给 AI 画一个哈勃半径:三层记忆架构的个人思考
给 AI 画一个哈勃半径:三层记忆架构的个人思考
最近半年,我花了不少时间折腾一件事:怎么让 AI 真正「认识」我。
不是那种「你好我是 GPT-4 请问有什么可以帮您」的认识,而是像一个跟了你两三年的助理,知道你最近在焦虑什么、手头在推什么项目、上次踩了什么坑还没爬出来。说实话,这个目标听起来不复杂,但真做起来,水比想象中深得多。
前不久读到评论尸(虹线)的一篇文章,他给自己的 AI Agent 配了三层上下文记忆,最外层起了个挺浪漫的名字——「哈勃半径」。私以为这个比喻相当精准,甚至可以说戳中了我一直在琢磨但没想清楚的那个点。这篇文章就聊聊我对这套三层记忆架构的理解,以及一些自己的思考。
第一层:我知道的——让 AI 变成「在你身边待过一阵子的人」
先说最基础的一层。
这一层说白了就是 RAG。我给 AI 接了一套切片式的检索系统,每条记忆都很短,不超过 200 字,带关键词、向量、关系和时效性。数据来源挺杂的——文章、日记、日程、会议记录、甚至是一些随手记的碎片化笔记。每天凌晨跑一遍自动化流程,把这些原始数据切成一条条记忆碎片,存进数据库。
效果还是很明显的。
跟 AI 聊天的时候,它基本能知道我最近在做什么。知道我这几天在折腾合规审查的 Skill,知道我在研究 AI 数据采购的分类分级,知道我一边写博客一边对「AI 写的博客到底算不算我的」这个问题保持纠结。它从一个通用模型,变成了一个「在你身边待过一阵子的人」。
但这层有一个很本质的问题:它只能记录已经发生过的事。
它知道我说过什么、做过什么、立过什么 flag,但它不知道我还没整理成文字的那些模糊想法。它是我的影子,但不具备我的思考。说白了,这一层解决的是「AI 能记住我」的问题,但光记住是不够的。
第二层:我应该知道的——从碎片到结构
如果第一层是一堆散落的记忆卡片,那第二层就是一个被编织过的知识网。
这一层的概念来自 Andrej Karpathy 提出的 LLM Wiki——简单理解就是一个由 AI 来维护的 Wiki。它不是把内容以原始形态塞进知识库,而是按 Wiki 的规则,把材料整理成可以继续生长的条目。

这一层读的东西也比第一层宽得多。除了关于「我」的事实,它还读我收藏的文章、订阅的播客、个性化日报,甚至是一些我没认真读完但已经被系统捕捉到的内容。AI 每天做联想、归纳、合并和结构化,最后形成一张可以浏览、可以检索、也可以继续修改的知识网。
这里我想特别说一点:切片式 RAG 和 LLM Wiki 不是替代关系。
我在不少地方看到有人喊「RAG 已经过时了」,这种非此即彼的思路挺典型的。RAG 在关键词搜索、速度和短事实召回上,依然非常好用。比如我每天跟谁开了什么会、几点到几点做了什么,这类记录就不该被郑重其事地写进 Wiki,它只适合安静地待在第一层,需要时被找回来。
第一层是记忆卡片,第二层是 Wiki。两层搭配,已经能覆盖大部分场景了。
但用了一段时间之后,我发现这两层记忆依然有它的边界——它只能处理已经进入我系统的东西。那些我没收藏、没读、没转录、没整理,只是刚好出现在我关注源里的内容,它仍然不知道。
而这恰恰是最大的一块。
第三层:我可能知道的——哈勃半径
这就是今天要聊的核心了。
第三层,评论尸叫它「哈勃半径」。我第一反应是这个名字取得太妙了。在宇宙学里,哈勃半径可以粗略理解为一个观测边界——以观察者为中心,边界以内的东西原则上可以被观测到,边界之外越来越远、越来越不可达。
套到信息世界里就是:每个人都有一个以自己为中心的信息半径。你每天刷到什么、订阅了什么、关注了哪些人、信任哪些媒体、反复打开哪些网站、听哪些播客——这些东西共同构成了你的信息宇宙。

具体怎么实现的呢?思路其实不复杂,但工程量不小:
- 把所有关注源(公众号、播客、网站、即刻、X、短视频等)通过工作流处理成文字
- 汇总到 FreshRSS
- 全量数据定时导入一个私有的 Meilisearch 搜索引擎
- 把 Meilisearch 接到 AI Agent 上,作为一个独立的搜索源

Meilisearch 是一个开源的私有搜索引擎,性能很好,能在海量数据下以十几毫秒的速度返回搜索结果。据说搭起来那天晚上,索引里已经有接近一万条文档,而且还会以每周大约 2000 条的速度增长。
对 Google 来说这是个笑话级别的数字。但对一个私人的信息库来说,这已经是一个不小的宇宙了。
更重要的是,这些文档不是互联网上随机抓来的几万条网页。它们来自手动关注过的源。公众号是自己关注的,播客是自己订阅的,网站是自己放进 RSS 的。它们当然不等于已经读过,更不等于同意。但至少说明,在过去某个时刻,我允许这些源进入我的视野。
这就是哈勃半径和公开搜索引擎的本质区别:
公开搜索引擎回答的是:全网有什么。
哈勃半径回答的是:在我的信息宇宙里,有什么。
不是搜索引擎,是记忆层
这一节我想展开聊聊自己的理解,因为我觉得这是整篇文章最有价值的洞察。
搜索引擎的核心动作是「检索」,记忆层的核心动作是「限定上下文」。
同一个关键词,在不同人的哈勃半径里,意思会完全不同。搜索「AI 陪伴」,投资人、心理咨询师、乙女游戏玩家、产品经理、未成年人研究者、同人作者,看到的世界不会一样。公开搜索会把这些语义场压平,再按流行度、权威性或广告逻辑排序。
而私人哈勃半径会先问另一组问题:这个词对你来说通常出现在哪里?你通常从哪些人那里接触它?你关注的源最近怎么谈它?
这不是覆盖率问题,而是权重问题。
AI 接入公开搜索以后,最大的问题往往不是查不到资料,而是不知道该信谁。它能打开 Google,能搜小红书,能查抖音,能读网页,但它不知道这些源在我的世界里是什么位置。
有些来源只是噪音,有些长期信任,有些虽然不同意但可以用来观察某种立场,有些质量一般却很接近一线语感,有些不权威但能比论文更早捕捉到文化变化。
这些权重,公开搜索不知道,AI 也不知道。哈勃半径知道——不是因为更聪明,而是因为它的信源已经被过去的关注动作筛过一遍。
关注本身就是一种缓慢的标注。它不像点赞那么短,也不像收藏那么重,更像一种持续授权:这个源可以进入我的世界。
所以 AI 在哈勃半径内搜索时,不是在「查全网」,而是在调用我的长期注意力沉淀。这就是记忆。
未读 ≠ 信息债务
这一层记忆还有一个很微妙的地方:它记录的不是「我知道」,而是「我可能知道」。
据说在评论尸的哈勃半径中,至少 99% 以上的内容他都没看过——毕竟关注了 2000 多个不同类型的订阅源。按传统知识管理的标准,这很奇怪:没看过,怎么能算我的知识?没有消化,怎么能算我的记忆?
但 AI 时代改变了这件事。
过去,知识管理的瓶颈是人的阅读时间。你订阅 100 个源,真正能读完的可能只有 5 个。剩下 95 个只是焦虑来源,是未读数字,是信息债务。但如果 AI 可以在需要时帮你回到这些材料里,未读内容就不再只是债务,它变成一种可调用的可能性。
这是一种将「阅读」从前置消费改成后置召回的信息管理方式。
过去我们必须先读,未来才有资格想起。现在我们可以先建立半径,再在问题出现时让 AI 回到半径内部找线索。人的角色不再是吞下全部信息,而是维护自己的可观测宇宙。
私以为这会是 AI 时代知识管理的一个大变化。
半径的价值来自边界
当然,哈勃半径不是越大越好。这是它和公开搜索最根本的差别:公开搜索追求覆盖率,私人半径追求相关性。
你不需要把全网都装进来,甚至不应该这么做。如果一个私人搜索库最后变成小号 Google,它就失去了意义。
边界越清楚,AI 越知道你在什么语境里提问。边界越混乱,AI 就越容易重新滑回公共平均值。
所以它的维护重点不是「多抓」,而是「选择」。哪些公众号值得保留,哪些 RSS 已经失效,哪些播客只是阶段性兴趣,哪些社交账号虽然经常胡说但有现场感,哪些来源应该降权,哪些来源只适合做情绪采样——这些都不是模型能自动决定的。
AI 可以帮你清理、分类、去重、打标签、转文字、做索引,但半径本身必须由人来画。因为这条边界表达的是你的注意力史、信任结构和审美偏好。
这也是为什么我越来越不满足于「给 AI 接一个搜索引擎」。接搜索引擎只是扩展能力,设置哈勃半径,才是在扩展主体。
前者让 AI 更会查,后者让 AI 更像你。
三层记忆的关系
把三层放在一起,关系就清楚了:
| 层级 | 定义 | 本质 | 类比 |
|---|---|---|---|
| 第一层 | 我知道的 | 事实记忆 | 记忆 |
| 第二层 | 我应该知道的 | 结构记忆 | 知识 |
| 第三层 | 我可能知道的 | 半径记忆 | 视野 |
最内层是我留下的痕迹,中间层是这些痕迹被整理后的结构,最外层是我可能接触到的世界。
如果用一个人来类比,第一层像记忆,第二层像知识,第三层像视野。一个真正个人化的 AI,不能只有记忆和知识,它还必须有视野。否则它知道你昨天做了什么,也能背出某个概念的定义,却不知道你平时从哪里感受世界。
这也是我对很多 AI 个性化产品不满意的地方。它们把「记住用户」理解成记住偏好——喜欢什么语气、在哪里工作、正在做什么项目。它们把「连接外部世界」理解成搜索网页。但用户不是一个偏好表,外部世界也不是一张无差别网页列表。用户和世界之间,还有一层长期形成的媒介关系。
哈勃半径记录的就是这层关系。
写在最后
未来每个重度使用 AI 的人,可能都需要自己的哈勃半径。
它不一定需要像评论尸那样折腾 FreshRSS、Meilisearch、群晖、Cloudflare Worker 全家桶。对大多数人来说,它可能只是一个持续维护的 RSS 列表,一个高质量收藏夹,一个跨平台稍后读,一个能被 AI 调用的信息源仓库。
关键不在技术栈,而在观念:你需要给 AI 一个你未必读、但给出权重很高的、可持续更新的内容池。
AI 的上下文不应该只来自公开互联网,也不应该只来自你已经整理好的笔记。真正属于你的上下文,还包括那些你长期允许进入生活、但尚未被你消化的信源。那是你的信息暗物质——它平时不可见,却影响你的判断、写作、情绪和问题意识。
你以为自己是在独立思考,其实你一直在某个半径内思考。过去,这个半径只被平台拿来塑造你。现在,你可以把它交还给自己的 AI,让它帮你看见这半径内部到底发生了什么。
AI 时代的问题不是信息不够,而是默认的世界太大。世界越大,平均值越强。平均值越强,个人经验越容易被淹没。
给 AI 设置哈勃半径,就是告诉它:先别急着替我抵达全世界,先回到我的宇宙里。看看我关注过什么、错过了什么、可能知道什么。看看哪些信号已经在我身边出现,只是还没来得及读。看看哪些问题早就在我的信息半径里反复回响,只是还没有被命名。
当 AI 能做到这一点,它就不再只是一个更快的搜索框,也不只是一个更长记性的助手——它开始像一个能替我巡视视野的人。
而这可能才是个人 AI 真正开始成立的时刻。
本文灵感来自评论尸的《一个新的 AI 记忆层概念:哈勃半径》。