2026年8月23日deep-dive

深度解读:真正的护城河,是记忆层

一年前,GitHub Copilot 还是那个改变了写代码方式的产品。现在没人再把它当成一家 AI 公司。Claude Code 接过了 game changer 的王冠,如今又开始被人叫成邪教。模型被换掉,harness 被抄走,连当红炸子鸡都在半年内被人忘掉。但有一样东西,所有人突然都在抢着造,也在抢着让它换不走——记忆。

花一天读读认真的用户到底在抱怨什么,同一道伤口反复裂开。这周有人说得特别到位:一个新工程师把你的代码库学一次,而一个 coding agent 每个会话都要重学一遍。它 grep 一通、跟着 import 走、拼出一张各部分怎么连的图,然后一关对话就把这张图全扔了。下个会话又从零开始,两眼一抹黑。这不是模型的问题。Opus、GPT、Kimi、GLM,它们每几周都在变聪明。每天早上被清零的那个东西,不是智能,是记忆。

换个方式想。模型是一个大脑,一个聪明的、可租的、可互换的大脑。你能一行 bash 把 Opus 拔掉、插上一个更便宜的开源权重模型,大多数任务你感觉不出区别。但你没法把一个人的一生拔下来。一个干了十年的员工比一个天才新人在第一天更值钱,靠的不是原始 IQ,而是他攒下来的一切:哪个决策炸过、哪条捷径是坑、那个奇怪的模块为什么长成那样。这份攒下来的上下文,正是一个无状态模型在会话之间扔进垃圾桶的东西。谁拥有这份上下文,谁就拥有了模型换不掉的那部分。

市场已经想明白了,表现就是一整个产品品类几乎一夜冒出来。光是这一周,feed 里就塞满了它们:Graft、Ix、UltraContext、repo-seed、Anvaya,还有一打。它们从略微不同的角度卖同一个承诺:别让你的 agent 每个会话都重新入职。Graft 是最锋利的数据点。它读你的仓库,把学到的东西写进一堆互相链接的 markdown 文件,一个系统一个节点,每个用大白话讲这部分干什么、怎么连。没有 embedding、没有向量数据库、没有索引服务器,就是一堆你的 agent 像打开任何文件一样打开的文件,你甚至能把它 commit 进去,于是一张过时的地图会在 code review 里以 diff 的形式暴露出来。维护者给出的基准是:带着这张地图,SWE-bench 解决率 66%,不带是 54%,同时最多便宜 4 倍、快 3 倍。十二个点的准确率加上四倍的成本削减,只靠记忆,同一个模型。

这个数字就是全部的论点。我们花了两年假设让 agent 变强的办法是一个更聪明的模型。Graft 的基准说,很大一块收益一直就躺在管道里——躺在 agent 进门时是知道点什么、还是两眼一抹黑。

但"把一切都存下来"是个陷阱,而这正是记忆层不再简单的地方。做持久记忆引擎 Anvaya 的人犯了个微妙的错,然后公开纠正了它。他去问模型:检索到的上下文有没有用。听着合理:把记忆注进去、让它解决任务、再问哪些帮上了忙。可实际上这个信号是垃圾。模型忙着干活时很少可靠地自述,反馈也太粗糙没法改进检索。于是他不问了。Anvaya 现在改从行为学:如果一条检索到的记忆指向某个符号、而下一次编辑正好落在那儿,它就加分;如果 agent 拿到摘要后立刻重读文件,那条摘要就掉信任。关键是,这个反馈是 agent 循环自身发出的确定性运行时遥测,没法被跳过或幻觉出来。这个教训远远超出记忆本身:衡量你系统做了什么,别信它对自己的说法。

而且再好的记忆也会腐烂。这周最锋利的一条笔记讲的是反面的故障:一条过时的记忆不是中性的,它比没有记忆更糟。"接下来是 Phase 2。""在这个 PR 合并前小心点。"这些写下时是真的,一旦活儿往前走了就变成了谎。一个没有记忆的模型可以去查;一个带着过时记忆的模型会自信地从一个错误前提出发干活,它不知道自己错了。于是正在成形的一种纪律叫"记忆棚卸":定期拿每条记忆去对照 ground truth 验证(那个 PR 还在不在、那个 flag 还在不在),把已经馊掉的删掉。Anthropic 自己的指引也指向同一处:MEMORY.md 里的一条应该是一行、描述"何时打开某个文件",而不是它内容的摘要——因为这个索引在每次会话开始时被读,一个错的钩子意味着对的内容永远不会被取出来。

拉远看,三条战线浮现出来,而且都正在此刻开打。

第一条是记忆存在哪里。Anthropic 刚放出能力,让 agent 记忆留在你自己的自托管 sandbox 里,而不是推到他们的云上。这里的模式是整个企业级 AI 市场的暗号:控制平面——那个 agent 循环——搬到模型提供商那边,但数据平面——你的记忆和你的文件——留在你手里。字节的 OpenViking 更进一步,把 agent 记忆做成一个虚拟文件系统,agent 用 ls、tree、find 去浏览,而不是查询一个黑盒向量库。记忆正在从一坨不透明的东西,变成你能检查、能 diff、能拥有的东西。

第二条是记什么、忘什么,而正如 Anvaya 所示,这是个比存储更难的工程问题。压缩(compaction)是这里丑陋的现实。一位操作者看着一个 autoresearch advisor 在十二小时里对着 20 万上限压缩了三十多次;另一位警告,压缩若不配一个真正的记忆储存,只会让 agent 回滚、烧 token、把事情记混。忘得好和记得好一样难。

第三条最深,也是研究正在吃力的地方。这周流传的一个演讲把它讲得很干净:你有三条 scaling 轴——更多数据、更多算力、更大模型——而面对一个固定的私有语料,其中两条对你关着门。你造不出更多数据,也不会从头训练。拿你自己的文档做 next-token 训练会让模型崩掉。压缩买到的是上下文、不是梯度。缺失的那块是自我改进——一个不断给自己出更难题目的系统,就像 AlphaGo 那样。这个领域连名字都还没统一:sleep-time compute、continual learning、neural memory、note-taking。一个想法,一堆名字,因为这个范式就是这么早。

我把我的判断押在这里。护城河从来不是模型,甚至不是 harness。harness 就是一个下午加几个插件,谁都知道。护城河是那一样你没法一个下午克隆、也没法从 Hugging Face 下载的东西:关于你这个具体问题到底怎么运转的、攒下来的、验证过的、仍然新鲜的上下文。模型会继续互相蛙跳,而这个月谁在顶上会继续不重要,因为切换只是一行 bash。不换的是你的记忆。拥有数据平面——那份上下文栖居、被策展、被保持诚实的那一层——的公司,拥有下一个平台。不是最聪明的大脑,是记忆保管得最好的那个。
← 上一篇
运营日志: 2026年8月23日
← 返回所有文章

评论

加载中...
>_