三个各自不怎么样的记忆补丁,叠起来就管用了
拿一个语言模型,一个接一个教它 100 个任务,中途不给它看之前的样本,然后问它还记得多少。朴素的顺序微调保留 1.2%。这是持续学习诚实的基线,也是没人敢把它上线的原因。约翰霍普金斯的一个团队——Alvin Zhang、Daniel Khashabi、Tianmin Shu——把这个数做到了 34.9%,靠的是把几个单看都挺平庸的机制叠起来。论文在 https://huggingface.co/papers/2609.06986 ,287 赞,当日榜首。
真正好用的是它的框架。他们把这个领域按两个轴拆开:anchor,也就是你要保住什么;低秩分配,也就是更新落在哪。三种 anchor——数据用生成式回放,函数用自蒸馏,权重用基于重要性的正则——跟共享 LoRA 还是合并 LoRA 交叉。然后对所有组合做全因子实验,用任务级的逐次减半把搜索成本压下来。三种 anchor 全上加合并 LoRA,就是那个 34.9%,比什么都不做聪明点强 28 倍。
值得停一下的词是超可加。回放和合并 LoRA 单拎出来贡献最大,但组合起来的效果超过你把各部分相加所能预测的,而且在他们试的三个数据集上都是如此:Symbol-QA、LLM-QA、Real-QA。持续学习的文献里全是论证自家那一个机制才是对的那个的论文。这篇说,争这个本身就是错的。
对做 agent 记忆的人来说这是直接承重的,因为那个 100 任务的设定基本就是一个长命 agent 要经历的东西。作者老实写出来的那条注意事项才是要紧的:记忆保留大幅改善,通用能力保住没有。你现在能让一个 agent 记住它干过的一百件活。它是不是还擅长别的,是另一个问题,没人解决。
← 返回所有文章
真正好用的是它的框架。他们把这个领域按两个轴拆开:anchor,也就是你要保住什么;低秩分配,也就是更新落在哪。三种 anchor——数据用生成式回放,函数用自蒸馏,权重用基于重要性的正则——跟共享 LoRA 还是合并 LoRA 交叉。然后对所有组合做全因子实验,用任务级的逐次减半把搜索成本压下来。三种 anchor 全上加合并 LoRA,就是那个 34.9%,比什么都不做聪明点强 28 倍。
值得停一下的词是超可加。回放和合并 LoRA 单拎出来贡献最大,但组合起来的效果超过你把各部分相加所能预测的,而且在他们试的三个数据集上都是如此:Symbol-QA、LLM-QA、Real-QA。持续学习的文献里全是论证自家那一个机制才是对的那个的论文。这篇说,争这个本身就是错的。
对做 agent 记忆的人来说这是直接承重的,因为那个 100 任务的设定基本就是一个长命 agent 要经历的东西。作者老实写出来的那条注意事项才是要紧的:记忆保留大幅改善,通用能力保住没有。你现在能让一个 agent 记住它干过的一百件活。它是不是还擅长别的,是另一个问题,没人解决。
评论