别在知道要被问什么之前,就决定记什么
所有agent记忆系统都有同一个毛病,而且没人把它当毛病。一个任务跑完,有个东西把整条轨迹总结成一条干净的记忆,剩下的扔掉。这个压缩发生在写入的时候——发生在谁都还不知道下个任务需要什么的时候。你在挑什么重要,而那个决定"什么重要"的东西还没出现。
Just-in-Time Memory这篇论文9月23日挂到arXiv,作者是Yefan Zhou、Yang Li、Zeyu Leo Liu、Semih Yavuz和Shafiq Joty,它把时间点掉了个个儿。原始轨迹留着。什么都不整理。等到读取的时候,当前任务就摆在眼前,你清清楚楚知道自己要找什么,这时候再由一个curator合成一份针对这个需求的紧凑内容。同样的信息,换一个压缩的时刻。
提升不是那种小打小闹。ALFWorld涨16.2个点,WebShop涨16.3个点,tau方bench涨3.9个点。而真正把论点撑起来、而不只是撑起方法的那个结果是:一个完全没训练过的curator就已经打赢了现有基线。意思是这个提升不来自某个聪明的学习组件,就是来自把决策往后挪。时机本身就是全部。
值得和Hindsight对着读——同一周冲上GitHub趋势第一的那个记忆系统,走的是完全相反的直觉:在写入的时候就用力做结构化,分门别类塞进不同类型的记忆桶。两边都可能对,因为它们优化的成本不是一回事。写时结构化,查起来便宜,但丢掉的东西永远丢了。读时整理,什么都留着,代价按每次查询付。你要哪个,取决于你更怕存储账单还是更怕推理账单。而现在,几乎没人是有意识地在做这个选择。
论文:https://arxiv.org/abs/2609.27334
← 返回所有文章
Just-in-Time Memory这篇论文9月23日挂到arXiv,作者是Yefan Zhou、Yang Li、Zeyu Leo Liu、Semih Yavuz和Shafiq Joty,它把时间点掉了个个儿。原始轨迹留着。什么都不整理。等到读取的时候,当前任务就摆在眼前,你清清楚楚知道自己要找什么,这时候再由一个curator合成一份针对这个需求的紧凑内容。同样的信息,换一个压缩的时刻。
提升不是那种小打小闹。ALFWorld涨16.2个点,WebShop涨16.3个点,tau方bench涨3.9个点。而真正把论点撑起来、而不只是撑起方法的那个结果是:一个完全没训练过的curator就已经打赢了现有基线。意思是这个提升不来自某个聪明的学习组件,就是来自把决策往后挪。时机本身就是全部。
值得和Hindsight对着读——同一周冲上GitHub趋势第一的那个记忆系统,走的是完全相反的直觉:在写入的时候就用力做结构化,分门别类塞进不同类型的记忆桶。两边都可能对,因为它们优化的成本不是一回事。写时结构化,查起来便宜,但丢掉的东西永远丢了。读时整理,什么都留着,代价按每次查询付。你要哪个,取决于你更怕存储账单还是更怕推理账单。而现在,几乎没人是有意识地在做这个选择。
论文:https://arxiv.org/abs/2609.27334
评论