PoS:别再给 agent 加记忆了,给它一个信念状态
大多数长周期 agent 把上下文管理当存储问题:存历史,太长了就压缩,用的时候检索对的片段。今天 Hugging Face 榜上票数最高的 agent 论文 PoS(Progression of States,68 票)认为这个问题问错了。记得发生过什么,不等于知道自己现在在哪。
PoS 构建并持续更新一个显式的信念状态,作为 agent 的决策上下文。每个信念包含两样东西:agent 对当前世界状态的估计,以及还没解决的任务需求。说白了就是「我认为现在是这样」加上「我还需要搞清楚或做完什么」。框架会检查这个信念是否自洽,同时盯着进度,抓作者所说的信念陷阱:agent 一直在行动,却离目标一步都没靠近。一旦检测到陷阱,恢复策略会同时根据陷阱模式和未解决需求的类型来定制。
在覆盖执行类和诊断类任务的四个基准上,PoS 在每一个上都拿到总分第一,三个 LLM 底座全部如此。消融实验显示,一致性校验和恢复机制是主要功臣;上下文规模实验显示,上下文变长它也扛得住。
最有意思的是这个框架本身。信念陷阱是每个做 agent 的人都见过的场面:四十轮忙碌、自信、毫无用处的工具调用。记忆系统抓不到它,因为记忆里什么都不缺。维护一张「还有什么没解决」的清单,是让这种空转现形的便宜办法,今天就能塞进你自己的 harness。代码在 github.com/luoyu100/PoS。
链接:arxiv.org/abs/2610.01415
← 返回所有文章
PoS 构建并持续更新一个显式的信念状态,作为 agent 的决策上下文。每个信念包含两样东西:agent 对当前世界状态的估计,以及还没解决的任务需求。说白了就是「我认为现在是这样」加上「我还需要搞清楚或做完什么」。框架会检查这个信念是否自洽,同时盯着进度,抓作者所说的信念陷阱:agent 一直在行动,却离目标一步都没靠近。一旦检测到陷阱,恢复策略会同时根据陷阱模式和未解决需求的类型来定制。
在覆盖执行类和诊断类任务的四个基准上,PoS 在每一个上都拿到总分第一,三个 LLM 底座全部如此。消融实验显示,一致性校验和恢复机制是主要功臣;上下文规模实验显示,上下文变长它也扛得住。
最有意思的是这个框架本身。信念陷阱是每个做 agent 的人都见过的场面:四十轮忙碌、自信、毫无用处的工具调用。记忆系统抓不到它,因为记忆里什么都不缺。维护一张「还有什么没解决」的清单,是让这种空转现形的便宜办法,今天就能塞进你自己的 harness。代码在 github.com/luoyu100/PoS。
链接:arxiv.org/abs/2610.01415
评论