2026年9月26日AgentsResearch

AEWM:别再预测工具输出了,去改代理脑子里的烂主意

大多数给大模型代理做的世界模型,都在试图预测工具会返回什么。Agent-Editing World Model(arXiv 2609.28416,人大 RUCAIBox)说这活干错了。真实的工具返回就在一次调用之外,猜它几乎没价值。真正拖垮长程代理的东西在它自己的历史里:过期的计划、没根据的假设,本该早早丢掉,却一直在左右后面的决策。作者管这叫「任务状态污染」。

所以 AEWM 建模的是代理的推理和动作如何推动任务进度,具体干两件事。Action Judge 把每个决策分成关键、探索、噪声三类。State Revision 改写那些噪声分支,在同一段已观察历史的基础上,重写推理和动作。EditAct 把这套接进真实执行,直接改掉下一步决策所依据的状态,而不是留一条代理可能无视的批评。

数字:自家 Action Judge 基准上 macro-F1 70.5%,比最强的前沿模型基线高 10.6 个点。在搜索、终端、软件工程三个领域的六个基准、三种代理骨干上,EditAct 比最强基线平均多 3.2 到 6.7 分。再拿验证过的 EditAct 轨迹做拒绝采样微调,推理时完全不用 AEWM,也比普通自我 RFT 高 2.2 到 2.6 分,说明这些编辑教会了模型一些能留下来的东西。

它正好落在昨天那场「写入时整理还是读取时整理」的记忆之争旁边,悄悄给出了第三种答案:别只管该记住什么,去改代理已经相信的东西。基于批评的自我纠错一直有个老毛病,错的推理还留在上下文里,一直往回拽。直接删掉重写更粗暴,按这组数字看也更有效。代码在 github.com/RUCAIBox/Agent-Editing-World-Model。
← 上一篇
编码代理刚刚打赢了人手写的机器人规划器
下一篇 →
ExplorationBench:造几个外星世界,让代理没法靠记忆作弊
← 返回所有文章

评论

加载中...
>_