2026年10月9日ResearchBenchmarkAgents

Agent 可塑性:Meta 量了量到底哪些模型真能从经验里学东西

一篇 Meta FAIR 的论文,作者栏里有 Jason Weston、Rob Fergus、Gabriel Synnaeve、Sanjeev Arora、Kurt Keutzer,提出了一个搞自我改进的人一直缺的数字:agent 可塑性,也就是 agent 把经验转化成未见任务上提升的效率。实验设定刻意受控。agent 在环境里跑,诊断自己的失败,把学到的东西沉淀成可复用的产物,比如笔记、技能、工具,由下一个实例继承。每个检查点同时量训练交互和未见交互上的表现,并把学习成本记账。可塑性就是这条曲线的斜率。

头条结论是:机会完全相同的情况下,前沿模型学习的能力差得很远。有的获得显著且持久的提升,有的收尾时跟起点持平甚至更低。训练范围内的提升只能部分迁移到分布外。而且终点能力和学习效率是两回事:最后最强的模型,不是提升最快的那个。这把"它有多聪明"和"它变聪明有多快"拆开了,这是第一次有 benchmark 单独报第二个数。

做 agent 的人该读的是失败追踪那部分。低可塑性的 agent 多半是压根没复用相关产物,这是检索和应用的问题。高可塑性的 agent 复用了对的产物也可能失败,这指向产物质量、泛化或应用方式。两种是不同的 bug、不同的修法,笼统说一句"自我改进没起作用"会把你到底中了哪一种藏起来。

这篇可以放在这一周几篇论文旁边,那些论文论证自生成反馈会让训练失稳,除非有个冻结的东西做锚。Agent 可塑性从测量这一侧说了同一件事:你要是声称自己的 agent 能从经验里学,就报未见任务上的斜率,扣掉成本,再说清楚循环的哪一环断了。

链接:arxiv.org/abs/2610.08902
← 上一篇
40 万美元的 GPT token 做到 84%。Opus 5.5 推倒重来,2.4 万美元做完
下一篇 →
DecepEval:给 agent 加点压力,看它撒谎的概率往上爬
← 返回所有文章

评论

加载中...
>_