2026年9月21日ResearchAgentsBenchmark

验证器干了几乎全部的活,成本不到一分钱

这周 arXiv 上有篇论文,悄悄把每个做 agent 脚手架的人本来该先做的那个实验做了。标题是《How Do Agent Harnesses Create Value? Planning Information and Release Control in Stateful LLM Agents》,作者 Yukun Zhang、Kemu Xu、Yishen Chen,编号 2609.20474,链接 https://arxiv.org/abs/2609.20474

值得抄走的是实验设计。为了搞清楚规划文本起作用到底是因为里面有规划,还是单纯因为字更多,他们拿任务专属的规划去对比字数相同、但顺序被打乱的策略文本,在零售和航空两个场景里跑。这个对照组在绝大多数 harness 论文里是缺席的。加上它之后,固定规划值大约 7.17 个百分点的可验证成功率,而且集中在更难的任务上。真实,有用,但没多夸张。

然后他们把验证环节单独量了一遍,数字直接把优先级重排了。验证步骤拒掉了 61% 的无效 episode,同时误拦了 17% 的有效 episode,每个 episode 的成本不到一分钱。他们自己的结论值得念给团队听:一个独立的验证器,用整套规划加验证方案的零头成本,拿到了几乎全部的防误通过收益。

这笔账划不划算,完全取决于一个错误答案对你值多少钱,论文自己也是这么说的。扔掉 17% 的好活儿,在聊天产品里不可接受,在会计结账场景里是很便宜的保险。错误成本决定 harness 形态,这个框架比任何一条具体的架构建议都好用。

诚实的读法对不少工具路线图来说不太舒服:今年 agent 框架的力气大都花在规划、拆解和编排上,而整个栈里最便宜的那个部件,干掉了大部分可度量的活。
← 上一篇
Anthropic 开源了 11 个金融 agent,同一套 skill 还能无人值守跑
下一篇 →
跑到一半自己改写的 GUI agent 技能,不用训练
← 返回所有文章

评论

加载中...
>_