验证器干了几乎全部的活,成本不到一分钱
这周 arXiv 上有篇论文,悄悄把每个做 agent 脚手架的人本来该先做的那个实验做了。标题是《How Do Agent Harnesses Create Value? Planning Information and Release Control in Stateful LLM Agents》,作者 Yukun Zhang、Kemu Xu、Yishen Chen,编号 2609.20474,链接 https://arxiv.org/abs/2609.20474 。
值得抄走的是实验设计。为了搞清楚规划文本起作用到底是因为里面有规划,还是单纯因为字更多,他们拿任务专属的规划去对比字数相同、但顺序被打乱的策略文本,在零售和航空两个场景里跑。这个对照组在绝大多数 harness 论文里是缺席的。加上它之后,固定规划值大约 7.17 个百分点的可验证成功率,而且集中在更难的任务上。真实,有用,但没多夸张。
然后他们把验证环节单独量了一遍,数字直接把优先级重排了。验证步骤拒掉了 61% 的无效 episode,同时误拦了 17% 的有效 episode,每个 episode 的成本不到一分钱。他们自己的结论值得念给团队听:一个独立的验证器,用整套规划加验证方案的零头成本,拿到了几乎全部的防误通过收益。
这笔账划不划算,完全取决于一个错误答案对你值多少钱,论文自己也是这么说的。扔掉 17% 的好活儿,在聊天产品里不可接受,在会计结账场景里是很便宜的保险。错误成本决定 harness 形态,这个框架比任何一条具体的架构建议都好用。
诚实的读法对不少工具路线图来说不太舒服:今年 agent 框架的力气大都花在规划、拆解和编排上,而整个栈里最便宜的那个部件,干掉了大部分可度量的活。
← 返回所有文章
值得抄走的是实验设计。为了搞清楚规划文本起作用到底是因为里面有规划,还是单纯因为字更多,他们拿任务专属的规划去对比字数相同、但顺序被打乱的策略文本,在零售和航空两个场景里跑。这个对照组在绝大多数 harness 论文里是缺席的。加上它之后,固定规划值大约 7.17 个百分点的可验证成功率,而且集中在更难的任务上。真实,有用,但没多夸张。
然后他们把验证环节单独量了一遍,数字直接把优先级重排了。验证步骤拒掉了 61% 的无效 episode,同时误拦了 17% 的有效 episode,每个 episode 的成本不到一分钱。他们自己的结论值得念给团队听:一个独立的验证器,用整套规划加验证方案的零头成本,拿到了几乎全部的防误通过收益。
这笔账划不划算,完全取决于一个错误答案对你值多少钱,论文自己也是这么说的。扔掉 17% 的好活儿,在聊天产品里不可接受,在会计结账场景里是很便宜的保险。错误成本决定 harness 形态,这个框架比任何一条具体的架构建议都好用。
诚实的读法对不少工具路线图来说不太舒服:今年 agent 框架的力气大都花在规划、拆解和编排上,而整个栈里最便宜的那个部件,干掉了大部分可度量的活。
评论