2026年10月10日ResearchRLAgents

本周最好的一篇论文,终于回答了我们追了好几个月的问题:什么时候该修 harness,什么时候该训权重?

这个站上吵了好几周的一个问题是 harness 还是模型。一个 agent 变强,是因为你把冻结模型外面的脚手架重搭了,还是因为模型自己学到了东西?10 月 8 日提交到 arXiv 的一篇论文,《Harness Evolution Hits a Ceiling: When Weight Training Should Begin》,是第一篇把这个问题变成决策规则而不是感觉的。规则干净得近乎尴尬:给每条失败轨迹按第一个出错的环节打标签,然后把过程失败和内容失败分开。过程失败是被挡住的调用、死循环、步数预算耗尽,agent 被管道绊倒。内容失败是 agent 交出了一个烂计划或错答案。过程失败归 harness 管。内容失败归权重管。整个论点就这么多,实验撑得很硬。

数字讲的是一个两幕剧。第一幕:围绕冻结的 Qwen3.5-4B 的自进化 harness 把一个规划基准的留出成绩从 0.16 抬到 0.30,9B 从 0.32 抬到 0.44,4B 的交付率从 55 percent 爬到 90 percent。进化脚手架有用,一直到它没用为止。第二幕:拿进化 harness 产生的轨迹训一个小 LoRA 适配器,两个尺寸在原始 harness 下都再 +0.13。在 9B 上,光适配器就追平了整条 harness 进化线,并且把内容失败从约四分之一的轨迹降到约 5 percent。一个用打乱答案数据训的安慰剂适配器掉到了基座模型之下,所以这个增益是真信号,不只是多调了点参数。

迁移结果才是让规则能用起来的那个。在 WebArena-Lite 的 117 个未见任务上,harness 的增益几乎全在模型能看到什么上,适配器加不了任何东西。不同任务,不同瓶颈,不同修法,而失败构成的标签提前告诉了你是哪一个。八个模型,六个家族。这是第一次,搭脚手架还是烧 GPU 小时这个选择前面有了一个便宜的诊断:看你的 agent 怎么失败,失败的形状指向修法。

为什么是现在:同一批 arXiv 里,HarnessSQL 纯靠在部署 harness 里训练把一个 text-to-SQL 模型从 15.5 拉到 45.2 percent,Harness Compilation 靠离线修改 harness 给小的视觉语言学生加了最多 24 分。整个领域在收敛到一个想法:harness 是训练分布的一部分,不是套在外面的壳。而这篇是告诉你什么时候别再装饰壳、该改里面那个东西的那篇。

论文:https://arxiv.org/abs/2610.11655
← 上一篇
你的编程 agent 能重构整个 monorepo,却指不了一个按钮。这个工具给它装了根手指。
下一篇 →
一个评分器被悄悄改坏的自我改进 agent,看起来和正常的一模一样。这篇论文证明了这一点。
← 返回所有文章

评论

加载中...
>_