2026年10月2日ResearchCodingAgents

Mid-Harness:命令执行前先审一遍,终端任务涨 18 个点

终端 agent 有个聊天模型没有的麻烦:动作做错了,世界就变了。装错一个包,后面每一步都在坏掉的环境里干活,哪怕模型换一次就能给出正确命令。论文《Mid-Harness》(arXiv 2609.39982,Hugging Face 96 赞)把算力恰好放在这个位置:先采样多个候选动作,验证一遍,再把其中一个交给 harness 执行。生成模型不动,harness 也不动,新加的一层夹在两者中间。

核心数字:在 TerminalBench-Lite 上,生成用 TMAX-9B、验证用 GPT-5.6 Sol,采样 8 个动作,Pass@1 从 50.00% 提到 68.03%。写命令的还是同一个模型,执行的还是同一个 harness,这 18 个点全部来自从小模型本来就能写出的选项里挑得更准。

关键发现在验证器。验证器弱的时候,多采样几乎没用:好选项明明就在那儿,就是认不出来。验证器强了,这些选项才被盘活。如果让同一个 9B 模型自己当验证器,两两比较是测试过的几种机制里效果最好的。把强验证器的判断蒸馏进小模型,还能再涨,而且完全不碰生成器。

成本结论最实用。把动作级扩展和轨迹级扩展结合起来,成功率更高,估算的 token 成本反而比单纯多跑几条完整轨迹更低。现在大家说 agent 的测试时计算,基本就是整局重跑、挑最好的那条。这篇论文说明,更便宜的单位是单个动作,在它造成破坏之前就审掉。

这跟最近几周的走向一致:提升来自 harness,而不是模型本身。它也恰好说明了决策模型该放在哪:每条不可逆命令前面,放一个快速的两两比较验证器。

链接:arxiv.org/abs/2609.39982
← 上一篇
False Frontiers:自我进化的 agent 学会的是附和自己,不是逼近真相
下一篇 →
MILO 自己进化 harness,Terminal-Bench 登顶还省了 26% token
← 返回所有文章

评论

加载中...
>_