2026年10月5日ResearchBenchmarkAgents

VeriHarness:所有 rollout 都一致的地方,恰恰最该查

这周一堆验证类论文里,最反直觉的一句来自 VeriHarness:rollout 之间的分歧常常暴露出正确答案,而一致反而可能把错误藏起来。多数投票的假设正好相反。作者包括 Caiqi Zhang、Rujun Han、Zifeng Wang、Nigel Collier、Tomas Pfister 等人。

设定是:基座模型固定,测试时没有参考答案也没有评分细则,手里只有一个长程任务的多条 rollout。VeriHarness 把生成器用的同一个模型改造成 agent 式的验证器,给它一个工作区、一套取证工具和可复用的验证 skill。干活的是两个角色。分歧裁决者拿环境里的证据去核对互相矛盾的说法。共识挑战者专门攻击所有 rollout 都同意的结论,并去找大家都漏掉的需求。

在五个长程工作区 benchmark、两个前沿模型上,它的选择得分都是参与对比的方法里最高的。再加上基于证据的修订,用 Gemini 3.5 Flash 比单条 rollout 提升 6.2 分,用 Claude Opus 4.8 提升 6.4 分。验证 skill 还能根据失败反馈自我改进。

值得收藏的理由有两个。一是提升全部来自固定模型外面那层 harness,又给「harness 比模型重要」这条线添了一个数据点。二是作者把五个 benchmark、两个模型上大约 2.6 万条 rollout 全部开放,据称生成成本超过 10 万美元。想做验证器的人,最贵的那部分有人替你付了。

链接:arxiv.org/abs/2610.00972
← 上一篇
特朗普成立「超级智能部队」:120 天,最大风险是「不是第一」
下一篇 →
PACE:别再审 agent 读进来的东西,在工具调用触发前一刻卡住它
← 返回所有文章

评论

加载中...
>_