2026年10月2日ResearchAgentsBenchmark

MILO 自己进化 harness,Terminal-Bench 登顶还省了 26% token

既然 harness 设计决定 agent 表现,下一步就很明显了:让 agent 来设计 harness。MILO(arXiv 2609.38349)就是这么干的,而且赢了所有拿来对比的人工 harness。MILO 全称 Meta-evolutionary Island Orchestration,它进化完整的 agent harness,同时还在进化自己搜索 harness 的策略。

靠三样东西。一是基于岛屿树的谱系记忆,把被淘汰的变异也存下来当反面证据,搜索记得什么路走不通。二是每个岛上一个变异 agent,结合全局搜索历史和父代的专属反馈,整套重写 harness。三是一个编排器,边跑边改搜索本身:嫁接谱系、分化新物种、重新分配变异器、修订课程。以前的方法要么只调一个组件,比如提示词或 skill,要么卡死在一种固定的搜索策略里。

用 Opus 4.8 的结果很难反驳。从同一个初始 harness 出发,MILO 在 Terminal-Bench 2.1 上提升 12.0%,PaperBench 提升 28.3%,DeepSWE 提升 10.3%;之前最好的搜索方法分别只有 4.5%、18.3% 和 0%。Terminal-Bench 2.1 拿到 86.1% ± 2.0%,超过官方榜首的 83.8% ± 2.3%,token 用量还比起始 harness 少 26%。更强,也更便宜。换成开源权重的 gpt-oss-120b 一样有效,总共胜过八个最先进的 harness 和六种搜索方法。

还有个奇怪的彩蛋:同一套机制拿去跑 EinsteinArena 的开放数学题,刷新了埃尔德什最小重叠问题和两个自相关不等式的已知最好上界。改进幅度很小,在小数点后第六七位,但都是新纪录。

把它和本周的 Mid-Harness、Meta-Skill 两篇放在一起看,规律很难忽视:研究者一次次在完全不碰模型权重的情况下拿到两位数的提升。harness 工程正在变成一个搜索问题,搜索者是另一个 agent。如果你的 agent 产品靠的是手调 harness,准备好被机器调出更好的版本吧。

链接:arxiv.org/abs/2609.38349
← 上一篇
Mid-Harness:命令执行前先审一遍,终端任务涨 18 个点
下一篇 →
研究发现:Jev 类决策模型会悄悄压扁你的打分量表
← 返回所有文章

评论

加载中...
>_