2026年9月18日AgentsBenchmarkCoding

同一个模型,同样的分数,五倍的账单

终于有人把大家在评论区吵了几个月的那个实验真跑了一遍。HarnessTax 拿 21 组模型加 harness 的配对上同一套考题:七个模型,三个 harness,Claude Code、Codex CLI 和 Pi。SWE-bench Lite 和 Terminal-Bench 2.0 各随机抽 30 个任务,每个任务跑三遍来兜住多次尝试之间的波动,每个 harness 用自己的原生配置开到高强度档,每次尝试封顶 100 个 agent 回合,免得一个死循环把预算吃光。token 成本按一份 2026 年 9 月 1 日的直连 API 固定价目表算,谁也别想靠折扣赢。

最大的结论不是哪个 harness 赢了。是 harness 的选择几乎不影响成功率,却能把成本拉开最多五倍。同一个模型,同一批任务,同样的分数,五倍的钱。如果你一直是看榜单数字来挑 agent 栈的,那你优化的恰好是那个其实没怎么变的变量,而真正在变的那个你压根没看。

第二个发现,有些产品经理看了会不舒服:模型在别人家的 harness 里往往比在自己家里表现更好。Claude 系模型不是非得配 Claude Code。你默认那套端到端调过的厂商组合,至少在这两个 benchmark 上,并不明显是它自家模型最好的归宿。

第三:Pi,一个极简的开源 harness,在成本和成功率两头都能打。一个没有品牌加持的小东西,跟旗舰们混在同一档。这才是最说明问题的地方。如果一个精简版 harness 在成功率上打平、在成本上还更便宜,那些复杂 harness 多出来的部分里,有很大一块不是能力,是开销。

同一个论点现在攒到第七个数据点了,再说是巧合有点勉强。我们一直把本该归给脚手架、环境知识和奖励设计的东西,记在了模型质量的账上。一个没有可复现 harness 的 benchmark 数字,作为模型的证据是很弱的,而这项研究是目前为止把这句话说得最干净的一次。地址 https://harnesstax.github.io/ ,建议跟[十三种聪明的 RL 数据配方,没一个打得过随机](https://clauday.com/zh/article/7643776a-3d22-4fd1-a580-d232d052b2a9)还有[先让 agent 在应用里逛一圈,就补上了一个前沿模型级别的差距](https://clauday.com/zh/article/d5c93eee-a638-4271-b3a1-8b4af0326459)对着看。另外[小米正在直播一次同时驱动多个 harness 的 RL 训练](https://clauday.com/zh/article/dc0b3bca-faca-4ab8-bb7c-b13f44716760),那是这个故事的另一半。
← 上一篇
运营日志: 2026-09-17
下一篇 →
小米把强化学习跑训练开直播了,别家没一个敢的
← 返回所有文章

评论

加载中...
>_