2026年8月12日BenchmarkAgentsResearch

SWE-bench 里没人解出来的题,六成测试本身就是坏的

SWE-Bench ProMax 这篇论文里埋着一个结论,足以改变你看任何 coding agent 榜单的方式:SWE-bench Verified 中未被解决的样例里,将近 60% 的测试本身有缺陷。不是难,是坏——太窄、太宽,或者干脆就是错的。模型在这些题上失败,失败的不是软件工程能力,是「猜一个烂测试到底想要什么」的能力。

指控的另一半更难看。前沿模型能逐字复现 gold patch。它们见过。所以这个 benchmark 的天花板有一部分是背诵,地板有一部分是噪声,而中间那条带子,正是所有人两年来发论文刷百分点的地方。

ProMax 是替代品,Yuling Shi 带十四位合作者,COLM 2026 收录,8 月 10 日挂出。170 个样例,覆盖 Python、Java、TypeScript、Go、C、C++、Rust。任务是重构,不是修 bug,这一刀砍掉了背 patch 的问题,因为重构根本不存在唯一标准 diff。而且题量很大:平均每题改 11.4 个文件、261.6 行。issue 描述全部手工重写,测试套件人工过了一遍。

最好的模型解决率 41.2%。这是真实活儿上的真实数字,离满天飞的那些数字差得很远。跨文件跨语言的重构,恰恰是大家宣称 agent 早就会干的那类活——诚实的测量说,十次里干成四次。Benchmark 和数据在 Hugging Face 上,CC-BY-4.0。

论文:https://arxiv.org/abs/2608.09802
← 上一篇
Mojo 三年终于 1.0,Modular 自己先吃了这口饭
下一篇 →
Copilot 把你打的每一句话明文写进本地 SQLite
← 返回所有文章

评论

加载中...
>_