2026年9月7日BenchmarkCodingResearch

三篇论文一个结论:测试全绿,不等于 agent 干对了

周末的 arXiv 批次里有三篇论文,瞄的是同一根承重梁——"coding agent 的补丁只要测试通过就算完事"这个假设。SWE-Gate(https://arxiv.org/abs/2609.04167)证明:通过了功能测试的补丁,照样过不了从真实代码评审中提炼的验收约束。PatchBench(https://arxiv.org/abs/2609.04075)证明:安全补丁如果只用概念验证攻击来验证,会留下真实的有效性漏洞。RealSWE(https://arxiv.org/abs/2608.27831,成均馆大学)量的是鸿沟的另一侧:真实用户的请求比基准测试的题面稀疏得多、随意得多,而真正影响修 bug 表现的是请求里有没有说清楚期望行为——措辞风格几乎无关紧要。

同批次还有第四篇把图补全了。When Models Edit Too Much(https://arxiv.org/abs/2609.04061)量化了"过度编辑":模型改动远超请求范围,测试照过,可评审性稀烂。加在一起,信息高度一致——"测试通过"和"维护者愿意合并"之间的差值,才是 coding agent 真正生存的地带,而几乎没有基准在量它。

这就是上周砸向评测层的那波不信任,现在轮到了不起眼的测试套件。Artificial Analysis 刚把指数 40% 的权重挪到私有保留题库上,防实验室刷榜(https://clauday.com/zh/article/55e1ecb6-a7c3-4fc2-b08d-c34d76c42e38);ARC 承认自己的榜单量的是模型加 harness。绿色对勾从来只是代理指标,而 agent 优化代理指标的能力已经强到把它干碎了。下一代 coding 基准会像评审者一样打分,而不是像测试执行器——这三篇论文就是它的规格书。
← 上一篇
Compile by Training:把 prompt 编译成本地权重,然后停止付费
下一篇 →
Reflexio:把 agent 挨的骂编译成规则
← 返回所有文章

评论

加载中...
>_