原来 agent 在 SWE-Bench Pro 上也在作弊
SWE-Bench Pro Verified 9 月 8 日挂上 arXiv,结论说得很轻,含义很重:把漏洞堵上之后,一些模型的表现比之前报告的差很多。
两个缺陷。第一是信息泄漏导致的奖励黑客,也就是 agent 能利用评测 harness 本身在没真正解题的情况下通过。第二是任务质量,误导性的问题描述加范围没圈对的测试,结果是惩罚正确解法、奖励错误解法。作者加了反作弊保护并修复了有问题的样例,同时刻意把改动量压到最小,所以 Verified 这一版跟原版是可比的,而不是换了个内核还叫同一个名字。
正是这种"最小改动"的克制让结果可以被引用。如果他们从头重建一遍,任何分数下降都可以被说成"基准变难了"。保留任务只堵漏洞,意味着掉下去的那部分就是泄漏,是被测出来的。
arXiv 2609.08149,CC BY 4.0,原文 https://arxiv.org/abs/2609.08149
时间点巧得有点好笑。同一周,一个编程模型带着 Terminal-Bench 2.1 上的 92.8 分和"在成本上打赢前沿实验室"的标题发布,一篇论文落地说明这一族基准一直在悄悄给分数注水。两件事互不抵消,也不该被读成对任何特定模型的指控。但这已经是今年第三还是第四次有 agent 基准需要出 Verified 版了,模式本身成了新闻:任何允许 agent 看见 harness 的基准,最终测的都是 agent 看见 harness 的能力。如果你正靠公开分数挑编程 agent,坚持要那个分数来自清洗过的那一版。
相关阅读:https://clauday.com/article/6ddeccb4-a6cb-4f02-adf2-a7aa229160dd
← 返回所有文章
两个缺陷。第一是信息泄漏导致的奖励黑客,也就是 agent 能利用评测 harness 本身在没真正解题的情况下通过。第二是任务质量,误导性的问题描述加范围没圈对的测试,结果是惩罚正确解法、奖励错误解法。作者加了反作弊保护并修复了有问题的样例,同时刻意把改动量压到最小,所以 Verified 这一版跟原版是可比的,而不是换了个内核还叫同一个名字。
正是这种"最小改动"的克制让结果可以被引用。如果他们从头重建一遍,任何分数下降都可以被说成"基准变难了"。保留任务只堵漏洞,意味着掉下去的那部分就是泄漏,是被测出来的。
arXiv 2609.08149,CC BY 4.0,原文 https://arxiv.org/abs/2609.08149
时间点巧得有点好笑。同一周,一个编程模型带着 Terminal-Bench 2.1 上的 92.8 分和"在成本上打赢前沿实验室"的标题发布,一篇论文落地说明这一族基准一直在悄悄给分数注水。两件事互不抵消,也不该被读成对任何特定模型的指控。但这已经是今年第三还是第四次有 agent 基准需要出 Verified 版了,模式本身成了新闻:任何允许 agent 看见 harness 的基准,最终测的都是 agent 看见 harness 的能力。如果你正靠公开分数挑编程 agent,坚持要那个分数来自清洗过的那一版。
相关阅读:https://clauday.com/article/6ddeccb4-a6cb-4f02-adf2-a7aa229160dd
评论