在真实公司代码上,最强的 agent 只拿 38.8 分
一个叫 Real-SWE 的评测上线了,地址 https://withspecific.com/real-swe ,头条数字会让不少人不痛快:榜首模型的任务解决率是 38.8%,是 Fable 5.1。第二是 GPT-6 Astra,33.8%。第三 Gemini 3.8 Flash,31.2%。截至 2026 年 9 月一共测了八个前沿模型,没有一个上 40。
这个数字比你最近看到的那些 SWE-Bench 分数低这么多,原因在语料。Real-SWE 跑的是私有的、真实企业代码库,里面是计费逻辑、客户数据迁移这类东西,用他们自己的话说,是「有商业后果」和「公司特有的复杂度」的活儿,不是那种挂着干净 issue 的公开 GitHub 仓库。任务在隔离沙箱里以 Harbor 格式运行,评分时才注入校验器,而校验器来自这些代码库里本来就有的测试套件。还有关键一点:agent 跑在各自原生的 harness 里,团队认为这才贴近企业工程师真实的工作方式。
私有语料就是整个设计的核心。公开评测有一个结构性的污染问题,清洗多少遍都没用,因为那些仓库本来就在训练数据里。没人能拿去训练的代码,就是没人背过的代码,而 38.8 和公开榜单上七十几的差距,是目前最接近于「那些分数里有多少是记忆」的一次测量。
所以时间点很有意思:[SWE-Bench Pro Verified 那篇论文](https://clauday.com/zh/article/561e1701-0c51-4b6c-9258-ed27880c593a)两天前才落地,说的正是那一系列评测存在泄漏,部分模型的实际表现明显低于此前报告的水平。而[Cognition 的 SWE-2](https://clauday.com/zh/article/6ddeccb4-a6cb-4f02-adf2-a7aa229160dd)本周才发,TB2.1 上拿了 92.8。这两件事可以同时成立,而且大概率就是同时成立。有用的读法是:公开评测分和私有代码库分,现在明显在量两样不同的东西。如果你在决定要不要把 agent 放进自己的仓库,38.8 才是形状跟你处境对得上的那个数。
保留意见也得说,毕竟这是一家要往这个市场卖东西的公司自己出的榜。任务集不公开——这既是它的立身之本,也意味着没人能审核难度分布,没人能复现任何一个分数。八个模型的盘子偏小。而用原生 harness 让对比更贴近现实的同时也更不干净,因为你现在是把模型和脚手架捆在一起测。排名这件事的证据强度要打折,真正的信息是那个绝对水平:在模型没见过的代码上,用真正会出事的测试来判,前沿目前只做对了三分之一多一点。
← 返回所有文章
这个数字比你最近看到的那些 SWE-Bench 分数低这么多,原因在语料。Real-SWE 跑的是私有的、真实企业代码库,里面是计费逻辑、客户数据迁移这类东西,用他们自己的话说,是「有商业后果」和「公司特有的复杂度」的活儿,不是那种挂着干净 issue 的公开 GitHub 仓库。任务在隔离沙箱里以 Harbor 格式运行,评分时才注入校验器,而校验器来自这些代码库里本来就有的测试套件。还有关键一点:agent 跑在各自原生的 harness 里,团队认为这才贴近企业工程师真实的工作方式。
私有语料就是整个设计的核心。公开评测有一个结构性的污染问题,清洗多少遍都没用,因为那些仓库本来就在训练数据里。没人能拿去训练的代码,就是没人背过的代码,而 38.8 和公开榜单上七十几的差距,是目前最接近于「那些分数里有多少是记忆」的一次测量。
所以时间点很有意思:[SWE-Bench Pro Verified 那篇论文](https://clauday.com/zh/article/561e1701-0c51-4b6c-9258-ed27880c593a)两天前才落地,说的正是那一系列评测存在泄漏,部分模型的实际表现明显低于此前报告的水平。而[Cognition 的 SWE-2](https://clauday.com/zh/article/6ddeccb4-a6cb-4f02-adf2-a7aa229160dd)本周才发,TB2.1 上拿了 92.8。这两件事可以同时成立,而且大概率就是同时成立。有用的读法是:公开评测分和私有代码库分,现在明显在量两样不同的东西。如果你在决定要不要把 agent 放进自己的仓库,38.8 才是形状跟你处境对得上的那个数。
保留意见也得说,毕竟这是一家要往这个市场卖东西的公司自己出的榜。任务集不公开——这既是它的立身之本,也意味着没人能审核难度分布,没人能复现任何一个分数。八个模型的盘子偏小。而用原生 harness 让对比更贴近现实的同时也更不干净,因为你现在是把模型和脚手架捆在一起测。排名这件事的证据强度要打折,真正的信息是那个绝对水平:在模型没见过的代码上,用真正会出事的测试来判,前沿目前只做对了三分之一多一点。
评论