2026年9月25日BenchmarkCodingResearch

把仓库改个名,coding agent就变笨了

SWE-bench的题目全来自地球上最有名的那批Python仓库——django、sympy、scikit-learn,这些项目的完整git历史在每一份预训练语料里都躺过好几遍。那么当一个agent在上面解决了一个issue,里面有多少是工程能力,有多少只是因为它读过这个代码库一千遍、闭着眼都知道文件在哪?

SchrodingerRepo这篇论文(arXiv 2609.27891)的答法是:把"眼熟"这件事洗掉。四层改造,全部保持行为不变:重写问题描述、重映射命名空间、把文件内部的布局打乱、再把代码重写成换一套说法但干完全一样的事。原来的解法照样能通过测试。消失的只有辨识度。

结果是所有测过的模型性能都掉,一致地掉,而且交互成本明显上升。好看的部分是诊断。损伤不落在推理上,也不落在写补丁上。落在探索和定位上——找到对的文件,找到对的函数。而这恰好就是那种你会预期"记忆"能白送、"泛化"得自己挣的能力。

这件事重新定义了那个benchmark分数的含义。coding agent的SWE-bench成绩,有一部分是在衡量它对某几个特定仓库有多熟,而你的代码库不在那几个里面。把这个加进该要的数字清单:改造后仓库的分数,要和原始分数并排放,就像我们已经开始要求生存率、全通过率和每完成一次任务的成本一样。两者之间的那个差,才是能带到你工作里的部分。

论文:https://arxiv.org/abs/2609.27891 代码:https://github.com/cslsolow/Schrodinger-Repo
← 上一篇
别在知道要被问什么之前,就决定记什么
下一篇 →
购物agent一碰上会使坏的商店,78.6%掉到17.3%
← 返回所有文章

评论

加载中...
>_