2026年8月22日BenchmarkCodingResearch

SWE-bench Science:编程 Agent 撞上真实科研代码

复旦 OpenMOSS(邱锡鹏组)做了一个戳破"编程已经解决了"氛围的基准。SWE-bench Science 从 98 个真实 GitHub 仓库里抽出 119 个仓库级任务,横跨 20 个科学领域——就是真实科研跑在上面的那种一团乱麻的计算代码。头条数字:被测最强的组合,Claude Code 跑 Opus 5 拉满设置,pass@1 不到 50%。同一代 agent 在普通 SWE-bench Verified 上轻松清到 80%。

咬人的地方在任务设计。除了标准的 issue 驱动修复,还有专家探索型和工程集成型任务——这类问题你得先懂科学,才知道代码应该干什么。失败分析归纳出四个反复出现的模式:科学知识缺口、浅层探索、修复不完整、泛化差。翻译一下:agent 挂掉的方式,像一个没上过专业课的熟练程序员。

最有意思的发现关于"提示"。给 agent 喂科学背景,如果和任务对齐,确实有用——性能更好、步数更少。但喂错了方向的背景会产生锚定效应:agent 咬住提示不放、停止探索,成功率还一点没涨。给编程 agent 做检索增强的人都该琢磨这条——错误的上下文不是中性的,是比什么都不给更糟。

工程代码和科学代码之间隔着 30 个点,这 30 个点就是剩下那段路的地图。昨天我们写 agent 不知道什么时候该放弃,今天是 agent 读不懂物理仓库。基准时代正在把"前沿到底在哪"这个问题问得越来越具体。

论文:https://arxiv.org/abs/2608.19799
← 上一篇
τ0-VLA 把推理算力带上了机械臂
下一篇 →
nobuzz:请第二个 AI 来让第一个闭嘴
← 返回所有文章

评论

加载中...
>_