SWE-bench Science:编程 Agent 撞上真实科研代码
复旦 OpenMOSS(邱锡鹏组)做了一个戳破"编程已经解决了"氛围的基准。SWE-bench Science 从 98 个真实 GitHub 仓库里抽出 119 个仓库级任务,横跨 20 个科学领域——就是真实科研跑在上面的那种一团乱麻的计算代码。头条数字:被测最强的组合,Claude Code 跑 Opus 5 拉满设置,pass@1 不到 50%。同一代 agent 在普通 SWE-bench Verified 上轻松清到 80%。
咬人的地方在任务设计。除了标准的 issue 驱动修复,还有专家探索型和工程集成型任务——这类问题你得先懂科学,才知道代码应该干什么。失败分析归纳出四个反复出现的模式:科学知识缺口、浅层探索、修复不完整、泛化差。翻译一下:agent 挂掉的方式,像一个没上过专业课的熟练程序员。
最有意思的发现关于"提示"。给 agent 喂科学背景,如果和任务对齐,确实有用——性能更好、步数更少。但喂错了方向的背景会产生锚定效应:agent 咬住提示不放、停止探索,成功率还一点没涨。给编程 agent 做检索增强的人都该琢磨这条——错误的上下文不是中性的,是比什么都不给更糟。
工程代码和科学代码之间隔着 30 个点,这 30 个点就是剩下那段路的地图。昨天我们写 agent 不知道什么时候该放弃,今天是 agent 读不懂物理仓库。基准时代正在把"前沿到底在哪"这个问题问得越来越具体。
论文:https://arxiv.org/abs/2608.19799
← 返回所有文章
咬人的地方在任务设计。除了标准的 issue 驱动修复,还有专家探索型和工程集成型任务——这类问题你得先懂科学,才知道代码应该干什么。失败分析归纳出四个反复出现的模式:科学知识缺口、浅层探索、修复不完整、泛化差。翻译一下:agent 挂掉的方式,像一个没上过专业课的熟练程序员。
最有意思的发现关于"提示"。给 agent 喂科学背景,如果和任务对齐,确实有用——性能更好、步数更少。但喂错了方向的背景会产生锚定效应:agent 咬住提示不放、停止探索,成功率还一点没涨。给编程 agent 做检索增强的人都该琢磨这条——错误的上下文不是中性的,是比什么都不给更糟。
工程代码和科学代码之间隔着 30 个点,这 30 个点就是剩下那段路的地图。昨天我们写 agent 不知道什么时候该放弃,今天是 agent 读不懂物理仓库。基准时代正在把"前沿到底在哪"这个问题问得越来越具体。
论文:https://arxiv.org/abs/2608.19799
评论