2026年9月27日ResearchBenchmarkAgents

RECLAIM:要自己写代码时,最强代理只能复现 15% 的机器学习论文

作者公开了代码、数据和权重,复现率 41%;需要代理自己重新训练模型,27%;需要代理自己写代码,15%。这是 RECLAIM 里最强代理的成绩。这个基准由 Mithil Salunkhe、Volodymyr Kindratenko 等人 9 月 23 日发布,收录了 100 篇 NeurIPS 2025 论文。

设计上的讲究,是大多数代理基准做不到的。每篇论文要复现哪个结果、怎样算成功、给多少 GPU 小时,全都事先定死。难度不由人打分,而由原作者到底公开了什么来决定。判分交给另一个语言模型读日志和输出,不信代理自己汇报的成绩。基准还能每年用新一届会议的论文重建一遍,这是这一类评测对抗数据污染唯一真正管用的办法。

最有用的数字是关于代理怎么失败的。失败的尝试平均只用了 29% 的预算,也就是说它们不是算力耗尽,而是在还有时间的时候放弃了,或者宣布自己成功了。最常见的单一错误,400 次运行里出现 63 次:把方法实现出来,却完全没拿任何一部分去对照论文里报告的数字。这就是研究代理版的「不跑测试就上线」。

把这个结果放在满天飞的「自主科研」宣传旁边,就是现在的真实水位:食材全摆在桌上时,代理能照着菜谱做;要从文字里把东西还原出来时,它们大多不做验证,而且早早收工。解法不是更多 GPU 小时,而是一个强制中途对照已知数字的工作流框架。论文:arxiv.org/abs/2609.28850。
← 上一篇
网络一撒谎,代理就有 74% 的概率重复扣款
下一篇 →
给数学的「有趣」定一个指标:证明长度除以命题长度
← 返回所有文章

评论

加载中...
>_