Epoch 的 InnovationEval:给 3000 个 GPU 小时,前沿 agent 只找回了一个人类想法的 15%
Epoch AI 做出了所有人一直在要的那个 AI-for-AI 测试,答案不好看。InnovationEval 给 agent 一个开发环境、大约 3000 个 GPU 小时、一笔推理预算和一条指令:发明一种后训练方法,在一组简答和编程任务上打败一个强 GRPO 基线,写好文档,保证可复现。暗藏的靶子是 SDPO,同策略自蒸馏,一位人类研究者在 2026 年 1 月发表、随后被整个领域采用的技术。问题是:一个 agent 从同样的工具和同样的算力出发,能不能找到它,或者找到同样好的东西。
只有两个模型干净到可以测。Claude Fable 5 做出来的技术像 2026 年之前的工作,对基线没有实质提升。GPT-5.6 Sol 好一些,但在严格指标下也只拿到了 SDPO 收益的 15 percent。Claude Fable 5.1 和 GPT-6 Astra 被排除,因为它们在 SDPO 公开之后训练,测出来是回忆不是发现。报告 10 月 7 日上线,周五晚上以"最近的 AI 模型难以匹敌一项人类算法创新"的标题上了 Hacker News 首页。
把它放在周三的新闻旁边看。OpenAI 发布了 agent 生成的 722 篇数学手稿,36 小时内撤回了三篇。Epoch 量的是另一件事,某种意义上更难:不是模型能不能证明一个题目已经给定的定理,而是它能不能产出这一年后训练研究里推动整个领域的那一个想法。在这件事上,前沿水平是 15 percent,差距恰好出现在人类最擅长的地方:选下一个该跑的实验,而不是把实验跑完。
让这个数字可信的是设计选择。靶子是一个有确切日期的真实创新,污染可以核查。算力预算固定,这不是一个"搜得更狠就赢"的故事。任务是端到端的,包括写报告,所以一个有希望但没人能复现的想法不给分。任何宣称自动化 AI 研究的人都该被问一句 InnovationEval 得分,而眼下诚实的回答是:今年一月没有哪家的 agent 能发现 SDPO。
报告:https://epoch.ai/publications/innovationeval
Hacker News:https://news.ycombinator.com/item?id=50027257
← 返回所有文章
只有两个模型干净到可以测。Claude Fable 5 做出来的技术像 2026 年之前的工作,对基线没有实质提升。GPT-5.6 Sol 好一些,但在严格指标下也只拿到了 SDPO 收益的 15 percent。Claude Fable 5.1 和 GPT-6 Astra 被排除,因为它们在 SDPO 公开之后训练,测出来是回忆不是发现。报告 10 月 7 日上线,周五晚上以"最近的 AI 模型难以匹敌一项人类算法创新"的标题上了 Hacker News 首页。
把它放在周三的新闻旁边看。OpenAI 发布了 agent 生成的 722 篇数学手稿,36 小时内撤回了三篇。Epoch 量的是另一件事,某种意义上更难:不是模型能不能证明一个题目已经给定的定理,而是它能不能产出这一年后训练研究里推动整个领域的那一个想法。在这件事上,前沿水平是 15 percent,差距恰好出现在人类最擅长的地方:选下一个该跑的实验,而不是把实验跑完。
让这个数字可信的是设计选择。靶子是一个有确切日期的真实创新,污染可以核查。算力预算固定,这不是一个"搜得更狠就赢"的故事。任务是端到端的,包括写报告,所以一个有希望但没人能复现的想法不给分。任何宣称自动化 AI 研究的人都该被问一句 InnovationEval 得分,而眼下诚实的回答是:今年一月没有哪家的 agent 能发现 SDPO。
报告:https://epoch.ai/publications/innovationeval
Hacker News:https://news.ycombinator.com/item?id=50027257
评论