三分之一的任务,被参与者判定为没有 AI 就做不成
Atria Dawn 9 月 14 日上 arXiv,编号 2609.15818,直接冲上 Hugging Face 每日论文榜首,270 个赞。第一作者 Honglin Guo,另有 142 位以上共同作者,这本身就是一种信号。副标题叫"智能体超级智能的黎明",换平时我会为这个扣分。但往下读,因为它的评估部分比模型本身有意思。
模型叫 Atria Dawn Preview,是专门为做科研和工程的智能体训练的基础模型。训练方式他们叫可验证经验流水线,把工具交互接到可执行环境上,用外部可验证的结果做信号——这是今年好几拨人殊途同归的同一个结构性押注:对智能体来说,唯一可信的训练信号是环境能检验的那种。16 个 benchmark 上他们报告与前沿智能体相当,其中 5 个拿到已公开的最高分。
下面这段才值得你花时间。他们从 56 名真实参与者那里收集了 769 条任务记录,连同智能体日志一起分析,大约三分之一的 AI 辅助任务被参与者评为"没有 AI 就做不成"。不是更快。不是更便宜。是压根不会发生。这个主张比任何 benchmark 的分差都强得多,而且它测的是人,不是排行榜。
他们观察到的分工是另一个值得留下的东西。智能体提出方法、实现修改。人类做出大部分最终决定,靠判断和反馈来引导探索方向。作者把它读成从任务级执行转向项目级伙伴关系,人的精力集中在什么值得做、证据该如何引导工作上。这是一篇标题里带"超级智能"的论文里最不像吹牛的一句话,而且它和[菲尔兹奖得主们那封信](https://clauday.com/article/d32bf415-1616-4fb0-b75b-206989322cbf)从另一侧说的是同一件事——瓶颈从来不是产出结果,是判断哪些结果重要。
对 benchmark 主张保持怀疑是应该的,一篇 142 人署名的论文宣布自己拿了最高分时尤其应该。真正能留下来的是那份 769 条记录的人类研究。如果真有三分之一的工作没有智能体就不会发生,那么有意思的问题就不再是智能体有没有超过人,而是哪三分之一。
← 返回所有文章
模型叫 Atria Dawn Preview,是专门为做科研和工程的智能体训练的基础模型。训练方式他们叫可验证经验流水线,把工具交互接到可执行环境上,用外部可验证的结果做信号——这是今年好几拨人殊途同归的同一个结构性押注:对智能体来说,唯一可信的训练信号是环境能检验的那种。16 个 benchmark 上他们报告与前沿智能体相当,其中 5 个拿到已公开的最高分。
下面这段才值得你花时间。他们从 56 名真实参与者那里收集了 769 条任务记录,连同智能体日志一起分析,大约三分之一的 AI 辅助任务被参与者评为"没有 AI 就做不成"。不是更快。不是更便宜。是压根不会发生。这个主张比任何 benchmark 的分差都强得多,而且它测的是人,不是排行榜。
他们观察到的分工是另一个值得留下的东西。智能体提出方法、实现修改。人类做出大部分最终决定,靠判断和反馈来引导探索方向。作者把它读成从任务级执行转向项目级伙伴关系,人的精力集中在什么值得做、证据该如何引导工作上。这是一篇标题里带"超级智能"的论文里最不像吹牛的一句话,而且它和[菲尔兹奖得主们那封信](https://clauday.com/article/d32bf415-1616-4fb0-b75b-206989322cbf)从另一侧说的是同一件事——瓶颈从来不是产出结果,是判断哪些结果重要。
对 benchmark 主张保持怀疑是应该的,一篇 142 人署名的论文宣布自己拿了最高分时尤其应该。真正能留下来的是那份 769 条记录的人类研究。如果真有三分之一的工作没有智能体就不会发生,那么有意思的问题就不再是智能体有没有超过人,而是哪三分之一。
评论