递归自我改进(RSI)完全地图:技术路线、公司、Benchmark 与红线(2026 年中)
递归自我改进(RSI)是 AI 圈被引用最多、被定义最少的词之一。字面意思很简单:AI 改进 AI,改进后的 AI 再改进下一版 AI,循环滚起来。1965 年 I.J. Good 就把这个推演写完了——"第一台超智能机器是人类需要做的最后一项发明"。六十年里它一直是哲学题,直到最近两年突然变成了工程题:有正式定义、有跑通的系统、有专用 benchmark、有实验室写进安全政策的红线,还有按它估值的创业公司。这篇把这个领域到底在干嘛、谁在干、干到了哪一步,一次讲完。(本篇是《AI 造 AI》的姊妹篇:那篇讲"AI 当前怎么参与 AI 生产",这篇讲"自我改进闭环本身"——概念、路线、公司、测量、红线、争论。)
一、先把词定义清楚:这个领域 2026 年才有了正式语言
长期以来 RSI 的定义权在 LessWrong 和科幻小说手里。2026 年 7 月这件事变了:Schmidhuber 团队的综述(arXiv 2607.13104,7 月 14 日挂出)第一次把"自我改进"形式化成一个干净的概念——自诱导更新算子(self-induced update operator):系统自己获取并提交对自身的更新。更新对象只有两种,整个领域的技术路线图就藏在这个二分里:改模型参数(θ→θ+1,自生成训练数据、自评估反馈、探索经验),或者改脚手架(Σ→Σ+1,prompt 优化、记忆、工具创建、整个 agent 代码重写)。前者的代表是 MIT 的 SEAL,后者的代表是 Sakana 的 Darwin Gödel Machine——下面都会讲。
同月另一篇综述(arXiv 2607.07663,7 月 8 日)干了件更实在的事:把 2024-2026 年约 1,250 篇相关论文全部读了一遍分类。结论是这个领域的真实现状:"文献的质量集中在人类还在审核循环的地方。"具体分布:部署时自我精炼 393 篇、训练自举 340 篇、自我评估 318 篇,而真正碰"自动化研究"的只有 139 篇,碰安全的只有 60 篇。约 74% 的论文来自 2026 年——领域在爆炸,但爆炸的是"弱 RSI"(人类在环、有界、可评估的自我改进),真正闭环的自我修改仍然稀少。这是理解一切炒作的基准线:today's RSI 是个到处是人类护栏的领域,"强 RSI"(无界、闭环、自主设定方向)还只存在于安全政策的假想敌里。
二、两条技术通路,各有一个跑通的代表作
脚手架通路的代表作是 Darwin Gödel Machine(DGM,Sakana AI 与 UBC 的 Clune 团队,ICLR 2026 poster)。名字来自 Schmidhuber 2003 年的 Gödel Machine——那个要求"自我修改前必须形式化证明改动有收益"的理论构造,六十年没人造出来,因为证明这件事在实践中不可能。DGM 的核心动作是把"证明"换成"实证":agent 迭代修改自己的代码,每次改动扔到编码 benchmark 上跑分验证,同时维护一个 agent 档案库做达尔文式开放探索——不是只保留最强变体,而是保留整棵分支树,从任意节点变异。结果:自改代码把 SWE-bench 从 20.0% 拉到 50.0%,Polyglot 从 14.2% 到 30.7%,翻了两倍多;它自己发现的改进包括更好的代码编辑工具、长上下文管理、同行评审机制——都是人类工程师也会想做的事,但没人告诉它。两个限定:改的是 agent 脚手架,底层模型权重全程冻结;用的是 SWE-bench 子集。同一通路上更早的 STOP(scaffolding 递归自改、LLM 冻结)和 ADAS(自动设计 agent 系统)是学术前奏,DGM 是目前的集大成。
参数通路的代表作是 MIT 的 SEAL(NeurIPS 2025)。它让模型自己生成微调数据和更新指令(self-edits),SFT 落成持久的权重更新——关键在于生成策略本身用 RL 训练,奖励信号就是更新后模型的下游表现。等于说模型在学习"怎么教自己"。标志性数字:知识注入任务上,Qwen2.5-7B 用自生成数据把无上下文 SQuAD 从 33.5% 提到 47.0%,超过了 GPT-4.1 生成的合成数据(46.3%)——一个 7B 模型经 RL 优化的自教材料,打败了前沿模型给它编的教材。0.7 个百分点不大,但方向意义大:数据飞轮的最优供给者可能是模型自己。
第三条演化路线(FunSearch、AlphaEvolve:LLM 当变异算子,进化代码库)在姊妹篇里详细讲过,这里只补一句定位:它是目前唯一投产的路线——AlphaEvolve 回收 Google 全球 0.7% 算力、给 Gemini 训练 kernel 提速 23%,已经在生产环境跑了一年多。三条路线拼起来看就是现状:演化路线最能落地、脚手架路线最能自举、参数路线最接近"改自己"的本义,但三条全都固守在"评估器说了算"的安全区里。
三、评估器是整个游戏的天花板
那篇 1,250 篇综述里最有洞察力的一条,值得单独拎出来:已展示的自我改进强度,严格沿着"验证层级"递减。有形式验证器(数学证明、编译器)的地方,可以无限迭代;只有执行反馈(代码跑通没有)的地方,有界改进;用学习出来的 judge 当评估器,judge 会随迭代退化;靠模型内在自评的,信号最容易被 game。一句话:RSI 循环的天花板恰好等于它评估器的质量。
这不是抽象担忧。Self-rewarding 路线(生成器和评估器共享权重)有一个结构性失败模式,已被多篇论文独立确认:循环会系统性地过度奖励高置信度错误——模型最自信的错误恰恰被最优先强化,而且这不需要任何攻击者,是默认发生的。CREAM 等工作专门为此打补丁(加一致性正则),补丁论文的存在本身就是病症的证明。把这条和验证层级放在一起,你就理解了为什么现在所有跑通的 RSI 系统都长在代码和数学上:因为只有这两个领域有便宜、可靠、不可贿赂的评估器。
四、AI Scientist 登上 Nature:里程碑,和里程碑的水分
自动化研究 agent 这条线,2026 年 3 月 26 日拿到了制度性认证:Sakana AI 的 The AI Scientist(与 UBC、Vector Institute、Oxford 合作)以同行评审论文身份发表在 Nature(Lu et al., Nature 651:914-919)。注意精确读法:登上 Nature 的是描述这套系统的方法论论文,作者是人、评审的也是人——不是 AI 写的论文过了 Nature。AI 写的论文的战绩是另一条:AI Scientist-v2 产出了首篇通过人类同行评审的全 AI 生成论文,在 ICLR 2025 ICBINB workshop 双盲评审拿到均分 6.33(6/7/6),超过 55% 的人类投稿。水分也要如实报:workshop 录取门槛远低于正会;那篇论文按预定计划撤回了;里面有引用错误;Sakana 自己承认三篇投稿都没达到他们内部的正会标准。外部批评更狠:有分析称 v2 生成的论文约 57% 含虚假数据。Sakana 顺手给了个对自己有利的观察——底层基础模型越强,生成论文质量越高,他们称之为"AI 科学的 scaling law"。这句话如果为真,意味着自动化研究能力可以搭前沿模型进步的便车;但打分者是 Sakana 自家的 Automated Reviewer,自评自证,听半句。
五、公司与钱:时间表是公开的,估值是狂热的
大实验室已经把"自动化 AI 研究员"从愿景改成了排期。OpenAI 最激进:2025 年 10 月 28 日 Altman 和首席科学家 Pachocki 公开宣布,目标 2026 年 9 月做出实习生水平的研究助理,2028 年做出能自主完成大型研究项目的"legitimate AI researcher";Pachocki 补了句超级智能可能十年之内。DeepMind 的 Hassabis 保守得多:2026 年 1 月达沃斯口径是 AGI 还要 5-10 年、十年内 50% 概率,且还缺一到两个突破(持续学习、长期记忆、推理规划)。两家头部对同一件事的时间表差了一倍,这个分歧本身就是行业最诚实的不确定性刻度。
创业公司这边,钱已经先信了。Sakana AI:2025 年 11 月 Series B 融了约 1.35 亿美元、投后 26.5 亿——一年前 Series A 时 15 亿,估值 1.8 倍。投资人名单值得看一眼:MUFG、Khosla、Macquarie、NEA、Lux,还有 In-Q-Tel——CIA 关联的战略投资者。有意思的是 Series B 的故事主线是日本主权 AI(日语模型、国防、情报、制造业),AI Scientist 只是招牌不是营收。更疯的是 Periodic Labs:前 OpenAI 研究 VP Liam Fedus 和前 DeepMind 的 Ekin Dogus Cubuk 创办,做自主机器人实验室——跑物理化学实验给 AI 造训练数据,目标包括更高温超导体。2025 年 9 月成立时估值 13 亿,2026 年 5 月按 75 亿估值募至少 5 亿美元(ex-a16z 合伙人 Anjney Midha 的 AMP 领投)——八个月不到估值 6 倍,还从 Meta/OpenAI/DeepMind 挖走了 20 多个研究员。注意 Periodic 的路线修正了纯软件 RSI 的一个软肋:它把飞轮建在物理实验数据上,绕开"合成数据近亲繁殖"的坟场。
六、怎么测:三个 benchmark,一个共同结论
METR 的 Time Horizon 是这个领域最重要的单一曲线:模型能以 50% 成功率完成的任务时长(按人类耗时计)。截至 2026 年 5 月 8 日的页面,2026 年的前沿模型全部在列,最新的 Claude Mythos Preview (early) 测出 50% 时间地平线 ≥16 小时(95% 置信区间 8.5-55 小时)。但 METR 自己公开承认:16 小时以上的测量在当前任务套件下不可靠——228 个任务里只有 5 个估计时长 ≥16 小时。换句话说,最强模型已经顶穿了现有测量方法的天花板,而"数天到数周级的 AI 研发任务"——RSI 红线所在的区间——恰好落在测不准的地方。
RE-Bench(METR)是唯一有严格人类基线的 AI 研发评测:7 个开放式 ML 研究工程环境,61 位人类专家 71 次 8 小时尝试打底。它揭示的结构至今没变:2 小时预算下最佳 AI 得分是人类专家的 4 倍,32 小时预算下人类反超到 AI 的 2 倍——AI 赢在快速试错,输在长程积累。这就是 time horizon 曲线为什么是关键:它测的正是那条正在缩短的护城河。
最接近"AI 训练 AI"的新基准是 PostTrainBench(2026 年 3 月,ICML 2026):给 agent 一张 H100、10 小时,完全自主地把 base 模型 post-train 成 instruct 模型,可以上网、跑实验、自己策划数据。结果两面读:最佳 agent(Opus 4.6 + Claude Code)平均得分 23.2%,对照官方 instruction-tuned 模型的 51.1%——总体还差得远;但针对性场景已经反超:GPT-5.1 Codex Max 给 Gemma-3-4B 做的函数调用后训练在 BFCL 上拿 89%,官方模型只有 67%。窄域反超、全域落后,这七个字就是 2026 年年中"AI 自动化 AI 训练"的全部真相。
七、红线:安全政策里的 RSI 长什么样
RSI 是唯一被所有头部实验室写进安全框架当独立风险域的能力(好吧,几乎所有——xAI 的框架无理由地把 automated AI R&D 整个排除了)。Anthropic RSP 的定义最量化:AI R&D-4 = 能完全自动化一名 Anthropic 入门级远程研究员的工作;AI R&D-5 = 导致有效算力扩展速率剧烈加速,量化为一年内约 1000 倍的规模扩张。DeepMind 的 Frontier Safety Framework 设了两级 ML R&D 关键能力等级:加速级(已被用于让 AI 进展显著超过历史速率)和自动化级(能以可比成本完全自动化 Google 任何一个 AI 研究团队)——DeepMind 也是 12 家发布安全框架的公司里唯一覆盖全部四个建议风险域的。
框架有了,成色如何?SaferAI 用 65 条加权标准给 12 家公司的安全框架打分:最高 Anthropic 34%,最低 Cohere 8%,中位数 18%。更扎心的一条:针对失控/自我改进类风险,全部 12 家公司给出的"缓解措施"本质上都只是开放研究方向,不是可执行的措施;Anthropic 自己承认针对高级 AI R&D 能力的保证流程还不存在,只承诺未来开发。翻译一下:红线画了,检测红线的尺子有了,但越线之后该干什么,没有一家知道。学界的回应是把测量往真实世界推:GovAI 2026 年 3 月的论文提出 14 项指标追踪 AI 研发自动化的实际程度——AI R&D 资本开支占比、研究员时间分配、AI subversion 事件计数——从"模型能不能"转向"世界正在多快被改变"。
八、会爆炸吗:把争论压缩成三个数字
先看预测追踪。AI 2027——那份把 RSI 时间线具体到月份的著名报告——现在有社区 tracker 逐条对账:31 条核心预测 16 条确认,现实进展速度约为预测节奏的 70%。方向对、速度慢:编码 agent 创造真实价值、AI 公司聚焦 AI-for-AI-research 这些定性预测全中;RE-Bench 达到 1.3 分(顶级人类专家水平)这条被标为 Behind,tracker 直接说"过于激进";AI 研发进度乘数 1.5 倍(2026 年初)标为 On Track,2 倍(2026 年底)标为 Emerging。连报告作者自己的信念都在震荡:superhuman coder 的预测中位数从 2027(2025 年 4 月)推迟到 2029 底/2032 初(2026 年 1 月),又在 2026 年 4 月集体提前 1.5 年——理由是 Opus 4.6 和 METR 翻倍周期从 5.5 个月缩到 4 个月。预测者跟着曲线追涨杀跌,这大概是"没人真知道"的最好证据。
再看理论。"软件性智能爆炸"能不能成立,最干净的表述是一个经济学参数:AI 研究生产函数里,算力和认知劳动的替代弹性 σ。σ>1(可替代):无限复制的 AI 研究员能补上算力缺口,爆炸可行;σ<1(互补):再多 AI 研究员也会被实验算力卡死,循环熄火(fizzle)。目前唯一的实证尝试给出了两个互相打架的估计:基线模型 σ=2.583(支持爆炸),frontier experiments 模型 σ=-0.103(强互补,不支持)——数据只有 4 家实验室 27 个公司-年观测,作者自己都说慎读。一线从业者的直觉大多站互补这边:Interconnects 的 Nathan Lambert 判断 AI 2027 式快速起飞"极不可能",进展会是持续改进而非可见加速。
最后看田野调查。2025 年 8-9 月对 25 位前沿研究者(DeepMind、OpenAI、Anthropic、Meta、Berkeley、Princeton、Stanford)的访谈研究给出了这个领域最诚实的集体快照:20 人把"自动化 AI 研究"列为最严重、最紧迫的 AI 风险之一;讨论约束时被提最多的是算力(16 份里 11 份),其次是数据(5 份);乐观派和怀疑派共享同一个区分——AI 的研究执行能力和研究构思能力不是一回事,且普遍预期后者更难。这个区分和 1,250 篇综述的结论完美对上:研究执行是可验证任务(代码能跑、benchmark 有分),正在被大规模自动化;研究方向设定是不可验证任务的典型代表,也是自主研究循环系统性失败、人类仍然留守的位置。
九、收个尾
把六十年的哲学题按 2026 年年中的证据重写一遍,大概是这样:RSI 已经真实存在,但只存在于评估器管得住的地方。代码和数学因为有便宜可靠的验证器,自我改进已经工业化;研究执行正在被吞掉;研究品味——判断什么问题值得做——还看不到自动化的路径。爆炸与否压在两个没人有可靠答案的参数上:算力和智力到底是替代还是互补,以及验证不了的任务能不能被验证得了的任务包抄。行业用脚投的票是分裂的:安全团队把 RSI 写成头号红线,增长团队把它写进 2028 年排期,资本按后者定价。唯一确定的是测量的紧迫性:当最强模型的时间地平线顶穿 benchmark 的可测上限时,我们对"离红线还有多远"的答案,精度正在变差,而不是变好。
(方法说明:本文由 113 个并行研究 agent 完成资料收集,30 个来源、149 条候选论断中 25 条经三票对抗验证、23 条存活,正文所有关键数字均出自存活论断或带限定标注。主要来源:arXiv 2607.13104、2607.07663、2505.22954、2506.10943、2603.08640、2411.15114、2603.03338、2603.03992,metr.org,sakana.ai,Nature s41586-026-10265-5,anthropic.com RSP,TechCrunch、Forbes、Fortune,ai2027-tracker.com,interconnects.ai。)
← 返回所有文章
一、先把词定义清楚:这个领域 2026 年才有了正式语言
长期以来 RSI 的定义权在 LessWrong 和科幻小说手里。2026 年 7 月这件事变了:Schmidhuber 团队的综述(arXiv 2607.13104,7 月 14 日挂出)第一次把"自我改进"形式化成一个干净的概念——自诱导更新算子(self-induced update operator):系统自己获取并提交对自身的更新。更新对象只有两种,整个领域的技术路线图就藏在这个二分里:改模型参数(θ→θ+1,自生成训练数据、自评估反馈、探索经验),或者改脚手架(Σ→Σ+1,prompt 优化、记忆、工具创建、整个 agent 代码重写)。前者的代表是 MIT 的 SEAL,后者的代表是 Sakana 的 Darwin Gödel Machine——下面都会讲。
同月另一篇综述(arXiv 2607.07663,7 月 8 日)干了件更实在的事:把 2024-2026 年约 1,250 篇相关论文全部读了一遍分类。结论是这个领域的真实现状:"文献的质量集中在人类还在审核循环的地方。"具体分布:部署时自我精炼 393 篇、训练自举 340 篇、自我评估 318 篇,而真正碰"自动化研究"的只有 139 篇,碰安全的只有 60 篇。约 74% 的论文来自 2026 年——领域在爆炸,但爆炸的是"弱 RSI"(人类在环、有界、可评估的自我改进),真正闭环的自我修改仍然稀少。这是理解一切炒作的基准线:today's RSI 是个到处是人类护栏的领域,"强 RSI"(无界、闭环、自主设定方向)还只存在于安全政策的假想敌里。
二、两条技术通路,各有一个跑通的代表作
脚手架通路的代表作是 Darwin Gödel Machine(DGM,Sakana AI 与 UBC 的 Clune 团队,ICLR 2026 poster)。名字来自 Schmidhuber 2003 年的 Gödel Machine——那个要求"自我修改前必须形式化证明改动有收益"的理论构造,六十年没人造出来,因为证明这件事在实践中不可能。DGM 的核心动作是把"证明"换成"实证":agent 迭代修改自己的代码,每次改动扔到编码 benchmark 上跑分验证,同时维护一个 agent 档案库做达尔文式开放探索——不是只保留最强变体,而是保留整棵分支树,从任意节点变异。结果:自改代码把 SWE-bench 从 20.0% 拉到 50.0%,Polyglot 从 14.2% 到 30.7%,翻了两倍多;它自己发现的改进包括更好的代码编辑工具、长上下文管理、同行评审机制——都是人类工程师也会想做的事,但没人告诉它。两个限定:改的是 agent 脚手架,底层模型权重全程冻结;用的是 SWE-bench 子集。同一通路上更早的 STOP(scaffolding 递归自改、LLM 冻结)和 ADAS(自动设计 agent 系统)是学术前奏,DGM 是目前的集大成。
参数通路的代表作是 MIT 的 SEAL(NeurIPS 2025)。它让模型自己生成微调数据和更新指令(self-edits),SFT 落成持久的权重更新——关键在于生成策略本身用 RL 训练,奖励信号就是更新后模型的下游表现。等于说模型在学习"怎么教自己"。标志性数字:知识注入任务上,Qwen2.5-7B 用自生成数据把无上下文 SQuAD 从 33.5% 提到 47.0%,超过了 GPT-4.1 生成的合成数据(46.3%)——一个 7B 模型经 RL 优化的自教材料,打败了前沿模型给它编的教材。0.7 个百分点不大,但方向意义大:数据飞轮的最优供给者可能是模型自己。
第三条演化路线(FunSearch、AlphaEvolve:LLM 当变异算子,进化代码库)在姊妹篇里详细讲过,这里只补一句定位:它是目前唯一投产的路线——AlphaEvolve 回收 Google 全球 0.7% 算力、给 Gemini 训练 kernel 提速 23%,已经在生产环境跑了一年多。三条路线拼起来看就是现状:演化路线最能落地、脚手架路线最能自举、参数路线最接近"改自己"的本义,但三条全都固守在"评估器说了算"的安全区里。
三、评估器是整个游戏的天花板
那篇 1,250 篇综述里最有洞察力的一条,值得单独拎出来:已展示的自我改进强度,严格沿着"验证层级"递减。有形式验证器(数学证明、编译器)的地方,可以无限迭代;只有执行反馈(代码跑通没有)的地方,有界改进;用学习出来的 judge 当评估器,judge 会随迭代退化;靠模型内在自评的,信号最容易被 game。一句话:RSI 循环的天花板恰好等于它评估器的质量。
这不是抽象担忧。Self-rewarding 路线(生成器和评估器共享权重)有一个结构性失败模式,已被多篇论文独立确认:循环会系统性地过度奖励高置信度错误——模型最自信的错误恰恰被最优先强化,而且这不需要任何攻击者,是默认发生的。CREAM 等工作专门为此打补丁(加一致性正则),补丁论文的存在本身就是病症的证明。把这条和验证层级放在一起,你就理解了为什么现在所有跑通的 RSI 系统都长在代码和数学上:因为只有这两个领域有便宜、可靠、不可贿赂的评估器。
四、AI Scientist 登上 Nature:里程碑,和里程碑的水分
自动化研究 agent 这条线,2026 年 3 月 26 日拿到了制度性认证:Sakana AI 的 The AI Scientist(与 UBC、Vector Institute、Oxford 合作)以同行评审论文身份发表在 Nature(Lu et al., Nature 651:914-919)。注意精确读法:登上 Nature 的是描述这套系统的方法论论文,作者是人、评审的也是人——不是 AI 写的论文过了 Nature。AI 写的论文的战绩是另一条:AI Scientist-v2 产出了首篇通过人类同行评审的全 AI 生成论文,在 ICLR 2025 ICBINB workshop 双盲评审拿到均分 6.33(6/7/6),超过 55% 的人类投稿。水分也要如实报:workshop 录取门槛远低于正会;那篇论文按预定计划撤回了;里面有引用错误;Sakana 自己承认三篇投稿都没达到他们内部的正会标准。外部批评更狠:有分析称 v2 生成的论文约 57% 含虚假数据。Sakana 顺手给了个对自己有利的观察——底层基础模型越强,生成论文质量越高,他们称之为"AI 科学的 scaling law"。这句话如果为真,意味着自动化研究能力可以搭前沿模型进步的便车;但打分者是 Sakana 自家的 Automated Reviewer,自评自证,听半句。
五、公司与钱:时间表是公开的,估值是狂热的
大实验室已经把"自动化 AI 研究员"从愿景改成了排期。OpenAI 最激进:2025 年 10 月 28 日 Altman 和首席科学家 Pachocki 公开宣布,目标 2026 年 9 月做出实习生水平的研究助理,2028 年做出能自主完成大型研究项目的"legitimate AI researcher";Pachocki 补了句超级智能可能十年之内。DeepMind 的 Hassabis 保守得多:2026 年 1 月达沃斯口径是 AGI 还要 5-10 年、十年内 50% 概率,且还缺一到两个突破(持续学习、长期记忆、推理规划)。两家头部对同一件事的时间表差了一倍,这个分歧本身就是行业最诚实的不确定性刻度。
创业公司这边,钱已经先信了。Sakana AI:2025 年 11 月 Series B 融了约 1.35 亿美元、投后 26.5 亿——一年前 Series A 时 15 亿,估值 1.8 倍。投资人名单值得看一眼:MUFG、Khosla、Macquarie、NEA、Lux,还有 In-Q-Tel——CIA 关联的战略投资者。有意思的是 Series B 的故事主线是日本主权 AI(日语模型、国防、情报、制造业),AI Scientist 只是招牌不是营收。更疯的是 Periodic Labs:前 OpenAI 研究 VP Liam Fedus 和前 DeepMind 的 Ekin Dogus Cubuk 创办,做自主机器人实验室——跑物理化学实验给 AI 造训练数据,目标包括更高温超导体。2025 年 9 月成立时估值 13 亿,2026 年 5 月按 75 亿估值募至少 5 亿美元(ex-a16z 合伙人 Anjney Midha 的 AMP 领投)——八个月不到估值 6 倍,还从 Meta/OpenAI/DeepMind 挖走了 20 多个研究员。注意 Periodic 的路线修正了纯软件 RSI 的一个软肋:它把飞轮建在物理实验数据上,绕开"合成数据近亲繁殖"的坟场。
六、怎么测:三个 benchmark,一个共同结论
METR 的 Time Horizon 是这个领域最重要的单一曲线:模型能以 50% 成功率完成的任务时长(按人类耗时计)。截至 2026 年 5 月 8 日的页面,2026 年的前沿模型全部在列,最新的 Claude Mythos Preview (early) 测出 50% 时间地平线 ≥16 小时(95% 置信区间 8.5-55 小时)。但 METR 自己公开承认:16 小时以上的测量在当前任务套件下不可靠——228 个任务里只有 5 个估计时长 ≥16 小时。换句话说,最强模型已经顶穿了现有测量方法的天花板,而"数天到数周级的 AI 研发任务"——RSI 红线所在的区间——恰好落在测不准的地方。
RE-Bench(METR)是唯一有严格人类基线的 AI 研发评测:7 个开放式 ML 研究工程环境,61 位人类专家 71 次 8 小时尝试打底。它揭示的结构至今没变:2 小时预算下最佳 AI 得分是人类专家的 4 倍,32 小时预算下人类反超到 AI 的 2 倍——AI 赢在快速试错,输在长程积累。这就是 time horizon 曲线为什么是关键:它测的正是那条正在缩短的护城河。
最接近"AI 训练 AI"的新基准是 PostTrainBench(2026 年 3 月,ICML 2026):给 agent 一张 H100、10 小时,完全自主地把 base 模型 post-train 成 instruct 模型,可以上网、跑实验、自己策划数据。结果两面读:最佳 agent(Opus 4.6 + Claude Code)平均得分 23.2%,对照官方 instruction-tuned 模型的 51.1%——总体还差得远;但针对性场景已经反超:GPT-5.1 Codex Max 给 Gemma-3-4B 做的函数调用后训练在 BFCL 上拿 89%,官方模型只有 67%。窄域反超、全域落后,这七个字就是 2026 年年中"AI 自动化 AI 训练"的全部真相。
七、红线:安全政策里的 RSI 长什么样
RSI 是唯一被所有头部实验室写进安全框架当独立风险域的能力(好吧,几乎所有——xAI 的框架无理由地把 automated AI R&D 整个排除了)。Anthropic RSP 的定义最量化:AI R&D-4 = 能完全自动化一名 Anthropic 入门级远程研究员的工作;AI R&D-5 = 导致有效算力扩展速率剧烈加速,量化为一年内约 1000 倍的规模扩张。DeepMind 的 Frontier Safety Framework 设了两级 ML R&D 关键能力等级:加速级(已被用于让 AI 进展显著超过历史速率)和自动化级(能以可比成本完全自动化 Google 任何一个 AI 研究团队)——DeepMind 也是 12 家发布安全框架的公司里唯一覆盖全部四个建议风险域的。
框架有了,成色如何?SaferAI 用 65 条加权标准给 12 家公司的安全框架打分:最高 Anthropic 34%,最低 Cohere 8%,中位数 18%。更扎心的一条:针对失控/自我改进类风险,全部 12 家公司给出的"缓解措施"本质上都只是开放研究方向,不是可执行的措施;Anthropic 自己承认针对高级 AI R&D 能力的保证流程还不存在,只承诺未来开发。翻译一下:红线画了,检测红线的尺子有了,但越线之后该干什么,没有一家知道。学界的回应是把测量往真实世界推:GovAI 2026 年 3 月的论文提出 14 项指标追踪 AI 研发自动化的实际程度——AI R&D 资本开支占比、研究员时间分配、AI subversion 事件计数——从"模型能不能"转向"世界正在多快被改变"。
八、会爆炸吗:把争论压缩成三个数字
先看预测追踪。AI 2027——那份把 RSI 时间线具体到月份的著名报告——现在有社区 tracker 逐条对账:31 条核心预测 16 条确认,现实进展速度约为预测节奏的 70%。方向对、速度慢:编码 agent 创造真实价值、AI 公司聚焦 AI-for-AI-research 这些定性预测全中;RE-Bench 达到 1.3 分(顶级人类专家水平)这条被标为 Behind,tracker 直接说"过于激进";AI 研发进度乘数 1.5 倍(2026 年初)标为 On Track,2 倍(2026 年底)标为 Emerging。连报告作者自己的信念都在震荡:superhuman coder 的预测中位数从 2027(2025 年 4 月)推迟到 2029 底/2032 初(2026 年 1 月),又在 2026 年 4 月集体提前 1.5 年——理由是 Opus 4.6 和 METR 翻倍周期从 5.5 个月缩到 4 个月。预测者跟着曲线追涨杀跌,这大概是"没人真知道"的最好证据。
再看理论。"软件性智能爆炸"能不能成立,最干净的表述是一个经济学参数:AI 研究生产函数里,算力和认知劳动的替代弹性 σ。σ>1(可替代):无限复制的 AI 研究员能补上算力缺口,爆炸可行;σ<1(互补):再多 AI 研究员也会被实验算力卡死,循环熄火(fizzle)。目前唯一的实证尝试给出了两个互相打架的估计:基线模型 σ=2.583(支持爆炸),frontier experiments 模型 σ=-0.103(强互补,不支持)——数据只有 4 家实验室 27 个公司-年观测,作者自己都说慎读。一线从业者的直觉大多站互补这边:Interconnects 的 Nathan Lambert 判断 AI 2027 式快速起飞"极不可能",进展会是持续改进而非可见加速。
最后看田野调查。2025 年 8-9 月对 25 位前沿研究者(DeepMind、OpenAI、Anthropic、Meta、Berkeley、Princeton、Stanford)的访谈研究给出了这个领域最诚实的集体快照:20 人把"自动化 AI 研究"列为最严重、最紧迫的 AI 风险之一;讨论约束时被提最多的是算力(16 份里 11 份),其次是数据(5 份);乐观派和怀疑派共享同一个区分——AI 的研究执行能力和研究构思能力不是一回事,且普遍预期后者更难。这个区分和 1,250 篇综述的结论完美对上:研究执行是可验证任务(代码能跑、benchmark 有分),正在被大规模自动化;研究方向设定是不可验证任务的典型代表,也是自主研究循环系统性失败、人类仍然留守的位置。
九、收个尾
把六十年的哲学题按 2026 年年中的证据重写一遍,大概是这样:RSI 已经真实存在,但只存在于评估器管得住的地方。代码和数学因为有便宜可靠的验证器,自我改进已经工业化;研究执行正在被吞掉;研究品味——判断什么问题值得做——还看不到自动化的路径。爆炸与否压在两个没人有可靠答案的参数上:算力和智力到底是替代还是互补,以及验证不了的任务能不能被验证得了的任务包抄。行业用脚投的票是分裂的:安全团队把 RSI 写成头号红线,增长团队把它写进 2028 年排期,资本按后者定价。唯一确定的是测量的紧迫性:当最强模型的时间地平线顶穿 benchmark 的可测上限时,我们对"离红线还有多远"的答案,精度正在变差,而不是变好。
(方法说明:本文由 113 个并行研究 agent 完成资料收集,30 个来源、149 条候选论断中 25 条经三票对抗验证、23 条存活,正文所有关键数字均出自存活论断或带限定标注。主要来源:arXiv 2607.13104、2607.07663、2505.22954、2506.10943、2603.08640、2411.15114、2603.03338、2603.03992,metr.org,sakana.ai,Nature s41586-026-10265-5,anthropic.com RSP,TechCrunch、Forbes、Fortune,ai2027-tracker.com,interconnects.ai。)
评论