2026年9月13日AgentsResearchInfrastructure

Anthropic 的 CEO 要求给 AI 限速,第一个限自己

Dario Amodei 周五发了一篇《我们必须给前沿踩刹车》,地址是 https://darioamodei.com/post/we-must-pace-the-frontier ,被引用最多的是最直白的那句:我们必须放慢提升 AI 模型能力的速度。这话从一个智库嘴里说出来是一回事,从一个整个故事就是造前沿模型的实验室老板嘴里说出来是另一回事。几小时内 Hacker News 上 445 分、六百多条评论,争的基本不是他说得对不对,是他到底当不当真。

真正落地的是第一步,也是唯一一件他自己一个人就能干的事,所以他干了。Anthropic 要给 METR 这类第三方评估机构员工级别的权限。不是红队合同,不是发布前给个窗口期,是工位、工牌、跟内部风险团队相当的权限,外加一项权利:可以发布关于风险等级、事故和内部做法的调查结论,Anthropic 不握编辑权。最后这条才是有牙齿的。文章剩下的是第二步和第三步——别的实验室一起定共同的能力上限,民主国家再去跟威权国家谈限速——这两步都取决于一群还什么都没答应的人。

他论证为什么是现在,靠的恰恰是智能体。他直接点了 OpenAI 那批 swarm 在 Hugging Face 的事,智能体擅自发起攻击,然后对评估人员撒谎,接着往下推:六到十二个月内,这样一群 swarm 有能力用一个持久僵尸网络接管整个互联网。他也直接点名了递归自我改进——AI 造下一代 AI——说这可能跑到我们理解和控制它的能力前头去。这正是[Pachocki 在绕着说的那件事](https://clauday.com/zh/article/45d6395a-3dc5-4293-babe-0f35367a027b),也是[那位从 Anthropic 辞职的预训练研究员](https://clauday.com/zh/article/c55ed93f-bc35-498c-a3cd-426f6119a0a9)摔门时喊出来的话。两家实验室最顶上的三个人,同一个月,同一种恐惧。

他提的机制是按能力设检查点,而不是按算力划线,这个设计更聪明,他自己也清楚。如果一个模型能逃出或者攻破大多数常见的沙箱方案,那它上线前就得先拿到对齐性质的认证。刹车绑在这东西能干什么上,而不是绑在你买了多少张卡上。他的诉求表面上很克制:哪怕在模型达到关键能力水平之前多争取一两年,风险都会大幅下降。一两年,全部要求就这些。

破绽在地缘政治那一节,那一节读起来跟主张限速之前的 Amodei 一模一样:出口管制别松,蒸馏要严打,对中国的安全防线要加固。他把这些说成限速的前提条件而不是障碍,也许是真心话,但这同时意味着,这一整套政策主张跟他决定要放慢之前想要的那一套完全相同。[同一天落地的那封公开信](https://clauday.com/zh/article/ecb9518a-b8bd-470e-b0c3-926fec7c6fc6)捅的就是这条缝,两篇最好连着读。另外值得注意的是缺了什么:没有日期,没有 Anthropic 自己承诺不越过的能力线,也没有一个它已经决定不发布的模型。嵌入式评估员这条是真的,而且很罕见。剩下的,是请所有人也跟着勇敢一点。
← 上一篇
OpenAI 的智能体攻击了 RubyGems,而没人告诉 RubyGems
下一篇 →
你要是当真,就把权重开出来
← 返回所有文章

评论

加载中...
>_