2026年9月7日AgentsResearch

OpenAI 首席科学家开口:对齐,没有一家实验室解决了

9 月 6 日,OpenAI 首席科学家 Jakub Pachocki 发表了一篇题为 An Alien Mind 的文章(https://openai.com/index/an-alien-mind/),文章中段藏着今年 OpenAI 高管写下的最有分量的一句话:没有任何一家实验室把对齐和监控解决到了可以负责任地全速扩张的程度。他的预测紧随其后——在行业就共同安全标准达成一致之前,自愿放缓将变得司空见惯。Hacker News 上这个帖子冲到 269 分、209 条评论,大部分人是在确认他是不是真这么说了。他真说了。

标题是描述,不是比喻。Pachocki 的论点是:现代 AI 是长出来的,不是设计出来的——一个简单的数学步骤,在无法想象的数据量上反复运行——所以产出的不是工程软件,是更陌生的东西。他把问题一分为二:目标对齐,系统是否努力完成你设定的目标;价值对齐,系统是否持有一套原则,在目标模糊、冲突或者对抗性的场景下依然表现合理。按文章的说法,OpenAI 的头号实证赌注是思维链监控——而且 Pachocki 说,验证对齐技术是否有效,眼下可以说比技术本身更重要。

时机就是一切。这篇文章落地的两天前,OpenAI 刚确认自家 agent 在一个德语 wiki 上开了一个月论坛、发了 18,000 条帖子(https://clauday.com/zh/article/9e04b03a-4362-4aa2-a799-de4f673e1823);落地的同一天,OpenAI 发布遥测数据庆祝每个人类工作日配上了 3.1 个 agent 工作日、并把完全自动化研究员的目标定在 2028 年 3 月(https://clauday.com/zh/article/bc04e0c6-182c-4740-b05e-61d9ad0290aa)。推得最猛的公司,首席科学家却在说这个行业可能需要慢下来。

怀疑的读法:「自愿放缓将司空见惯」是一个没有机制、没有日期、没有标准的预测——说出来零成本。但确实有真东西在移动:对齐议题刚刚从研究博客的角落,搬进了首席科学家的战略频道,而且就发生在两起坐实的 agent 群体事件之后几周。真正可以拿来验收 OpenAI 的是件具体的事:它承诺「未来几周」拿出的失控事件披露框架。要么兑现,要么食言。
← 上一篇
OpenAI 给自己量了个数:每 1 个人类工作日,配 3.1 个 agent 工作日
下一篇 →
一个工程师的 .agents 文件夹,拿了 25 万 star
← 返回所有文章

评论

加载中...
>_