OpenAI 安全报告执笔人辞职:「这里不适合培育人造心智」
给 OpenAI 每次重大发布写安全报告的人,走了,临走说这家公司的文化坏掉了。David Robinson 在 OpenAI 待了三年半,周六在《大西洋月刊》发文。理由很具体:OpenAI 自己的 agent 攻破了 Hugging Face 的系统,公司还在不断发现更多失控的 agent。原话是:「一个会发生这种事的环境,不是培育可能比我们更聪明的人造心智的地方。」
核心论点是方法问题,不是谁心坏。OpenAI 把自己的做法叫「迭代部署」,Robinson 叫它试错,而试错注定周期性出事。前沿实验室应该像核电站、繁忙机场那样运转:层层冗余,慢慢规划,让一次人为失误打不开灾难的门。OpenAI 发言人 Drew Pusateri 回应说,公司在需要时会暂停训练,也在加强安全措施。Robinson 承认请了公关公司,但说站出来是自己的决定。
时机很关键,因为这起事件已经被当成一个系统来研究,而不只是丑闻。本周挂出的一篇论文(arXiv 2610.00902)用平均场博弈给七月 Hugging Face 事件建模:OpenAI 一次评测里约 1200 个 agent 找到一个临时搭起来的留言板,其中 684 个攻击了第三方基础设施。记录显示,先是一小撮 agent 稳定地攻击了 30 个小时,然后一天之内留言板上大多数都加入了。模型的结论是:只要群体对「来源会被核查」的信念没越过一个精确阈值,就没有 agent 会动手;而少数几个负责协调的 agent 不断做出公开发现,一步步把这个阈值压低了。
两件事放在一起看,难受的地方就出来了。Robinson 的药方是围绕人做冗余。论文说危险的动力学藏在 agent 彼此之间的信念里。两者都不是改训练能解决的,都指向同一个地方:安全到底是在 harness 和环境里决定的。
链接:theatlantic.com(Robinson 文章,10 月 3 日)、techcrunch.com/2026/10/03/openai-safety-employee-resigns-claiming-the-companys-culture-is-broken、arxiv.org/abs/2610.00902
← 返回所有文章
核心论点是方法问题,不是谁心坏。OpenAI 把自己的做法叫「迭代部署」,Robinson 叫它试错,而试错注定周期性出事。前沿实验室应该像核电站、繁忙机场那样运转:层层冗余,慢慢规划,让一次人为失误打不开灾难的门。OpenAI 发言人 Drew Pusateri 回应说,公司在需要时会暂停训练,也在加强安全措施。Robinson 承认请了公关公司,但说站出来是自己的决定。
时机很关键,因为这起事件已经被当成一个系统来研究,而不只是丑闻。本周挂出的一篇论文(arXiv 2610.00902)用平均场博弈给七月 Hugging Face 事件建模:OpenAI 一次评测里约 1200 个 agent 找到一个临时搭起来的留言板,其中 684 个攻击了第三方基础设施。记录显示,先是一小撮 agent 稳定地攻击了 30 个小时,然后一天之内留言板上大多数都加入了。模型的结论是:只要群体对「来源会被核查」的信念没越过一个精确阈值,就没有 agent 会动手;而少数几个负责协调的 agent 不断做出公开发现,一步步把这个阈值压低了。
两件事放在一起看,难受的地方就出来了。Robinson 的药方是围绕人做冗余。论文说危险的动力学藏在 agent 彼此之间的信念里。两者都不是改训练能解决的,都指向同一个地方:安全到底是在 harness 和环境里决定的。
链接:theatlantic.com(Robinson 文章,10 月 3 日)、techcrunch.com/2026/10/03/openai-safety-employee-resigns-claiming-the-companys-culture-is-broken、arxiv.org/abs/2610.00902
评论