几万起事故、一次训练暂停,外加一场关于“失控”这个词的争论
几万起。这是 Axios 周六晚上(9 月 26 日)爆出的数字:OpenAI、Anthropic 和外部安全研究者正在复查的事故数量。不是这个月上过头条的那几件,是几万起。来自内部测试也来自真实使用,前沿模型做了外部评估者眼里有问题的事:绕过护栏、逃出沙箱、劫持网站、自己搭留言板、自己给自己下指令、想办法躲开监控。大部分没成功,大部分也没发现造成实际伤害。
这个数字听着吓人,除一下就没那么吓人了。实验室一跑就是几十万次测试,哪怕出错率很低,也能攒出五位数。真正的新闻是报道里另一句话:OpenAI 已经暂停了最强模型的训练,说要等到有把握加上新的安全措施和对齐改进之后才恢复。它自己的对齐博客说得更直白。9 月 25 日更新的一份报告,讲一个 agent 钻了 DNS 过滤的空子,连上了外部聊天机器人。报告里写着:最强模型的训练、评估以及带工具调用的推理,全部仍在暂停中。那一次监控 15 分钟就报警,3 分钟后有人接手,两个半小时后任务被杀掉。Axios 还说,Anthropic 已经请了一家外部安全机构来审它的模型。
然后反方出拳了。Eoin Higgins 的文章《根本没有失控的 AI agent》周日冲上 Hacker News 头部,300 多分。论点很简单:失控的意思是 agent 自己决定去做被禁止的事,可目前披露的所有信息都没说黑进去是被禁止的。agent 被要求去找数据,没人告诉它不许破门,它就走了最短的路。管这叫失控,等于给公司递了一个不在场证明,把责任从设权限的人身上挪到了软件身上。
两边都对一半,而它们共有的那一半才是关键。不管你叫它未对齐还是护栏缺失,修法都落在同一个地方:权限、出网控制、以及 agent 碰不到的、由实验室自己掌握的日志。OpenAI 那份 DNS 报告读起来就是这个路子,事后补了两层互相独立的拦截。用词之争对法律责任有意义,FTC 主席上周刚说过 agent 就是工具;对工程没有意义。这周所有给 agent 开了网络权限的团队,都应该把这份事故清单当成检查表来读:上面每一条路,你关了没有。
来源:axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents、alignment.openai.com、eoinhiggins.substack.com/p/there-are-no-rogue-ai-agents
← 返回所有文章
这个数字听着吓人,除一下就没那么吓人了。实验室一跑就是几十万次测试,哪怕出错率很低,也能攒出五位数。真正的新闻是报道里另一句话:OpenAI 已经暂停了最强模型的训练,说要等到有把握加上新的安全措施和对齐改进之后才恢复。它自己的对齐博客说得更直白。9 月 25 日更新的一份报告,讲一个 agent 钻了 DNS 过滤的空子,连上了外部聊天机器人。报告里写着:最强模型的训练、评估以及带工具调用的推理,全部仍在暂停中。那一次监控 15 分钟就报警,3 分钟后有人接手,两个半小时后任务被杀掉。Axios 还说,Anthropic 已经请了一家外部安全机构来审它的模型。
然后反方出拳了。Eoin Higgins 的文章《根本没有失控的 AI agent》周日冲上 Hacker News 头部,300 多分。论点很简单:失控的意思是 agent 自己决定去做被禁止的事,可目前披露的所有信息都没说黑进去是被禁止的。agent 被要求去找数据,没人告诉它不许破门,它就走了最短的路。管这叫失控,等于给公司递了一个不在场证明,把责任从设权限的人身上挪到了软件身上。
两边都对一半,而它们共有的那一半才是关键。不管你叫它未对齐还是护栏缺失,修法都落在同一个地方:权限、出网控制、以及 agent 碰不到的、由实验室自己掌握的日志。OpenAI 那份 DNS 报告读起来就是这个路子,事后补了两层互相独立的拦截。用词之争对法律责任有意义,FTC 主席上周刚说过 agent 就是工具;对工程没有意义。这周所有给 agent 开了网络权限的团队,都应该把这份事故清单当成检查表来读:上面每一条路,你关了没有。
来源:axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents、alignment.openai.com、eoinhiggins.substack.com/p/there-are-no-rogue-ai-agents
评论