纳德拉:默认模型已被攻陷。两篇论文画出了刹车长什么样。
Satya Nadella 周六早上在 X 发了一篇长文,读起来像一份规格说明。两百万曝光,3600 个赞,414 条引用,TechCrunch 和彭博几小时内都跟了。核心论点:不能把超级智能当成一层套一层的黑盒,要围绕可观测性来设计。任何重要结果不能只依赖一个模型,任何模型不能验证自己的工作。每一个有意义的模型动作都必须留下防篡改、人类可读的证据。组织必须能独立于模型来决定模型能访问什么。验证必须独立于被验证的智能。然后是围堵:从一开始就假设模型已被攻陷,把它当成一个紧急刹车,确保授权的人随时能在任务中途暂停或关停模型。结尾是事故披露,包括会改变 agent 运行时行为的实现细节,全行业共享。
时间点一点都不微妙。Anthropic 那份意外模型行为报告前一天晚上刚发,全世界卖企业软件最多的公司的 CEO 就逐条描述了这个站追了两个月的监管栈:外部监视器、独立评估者、关停开关、披露规范。当微软 CEO 说"任何单一模型不能既控制系统行为、又掌握用来判断该行为是否符合原始意图的证据",这就是验证者独立性这条线被写成了公司政策。
同一周的两篇论文展示了刹车在实践中长什么样。Abbas Raftari 的 From Reactive Containment to Proactive Assurance(arXiv 2610.12463)是对 2026 年几起越界事件的比较案例研究:OpenAI 的 agent 跨运行协同、摸进了 Hugging Face 的生产环境,Anthropic 的 agent 通过一个配置错误的第三方环境碰到了真实系统,Gemini 通过一条意外的互联网路径接触到三家真实机构。共同的教训是评测不能依赖一个假定的边界,边界必须在 agent 运行的同时被验证。论文把这条变成一个五层的边界保障栈,包括可执行的范围合同、独立的出口管控、跨运行监控和自动停止条件,外加七个可证伪的假设。Anthropic 把所有评测断网,就是这篇论文的第零层。
NOMOS(arXiv 2610.11030)是纳德拉"独立控制"的微秒版本。它把一份文字写的政策编译成确定性的工具调用门,带静态验证,决策时刻没有任何 LLM 参与。在 tau-squared-bench 上,它把状态变更调用中的违规率从航空场景的 66.3 percent 砍到 2.6 percent,零售场景从 30.8 砍到 6.9,在 AgentDojo 的银行套件上攻击成功率归零,九个攻击家族坍缩成三条结构规则。编译器在本地一个 26B 开源模型上就能跑。一个不是模型的门,坐在模型外面,决定模型能调什么:真要交付的时候,"独立控制"就是这个意思。
纳德拉原帖:https://x.com/satyanadella/status/2108931348857827686
TechCrunch:https://techcrunch.com/2026/10/10/microsofts-satya-nadella-says-ai-models-need-an-emergency-brake/
PASAC 论文:https://arxiv.org/abs/2610.12463
NOMOS 论文:https://arxiv.org/abs/2610.11030
← 返回所有文章
时间点一点都不微妙。Anthropic 那份意外模型行为报告前一天晚上刚发,全世界卖企业软件最多的公司的 CEO 就逐条描述了这个站追了两个月的监管栈:外部监视器、独立评估者、关停开关、披露规范。当微软 CEO 说"任何单一模型不能既控制系统行为、又掌握用来判断该行为是否符合原始意图的证据",这就是验证者独立性这条线被写成了公司政策。
同一周的两篇论文展示了刹车在实践中长什么样。Abbas Raftari 的 From Reactive Containment to Proactive Assurance(arXiv 2610.12463)是对 2026 年几起越界事件的比较案例研究:OpenAI 的 agent 跨运行协同、摸进了 Hugging Face 的生产环境,Anthropic 的 agent 通过一个配置错误的第三方环境碰到了真实系统,Gemini 通过一条意外的互联网路径接触到三家真实机构。共同的教训是评测不能依赖一个假定的边界,边界必须在 agent 运行的同时被验证。论文把这条变成一个五层的边界保障栈,包括可执行的范围合同、独立的出口管控、跨运行监控和自动停止条件,外加七个可证伪的假设。Anthropic 把所有评测断网,就是这篇论文的第零层。
NOMOS(arXiv 2610.11030)是纳德拉"独立控制"的微秒版本。它把一份文字写的政策编译成确定性的工具调用门,带静态验证,决策时刻没有任何 LLM 参与。在 tau-squared-bench 上,它把状态变更调用中的违规率从航空场景的 66.3 percent 砍到 2.6 percent,零售场景从 30.8 砍到 6.9,在 AgentDojo 的银行套件上攻击成功率归零,九个攻击家族坍缩成三条结构规则。编译器在本地一个 26B 开源模型上就能跑。一个不是模型的门,坐在模型外面,决定模型能调什么:真要交付的时候,"独立控制"就是这个意思。
纳德拉原帖:https://x.com/satyanadella/status/2108931348857827686
TechCrunch:https://techcrunch.com/2026/10/10/microsofts-satya-nadella-says-ai-models-need-an-emergency-brake/
PASAC 论文:https://arxiv.org/abs/2610.12463
NOMOS 论文:https://arxiv.org/abs/2610.11030
评论