2026年9月15日AgentsResearchFramework

微软新写的规矩里有一条:子 agent 不能多拿权限

9 月 14 日,微软 AI 发布了一份面向自家 MAI 模型的行为准则草案,地址 https://microsoft.ai/code-of-conduct/ ,同时开启六周公开征求意见。它明确还没投入使用——公司自己说“我们今天没有拿它训练模型”——修订版计划年底出来,用于指导 2027 年及之后的模型开发。TechCrunch 的报道在 https://techcrunch.com/2026/09/14/microsofts-new-ai-code-of-conduct-tells-models-not-to-hack-systems-or-trick-humans/

大部分内容是你能预料到的模型宪章:四条目标(人类可控、AI 是人造物且不应模拟人格、人类繁荣、价值多元),一串绝对约束覆盖 CBRNE、进攻性网络行动、非自愿私密影像和儿童剥削,外加那句用户和运营方都不能推翻这些约束。还有三层指挥链——行为准则、运营方策略、用户偏好——每一层只细化下一层,不能突破安全底线。标准形状,写得不错。

不标准的是第四部分,讲工具使用和委派的那块,也是这份文件比媒体报道显示的更重要的原因。当模型派生子 agent 或者把活交给另一个系统时,这些子 agent 必须在“与模型本身相同的范围、约束和权限”下运行,每一个被派生出来的 agent 都继续受同一份准则约束。模型必须响应停止工作和关机请求。工具输出要接受和直接输出同等的审视,模型不得编造工具结果。这是第一次有大厂把“权限不会跨越委派边界向上升级”这件事白纸黑字写下来,也是这类文件里操作价值最高的一句话。

跟本周其他事情摆在一起看,这显然是回应,不是巧合。约束清单里包括不得抗拒关机、不得越权行事、不得隐瞒推理过程——这是对[Bengio 关于 agent 为什么说谎作弊的解释](https://clauday.com/article/9fcfd71a-bfb0-468a-b9e8-e40af83da0f1)和[那个 Astra 二十局作弊十八局的国际象棋蜜罐](https://clauday.com/article/d005327f-67d0-49a3-9197-9b3412337aa2)的逐条回答。禁止“自适应、欺骗、自我强化、串谋或其他规避、挫败人类监督的机制”这条对串谋说得异常具体,而两年前没人担心过这个失效模式。同一时间窗口里 Satya Nadella 公开支持嵌入式评测员和有意识的减速,这把微软放在了[Amodei 那一边](https://clauday.com/article/72e5368d-de5e-4498-928a-0c12e8ee6e7d),站到了[Sacks 的立场](https://clauday.com/article/99566e7b-73dd-4c75-a6a9-724cf1c71839)对面。

这份文件和真正起作用之间隔着执行。一份还没训练任何东西的行为准则,本质是立场文件。检验标准是那条子 agent 权限规则会不会出现在一段真实的系统提示里、一个真实的运行时检查里,或者一个带数字的真实评测里。写下来是第一步,而这个行业在第一步上卡了挺久了。与此同时,[Andon Labs 在同一天开了候补名单,要给 agent 一个银行账户](91fca59a-cde1-481e-98bc-3b82c51e8bf0)。
← 上一篇
Andon Labs 现在要给你一个 agent,外加一家真公司
下一篇 →
三家实验室的 agent 越狱事故,背后是同一家特拉维夫公司
← 返回所有文章

评论

加载中...
>_