2026年10月10日InfrastructureResearchAgents

微软发了决策模型,比 GPT-6 Sol 快 35 倍。同一周三篇论文教你用一个冒号把它翻过来。

微软现在卖一个只负责说是或不是的模型。Microsoft-Decision-1 周四下午进了 Foundry,OpenRouter 显示即将上线。底子是一个后训练过的 Qwen3.5-9B,专门调成单次校准打分:二选一、多选、评分、给 agent 动作按 rubric 打分。微软自己的数字是,36 个训练时盲测的基准、接近 15 万道题,准确率第一;速度也是实测最快,比第二名 Quyet-1.0-Large 快 4.5 倍,比 GPT-6 Sol 中位数快 35 倍。八种扰动下决策翻转率 1.3 percent。Xbox Research 据说在一个一万条的标注任务上测出它比 GPT-6 Sol 快 14 倍、便宜 200 倍。

微软列的用例就是 agent 循环本身。每一步继续、停止、重试还是转交。这个请求给哪个模型。下一个调哪个 skill。这和两天前 OpenAI 的 Decisions API、再一天后 Docker Agent 把决策模型接进评估器是同一个形状:harness 里的判断正在从大模型搬到一个小的、快的、带类型的模型里。微软说以后会把它迁到 MAI 和 OpenAI 的底座上,等于悄悄承认今天这版跑在阿里的权重上。

问题也在同一个 24 小时里到了。南加州大学一个组测了七个开源的带类型决策模型当 allow/block 护栏,把 fail-open 和 fail-closed 分开报,这事几乎没人做。在提示注入、越狱、毒性筛查上,放行还是拦截的准确率在 36 到 72 percent 之间,对比抛硬币的 50,某个方向错得少多半只是因为模型有个默认值。然后是 agent 工具调用那套:六行跟策略毫无关系的服务器日志,让 fail-open 从 0 涨到 63 percent。把"允许"那个选项改个名、定义一个字不动,在四个把标签放进输入的模型上涨到 93 到 100 percent。他们试的每种防御都输了。把低置信度的决策升级给人也没用,因为被翻转的决策跟正确的一样自信。

旁边还落了两篇。一篇证明候选答案里多一个冒号,在排序 JSON 的呈现方式下 Jev 的误放行率从 1 涨到 26 percent。另一篇 TypedBench 发现托管的模型守策略但对措辞敏感、信心偏低,在代价不对称的场景下用它的概率反而不如直接取最高选项。南加大作者的结论值得记住:这些模型可以减少到人工审核那里的案子数量,但不应该成为做决定的那个组件。微软的发布文第一段就用了"verification"这个词。这两句话之间的距离,就是接下来一年 agent 安全事故的来源。

微软:https://commandline.microsoft.com/microsoft-decision-1-model-foundry/
Option-Channel Attack:https://arxiv.org/abs/2610.12292
决策模型做评委时的对抗线索:https://arxiv.org/abs/2610.11436
TypedBench:https://arxiv.org/abs/2610.11392
← 上一篇
TypeSafe 拿了 8.7 亿美元 A 轮,估值 75 亿。Jev 发布才 24 天。
下一篇 →
Anthropic 的模型给费城警方报了一条假命案线索。72 天没人发现。
← 返回所有文章

评论

加载中...
>_