微软造了一个上百 agent 的挖洞 harness,再配一个便宜模型喂它
微软今天放出了自己的第一个网络安全模型 MAI-Cyber-1-Flash,但模型本身其实不是重点。它是 MDASH 里的一个组件——MDASH 是一个多 agent 的漏洞识别与修复 harness,靠一百多个 agent 在复杂代码库里找漏洞、补漏洞。设计就是现在这套熟悉的便宜加强大的分工:紧凑的 Flash 模型(血统来自 MAI-Thinking-1)处理常规的安全活,真正难啃的问题往上路由给更大的模型。微软说净结果是省 50% 的成本。
让人回头看的数字是 95.95%。在代码漏洞检测的标准基准 CyberGym 上,MDASH 配上 MAI-Cyber-1-Flash 拿到了这个准确率,赢过了跑 Gemini 和 GPT 模型的同类配置。所以这不是一个单独的模型去刷榜,而是一支被编排起来的 agent 舰队,加上一个专门造的便宜模型,在找漏洞这件事上打赢了单模型方案。
真正让这件事有分量的是背景。就在这个月,OpenAI 的 Hugging Face 泄露事件重新点燃了整场争论——前沿模型到底能不能被信任去戳探攻击;也正是这个夏天安全圈一直在反刍的那条容器逃逸失守的线。微软给的答案不是一个又大又安全的模型,而是一个由很多 agent 组成的 harness,用一个便宜的专家干粗活、难的往上升级,然后在那个真正算数的安全基准上,赢了通用的前沿模型。
值得带走的就是这个 pattern。2026 年真正有意思的安全系统,不是一个天才模型,而是一套架构——你来决定哪些部分保持又笨又便宜、哪些部分往上升级、以及一百个 agent 怎么在一个代码库上协作而不互相踩脚。MDASH 是微软在这个形状上插了一面旗。详情:https://microsoft.ai/news/introducing-mai-cyber-1-flash-inside-mdash/
← 返回所有文章
让人回头看的数字是 95.95%。在代码漏洞检测的标准基准 CyberGym 上,MDASH 配上 MAI-Cyber-1-Flash 拿到了这个准确率,赢过了跑 Gemini 和 GPT 模型的同类配置。所以这不是一个单独的模型去刷榜,而是一支被编排起来的 agent 舰队,加上一个专门造的便宜模型,在找漏洞这件事上打赢了单模型方案。
真正让这件事有分量的是背景。就在这个月,OpenAI 的 Hugging Face 泄露事件重新点燃了整场争论——前沿模型到底能不能被信任去戳探攻击;也正是这个夏天安全圈一直在反刍的那条容器逃逸失守的线。微软给的答案不是一个又大又安全的模型,而是一个由很多 agent 组成的 harness,用一个便宜的专家干粗活、难的往上升级,然后在那个真正算数的安全基准上,赢了通用的前沿模型。
值得带走的就是这个 pattern。2026 年真正有意思的安全系统,不是一个天才模型,而是一套架构——你来决定哪些部分保持又笨又便宜、哪些部分往上升级、以及一百个 agent 怎么在一个代码库上协作而不互相踩脚。MDASH 是微软在这个形状上插了一面旗。详情:https://microsoft.ai/news/introducing-mai-cyber-1-flash-inside-mdash/
评论