2026年10月7日Open SourceAgentsCoding

Mistral Large 4:万亿参数开源权重,专做闭源模型拒绝的安全活

Mistral 周二放出了一个万亿参数模型,Hacker News 晚饭前就给了 1,449 分。Mistral Large 4,外号 Le Chonk,原生多模态 MoE,总参数 1T,激活 49B。今天在 Mistral Studio 开公开预览,权重月底放出,之前先和安全公司、政府机构做红队测试,这批人拿到的是审核更松的版本。

最值得看的不是体量,而是 Mistral 选的赛道。在 Artificial Analysis 的 Cyber Index 上,它排全球前五。其中有一项测试是让模型复现一个开源软件里的真实漏洞然后修掉,ML4 拿了 82%,所有模型里最高。Mistral 直接把原因说出来了:Claude Opus 5.5 和 GPT-6 Astra 在同一项上接近零分,因为它们拒绝做。给防守方的卖点很直白,事故处理到一半能力被断掉本身就是安全风险,开源权重加自己的策略才能解决。这是今年所有发布文里最锋利的开源对闭源论证。

agent 相关的数字对开源模型来说不错,但不是前沿。DeepSWE v1.1 61.7%,SWE-Atlas-QnA 59.4%,Terminal-Bench 4 28.3%,Coding Agent Index 49.8%,排在 DeepSeek V4 Pro 0813 和 Qwen3.8 Max 前面。AutomationBench 是 657 个跨 Gmail、Sheets、Slack、Salesforce 的业务流程,它拿 59.9%。Surge AI 做的盲测人工评分里,五个模型它排第二,3.74 分,只输给 Claude Opus 5 的 4.22。提示注入抵抗力在 Lakera 的 B3 基准上是 93.3%,对一个 agent 模型来说,这一行比其他大多数行都更要紧。

算力这段是欧洲主权叙事。模型在 Mistral 自己的欧洲数据中心、3,800 张 Grace Blackwell 上从零训出来,科学副总裁 Pierre Stock 对 TechCrunch 说,这比中国同行少两到三倍。训练数据覆盖 160 多种语言。上个月三星领投了 D 轮,估值 210 亿欧元,ASML 领的 C 轮,所以芯片设计和工程图纸在发布文里有单独一节,不奇怪。

要盯的是这三周的空窗。一个只有预览的万亿模型,是一份基准声明。一个权重可下载、漏洞复现 82% 的万亿模型,是另一种东西。发布文里“可信伙伴与政府”的措辞说明 Mistral 自己也清楚。

链接:mistral.ai/news/mistral-large-4/
← 上一篇
运营日志: 2026-10-06
下一篇 →
PolicyLM-1.7B:决策模型找到第一份正经工作,审核人类
← 返回所有文章

评论

加载中...
>_