Qwen 把 2.4 万亿参数的模型开源了,这事没人干过
等到了。Qwen3.8-2.4T-A95B 带权重上了 Hugging Face,这是第一个开放出来的 Qwen-Max 级别模型。2.4 万亿总参、950 亿激活,92 层,Gated DeltaNet 和门控注意力混着用,每层 512 个专家、10 个路由加 1 个共享。原生上下文 262144,可扩到 1010000。同时还放了一个 27B 稠密版,给没有机房的人用。
分数不是走过场。SWE-bench Pro 67.7%,GPQA Diamond 92.6%,OneMillion-Bench 专家分 52.5。这是前沿区间的成绩,开放许可,今晚就能下。FP8 权重已经在了,unsloth 的 GGUF 量化也出了,vLLM、SGLang、TokenSpeed 开箱即用。
有两个设计选择值得盯一眼。thinking 模式关不掉——每次回复都从推理开始,而且有个 preserve_thinking 开关,能把推理上下文跨消息带过去,而不是每轮扔掉重来。对 agent 循环来说这是实打实的行为变化:模型在步骤之间保住了自己的草稿纸。另外 reasoning_effort 直接暴露成 xhigh、medium、low,任务需要深度的时候才付那份钱。
排行榜之外真正要紧的是这一层。今年每一家谈开放的西方实验室,交出来的都是 20B 到 30B 这个量级的东西,然后管它叫送给社区的礼物。阿里把自己真正的旗舰放上了桌。不管你怎么看动机,实际效果是:现在你能在自己硬件上跑的最强模型是中国的,而且差距不小。
权重在 https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
← 返回所有文章
分数不是走过场。SWE-bench Pro 67.7%,GPQA Diamond 92.6%,OneMillion-Bench 专家分 52.5。这是前沿区间的成绩,开放许可,今晚就能下。FP8 权重已经在了,unsloth 的 GGUF 量化也出了,vLLM、SGLang、TokenSpeed 开箱即用。
有两个设计选择值得盯一眼。thinking 模式关不掉——每次回复都从推理开始,而且有个 preserve_thinking 开关,能把推理上下文跨消息带过去,而不是每轮扔掉重来。对 agent 循环来说这是实打实的行为变化:模型在步骤之间保住了自己的草稿纸。另外 reasoning_effort 直接暴露成 xhigh、medium、low,任务需要深度的时候才付那份钱。
排行榜之外真正要紧的是这一层。今年每一家谈开放的西方实验室,交出来的都是 20B 到 30B 这个量级的东西,然后管它叫送给社区的礼物。阿里把自己真正的旗舰放上了桌。不管你怎么看动机,实际效果是:现在你能在自己硬件上跑的最强模型是中国的,而且差距不小。
权重在 https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
评论