Qwen 故意提前把 Qwen4 架构发了
阿里 Qwen 团队开源了 Qwen3.8-Flash-Next 的权重,这名字低估了它是什么:第一个基于 Qwen4 架构的公开模型,比整个家族提前几个月发出来,就为了让生态先做好准备。他们自己说的理由就是这么直白——架构上的改动应该在 Qwen4 到来之前先交到社区手里,这样运行时、量化方案、应用在第一天就能跑。
有意思的在架构上。125B 参数的 MoE,每个 token 只激活 6B,配了一张 51B 的 n-gram 嵌入表和一个 4B 的多 token 预测模块,注意力换成了 Gated DeltaNet 加 Qwen Sparse Attention 的新组合。原生 262K 上下文,原生多模态。这个比例很反常——嵌入表几乎有主干的一半大——它透露了 Qwen 认为效率前沿在哪:把参数花在类似记忆的查表上,把每个 token 的计算压到最小。
对一个激活 6B 的模型来说,这些数字是真吓人:DeepSWE 1.1 拿 58.7,SWE-bench Pro 拿 62.5,AndroidWorld 拿 84.5。一年前这些是旗舰模型的分数。生产版 Qwen3.8-Flash 在他们 API 上会卖到每百万输入 token 0.16 刀——延续了本周的主题:能干 agent 编码活儿的模型,价格地板在一层层往下砸穿。
这步棋本身值得停一拍。把下一代架构在这一代还不存在的时候就开源出来,是闭源实验室在结构上做不到的事,它把整个社区变成了免费的集成团队。等 Qwen4 落地,每个推理栈都已经能跑它了。开源权重的打法从我们发模型,进化成了我们发路线图。权重在 huggingface.co/Qwen/Qwen3.8-Flash-Next。
← 返回所有文章
有意思的在架构上。125B 参数的 MoE,每个 token 只激活 6B,配了一张 51B 的 n-gram 嵌入表和一个 4B 的多 token 预测模块,注意力换成了 Gated DeltaNet 加 Qwen Sparse Attention 的新组合。原生 262K 上下文,原生多模态。这个比例很反常——嵌入表几乎有主干的一半大——它透露了 Qwen 认为效率前沿在哪:把参数花在类似记忆的查表上,把每个 token 的计算压到最小。
对一个激活 6B 的模型来说,这些数字是真吓人:DeepSWE 1.1 拿 58.7,SWE-bench Pro 拿 62.5,AndroidWorld 拿 84.5。一年前这些是旗舰模型的分数。生产版 Qwen3.8-Flash 在他们 API 上会卖到每百万输入 token 0.16 刀——延续了本周的主题:能干 agent 编码活儿的模型,价格地板在一层层往下砸穿。
这步棋本身值得停一拍。把下一代架构在这一代还不存在的时候就开源出来,是闭源实验室在结构上做不到的事,它把整个社区变成了免费的集成团队。等 Qwen4 落地,每个推理栈都已经能跑它了。开源权重的打法从我们发模型,进化成了我们发路线图。权重在 huggingface.co/Qwen/Qwen3.8-Flash-Next。
评论