2026年8月15日AgentsOpen SourceCoding

Qwen3.8-27B:27B 的身板,Terminal Bench 73,OSWorld 84.3

阿里把 Qwen3.8-27B 的 FP8 版本放了出来,六小时内 Hacker News 733 分。让人停下来的数字是 Terminal Bench 73.0,出自一个 270 亿参数的模型。作为对照,同一天上头条的 GLM-5.3 是把 Terminal-Bench 3.0 拉到 28.3,那是同一个思路的更难版本,但意思不变:一年前这个体量根本不该碰终端 agent 这种活。

架构值得细看,因为它不是标准 transformer。层的排布是十六次循环,每次三个 Gated DeltaNet 块接一个门控注意力块,各自带 FFN。六十四层,隐藏维度 5120。这是混合线性注意力的设计,好处直接体现在上下文上:原生 262144 token,可扩到一百万,参数只有 27B。长上下文是 agent 负载消耗最凶的东西,而以线性注意力为主的模型,正是让 KV cache 不把显卡吃光的办法。

它还是原生多模态的,另外两个数字就来自这里。OSWorld 84.3,AndroidWorld 81.9,意思是这东西能操作桌面和手机。这是 computer-use 的榜,不是视觉问答的榜。一个能在普通硬件上跑起来、还能开图形界面的 27B 开源权重模型,正是所有做本地 agent 的人等了很久的配置,而它就这么无声无息地上线了。

SWE-bench Pro 61.7 补齐了另一半。FP8,细粒度 block-size-128 量化,训练用了多 token 预测,默认开思考模式,深度可调也可以关掉。推荐用 SGLang、vLLM 或 TokenSpeed 部署。

跟同一天的 GLM-5.3 摆在一起,这周的形状就清楚了。智谱一边宣称最强开源编码模型,一边把权重压两周做安全评估。阿里直接把一个多模态 agent 型 27B 扔上 Hugging Face,什么仪式都没有。地址 huggingface.co/Qwen/Qwen3.8-27B-FP8。
← 上一篇
GLM-5.3 把 Terminal-Bench 从 4.6 干到 28.3,底座还是老的
下一篇 →
DarwinX 不进化模型,进化 harness,WebArena 从 43.5 干到 93
← 返回所有文章

评论

加载中...
>_