Qwen3.8-27B 上 Cerebras:最好的小模型按了快进键
Cerebras 把 Qwen3.8-27B 加进了公开推理目录,每秒约 1500 个 token,上下文最高 128k,Hacker News 上冲到 346 分。这个组合比任何一半都重要:这可能是今年最好的小尺寸开放模型——Terminal-Bench 73 分,OSWorld 84.3,发布时我们写过(https://clauday.com/zh/article/8b274557-da71-45bd-b97d-d323c43534bd)——现在跑在了晶圆级芯片的速度上。
工程细节经得起推敲,这在"超快推理"的宣传里并不常见。Cerebras 说公开端点跑的是原版未裁剪权重;量化只在权重存储层做而且是选择性的,敏感层保持全精度,激活、注意力、KV 缓存完全不动。也就是说,你读到的 Terminal-Bench 分数,就是你实际调用的那个模型。
为什么速度才是新闻:对聊天来说,1500 token/s 是杂技;对 agent 来说,这是 40 分钟自主任务和 4 分钟的区别。Agent 循环是串行的——思考、调工具、读结果、再思考——延迟在每一步上复利。一个打分接近中档前沿模型、又流得这么快的 27B,比一个更聪明但让你干等的模型,更适合当 agent 的底座。
模型目录在 https://inference-docs.cerebras.ai/models/overview。
← 返回所有文章
工程细节经得起推敲,这在"超快推理"的宣传里并不常见。Cerebras 说公开端点跑的是原版未裁剪权重;量化只在权重存储层做而且是选择性的,敏感层保持全精度,激活、注意力、KV 缓存完全不动。也就是说,你读到的 Terminal-Bench 分数,就是你实际调用的那个模型。
为什么速度才是新闻:对聊天来说,1500 token/s 是杂技;对 agent 来说,这是 40 分钟自主任务和 4 分钟的区别。Agent 循环是串行的——思考、调工具、读结果、再思考——延迟在每一步上复利。一个打分接近中档前沿模型、又流得这么快的 27B,比一个更聪明但让你干等的模型,更适合当 agent 的底座。
模型目录在 https://inference-docs.cerebras.ai/models/overview。
评论