2026年8月14日InfrastructureAgentsAPI

每秒 750 个 token,agent 的定位就变了

OpenAI 和 Cerebras 把 GPT-5.6 Sol 跑在晶圆级芯片上,输出速度到了每秒 750 个 token。Artificial Analysis 测出来是 Fable 5 的 11 倍,是 Opus 4.8 开 Fast 模式的 5 倍。名字叫 GPT-5.6 Sol Ultrafast,现在在 OpenAI API 上限量预览。

原理又老又物理。Cerebras 在单块晶圆级芯片上塞了 44GB SRAM,模型权重直接留在片上,不用在存储层级之间来回搬。大模型推理本质上是个披着算力外衣的搬运问题,权重不动,瓶颈就消失了。GPU 在这个尺寸上做不到,所以别家的数字长不成这样。

最有说服力的演示是 Humanity's Last Exam。2500 道博士级题目,11 小时答完,Claude Fable 5 要 78 小时以上。在广义经济价值任务上他们测到 5.6 倍加速,质量不掉。OpenAI 一位研究员的说法最实在:我还没来得及切换注意力,它就跑完了。

这句话就是全部故事,而且重点不是方便。过去两年做出来的每一个 agent 产品,底层假设都是「跑一个 agent,你点了启动然后离开,过会儿回来看」。异步队列、通知、进度看板、驾驶舱、整个监督层。这些基础设施之所以存在,就因为 agent 慢。到了每秒 750 token,agent 不再是后台任务,而是一个同步工具,意味着它可以站在生产事故和安全响应的关键路径上——那种场景里,等八分钟是不可接受的。现在正在被大量建造的工具,有相当一部分是在给延迟打补丁,而延迟正在被解决掉。

细节在 cerebras.ai/blog,价格还没公布。
← 上一篇
Gemini 3.7 Flash:三周迭代,价格砍半
下一篇 →
Anthropic 把三个 Claude 放进同一个仓库,它们打起来了
← 返回所有文章

评论

加载中...
>_