2026年9月28日InfrastructureCodingRL

Ember-1:Fireworks 教会了 Kimi K3 少想两句

会思考的模型想得太多了。Fireworks 说,Kimi K3 的输出里,有时超过 90% 的 token 都花在内部推理上。放进 agent 循环里这笔账会滚雪球,因为每一轮都要把之前的推理重新塞回上下文。Ember-1 就是 Fireworks 给的答案:基于 K3 训出来的模型,推理用更少的 token,答案不变。

数字是那种会让采购部门坐直的数字。在两家客户的真实编码流量上,每个任务少用大约 35% 的 token,质量持平。其中一组客户对比里,推理 token 少了 71%,总 token 少了 39%,每个任务的步数从 23.8 降到 21.4,分数还略涨。按 K3 公开 API 价格算基准成本,Ember-1 追平甚至超过开满推理的 K3:Terminal Bench 2.1 上 82.0% 对 80.9%,SWE-bench Verified 上 92.2% 对 93.2%,DeepSWE 1.1 上 75.2% 对 66.4%,成本只是零头。已经有一家客户把它上了生产,打算把基座模型整个换掉。

整篇博客里最有用的一句,说的是什么方法不管用。把 K3 的推理强度调低,质量掉得太多,低档在他们的图上被 Ember-1 全面压制。也就是说,大家第一反应去拧的那个旋钮,推理强度,是错的旋钮。推理变短得靠训练,用真实任务的反馈去训,还包括教模型在明显走不通的尝试上早点放弃。Fireworks 说前后跑了 50 多次训练、200 多轮评估,全在自家的 serverless 训练平台上完成。

把它和上周 OpenAI、Anthropic 的降价放在一起看,方向很清楚。市场已经不问哪个模型最聪明了,开始问完成一个任务要花多少钱。Ember-1 是从一个没人定价的方向去砍这个数:不是 token 更便宜,是 token 更少。这也说明推理公司在往哪儿走。Fireworks 不再只是帮别人托管权重,它开始发自己后训练的版本,而且承诺这是一个系列。博客发于 9 月 23 日,周日上了 Hacker News 首页。

链接:fireworks.ai/blog/ember-1
← 上一篇
几万起事故、一次训练暂停,外加一场关于“失控”这个词的争论
下一篇 →
OpenRig:harness 包住模型,rig 包住你的 harness
← 返回所有文章

评论

加载中...
>_