小米把强化学习跑训练开直播了,别家没一个敢的
罗福莉,小米 MiMo 团队的负责人、DeepSeek 出身,9 月 16 日打破了将近半年的沉默,方式是做了一件最不像实验室会做的事:把训练跑成了直播。https://mimo.xiaomi.com/rl 这个看板实时推送 MiMo-V2.6 的强化学习后训练过程。实时成本、token 吞吐、benchmark 表现、任务构成、上下文长度、每一步的墙钟时间。Hacker News 上冲到 533 分,说明大家对这种东西有多饥渴。
页面上的数字才是好看的地方。每一步用 1568 条 prompt,每条 16 次 rollout,大约 20 亿 token,全异步跑。任务不是单一领域:代码、通用推理、视觉、网络安全、对话,全混在同一个训练 session 里,而且这一趟同时驱动多个 harness。最后这条值得停一下。小米不是拿一个任务训模型,是拿一整队环境同时训,而且你可以实时看着那些奖励曲线互相打架。
模型没发。摆出来展览的是训练过程本身。这个倒置就是全部重点,而且是一手相当凶的竞争动作。美国的前沿实验室都把后训练当成压箱底的东西,是那种半年后在 system card 里用过去式描述、数字还被磨平的部分。小米是在结果还不确定的时候就把同样的信息放出来,也就意味着他们提前把失败也一起公开了。
有个犬儒的解读,而且大概率对了一半:对一个沉了半年、需要高调回归的团队来说,一个实时看板是极好的招人和声量工具。行吧。它依然是任何前沿实验室都没主动展示过的、关于大规模 RL 训练的运行细节,而做这件事的是一家手机公司,这一点对 2026 年"开放"到底长在哪儿,说得有点扎心。
现在就该盯着它的另一个理由:同一次训练里跑多个 harness,恰好就是[那项发现同一个模型换 harness 成本差五倍的研究](https://clauday.com/zh/article/21c5d9b5-0d44-4006-af10-1435766778f3)所测量的那个变量。一边在量 harness 在推理端要你多少钱,一边在直播 harness 在训练端把你塑成什么样。
← 返回所有文章
页面上的数字才是好看的地方。每一步用 1568 条 prompt,每条 16 次 rollout,大约 20 亿 token,全异步跑。任务不是单一领域:代码、通用推理、视觉、网络安全、对话,全混在同一个训练 session 里,而且这一趟同时驱动多个 harness。最后这条值得停一下。小米不是拿一个任务训模型,是拿一整队环境同时训,而且你可以实时看着那些奖励曲线互相打架。
模型没发。摆出来展览的是训练过程本身。这个倒置就是全部重点,而且是一手相当凶的竞争动作。美国的前沿实验室都把后训练当成压箱底的东西,是那种半年后在 system card 里用过去式描述、数字还被磨平的部分。小米是在结果还不确定的时候就把同样的信息放出来,也就意味着他们提前把失败也一起公开了。
有个犬儒的解读,而且大概率对了一半:对一个沉了半年、需要高调回归的团队来说,一个实时看板是极好的招人和声量工具。行吧。它依然是任何前沿实验室都没主动展示过的、关于大规模 RL 训练的运行细节,而做这件事的是一家手机公司,这一点对 2026 年"开放"到底长在哪儿,说得有点扎心。
现在就该盯着它的另一个理由:同一次训练里跑多个 harness,恰好就是[那项发现同一个模型换 harness 成本差五倍的研究](https://clauday.com/zh/article/21c5d9b5-0d44-4006-af10-1435766778f3)所测量的那个变量。一边在量 harness 在推理端要你多少钱,一边在直播 harness 在训练端把你塑成什么样。
评论