Reflection 发布 Beam:501B 参数,外加一张不遮丑的成绩单
Reflection AI 融了大约 47 亿美元,直到这周一都没交出过一个前沿模型。现在交了。Beam 是一个 5010 亿参数的稀疏 MoE 模型,每个 token 激活 230 亿参数,纯文本,100 万 token 上下文,主打 coding 和 agent 任务。权重、技术报告和 model card 承诺本月晚些时候放出,眼下能拿到的是早期体验申请和一篇很长的博客。
最值得看的是怎么练出来的。预训练用了 23.8 万亿 token,在 6144 块 Nvidia GB300 上不到四周跑完。然后是强化学习:1.05 万块 GB300 跑了四周,超过 1 亿条 rollout,训练加评分一共起了大约 13 亿个沙盒,背后是 100 万个 coding、agent 和 STEM 环境。Reflection 说分数随 RL 算力一路涨,没看到平台期。给个参照,博客里提到 Thinking Machines 的 Inkling 用了 3000 万条 rollout。
成绩单在发布文里算少见的坦白。Terminal-Bench 2.1 上 Beam 是 80.1,和 GLM 5.2 的 81.0 差不多,落后 Kimi K3 的 88.3 和 DeepSeek V4.1 Flash 的 90.6。DeepSWE 上是 44.4,K3 是 68.0,DeepSeek 是 74.2。凡是和 Inkling 都报了分的项目,Beam 都赢,比如 SWE-Bench Pro v1 是 65.5 对 54.3。Reflection 自己在文里写明:最强的中国开源模型在绝对能力上仍然领先。
所以卖点落在效率上。激活参数 230 亿,GLM 5.2 大约 400 亿,Reflection 说推理类评测分数相当,推理算力只要三分之一到四分之一。这些是自家按 FLOPs 估算的数字,外部还没人验证过。TechCrunch 提到,这家公司今年夏天已经从 SpaceX 和 Nebius 锁定了价值 70 多亿美元、一直到 2029 年的 GB300 算力。
两个判断。西方最强的开源权重模型,现在公开把自己摆在追赶中国实验室的位置上,放在两年前这像个段子。另外配方正在变成公式:中等体量的稀疏模型,加一场覆盖百万个 agent 环境的超大规模 RL。钱主要花在环境上,而不是参数量上。
链接:reflection.ai/blog/introducing-beam
← 返回所有文章
最值得看的是怎么练出来的。预训练用了 23.8 万亿 token,在 6144 块 Nvidia GB300 上不到四周跑完。然后是强化学习:1.05 万块 GB300 跑了四周,超过 1 亿条 rollout,训练加评分一共起了大约 13 亿个沙盒,背后是 100 万个 coding、agent 和 STEM 环境。Reflection 说分数随 RL 算力一路涨,没看到平台期。给个参照,博客里提到 Thinking Machines 的 Inkling 用了 3000 万条 rollout。
成绩单在发布文里算少见的坦白。Terminal-Bench 2.1 上 Beam 是 80.1,和 GLM 5.2 的 81.0 差不多,落后 Kimi K3 的 88.3 和 DeepSeek V4.1 Flash 的 90.6。DeepSWE 上是 44.4,K3 是 68.0,DeepSeek 是 74.2。凡是和 Inkling 都报了分的项目,Beam 都赢,比如 SWE-Bench Pro v1 是 65.5 对 54.3。Reflection 自己在文里写明:最强的中国开源模型在绝对能力上仍然领先。
所以卖点落在效率上。激活参数 230 亿,GLM 5.2 大约 400 亿,Reflection 说推理类评测分数相当,推理算力只要三分之一到四分之一。这些是自家按 FLOPs 估算的数字,外部还没人验证过。TechCrunch 提到,这家公司今年夏天已经从 SpaceX 和 Nebius 锁定了价值 70 多亿美元、一直到 2029 年的 GB300 算力。
两个判断。西方最强的开源权重模型,现在公开把自己摆在追赶中国实验室的位置上,放在两年前这像个段子。另外配方正在变成公式:中等体量的稀疏模型,加一场覆盖百万个 agent 环境的超大规模 RL。钱主要花在环境上,而不是参数量上。
链接:reflection.ai/blog/introducing-beam
评论