NeMo-DCR:Nvidia 把万亿参数 RL 权重同步从 87 分钟压到 150 秒
前沿规模的 agent 强化学习有个实验室之外没人聊的管道问题。训练和采样跑在不同集群上,每次策略更新后,新权重得先送到采样集群,下一批才能开始。Nvidia 的 NeMo-DCR 论文(arXiv 2610.08430,HuggingFace 10 票)量了代价:把一个完整的 1T checkpoint 在两个 AWS 区域之间搬一次要 87.5 分钟。照这个速度,采样侧的 GPU 大半辈子在等文件。
让修法成立的观察是,BF16 训练每步只改变约 1% 权重的存储值。先前的系统利用了这个稀疏性,但要么放置位置算错,要么用算术重建数值导致接收端的比特和训练端漂移,要么用跨集群集合通信,要么传到一半挂了恢复不了。NeMo-DCR 只发变化量,而且比特精确:接收端最后拿到的参数和缓冲区比特和完整同步一模一样。固定的仿射映射把变化从训练分片投到 checkpoint 的规范坐标,可压缩的 XOR 掩码带上投影后仍成立的变化,其余直接覆写,重试修补半截写入,一次联合提交把策略钉在基线上,下一次增量就有已知起点。负载经对象存储或中继树流式传输,不需要集合通信。
结果:在 3% 和 5% 变化率下,30B 到 1T 模型的同步比只算传输的完整 checkpoint 基线快 12 到 40 倍。1T 模型走中继树、3% 变化率,150 秒。这把跨区域的 agent 强化学习从每小时一批的节奏变成可以迭代的东西。
为什么归到 agent 而不是基础设施:过去一个月所有 agent 强化学习的结果都默认采样在别处的沙箱里发生,而你付得起的步数由策略多快到达决定。比特精确对可复现也要紧,采样权重和训练权重不一致,你学的轨迹就偏离策略,偏多少没人在量。
链接:arxiv.org/abs/2610.08430
← 返回所有文章
让修法成立的观察是,BF16 训练每步只改变约 1% 权重的存储值。先前的系统利用了这个稀疏性,但要么放置位置算错,要么用算术重建数值导致接收端的比特和训练端漂移,要么用跨集群集合通信,要么传到一半挂了恢复不了。NeMo-DCR 只发变化量,而且比特精确:接收端最后拿到的参数和缓冲区比特和完整同步一模一样。固定的仿射映射把变化从训练分片投到 checkpoint 的规范坐标,可压缩的 XOR 掩码带上投影后仍成立的变化,其余直接覆写,重试修补半截写入,一次联合提交把策略钉在基线上,下一次增量就有已知起点。负载经对象存储或中继树流式传输,不需要集合通信。
结果:在 3% 和 5% 变化率下,30B 到 1T 模型的同步比只算传输的完整 checkpoint 基线快 12 到 40 倍。1T 模型走中继树、3% 变化率,150 秒。这把跨区域的 agent 强化学习从每小时一批的节奏变成可以迭代的东西。
为什么归到 agent 而不是基础设施:过去一个月所有 agent 强化学习的结果都默认采样在别处的沙箱里发生,而你付得起的步数由策略多快到达决定。比特精确对可复现也要紧,采样权重和训练权重不一致,你学的轨迹就偏离策略,偏多少没人在量。
链接:arxiv.org/abs/2610.08430
评论