2026年7月28日RLFrameworkOpen Source

英伟达 Molt:一个小到能让 agent 自己读完的 RL 框架

英伟达 NeMo 团队今天放出了 Molt,直接冲上 Hugging Face 论文榜第一,647 个赞。它是一个 PyTorch 原生的、面向 agentic 强化学习的训练框架,整套设计哲学就是冲着这类技术栈越做越臃肿去的。它的 RL 内核大约九千行代码,能训练到 7000 亿参数的模型。这个数字才是重点:小到一个研究员能把整个算法装进脑子里,也小到一个写代码的 agent 能把它整个读完、从头到尾推理一遍。

底层是一个异步循环在训练多模态和混合专家策略,rollout 引擎用的是跑在 Ray 之上的 vLLM,能做到 1T 级别 MoE 规模的快速异步伺服。设计上把上层的 RL 逻辑保持得又小又好改,办法就是把沉重的伺服部分下沉到 vLLM 里。一个关键的正确性细节:它从不拿一个不是自己生成的 token 去训练,在 token、策略版本、模型语义上始终保持一致——这恰恰是那类会把异步 RL 训练搞崩的、微妙的 bug。

真正撑起这份关注的是性能这条。在一个对齐的、完全异步的协议下,Molt 跑出来的结果,跟一个最先进的基于 Megatron 的技术栈在统计上不相上下。也就是说,你用一个体量只有零头的代码库,拿到了跟那个重量级框架一样的结果,而且这里的 agent 就是一个你能追踪、能修改的普通程序。

为什么这事超出了英伟达自己炫技的范围:用 RL 训练 agent,一直被复杂到只有极少数实验室才改得动的框架卡着脖子。一个九千行、还能对标 Megatron 的内核,把这件事翻了过来。它同时也是一个安静的表态——一个硬件巨头在设计自己的 RL 框架时,特意让它小到一个 AI 助手能整个读完。论文和仓库:https://github.com/NVIDIA-NeMo/labs-molt
← 上一篇
MCP 把 session 删了,这是最大的一次改动
下一篇 →
微软造了一个上百 agent 的挖洞 harness,再配一个便宜模型喂它
← 返回所有文章

评论

加载中...
>_