Miles v0.1:把大厂通常不外传的后训练全家桶开源了
RadixArk 放出了 Miles v0.1,自称生产级后训练,名字无聊得很,但它是今天 Hugging Face 榜上最不无聊的东西。过去半年所有 agent RL 故事底下的那层管道,这次不是写成论文描述,是整套搬出来。
盒子里有什么:rollout 引擎跑在 SGLang 上,训练后端 Megatron-LM 和 PyTorch FSDP 都支持,还有好几种权重同步协议,让你自己挑拓扑而不是被迫接受一种。除了普通 RL,它覆盖 LoRA RL、on-policy 蒸馏、SFT、异步 agentic RL,还顺带支持扩散模型。他们摆在最前面的设计原则是:组件必须可验证、干净、可改。这句话是冲着「研究代码硬扛生产」这个大家都在默默吞下的问题去的。
真正秀肌肉的是那个 demo:在 GLM-5.2 这个 744B-A40B 的模型上跑完全异步的 agentic RL,任务是终端里的编码,硬件是 64 张 NVIDIA GB300。异步 agentic RL 是最难的那一档:一次 rollout 要几分钟、返回顺序还乱,训练循环得在半个集群还在敲键盘的时候继续学。多数开源框架在这个规模上是默默做不到的,这个把它跑给你看。
值得注意的是当下是谁在把后训练层当成开源基础设施发。放权重的最抢眼,但决定你的 agent 下个月会不会更强的,是那个把轨迹变回梯度的循环(https://clauday.com/zh/article/4816c05d-a6ea-414d-b4b7-adf2fa3991f4)。今天 NeoHorse 发的是这个循环的产物,Miles 发的是它的机器。仓库和技术报告:https://arxiv.org/abs/2609.08368
← 返回所有文章
盒子里有什么:rollout 引擎跑在 SGLang 上,训练后端 Megatron-LM 和 PyTorch FSDP 都支持,还有好几种权重同步协议,让你自己挑拓扑而不是被迫接受一种。除了普通 RL,它覆盖 LoRA RL、on-policy 蒸馏、SFT、异步 agentic RL,还顺带支持扩散模型。他们摆在最前面的设计原则是:组件必须可验证、干净、可改。这句话是冲着「研究代码硬扛生产」这个大家都在默默吞下的问题去的。
真正秀肌肉的是那个 demo:在 GLM-5.2 这个 744B-A40B 的模型上跑完全异步的 agentic RL,任务是终端里的编码,硬件是 64 张 NVIDIA GB300。异步 agentic RL 是最难的那一档:一次 rollout 要几分钟、返回顺序还乱,训练循环得在半个集群还在敲键盘的时候继续学。多数开源框架在这个规模上是默默做不到的,这个把它跑给你看。
值得注意的是当下是谁在把后训练层当成开源基础设施发。放权重的最抢眼,但决定你的 agent 下个月会不会更强的,是那个把轨迹变回梯度的循环(https://clauday.com/zh/article/4816c05d-a6ea-414d-b4b7-adf2fa3991f4)。今天 NeoHorse 发的是这个循环的产物,Miles 发的是它的机器。仓库和技术报告:https://arxiv.org/abs/2609.08368
评论