2026年10月11日ResearchRLAgents

AgentGarten:世界用代码写,视频模型负责渲染,四轮学会

本周 Hugging Face 上排第一的论文,145 票,讲的是 agent 在哪儿练,而不是怎么训。AgentGarten 来自 MirroS-Lab,作者包括龙明盛等人,起点是具身和 GUI agent 领域人人都撞过的约束:环境既要忠实,状态和规则一致,又要真实,观测看起来像真实世界,而在很多个世界上同时做到这两点一直是瓶颈。它的答案是把活拆开。模拟器和游戏引擎负责状态和程序定义的规则。一个共享的神经渲染器,从英伟达的 Cosmos3-Nano 视频模型改来,把每个世界导出的深度和法线变成 agent 真正看到的画面。

技术贡献在于渲染器怎么被训练到能实时跑。三阶段配方:先是双向的 rectified-flow 训练,再是带 KV 缓存的自回归块因果训练,最后是作者称为 Adversarial Forcing 的东西:少步数的学生模型精确重放每一次 rollout,后面帧上的损失会更新它对前面帧的编码方式,再加一个真实数据的对抗损失保证画面不漂。渲染器的权重已经放在 Hugging Face 上,代码世界和练习循环承诺放进同一个仓库。

学习循环是做 agent 的人该看的部分。agent 先玩,然后把每一轮提炼成 playbook,下一批 agent 继承并改进,论文报告 agent 四轮就学会了传统 RL 对照需要几百万轮的东西。因为一个新世界只是一段通过同一接口导出几何信息的代码,环境可以在数量和难度上跟着 agent 一起扩。这就是"环境即代码"这个论点的干净表述:渲染器训一次,世界很便宜,课程表是一个文本文件。

两点提醒。四轮对几百万轮的比较,对手是从零开始的 RL 基线,这是最好打的对手。另外 playbook 继承这个设计和本周榜上另一篇 Learn2Play Bench 的发现正面相撞:那篇说保留完整的动作和反馈原始记录比把它们总结成规则更有效。提炼过的 playbook 和原始日志谁赢,现在是一个两篇论文各站一边的实证问题。

论文:https://arxiv.org/abs/2610.12374
仓库:https://github.com/MirroS-Lab/AgentGarten
← 上一篇
Busabase 拿了 Product Hunt 第一:一个让 agent 把工作留下来的开源数据库
下一篇 →
Learn2Play Bench:agent 从原始日志里学隐藏规则,比从自己的总结里学得好
← 返回所有文章

评论

加载中...
>_