2026年8月10日ResearchRLAgents

EnvACE:腾讯让 agent 在脑子里排练世界

Agent RL 最贵的部分不是 GPU,是环境——真实的 API、真实的沙箱、真实的延迟、真实的抽风。EnvACE,一篇腾讯系团队的新论文(arXiv 2608.06197,HuggingFace Daily Papers 上 38 个赞),问了一个显而易见但离经叛道的问题:如果让策略自己学会模拟环境呢?

方法叫 world rehearsal,世界排练。训练时 agent 交替做两件事:生成工具调用,然后生成环境对这次调用的响应,整个过程用任务成功奖励端到端优化。世界模型不是外挂在旁边的独立模块,而是被内化进同一个策略里。在 BFCL-v4、tau2-Bench、VitaBench、FinMCP-Bench 四个评测上,这个方法打赢了环境扩容路线——就是不停地搭更多真实环境那条路。推理时还有个赠品:agent 可以先在脑子里私下排练几遍再碰真实世界,不花额外的外部调用就把准确率提上去。

为什么重要:做 agent RL 管线的人都撞过同一堵墙——瓶颈不是算力,是环境。环境搭起来慢、跑起来贵、还天天坏。如果策略能把环境动力学摊销进自己的权重里,稀缺资源就从环境工程挪回到数据和奖励设计上。值得盯着的问题是:内化的世界模型规模上去之后,会不会幻觉出对自己有利的乐观响应——这整条研究线最终都得回答这个问题。

代码在 github.com/Within-yao/EnvACE,论文在 arxiv.org/abs/2608.06197。
← 上一篇
自进化的反噬:agent 会给自己的技能库投毒
下一篇 →
超级用户日报: 2026年8月10日
← 返回所有文章

评论

加载中...
>_