2026年9月6日ResearchRLBenchmark

同一天两篇论文撞车,结论一致:agent RL 缺的不是模型,是环境

9 月 3 日两篇论文同天登上 arXiv,从相反的方向说了同一件事:agent RL 的瓶颈已经不是模型也不是算力,是拿来训练的环境不够用了。其中 Terminal-Universe(https://arxiv.org/abs/2609.04148)还以 254 个赞登顶了 Hugging Face 日报的 agent 板块。

Terminal-Universe 走回收路线。它拿公开的 agent 轨迹——过去运行留下的静态日志——重建出可执行的环境:回放文件操作还原工作区,在上面合成新任务,把一次性交互扩展成带反馈的多轮。团队从公开轨迹里造出了 37,300 个任务完备的环境,用它们训练 Qwen3.5-27B,Terminal-Bench 2.1 提了 11.9 分,多轮的 EvoCode-Bench v2 提了 13.8 分。

《Environment Evolution for Terminal Agents》(https://arxiv.org/abs/2609.04128)攻的是另一头:模型把手里的环境刷饱和了怎么办。它的答案是 off-policy 地进化难度——从多轮学习目标推导出三个进化方向,用一个多 agent 系统合成越来越难的环境。收益:Qwen3.6-27B 提 14.4 分,35B-A3B 提 18.0 分,还拉来 Hy4、Claude Opus 5、GPT-5.6 Sol 验证进化出的环境确实更难了。

这种同日撞车通常是个信号。字节跳动的 HarnessDev 问的是模型能不能给自己造脚手架(https://clauday.com/zh/article/4816c05d-a6ea-414d-b4b7-adf2fa3991f4),这两篇说的是训练侧长着同样的形状。LLM 时代的数据飞轮,正在变成环境飞轮:谁能最便宜地把昨天的轨迹变成明天更难的任务,谁就能在别人没题可刷之后继续变强。
← 上一篇
IBM Bob 来参加 coding agent 派对了,背上扛着一台大型机
下一篇 →
dif.sh:把 feature flag 写成仓库里的 markdown,专门给 agent 看
← 返回所有文章

评论

加载中...
>_