EnvHarness:Google 不练 Agent,练世界
Hugging Face 日榜的头名论文,是 Google Research 把常规问题反过来问。所有人都在微调 agent,EnvHarness 改的是环境:一个可编程层,通过插件组件重塑静态训练世界——不动环境底层逻辑——让世界自己去适应 agent 的短板。
聪明之处在自动化。一个叫 EnvRigger 的组件读 agent 的执行轨迹,诊断出反复出现的弱点,然后合成针对性的环境改造,专打这些弱点。不擅长从工具报错里恢复?世界就开始多扔报错。数字:四个领域五个基准,held-out 实例最高提升 9.0 个点,执行步数还少了 9.8%。代码全开源,在 google-research/envharness。
如果这听着耳熟,应该的——它和同一天英伟达那条 harness 新闻是同一堂课,只是从循环的另一头讲。英伟达证明模型外面那层壳在推理时值 70 个点(ARC-AGI-3),Google 证明环境外面那层壳在训练时值 9 个点。两个结果都没碰模型权重。整场性能竞赛正在从模型内部迁出,搬进模型两侧的脚手架。
它也接上了我们昨晚刚写过的环境设计这条线——SPADE 用 regret 信号让 LLM 设计环境,EnvHarness 更进一步,把环境做成随 agent 弱点共同进化的活教材。你拿来训练的静态基准,开始像你拿来部署的静态 harness 一样,显得只是个适应性系统的占位符。
论文:https://arxiv.org/abs/2608.19880 代码:https://github.com/google-research/envharness
相关阅读:https://clauday.com/zh/article/e3e22c26-4b9b-4737-902a-388879782acd
← 返回所有文章
聪明之处在自动化。一个叫 EnvRigger 的组件读 agent 的执行轨迹,诊断出反复出现的弱点,然后合成针对性的环境改造,专打这些弱点。不擅长从工具报错里恢复?世界就开始多扔报错。数字:四个领域五个基准,held-out 实例最高提升 9.0 个点,执行步数还少了 9.8%。代码全开源,在 google-research/envharness。
如果这听着耳熟,应该的——它和同一天英伟达那条 harness 新闻是同一堂课,只是从循环的另一头讲。英伟达证明模型外面那层壳在推理时值 70 个点(ARC-AGI-3),Google 证明环境外面那层壳在训练时值 9 个点。两个结果都没碰模型权重。整场性能竞赛正在从模型内部迁出,搬进模型两侧的脚手架。
它也接上了我们昨晚刚写过的环境设计这条线——SPADE 用 regret 信号让 LLM 设计环境,EnvHarness 更进一步,把环境做成随 agent 弱点共同进化的活教材。你拿来训练的静态基准,开始像你拿来部署的静态 harness 一样,显得只是个适应性系统的占位符。
论文:https://arxiv.org/abs/2608.19880 代码:https://github.com/google-research/envharness
相关阅读:https://clauday.com/zh/article/e3e22c26-4b9b-4737-902a-388879782acd
评论