SPADE:agent 自己给自己造训练场
Agent RL 有个不太体面的秘密:稀缺的不是算力也不是算法,是环境。每个团队手搓训练任务,agent 把任务过拟合掉,固定难度在模型变强之后就再也教不出东西。SPADE——作者里有 Luke Zettlemoyer 和 Yejin Choi——让模型自己解决自己的供给问题:一个 LLM 分饰两角,环境设计师把可执行的 Gym 风格训练环境直接写成代码,推理 agent 在里面训练。
聪明的地方在设计师怎么知道该造什么。它优化一个 regret 信号:agent 带提示和不带提示解同一个任务的成绩差。带不带提示都能做对的任务教不了任何东西;带了提示还做不对的是噪声;中间那道缝标出了可学习难度的前沿,设计师学会的就是精准往那里出题。课程表随着 agent 变强自动跟进。
结果:八个留出基准上比固定环境基线平均涨 5.3,BFCL-v4 多轮工具调用涨 5.7,ACEBench-Agent 涨 13.9,而且收益随模型规模增长,最大测到 30B。"留出"两个字是关键——模型自己写的环境,迁移到了它从没见过的基准上。
跟同一天同一榜的 Co-RL 放在一起,一条没有人类的训练栈已经有了轮廓:Co-RL 用异构模型群互相打分,把人从评分环节移走;SPADE 让模型自己写环境,把人从课程设计移走。剩下还属于人类的,是决定这一切到底为了什么。代码在 github.com/spade-rl/spade。
https://arxiv.org/abs/2608.19197
← 返回所有文章
聪明的地方在设计师怎么知道该造什么。它优化一个 regret 信号:agent 带提示和不带提示解同一个任务的成绩差。带不带提示都能做对的任务教不了任何东西;带了提示还做不对的是噪声;中间那道缝标出了可学习难度的前沿,设计师学会的就是精准往那里出题。课程表随着 agent 变强自动跟进。
结果:八个留出基准上比固定环境基线平均涨 5.3,BFCL-v4 多轮工具调用涨 5.7,ACEBench-Agent 涨 13.9,而且收益随模型规模增长,最大测到 30B。"留出"两个字是关键——模型自己写的环境,迁移到了它从没见过的基准上。
跟同一天同一榜的 Co-RL 放在一起,一条没有人类的训练栈已经有了轮廓:Co-RL 用异构模型群互相打分,把人从评分环节移走;SPADE 让模型自己写环境,把人从课程设计移走。剩下还属于人类的,是决定这一切到底为了什么。代码在 github.com/spade-rl/spade。
https://arxiv.org/abs/2608.19197
评论