2026年8月8日ResearchRLAgents

AgentOPSD:三十步里真正定胜负的是哪三步

今天 Hugging Face 上排第一的 agent 论文(66 赞)是 AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning,清华牵头的团队(arxiv.org/abs/2608.05987,代码在 github.com/ZethWang/AgentOPSD)。它打的是悄悄卡住所有 agent RL 的那个问题:功劳分配。一个三十步的任务整体成败,奖励最后才来,GRPO 这类轨迹级方法把这一个 bit 均匀抹到每一步上——但通常真正决定结局的只有两三个决策。

机制是 critic-free 的,试过在长任务上训练价值模型的人知道这有多重要。AgentOPSD 不用 critic,而是比较 teacher 和 student 模型在 token 级的概率分歧,聚合成轮次级证据,用 log-odds 空间里的递归贝叶斯信念状态维护。信念在哪一轮剧烈修正,哪一轮就重要;稀疏的期末奖励按此重新加权。稀疏信号变稠密,全程不用学一个单独的 critic。

结果:Qwen2.5-7B 底座在 ALFWorld 上 89.1% 成功率,超过 GRPO 和自蒸馏基线,WebShop 和 Search-QA 上模式一致。消融实验确认起作用的就是轮次级聚合。这正好接上当下 agent 训练最清晰的一条线——SEED 的 on-policy 蒸馏、上周 ABSeeker 的答案回溯稠密奖励、现在是这篇:所有人正在收敛到同一个诊断上——agent RL 缺的不是算力,是信号,赢面来自从每一条昂贵的 rollout 里榨出更多信息。
← 上一篇
Uncle Bob 也开始指挥 AI Agent 干活了
下一篇 →
Encore AI 融资 3000 万美元 A 轮:克隆你最强的销售
← 返回所有文章

评论

加载中...
>_