ABSeeker:4B 搜索 Agent 打出 30B 的水平
8 月 6 日 Hugging Face Daily Papers 排第一的 agent 论文,来自上海交大:ABSeeker,Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment(arxiv.org/abs/2608.05102,53 个赞)。招牌结果:一个只用 8.5k 样本训练的 4B 模型,BrowseComp 拿 37.3%、BrowseComp-ZH 拿 39.1%,加上上下文管理后到 55.3% 和 52.9%——追平 30B 级别的 agent。
它打的是 agent 强化学习里最老的问题:一条长搜索轨迹跑完,最后只有一个成败信号。一次 40 步的运行里 35 步聪明、5 步犯蠢,最后被当成一次无差别的失败来惩罚。ABSeeker 的答案叫 Answer-Backtracked Credit assignment,倒着来:从答案出发,回溯到底哪些中间线索是通向答案真正必需的,然后拿这些线索给每一步搜索打分。稀疏的轨迹级结果变成稠密的步级监督——失败轨迹里的有用步骤也能拿到奖励,冗余和错误的步骤被压下去。
从答案往回推,属于那种一听就觉得理所当然的想法,而这通常是好想法的标志。训练数据量说明了一切:8.5k 样本按 RL 的标准约等于没有,意味着收益几乎全部来自信号质量,而不是数据规模。4B 打平 30B,是今年反复出现的主题的又一个数据点——模型规模和 agent 表现之间的差距,大部分是训练信号问题,谁的 credit assignment 做得好,谁就能用更小更便宜的 agent 干活。对任何要规模化部署搜索 agent 的人来说,这道算术题就是全部的商业理由。
← 返回所有文章
它打的是 agent 强化学习里最老的问题:一条长搜索轨迹跑完,最后只有一个成败信号。一次 40 步的运行里 35 步聪明、5 步犯蠢,最后被当成一次无差别的失败来惩罚。ABSeeker 的答案叫 Answer-Backtracked Credit assignment,倒着来:从答案出发,回溯到底哪些中间线索是通向答案真正必需的,然后拿这些线索给每一步搜索打分。稀疏的轨迹级结果变成稠密的步级监督——失败轨迹里的有用步骤也能拿到奖励,冗余和错误的步骤被压下去。
从答案往回推,属于那种一听就觉得理所当然的想法,而这通常是好想法的标志。训练数据量说明了一切:8.5k 样本按 RL 的标准约等于没有,意味着收益几乎全部来自信号质量,而不是数据规模。4B 打平 30B,是今年反复出现的主题的又一个数据点——模型规模和 agent 表现之间的差距,大部分是训练信号问题,谁的 credit assignment 做得好,谁就能用更小更便宜的 agent 干活。对任何要规模化部署搜索 agent 的人来说,这道算术题就是全部的商业理由。
评论