DeepSearch-World:一个9B的搜索agent,没老师,自己教会了自己
现在做一个好用的搜索agent,默认配方是:拿个小模型,从前沿模型里蒸馏轨迹,发布。港科大的DeepSearch-World,arXiv 2607.07820,没走这条路,结果一个9B模型在BrowseComp上31.2%,GAIA上61.5%,HotpotQA上93.4%。
诀窍在环境。DeepSearch-World是一个给web agent用的确定性世界,搜索和阅读都可复现:同一个query每次返回同样的结果。这听起来像个小工程细节,它其实是全部贡献。真实的网是不确定的,意味着一次rollout没法重放,意味着reward有噪声,意味着在真实web agent上做RL一直很痛苦。把世界冻住,reward就变成可验证的;reward一旦可验证,模型就能靠自己的成功往上爬。
在这之上他们做了DeepSearch-Evolve自蒸馏框架,还有42万条多跳QA任务,从环境实体图上的实体级随机游走生成。随机游走是个漂亮的造题方式:答案路径已知,跳数可调,所以难度是个旋钮而不是一个你得去买的数据集。环境还支持长周期搜索里真正要紧、而监督轨迹里很少出现的行为:进度校验和失败恢复。agent能学会线索断了该怎么办,因为环境让它可复现地撞墙。
作者的结论值得停一下:可验证的环境能让长周期web agent实现可扩展的自演化,不需要从更大的模型蒸馏。如果这条成立,小搜索agent的天花板就不是你能抄到的最强前沿模型,而是你的训练场有多好。
他们会把环境、训练数据、验证集、训练好的模型和代码都放出来。环境可能是更值钱的那件东西,因为9B模型是一个结果,而一个可复现的网是所有人都能拿来训练的基础设施。arxiv.org/abs/2607.07820
← 返回所有文章
诀窍在环境。DeepSearch-World是一个给web agent用的确定性世界,搜索和阅读都可复现:同一个query每次返回同样的结果。这听起来像个小工程细节,它其实是全部贡献。真实的网是不确定的,意味着一次rollout没法重放,意味着reward有噪声,意味着在真实web agent上做RL一直很痛苦。把世界冻住,reward就变成可验证的;reward一旦可验证,模型就能靠自己的成功往上爬。
在这之上他们做了DeepSearch-Evolve自蒸馏框架,还有42万条多跳QA任务,从环境实体图上的实体级随机游走生成。随机游走是个漂亮的造题方式:答案路径已知,跳数可调,所以难度是个旋钮而不是一个你得去买的数据集。环境还支持长周期搜索里真正要紧、而监督轨迹里很少出现的行为:进度校验和失败恢复。agent能学会线索断了该怎么办,因为环境让它可复现地撞墙。
作者的结论值得停一下:可验证的环境能让长周期web agent实现可扩展的自演化,不需要从更大的模型蒸馏。如果这条成立,小搜索agent的天花板就不是你能抄到的最强前沿模型,而是你的训练场有多好。
他们会把环境、训练数据、验证集、训练好的模型和代码都放出来。环境可能是更值钱的那件东西,因为9B模型是一个结果,而一个可复现的网是所有人都能拿来训练的基础设施。arxiv.org/abs/2607.07820
评论