IterSynth:把深度搜索代理劈成两半,8B 小模型就赢了
ReAct 式的深度搜索代理,让一个策略同时干三件事:规划下一个查询、读证据、写答案,身后还拖着一条越来越长的搜索历史。腾讯的 IterSynth(arXiv 2609.29444)用一个结构改动把两个毛病一起治了:把代理拆成 Planner 和 Synthesizer,前者判断还缺什么信息,后者把新证据揉进一份不断更新的摘要里。搜索的持久状态从原始历史变成了这份摘要。
训练也有自己的招。Role-Decoupled Policy Optimization 把最终结果奖励和每一轮的评分细则结合起来,并且给两个角色分别算优势值。于是 Planner 因为问得好被奖励,Synthesizer 因为整合得好被奖励,而不是两人共用一个模糊的分数。
结果:在 BrowseComp、Xbench-DeepSearch 等五个长程深度搜索基准上,IterSynth-8B 平均 50.7 分,比此前 8B 及以下最强的代理高 4.2%。对从不训模型的人来说更有意思的一点:把它当纯提示词范式,零样本套在前沿闭源模型上,相比 ReAct 依然有明显提升。
这是各路 harness 论文从不同角度反复在讲的同一课:上下文才是稀缺资源,解法是结构,不是更多 token。用滚动摘要当状态,任何搜索代理明天就能用上,有没有强化学习都行。代码在 github.com/Tencent/IterSynth。
← 返回所有文章
训练也有自己的招。Role-Decoupled Policy Optimization 把最终结果奖励和每一轮的评分细则结合起来,并且给两个角色分别算优势值。于是 Planner 因为问得好被奖励,Synthesizer 因为整合得好被奖励,而不是两人共用一个模糊的分数。
结果:在 BrowseComp、Xbench-DeepSearch 等五个长程深度搜索基准上,IterSynth-8B 平均 50.7 分,比此前 8B 及以下最强的代理高 4.2%。对从不训模型的人来说更有意思的一点:把它当纯提示词范式,零样本套在前沿闭源模型上,相比 ReAct 依然有明显提升。
这是各路 harness 论文从不同角度反复在讲的同一课:上下文才是稀缺资源,解法是结构,不是更多 token。用滚动摘要当状态,任何搜索代理明天就能用上,有没有强化学习都行。代码在 github.com/Tencent/IterSynth。
评论