SearchJev:给搜索 agent 的决策模型,快 5 倍还答得更准
搜索 agent 反复做同样的小决定。这条结果相关吗。证据够了吗。再搜一次还是直接回答。每一个都用生成模型来做,既加延迟,又给你一个没人该信的置信度。周一挂出来的 SearchJev 这篇论文,把这些决定抽出来交给一个单独的快模型,慢模型只负责规划、写查询、组织答案。名字是故意起的:就是把 Jev 那套决策模型模式套到一个 agent 循环上。
给定搜索状态和一个决策 schema,SearchJev 直接给合法选项打分,不做自回归生成。训练上的招叫 Soft-Label Learning for Calibrated Decisions,从不确定的监督信号里学决策概率,再校准置信度。拿不准的判断上交给 System-2 模型。作者还放出了 SearchDecision-Bench,把六类搜索决策统一成一个训练和评估基准。
数字正是决策模型这条线一直在等的那种。在 SearchDecision-Bench 上,SearchJev 的决策质量超过同尺寸的 Qwen3.5 自回归模型,决策速度快 5.2 到 5.3 倍,期望校准误差降低 41% 到 74%。在 BrowseComp-Plus 上,双系统 agent 的活跃搜索时间提速 3.7 到 4.7 倍,答案准确率从 45% 升到最高 54%。又快又准同时成立,正是过去一周序数偏差和零样本路由那两篇批评说很难拿到的结果。差别在于这一个是针对它要服务的那个决策 schema 训练的。
这个设计模式不止于搜索。任何 agent 循环都有一小撮每个任务触发几百次的是非门,和一两步真正要紧的生成。把门按分类器的价格算,把生成按大模型的价格算,这就是单任务成本论证最干净的形式。
链接:arxiv.org/abs/2610.05107
← 返回所有文章
给定搜索状态和一个决策 schema,SearchJev 直接给合法选项打分,不做自回归生成。训练上的招叫 Soft-Label Learning for Calibrated Decisions,从不确定的监督信号里学决策概率,再校准置信度。拿不准的判断上交给 System-2 模型。作者还放出了 SearchDecision-Bench,把六类搜索决策统一成一个训练和评估基准。
数字正是决策模型这条线一直在等的那种。在 SearchDecision-Bench 上,SearchJev 的决策质量超过同尺寸的 Qwen3.5 自回归模型,决策速度快 5.2 到 5.3 倍,期望校准误差降低 41% 到 74%。在 BrowseComp-Plus 上,双系统 agent 的活跃搜索时间提速 3.7 到 4.7 倍,答案准确率从 45% 升到最高 54%。又快又准同时成立,正是过去一周序数偏差和零样本路由那两篇批评说很难拿到的结果。差别在于这一个是针对它要服务的那个决策 schema 训练的。
这个设计模式不止于搜索。任何 agent 循环都有一小撮每个任务触发几百次的是非门,和一两步真正要紧的生成。把门按分类器的价格算,把生成按大模型的价格算,这就是单任务成本论证最干净的形式。
链接:arxiv.org/abs/2610.05107
评论