谷歌的 SHIFT 给每个请求搭一套不同的 agent 框架,一套都不用先跑
框架对模型这条线一周下来的证据都在说,脚手架决定分数。顺理成章的下一个问题是,能不能按任务挑脚手架。本周 HuggingFace 榜上两篇论文说能,但做法不同。
谷歌的 SHIFT 是按请求定制的版本。框架就是包在模型外面的那套角色、指令、工具和通信结构,哪一套合适取决于请求。在推理时搜索备选方案意味着要把它们都跑一遍,太贵。SHIFT 把执行从循环里拿出去。一个本地的 LLM 架构师学一套关于搭框架动作的策略,再加一个用实测执行训练出来的价值函数,预测一个平衡准确率和成本的效用值。每个请求来了,蒙特卡洛树搜索用这些预测组装一套框架,只有选中的那套真的跑。在六个基准、9,193 个任务上,用 Gemini 3.5 Flash 做执行器,SHIFT 平均准确率约 80%,打赢了涵盖提示、提示优化和工作流搜索的 17 个基线,比最强基线高 7.2 个点。一个更便宜的模式仍然赢过所有基线,同时少用 32% 的执行 token。结构、指令、工具三者一起选,比只选其中任何一个高出最多 9.1 个点。
中科大的 PluginRSI 是积累的版本。它不演化整个框架程序,那样机制纠缠在一起没法复用,而是把框架表示为原子化插件的组合,插件各自独立改进,存进一个共享库,每轮重新组合。它在软件工程、命令行和问答任务上超过现有的框架优化方法,演化出来的框架换到别的求解模型上不用重新优化也保持优势,插件库让下一次优化在没见过的任务上起步更快、收敛更高。
两篇放一起,标志着“框架”这个词变了意思。它不再是一个人写过一次的文件,而是一个带学习先验的搜索空间。SHIFT 里要记住的是那个关乎成本的数字:预测出来的框架打赢了跑出来的搜索,还少花三分之一的 token。
链接:arxiv.org/abs/2610.04137,以及 arxiv.org/abs/2609.32423
← 返回所有文章
谷歌的 SHIFT 是按请求定制的版本。框架就是包在模型外面的那套角色、指令、工具和通信结构,哪一套合适取决于请求。在推理时搜索备选方案意味着要把它们都跑一遍,太贵。SHIFT 把执行从循环里拿出去。一个本地的 LLM 架构师学一套关于搭框架动作的策略,再加一个用实测执行训练出来的价值函数,预测一个平衡准确率和成本的效用值。每个请求来了,蒙特卡洛树搜索用这些预测组装一套框架,只有选中的那套真的跑。在六个基准、9,193 个任务上,用 Gemini 3.5 Flash 做执行器,SHIFT 平均准确率约 80%,打赢了涵盖提示、提示优化和工作流搜索的 17 个基线,比最强基线高 7.2 个点。一个更便宜的模式仍然赢过所有基线,同时少用 32% 的执行 token。结构、指令、工具三者一起选,比只选其中任何一个高出最多 9.1 个点。
中科大的 PluginRSI 是积累的版本。它不演化整个框架程序,那样机制纠缠在一起没法复用,而是把框架表示为原子化插件的组合,插件各自独立改进,存进一个共享库,每轮重新组合。它在软件工程、命令行和问答任务上超过现有的框架优化方法,演化出来的框架换到别的求解模型上不用重新优化也保持优势,插件库让下一次优化在没见过的任务上起步更快、收敛更高。
两篇放一起,标志着“框架”这个词变了意思。它不再是一个人写过一次的文件,而是一个带学习先验的搜索空间。SHIFT 里要记住的是那个关乎成本的数字:预测出来的框架打赢了跑出来的搜索,还少花三分之一的 token。
链接:arxiv.org/abs/2610.04137,以及 arxiv.org/abs/2609.32423
评论