Qwen-Planner-Agent:让 AI 参与造下一个手机代理
AI 能不能既是被造的东西,又是造它的人之一?Qwen 在 Qwen-Planner-Agent(arXiv 2609.29892)里给的答案是一个闭环:由代理来生产数据、影响训练、调整 harness,产出下一版手机规划代理。选手机规划当试验场是故意的:任务长程,而且每一次真机交互都又慢又贵。
闭环分三块,用一份共享的「动作、反馈、验证」契约串起来。AI for Data 是一个有人把关的数据飞轮,专门的代理负责构造任务、采集轨迹、整理和平衡训练集,并根据训练反馈决定下一轮生成什么。AI for Training 先做有监督冷启动,再做混合环境下的在线代理强化学习,配了一套叫 CARE 的新奖励设计,在保持效果的前提下压低推理和工具调用成本。第三块是模型和 harness 共同进化:一个以执行证据驱动的循环在运行时编排记忆、技能和工具,再把结构化的失败轨迹同时回灌给两边。
结果是在 MobilePA-Bench 上拿到所有被测模型和系统里的最佳综合成绩,相比基座模型在工具使用、记忆、技能和子代理协作上都有提升,在非手机类代理基准上也有进步,通用能力基本没掉。
最关键的一个词是模型与 harness 共同进化。多数实验室还把 harness 当成训练好的模型外面套的一层壳。这里失败轨迹同时流向两边,正是「harness 是产品的一半」这个论点的生产版本。还要注意数据飞轮上那道人工闸门。一个真正要上线的 AI for AI 循环,在数据进门的地方依然站着一个人。
← 返回所有文章
闭环分三块,用一份共享的「动作、反馈、验证」契约串起来。AI for Data 是一个有人把关的数据飞轮,专门的代理负责构造任务、采集轨迹、整理和平衡训练集,并根据训练反馈决定下一轮生成什么。AI for Training 先做有监督冷启动,再做混合环境下的在线代理强化学习,配了一套叫 CARE 的新奖励设计,在保持效果的前提下压低推理和工具调用成本。第三块是模型和 harness 共同进化:一个以执行证据驱动的循环在运行时编排记忆、技能和工具,再把结构化的失败轨迹同时回灌给两边。
结果是在 MobilePA-Bench 上拿到所有被测模型和系统里的最佳综合成绩,相比基座模型在工具使用、记忆、技能和子代理协作上都有提升,在非手机类代理基准上也有进步,通用能力基本没掉。
最关键的一个词是模型与 harness 共同进化。多数实验室还把 harness 当成训练好的模型外面套的一层壳。这里失败轨迹同时流向两边,正是「harness 是产品的一半」这个论点的生产版本。还要注意数据飞轮上那道人工闸门。一个真正要上线的 AI for AI 循环,在数据进门的地方依然站着一个人。
评论