2026年10月3日ResearchAgentsOpen Source

AutoGUIWorld:用从未存在过的屏幕训练电脑操控 agent

训练电脑操控 agent,通常得真把软件跑起来:装 app、配环境、调到对的状态,再录点击。每多一个小众软件就多一份部署成本,所以数据最后都扎堆在少数好托管的 app 上。AutoGUIWorld(HF 40 票)干脆跳过软件本身,让图像生成模型来扮演操作系统。

做法是这样的:用结构化描述规定操作系统环境、视觉风格和界面状态,据此采样一张初始截图;针对这个画面生成任务;规划器决定每一个原子动作,并描述它在画面上应有的结果;图像生成模型在当前截图上编辑出下一帧。再经过动作定位和逐步转移的质量过滤,最终得到 79266 条带空间标注的单步训练样本,覆盖 Ubuntu、Windows、macOS 和 Chrome,没有一条来自真实运行的 app。

效果比听上去好。用这些轨迹微调 Qwen3.5-35B-A3B,OSWorld 平均任务分从 33.0% 升到 40.8%。ScienceBoard 测的是部署起来特别麻烦的专业科学软件,任务成功率从 14.0% 涨到 32.2%,翻了一倍还多。

ScienceBoard 这一跳才是重点。专业软件的长尾一直是最难采 agent 数据的地方,而「幻想出来的屏幕」恰好在这里帮助最大。图像模型已经好到可以给 GUI 当世界模型了。代码在 github.com/ImYangC7/AutoGUIWorld。

链接:arxiv.org/abs/2610.01215
← 上一篇
GraphForge:2169 条轨迹,让 27B 开源模型在 GDPVal 上涨 65 分
下一篇 →
Argo-Bench:75 亿行数据,按后果给 agent 打分
← 返回所有文章

评论

加载中...
>_