OSReward:给智能体打分的 AI 裁判集体手软
OSReward 测了一件整个 computer-use 领域一直默认可行的事:让 AI 裁判给智能体的操作打分。结论是不可行。港大 OS-Copilot 团队做了迄今最全面的 VLM 裁判评测——真实的跨平台电脑操作轨迹、多种智能体骨干、人工验证的指令、多轮人工标注的真值判定——所有最强模型全部不及格,而且错法一致:系统性的宽松偏差,把失败的运行判成成功。少数靠谱的裁判贵到没法规模化,便宜的开源模型又差一大截。论文在 HuggingFace daily papers 上拿了60个赞。
细想一下宽松偏差对训练意味着什么。computer-use 智能体的强化学习成败全系于奖励信号。裁判在运行实际失败时说"通过",你不只是测错了——你是在大规模地、满怀信心地把失败训进模型里。所有拿 VLM 裁判当验证器的 GRPO 类流水线,都在无声地继承这个偏差。
团队给的答案很实用:OS-Shepherd-100K,一个带推理标注的轨迹判定开源语料库,加上在它上面训出来的 OS-Shepherd 9B 和 35B——开源奖励模型,提供便宜、稳定、可靠的奖励信号。还附带专收硬案例的 OSReward-Hard 和做细粒度效率评分的 OSReward-Multi。
这是"评分危机"的第三条腿。Who Grades the Grader 证明奖励模型在推理题上失灵;ScaleX 证明人类监督者准确率只有66.3%,三分之一的恶意操作照批不误;现在盯着 computer-use 智能体的 VLM 裁判又被证明系统性手软。智能体进步的瓶颈一再回到同一个位置:不是选手,是裁判。
论文:arxiv.org/abs/2607.28609 代码:github.com/OS-Copilot/OSReward
← 返回所有文章
细想一下宽松偏差对训练意味着什么。computer-use 智能体的强化学习成败全系于奖励信号。裁判在运行实际失败时说"通过",你不只是测错了——你是在大规模地、满怀信心地把失败训进模型里。所有拿 VLM 裁判当验证器的 GRPO 类流水线,都在无声地继承这个偏差。
团队给的答案很实用:OS-Shepherd-100K,一个带推理标注的轨迹判定开源语料库,加上在它上面训出来的 OS-Shepherd 9B 和 35B——开源奖励模型,提供便宜、稳定、可靠的奖励信号。还附带专收硬案例的 OSReward-Hard 和做细粒度效率评分的 OSReward-Multi。
这是"评分危机"的第三条腿。Who Grades the Grader 证明奖励模型在推理题上失灵;ScaleX 证明人类监督者准确率只有66.3%,三分之一的恶意操作照批不误;现在盯着 computer-use 智能体的 VLM 裁判又被证明系统性手软。智能体进步的瓶颈一再回到同一个位置:不是选手,是裁判。
论文:arxiv.org/abs/2607.28609 代码:github.com/OS-Copilot/OSReward
评论