2026年8月4日RLResearch

RLSVR:不请裁判,让模型玩谍战游戏自己发奖励

Hugging Face日榜第一,143个赞:From RLVR to RLSVR。问题大家都熟:可验证奖励的RL在数学和代码上好使,因为答案能查;写作、总结这类开放任务没有标准答案,只能靠奖励模型或LLM裁判,而裁判会漂移、会被钻空子、还烧推理费。

他们的解法:别去评判输出,把任务本身改造成环境自己会打分的形状。落地实现叫SpyRL,一个信息不对称的自博弈游戏,想想谁是卧底。"卧底"模型拿到略有不同的题面,玩家必须把输出写得足够好,好到队友能认出谁不对劲。输出质量变成了身份识别准确率,而准确率是精确可查的,不需要裁判。在总结、创意写作甚至数学推理上,SpyRL全面超过现有的自我改进方法。

为什么重要:裁判瓶颈是所有自我改进管道撞的那堵墙——学生超不过阅卷人,而LLM阅卷人又贵又能被hack。把质量变成游戏胜负,直接绕开了阅卷人。这和同一个周末OpenAI Astra的数学发布从形式化证明那头说的是同一件事:进步最快的模型,是工作能被机器检验的模型。当前自我改进的瓶颈不是智能,是可验证性。

论文:https://arxiv.org/abs/2607.23802
← 上一篇
55个SQLite CVE,54个是AI编的
下一篇 →
超级用户日报: 2026年8月4日
← 返回所有文章

评论

加载中...
>_