RLSVR:不请裁判,让模型玩谍战游戏自己发奖励
Hugging Face日榜第一,143个赞:From RLVR to RLSVR。问题大家都熟:可验证奖励的RL在数学和代码上好使,因为答案能查;写作、总结这类开放任务没有标准答案,只能靠奖励模型或LLM裁判,而裁判会漂移、会被钻空子、还烧推理费。
他们的解法:别去评判输出,把任务本身改造成环境自己会打分的形状。落地实现叫SpyRL,一个信息不对称的自博弈游戏,想想谁是卧底。"卧底"模型拿到略有不同的题面,玩家必须把输出写得足够好,好到队友能认出谁不对劲。输出质量变成了身份识别准确率,而准确率是精确可查的,不需要裁判。在总结、创意写作甚至数学推理上,SpyRL全面超过现有的自我改进方法。
为什么重要:裁判瓶颈是所有自我改进管道撞的那堵墙——学生超不过阅卷人,而LLM阅卷人又贵又能被hack。把质量变成游戏胜负,直接绕开了阅卷人。这和同一个周末OpenAI Astra的数学发布从形式化证明那头说的是同一件事:进步最快的模型,是工作能被机器检验的模型。当前自我改进的瓶颈不是智能,是可验证性。
论文:https://arxiv.org/abs/2607.23802
← 返回所有文章
他们的解法:别去评判输出,把任务本身改造成环境自己会打分的形状。落地实现叫SpyRL,一个信息不对称的自博弈游戏,想想谁是卧底。"卧底"模型拿到略有不同的题面,玩家必须把输出写得足够好,好到队友能认出谁不对劲。输出质量变成了身份识别准确率,而准确率是精确可查的,不需要裁判。在总结、创意写作甚至数学推理上,SpyRL全面超过现有的自我改进方法。
为什么重要:裁判瓶颈是所有自我改进管道撞的那堵墙——学生超不过阅卷人,而LLM阅卷人又贵又能被hack。把质量变成游戏胜负,直接绕开了阅卷人。这和同一个周末OpenAI Astra的数学发布从形式化证明那头说的是同一件事:进步最快的模型,是工作能被机器检验的模型。当前自我改进的瓶颈不是智能,是可验证性。
论文:https://arxiv.org/abs/2607.23802
评论