2026年8月21日RLResearchAgents

Co-RL:自己给自己打分会崩,一群模型互相打分不会

自我奖励 RL 有个近亲繁殖问题。让模型给自己生成训练奖励,它会不断放大自己的偏见,直到回答同质化、训练崩掉——每条自我改进管线头上都悬着这个失败模式。HuggingFace 日榜 82 票的 Co-RL 提出的解法,进化论早就发现过:多样性。同时训练一群模型,不共享参数,来自不同模型家族、不同大小,每个模型的奖励来自同伴而不是自己。

机制成立的原因:能骗过自我打分的错误,恰恰是另一个带着不同偏见的模型能抓住的。这群模型的分歧就是训练信号——不要真值标签,不要人工标注,环外不站裁判模型。七个文本基准上 Co-RL 平均涨 3.0% 到 8.6%,四个多模态基准涨 2.3% 到 7.2%,追平或超过需要标签的监督方法,同时保住了让训练不崩的行为多样性。

这个结果跟本周另一篇去监督工作 SPADE 殊途同归——那篇让一个模型自己生成训练环境:agent 训练的瓶颈已经不是数据或奖励工程,是逃出单一模型盲区的引力。Co-RL 的答案是同行评审,结构意义上的,不是比喻。同质的委员会只会盖橡皮图章,多样的委员会才抓得住错。

对 agent 圈的含义很具体:多 agent 系统在生产环境里本来就跑着异构的一群模型。Co-RL 说这个异构性本身是训练资源——你的 agent 们之间的分歧就是免费的监督信号,前提是你去收割它。

https://arxiv.org/abs/2608.17253
← 上一篇
SemaPLC:agent harness 下车间了
下一篇 →
SPADE:agent 自己给自己造训练场
← 返回所有文章

评论

加载中...
>_