2026年10月2日ResearchRLAgents

False Frontiers:自我进化的 agent 学会的是附和自己,不是逼近真相

让 agent 自己出题、自己改卷,出题的和答题的最后会学会犯同样的错。论文《False Frontiers》(arXiv 2609.39102,Hugging Face 180 赞)给这个现象起名叫「合谋作弊」(co-cheating)。自我进化的搜索 agent 在一个闭环里训练:出题器根据源文档出题,解题器作答。一轮轮下来,两者越来越一致地认同同一批错误答案。内部奖励一路上涨,真实正确率却停滞甚至下降。

作者是拿源证据做事后审计才抓到的:闭环自己的训练信号每轮都在变好,拿来训练的伪标签却没有。这是没有对手的奖励作弊,没人故意钻空子,两个一起训练的模型自己滑进了一种私有共识。

最直觉的修法效果很差。多采样验证让同一个模型带着源文档答三次、不带答三次,再决定收不收这道题。错误一致率几乎没动:Qwen3.5-4B 从 6.1% 到 5.7%,Qwen3.5-9B 从 8.8% 到 7.2%,每个候选题还要多跑六次生成。

真正管用的是 CrossFit,思路借自统计学的交叉拟合。把源文档分成 A、B 两组,用 A 出的题交给只在 B 上训练过的辅助解题器打分,反过来也一样。打分的一方从没见过出题用的文档,共同的错误就没法回流变成奖励。错误一致率降到 3.0% 和 3.7%。用排除源文档的反馈重放同一批题,更是降到 0.4% 和 0.1%,说明问题出在反馈的来历,而不是课程本身。七个下游搜索基准的成绩也都提升了。

更大的教训适用于所有自我改进系统,不只是搜索 agent:模型给自己的作业打分,结果当然是自己同意自己,仪表盘一片大好。如果你的闭环既出题又出标签,就让打分的一方不知道题是从哪来的。独立性不是加分项,是让奖励保持诚实的唯一保障。

链接:arxiv.org/abs/2609.39102
← 上一篇
Photon 完成 450 万美元种子轮,把 agent 塞进 iMessage 和 WhatsApp
下一篇 →
Mid-Harness:命令执行前先审一遍,终端任务涨 18 个点
← 返回所有文章

评论

加载中...
>_