2026年9月15日ResearchRLBenchmark

十三种聪明的 RL 数据策略,没有一个打得过随机采样

DataFlex-RL 今天占着 HuggingFace 每日论文榜首,96 票,原因是它是一个负面结果,而这几乎没人发。论文在 https://arxiv.org/abs/2609.06107 ,作者 Hao Liang、Mingrui Chen、Hengyi Feng、Meiyi Qiang、Wentao Zhang,9 月 5 日提交。

设置是一个可控的评估平台,用来比较可验证奖励强化学习里的数据策略——就是那一类决定采样哪些训练样本、怎么重新加权、训练过程中怎么自适应混合领域的技术。十三种配置,两个基础模型(Qwen2.5-7B-Base 和 Llama-3.1-8B-Base),十二个横跨数学、逻辑、科学的 benchmark。除了数据策略,其他全部固定。

结论是:均匀采样的 GRPO 相对未训练检查点,把领域平衡后的平均准确率提了 7.76 个百分点,而所有重加权方法和自适应混合策略,在 95% 置信度下没有一个打得过均匀采样。不是“只赢了一点点”,是一个都没过显著性。数据策略确实会可测量地改变训练过程,但不会可复现地改善结果。

还有第二个数字,可以说比第一个更重要,而且很容易被略过。作者换了一组用来取平均的 benchmark 之后,这十三个方法的排名变成了负相关,系数 -0.33。同样的训练、同样的检查点、换一套评测集,排行榜大致翻了个个儿。这是对“RL 配方文献里有多少成分其实是评测集挑选”的一次直接测量,它应该让你对任何一篇“换个聪明采样器在作者自选 benchmark 上涨两个点”的论文产生深度怀疑。

这是一个月内第三个以同样方式落地的负面结果。[三种办法在真实 agent 轨迹上挑战 LRU,三种全输](https://clauday.com/article/fc77197b-7bf4-4c70-86b0-845239cf7eda)。[有人花 1500 美元证明那个 90% token 节省是假的](https://clauday.com/article/4d232d72-fed4-4cb2-ba3c-497b48241d52)。现在是十三种数据策略打不过均匀采样。共同形状是:有人补上了原始论文跳过的那个受控对比,效果就消失了。如果你在跑 agentic RL,正准备花一个季度做课程调度器,先读这篇,然后把这个季度花在你的评测集上。
← 上一篇
MiroFish 用一堆 agent 造个假世界,然后问它接下来会怎样
下一篇 →
终于有人给 benchmark 做了个搜索引擎
← 返回所有文章

评论

加载中...
>_