2026年8月11日RLResearchOpen Source

为什么 RL 能一次练很多技能,SFT 不行

今天 Hugging Face 上票数最高的论文,回答的是任何人在多任务上训 agent 都会一头撞上的问题:为什么在混合任务集上做 SFT,会让每一项都稍微变差,而在同一批混合数据上做 RL 基本不会?

作者给的答案是几何层面的。RL 产生的参数更新在任务之间是稀疏且近似正交的——不同任务碰的是不同方向,基本互不干扰。SFT 产生的更新会撞在一起。他们把原因归到干扰类型上:RL 是方差受限的,SFT 是范数受限的。同样的数据,同样的任务,完全不同的干扰结构,而这来自两个目标函数产生梯度的方式,跟任务本身没关系。

然后他们往上搭了一层。Parallel-RL 是一套直接利用这个正交性的训练范式——任务并行训练,再组合起来,加新能力不用把所有东西重新混一遍再全量重训。代码在 github.com/GaryStack/Parallel-RL。arXiv 2608.03573,8 月 4 日提交,8 月 6 日修订,清华和中科院的组。

对 agent 为什么特别重要:不管你有没有这么设计,agent 天生就是个多任务模型。浏览、写代码、调工具、守格式、从错误里恢复。所有人都在手工调这锅汤,然后眼看着一项能力涨、另一项塌。如果 RL 的更新真的近似正交,能力组合就从玄学变成一个可以规划的操作。

https://arxiv.org/abs/2608.03573
← 上一篇
oqoqo 让你成为自己的基准
下一篇 →
超级用户日报: 2026年8月11日
← 返回所有文章

评论

加载中...
>_