论文链接:SFT Conflicts, RL Coexists (arXiv:2608.03573) HTML 全文:arXiv HTML v2 代码仓库:GaryStack/Parallel-RL (GitHub) 发表时间:2026 年(ICML 投稿) 机构:清华大学(作者 Kejian Zhu、Zhuoran Jin、Shangqing Tu、Hongbang Yuan、Yushi Bai、Kang Liu、Juanzi Li、Jun Zhao)


一、论文背景

1.1 大模型为什么需要"多任务训练"

一个能力强的大语言模型(LLM)不能只会做一件事。我们希望它既能解数学题(Math)、又能回答科学常识(Science)、还能写代码(Code)、做逻辑推理(Logic)。这种"同时掌握多种能力"的需求,在学术界叫做多任务学习(Multi-Task Learning)。它被普遍认为是通向更通用人工智能(AGI)的必经之路。

在当前 LLM 的训练流程里,让模型获得推理能力的两大主流方法是:

  • SFT(Supervised Fine-Tuning,监督微调):给模型看"题目 + 标准答案"的示范,让它模仿专家的写法。就像给学生看老师写好的解题步骤,照着学。
  • RL(Reinforcement Learning,强化学习):让模型自己尝试生成答案,然后用一个"判分函数(奖励函数)“给答案打分,做对了就奖励、做错了就惩罚,模型逐步调整策略。就像让学生自己刷题,做对了加分、做错了扣分,在试错中进步。

1.2 多任务训练的两种工程做法

当要把多个任务一起训给模型时,工程上有两种常见做法:

做法中文名直观类比特点
Mixed-Data(混合数据)一锅炖把数学、科学、代码的题目打乱混在一起,每轮随机抽样训练实现简单,但不同任务的梯度可能互相打架
Multi-Stage(多阶段)流水线先专门训数学、再专门训科学、再训代码……一个任务接一个任务地学灵活可控,但容易"学了新的忘旧的”(灾难性遗忘)

1.3 一个令人困惑的实践现象

研究者发现了一个反直觉的现象:

  • 用 SFT 做多阶段训练(先训 A 再训 B 再训 C),模型性能严重崩溃——相比基础模型平均下降 23.1%。
  • 而用 RL 做同样的多阶段训练,模型性能反而持续提升——相比基础模型平均提升 24.9%。

这就像两个学生,用同样的"流水线"学习顺序,一个越学越差,一个越学越好。为什么会这样?这正是本论文要回答的核心问题。

理解这个差异非常重要:如果多阶段训练会崩溃,我们就得花大量算力去做混合数据训练(数据配比、调度都很麻烦);如果多阶段训练能稳定变好,我们就可以放心地"分而治之",每个任务单独训练再合并,效率高得多。


二、论文定位和关联工作

2.1 研究脉络:SFT 与 RL 的对比

关于 SFT 和 RL 的差异,学术界已经有一些前期探索,但这些工作主要关注单任务场景:

研究谱系代表工作核心观点与本论文的关键区别
行为差异类Chu et al. (2025) “SFT memorizes, RL generalizes”SFT 倾向于记忆训练数据,RL 倾向于泛化只在单任务层面观察,未触及多任务冲突机制
能力变化类Matsutani et al. (2025) “RL squeezes, SFT expands”RL"挤压"模型输出分布,SFT"扩张"分布未从参数更新几何角度解释
参数稀疏性类Mukherjee et al. (2025)RL 只微调模型的一个小子网络未系统对比 SFT 与 RL 的更新幅度
RL 遗忘理论Shenfeld et al. (2025) “RL’s Razor”RL 由于隐式 KL 约束最小化参数偏差本论文直接借鉴其 KL 投影理论
SFT+RL 结合Zhang et al. (2025)、Fu et al. (2025) SRFT单阶段融合 off-policy 和 on-policy关注的是"怎么训得更好",而非"多任务冲突的本质原因"

2.2 本论文的独特定位

本论文是首次系统性地从理论和经验角度研究"多任务训练中 SFT 和 RL 差异"的工作。

之前的所有工作要么只看单任务,要么只比较"学到了什么",而本论文直击一个更根本的问题:当多个任务的更新叠加在一起时,SFT 和 RL 在参数空间里的几何行为有何本质不同? 这就像别人在研究"两个学生谁学得好",而本论文在研究"两个学生在学新东西时,脑子里旧知识的存储结构有什么不同,为什么一个会被覆盖、另一个不会"。

2.3 本论文的突破

维度之前的路线本论文的突破
研究场景单任务 SFT vs RL多任务 SFT vs RL
分析层次行为/能力层面参数几何 + 理论上界层面
解释机制经验观察norm-limited vs variance-limited 理论
应用产出训练技巧Parallel-RL 范式(解耦多任务训练)

三、问题定义

3.1 从具体现象到抽象问题

具体现象:用 SFT 和 RL 做多阶段多任务训练,效果天差地别(SFT 崩溃 -23.1%,RL 提升 +24.9%)。

直觉猜测:可能是"学新任务时覆盖了旧任务"?但这个说法太模糊,无法解释"为什么 RL 不覆盖而 SFT 会覆盖"。

论文的核心洞察:问题不在"覆盖",而在于不同任务引起的参数更新向量(ΔW)在几何上是否相互冲突。这把一个模糊的认知问题,转化为一个清晰的几何与优化问题。

3.2 类比:参数更新向量 ≈ 高维空间中的"位移"

把模型的所有参数想象成生活在一个非常高维的空间里(一个 1.5B 的模型,参数空间维度约 15 亿维)。训练一个任务,就相当于让参数从起点 W_base 沿着一个方向移动一段距离,到达一个新的位置。这个"移动"就是一个向量 ΔW = W_trained - W_base。

  • ΔW 的长度(L2 范数):移动了多远。
  • 两个任务 ΔW 之间的余弦相似度:两个移动方向是同向(cos≈1)、反向(cos≈-1)还是正交(cos≈0)。

如果两个任务的 ΔW 方向接近正交(cos≈0),那么先训任务 A 再训任务 B,相当于"先往东走,再往北走",两条路径互不干扰。如果两个任务的 ΔW 方向接近反向(cos≈-1),那就是"先往东走,再被拉回西走",旧任务的能力被冲掉。

3.3 形式化问题定义

给定:

  • 基础模型参数 W_base
  • N 个任务 T_1, …, T_N,每个任务有训练数据 D_i
  • 两种训练算法:SFT 和 RL

每个任务训练后产生参数更新:ΔW_i = W_i - W_base

核心问题:对于 SFT 和 RL,

  1. ΔW_i 的幅度(L2 范数)有多大?
  2. 不同任务的 ΔW_i、ΔW_j 之间的余弦相似度分布如何?
  3. 多任务梯度干扰 $\mathcal{I}(i,j) = \langle g_i, g_j \rangle$ 的理论上界由什么决定?
  4. 能否利用这些几何性质,设计更高效的多任务训练范式?

3.4 这个抽象的精妙之处

这个抽象把"多任务学习为什么会冲突"这个看似玄学的问题,变成了一个可以用尺子(范数)和量角器(余弦相似度)测量的几何问题,进一步又变成了一个可以用概率不等式证明的理论问题。它排除了"数据质量"“学习率调参"“模型架构"等外部干扰,直击参数更新的几何本质。


四、问题解法

本论文的解法分三层:经验观测 → 理论解释 → 工程应用。我们逐层展开。

4.1 第一层:参数级经验观测(“用尺子和量角器量一下”)

作者对每个任务训练后计算 ΔW_i,然后测量两个几何属性:

观测 1:RL 更新的幅度极小且稀疏

指标SFTRL差距
ΔW 平均 L2 范数~7.4~3×10⁻²超过两个数量级
幅度超过 10⁻⁵ 的参数比例93%~20%RL 更新非常稀疏

这意味着什么:SFT 训练时参数"大动”,几乎改动所有参数;RL 训练时参数"微调”,只改动约 20% 的参数,而且改动量极小。

观测 2:RL 不同任务的优化方向近似正交

指标SFTRL
不同任务间 ΔW 余弦相似度~10⁻¹ 至 1.0~10⁻⁵

这意味着什么:SFT 不同任务的更新方向甚至可能完全相反(互相打架);RL 不同任务的更新方向几乎两两垂直(互不打扰)。这就解释了为什么 RL 多阶段训练能稳定累积——每学一个新任务,都像在一个新方向上延伸,不会冲掉旧方向上的能力。

4.2 第二层:理论分析(“为什么会这样”)

光观测不够,论文进一步从数学上证明了为什么 RL 的更新小而正交,SFT 的更新大而冲突。核心是理解 SFT 和 RL 梯度公式的两个根本区别。

4.2.1 SFT 与 RL 的梯度公式对比

维度SFT 梯度RL 梯度(以 GRPO 为例)
梯度公式$g_{\text{SFT}} = \mathbb{E}[\nabla_\theta \log \pi_\theta(y\|x)]$$g_{\text{RL}} = \mathbb{E}[A(x,y) \nabla_\theta \log \pi_\theta(y\|x)]$
策略来源y 来自固定的专家分布 π_expert(off-policy)y 来自当前模型 π_θ(on-policy)
加权项无(每条专家样本权重相同)有优势函数 A(x,y) 做加权
得分函数范数‖S‖₂ ~7.1(大)‖S‖₂ ~10⁻¹(小)

什么是优势函数 A(x,y):在一个题目 x 上,模型生成一组答案,有的对有的错。优势函数衡量"这个答案比平均水平好多少"——做对了的 A>0,做错了的 A<0,且一组的优势函数之和恒为 0(零和性质)。

4.2.2 RL 更新为何小而稀疏:KL 投影理论

论文援引 Shenfeld et al. (2025) 的 Proposition 4.1:RL(用二值奖励的策略梯度)收敛到的解,是在所有"奖励=1"的最优策略集合中,与初始策略 π_0 在 KL 散度意义上最近的那个。

直观理解:RL 不是"想怎么改就怎么改",而是"在所有能达到好成绩的策略里,选一个离出发点最近的"。这就像你在迷宫里找出口,RL 会选离起点最近的那条出口,而不是绕一大圈。

这个过程被刻画为两阶段交替投影:

  • I-Projection:把当前策略拉到"所有奖励=1 的策略集合"里(向正确答案靠拢)。
  • M-Projection:再把策略拉回"模型参数能表示的范围"里(这步反映了 on-policy 的作用,保证策略始终能被模型实际表达)。

这两步反复迭代,最终结果就是"参数改动尽可能小,又能拿到奖励"。这从理论上解释了 RL 的 ΔW 范数为什么只有 ~3×10⁻²。

4.2.3 RL 多任务梯度干扰为何小:方差受限 vs 范数受限

这是论文最核心的理论贡献。作者证明了 GRPO 的优势函数有一个关键性质——零和性质:

$$\sum_{k=1}^{G} \hat{A}_{i,k}(x) = 0$$

这意味着:在一组采样里,好的答案和差的答案的优势函数相互抵消。利用这个性质,作者把 RL 的多任务梯度内积分解为:

$$\mathcal{I}_{\text{RL}}(i,j) = \mathbb{E}\left[\frac{1}{G^2}\sum_{k,l} \hat{A}_{i,k}\hat{A}_{j,l} \langle \delta S_{i,k}(x), \delta S_{j,l}(x') \rangle\right]$$

其中 δS 是残差得分函数(每个 rollout 的得分函数减去组内平均得分函数)。

两个关键机制:

机制作用直观类比
优势归一化(零和)代数上消去了平均梯度方向 S̄,把得分函数内积转化为残差内积 ⟨δS_i, δS_j⟩把"所有力的合力"换成"力的波动部分"
on-policy 采样残差 δS 捕获的是同一输入下 G 个 rollout 之间的"组内分歧",这个分歧天然有界;不同任务的 δS 是独立、零均值、稀疏的高维向量,在高维空间里以高概率近似正交高维空间里随机方向的两根针,几乎一定是互相垂直的(浓度现象)

浓度不等式(高维近似正交的数学保证):

$$\mathbb{P}(|\langle \delta S_i, \delta S_j \rangle| \geq t) \leq 2\exp(-ct^2 d)$$

其中 d 是参数空间维度(~10⁹)。维度越高,两个独立随机向量越接近正交。这就是为什么在几十亿参数的大模型里,RL 的任务间干扰几乎可以忽略。

4.2.4 主定理(Theorem 4.5):干扰上界

设假设 4.4 成立:

量定义实测值
$M_i$SFT 得分函数范数的期望平方根 $\sqrt{\mathbb{E}[\|S_i^*\|^2]}$~7.1
$V_i$RL 残差得分函数方差 $\sqrt{\mathbb{E}[\frac{1}{G}\sum_k \|\delta S_{i,k}\|^2]}$~10⁻²

则多任务梯度干扰的上界为:

算法上界类型本质
SFT$\|\mathcal{I}_{\text{SFT}}(i,j)\| \leq M_i \cdot M_j$范数受限(norm-limited)由得分函数的绝对幅度控制(大)
RL$\|\mathcal{I}_{\text{RL}}(i,j)\| \leq V_i \cdot V_j$方差受限(variance-limited)由组内残差的方差控制(小)

这个定理的精妙之处:SFT 的干扰上界正比于得分函数的"绝对大小"(大数),RL 的干扰上界正比于"组内波动大小"(小数)。这就是为什么 SFT 冲突严重而 RL 近乎无冲突的根本原因——不是经验现象,而是数学结构上必然如此。

4.2.5 理论的定量验证

指标SFTRL理论预测
‖S‖₂(得分函数范数)~7.1~10⁻¹SFT 大、RL 小 ✅
‖δS‖₂(残差范数)—~10⁻²RL 受方差约束 ✅
CosSim(S_i, S_j)~10⁻¹~10⁻³RL 更接近正交 ✅

实测与理论预测高度吻合。

4.3 第三层:Parallel-RL 工程范式(“利用这个性质做点什么”)

既然 RL 不同任务的 ΔW 近似正交,那么干扰项 ⟨ΔW_i, ΔW_j⟩ ≈ 0。这意味着:把各任务独立训练得到的 ΔW_i 直接加起来,效果应该接近多阶段顺序训练——而且还能并行执行,效率高得多。

4.3.1 Parallel-RL 的核心公式

$$W_{final} = W_{base} + \mathcal{M}(\Delta W_1, \Delta W_2, \dots, \Delta W_N)$$

其中 ℳ 是合并函数,N 个任务的 ΔW_i 可以并行获得(都从同一个 W_base 出发独立训练)。

4.3.2 五种合并策略对比

策略合并函数 ℳ直观类比复杂度
Naive sum$\sum_i \Delta W_i$直接把所有方向的位移相加最低
Naive mean$\frac{1}{N}\sum_i \Delta W_i$取平均位移最低
TIES用 TIES 算法(Yadav et al., 2023)处理冲突先裁剪再解决符号冲突再平均中
SVD每个 ΔW 做 SVD,只保留 rank-1 方向只保留每个任务最主要的更新方向中
Adapted Parallel-RLNaive sum 之后,用 5% 训练数据做快速适应微调合并后再做一次"轻量校准"较高但效果最好

Adapted Parallel-RL 为何最优:直接相加虽然因为近似正交而干扰小,但仍有微小偏差;用 5% 数据做一次轻量微调,就能把这些微小偏差"熨平",甚至因为多任务数据的轻微交互而超过单任务 RL 的上限(Retention > 100%)。

4.3.3 Parallel-RL 相对传统范式的优势

维度混合数据训练(Mixed-Data)多阶段训练(Multi-Stage)Parallel-RL
训练并行度串行(一个大数据集)串行(N 个阶段)完全并行(N 个任务同时训)
任务解耦否(数据混杂)部分(阶段切换)完全解耦(各任务独立)
任务可插拔困难(需重训)困难(需重排)简单(新任务独立训,合并 ΔW)
适用于 SFT可行崩溃不适用(SFT 更新冲突大)
适用于 RL可行可行且有效最优(RL 更新近似正交)

4.3.4 全景方法对比表

方法核心机制训练方式理论保证适用算法
Mixed-Data SFT数据混合串行无SFT
Multi-Stage SFT顺序训练串行易崩溃SFT
Mixed-Data RL数据混合串行干扰中等RL
Multi-Stage RL顺序训练串行干扰小(variance-limited)RL
Parallel-RL独立训练 + 合并并行干扰可忽略(正交性)RL
Adapted Parallel-RL独立训练 + 合并 + 轻量适应并行 + 微调串行干扰最小RL

五、评估指标与实验证据

5.1 评估指标体系

论文用三层指标来全面验证论点:

指标层级指标名定义衡量的本质能力
主指标各基准准确率 (%)在 MATH500/AIME/MMLU/GPQA/KK/LCB 上的答题正确率模型在数学/科学/逻辑/代码任务上的实际推理能力
主指标ΔBase方法得分 − 基础模型得分的平均提升方法相对基础模型的整体增益
主指标Retention (%)多任务方法得分 / 单任务 RL 得分多任务合并后保留了多少"单任务专家"的能力
辅助指标ΔW 的 L2 范数参数更新向量的长度训练改动了多少参数
辅助指标任务间余弦相似度不同任务 ΔW 的夹角余弦任务更新是否方向冲突
理论指标‖S‖₂、‖δS‖₂、CosSim(S_i,S_j)得分函数范数、残差范数、得分函数相似度验证 norm-limited vs variance-limited 理论
消融指标Δ_Target、Δ_Others移除某任务 ΔW 后该任务/其他任务的变化验证 Parallel-RL 是否真的解耦了各任务

Retention 的意义:如果 Retention = 100%,说明合并后完全保留了单任务专家的能力;如果 >100%,说明合并甚至产生了正向协同(1+1>2);如果 <100%,说明合并有损失。这是衡量"多任务训练范式好坏"的最直观指标。

5.2 实验数据集与基准

领域基准规模/特点为什么选它
数学(基础)MATH500500 道高中竞赛级数学题衡量基础数学推理
数学(困难)AIME 2025美国数学邀请赛,极难衡量高难度数学推理
科学MMLU多学科选择题衡量广度知识
科学(困难)GPQA研究生级科学题衡量深度科学推理
逻辑Knights & Knaves (KK)骑士与无赖逻辑谜题衡量形式逻辑推理
代码LiveCodeBench (LCB)实时编程题衡量代码生成能力

基础模型:DeepSeek-R1-Distill-Qwen-1.5B 和 7B(开源蒸馏推理模型,当前主流的推理能力研究底座)。

训练算法:RL 用 GRPO(Group Relative Policy Optimization,组相对策略优化),这是 DeepSeek-R1 用的主流 RL 算法。

5.3 核心实验 1:SFT vs RL 的多任务行为对比(Table 1)

这个实验直接证明了"SFT 冲突、RL 共存"的核心论点。

策略MathScienceLogicCode平均变化
Base Model83.134.931.015.0—
Mixed Data SFT84.6 (↑1.5)38.9 (↑4.0)34.0 (↑3.0)16.0 (↑1.0)+7.4%
Multi Stage SFT78.2 (↓4.9)31.1 (↓3.8)9.0 (↓22.0)14.3 (↓0.7)−23.1%
Mixed Data RL85.2 (↑2.1)43.2 (↑8.3)37.0 (↑6.0)15.7 (↑0.7)+12.6%
Multi Stage RL86.6 (↑3.5)49.3 (↑14.4)43.0 (↑12.0)17.3 (↑2.3)+24.9%

关键对比:

  • Multi-Stage SFT 的 Logic 任务从 31.0 暴跌到 9.0(↓22.0),几乎丧失逻辑能力——典型的灾难性遗忘。
  • Multi-Stage RL 的 Logic 任务反而从 31.0 提升到 43.0(↑12.0)——新任务训练不但没冲掉旧能力,反而有正向迁移。
  • 同样是多阶段训练,SFT 和 RL 的平均变化相差 47 个百分点(−23.1% vs +24.9%)。

这个实验如何证明论点:它直接展示了在完全相同的训练范式(多阶段)下,SFT 和 RL 表现出截然相反的多任务行为,证明冲突与否是算法本身的性质,而非训练流程的问题。

5.4 核心实验 2:单任务训练的泛化性(Table 2)

这个实验进一步验证:即使只训一个任务,SFT 也会伤害其他任务,RL 则不会。

以 Math 单任务训练为例:

训练算法Math(目标)ScienceLogicCode
Math SFT84.4 (↑2.4)28.0 (↓6.9)15.0 (↓16.0)12.4 (↓2.6)
Math RL85.6 (↑3.6)42.5 (↑7.6)33.0 (↑2.0)15.6 (↑0.6)

关键对比:

  • Math SFT:数学提升 2.4%,但逻辑暴跌 16.0%——SFT 的更新方向与其他任务能力"反向"。
  • Math RL:数学提升 3.6%,同时科学、逻辑、代码全部提升——RL 的更新方向与其他任务能力"正交甚至同向"。

汇总所有单任务训练:

  • SFT:目标任务平均 +4.0%,其他任务平均 −5.1%
  • RL:目标任务平均 +6.8%,其他任务平均 **+2.3%

5.5 核心实验 3:Parallel-RL 主结果(Table 4)

这是 Parallel-RL 范式的核心证明。在 DeepSeek-R1-Distill-Qwen-1.5B 上:

方法MATH500AIMEMMLUGPQAKKLCBΔBaseRetention
Base Model82.026.934.932.331.015.0——
Single-Task RL(上界参考)87.432.751.839.944.021.6+9.3—
Mixed Data RL87.032.950.938.945.020.7+8.9—
Multi Stage RL87.833.152.840.448.021.0+10.2—
Naive Parallel-SFT (sum)61.220.025.926.823.010.1−9.265.4
Naive Parallel-RL (sum)86.432.348.037.439.018.4+6.694.2
TIES Parallel-RL87.632.549.238.443.019.7+8.097.4
Adapted Parallel-RL88.633.850.941.449.022.5+10.7103.2

如何解读这个表证明论点:

  1. Parallel-SFT 彻底失败(Retention 65.4%,ΔBase −9.2%)——因为 SFT 的 ΔW 冲突大,直接相加会互相破坏。这反证了"只有更新近似正交时才能合并"。
  2. Naive Parallel-RL 已保留 94.2%——直接相加就能接近单任务 RL 的效果,证明 RL 的 ΔW 确实近似正交。
  3. TIES/SVD 提升到 97%+——用更精细的合并算法进一步减少微小干扰。
  4. Adapted Parallel-RL 达到 103.2%——超过单任务 RL 上界,说明轻量适应不仅补回了损失,还激发了多任务协同。

在 7B 模型上同样规律成立(Adapted Parallel-RL: ΔBase +8.0%,Retention 102.4%),证明方法可扩展。

5.6 核心实验 4:消融实验(Table 5)——证明任务真的被解耦了

这个消融非常巧妙:从完整的 Parallel-RL(包含所有任务的 ΔW)中移除某一个任务的 ΔW_i,看对应任务和其他任务的性能变化。

配置MATH500MMLUKKLCB被移除任务的 Δ其他任务 Δ
完整 Parallel-RL86.448.039.018.4——
移除 Math 的 ΔW82.847.841.019.2−3.6+0.9
移除 Science 的 ΔW86.037.539.018.4−10.5−0.1
移除 Logic 的 ΔW85.649.630.020.3−9.0+0.9
移除 Code 的 ΔW88.246.940.013.1−5.3+0.6

如何解读:

  • 移除某任务的 ΔW,该任务性能显著下降(平均 −7.1%),证明这个 ΔW 确实专属于该任务。
  • 其他任务性能几乎不受影响(平均 +0.6%),证明任务之间确实做到了解耦。
  • 这就像抽掉一本书的某一章,只有那一章的内容没了,其他章完好无损——说明 Parallel-RL 把每个任务的能力"封装"在了各自的 ΔW 里。

六、效果优势的根源解释

本节建立完整的因果链:方法差异 → 参数更新几何变化 → 理论边界差异 → 指标提升。禁止泛泛而谈,每一步都要可验证。

6.1 baseline 的根本局限:为什么传统多任务训练会出问题

传统多任务训练(无论是 Mixed-Data 还是 Multi-Stage)的根本局限在于:它假设不同任务的梯度可以"叠加"而不互相破坏,但这个假设对 SFT 不成立。

SFT 的根本瓶颈:SFT 梯度 $g_{\text{SFT}} = \mathbb{E}[\nabla \log \pi(y|x)]$ 中,每条专家样本贡献的方向是"把概率往专家答案上拉"。不同任务的专家答案分布差异巨大(数学要拉向数字推导,科学要拉向知识陈述),导致:

  • 这些"拉力"方向在参数空间里经常冲突(余弦相似度 ~10⁻¹,甚至为负)。
  • 而且 SFT 的拉力没有归一化,幅度由得分函数范数 M_i 决定(~7.1,很大)。
  • 大幅度 + 方向冲突 = 灾难性干扰。多阶段训练时,后一个任务的大幅度更新会直接覆盖前一个任务。

这不是"调参不好"或"数据不够"的问题,而是 SFT 梯度结构的内在缺陷:off-policy + 无优势加权。

6.2 本文方法的根本性改变:RL 改变了什么

本文不是"引入了 RL 所以好",而是要追溯到:RL 的哪两个结构性质,改变了对多任务干扰的约束。

改变 1:优势归一化(零和性质)——把"合力"换成"波动"

环节SFTRL(GRPO)
梯度方向平均得分函数 S̄(指向"专家分布")残差得分函数 δS(捕获"组内分歧")
干扰上界控制量M_i(绝对范数,大)V_i(组内方差,小)

机制因果:GRPO 的优势函数 $\hat{A}_{i,k} = (r_{i,k} - \mu_r)/\sigma_r$ 满足 $\sum_k \hat{A}_{i,k} = 0$。这个零和性质在代数上消去了平均梯度方向 S̄ 的贡献(Lemma 4.3),把多任务干扰从"得分函数内积 ⟨S_i, S_j⟩“降为"残差内积 ⟨δS_i, δS_j⟩"。

为什么残差更小:δS 衡量的是"同一题目下,不同 rollout 之间的得分函数差异”——也就是模型在自己生成的几个答案之间的分歧。这个分歧天然有界(因为输入和参数在生成时是固定的),远小于 SFT 中"专家答案 vs 模型当前分布"的巨大差距。

指标对应:这一改变体现在 ‖δS‖₂ ~10⁻² ≪ ‖S‖₂ ~7.1 上(Table 3),直接把干扰上界从 ~50 量级(M_i·M_j)压到 ~10⁻⁴ 量级(V_i·V_j)。

改变 2:on-policy 采样——让不同任务的残差"天然正交"

环节SFT(off-policy)RL(on-policy)
样本来源固定的专家数据集当前模型自己生成
不同任务残差的关系共享同一个"专家偏置"方向,相关性高各自独立采样,统计独立
高维几何相关向量难以正交独立、零均值、稀疏向量在高维空间以高概率正交

机制因果:on-policy 意味着每个任务的 rollout 都是用"当前模型在该任务数据上"生成的,不同任务的 rollout 之间没有共享的专家偏置。因此 δS_i 和 δS_j 是统计独立、零均值、稀疏的高维随机向量。根据浓度不等式 $\mathbb{P}(|\langle \delta S_i, \delta S_j \rangle| \geq t) \leq 2\exp(-ct^2 d)$,在 d~10⁹ 维空间里,两个这样的向量几乎必然近似正交。

指标对应:这一改变体现在"任务间 ΔW 余弦相似度"上——RL ~10⁻⁵(几乎完美正交)vs SFT ~10⁻¹ 至 1.0(高度相关甚至冲突)。

6.3 完整因果链汇总

把上面的分析串成一条从方法到指标的因果链:

方法差异(SFT vs RL)
    │
    ├─ SFT: off-policy + 无优势加权
    │       → 梯度 = 平均得分函数 S̄
    │       → 不同任务 S̄ 方向冲突(共享专家偏置)
    │       → ‖S‖₂ ~7.1(大),CosSim ~10⁻¹
    │       → 干扰上界 M_i·M_j ~50(范数受限,大)
    │       → 多阶段更新互相覆盖
    │       → Multi-Stage SFT −23.1%(崩溃)
    │       → Parallel-SFT Retention 65.4%(合并失败)
    │
    └─ RL: on-policy + 优势归一化(零和)
            → 梯度 = 残差得分函数 δS
            → 不同任务 δS 统计独立、零均值、稀疏
            → 高维浓度现象 → 近似正交
            → ‖δS‖₂ ~10⁻²(小),CosSim ~10⁻⁵
            → 干扰上界 V_i·V_j ~10⁻⁴(方差受限,小)
            → 多阶段更新互不干扰
            → Multi-Stage RL +24.9%(持续提升)
            → Parallel-RL Retention 94.2%(直接相加就有效)
            → Adapted Parallel-RL Retention 103.2%(轻量适应后超过单任务上界)

6.4 反事实推理:去掉关键设计会怎样

论文用消融实验做了反事实验证:

去掉的设计后果反证
去掉优势归一化(退化为 SFT 式加权)干扰上界从 V_i·V_j 退化为 M_i·M_jParallel-SFT Retention 仅 65.4%,证明归一化不可或缺
去掉 on-policy(用固定专家数据)残差 δS 不再独立,正交性丧失SFT 任务间余弦相似度飙到 10⁻¹~1.0
去掉 Parallel-RL 中的某个 ΔW_i该任务性能下降 7.1%,其他任务不变证明 ΔW 之间确实解耦(正交性的直接验证)
去掉 Adapted 的 5% 适应微调Retention 从 103.2% 降到 94.2%(Naive sum)适应微调补回了合并的微小偏差

这些反事实结果都指向同一个结论:RL 的优势归一化 + on-policy 采样是"近似正交"的根源,而近似正交是 Parallel-RL 有效的根源。不是凑巧好,而是结构上必然更好。


七、必要知识反推

假设找一个没有任何背景知识的人来完成这项研究,他必须掌握哪些信息?

7.1 领域知识层:LLM 训练的基本运作机制

必须掌握的知识为什么必须不掌握会怎样
SFT 的工作原理(监督微调、交叉熵损失)这是被对比的两大算法之一无法设置 SFT baseline,无法理解其梯度结构
RLHF/GRPO 的工作原理(策略梯度、优势函数、奖励模型)这是论文的核心算法无法理解"优势归一化零和性质"这一关键机制
LLM 的参数空间维度(1.5B/7B 模型)这是"高维浓度现象"成立的物理基础无法理解为什么残差向量天然正交
灾难性遗忘现象这是多阶段训练的核心痛点无法理解论文要解决的问题有多重要

7.2 方法论知识层:优化与概率理论

必须掌握的知识为什么必须不掌握会怎样
梯度下降与随机梯度下降理解"参数更新 ΔW = −η·g"无法建立梯度到参数几何的桥梁
得分函数(score function)梯度估计RL 梯度的标准形式无法推导 SFT 和 RL 的梯度公式差异
KL 散度与信息投影(I-Projection/M-Projection)理解 RL 收敛性的理论基础(Proposition 4.1)无法解释"RL 为何更新幅度小"
高维概率中的浓度不等式(concentration inequality)证明残差向量近似正交的核心工具无法给出 Theorem 4.5 的 RL 上界
内积分解与残差分析(Lemma 4.3)把 RL 干扰从范数转化为方差的关键步骤无法建立 variance-limited 理论
LoRA 微调机制用于高效训练和参数分析无法复现实验中的参数级观测

7.3 工程知识层:实验与系统实现

必须掌握的知识为什么必须不掌握会怎样
DeepSeek-R1-Distill 系列模型的特性选择合适的基础模型实验结果不可复现、不可比
vLLM/SGLang 等推理加速框架RL 需要大量 on-policy 采样,推理效率是瓶颈RL 训练慢到不可行
多 GPU 并行训练(DDP/FSDP)Parallel-RL 的核心优势是并行无法实现"各任务独立训练"
TIES/SVD 等模型合并算法作为 Parallel-RL 的合并策略对比无法对比不同合并策略
MATH500/AIME/MMLU/GPQA/KK/LCB 评测基准评估模型能力无法衡量效果

7.4 知识融合的关键节点

这项研究的创造性不在于单项知识,而在于几个关键节点上的"化学反应":

融合节点 1:梯度公式差异 → 几何性质差异

  • 单独看 SFT 和 RL 的梯度公式,只是"一个是 off-policy 一个是 on-policy"。
  • 但融合"得分函数分解 + 零和性质",发现 RL 梯度本质上是在"残差子空间"里运作。
  • 这是把代数(零和性质)转化为几何(正交性)的创造性地标。

融合节点 2:高维概率 → 多任务不冲突的保证

  • 单独看"残差 δS 是零均值、独立"这个性质,在低维空间里并不能保证正交。
  • 但融合"LLM 参数空间维度 d~10⁹"这个物理事实,加上浓度不等式,才能得出"以高概率近似正交"。
  • 这是把"统计性质"与"模型规模"结合的洞察——只有在足够大的模型上,RL 的这个优势才充分显现。

融合节点 3:正交性 → Parallel-RL 范式

  • 单独看"RL 更新近似正交",只是一个理论结论。
  • 但融合"线性相加保持正交方向"这个线性代数常识,得出"各任务 ΔW 可以直接相加"。
  • 这是把理论发现转化为工程产出的关键一步——论文没有止步于解释现象,而是利用这个现象设计了一个新的训练范式。

八、论文中可以提取的通用性灵感

灵感 1:范数受限 vs 方差受限——“绝对幅度"与"相对波动"的对偶

核心思想:一个优化过程的干扰大小,可以由两种本质不同的量控制——绝对幅度(范数)或相对波动(方差)。通过设计让干扰从"范数受限"转变为"方差受限”,可以实现数量级的干扰降低。

论文证据:SFT 干扰上界 M_i·M_j ~50(范数受限),RL 干扰上界 V_i·V_j ~10⁻⁴(方差受限),相差 6 个数量级,直接对应了 Multi-Stage SFT −23.1% vs Multi-Stage RL +24.9% 的巨大差距。

推广场景:

  1. 多目标优化:当多个损失函数梯度冲突时,用"相对优势"而非"绝对梯度"做加权,可能降低目标间干扰。
  2. 联邦学习:不同客户端的更新冲突,可借鉴"归一化优势"思路,让更新从范数主导转为方差主导。
  3. 持续学习:缓解灾难性遗忘时,不一定要"冻结关键参数",可以让新任务的更新天然与旧能力正交。
  4. 机器人多技能学习:不同技能的策略更新如果能做到近似正交,就可以并行学习后合并。

灵感 2:高维空间是天然的正交资源——“维度即解耦”

核心思想:在足够高维的空间里,独立的随机方向几乎必然正交。这意味着"只要让不同任务的更新成为独立随机的",高维空间本身就提供了解耦能力,不需要额外的正则化。

论文证据:浓度不等式 $\mathbb{P}(|\langle \delta S_i, \delta S_j \rangle| \geq t) \leq 2\exp(-ct^2 d)$ 显示,正交性概率随维度 d 指数提升。这解释了为什么在 1.5B(d~10⁹)模型上 Parallel-RL 如此有效——维度本身就是资源。

推广场景:

  1. 大模型架构设计:更高维的参数空间不仅是"容量更大",还可能是"天然更适合并行训练"。
  2. 多模态学习:不同模态(视觉、语言、音频)的更新如果能保持独立性,高维空间会让它们自动解耦。
  3. 神经网络集成:多个独立训练的网络合并时,高维性可能让合并几乎无损。
  4. 特征解耦:高维特征空间里,只要特征生成过程独立,就能自动得到解耦表示。

灵感 3:先解耦再合并——“分而治之"的并行范式

核心思想:当一个全局优化问题可以被分解为多个"近似正交"的子问题时,最优策略是让子问题完全独立求解,再合并结果,而非让它们在同一个优化过程里互相干扰。

论文证据:Parallel-RL 把多任务训练分解为 N 个独立 RL 训练(完全并行),再合并 ΔW。相比 Mixed-Data RL(+8.9%),Adapted Parallel-RL 达到 +10.7%,而且 Retention 超过 100%——分而治之不仅没损失,反而更好。

推广场景:

  1. 微服务架构:服务边界划分如果能做到"更新近似正交”,各服务可独立迭代部署。
  2. 模块化课程设计:把知识拆成相互正交的模块并行学习,可能比"螺旋式混合学习"更高效。
  3. 团队分工:任务分解时,如果能保证各子任务的"决策方向"正交,并行团队优于串行流水线。
  4. 数据库分片:按"更新正交性"而非简单按主键分片,可能减少分布式事务冲突。

灵感 4:轻量适应补回合并偏差——“先粗调再精修"的两阶段范式

核心思想:当多个独立训练的结果合并后存在微小偏差时,不需要重新大规模训练,用少量数据做轻量适应微调就能"熨平"偏差,甚至激发协同效应。

论文证据:Naive Parallel-RL (sum) 的 Retention 是 94.2%,而加入 5% 数据的轻量适应后(Adapted Parallel-RL),Retention 提升到 103.2%——超过单任务上界。5% 的数据补回了 6% 的偏差,并额外创造了 3% 的协同。

推广场景:

  1. 模型微调服务:多个定制化微调合并后,用少量用户数据做适应,成本低效果好。
  2. 多语言模型:各语言独立训练后合并,再用少量多语言数据做适应。
  3. 多专家系统集成:各专家模型参数合并后,用少量综合数据做精修。
  4. 个性化推荐:多个用户群体的推荐策略合并后,用少量个体数据快速个性化。

灵感 5:on-policy 是天然的"去相关"机制

核心思想:on-policy 采样(用当前策略自己生成数据)相比 off-policy(用固定外部数据),天然去除了"共享数据偏置”,让不同任务的数据来源统计独立,这是多任务不冲突的隐性前提。

论文证据:SFT 的 off-policy 让不同任务共享"专家分布的偏置",得分函数相关性高(CosSim ~10⁻¹);RL 的 on-policy 让每个任务用自己当前模型生成数据,残差 δS 统计独立,正交性大幅提升(CosSim ~10⁻⁵)。

推广场景:

  1. 数据增强:用模型自身生成的增强数据(on-policy)可能比用固定外部增强数据更适合多任务。
  2. 主动学习:让模型自己选择要标注的数据,天然去相关。
  3. 对话系统:用模型自身对话历史优化策略,比用固定语料更不容易在多任务间冲突。
  4. 自适应控制系统:基于控制器自身采样的数据做优化,多目标间更不容易互相干扰。

附录:关键术语速查

术语全称通俗解释
SFTSupervised Fine-Tuning监督微调,给标准答案让模型模仿
RLReinforcement Learning强化学习,靠奖励信号试错学习
GRPOGroup Relative Policy Optimization组相对策略优化,DeepSeek-R1 用的 RL 算法
ΔW参数更新向量训练前后参数的差值,代表"学到了什么"
L2 范数向量长度ΔW 的"移动距离"
余弦相似度Cosine Similarity两个向量方向的夹角余弦,越接近 0 越正交
优势函数 AAdvantage Function某个答案比平均水平好多少
零和性质Zero-sum Property一组优势函数之和恒为 0
on-policy在策略用当前模型自己生成数据
off-policy离策略用固定的外部数据
KL 散度Kullback-Leibler Divergence两个概率分布的差异度量
浓度不等式Concentration Inequality高维随机向量接近正交的概率保证
LoRALow-Rank Adaptation低秩适应,一种高效微调方法
Retention保留率多任务合并后保留单任务能力的比例
Mixed-Data混合数据多任务数据打乱一起训
Multi-Stage多阶段一个任务接一个任务顺序训
TIESTrIM, Elect, Sign-merge一种模型合并算法(裁剪+选举+符号合并)