论文链接:SFT Conflicts, RL Coexists (arXiv:2608.03573) HTML 全文:arXiv HTML v2 代码仓库:GaryStack/Parallel-RL (GitHub) 发表时间:2026 年(ICML 投稿) 机构:清华大学(作者 Kejian Zhu、Zhuoran Jin、Shangqing Tu、Hongbang Yuan、Yushi Bai、Kang Liu、Juanzi Li、Jun Zhao)
一、论文背景
1.1 大模型为什么需要"多任务训练"
一个能力强的大语言模型(LLM)不能只会做一件事。我们希望它既能解数学题(Math)、又能回答科学常识(Science)、还能写代码(Code)、做逻辑推理(Logic)。这种"同时掌握多种能力"的需求,在学术界叫做多任务学习(Multi-Task Learning)。它被普遍认为是通向更通用人工智能(AGI)的必经之路。
在当前 LLM 的训练流程里,让模型获得推理能力的两大主流方法是:
- SFT(Supervised Fine-Tuning,监督微调):给模型看"题目 + 标准答案"的示范,让它模仿专家的写法。就像给学生看老师写好的解题步骤,照着学。
- RL(Reinforcement Learning,强化学习):让模型自己尝试生成答案,然后用一个"判分函数(奖励函数)“给答案打分,做对了就奖励、做错了就惩罚,模型逐步调整策略。就像让学生自己刷题,做对了加分、做错了扣分,在试错中进步。
1.2 多任务训练的两种工程做法
当要把多个任务一起训给模型时,工程上有两种常见做法:
| 做法 | 中文名 | 直观类比 | 特点 |
|---|---|---|---|
| Mixed-Data(混合数据) | 一锅炖 | 把数学、科学、代码的题目打乱混在一起,每轮随机抽样训练 | 实现简单,但不同任务的梯度可能互相打架 |
| Multi-Stage(多阶段) | 流水线 | 先专门训数学、再专门训科学、再训代码……一个任务接一个任务地学 | 灵活可控,但容易"学了新的忘旧的”(灾难性遗忘) |
1.3 一个令人困惑的实践现象
研究者发现了一个反直觉的现象:
- 用 SFT 做多阶段训练(先训 A 再训 B 再训 C),模型性能严重崩溃——相比基础模型平均下降 23.1%。
- 而用 RL 做同样的多阶段训练,模型性能反而持续提升——相比基础模型平均提升 24.9%。
这就像两个学生,用同样的"流水线"学习顺序,一个越学越差,一个越学越好。为什么会这样?这正是本论文要回答的核心问题。
理解这个差异非常重要:如果多阶段训练会崩溃,我们就得花大量算力去做混合数据训练(数据配比、调度都很麻烦);如果多阶段训练能稳定变好,我们就可以放心地"分而治之",每个任务单独训练再合并,效率高得多。
二、论文定位和关联工作
2.1 研究脉络:SFT 与 RL 的对比
关于 SFT 和 RL 的差异,学术界已经有一些前期探索,但这些工作主要关注单任务场景:
| 研究谱系 | 代表工作 | 核心观点 | 与本论文的关键区别 |
|---|---|---|---|
| 行为差异类 | Chu et al. (2025) “SFT memorizes, RL generalizes” | SFT 倾向于记忆训练数据,RL 倾向于泛化 | 只在单任务层面观察,未触及多任务冲突机制 |
| 能力变化类 | Matsutani et al. (2025) “RL squeezes, SFT expands” | RL"挤压"模型输出分布,SFT"扩张"分布 | 未从参数更新几何角度解释 |
| 参数稀疏性类 | Mukherjee et al. (2025) | RL 只微调模型的一个小子网络 | 未系统对比 SFT 与 RL 的更新幅度 |
| RL 遗忘理论 | Shenfeld et al. (2025) “RL’s Razor” | RL 由于隐式 KL 约束最小化参数偏差 | 本论文直接借鉴其 KL 投影理论 |
| SFT+RL 结合 | Zhang et al. (2025)、Fu et al. (2025) SRFT | 单阶段融合 off-policy 和 on-policy | 关注的是"怎么训得更好",而非"多任务冲突的本质原因" |
2.2 本论文的独特定位
本论文是首次系统性地从理论和经验角度研究"多任务训练中 SFT 和 RL 差异"的工作。
之前的所有工作要么只看单任务,要么只比较"学到了什么",而本论文直击一个更根本的问题:当多个任务的更新叠加在一起时,SFT 和 RL 在参数空间里的几何行为有何本质不同? 这就像别人在研究"两个学生谁学得好",而本论文在研究"两个学生在学新东西时,脑子里旧知识的存储结构有什么不同,为什么一个会被覆盖、另一个不会"。
2.3 本论文的突破
| 维度 | 之前的路线 | 本论文的突破 |
|---|---|---|
| 研究场景 | 单任务 SFT vs RL | 多任务 SFT vs RL |
| 分析层次 | 行为/能力层面 | 参数几何 + 理论上界层面 |
| 解释机制 | 经验观察 | norm-limited vs variance-limited 理论 |
| 应用产出 | 训练技巧 | Parallel-RL 范式(解耦多任务训练) |
三、问题定义
3.1 从具体现象到抽象问题
具体现象:用 SFT 和 RL 做多阶段多任务训练,效果天差地别(SFT 崩溃 -23.1%,RL 提升 +24.9%)。
直觉猜测:可能是"学新任务时覆盖了旧任务"?但这个说法太模糊,无法解释"为什么 RL 不覆盖而 SFT 会覆盖"。
论文的核心洞察:问题不在"覆盖",而在于不同任务引起的参数更新向量(ΔW)在几何上是否相互冲突。这把一个模糊的认知问题,转化为一个清晰的几何与优化问题。
3.2 类比:参数更新向量 ≈ 高维空间中的"位移"
把模型的所有参数想象成生活在一个非常高维的空间里(一个 1.5B 的模型,参数空间维度约 15 亿维)。训练一个任务,就相当于让参数从起点 W_base 沿着一个方向移动一段距离,到达一个新的位置。这个"移动"就是一个向量 ΔW = W_trained - W_base。
- ΔW 的长度(L2 范数):移动了多远。
- 两个任务 ΔW 之间的余弦相似度:两个移动方向是同向(cos≈1)、反向(cos≈-1)还是正交(cos≈0)。
如果两个任务的 ΔW 方向接近正交(cos≈0),那么先训任务 A 再训任务 B,相当于"先往东走,再往北走",两条路径互不干扰。如果两个任务的 ΔW 方向接近反向(cos≈-1),那就是"先往东走,再被拉回西走",旧任务的能力被冲掉。
3.3 形式化问题定义
给定:
- 基础模型参数 W_base
- N 个任务 T_1, …, T_N,每个任务有训练数据 D_i
- 两种训练算法:SFT 和 RL
每个任务训练后产生参数更新:ΔW_i = W_i - W_base
核心问题:对于 SFT 和 RL,
- ΔW_i 的幅度(L2 范数)有多大?
- 不同任务的 ΔW_i、ΔW_j 之间的余弦相似度分布如何?
- 多任务梯度干扰 $\mathcal{I}(i,j) = \langle g_i, g_j \rangle$ 的理论上界由什么决定?
- 能否利用这些几何性质,设计更高效的多任务训练范式?
3.4 这个抽象的精妙之处
这个抽象把"多任务学习为什么会冲突"这个看似玄学的问题,变成了一个可以用尺子(范数)和量角器(余弦相似度)测量的几何问题,进一步又变成了一个可以用概率不等式证明的理论问题。它排除了"数据质量"“学习率调参"“模型架构"等外部干扰,直击参数更新的几何本质。
四、问题解法
本论文的解法分三层:经验观测 → 理论解释 → 工程应用。我们逐层展开。
4.1 第一层:参数级经验观测(“用尺子和量角器量一下”)
作者对每个任务训练后计算 ΔW_i,然后测量两个几何属性:
观测 1:RL 更新的幅度极小且稀疏
| 指标 | SFT | RL | 差距 |
|---|---|---|---|
| ΔW 平均 L2 范数 | ~7.4 | ~3×10⁻² | 超过两个数量级 |
| 幅度超过 10⁻⁵ 的参数比例 | 93% | ~20% | RL 更新非常稀疏 |
这意味着什么:SFT 训练时参数"大动”,几乎改动所有参数;RL 训练时参数"微调”,只改动约 20% 的参数,而且改动量极小。
观测 2:RL 不同任务的优化方向近似正交
| 指标 | SFT | RL |
|---|---|---|
| 不同任务间 ΔW 余弦相似度 | ~10⁻¹ 至 1.0 | ~10⁻⁵ |
这意味着什么:SFT 不同任务的更新方向甚至可能完全相反(互相打架);RL 不同任务的更新方向几乎两两垂直(互不打扰)。这就解释了为什么 RL 多阶段训练能稳定累积——每学一个新任务,都像在一个新方向上延伸,不会冲掉旧方向上的能力。
4.2 第二层:理论分析(“为什么会这样”)
光观测不够,论文进一步从数学上证明了为什么 RL 的更新小而正交,SFT 的更新大而冲突。核心是理解 SFT 和 RL 梯度公式的两个根本区别。
4.2.1 SFT 与 RL 的梯度公式对比
| 维度 | SFT 梯度 | RL 梯度(以 GRPO 为例) |
|---|---|---|
| 梯度公式 | $g_{\text{SFT}} = \mathbb{E}[\nabla_\theta \log \pi_\theta(y\|x)]$ | $g_{\text{RL}} = \mathbb{E}[A(x,y) \nabla_\theta \log \pi_\theta(y\|x)]$ |
| 策略来源 | y 来自固定的专家分布 π_expert(off-policy) | y 来自当前模型 π_θ(on-policy) |
| 加权项 | 无(每条专家样本权重相同) | 有优势函数 A(x,y) 做加权 |
| 得分函数范数 | ‖S‖₂ ~7.1(大) | ‖S‖₂ ~10⁻¹(小) |
什么是优势函数 A(x,y):在一个题目 x 上,模型生成一组答案,有的对有的错。优势函数衡量"这个答案比平均水平好多少"——做对了的 A>0,做错了的 A<0,且一组的优势函数之和恒为 0(零和性质)。
4.2.2 RL 更新为何小而稀疏:KL 投影理论
论文援引 Shenfeld et al. (2025) 的 Proposition 4.1:RL(用二值奖励的策略梯度)收敛到的解,是在所有"奖励=1"的最优策略集合中,与初始策略 π_0 在 KL 散度意义上最近的那个。
直观理解:RL 不是"想怎么改就怎么改",而是"在所有能达到好成绩的策略里,选一个离出发点最近的"。这就像你在迷宫里找出口,RL 会选离起点最近的那条出口,而不是绕一大圈。
这个过程被刻画为两阶段交替投影:
- I-Projection:把当前策略拉到"所有奖励=1 的策略集合"里(向正确答案靠拢)。
- M-Projection:再把策略拉回"模型参数能表示的范围"里(这步反映了 on-policy 的作用,保证策略始终能被模型实际表达)。
这两步反复迭代,最终结果就是"参数改动尽可能小,又能拿到奖励"。这从理论上解释了 RL 的 ΔW 范数为什么只有 ~3×10⁻²。
4.2.3 RL 多任务梯度干扰为何小:方差受限 vs 范数受限
这是论文最核心的理论贡献。作者证明了 GRPO 的优势函数有一个关键性质——零和性质:
$$\sum_{k=1}^{G} \hat{A}_{i,k}(x) = 0$$这意味着:在一组采样里,好的答案和差的答案的优势函数相互抵消。利用这个性质,作者把 RL 的多任务梯度内积分解为:
$$\mathcal{I}_{\text{RL}}(i,j) = \mathbb{E}\left[\frac{1}{G^2}\sum_{k,l} \hat{A}_{i,k}\hat{A}_{j,l} \langle \delta S_{i,k}(x), \delta S_{j,l}(x') \rangle\right]$$其中 δS 是残差得分函数(每个 rollout 的得分函数减去组内平均得分函数)。
两个关键机制:
| 机制 | 作用 | 直观类比 |
|---|---|---|
| 优势归一化(零和) | 代数上消去了平均梯度方向 S̄,把得分函数内积转化为残差内积 ⟨δS_i, δS_j⟩ | 把"所有力的合力"换成"力的波动部分" |
| on-policy 采样 | 残差 δS 捕获的是同一输入下 G 个 rollout 之间的"组内分歧",这个分歧天然有界;不同任务的 δS 是独立、零均值、稀疏的高维向量,在高维空间里以高概率近似正交 | 高维空间里随机方向的两根针,几乎一定是互相垂直的(浓度现象) |
浓度不等式(高维近似正交的数学保证):
$$\mathbb{P}(|\langle \delta S_i, \delta S_j \rangle| \geq t) \leq 2\exp(-ct^2 d)$$其中 d 是参数空间维度(~10⁹)。维度越高,两个独立随机向量越接近正交。这就是为什么在几十亿参数的大模型里,RL 的任务间干扰几乎可以忽略。
4.2.4 主定理(Theorem 4.5):干扰上界
设假设 4.4 成立:
| 量 | 定义 | 实测值 |
|---|---|---|
| $M_i$ | SFT 得分函数范数的期望平方根 $\sqrt{\mathbb{E}[\|S_i^*\|^2]}$ | ~7.1 |
| $V_i$ | RL 残差得分函数方差 $\sqrt{\mathbb{E}[\frac{1}{G}\sum_k \|\delta S_{i,k}\|^2]}$ | ~10⁻² |
则多任务梯度干扰的上界为:
| 算法 | 上界 | 类型 | 本质 |
|---|---|---|---|
| SFT | $\|\mathcal{I}_{\text{SFT}}(i,j)\| \leq M_i \cdot M_j$ | 范数受限(norm-limited) | 由得分函数的绝对幅度控制(大) |
| RL | $\|\mathcal{I}_{\text{RL}}(i,j)\| \leq V_i \cdot V_j$ | 方差受限(variance-limited) | 由组内残差的方差控制(小) |
这个定理的精妙之处:SFT 的干扰上界正比于得分函数的"绝对大小"(大数),RL 的干扰上界正比于"组内波动大小"(小数)。这就是为什么 SFT 冲突严重而 RL 近乎无冲突的根本原因——不是经验现象,而是数学结构上必然如此。
4.2.5 理论的定量验证
| 指标 | SFT | RL | 理论预测 |
|---|---|---|---|
| ‖S‖₂(得分函数范数) | ~7.1 | ~10⁻¹ | SFT 大、RL 小 ✅ |
| ‖δS‖₂(残差范数) | — | ~10⁻² | RL 受方差约束 ✅ |
| CosSim(S_i, S_j) | ~10⁻¹ | ~10⁻³ | RL 更接近正交 ✅ |
实测与理论预测高度吻合。
4.3 第三层:Parallel-RL 工程范式(“利用这个性质做点什么”)
既然 RL 不同任务的 ΔW 近似正交,那么干扰项 ⟨ΔW_i, ΔW_j⟩ ≈ 0。这意味着:把各任务独立训练得到的 ΔW_i 直接加起来,效果应该接近多阶段顺序训练——而且还能并行执行,效率高得多。
4.3.1 Parallel-RL 的核心公式
$$W_{final} = W_{base} + \mathcal{M}(\Delta W_1, \Delta W_2, \dots, \Delta W_N)$$其中 ℳ 是合并函数,N 个任务的 ΔW_i 可以并行获得(都从同一个 W_base 出发独立训练)。
4.3.2 五种合并策略对比
| 策略 | 合并函数 ℳ | 直观类比 | 复杂度 |
|---|---|---|---|
| Naive sum | $\sum_i \Delta W_i$ | 直接把所有方向的位移相加 | 最低 |
| Naive mean | $\frac{1}{N}\sum_i \Delta W_i$ | 取平均位移 | 最低 |
| TIES | 用 TIES 算法(Yadav et al., 2023)处理冲突 | 先裁剪再解决符号冲突再平均 | 中 |
| SVD | 每个 ΔW 做 SVD,只保留 rank-1 方向 | 只保留每个任务最主要的更新方向 | 中 |
| Adapted Parallel-RL | Naive sum 之后,用 5% 训练数据做快速适应微调 | 合并后再做一次"轻量校准" | 较高但效果最好 |
Adapted Parallel-RL 为何最优:直接相加虽然因为近似正交而干扰小,但仍有微小偏差;用 5% 数据做一次轻量微调,就能把这些微小偏差"熨平",甚至因为多任务数据的轻微交互而超过单任务 RL 的上限(Retention > 100%)。
4.3.3 Parallel-RL 相对传统范式的优势
| 维度 | 混合数据训练(Mixed-Data) | 多阶段训练(Multi-Stage) | Parallel-RL |
|---|---|---|---|
| 训练并行度 | 串行(一个大数据集) | 串行(N 个阶段) | 完全并行(N 个任务同时训) |
| 任务解耦 | 否(数据混杂) | 部分(阶段切换) | 完全解耦(各任务独立) |
| 任务可插拔 | 困难(需重训) | 困难(需重排) | 简单(新任务独立训,合并 ΔW) |
| 适用于 SFT | 可行 | 崩溃 | 不适用(SFT 更新冲突大) |
| 适用于 RL | 可行 | 可行且有效 | 最优(RL 更新近似正交) |
4.3.4 全景方法对比表
| 方法 | 核心机制 | 训练方式 | 理论保证 | 适用算法 |
|---|---|---|---|---|
| Mixed-Data SFT | 数据混合 | 串行 | 无 | SFT |
| Multi-Stage SFT | 顺序训练 | 串行 | 易崩溃 | SFT |
| Mixed-Data RL | 数据混合 | 串行 | 干扰中等 | RL |
| Multi-Stage RL | 顺序训练 | 串行 | 干扰小(variance-limited) | RL |
| Parallel-RL | 独立训练 + 合并 | 并行 | 干扰可忽略(正交性) | RL |
| Adapted Parallel-RL | 独立训练 + 合并 + 轻量适应 | 并行 + 微调串行 | 干扰最小 | RL |
五、评估指标与实验证据
5.1 评估指标体系
论文用三层指标来全面验证论点:
| 指标层级 | 指标名 | 定义 | 衡量的本质能力 |
|---|---|---|---|
| 主指标 | 各基准准确率 (%) | 在 MATH500/AIME/MMLU/GPQA/KK/LCB 上的答题正确率 | 模型在数学/科学/逻辑/代码任务上的实际推理能力 |
| 主指标 | ΔBase | 方法得分 − 基础模型得分的平均提升 | 方法相对基础模型的整体增益 |
| 主指标 | Retention (%) | 多任务方法得分 / 单任务 RL 得分 | 多任务合并后保留了多少"单任务专家"的能力 |
| 辅助指标 | ΔW 的 L2 范数 | 参数更新向量的长度 | 训练改动了多少参数 |
| 辅助指标 | 任务间余弦相似度 | 不同任务 ΔW 的夹角余弦 | 任务更新是否方向冲突 |
| 理论指标 | ‖S‖₂、‖δS‖₂、CosSim(S_i,S_j) | 得分函数范数、残差范数、得分函数相似度 | 验证 norm-limited vs variance-limited 理论 |
| 消融指标 | Δ_Target、Δ_Others | 移除某任务 ΔW 后该任务/其他任务的变化 | 验证 Parallel-RL 是否真的解耦了各任务 |
Retention 的意义:如果 Retention = 100%,说明合并后完全保留了单任务专家的能力;如果 >100%,说明合并甚至产生了正向协同(1+1>2);如果 <100%,说明合并有损失。这是衡量"多任务训练范式好坏"的最直观指标。
5.2 实验数据集与基准
| 领域 | 基准 | 规模/特点 | 为什么选它 |
|---|---|---|---|
| 数学(基础) | MATH500 | 500 道高中竞赛级数学题 | 衡量基础数学推理 |
| 数学(困难) | AIME 2025 | 美国数学邀请赛,极难 | 衡量高难度数学推理 |
| 科学 | MMLU | 多学科选择题 | 衡量广度知识 |
| 科学(困难) | GPQA | 研究生级科学题 | 衡量深度科学推理 |
| 逻辑 | Knights & Knaves (KK) | 骑士与无赖逻辑谜题 | 衡量形式逻辑推理 |
| 代码 | LiveCodeBench (LCB) | 实时编程题 | 衡量代码生成能力 |
基础模型:DeepSeek-R1-Distill-Qwen-1.5B 和 7B(开源蒸馏推理模型,当前主流的推理能力研究底座)。
训练算法:RL 用 GRPO(Group Relative Policy Optimization,组相对策略优化),这是 DeepSeek-R1 用的主流 RL 算法。
5.3 核心实验 1:SFT vs RL 的多任务行为对比(Table 1)
这个实验直接证明了"SFT 冲突、RL 共存"的核心论点。
| 策略 | Math | Science | Logic | Code | 平均变化 |
|---|---|---|---|---|---|
| Base Model | 83.1 | 34.9 | 31.0 | 15.0 | — |
| Mixed Data SFT | 84.6 (↑1.5) | 38.9 (↑4.0) | 34.0 (↑3.0) | 16.0 (↑1.0) | +7.4% |
| Multi Stage SFT | 78.2 (↓4.9) | 31.1 (↓3.8) | 9.0 (↓22.0) | 14.3 (↓0.7) | −23.1% |
| Mixed Data RL | 85.2 (↑2.1) | 43.2 (↑8.3) | 37.0 (↑6.0) | 15.7 (↑0.7) | +12.6% |
| Multi Stage RL | 86.6 (↑3.5) | 49.3 (↑14.4) | 43.0 (↑12.0) | 17.3 (↑2.3) | +24.9% |
关键对比:
- Multi-Stage SFT 的 Logic 任务从 31.0 暴跌到 9.0(↓22.0),几乎丧失逻辑能力——典型的灾难性遗忘。
- Multi-Stage RL 的 Logic 任务反而从 31.0 提升到 43.0(↑12.0)——新任务训练不但没冲掉旧能力,反而有正向迁移。
- 同样是多阶段训练,SFT 和 RL 的平均变化相差 47 个百分点(−23.1% vs +24.9%)。
这个实验如何证明论点:它直接展示了在完全相同的训练范式(多阶段)下,SFT 和 RL 表现出截然相反的多任务行为,证明冲突与否是算法本身的性质,而非训练流程的问题。
5.4 核心实验 2:单任务训练的泛化性(Table 2)
这个实验进一步验证:即使只训一个任务,SFT 也会伤害其他任务,RL 则不会。
以 Math 单任务训练为例:
| 训练算法 | Math(目标) | Science | Logic | Code |
|---|---|---|---|---|
| Math SFT | 84.4 (↑2.4) | 28.0 (↓6.9) | 15.0 (↓16.0) | 12.4 (↓2.6) |
| Math RL | 85.6 (↑3.6) | 42.5 (↑7.6) | 33.0 (↑2.0) | 15.6 (↑0.6) |
关键对比:
- Math SFT:数学提升 2.4%,但逻辑暴跌 16.0%——SFT 的更新方向与其他任务能力"反向"。
- Math RL:数学提升 3.6%,同时科学、逻辑、代码全部提升——RL 的更新方向与其他任务能力"正交甚至同向"。
汇总所有单任务训练:
- SFT:目标任务平均 +4.0%,其他任务平均 −5.1%
- RL:目标任务平均 +6.8%,其他任务平均 **+2.3%
5.5 核心实验 3:Parallel-RL 主结果(Table 4)
这是 Parallel-RL 范式的核心证明。在 DeepSeek-R1-Distill-Qwen-1.5B 上:
| 方法 | MATH500 | AIME | MMLU | GPQA | KK | LCB | ΔBase | Retention |
|---|---|---|---|---|---|---|---|---|
| Base Model | 82.0 | 26.9 | 34.9 | 32.3 | 31.0 | 15.0 | — | — |
| Single-Task RL(上界参考) | 87.4 | 32.7 | 51.8 | 39.9 | 44.0 | 21.6 | +9.3 | — |
| Mixed Data RL | 87.0 | 32.9 | 50.9 | 38.9 | 45.0 | 20.7 | +8.9 | — |
| Multi Stage RL | 87.8 | 33.1 | 52.8 | 40.4 | 48.0 | 21.0 | +10.2 | — |
| Naive Parallel-SFT (sum) | 61.2 | 20.0 | 25.9 | 26.8 | 23.0 | 10.1 | −9.2 | 65.4 |
| Naive Parallel-RL (sum) | 86.4 | 32.3 | 48.0 | 37.4 | 39.0 | 18.4 | +6.6 | 94.2 |
| TIES Parallel-RL | 87.6 | 32.5 | 49.2 | 38.4 | 43.0 | 19.7 | +8.0 | 97.4 |
| Adapted Parallel-RL | 88.6 | 33.8 | 50.9 | 41.4 | 49.0 | 22.5 | +10.7 | 103.2 |
如何解读这个表证明论点:
- Parallel-SFT 彻底失败(Retention 65.4%,ΔBase −9.2%)——因为 SFT 的 ΔW 冲突大,直接相加会互相破坏。这反证了"只有更新近似正交时才能合并"。
- Naive Parallel-RL 已保留 94.2%——直接相加就能接近单任务 RL 的效果,证明 RL 的 ΔW 确实近似正交。
- TIES/SVD 提升到 97%+——用更精细的合并算法进一步减少微小干扰。
- Adapted Parallel-RL 达到 103.2%——超过单任务 RL 上界,说明轻量适应不仅补回了损失,还激发了多任务协同。
在 7B 模型上同样规律成立(Adapted Parallel-RL: ΔBase +8.0%,Retention 102.4%),证明方法可扩展。
5.6 核心实验 4:消融实验(Table 5)——证明任务真的被解耦了
这个消融非常巧妙:从完整的 Parallel-RL(包含所有任务的 ΔW)中移除某一个任务的 ΔW_i,看对应任务和其他任务的性能变化。
| 配置 | MATH500 | MMLU | KK | LCB | 被移除任务的 Δ | 其他任务 Δ |
|---|---|---|---|---|---|---|
| 完整 Parallel-RL | 86.4 | 48.0 | 39.0 | 18.4 | — | — |
| 移除 Math 的 ΔW | 82.8 | 47.8 | 41.0 | 19.2 | −3.6 | +0.9 |
| 移除 Science 的 ΔW | 86.0 | 37.5 | 39.0 | 18.4 | −10.5 | −0.1 |
| 移除 Logic 的 ΔW | 85.6 | 49.6 | 30.0 | 20.3 | −9.0 | +0.9 |
| 移除 Code 的 ΔW | 88.2 | 46.9 | 40.0 | 13.1 | −5.3 | +0.6 |
如何解读:
- 移除某任务的 ΔW,该任务性能显著下降(平均 −7.1%),证明这个 ΔW 确实专属于该任务。
- 其他任务性能几乎不受影响(平均 +0.6%),证明任务之间确实做到了解耦。
- 这就像抽掉一本书的某一章,只有那一章的内容没了,其他章完好无损——说明 Parallel-RL 把每个任务的能力"封装"在了各自的 ΔW 里。
六、效果优势的根源解释
本节建立完整的因果链:方法差异 → 参数更新几何变化 → 理论边界差异 → 指标提升。禁止泛泛而谈,每一步都要可验证。
6.1 baseline 的根本局限:为什么传统多任务训练会出问题
传统多任务训练(无论是 Mixed-Data 还是 Multi-Stage)的根本局限在于:它假设不同任务的梯度可以"叠加"而不互相破坏,但这个假设对 SFT 不成立。
SFT 的根本瓶颈:SFT 梯度 $g_{\text{SFT}} = \mathbb{E}[\nabla \log \pi(y|x)]$ 中,每条专家样本贡献的方向是"把概率往专家答案上拉"。不同任务的专家答案分布差异巨大(数学要拉向数字推导,科学要拉向知识陈述),导致:
- 这些"拉力"方向在参数空间里经常冲突(余弦相似度 ~10⁻¹,甚至为负)。
- 而且 SFT 的拉力没有归一化,幅度由得分函数范数 M_i 决定(~7.1,很大)。
- 大幅度 + 方向冲突 = 灾难性干扰。多阶段训练时,后一个任务的大幅度更新会直接覆盖前一个任务。
这不是"调参不好"或"数据不够"的问题,而是 SFT 梯度结构的内在缺陷:off-policy + 无优势加权。
6.2 本文方法的根本性改变:RL 改变了什么
本文不是"引入了 RL 所以好",而是要追溯到:RL 的哪两个结构性质,改变了对多任务干扰的约束。
改变 1:优势归一化(零和性质)——把"合力"换成"波动"
| 环节 | SFT | RL(GRPO) |
|---|---|---|
| 梯度方向 | 平均得分函数 S̄(指向"专家分布") | 残差得分函数 δS(捕获"组内分歧") |
| 干扰上界控制量 | M_i(绝对范数,大) | V_i(组内方差,小) |
机制因果:GRPO 的优势函数 $\hat{A}_{i,k} = (r_{i,k} - \mu_r)/\sigma_r$ 满足 $\sum_k \hat{A}_{i,k} = 0$。这个零和性质在代数上消去了平均梯度方向 S̄ 的贡献(Lemma 4.3),把多任务干扰从"得分函数内积 ⟨S_i, S_j⟩“降为"残差内积 ⟨δS_i, δS_j⟩"。
为什么残差更小:δS 衡量的是"同一题目下,不同 rollout 之间的得分函数差异”——也就是模型在自己生成的几个答案之间的分歧。这个分歧天然有界(因为输入和参数在生成时是固定的),远小于 SFT 中"专家答案 vs 模型当前分布"的巨大差距。
指标对应:这一改变体现在 ‖δS‖₂ ~10⁻² ≪ ‖S‖₂ ~7.1 上(Table 3),直接把干扰上界从 ~50 量级(M_i·M_j)压到 ~10⁻⁴ 量级(V_i·V_j)。
改变 2:on-policy 采样——让不同任务的残差"天然正交"
| 环节 | SFT(off-policy) | RL(on-policy) |
|---|---|---|
| 样本来源 | 固定的专家数据集 | 当前模型自己生成 |
| 不同任务残差的关系 | 共享同一个"专家偏置"方向,相关性高 | 各自独立采样,统计独立 |
| 高维几何 | 相关向量难以正交 | 独立、零均值、稀疏向量在高维空间以高概率正交 |
机制因果:on-policy 意味着每个任务的 rollout 都是用"当前模型在该任务数据上"生成的,不同任务的 rollout 之间没有共享的专家偏置。因此 δS_i 和 δS_j 是统计独立、零均值、稀疏的高维随机向量。根据浓度不等式 $\mathbb{P}(|\langle \delta S_i, \delta S_j \rangle| \geq t) \leq 2\exp(-ct^2 d)$,在 d~10⁹ 维空间里,两个这样的向量几乎必然近似正交。
指标对应:这一改变体现在"任务间 ΔW 余弦相似度"上——RL ~10⁻⁵(几乎完美正交)vs SFT ~10⁻¹ 至 1.0(高度相关甚至冲突)。
6.3 完整因果链汇总
把上面的分析串成一条从方法到指标的因果链:
方法差异(SFT vs RL)
│
├─ SFT: off-policy + 无优势加权
│ → 梯度 = 平均得分函数 S̄
│ → 不同任务 S̄ 方向冲突(共享专家偏置)
│ → ‖S‖₂ ~7.1(大),CosSim ~10⁻¹
│ → 干扰上界 M_i·M_j ~50(范数受限,大)
│ → 多阶段更新互相覆盖
│ → Multi-Stage SFT −23.1%(崩溃)
│ → Parallel-SFT Retention 65.4%(合并失败)
│
└─ RL: on-policy + 优势归一化(零和)
→ 梯度 = 残差得分函数 δS
→ 不同任务 δS 统计独立、零均值、稀疏
→ 高维浓度现象 → 近似正交
→ ‖δS‖₂ ~10⁻²(小),CosSim ~10⁻⁵
→ 干扰上界 V_i·V_j ~10⁻⁴(方差受限,小)
→ 多阶段更新互不干扰
→ Multi-Stage RL +24.9%(持续提升)
→ Parallel-RL Retention 94.2%(直接相加就有效)
→ Adapted Parallel-RL Retention 103.2%(轻量适应后超过单任务上界)
6.4 反事实推理:去掉关键设计会怎样
论文用消融实验做了反事实验证:
| 去掉的设计 | 后果 | 反证 |
|---|---|---|
| 去掉优势归一化(退化为 SFT 式加权) | 干扰上界从 V_i·V_j 退化为 M_i·M_j | Parallel-SFT Retention 仅 65.4%,证明归一化不可或缺 |
| 去掉 on-policy(用固定专家数据) | 残差 δS 不再独立,正交性丧失 | SFT 任务间余弦相似度飙到 10⁻¹~1.0 |
| 去掉 Parallel-RL 中的某个 ΔW_i | 该任务性能下降 7.1%,其他任务不变 | 证明 ΔW 之间确实解耦(正交性的直接验证) |
| 去掉 Adapted 的 5% 适应微调 | Retention 从 103.2% 降到 94.2%(Naive sum) | 适应微调补回了合并的微小偏差 |
这些反事实结果都指向同一个结论:RL 的优势归一化 + on-policy 采样是"近似正交"的根源,而近似正交是 Parallel-RL 有效的根源。不是凑巧好,而是结构上必然更好。
七、必要知识反推
假设找一个没有任何背景知识的人来完成这项研究,他必须掌握哪些信息?
7.1 领域知识层:LLM 训练的基本运作机制
| 必须掌握的知识 | 为什么必须 | 不掌握会怎样 |
|---|---|---|
| SFT 的工作原理(监督微调、交叉熵损失) | 这是被对比的两大算法之一 | 无法设置 SFT baseline,无法理解其梯度结构 |
| RLHF/GRPO 的工作原理(策略梯度、优势函数、奖励模型) | 这是论文的核心算法 | 无法理解"优势归一化零和性质"这一关键机制 |
| LLM 的参数空间维度(1.5B/7B 模型) | 这是"高维浓度现象"成立的物理基础 | 无法理解为什么残差向量天然正交 |
| 灾难性遗忘现象 | 这是多阶段训练的核心痛点 | 无法理解论文要解决的问题有多重要 |
7.2 方法论知识层:优化与概率理论
| 必须掌握的知识 | 为什么必须 | 不掌握会怎样 |
|---|---|---|
| 梯度下降与随机梯度下降 | 理解"参数更新 ΔW = −η·g" | 无法建立梯度到参数几何的桥梁 |
| 得分函数(score function)梯度估计 | RL 梯度的标准形式 | 无法推导 SFT 和 RL 的梯度公式差异 |
| KL 散度与信息投影(I-Projection/M-Projection) | 理解 RL 收敛性的理论基础(Proposition 4.1) | 无法解释"RL 为何更新幅度小" |
| 高维概率中的浓度不等式(concentration inequality) | 证明残差向量近似正交的核心工具 | 无法给出 Theorem 4.5 的 RL 上界 |
| 内积分解与残差分析(Lemma 4.3) | 把 RL 干扰从范数转化为方差的关键步骤 | 无法建立 variance-limited 理论 |
| LoRA 微调机制 | 用于高效训练和参数分析 | 无法复现实验中的参数级观测 |
7.3 工程知识层:实验与系统实现
| 必须掌握的知识 | 为什么必须 | 不掌握会怎样 |
|---|---|---|
| DeepSeek-R1-Distill 系列模型的特性 | 选择合适的基础模型 | 实验结果不可复现、不可比 |
| vLLM/SGLang 等推理加速框架 | RL 需要大量 on-policy 采样,推理效率是瓶颈 | RL 训练慢到不可行 |
| 多 GPU 并行训练(DDP/FSDP) | Parallel-RL 的核心优势是并行 | 无法实现"各任务独立训练" |
| TIES/SVD 等模型合并算法 | 作为 Parallel-RL 的合并策略对比 | 无法对比不同合并策略 |
| MATH500/AIME/MMLU/GPQA/KK/LCB 评测基准 | 评估模型能力 | 无法衡量效果 |
7.4 知识融合的关键节点
这项研究的创造性不在于单项知识,而在于几个关键节点上的"化学反应":
融合节点 1:梯度公式差异 → 几何性质差异
- 单独看 SFT 和 RL 的梯度公式,只是"一个是 off-policy 一个是 on-policy"。
- 但融合"得分函数分解 + 零和性质",发现 RL 梯度本质上是在"残差子空间"里运作。
- 这是把代数(零和性质)转化为几何(正交性)的创造性地标。
融合节点 2:高维概率 → 多任务不冲突的保证
- 单独看"残差 δS 是零均值、独立"这个性质,在低维空间里并不能保证正交。
- 但融合"LLM 参数空间维度 d~10⁹"这个物理事实,加上浓度不等式,才能得出"以高概率近似正交"。
- 这是把"统计性质"与"模型规模"结合的洞察——只有在足够大的模型上,RL 的这个优势才充分显现。
融合节点 3:正交性 → Parallel-RL 范式
- 单独看"RL 更新近似正交",只是一个理论结论。
- 但融合"线性相加保持正交方向"这个线性代数常识,得出"各任务 ΔW 可以直接相加"。
- 这是把理论发现转化为工程产出的关键一步——论文没有止步于解释现象,而是利用这个现象设计了一个新的训练范式。
八、论文中可以提取的通用性灵感
灵感 1:范数受限 vs 方差受限——“绝对幅度"与"相对波动"的对偶
核心思想:一个优化过程的干扰大小,可以由两种本质不同的量控制——绝对幅度(范数)或相对波动(方差)。通过设计让干扰从"范数受限"转变为"方差受限”,可以实现数量级的干扰降低。
论文证据:SFT 干扰上界 M_i·M_j ~50(范数受限),RL 干扰上界 V_i·V_j ~10⁻⁴(方差受限),相差 6 个数量级,直接对应了 Multi-Stage SFT −23.1% vs Multi-Stage RL +24.9% 的巨大差距。
推广场景:
- 多目标优化:当多个损失函数梯度冲突时,用"相对优势"而非"绝对梯度"做加权,可能降低目标间干扰。
- 联邦学习:不同客户端的更新冲突,可借鉴"归一化优势"思路,让更新从范数主导转为方差主导。
- 持续学习:缓解灾难性遗忘时,不一定要"冻结关键参数",可以让新任务的更新天然与旧能力正交。
- 机器人多技能学习:不同技能的策略更新如果能做到近似正交,就可以并行学习后合并。
灵感 2:高维空间是天然的正交资源——“维度即解耦”
核心思想:在足够高维的空间里,独立的随机方向几乎必然正交。这意味着"只要让不同任务的更新成为独立随机的",高维空间本身就提供了解耦能力,不需要额外的正则化。
论文证据:浓度不等式 $\mathbb{P}(|\langle \delta S_i, \delta S_j \rangle| \geq t) \leq 2\exp(-ct^2 d)$ 显示,正交性概率随维度 d 指数提升。这解释了为什么在 1.5B(d~10⁹)模型上 Parallel-RL 如此有效——维度本身就是资源。
推广场景:
- 大模型架构设计:更高维的参数空间不仅是"容量更大",还可能是"天然更适合并行训练"。
- 多模态学习:不同模态(视觉、语言、音频)的更新如果能保持独立性,高维空间会让它们自动解耦。
- 神经网络集成:多个独立训练的网络合并时,高维性可能让合并几乎无损。
- 特征解耦:高维特征空间里,只要特征生成过程独立,就能自动得到解耦表示。
灵感 3:先解耦再合并——“分而治之"的并行范式
核心思想:当一个全局优化问题可以被分解为多个"近似正交"的子问题时,最优策略是让子问题完全独立求解,再合并结果,而非让它们在同一个优化过程里互相干扰。
论文证据:Parallel-RL 把多任务训练分解为 N 个独立 RL 训练(完全并行),再合并 ΔW。相比 Mixed-Data RL(+8.9%),Adapted Parallel-RL 达到 +10.7%,而且 Retention 超过 100%——分而治之不仅没损失,反而更好。
推广场景:
- 微服务架构:服务边界划分如果能做到"更新近似正交”,各服务可独立迭代部署。
- 模块化课程设计:把知识拆成相互正交的模块并行学习,可能比"螺旋式混合学习"更高效。
- 团队分工:任务分解时,如果能保证各子任务的"决策方向"正交,并行团队优于串行流水线。
- 数据库分片:按"更新正交性"而非简单按主键分片,可能减少分布式事务冲突。
灵感 4:轻量适应补回合并偏差——“先粗调再精修"的两阶段范式
核心思想:当多个独立训练的结果合并后存在微小偏差时,不需要重新大规模训练,用少量数据做轻量适应微调就能"熨平"偏差,甚至激发协同效应。
论文证据:Naive Parallel-RL (sum) 的 Retention 是 94.2%,而加入 5% 数据的轻量适应后(Adapted Parallel-RL),Retention 提升到 103.2%——超过单任务上界。5% 的数据补回了 6% 的偏差,并额外创造了 3% 的协同。
推广场景:
- 模型微调服务:多个定制化微调合并后,用少量用户数据做适应,成本低效果好。
- 多语言模型:各语言独立训练后合并,再用少量多语言数据做适应。
- 多专家系统集成:各专家模型参数合并后,用少量综合数据做精修。
- 个性化推荐:多个用户群体的推荐策略合并后,用少量个体数据快速个性化。
灵感 5:on-policy 是天然的"去相关"机制
核心思想:on-policy 采样(用当前策略自己生成数据)相比 off-policy(用固定外部数据),天然去除了"共享数据偏置”,让不同任务的数据来源统计独立,这是多任务不冲突的隐性前提。
论文证据:SFT 的 off-policy 让不同任务共享"专家分布的偏置",得分函数相关性高(CosSim ~10⁻¹);RL 的 on-policy 让每个任务用自己当前模型生成数据,残差 δS 统计独立,正交性大幅提升(CosSim ~10⁻⁵)。
推广场景:
- 数据增强:用模型自身生成的增强数据(on-policy)可能比用固定外部增强数据更适合多任务。
- 主动学习:让模型自己选择要标注的数据,天然去相关。
- 对话系统:用模型自身对话历史优化策略,比用固定语料更不容易在多任务间冲突。
- 自适应控制系统:基于控制器自身采样的数据做优化,多目标间更不容易互相干扰。
附录:关键术语速查
| 术语 | 全称 | 通俗解释 |
|---|---|---|
| SFT | Supervised Fine-Tuning | 监督微调,给标准答案让模型模仿 |
| RL | Reinforcement Learning | 强化学习,靠奖励信号试错学习 |
| GRPO | Group Relative Policy Optimization | 组相对策略优化,DeepSeek-R1 用的 RL 算法 |
| ΔW | 参数更新向量 | 训练前后参数的差值,代表"学到了什么" |
| L2 范数 | 向量长度 | ΔW 的"移动距离" |
| 余弦相似度 | Cosine Similarity | 两个向量方向的夹角余弦,越接近 0 越正交 |
| 优势函数 A | Advantage Function | 某个答案比平均水平好多少 |
| 零和性质 | Zero-sum Property | 一组优势函数之和恒为 0 |
| on-policy | 在策略 | 用当前模型自己生成数据 |
| off-policy | 离策略 | 用固定的外部数据 |
| KL 散度 | Kullback-Leibler Divergence | 两个概率分布的差异度量 |
| 浓度不等式 | Concentration Inequality | 高维随机向量接近正交的概率保证 |
| LoRA | Low-Rank Adaptation | 低秩适应,一种高效微调方法 |
| Retention | 保留率 | 多任务合并后保留单任务能力的比例 |
| Mixed-Data | 混合数据 | 多任务数据打乱一起训 |
| Multi-Stage | 多阶段 | 一个任务接一个任务顺序训 |
| TIES | TrIM, Elect, Sign-merge | 一种模型合并算法(裁剪+选举+符号合并) |