论文链接:Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms (arXiv:2608.27409) 发表时间:2026年8月27日 机构:复旦大学、腾讯 LLM 部门——「高校 + 企业」合作,多位一作为在腾讯实习期间完成的工作 领域标签:cs.CL(计算语言学),LLM 后训练 / 多域强化学习 / 模型融合 开源资源:论文提供 GitHub 与 HuggingFace 链接
一、论文背景
1.1 什么是 RLVR 与领域专家困境?
RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励的强化学习) 是当前 LLM 后训练的主流范式:对有标准答案的任务(数学、代码等),用一个验证器给模型的回答打分,再用 GRPO 这类算法把分数转化为参数更新。它的好处是奖励信号客观、无需人工标注偏好。
但 RLVR 有个实际麻烦:一次训练通常只精一个域。数学 RLVR 练出数学专家,代码 RLVR 练出代码专家——想覆盖五六个能力,就得训五六个专家模型,部署时要么并行伺服多个模型,要么做路由,工程成本高昂。于是问题变成:怎么把多个领域专家「融合」成一个模型?
1.2 训练留下了什么?
论文提出了一个漂亮的组织视角:每次训练领域专家 i 会留下两种「资产」(artifacts):
- 任务向量(task vector)τ_i = θ_i − θ_0:专家权重相对 base 模型的「位移」;
- 数据集 D_i:训练这个专家用的提示词集合。
按「融合时复用哪种资产」分类,所有融合方法恰好归为三范式:
| 范式 | 复用任务向量? | 复用数据? | 需要训练? |
|---|---|---|---|
| Merge(合并) | 是 | 否 | 否(纯算术) |
| Mix RL(混合数据 RL) | 否 | 是 | 是(一次 GRPO) |
| MOPD(多师在线蒸馏) | 是(作为教师) | 是 | 是(蒸馏) |
1.3 为什么需要这项研究?
三种范式此前基本是「各玩各的」:Merge 出自模型合并社区(Task Arithmetic 一脉),Mix RL 出自多任务 RL 社区,MOPD 出自蒸馏社区——各自用不同的底座、不同的基准评测,报告的数字根本没法直接比较。选哪个范式更像靠信仰而非证据。本文是第一个把三者放进同一实验框架(共享专家、共享数据、共享基准、跨两个模型规模)的受控对比研究。
二、论文定位和关联工作
本文属于实证对比 + 机制分析型研究,类似「给三种融合路线出具权威评测报告」。
关联工作三条线:一是模型合并(Ilharco et al. 2023 的 Task Arithmetic、TIES/DARE 等变体),操作对象是权重;二是多域混合 RLVR(Huang et al. 2026、Li et al. 2025),关注数据配比与域间干扰;三是在线策略蒸馏(OPD/MOPD),学生 rollout、教师逐 token 监督。此前最接近的对比研究是 Wang et al. 2026,但只比了「混合 RL vs 事后合并」两方且场景聚焦;本文首次三方齐全、并加入任务向量几何这一参数空间分析工具来解释行为层面的域级差异——「任务向量余弦相似度能预测行为跨域迁移」是本文最有增量的分析贡献。
三、问题定义
论文的核心问题:给定 N 个分别训练的 RLVR 领域专家,如何用一个模型服务全部 N 个域?三范式各能保留多少专家增益、在哪些域上得、哪些域上失、成本如何?
具体拆为三问:
- 效果:各融合范式相对 base 模型与逐域专家(性能上限参照),在五个目标域上表现如何?
- 机制:域级的得与失由什么决定?训练动态(收敛速度、数据用量)有何差异?
- 边界:融合是扩大了解题覆盖,还是只提高单次采样准确率?会不会损伤训练域之外的能力?
四、问题解法
4.1 实验设计
- 底座:Qwen3-4B-Instruct-2507 与 Qwen3-8B(non-thinking 模式)。
- 五个领域:数学(Polaris 难题过滤,38,131 条)、科学(OpenScienceReasoning-2 难题,50,000 条)、代码(CodeContests + Open-R1,19,169 条)、指令跟随 IF(WildChat-1M + Open-Instruct,16,575 条)、Agent(WorkplaceAssistant,10,229 条)。每个域训练全参专家与 LoRA 专家各一个。
- 三种融合:Merge 用 Task Arithmetic(θ_merge = θ_0 + λ·Στ_i,λ=0.6);Mix RL 在 87,699 条混合语料(25% 数学/22% 科学/22% 代码/19% IF/12% Agent)上单跑一次 GRPO;MOPD 把五个专家当教师,学生 rollout 由对应域的教师提供逐 token 逆向 KL 监督。
- 评测:8 个基准(AIME25/26、GPQA-Diamond、LiveCodeBench v5/v6、IFEval、IFBench、BFCL v3),每题采 16 次报 mean@16。
4.2 分析工具:任务向量几何
论文的关键分析创新是把「域关系」量化到参数空间:计算每对任务向量在特定层的余弦相似度,并与行为层面的跨域迁移(在 A 域训练对 B 基准的分数变化)对照。选第 16 层是因为 RLVR 引起的相对位移在网络中层最大(位移份额超出参数份额的比值在中部达峰)。
五、评估指标与实验证据
5.1 主结果:平均接近,域级分化
4B 上八基准平均:Base 57.0 / 逐域专家 63.9 / Merge 63.7 / Mix RL 62.3 / MOPD 63.3。8B 上:Base 42.0 / 专家 53.8 / Mix RL 54.6 / Merge 53.7 / MOPD 53.2。
三个关键观察:
- 三范式平均差距 ≤1.4 分——融合路线的选择在「平均分」层面几乎不重要。
- 但单基准差距可达 8.6 分:Mix RL 在 8B 的 AIME 两套上反超专家 6.5/7.3 分(全表最大越限幅度)——其它域的正迁移帮数学「白赚」了增益;而 Merge 和 Mix RL 在 IFBench 上落后专家 4.9–9.2 分——IF 没有外援,只能靠自己那份配额。
- MOPD 全程贴着教师但从不超越:这是 OPD 目标函数决定的——学生被优化去匹配教师行为,教师就是天然性能上界。
5.2 域关系:行为与几何的双重印证
行为层面:数学训练让 GPQA 涨约 5 分(接近科学专家自己的增益)、科学训练反哺 AIME;而 IF 训练在 4B 上把 BFCL 拉低 9.8 分(最明显的负迁移)。五个域清晰分成两组:推理密集型(数学/科学/代码,互相正迁移)与任务特异型(IF/Agent,与其它域近正交、彼此也不帮忙)。
几何层面:第 16 层任务向量余弦相似度,数学–科学对在 4B/8B 上分别为 21.7/50.7(×10⁻³),数学–代码 10.3/8.2;而所有涉及 IF 或 Agent 的配对绝对值 ≤2.3×10⁻³——近正交。把每对的余弦与行为迁移作图,两组点清晰分区:权重空间一起动的域,行为上也互相帮忙。
5.3 训练动态与成本
- 收敛速度:按优化步看,Mix RL 收敛最慢(步 300 时落后,继续训练才追上);MOPD 最快——步 100(全程三分之一处)已拿下 70% 总增益,因为每个 token 都有教师目标可跟,无需探索。按「域内提示词消耗量」看,IF 这种无外援的域进步完全正比于见过的 IF 提示词数量;数学这种有外援的域,Mix RL 只用 25.8k 数学提示就超过了用 38.4k 的专家。
- 成本(参考:逐域 RL 4B 需 5,220 GPU 时):Merge 融合阶段 ≈0(分钟级算术);Mix RL 全程 3,042 GPU 时(0.58×),且不需要先训专家;MOPD 融合阶段仅 741 GPU 时(<0.2×)但算上五个教师的端到端成本 5,960 GPU 时(1.14×)——三者中最高。
- 覆盖与保持:pass@k 分析显示,k=1 时三范式比 base 高 4.5–6.9 分,但增益随 k 单调衰减,k=32 时三者与 base 在 AIME 上统计不可区分——融合没有扩大「可解题集合」,只是把已有解的概率调高。同时两个 held-out 能力(SimpleQA 事实回忆、AA-LCR 长上下文推理)上没有任何范式低于 base——融合不伤训练域外的能力。
六、效果优势的根源解释
按「方法差异→机制变化→指标表现」建立因果链:
链条一(Mix RL 的 AIME 反超):Mix RL 把五域数据放进同一条优化轨迹 → 数学/科学/代码任务向量方向相近(层 16 余弦 21.7–50.7×10⁻³),梯度在共享权重上互相强化 → 数学域从科学、代码的更新中获得正迁移 → 8B AIME 上仅用专家 2/3 的数据量反超专家 6.5–7.3 分。
链条二(IF/Agent 的系统性失分):IF/Agent 与其它域近正交(≤2.3×10⁻³)、IF 甚至对 Agent 有负迁移 → 在 Merge 中,五个向量压成一个更新后,IF 的位移没有其它域的成分可以借力,只能保留约 60% 的 IFBench 增益;在 Mix RL 中,IF 的进步完全取决于 19% 的数据配额 → 两范式在 IFBench 落后专家 4.9–9.2 分。MOPD 不受此困,因为每个域的提示词有对应教师逐 token 监督,域信号不靠迁移。
链条三(MOPD 的快与顶):每个学生 token 都有教师分布作目标(逆向 KL)→ 无需靠奖励信号探索,每步进展大 → 步 100 即达 70% 增益;但目标函数是「匹配教师」而非「超越教师」,教师同源于同一 base,没有新解可引入 → 性能贴着教师上界,无法像 Mix RL 那样借迁移越限。
链条四(融合的本质):三种范式都从同一 base 出发、监督信息都源自 base 自己训出的专家/数据 → 没有外部新知识注入 → pass@k 随 k 增大收敛回 base 水平——融合是「重新加权已有解」而非「扩展解覆盖」。这条与 2608.27351(ES 扩展 Pass@K)形成有趣对照:探索机制(参数空间种群)才能扩覆盖,融合机制只调权重。
七、必要知识反推
读懂本文需要(按依赖顺序):
- RLVR 与 GRPO 基础:组采样、相对优势、验证器奖励——理解「专家是怎么练出来的」。
- 任务向量与 Task Arithmetic(Ilharco et al. 2023):θ − θ_0 的语义(「训练对权重做了什么位移」)、加法/缩放合并规则。
- LoRA:低秩适配器 τ = (α/r)·BA,及其与全参微调在融合场景的等价性。
- 在线策略蒸馏(OPD):学生 rollout + 教师 logits 监督,与「离线 SFT 蒸馏」的区别(on-policy 状态分布)。
- 正向 vs 逆向 KL:MOPD 用逆向 KL(mode-seeking)的意义——学生集中拟合教师的高概率模式。
- Pass@k / mean@k 的区别:前者测覆盖(至少一次对),后者测平均质量——本文用二者之差区分「扩覆盖」与「重加权」。
- 余弦相似度与正交性:高维向量方向一致性度量,理解「正交 ≈ 互不干扰」的几何直觉。
- 多任务学习中的正/负迁移:任务相关性、梯度干扰等经典概念。
八、论文中可以提取的通用性灵感
「按复用什么资产」来组织方法论分类。Merge/Mix RL/MOPD 看似三类完全不同的技术,用「复用任务向量 / 复用数据 / 两者都用」一分,立刻形成干净的 2×2 结构。面对一堆纷繁的方案时,先问「它们各自消耗和保留什么资源」,分类框架往往自然浮现。
平均分会掩盖结构化差异。三范式平均差 1.4 分,看起来随便选;但域级差距最大 8.6 分且有清晰规律。任何「总体差不多」的对比结论都值得下钻一层看子维度——差异可能集中在特定条件下。
参数空间的几何可以预测行为空间的结果。任务向量余弦相似度(纯权重运算,不需要跑评测)与跨域迁移(要跑大量评测)高度相关——意味着可以用便宜的几何计算预估昂贵的融合效果,先算相似度再决定融合配方,是可直接落地的工程技巧。
性能上限由监督信号的来源决定。MOPD 快但顶不过教师,因为监督全部来自教师;Mix RL 慢但能借迁移反超专家,因为信号源是奖励本身。设计任何学习系统时,「你的信号天然上限在哪」是个先验问题。
区分「概率重加权」与「能力扩展」。pass@k 递减曲线揭示融合只是把 base 已会的解调得更可及。评估任何系统改进时,多问一句:这是让已有能力更可靠,还是真的解锁了新能力?两者的价值评估方式完全不同(前者可用采样预算替代,后者不能)。
端到端成本核算改变范式选择结论。MOPD 融合阶段最便宜(<0.2×),但算上教师训练成本反而是最贵的(1.19×)。只看局部最优而忽视前置成本,是技术选型中的常见盲区——论文给出的选择指南(已有专家且求便宜→Merge;无专家求单一模型→Mix RL;在意逐域保持且不计成本→MOPD)正是全成本视角的产物。