Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms 精读
用 RLVR(可验证奖励的强化学习)训练出的领域专家各有绝活:数学专家、代码专家、指令跟随专家……但实际部署总不能带上五个模型。这篇复旦大学与腾讯 LLM 部门合作的论文,把三种把多域能力融合进单模型的范式放进同一实验框架对比:Merge(合并任务向量,零训练成本)、Mix RL(混合数据重训一遍)、MOPD(多师在线蒸馏,兼用两者)。结论出人意料地均衡:三范式平均分差不超过 1.4 分,但单个基准差距可达 8.6 分,且域级得失完全由「域之间的关系」决定——数学/科学/代码的任务向量方向相近、互相正迁移,指令跟随与 Agent 则与其它域近正交。更有意思的是,三种融合都只是『把已有的解重新加权』而非扩大解题覆盖:pass@32 时三者与 base 模型已不可区分。本文精读其实验设计、任务向量几何分析与范式选择指南。