论文链接:On-policy Distillation with Verifiable Reward 代码仓库:LeapLabTHU/OPDVR 发表时间:2026年8月 机构:清华大学LeapLab(一作/通讯)、北京航空航天大学、北京大学SMS、清华大学NLP Lab(全高校合作,无企业参与) 领域标签:cs.LG / 大模型后训练、知识蒸馏、强化学习
一、论文背景
大语言模型(LLM)的预训练只教模型"懂世界",真正的解题能力要在后训练(post-training)阶段锻造。目前有两大主流范式,它们恰好互补又各有软肋。
第一条路线:可验证奖励强化学习(RLVR)。给模型一道数学题,让它生成完整推理过程,最后用规则验证器(不是人工、不是另一个模型)检查答案对不对:对了奖励+1,错了-1。这就像考试只看最终得分——目标明确、信号干净,但问题是反馈太稀疏:一条几千token的推理轨迹只换来一个±1的分数,模型根本不知道中间哪一步立功、哪一步出错。这就是所谓的信用分配难题——好比篮球教练只告诉球员"这场输了",却不指出哪个传球失误。
第二条路线:On-policy蒸馏(OPD)。让一个更强的教师模型在学生自己生成的轨迹上逐token地给建议。学生每写一个token,教师都会说"这个位置我认为该词的概率分布是这样的",学生据此调整。这就像请了一位名师坐在旁边逐字批改作文——反馈密集到每个token都有。但OPD有个致命盲区:它只看分布、不看对错。学生模仿得再像,上限也只是教师的水平;更糟的是,教师自己也会犯错,学生连错误也一起学了。
一个自然的想法:把两者结合——OPD提供密集的token级指导,RLVR提供任务级正确性判断。但现有结合方式(如加权组合两个损失、按优势符号切换两套目标)都要引入额外的超参数和手工权衡,好比往一台机器上加装齿轮和皮带,既难调又容易失效。
二、论文定位和关联工作
理解OPDVR的位置,需要看它在两条研究脉络交叉点上的站位。
RLVR脉络:从PPO、GRPO(DeepSeek-R1所用)到DAPO,RLVR已经成为推理模型训练的标准配方。各种改进工作围绕长度控制、熵稳定化展开,但"奖励稀疏"这个根本局限从未被解决——所有这些方法仍然只有轨迹级±1信号。
OPD脉络:近一年OPD快速崛起(DeepSeek-V4、GLM-5、MIMO-V2等技术报告都提到蒸馏后训练)。相关工作研究了OPD的失败模式、哪些token值得训练、训练稳定性问题,但都没有质疑过OPD的核心缺陷:纯分布目标不考虑轨迹正确性。
结合OPD与RLVR的先行工作:这一方向已有多个尝试——有的直接对两个目标加权求和(Hubotter et al.),有的按优势符号选择性应用其中之一(Wang et al.、Cai et al.),有的用师生概率比给GRPO的优势加权(Yang et al.)。它们的共同问题是:把OPD和RLVR当作两个需要"调和"的独立目标,于是不得不引入平衡超参数或启发式切换规则。
| 维度 | 之前路线 | OPDVR的突破 |
|---|---|---|
| 结合方式 | 两个目标的加权和/切换 | 单一目标,无需调和 |
| 额外超参数 | 需要平衡权重等 | 零 |
| 信号性质 | OPD部分仍不管对错 | 蒸馏信号方向由验证器决定 |
| 理论地位 | 启发式组合 | OPD的严格子集(去掉冲突分量) |
| 可扩展性 | 需针对每个RL算法重新设计 | 天然兼容任意策略梯度算法 |
OPDVR的定位结论:它不是又一种"OPD+RLVR调和配方",而是一个视角反转——通过重新推导发现,sampled-token OPD本身就是一种隐式的RLVR,只是它的"奖励符号"由师生概率比错误地决定了;修正这个符号,OPD就自动变成了合法的RLVR方法。
三、问题定义
论文面对的具体场景是:用OPD蒸馏训练数学推理模型时,学生成绩卡在教师水平之下,甚至学到教师的坏习惯。
核心洞察在于发现了一个深层结构相似性:把sampled-token OPD的梯度与标准RLVR的梯度并排写出来,它们形式完全一样——都是"奖励系数 × ∇log π"。这意味着OPD的log-ratio项可以重新解释为一个隐式的token级奖励:
$$R_{OPD}(o_t) = \log\frac{\pi_T(o_t)}{\pi_\theta(o_t)}$$问题恰恰出在这个隐式奖励的符号上。主流RLVR有一条经验铁律:正确轨迹上的所有token都应获得非负优势,错误轨迹上的所有token都应获得非正优势。但OPD的隐式奖励符号只由"教师比学生自信还是学生比教师自信"决定,与轨迹对错完全无关——于是必然出现两类违规。
用类比建立直觉:OPD就像一位只顾师道尊严的助教——学生答对了,但如果学生"越位"比教师还自信,助教反而打压他(正确行为受罚);学生答错了,但只要教师在那一步恰好更自信,助教就鼓励错误继续(错误行为受奖)。
形式化的问题定义:给定教师πT、学生πθ和轨迹级二元验证奖励R∈{+1,−1},求一个对OPD目标的最小修改,使得:(1)正确轨迹上的token奖励非负、错误轨迹上非正(满足RLVR符号原则);(2)不引入任何新超参数;(3)保留教师分布指导的幅度信息。
这个抽象的精妙之处:它把"如何结合两个范式"这个看似需要设计智慧的问题,化归为"如何修正一个隐式奖励的符号"这个有唯一自然答案的数学问题。
四、问题解法
4.1 解法总览:一道ReLU门
OPDVR的修改极其简单:对隐式奖励套一个ReLU门(max(0,·)):
$$R_{OPDVR}(o_t) = \begin{cases} \max\left(0, \log\frac{\pi_T}{\pi_\theta}\right) \cdot (+1), & \text{轨迹正确} \\ \max\left(0, \log\frac{\pi_\theta}{\pi_T}\right) \cdot (-1), & \text{轨迹错误} \end{cases}$$类比理解:ReLU门像一个智能闸门——只有当"修改方向"与"验证器方向"一致时才放行梯度,否则直接掐断。它做了两件事:
| 轨迹状态 | OPD原始行为 | OPDVR门控后 |
|---|---|---|
| 正确 + 教师更自信(πT>πθ) | 正常奖励(方向正确) | 保留:奖励幅度=log(πT/πθ) |
| 正确 + 学生更自信(πθ>πT) | 惩罚正确token(违规) | 门控归零:不动学生已对的自信 |
| 错误 + 教师更自信(πT>πθ) | 奖励错误token(违规) | 门控归零:不让教师带偏 |
| 错误 + 学生更自信(πθ>πT) | 正常惩罚(方向正确) | 保留:惩罚幅度=log(πθ/πT) |
直觉上这符合人类学习规律:巩固可靠的正确行为,重点压制过度自信的错误预测。
4.2 条件掩码解释:为什么恰好是"去掉冲突"
论文给出更深的解释:ReLU门等价于一个条件token掩码。标准OPD梯度可分解为Term A(教师更自信时推高)和Term B(学生更自信时压低)。OPDVR按验证器结果选择性保留:
- R=+1时只保留Term A(正确时向教师学习)
- R=−1时只保留−Term B(错误时压掉过度自信)
于是OPDVR恰好移除两类与验证器冲突的token更新:
- I类冲突(正确轨迹+学生更自信):学生的更高自信与正确结果一致,压它会引入与任务表现无关的分布扭曲;
- II类冲突(错误轨迹+教师更自信):教师的高置信度并没有伴随正确轨迹,抬升错误token的概率等于强化已被验证器否决的推理模式。
最终格局是:教师控制更新的幅度,验证器决定更新的方向——蒸馏过程永远不会与任务奖励对着干。
4.3 GRPD:与GRPO的无缝结合
既然OPDVR已经是一个合法的RLVR方法,就能与任意策略梯度算法结合。把二元奖励R换成GRPO的组相对优势Â(同题G个回答中,高于组平均为正、低于为负),就得到GRPD(Group Relative Policy Distillation):
$$R_{GRPD} = \text{sign}(\hat{A}) \cdot \text{ReLU}\left(\text{sign}(\hat{A}) \cdot \log\frac{\pi_T}{\pi_\theta}\right)$$类比:二元R像"及格/不及格"的粗判,组相对优势像"这次考试你在班里排第几"的细判——信息更丰富,且天然完成了优势归一化(降低方差)。
4.4 实验设置速览
- 同架构蒸馏:Qwen3-4B学生 ← Qwen3-4B-RL教师(同底座GRPO训练),DeepMath 57k数据
- 跨架构蒸馏:Qwen3-1.7B-Base ← Qwen3-4B-Base-RL,DAPO-Math-17k数据
- 6个推理基准:AIME24/AIME25/AMC/MATH500/Minerva/OlympiadBench,avg@16准确率
- 训练用Verl框架,RTX 5090 GPU
五、评估指标与实验证据
评估体系:主指标为6个数学推理基准上的avg@16准确率(每题采样16次取平均,比单次pass@1更稳定地反映真实能力);辅助指标包括训练时accuracy reward曲线、熵、响应长度;消融指标为零门控token比例。
三个关键实验设计及其证据:
实验1:主对比(OPDVR vs OPD)。同架构下OPDVR平均49.1,超过sampled-token OPD的47.8和Top-64 OPD的47.4,且AIME24上36.9反超教师的36.0——证明OPDVR突破了"学生上限=教师"的天花板。跨架构下优势更大(平均22.8 vs 20.9)。
| 方法(同架构 4B←4B-RL) | AIME24 | AIME25 | AMC | MATH500 | Minerva | Olympiad | 平均 |
|---|---|---|---|---|---|---|---|
| 学生(Qwen3-4B) | 24.0 | 15.8 | 60.8 | 80.9 | 27.6 | 42.9 | 42.0 |
| 教师(Qwen3-4B-RL) | 36.0 | 29.0 | 65.9 | 87.0 | 35.4 | 49.3 | 50.4 |
| Sampled-Token OPD | 34.2 | 26.0 | 63.1 | 85.5 | 31.6 | 46.5 | 47.8 |
| Top-64 OPD | 34.6 | 23.5 | 62.0 | 85.0 | 32.2 | 46.8 | 47.4 |
| OPDVR | 36.9 | 28.1 | 64.8 | 84.7 | 33.2 | 47.0 | 49.1 |
实验2:GRPD vs GRPO vs OPD。在DAPO-Math-17K上(刻意区别于教师的训练数据,更干净地隔离组相对优势的贡献),GRPD平均49.4全面领先GRPO的44.8和OPD的48.4,AIME25上差距最大(31.7 vs 20.8,+10.9)。
| 方法 | AIME24 | AIME25 | AMC | MATH500 | Minerva | Olympiad | 平均 |
|---|---|---|---|---|---|---|---|
| GRPO | 28.3 | 20.8 | 62.3 | 83.9 | 28.9 | 44.6 | 44.8 |
| OPD | 32.0 | 31.7 | 65.6 | 85.4 | 28.9 | 46.6 | 48.4 |
| GRPD | 34.8 | 31.7 | 67.0 | 85.6 | 30.5 | 47.0 | 49.4 |
实验3:逆向门控消融(因果验证的关键)。把门控方向反过来——专保留OPDVR会门掉的冲突token、门掉OPDVR保留的token,其余一切不变。结果逆向门控在全部6个基准上都低于vanilla OPD(平均44.6 vs 47.8),训练曲线呈单调分离的OPDVR > OPD > Inverse-Gated排序。这个实验设计的高明之处:它证明了门控的方向性(而非门控这个动作本身)是性能差异的原因——门谁和怎么门都重要,门错了比不门更糟。
训练动态证据:零门控token比例在整个训练过程中稳定在约48-50%(4B学生)/40-44%(1.7B学生),从未退化到全开或全关。这说明与验证器冲突的token持续占约一半——问题不是训练早期的暂态,而是OPD目标中顽固的结构性缺陷,ReLU门在持续地过滤它们。
六、效果优势的根源解释
为什么一道ReLU门就能稳定带来1-3分的提升?因果链要从OPD梯度的数学结构追溯。
Baseline的根本局限:标准OPD的隐式奖励符号由rt=log(πT/πθ)决定,而rt的正负与轨迹正确性R统计独立。于是每个minibatch中都有约一半token的更新方向与验证器方向相反(被零门控比例的48-50%直接证实)。这些反向更新不是随机噪声——它们是系统性的破坏力量:
- 正确轨迹上学生更自信的token被压低 → 学生的正确直觉被磨平(分布扭曲)
- 错误轨迹上教师更自信的token被抬高 → 教师的错误模式被注入学生
论文的两条定理锁定因果机制:
命题A.1(方向对齐):OPDVR更新与纯验证器梯度的内积⟨ΔOPDVR, ΔRLVR⟩ = ReLU(R·rt)·||u||² ≥ 0,永远非负;而OPD的内积= rt·R·||u||²,当rt与R反号时为负——OPD在主动往验证器要推的方向上往回拉。
命题A.2(冲突移除):ΔOPD可精确分解为ΔOPDVR + Δconflict,其中冲突分量Δconflict = rt·1(rt·R<0)·u,其与验证器梯度的内积≤0。也就是说,OPDVR不是对OPD的任意修改,而恰好是"OPD减去有害的反对分量"——这是数学上的精确关系,不是近似。
因果链完整版本:
ReLU门按轨迹正确性强制奖励符号 → 恰好移除OPD梯度中与验证器内积为负的分量(命题A.2)→ 每一步更新不再被约半数冲突token拖后腿 → 相同教师信号下学习方向与任务目标一致 → 体现在avg@16全基准提升 + 反超教师
反事实推理:如果去掉门控(退回OPD),平均从49.1掉到47.8;如果把门控方向反过来(专留冲突token),掉到44.6——比什么都不做还差3.2分。这两个反事实夹逼出结论:门控的方向性贡献了全部增益,冲突token的梯度确实是净破坏。
为什么能反超教师(36.9 vs 36.0)?附录A.3的单token分析给出机制:当学生初始已比教师更优(q0>p)时,OPD的目标最优解是q=p(强行拉回教师水平),而OPDVR的期望梯度恰好为零(两类门都不开),学生保持q0不动——OPDVR对学生的正确优势是"不折腾"的,只从教师那里吸收有用的分布指导。
七、必要知识反推
假设一个研究者从零开始要做这个工作,他最少需要掌握什么?
领域知识层:
- RLVR的运作机制(REINFORCE梯度形式、GRPO组归一化)——不知道"奖励×∇log π"的结构,就看不到OPD梯度的同构性
- 蒸馏的损失函数家族(全词表KL、Top-k、sampled-token三个变体)——本文只针对最常用的sampled-token变体做改造
方法论知识层:
- 梯度配对比较技巧:把OPD损失和RLVR损失的梯度并排写、按∇log π系数匹配——这是发现隐式奖励的关键一步,属于"数学摄影"式洞察
- RLVR的符号原则(正确轨迹非负优势)作为规范性判据——需要熟悉GRPO/PPO实践才知道这是社区共识而非本文发明
- 命题证明的基本功(内积分析、梯度分解)——A.1/A.2的证明只有几行但锁定了因果解释
工程知识层:
- Verl训练框架、DeepMath/DAPO-Math数据集的难度分级使用
- 控制变量实验设计:同架构/跨架构双设定、教师数据与学生数据分离(GRPD实验用DAPO数据避免教师过拟合泄漏)、逆向门控消融
知识融合的关键节点:真正的化学反应发生在**“RLVR视角"这个透镜**上——把OPD损失不是当作蒸馏问题而是当作RL问题重读,符号违规立刻显形。三个层次的知识(梯度同构性、符号原则、掩码机制)在这个视角下瞬间对齐,剩下的修改(ReLU)几乎是唯一自然的选择。这提示我们:范式间的翻译能力(把A领域的问题用B领域的语言重述)往往比任何单领域深挖更能产出简洁的突破。
八、论文中可以提取的通用性灵感
灵感1:隐式奖励审计——先找出损失函数"真正在奖励什么”
- 核心思想:任何损失函数都可以重写成"奖励×∇log π"的形式;审计这个隐式奖励的符号/结构与你的真实目标是否一致,可能发现根本性错位。
- 论文证据:OPD的隐式奖励符号与轨迹正确性无关,约半数token更新与验证器冲突(零门控比例48-50%)。
- 推广场景:RLHF中的reward model隐式偏好审计;对比学习的正负样本构造审查;课程学习中难度标签与梯度方向的一致性检验;扩散模型损失中噪声预测目标的偏差分析。
灵感2:零超参数的极简修改优于复杂调和
- 核心思想:当两个范式冲突时,优先寻找"修正一方以天然兼容另一方"的最小改动,而不是设计调和两者的新机制。
- 论文证据:对比需要加权/切换超参的先行工作,OPDVR零超参数、六行公式、全基准提升。
- 推广场景:多任务学习中用约束替代加权;系统设计中"改接口"优于"加中间层";组织协作中"修流程"优于"加协调岗"。
灵感3:逆向消融是因果证明的黄金标准
- 核心思想:不仅做"去掉机制"的消融,还要做"反向执行机制"的消融——如果反向比基线更差,机制的方向性因果作用才被锁定。
- 论文证据:逆向门控在全部6基准低于vanilla OPD(44.6<47.8),训练曲线单调分离。
- 推广场景:注意力机制的逆向mask实验;数据增强中"加噪vs加错信号"对照;产品A/B测试中的反向特性组。
灵感4:稳定性指标可以当作机制存在的证据
- 核心思想:如果某个量(如被门控token比例)在整个训练中稳定在非平凡区间,说明对应机制是持续的结构性现象而非暂态。
- 论文证据:零门控比例稳定在48-50%区间,从未收敛到0或1。
- 推广场景:用梯度冲突比例的持续性诊断多任务学习;监控RL探索率是否退化;检测数据分布漂移是否为结构性。
灵感5:好的问题重述能把"设计问题"变成"求解问题"
- 核心思想:把"如何结合A与B"重述为"B其实是一种有缺陷的A,缺陷有唯一自然修正",设计空间塌缩到一点。
- 论文证据:OPD被重述为符号违规的RLVR后,ReLU门控是满足全部约束的唯一最简解。
- 推广场景:把prompt工程问题重述为概率干预问题;把模型融合重述为分布插值问题;把超参数选择重述为等变性问题。