Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement 精读
论文链接:arXiv:2608.31046 发表时间:2026年8月31日 机构:Purdue University 计算机系(Yi Ding、Ruqi Zhang),纯学术团队 领域标签:cs.LG — LLM 后训练 / 知识蒸馏 / 自监督强化学习
一、论文背景
要理解这篇论文的颠覆性,先得知道它攻击的对象有多火。On-Policy Distillation(OPD,在线策略蒸馏) 是 2025 年底由 Thinking Machines Lab(Kevin Lu)系统化提出、目前业界最热门的后训练方法之一。它的核心卖点是:用教师模型对学生自己生成的轨迹逐 token 打分,把 RL 那种"一整个回答才给一个分数"的稀疏信号,变成每个 token 都有反馈的稠密信号,训练效率比标准 RL 高 9–30 倍。
与 OPD 对垒的是 RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)——以 GRPO/DAPO 为代表,对数学题这类"答案可以对错判定"的任务,按组归一化结果奖励。RLVR 的问题在于:长推理链上结果级奖励太稀疏;一组采样全对或全错时归一化优势归零,学习信号消失甚至训练崩溃。
OPD 看起来完美补位,但它有一个被所有人默认忽略的隐患:教师被迫给学生自己采样出来的轨迹打分,而这些轨迹对教师而言是 off-policy(离策略)的——教师自己根本不会这样写。让一个资深教授逐字批改小学生天马行空的作文,批语可靠吗?没人认真量化过。这就是本文的第一个切入点。
另一个背景知识是 token 熵(entropy)。2025 年 NeurIPS 的"Beyond the 80/20 Rule"工作发现:推理过程中只有约 20% 的 token 呈现高熵(模型很不确定),它们是推理路径的"分岔口(fork)"——模型在这里选择走哪条推理分支,“wait"“but"这类反思词常出现在高熵位置;其余 80% 的低熵 token 只是确定性填充。这一发现是本文方法设计的直接灵感来源之一。
二、论文定位和关联工作
本文处在三条研究线的交汇点:
(1)OPD 效率线。GKD(Agarwal et al., 2024)与 MiniLLM(Gu et al., 2024)奠定在线蒸馏基础;Thinking Machines 的 K1 估计器(Lu & Lab, 2025)把 OPD 变成工程可用的后训练配方。这条线默认"教师信号 = 知识转移”。
(2)去教师化线。OPSD(On-Policy Self-Distillation,2026 年多篇工作)用"模型自己看到提示词后的分布"充当教师,但构造提示仍需标注或额外采样,且有信息泄漏风险;TTRL、EMPO、Intuitor 等无标签方法依赖多数投票、聚类或自确定性构造伪奖励,粗粒度且依赖策略初始能力——正确答案不在策略分布的众数附近时会强化错误模式。
(3)token 级分析线。“Beyond the 80/20 Rule”(NeurIPS 2025)揭示高熵 token 主导 RLVR 学习;NSR(Negative Sample Reinforcement,Zhu et al., NeurIPS 2025)发现只用错误样本做负强化即可显著提升推理。这两项工作分别提供了"熵作为信号"与"负优势作为信号"的独立证据,但都没有把它们与 OPD 的归因问题连起来。
本文的独特位置:它是第一个对 OPD 增益来源做系统性因果归因的工作——不提出"更强的蒸馏方法”,而是先证明"蒸馏根本没发生多少",再把归因分析的副产物组装成一个零监督方法。对比定位如下:
| 维度 | OPD / OPSD | TTRL / Intuitor | 本文 OPSA |
|---|---|---|---|
| 稠密 token 级信号 | ✓ | ✗(轨迹级伪奖励) | ✓ |
| 无需可验证奖励 | ✓ | ✓ | ✓ |
| 无需外部教师 | ✗(OPD)/ 需提示(OPSD) | ✓ | ✓ |
| 无需任何提示/标注 | ✓ | ✗(需参考答案等) | ✓ |
| 信号来源 | 教师 logits | 伪真值/自确定性 | 自身 token 熵 |
三、问题定义
论文的抽象问题可以剥离成两层:
第一层(归因问题):给定一个表现出性能增益的训练算法 A(OPD),其增益是否真的来自它名义上的机制(教师知识蒸馏)?形式化地:设学生策略 πs 在算法 A 下从性能 P₀ 提升到 P₁,问提升量 ΔP = P₁ − P₀ 中有多少比例可归因于"教师提供的 token 级优势信号的内容",多少可归因于其他结构性副效应(如对特定 token 子集的负梯度)?
第二层(构造问题):若归因发现增益主要来自某个无需教师的副效应 S,能否把 S 提炼成一个最小化依赖的显式算法,在不损失(甚至超越)原有效果的前提下消除对外部监督的全部依赖?
这个抽象的精妙之处在于:它把"方法改进"问题转化为"机制归因"问题——先用受控实验拆解增益来源,再按归因结果重构方法。这本质上是一种科学方法论在 ML 研究中的应用,而非单纯刷分。
四、问题解法
论文的四步推进构成一条完整的证据链。
4.1 第一步:量化教师噪声
噪声定义:只看最终答案 token(\boxed{} 内、可被验证器判对错的部分),当教师优势的符号与可验证奖励矛盾——错答案拿到正优势、或对答案拿到负优势——即记为噪声。
实验设计:Qwen3-1.7B 作学生(关闭思考模式),分别用 Qwen3-4B / 30B-A3B / 235B-A22B-Instruct 作教师,在 DAPO-17k 的 500 道题上每题采样一对一错两条回答。结果:4B 教师总噪声率 30.6%,30B 教师 34.7%,235B 教师高达 50.6%——且最大教师对 97.8% 的正确答案 token 也打负分(对错无感)。教师越强,学生轨迹对它越 off-policy,噪声越大。
关键对照:把训练数据切分为"只含噪声轨迹 / 只含干净轨迹 / 全部"三组分别训练——三者收敛到同等性能。学生根本不在乎噪声。
4.2 第二步:定位有效 token
对 OPD 损失做 logit 级梯度展开(论文式 3):采样 token 的梯度 ∝ A_t(1−π_s),未采样 token ∝ −A_t·π_s。梯度在两处消失:|A_t| 小、或学生对该 token 概率接近 1。测量发现 29.2% 的 token 优势恰为零、51.7% 优势绝对值小于 10⁻⁴,而这些近零优势 token 恰好集中在学生的高 logp 区域(学生自信时教师也自信,差值趋零)。
验证实验:只用学生 top-logp 的各比例 token 训练(无论用真实优势还是 [−1,1] 均匀随机优势),AIME24 性能纹丝不动——高 logp token 无论怎么打分都不产生学习。有效信号必然在低 logp token 上。
4.3 第三步:定位有效信号
只取 logp 最低的 20% token,分别赋固定优势 −0.5 / +0.2 / 标准 OPD 优势训练:固定负优势稳步提升(响应长度增长到约 12K token 后稳定);固定正优势 40 步内响应长度塌缩到零、梯度范数爆炸、输出乱码。负优势是关键成分——这呼应了 NSR 的发现,但本文把它定位到 token 而非轨迹粒度。
4.4 第四步:OPSA——熵自适应的负优势
剩下的自由度是"每个低 logp token 该吃多大的负信号"。logp 低有两种原因:分布平坦(高熵,头部 token 也低 logp)或分布尖锐但采样到尾部(低熵)。借用 80/20 规则的洞察(高熵 fork 值得强信号),设计:
- 在每条回答内,对 logp 最低 20% 的位置集合 S_lowest20;
- 优势公式:A_i = −1/2 − (H_i − H_min) / (2(H_max − H_min)),其中 H_i 是该位置 token 熵,H_min/H_max 是该回答内 S_lowest20 的熵极值——熵越高负优势越强,范围 [−1, −1/2];
- 损失即标准策略梯度形式,只对 S_lowest20 求和。
训练开销极小:无需教师前向(OPD 每步 61.2s → OPSA 46.3s),优势直接从学生自身熵计算。
机制直觉:高熵尾部 token 被强负信号压掉(避免误入低概率错误分支);高熵头部 token 之间概率质量被均匀再分配(鼓励探索不同推理分支);低熵高置信 token 被排除在训练外(保持精度)。消融中把含反思词(“wait"“but"等九词集)的 fork 位置遮蔽后,响应长度增长与精度提升基本消失且 300 步后长度塌缩——直接证明 fork 位置的操作是增益主源。
五、评估指标与实验证据
指标体系:主指标 Avg@32(每题 32 次采样的平均得分,衡量单次采样质量)与 Pass@32(32 次中至少一次正确的题目比例,衡量探索多样性)。二者互补很关键:只有 Avg 涨可能意味着分布塌缩(只会做一类题),Pass@k 同涨才能证明"锐化不牺牲多样性”。
数据集:训练 DAPO-17k(只用问题不用标签);评测 AIME24/25、HMMT25(域内数学)、MBPP+(域外代码)、GPQA-Diamond(域外问答)。
核心结果表(Qwen3-1.7B,非思考模式):
| 方法 | AIME24 Avg@32 | AIME25 Avg@32 | HMMT25 Avg@32 | 三基准 Avg |
|---|---|---|---|---|
| 基线 | 13.44 | 9.69 | 5.73 | 9.62 |
| GRPO | 33.96 | 25.31 | 15.10 | 24.79 |
| OPD | 32.08 | 20.52 | 13.85 | 22.15 |
| OPSD | 33.33 | 22.50 | 14.90 | 23.58 |
| OPSA | 48.85 | 35.31 | 23.33 | 35.83 |
跨规模:Qwen3-4B 相对提升 166%–185%;Qwen3.5-9B(基线已 76.35)再 +11.46;思考模式下 OPSA 与原生思考能力互补叠加。
实验设计的证明力:这份实验之所以能支撑"OPD 增益非蒸馏"的论点,在于三点设计——噪声过滤对照实验(4.1)直接隔离了教师信号内容的因果贡献;随机优势对照(4.2)排除了"任何梯度都有效"的解释;token 预算匹配实验(附录 C.3,给 GRPO/OPD 基线追加等量推理 token)排除了"OPSA 只是让回答更长"的解释——等长控制下 GRPO 32.81、OPD 31.67,OPSA 仍 48.85。
六、效果优势的根源解释
对比对象是 OPD。OPD 为什么有效过?因为它事实上执行了"压制学生低概率 token"的操作——教师对学生轨迹整体打负分(97.8% 的负优势)相当于无差别负强化。
机制因果链:OPD 名义机制(知识转移)→ 实际执行的操作(对低 logp token 的负梯度)→ 学生分布形态变化(尾部收缩、fork 处再分配)→ 指标提升。OPSA 把这条链的中间环节显式化并优化参数:只取最低 20%(精确命中有效 token 集,避免高 logp 位置的无效梯度计算)、负优势随熵自适应(把有限的学习信号预算集中投放到 fork 决策点)。因此 OPSA 超 OPD 不是偶然而是结构必然——它去掉了噪声源(教师分布失配)同时保留了有效操作(尾部压制),还额外获得了熵调度的最优性。
反事实验证:去掉熵自适应(固定负优势)性能从 50.0% 掉到与 OPD 相当的水平;熵负相关(δ=−1,低熵强信号)则训练不稳且低于固定基线;遮蔽 fork 位置则增益几乎归零。三个消融共同锁死因果链的每一环。
局限性(论文自陈):实验最大 9B,更大规模与 MoE 未验证;对输出分布本已过锐的重后训练模型收益可能有限;思考模式 Pass@k 提升相对温和,说明 OPSA 不扩展探索边界、只重分配既有概率质量。
七、必要知识反推
要做这项研究,作者最少需要:
领域知识层:OPD 的精确数学形式(K1 估计器下的 token 优势定义)、RLVR 组归一化的失效模式、KV 级 logits 的梯度结构——不知道式 3 的梯度消失条件就无法提出"哪些 token 有效"的假设。
方法论知识层:受控变量实验设计(噪声过滤、随机优势、token 预算匹配三重对照);80/20 高熵 token 规则与 NSR 负强化这两项前序发现的深度掌握——OPSA 公式是二者的融合而非发明。
工程知识层:slime + Megatron + SGLang 全栈训练基础设施;如何用反事实消融(fork 遮蔽)验证机制假设。
融合关键节点:最关键的化学反应在"噪声不敏感性"与"负优势有效性"两个发现的对接处——单独看任何一个都不会推出 OPSA;只有同时知道"教师内容不重要"与"负信号在低 logp token 上重要”,才会想到用模型自身的熵去调度负信号强度。这需要作者对梯度公式与实验现象的同时把玩。
八、论文中可以提取的通用性灵感
1. 归因先于改进。性能提升的方法不等于其名义机制在起作用——先做受控归因实验拆解增益来源,再按归因重构最小方法。推广场景:任何"借外部信号提升效果"的系统(推荐系统的 LLM 重排、RAG 的检索增强)都可先问"信号内容到底贡献了多少";评测方法学中的混杂变量控制;科学计量学中的效应归因。
2. 噪声不敏感是机制错配的证据。如果一个系统对输入某成分的噪声表现出鲁棒性,更可能的解释是该成分根本不参与核心因果链。推广场景:药物临床试验中安慰剂对照的设计逻辑;代码评审中"删掉这段注释后测试仍通过"的死代码检测;特征重要性分析中的扰动测试。
3. 负信号比正信号更安全。固定正优势导致策略崩溃而负优势稳定提升——惩罚错误比奖励正确更不容易引起分布塌缩。推广场景:教育中的纠错反馈优于表扬式泛化;进化算法中淘汰压力与变异的平衡;金融风控中止损规则相对追涨的稳健性。
4. 不确定性本身可以当监督。OPSA 证明模型的 token 熵无需任何标注即可充当细粒度学习信号。推广场景:主动学习用模型不确定性挑样本;人机协作中把 AI 的犹豫展示给人以引导干预时机;异常检测用熵漂移发现分布变化。
5. 资源分配应向"分岔点"集中。把有限的学习信号集中投放到高熵决策位(fork),而非均匀铺开。推广场景:课程设计把练习集中在概念分界处;强化学习中的关键状态识别;组织管理中对战略决策节点投入更高审慎。
本精读基于论文 arXiv:2608.31046v1 全文(含附录 A–C)撰写,实验数字均引自原文表格。