论文链接:arXiv:2609.24432 代码仓库:github.com/BruceSheng1202/IER-OPD 发表时间:2026 年 9 月 机构:MBZUAI(穆罕默德·本·扎耶德人工智能大学)+ 蚂蚁集团(校企合作) 领域标签:cs.LG / 知识蒸馏 / 同策略训练 / 梯度估计

一、论文背景

1.1 什么是「知识蒸馏」,又为什么要有「同策略」

大语言模型(LLM)的训练有一个常见需求:把大模型(教师 Teacher)的能力,压缩/迁移到一个小模型(学生 Student)上。这个过程叫知识蒸馏(Knowledge Distillation, KD)。

最朴素的蒸馏是「离线蒸馏(off-policy / offline KD)」:先用教师模型对一批固定数据生成「软标签 / 参考答案」,再让学生去拟合这些静态目标。它的好处是简单、可批处理;缺点是学生永远在模仿教师「在别的数据分布上」给出的答案,与自己实际会采样出的分布脱节——当学生能力远弱于教师时,这种脱节尤为致命(学生「看不懂」教师要它模仿的东西)。

于是出现了同策略蒸馏(On-Policy Distillation, OPD):学生用自己的策略生成数据,再在这些「自己产生的」数据上去匹配教师。换句话说,教师只在学生「亲眼看到、亲自生成」的样本上给指导。这样做的好处是分布对齐——学生学的是「在自己会说的句子上,如何更像教师」,而非「在教师的句子上,如何抄教师」。

OPD 与 RLHF/强化学习里的「同策略(on-policy)」概念一脉相承:训练所用的数据与当前策略同分布,避免了 off-policy 的偏离与修正麻烦。

1.2 OPD 的核心矛盾:梯度方差爆炸

OPD 通常用**策略梯度(policy gradient)**来优化 reverse-KL 散度(让学生分布去贴近教师分布)。但策略梯度有个老毛病:方差极大。

直观理解:学生每生成一个 token,都要拿它和教师在同一位置的「可能动作集合」比较,得到一个「该往哪调」的梯度。但一条序列有成百上千个 token,绝大多数 token 学生已经说得和教师差不多了,这些位置的梯度接近于零噪声;而真正「学生说错、教师能纠正」的位置,才是携带学习信号的少数派。如果对每个 token 都等权更新,等于在海量噪声里捞那一点点信号——既浪费算力(每个 token 都要算梯度),又让优化被噪声拖慢。

这就引出了本论文的核心问题:

OPD 里,到底哪些 token 真正值得训练?能不能只挑出那 1% 的「高信息效率」token,就达到全量训练的效果?

1.3 一个关键观察:token 之间的信息效率天差地别

论文的出发点是:不同 token 对学习目标的「信息贡献」极不均匀。有些 token(比如一道数学题里的关键推理步、一个罕见但决定性的词)一旦被纠正,学生能力跃升;而大量「safe」token(如标点、常见衔接词)即使训练也几乎不改变什么。

如果能量化每个 token 的「信号 / 噪声」比,就能只保留高比值 token。这就是 IER(Information-Efficiency Ratio,信息效率比)的由来。

二、论文定位和关联工作

2.1 同策略蒸馏的方法谱系

onPanda 那篇关心「标注数据怎么来」,本篇关心「拿到同策略数据后,怎么高效地训练」。OPD 这条线近年有几条重要脉络:

  • MiniLLM(Gu et al.)**:提出用序列级(sequence-level)**的 reverse-KL 策略梯度做 LLM 蒸馏,是 OPD 的早期奠基工作之一。它把蒸馏建模为学生在自己生成的数据上、用策略梯度最小化与教师的 reverse-KL。
  • GKD(Generalized Knowledge Distillation,Agarwal et al., 2024):**把多种散度(forward/ddist 等)统一到 on-policy 框架下,引入「学生数据比例 λ(student-data fraction)」来插值 off-policy 与 on-policy,展示了同策略训练在教师-学生能力差距大时的优势。GKD 是 OPD 走向「通用化」的关键一步。
  • 各类 OPD 变体:vOPD、OPRD、SA-OPD、TrOPD 等,多从「如何更稳地估计同策略梯度」入手(方差缩减、截断、重要性权重修正等)。

本论文与它们的区别在于:前面工作多在「怎么把梯度估计得更准」,而 IER-OPD 进一步问「哪些 token 的梯度值得算」——把问题从「梯度估计的偏差/方差」推进到「梯度的信息效率筛选」。

2.2 同策略训练中的「token 选择」

在 OPD 里「只训练一部分 token」并非全新想法,已有若干「选 token」的启发式:

  • Prefix(前缀法):只训练每条序列的前若干 token;
  • Entropy(熵法):挑学生预测熵高(最不确定)的 token;
  • TIP(Token-level Importance for Policy gradient):基于某种重要性分数为 token 加权/筛选;
  • TA-OPD:面向 OPD 的 token 级选择变体。

这些方法各有道理但缺乏统一理论。IER-OPD 的贡献正是给「选哪些 token」提供一个基于 Fisher 几何与信号-噪声分解的、可解释的准则,并证明用它能把所需 token 数压到极致(0.1%~1%)。

2.3 定位小结

维度前人路线IER-OPD 的突破
优化目标序列级 / 全 token 梯度仍用 reverse-KL 策略梯度
梯度处理降方差、修正权重先量化「信号/噪声」,再按信息效率筛选 token
token 选择Prefix/Entropy/TIP 等启发式IER 理论准则 + 候选集近似 + soft OR/AND 融合
效果通常需较多 token0.1%~1% token 达到/超过全量

三、问题定义

3.1 把「高效 OPD」抽象成什么

OPD 的目标可形式化为:在学生策略 π_θ 生成的同策略数据上,最小化学生与教师 π_T 之间的 reverse KL 散度 KL(π_θ ‖ π_T)。优化用策略梯度,每步要为每个生成的 token 估计梯度。

论文把核心难题抽象为:

给定:学生策略 π_θ、教师策略 π_T、当前同策略采样的一批序列。 求:一个** token 级的选择/加权准则**,使得只对被选中的少量 token 计算并应用梯度,就能达到「对全部 token 计算梯度」的同款(甚至更好)的收敛效果。 约束:(a) 准则必须可解释、可计算,不能依赖不可得的真值;(b) 计算开销(算 IER、筛 token)必须远小于「全 token 梯度」节省的算力,净收益为正。

3.2 一个类比

把 OPD 想象成「老师辅导学生写作文」:

  • 全量训练:老师把学生写的每一句话都逐字批改、逐字讲解——绝大多数句子学生已经写对了,老师是在做无用功,还因为讲得太细而把自己讲累(梯度方差大、进展慢)。
  • IER-OPD:老师先判断「哪几句话才是学生真正不会、改了能进步的」(高 IER),只对这几句精批细讲。结果学生进步一样快,老师省了 99% 的精力。

关键是:老师靠的不是「随机抽几句」,而是靠一个可量化的「这句值不值得讲」的指标——这正是 IER。

四、问题解法

IER-OPD 的解法分两条主线:(A) 在理论上定义 IER;(B) 在工程上用 IER 做稀疏 token 选择。

4.1 理论主线:reverse-KL 梯度的「信号-噪声」分解

在 Fisher 信息几何视角下,reverse-KL 的局部梯度可以写成(论文以 g = E_p[ρ(a)·ϕ_a] 的形式表达,其中 ρ 为重要性比、ϕ_a 为某动作方向):

  • Theorem 1(信号-噪声分解):该梯度的期望可分解为一个信号项(指向真正能缩小 reverse-KL 的更新方向)与一个噪声项(零均值但高方差的扰动)。
  • 最优标量基线 b*:存在一个最优的标量基线 b*,能使梯度的方差最小(类比 REINFORCE 里 baseline 减方差的经典结论,但本文在 OPD 的 reverse-KL 设定下推导)。
  • Definition 1(IER = 信号 / 噪声):定义信息效率比 IER = Signal / Noise。它衡量「单位噪声下,这个 token 携带多少有用学习信号」。

直觉:如果一个 token 处,学生与教师差异大、且这个差异方向明确(信号强),同时估计这个信号的随机性小(噪声低),那它的 IER 就高——它值得被训练。反之,学生已经和教师一致(信号≈0)或估计极不稳定(噪声大)的 token,IER 低,不值得算梯度。

这一步把「选 token」从启发式升级为有几何依据的、可排序的准则:每个 token 都能算出一个 IER 分数,分数越高越该被训练。

4.2 工程主线:用 IER 做稀疏选择

直接算 IER 需要遍历词表并对每个动作估计信号/噪声,代价不菲。论文给出可扩展的实现:

(1) 候选集近似(candidate-set approximation)。 把「所有可能动作」缩到一个小候选集:

C = TopK(z_θ) ∪ TopK(z_T) ∪ {a} 即学生概率最高的 K 个 token、教师概率最高的 K 个 token、以及实际被采样到的那个动作 a 的并集。这样信号/噪声估计只需在这个小集合上做,复杂度从词表大小 V 降到约 2K+1。

(2) 多准则的 soft 融合。 IER 是「主准则」,但还可以结合其它有用信号(如 Prefix、Entropy、TIP、TA-OPD、CA-SoftOR 等启发式分数)。论文用两种 soft 算子把它们组合:

  • soft OR:sOR = 1 − (1−u)(1−r),用于「任一准则认为重要就保留」(偏召回,宁可多留);
  • soft AND:sAND = u · r,用于「多准则一致认为重要才保留」(偏精确,更稀疏)。

其中 u、r 是两个待融合的分数(例如 IER 分数与某启发式分数)。通过 OR/AND 组合,可以在「保留多一点」与「压到极稀疏」之间调节。

(3) 训练时只对被选 token 反传。 最终只有 IER(经 soft 融合后)高于阈值的少量 token 参与梯度更新。由于保留了「信号密度最高」的 token,整体学习效果持平甚至更好,而参与计算的 token 数从 100% 降到 0.1%~1%。

4.3 全景对照

组件输入输出作用
信号-噪声分解 (Thm 1, Def 1)reverse-KL 梯度每个 token 的 IER = 信号/噪声理论上量化 token 信息效率
候选集近似学生/教师 top-K + 采样动作小规模候选集 C让 IER 可计算
soft OR / ANDIER + 启发式分数融合后的保留分数调节稀疏度与召回
稀疏反传高 IER token更新后的学生用 0.1%~1% token 达到全量效果

五、评估指标与实验证据

5.1 评测设定与指标

论文在数学推理与医学专业两类高难度基准上验证:

  • 数学推理:AIME25、AIME26、HMMT25、HMMT26(竞赛级数学,难度高、长链推理,是检验 OPD 的硬核场景);
  • 医学:HealthBench(专业医疗问答基准,衡量领域知识迁移)。

核心因变量:在不同** token 预算(budget)下(0.1% / 1% / 10%),看学生模型在以上基准上的准确率/得分,并与全量训练(100% token)**比较。token 预算即「参与梯度更新的 token 占总 token 的比例」。

辅助指标:

  • 单步开销(step time 增量):稀疏选择本身引入的计算成本,必须足够小才有实用价值;
  • 与多种 selection 基线的对比:Prefix、Entropy、TIP、TA-OPD、CA-SoftOR,以及它们的组合(如 TIP + IER-AND)。

实验设计的关键论点是:若低预算下 IER-OPD 的得分逼近甚至超过全量训练,就证明「1% 的 token 真的够」。

5.2 关键结果(论文表 1~表 3 摘录)

结果一:0.1% 预算即近乎持平(AIME26)。 在 AIME26 上,仅用 0.1% 的 token 预算,IER-OPD 取得 58.9,而全量训练为 59.9——差距仅 1 分,可视作近乎持平(parity)。这说明在竞赛数学这种长推理任务上,真正驱动学习的 token 极其稀疏,0.1% 就几乎覆盖完了。

结果二:医学领域 IER 显著修复了「前缀法」的短板(HealthBench)。 在 HealthBench 上:

  • 朴素 Prefix(只训前缀)仅 38.30;
  • 加入 IER-OR(soft OR 融合)后升到 44.98;
  • 全量训练为 45.77。

即 IER-OR 把 Prefix 的 38.30 拉到了接近全量的 44.98,几乎吃满了全量收益——而它用的 token 远少于全量。这显示:在医学这类「错误常在序列中段/后段」的任务上,单纯训前缀不够,IER 的「哪里重要训哪里」恰好补上。

结果三:1% 预算反超全量(AIME25)。 在 AIME25 上,用 1% 预算的 TIP + IER-AND 取得 17.0,超过了全量训练的 14.4。这是一个反直觉却有力的证据:适度稀疏(1%)不仅没损失,反而因为「滤掉噪声 token、聚焦信号 token」而优于全量——全量训练里那 99% 的低 IER token 其实在拖后腿。

结果四:开销可忽略。 引入 IER 选择带来的额外单步时间仅 +2.2%。考虑到它把参与梯度的 token 从 100% 砍到 0.1%~1%(即算力主体大幅下降),这 2.2% 的「筛选税」净收益极高。

5.3 思维开关实验(§5.5 thinking-on/off)

论文还报告了在「thinking 开/关」(是否让模型显式输出推理链)两种设定下的结果,验证 IER 选择在不同生成范式下都稳健。结论方向一致:IER 的选择准则不依赖特定推理格式,具有通用性。

5.4 指标如何支撑核心主张

实验设计结论支撑的主张
AIME26 @0.1%极低预算 vs 全量58.9 vs 59.9「1% 的 token 就够」成立
HealthBenchPrefix vs +IER-OR vs 全量38.30→44.98→45.77IER 补上 Prefix 的分布盲区
AIME25 @1%TIP+IER-AND vs 全量17.0 > 14.4适度稀疏可反超全量
step time加 IER 选择+2.2%筛选开销可忽略

这些结果共同指向一个机制性结论:OPD 的学习信号高度集中在极少数高 IER token 上;去掉低 IER 的噪声 token,不仅省算力,还常常改善优化。

六、效果优势的根源解释

6.1 根源机制与证据链

因果链 1:reverse-KL 梯度的信息高度集中 → 多数 token 是噪声。

OPD 用 reverse-KL 策略梯度,其梯度在 Fisher 几何下可分解为「信号 + 噪声」→ 学生已学会的 token 信号≈0、估计又随机(噪声大)→ 这些 token 的 IER≈0 → 全量训练在 99% 的 token 上「白算梯度」。 证据等级:论文理论已支持(Theorem 1 + Definition 1 的分解);实验以「低预算持平」佐证。

因果链 2:按 IER 筛选 = 只保留「信号密度高」的 token → 等效甚至优于全量。

用候选集近似把 IER 算得出来 → soft OR/AND 融合多准则 → 只训高 IER token → 保留的正是驱动 reverse-KL 下降的那部分 → 0.1%~1% token 即逼近全量(AIME26 58.9 vs 59.9),1% 时因滤掉噪声反而反超(AIME25 17.0 vs 14.4)。 证据等级:论文实验已支持(各预算表)。

因果链 3:候选集近似让理论可落地 → 开销仅 +2.2%。

直接算 IER 需遍历词表 V,不可行 → 用 TopK(学生)∪TopK(教师)∪{a} 把动作空间压到 ~2K+1 → IER 估计变廉价 → 净算力随 token 数下降而大幅下降,筛选税仅 +2.2%。 证据等级:论文实验已支持(step time)。

反事实推理:若不做 IER 筛选(即全量训练),则 99% 的低 IER token 参与更新,既浪费算力,又用噪声扰动拖慢/拖偏优化——AIME25 上「全量 14.4 < 1% 的 17.0」正是反证。若只做朴素 Prefix/Entropy 而不用 IER 理论,则在「错误不在前缀/不在高熵位」的任务(如 HealthBench)上会显著掉分(38.30),说明「凭位置/熵启发式」不如「凭信号-噪声比」精准。

6.2 相关工作检索与对照(WebSearch 交叉验证)

围绕「on-policy distillation(MiniLLM、GKD)」与「稀疏 token 选择」做外部检索。注意区分「方法相似」与「结论相近」。

研究(可核验链接)相似尝试(方法)相关结论与 IER-OPD 的差异与边界对根源解释的影响
MiniLLM(Gu et al., 2023;arXiv:2306.08561)序列级 reverse-KL 策略梯度做 LLM 蒸馏方法相似:同用 reverse-KL + 策略梯度做 OPD证明「在学生自己生成的数据上用 reverse-KL 策略梯度」能有效蒸馏,且优于 forward-KL/offline它聚焦「怎么把梯度估出来并稳住」,未做「按 token 信息效率筛选」支持因果链1 的 OPD 设定;但未触达 IER 的稀疏筛选,故 IER-OPD 在其之上推进
GKD / Generalized KD(Agarwal et al., 2024;arXiv:2306.13649)统一多散度 + 学生数据比例 λ 的 on-policy 蒸馏方法相近:系统研究 OPD 框架结论:当教师-学生能力差距大时,on-policy(λ→1)显著优于 off-policy;on-policy 是强基线它论证「同策略本身重要」,IER-OPD 进一步论证「同策略下还要挑 token」补充因果链1:同策略前提下仍有巨大冗余,IER 把冗余挖掉
TIP / TA-OPD / Prefix / Entropy(OPD token 选择启发式,见论文 Related Work)各类「选哪些 token 训」的方法方法相似(都在做 token 选择)经验上某些选择优于全量,但缺乏统一理论、且任务间不稳定IER-OPD 用信号-噪声比给它们一个统一理论框架,并用 soft OR/AND 融合支持因果链2:token 选择有效,但 IER 提供更稳的理论准则
策略梯度方差缩减研究(baseline / TRPO / 重要性采样修正等)经典 RL 文献方法相似(减方差思路)共识:策略梯度方差是核心瓶颈,减方差能加速收敛IER 把「减方差」升级为「按信息效率选 token」,是方差议题的新角度支持因果链1 的方差视角

证据缺口说明:本次检索聚焦于 OPD 奠基工作(MiniLLM、GKD)与 token 选择启发式脉络,均能在论文 Related Work 与公开 arXiv 中核验。在本次检索范围内,未发现「在 Fisher 几何下对 reverse-KL 梯度做信号-噪声分解并定义 IER、再据此做 0.1% 级稀疏训练」的完全同名工作——IER-OPD 的这一组合是其增量。亦未发现否定「OPD 学习信号高度集中」的反例(该结论与 MiniLLM/GKD 的 on-policy 有效性相互印证)。

6.3 综合判断与未决问题

  • 多研究共同支持的机制:(a) OPD(在学生自身数据上训练)本身有效且优于 offline(MiniLLM、GKD 共识);(b) 策略梯度方差是真实瓶颈、减方差/选样本能改善优化(经典 RL + 本文一致)。
  • 本文强支撑的机制:token 级 IER 筛选能在 0.1%~1% 预算达到/超过全量——由多基准(AIME/HMMT/HealthBench)一致佐证,可信度高。
  • 仍属合理推测 / 待深究:IER 作为「信号/噪声」的估计在候选集近似下是否_bias_ 了选择(近似可能漏掉 TopK 之外的真正高 IER token);在不同模型规模、不同教师-学生差距下,最优预算是否仍是 0.1%~1% 区间,论文未系统扫描。
  • 优势成立的条件:学生与教师差距适中、任务有「少数关键 token」结构(数学推理、专业问答均符合)。
  • 可能失效的条件:若任务的信息分布极均匀(每个 token 都关键),IER 筛选的红利会缩小;若候选集 K 太小而真正高 IER token 落在 TopK 之外,近似会漏选。

七、必要知识反推

一个无基础者要做出 IER-OPD,须掌握并融合以下知识:

7.1 领域知识层

  • 知识蒸馏与 reverse/forward-KL 的区别:为何 reverse-KL 在蒸馏里常用、其 mode-covering / mode-seeking 性质意味着什么。
  • 策略梯度与 REINFORCE:梯度形如 E[ρ·∇log],为何有高方差,baseline 为何能减方差。不理解这个就写不出 Theorem 1 的分解。
  • 同策略(on-policy)训练含义:为何 OPD 要用学生自己生成的数据,与 RLHF 的 on-policy 同源。

7.2 方法论知识层

  • Fisher 信息矩阵与信息几何:梯度在 Fisher 度量下的几何意义,信号/噪声如何在几何视角下分解。这是把「选 token」从启发式升格为理论的关键。
  • 重要性采样(importance sampling):ρ = π_T / π_θ 的角色,以及候选集近似为何用教师+学生 TopK。
  • 多准则融合算子:soft OR/AND 为何分别是「召回型/精确型」,以及如何在稀疏度与覆盖间权衡。

7.3 工程知识层

  • LLM 训练中的 token 级反传与 masking:如何只让被选 token 参与梯度(mask 掉其余),这决定了「省算力」能真正落地。
  • step time 评测:如何把「筛选引入的开销」量化成 +2.2%,以证明净收益。

7.4 知识融合的关键节点

创造性节点在于:把「策略梯度方差大」这个老问题,重新表述为「每个 token 的信息效率(信号/噪声)不同」这个新视角,并用 Fisher 几何给出可计算定义,再在工程上用候选集近似与 soft 融合把它变成可落地的稀疏训练。这需要蒸馏、RL 方差理论、信息几何、训练系统工程四类知识的融合。

八、论文中可以提取的通用性灵感

8.1 机制类:「学习信号高度集中,训练应聚焦信号而非覆盖」

  • 核心思想:任何「对大量样本/位置求梯度」的优化里,真正驱动进步的往往是极少数高信息效率的样本/token;与其全量更新,不如先量化「谁值得训」。
  • 论文证据:0.1% token 持平、1% token 反超全量。
  • 推广场景:① 强化学习里优先回放「高价值轨迹」;② 数据蒸馏中按「对模型提升最大」筛选样本;③ 主动学习选取「信息量最大」的未标注样本。

8.2 范式迁移:「从减方差到选样本」

  • 核心思想:面对高方差优化,除了「把估计搞准」,还可以「只信高信噪比的部分」——后者往往更省、更稳。
  • 论文证据:IER 用信号-噪声比替代单纯降方差,实现极端稀疏。
  • 推广场景:① 大模型 SFT 中「只训难例 token」;② 多任务学习中按任务梯度信噪比分配权重;③ 在线学习中按反馈可信度选样本。

8.3 信号利用类:「候选集近似让理论可落地」

  • 核心思想:漂亮的理论若不可计算就无意义;用「TopK(学生)∪TopK(教师)∪{采样}」这类小规模近似,能把指数级/词表级计算压到常数级。
  • 论文证据:候选集近似使 IER 可算,开销仅 +2.2%。
  • 推广场景:① 检索增强中只重排 top-k 候选;② 任何需在超大动作空间估计期望的场景,先用双模型 TopK 裁剪。

8.4 关注点分离类:「主准则 + 多启发式 soft 融合」

  • 核心思想:让一个理论准则(IER)当主心骨,再用 soft OR/AND 吸收已有启发式(Prefix/Entropy/TIP),兼顾稳健与可解释。
  • 论文证据:TIP+IER-AND 在 AIME25 反超全量。
  • 推广场景:① 推荐系统多目标融合;② 模型集成的多信号投票;③ 任何「已有多个有效启发式、想要统一框架」的场景。

8.5 紧凑性类:「1% 的 token 就够」对算力的启示

  • 核心思想:在能力已较强的模型上,继续训练的边际信号极稀疏;盲目全量更新是算力浪费。
  • 论文证据:AIME26 上 0.1% 即近乎持平。
  • 推广场景:① 持续预训练/后训练的「差分更新」;② 边缘设备上的增量微调;③ 训练预算受限时的优先级调度。

小结:IER-OPD 用一个反直觉但被数学与实验双重支撑的洞见——「OPD 里 99% 的 token 梯度近乎噪声」——把同策略蒸馏从「全量更新」推进到「按信息效率(IER = 信号/噪声)筛选」。它在 Fisher 几何下对 reverse-KL 梯度做信号-噪声分解,用候选集近似与 soft OR/AND 融合把理论落地,最终仅用 0.1%~1% 的 token 就达到甚至超过全量训练(AIME26 58.9 vs 59.9、AIME25 17.0 vs 14.4),开销仅 +2.2%。其启示远超蒸馏本身:凡「对大量位置求梯度」的优化,都该先问一句「谁真正值得训」。局限在于候选集近似的理论偏差与跨规模/跨任务的最优预算仍有待系统研究。