论文链接:arXiv:2609.24432 代码仓库:github.com/BruceSheng1202/IER-OPD 发表时间:2026 年 9 月 机构:MBZUAI(穆罕默德·本·扎耶德人工智能大学)+ 蚂蚁集团(校企合作) 领域标签:cs.LG / 知识蒸馏 / 同策略训练 / 梯度估计
一、论文背景
1.1 什么是「知识蒸馏」,又为什么要有「同策略」
大语言模型(LLM)的训练有一个常见需求:把大模型(教师 Teacher)的能力,压缩/迁移到一个小模型(学生 Student)上。这个过程叫知识蒸馏(Knowledge Distillation, KD)。
最朴素的蒸馏是「离线蒸馏(off-policy / offline KD)」:先用教师模型对一批固定数据生成「软标签 / 参考答案」,再让学生去拟合这些静态目标。它的好处是简单、可批处理;缺点是学生永远在模仿教师「在别的数据分布上」给出的答案,与自己实际会采样出的分布脱节——当学生能力远弱于教师时,这种脱节尤为致命(学生「看不懂」教师要它模仿的东西)。
于是出现了同策略蒸馏(On-Policy Distillation, OPD):学生用自己的策略生成数据,再在这些「自己产生的」数据上去匹配教师。换句话说,教师只在学生「亲眼看到、亲自生成」的样本上给指导。这样做的好处是分布对齐——学生学的是「在自己会说的句子上,如何更像教师」,而非「在教师的句子上,如何抄教师」。
OPD 与 RLHF/强化学习里的「同策略(on-policy)」概念一脉相承:训练所用的数据与当前策略同分布,避免了 off-policy 的偏离与修正麻烦。
1.2 OPD 的核心矛盾:梯度方差爆炸
OPD 通常用**策略梯度(policy gradient)**来优化 reverse-KL 散度(让学生分布去贴近教师分布)。但策略梯度有个老毛病:方差极大。
直观理解:学生每生成一个 token,都要拿它和教师在同一位置的「可能动作集合」比较,得到一个「该往哪调」的梯度。但一条序列有成百上千个 token,绝大多数 token 学生已经说得和教师差不多了,这些位置的梯度接近于零噪声;而真正「学生说错、教师能纠正」的位置,才是携带学习信号的少数派。如果对每个 token 都等权更新,等于在海量噪声里捞那一点点信号——既浪费算力(每个 token 都要算梯度),又让优化被噪声拖慢。
这就引出了本论文的核心问题:
OPD 里,到底哪些 token 真正值得训练?能不能只挑出那 1% 的「高信息效率」token,就达到全量训练的效果?
1.3 一个关键观察:token 之间的信息效率天差地别
论文的出发点是:不同 token 对学习目标的「信息贡献」极不均匀。有些 token(比如一道数学题里的关键推理步、一个罕见但决定性的词)一旦被纠正,学生能力跃升;而大量「safe」token(如标点、常见衔接词)即使训练也几乎不改变什么。
如果能量化每个 token 的「信号 / 噪声」比,就能只保留高比值 token。这就是 IER(Information-Efficiency Ratio,信息效率比)的由来。
二、论文定位和关联工作
2.1 同策略蒸馏的方法谱系
onPanda 那篇关心「标注数据怎么来」,本篇关心「拿到同策略数据后,怎么高效地训练」。OPD 这条线近年有几条重要脉络:
- MiniLLM(Gu et al.)**:提出用序列级(sequence-level)**的 reverse-KL 策略梯度做 LLM 蒸馏,是 OPD 的早期奠基工作之一。它把蒸馏建模为学生在自己生成的数据上、用策略梯度最小化与教师的 reverse-KL。
- GKD(Generalized Knowledge Distillation,Agarwal et al., 2024):**把多种散度(forward/ddist 等)统一到 on-policy 框架下,引入「学生数据比例 λ(student-data fraction)」来插值 off-policy 与 on-policy,展示了同策略训练在教师-学生能力差距大时的优势。GKD 是 OPD 走向「通用化」的关键一步。
- 各类 OPD 变体:vOPD、OPRD、SA-OPD、TrOPD 等,多从「如何更稳地估计同策略梯度」入手(方差缩减、截断、重要性权重修正等)。
本论文与它们的区别在于:前面工作多在「怎么把梯度估计得更准」,而 IER-OPD 进一步问「哪些 token 的梯度值得算」——把问题从「梯度估计的偏差/方差」推进到「梯度的信息效率筛选」。
2.2 同策略训练中的「token 选择」
在 OPD 里「只训练一部分 token」并非全新想法,已有若干「选 token」的启发式:
- Prefix(前缀法):只训练每条序列的前若干 token;
- Entropy(熵法):挑学生预测熵高(最不确定)的 token;
- TIP(Token-level Importance for Policy gradient):基于某种重要性分数为 token 加权/筛选;
- TA-OPD:面向 OPD 的 token 级选择变体。
这些方法各有道理但缺乏统一理论。IER-OPD 的贡献正是给「选哪些 token」提供一个基于 Fisher 几何与信号-噪声分解的、可解释的准则,并证明用它能把所需 token 数压到极致(0.1%~1%)。
2.3 定位小结
| 维度 | 前人路线 | IER-OPD 的突破 |
|---|---|---|
| 优化目标 | 序列级 / 全 token 梯度 | 仍用 reverse-KL 策略梯度 |
| 梯度处理 | 降方差、修正权重 | 先量化「信号/噪声」,再按信息效率筛选 token |
| token 选择 | Prefix/Entropy/TIP 等启发式 | IER 理论准则 + 候选集近似 + soft OR/AND 融合 |
| 效果 | 通常需较多 token | 0.1%~1% token 达到/超过全量 |
三、问题定义
3.1 把「高效 OPD」抽象成什么
OPD 的目标可形式化为:在学生策略 π_θ 生成的同策略数据上,最小化学生与教师 π_T 之间的 reverse KL 散度 KL(π_θ ‖ π_T)。优化用策略梯度,每步要为每个生成的 token 估计梯度。
论文把核心难题抽象为:
给定:学生策略 π_θ、教师策略 π_T、当前同策略采样的一批序列。 求:一个** token 级的选择/加权准则**,使得只对被选中的少量 token 计算并应用梯度,就能达到「对全部 token 计算梯度」的同款(甚至更好)的收敛效果。 约束:(a) 准则必须可解释、可计算,不能依赖不可得的真值;(b) 计算开销(算 IER、筛 token)必须远小于「全 token 梯度」节省的算力,净收益为正。
3.2 一个类比
把 OPD 想象成「老师辅导学生写作文」:
- 全量训练:老师把学生写的每一句话都逐字批改、逐字讲解——绝大多数句子学生已经写对了,老师是在做无用功,还因为讲得太细而把自己讲累(梯度方差大、进展慢)。
- IER-OPD:老师先判断「哪几句话才是学生真正不会、改了能进步的」(高 IER),只对这几句精批细讲。结果学生进步一样快,老师省了 99% 的精力。
关键是:老师靠的不是「随机抽几句」,而是靠一个可量化的「这句值不值得讲」的指标——这正是 IER。
四、问题解法
IER-OPD 的解法分两条主线:(A) 在理论上定义 IER;(B) 在工程上用 IER 做稀疏 token 选择。
4.1 理论主线:reverse-KL 梯度的「信号-噪声」分解
在 Fisher 信息几何视角下,reverse-KL 的局部梯度可以写成(论文以 g = E_p[ρ(a)·ϕ_a] 的形式表达,其中 ρ 为重要性比、ϕ_a 为某动作方向):
- Theorem 1(信号-噪声分解):该梯度的期望可分解为一个信号项(指向真正能缩小 reverse-KL 的更新方向)与一个噪声项(零均值但高方差的扰动)。
- 最优标量基线 b*:存在一个最优的标量基线 b*,能使梯度的方差最小(类比 REINFORCE 里 baseline 减方差的经典结论,但本文在 OPD 的 reverse-KL 设定下推导)。
- Definition 1(IER = 信号 / 噪声):定义信息效率比 IER = Signal / Noise。它衡量「单位噪声下,这个 token 携带多少有用学习信号」。
直觉:如果一个 token 处,学生与教师差异大、且这个差异方向明确(信号强),同时估计这个信号的随机性小(噪声低),那它的 IER 就高——它值得被训练。反之,学生已经和教师一致(信号≈0)或估计极不稳定(噪声大)的 token,IER 低,不值得算梯度。
这一步把「选 token」从启发式升级为有几何依据的、可排序的准则:每个 token 都能算出一个 IER 分数,分数越高越该被训练。
4.2 工程主线:用 IER 做稀疏选择
直接算 IER 需要遍历词表并对每个动作估计信号/噪声,代价不菲。论文给出可扩展的实现:
(1) 候选集近似(candidate-set approximation)。 把「所有可能动作」缩到一个小候选集:
C = TopK(z_θ) ∪ TopK(z_T) ∪ {a} 即学生概率最高的 K 个 token、教师概率最高的 K 个 token、以及实际被采样到的那个动作 a 的并集。这样信号/噪声估计只需在这个小集合上做,复杂度从词表大小 V 降到约 2K+1。
(2) 多准则的 soft 融合。 IER 是「主准则」,但还可以结合其它有用信号(如 Prefix、Entropy、TIP、TA-OPD、CA-SoftOR 等启发式分数)。论文用两种 soft 算子把它们组合:
- soft OR:sOR = 1 − (1−u)(1−r),用于「任一准则认为重要就保留」(偏召回,宁可多留);
- soft AND:sAND = u · r,用于「多准则一致认为重要才保留」(偏精确,更稀疏)。
其中 u、r 是两个待融合的分数(例如 IER 分数与某启发式分数)。通过 OR/AND 组合,可以在「保留多一点」与「压到极稀疏」之间调节。
(3) 训练时只对被选 token 反传。 最终只有 IER(经 soft 融合后)高于阈值的少量 token 参与梯度更新。由于保留了「信号密度最高」的 token,整体学习效果持平甚至更好,而参与计算的 token 数从 100% 降到 0.1%~1%。
4.3 全景对照
| 组件 | 输入 | 输出 | 作用 |
|---|---|---|---|
| 信号-噪声分解 (Thm 1, Def 1) | reverse-KL 梯度 | 每个 token 的 IER = 信号/噪声 | 理论上量化 token 信息效率 |
| 候选集近似 | 学生/教师 top-K + 采样动作 | 小规模候选集 C | 让 IER 可计算 |
| soft OR / AND | IER + 启发式分数 | 融合后的保留分数 | 调节稀疏度与召回 |
| 稀疏反传 | 高 IER token | 更新后的学生 | 用 0.1%~1% token 达到全量效果 |
五、评估指标与实验证据
5.1 评测设定与指标
论文在数学推理与医学专业两类高难度基准上验证:
- 数学推理:AIME25、AIME26、HMMT25、HMMT26(竞赛级数学,难度高、长链推理,是检验 OPD 的硬核场景);
- 医学:HealthBench(专业医疗问答基准,衡量领域知识迁移)。
核心因变量:在不同** token 预算(budget)下(0.1% / 1% / 10%),看学生模型在以上基准上的准确率/得分,并与全量训练(100% token)**比较。token 预算即「参与梯度更新的 token 占总 token 的比例」。
辅助指标:
- 单步开销(step time 增量):稀疏选择本身引入的计算成本,必须足够小才有实用价值;
- 与多种 selection 基线的对比:Prefix、Entropy、TIP、TA-OPD、CA-SoftOR,以及它们的组合(如 TIP + IER-AND)。
实验设计的关键论点是:若低预算下 IER-OPD 的得分逼近甚至超过全量训练,就证明「1% 的 token 真的够」。
5.2 关键结果(论文表 1~表 3 摘录)
结果一:0.1% 预算即近乎持平(AIME26)。 在 AIME26 上,仅用 0.1% 的 token 预算,IER-OPD 取得 58.9,而全量训练为 59.9——差距仅 1 分,可视作近乎持平(parity)。这说明在竞赛数学这种长推理任务上,真正驱动学习的 token 极其稀疏,0.1% 就几乎覆盖完了。
结果二:医学领域 IER 显著修复了「前缀法」的短板(HealthBench)。 在 HealthBench 上:
- 朴素 Prefix(只训前缀)仅 38.30;
- 加入 IER-OR(soft OR 融合)后升到 44.98;
- 全量训练为 45.77。
即 IER-OR 把 Prefix 的 38.30 拉到了接近全量的 44.98,几乎吃满了全量收益——而它用的 token 远少于全量。这显示:在医学这类「错误常在序列中段/后段」的任务上,单纯训前缀不够,IER 的「哪里重要训哪里」恰好补上。
结果三:1% 预算反超全量(AIME25)。 在 AIME25 上,用 1% 预算的 TIP + IER-AND 取得 17.0,超过了全量训练的 14.4。这是一个反直觉却有力的证据:适度稀疏(1%)不仅没损失,反而因为「滤掉噪声 token、聚焦信号 token」而优于全量——全量训练里那 99% 的低 IER token 其实在拖后腿。
结果四:开销可忽略。 引入 IER 选择带来的额外单步时间仅 +2.2%。考虑到它把参与梯度的 token 从 100% 砍到 0.1%~1%(即算力主体大幅下降),这 2.2% 的「筛选税」净收益极高。
5.3 思维开关实验(§5.5 thinking-on/off)
论文还报告了在「thinking 开/关」(是否让模型显式输出推理链)两种设定下的结果,验证 IER 选择在不同生成范式下都稳健。结论方向一致:IER 的选择准则不依赖特定推理格式,具有通用性。
5.4 指标如何支撑核心主张
| 实验 | 设计 | 结论 | 支撑的主张 |
|---|---|---|---|
| AIME26 @0.1% | 极低预算 vs 全量 | 58.9 vs 59.9 | 「1% 的 token 就够」成立 |
| HealthBench | Prefix vs +IER-OR vs 全量 | 38.30→44.98→45.77 | IER 补上 Prefix 的分布盲区 |
| AIME25 @1% | TIP+IER-AND vs 全量 | 17.0 > 14.4 | 适度稀疏可反超全量 |
| step time | 加 IER 选择 | +2.2% | 筛选开销可忽略 |
这些结果共同指向一个机制性结论:OPD 的学习信号高度集中在极少数高 IER token 上;去掉低 IER 的噪声 token,不仅省算力,还常常改善优化。
六、效果优势的根源解释
6.1 根源机制与证据链
因果链 1:reverse-KL 梯度的信息高度集中 → 多数 token 是噪声。
OPD 用 reverse-KL 策略梯度,其梯度在 Fisher 几何下可分解为「信号 + 噪声」→ 学生已学会的 token 信号≈0、估计又随机(噪声大)→ 这些 token 的 IER≈0 → 全量训练在 99% 的 token 上「白算梯度」。 证据等级:论文理论已支持(Theorem 1 + Definition 1 的分解);实验以「低预算持平」佐证。
因果链 2:按 IER 筛选 = 只保留「信号密度高」的 token → 等效甚至优于全量。
用候选集近似把 IER 算得出来 → soft OR/AND 融合多准则 → 只训高 IER token → 保留的正是驱动 reverse-KL 下降的那部分 → 0.1%~1% token 即逼近全量(AIME26 58.9 vs 59.9),1% 时因滤掉噪声反而反超(AIME25 17.0 vs 14.4)。 证据等级:论文实验已支持(各预算表)。
因果链 3:候选集近似让理论可落地 → 开销仅 +2.2%。
直接算 IER 需遍历词表 V,不可行 → 用 TopK(学生)∪TopK(教师)∪{a} 把动作空间压到 ~2K+1 → IER 估计变廉价 → 净算力随 token 数下降而大幅下降,筛选税仅 +2.2%。 证据等级:论文实验已支持(step time)。
反事实推理:若不做 IER 筛选(即全量训练),则 99% 的低 IER token 参与更新,既浪费算力,又用噪声扰动拖慢/拖偏优化——AIME25 上「全量 14.4 < 1% 的 17.0」正是反证。若只做朴素 Prefix/Entropy 而不用 IER 理论,则在「错误不在前缀/不在高熵位」的任务(如 HealthBench)上会显著掉分(38.30),说明「凭位置/熵启发式」不如「凭信号-噪声比」精准。
6.2 相关工作检索与对照(WebSearch 交叉验证)
围绕「on-policy distillation(MiniLLM、GKD)」与「稀疏 token 选择」做外部检索。注意区分「方法相似」与「结论相近」。
| 研究(可核验链接) | 相似尝试(方法) | 相关结论 | 与 IER-OPD 的差异与边界 | 对根源解释的影响 |
|---|---|---|---|---|
| MiniLLM(Gu et al., 2023;arXiv:2306.08561)序列级 reverse-KL 策略梯度做 LLM 蒸馏 | 方法相似:同用 reverse-KL + 策略梯度做 OPD | 证明「在学生自己生成的数据上用 reverse-KL 策略梯度」能有效蒸馏,且优于 forward-KL/offline | 它聚焦「怎么把梯度估出来并稳住」,未做「按 token 信息效率筛选」 | 支持因果链1 的 OPD 设定;但未触达 IER 的稀疏筛选,故 IER-OPD 在其之上推进 |
| GKD / Generalized KD(Agarwal et al., 2024;arXiv:2306.13649)统一多散度 + 学生数据比例 λ 的 on-policy 蒸馏 | 方法相近:系统研究 OPD 框架 | 结论:当教师-学生能力差距大时,on-policy(λ→1)显著优于 off-policy;on-policy 是强基线 | 它论证「同策略本身重要」,IER-OPD 进一步论证「同策略下还要挑 token」 | 补充因果链1:同策略前提下仍有巨大冗余,IER 把冗余挖掉 |
| TIP / TA-OPD / Prefix / Entropy(OPD token 选择启发式,见论文 Related Work)各类「选哪些 token 训」的方法 | 方法相似(都在做 token 选择) | 经验上某些选择优于全量,但缺乏统一理论、且任务间不稳定 | IER-OPD 用信号-噪声比给它们一个统一理论框架,并用 soft OR/AND 融合 | 支持因果链2:token 选择有效,但 IER 提供更稳的理论准则 |
| 策略梯度方差缩减研究(baseline / TRPO / 重要性采样修正等)经典 RL 文献 | 方法相似(减方差思路) | 共识:策略梯度方差是核心瓶颈,减方差能加速收敛 | IER 把「减方差」升级为「按信息效率选 token」,是方差议题的新角度 | 支持因果链1 的方差视角 |
证据缺口说明:本次检索聚焦于 OPD 奠基工作(MiniLLM、GKD)与 token 选择启发式脉络,均能在论文 Related Work 与公开 arXiv 中核验。在本次检索范围内,未发现「在 Fisher 几何下对 reverse-KL 梯度做信号-噪声分解并定义 IER、再据此做 0.1% 级稀疏训练」的完全同名工作——IER-OPD 的这一组合是其增量。亦未发现否定「OPD 学习信号高度集中」的反例(该结论与 MiniLLM/GKD 的 on-policy 有效性相互印证)。
6.3 综合判断与未决问题
- 多研究共同支持的机制:(a) OPD(在学生自身数据上训练)本身有效且优于 offline(MiniLLM、GKD 共识);(b) 策略梯度方差是真实瓶颈、减方差/选样本能改善优化(经典 RL + 本文一致)。
- 本文强支撑的机制:token 级 IER 筛选能在 0.1%~1% 预算达到/超过全量——由多基准(AIME/HMMT/HealthBench)一致佐证,可信度高。
- 仍属合理推测 / 待深究:IER 作为「信号/噪声」的估计在候选集近似下是否_bias_ 了选择(近似可能漏掉 TopK 之外的真正高 IER token);在不同模型规模、不同教师-学生差距下,最优预算是否仍是 0.1%~1% 区间,论文未系统扫描。
- 优势成立的条件:学生与教师差距适中、任务有「少数关键 token」结构(数学推理、专业问答均符合)。
- 可能失效的条件:若任务的信息分布极均匀(每个 token 都关键),IER 筛选的红利会缩小;若候选集 K 太小而真正高 IER token 落在 TopK 之外,近似会漏选。
七、必要知识反推
一个无基础者要做出 IER-OPD,须掌握并融合以下知识:
7.1 领域知识层
- 知识蒸馏与 reverse/forward-KL 的区别:为何 reverse-KL 在蒸馏里常用、其 mode-covering / mode-seeking 性质意味着什么。
- 策略梯度与 REINFORCE:梯度形如 E[ρ·∇log],为何有高方差,baseline 为何能减方差。不理解这个就写不出 Theorem 1 的分解。
- 同策略(on-policy)训练含义:为何 OPD 要用学生自己生成的数据,与 RLHF 的 on-policy 同源。
7.2 方法论知识层
- Fisher 信息矩阵与信息几何:梯度在 Fisher 度量下的几何意义,信号/噪声如何在几何视角下分解。这是把「选 token」从启发式升格为理论的关键。
- 重要性采样(importance sampling):ρ = π_T / π_θ 的角色,以及候选集近似为何用教师+学生 TopK。
- 多准则融合算子:soft OR/AND 为何分别是「召回型/精确型」,以及如何在稀疏度与覆盖间权衡。
7.3 工程知识层
- LLM 训练中的 token 级反传与 masking:如何只让被选 token 参与梯度(mask 掉其余),这决定了「省算力」能真正落地。
- step time 评测:如何把「筛选引入的开销」量化成 +2.2%,以证明净收益。
7.4 知识融合的关键节点
创造性节点在于:把「策略梯度方差大」这个老问题,重新表述为「每个 token 的信息效率(信号/噪声)不同」这个新视角,并用 Fisher 几何给出可计算定义,再在工程上用候选集近似与 soft 融合把它变成可落地的稀疏训练。这需要蒸馏、RL 方差理论、信息几何、训练系统工程四类知识的融合。
八、论文中可以提取的通用性灵感
8.1 机制类:「学习信号高度集中,训练应聚焦信号而非覆盖」
- 核心思想:任何「对大量样本/位置求梯度」的优化里,真正驱动进步的往往是极少数高信息效率的样本/token;与其全量更新,不如先量化「谁值得训」。
- 论文证据:0.1% token 持平、1% token 反超全量。
- 推广场景:① 强化学习里优先回放「高价值轨迹」;② 数据蒸馏中按「对模型提升最大」筛选样本;③ 主动学习选取「信息量最大」的未标注样本。
8.2 范式迁移:「从减方差到选样本」
- 核心思想:面对高方差优化,除了「把估计搞准」,还可以「只信高信噪比的部分」——后者往往更省、更稳。
- 论文证据:IER 用信号-噪声比替代单纯降方差,实现极端稀疏。
- 推广场景:① 大模型 SFT 中「只训难例 token」;② 多任务学习中按任务梯度信噪比分配权重;③ 在线学习中按反馈可信度选样本。
8.3 信号利用类:「候选集近似让理论可落地」
- 核心思想:漂亮的理论若不可计算就无意义;用「TopK(学生)∪TopK(教师)∪{采样}」这类小规模近似,能把指数级/词表级计算压到常数级。
- 论文证据:候选集近似使 IER 可算,开销仅 +2.2%。
- 推广场景:① 检索增强中只重排 top-k 候选;② 任何需在超大动作空间估计期望的场景,先用双模型 TopK 裁剪。
8.4 关注点分离类:「主准则 + 多启发式 soft 融合」
- 核心思想:让一个理论准则(IER)当主心骨,再用 soft OR/AND 吸收已有启发式(Prefix/Entropy/TIP),兼顾稳健与可解释。
- 论文证据:TIP+IER-AND 在 AIME25 反超全量。
- 推广场景:① 推荐系统多目标融合;② 模型集成的多信号投票;③ 任何「已有多个有效启发式、想要统一框架」的场景。
8.5 紧凑性类:「1% 的 token 就够」对算力的启示
- 核心思想:在能力已较强的模型上,继续训练的边际信号极稀疏;盲目全量更新是算力浪费。
- 论文证据:AIME26 上 0.1% 即近乎持平。
- 推广场景:① 持续预训练/后训练的「差分更新」;② 边缘设备上的增量微调;③ 训练预算受限时的优先级调度。
小结:IER-OPD 用一个反直觉但被数学与实验双重支撑的洞见——「OPD 里 99% 的 token 梯度近乎噪声」——把同策略蒸馏从「全量更新」推进到「按信息效率(IER = 信号/噪声)筛选」。它在 Fisher 几何下对 reverse-KL 梯度做信号-噪声分解,用候选集近似与 soft OR/AND 融合把理论落地,最终仅用 0.1%~1% 的 token 就达到甚至超过全量训练(AIME26 58.9 vs 59.9、AIME25 17.0 vs 14.4),开销仅 +2.2%。其启示远超蒸馏本身:凡「对大量位置求梯度」的优化,都该先问一句「谁真正值得训」。局限在于候选集近似的理论偏差与跨规模/跨任务的最优预算仍有待系统研究。