本文为三篇论文合并精读:论文一《Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning》(arXiv:2609.33781,EAPO);论文二《Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation》(arXiv:2609.35347,DN-MOPD);论文三《d-OPD: Future-Aware On-Policy Distillation for Block Diffusion Language Models》(arXiv:2609.35362,d-OPD)。三篇各覆盖问题与解法,第五、六部分分论文给证据,最后合并讨论。
总题目区
论文一(EAPO):arXiv 2609.33781 | 2026 年 9 月 | KAIST(第一单位)+ DeepAuto.ai(Sung Ju Hwang 双聘)| cs.LG / RLVR / token 级信用分配 论文二(DN-MOPD):arXiv 2609.35347 | 2026 年 9 月 | 南洋理工大学(第一单位)+ 耶鲁大学 + 曼彻斯特大学,纯高校合作 | cs.CL / 多教师蒸馏 / 能力融合;当日 Hugging Face 日榜 up=111 趋势第一 论文三(d-OPD):arXiv 2609.35362 | 代码开源于 mit-han-lab | 2026 年 9 月 | 清华大学(第一作者)+ MIT(Han Lab 主导)+ NVIDIA(Song Han 双聘)| cs.CL / 块扩散语言模型 / 蒸馏
一、论文背景:训练信号不是「有没有」,而是「准不准」
要从三个基本概念讲起。
RLVR 与 token 级信用分配。可验证奖励的强化学习(RLVR)是当前 LLM 推理后训练的主流范式:给模型一道数学题,采样一批完整回答,用验证器判对错,再用 GRPO 之类的算法更新参数。问题在于奖励是序列级的——一条几百 token 的推理链只拿到一个 0/1 标量,而 GRPO 把这个标量均匀广播到轨迹上每个 token。可是一条推理链的成败往往取决于少数几个关键决策点(一步转换、一个引理选择),大多数 token 只是例行续写。「哪几个 token 真正值得奖/罚」就是 token 级信用分配问题。分配失当的后果不只是慢——错误的惩罚落在错误的位置,会把模型还没充分探索的解法路径直接压死。
熵。策略熵衡量模型在某位置输出分布的「不确定程度」:高熵意味着模型还在多个候选之间犹豫,低熵意味着它已经笃定。训练中一个广为人知的现象是熵塌缩:随着强化训练推进,模型迅速「过早自信」,输出趋于同质化,探索能力随之枯竭(浙江大学+腾讯的 STEER 研究、阿里通义的熵动力学分析都系统刻画过这一现象)。于是「熵」从一个被动的观测量变成了主动的调控对象——既然高熵位置是模型「还能改主意」的位置,能否用它来引导信用分配?这正是 EAPO 所属谱系的出发点,但此前的方法忽略了一个关键不对称(见问题定义)。
on-policy 蒸馏与多教师版。后训练的另一条路线是蒸馏:让一个强「教师」模型给「学生」的输出逐 token 打分。在策略蒸馏(OPD)中学生采样自己的 rollout、教师对每个 token 给出分布,学生最小化与教师的反向 KL——它兼得 RL 的在策略性(学生学的是自己会遇到的局面)与 SFT 的信号密集性(每个 token 都有反馈而非整条轨迹一个奖励)。Thinking Machines 的实践显示 OPD 达到同等数学水平比 RL 省约一个数量级算力。当单项能力各有专家时(数学专家、代码专家、指令跟随专家),自然 extension 是多教师 OPD(MOPD):按提示路由到对应专家。既有研究都在优化「谁来教」——路由标签、动态路由器、均匀池——而忽视了「教多响」:不同专家的反馈尺度可能天差地别。
块扩散语言模型与 AR 转换蒸馏。自回归(AR)模型逐 token 生成,质量高但无法并行;掩码扩散模型(masked diffusion)从全 MASK 序列出发迭代去噪,可并行生成但质量落后。块扩散(block diffusion,BD3-LM 一脉)取折中:块间自回归、块内并行去噪,兼顾生成质量、任意长度生成与 KV 缓存加速。由于 AR 预训练模型远强于从头训练的扩散模型,主流做法是把 AR 模型转换蒸馏成块扩散模型——但这里藏着一个此前无人量化的坑:两种模型在同一位置看到的信息不一样(详见问题定义)。
三篇论文的共同底色由此浮现:训练信号的研究已经从「更密」「更强」进入「更准」的阶段——稀疏与密集的矛盾被 OPD 解决后,剩下的是三类更隐蔽的失真。
二、论文定位和关联工作
谱系一:熵感知信用分配(EAPO 的坐标系)。GRPO 均匀广播是原点;EntropyAdv 给优势加熵加成(无界、影响稳定性);HAPO 做有界熵偏好(HKUST-GZ+华为的四象限分解工作,证明 token 可携带的信用以其熵为上界——CMI 视角);80/20 Forking Tokens 只更新最高熵 20% 的 token(选择性但无方向区分);RLRT 用特权信息反向蒸馏。这些方法有一个共同假设:对正反馈和负反馈使用同一个熵偏好。EAPO 的区分点:熵的信息量依赖反馈符号——正优势下的高熵是「惊讶的成功」(最有价值的探索样本),负优势下的高熵是「尚有替代路径的失败」(惩罚它等于烧掉退路),两者必须反向处理。
谱系二:多教师在策略蒸馏(DN-MOPD 的坐标系)。单教师 OPD 从 GKD、MiniLLM 到 Thinking Machines 的 Tinker 实践已成熟;多教师方向有 Label-routed MOPD(域标签路由)、Dynamic router(学习路由器)、Uniform pool(均匀采样教师)、以及参数级的 ParamMerge。同期还有 Open-MOPD 诊断出「token 预算错配」(长答案域霸占优化预算、短答案域被饿死)。DN-MOPD 的区分点:不碰路由、不加教师调用、不学路由器——只问一个被所有前作跳过的问题:各域反馈的强度尺度是否可比。它与 Open-MOPD 互补:一个修 token 数量失衡,一个修信号幅度失衡。
谱系三:AR→块扩散转换蒸馏(d-OPD 的坐标系)。Blockwise SFT 用教师前缀做块内 SFT;BARD 把蒸馏方向反过来(dLLM 教师 → AR 学生)以绕开 AR 教师与扩散学生之间的分布鸿沟;OPDLM 做了正确的第一步——用学生自己的部分去噪状态做 on-policy 训练而非教师前缀,但蒸馏目标仍是未修正的 AR 教师分布。d-OPD 的区分点:首次量化了「教师条件集 ⊂ 学生条件集」造成的目标条件失配,并用 Bayes 重加权做最小修正。
| 维度 | 之前的路线 | 三篇论文的突破 |
|---|---|---|
| 信用分配 | 同一熵偏好用于正负反馈 | EAPO:符号-熵耦合,非对称重分配 |
| 多教师蒸馏 | 只优化「谁来教」(路由) | DN-MOPD:批内测离散度,修「教多响」(尺度) |
| AR→块扩散 | 正确的状态(OPDLM),未修正的目标 | d-OPD:Bayes 未来重加权,目标与信息集对齐 |
| 修正幅度 | 加模型/加采样/加特权信息 | 三者均为零额外模型的最小修正 |
定位结论:三篇分别站在三条谱系的「下一步」位置,且都选择了诊断先于设计的路径——先用可测量的证据把失真钉死(重采样实验、梯度占比、KL 诊断),再做理论上可解释的最小修正。
三、问题定义:训练信号失真的三种形态
EAPO:符号信息被抹平。具体场景:GRPO 把响应级优势 Â_i 均匀分给每个 token。抽象问题:给定 (Â_i, h_{i,t})(响应级优势与 token 级熵),如何构造 token 级权重 w_{i,t},使「值得强化的位置」与「值得惩罚的位置」得到方向相反的熵偏好?其经验基础是一个不对称发现(Table 1 重采样实验,见第六部分):成功响应的高熵窗口重采样后成功率暴跌(成功不可复现),失败响应的高熵窗口重采样反而成功率上升(替代路径仍在)。形式化:w_{i,t} ∝ exp(κ·sign(Â_i)·h_{i,t}),正优势偏高熵、负优势偏低熵。
DN-MOPD:多源尺度失衡。具体场景:数学/代码/IF 三个 RL 专家的 token 级反馈(教师-学生 log-ratio)进入同一学生的联合梯度。抽象问题:当各域反馈的离散度天然不齐(IF 是池化的 2.3–4.4 倍、数学约一半)时,等权融合意味着梯度被「声音最大」的域劫持。形式化:给定各域离散度 σ_d 与池化 σ_all,求有界重缩放乘子 w_d 使 Std(w_d·r_d) ≈ σ_all——把「谁教」的离散决策与「多响」的连续校准解耦。
d-OPD:条件集失配。具体场景:块扩散学生在预测第 i 个位置时以整块部分去噪状态为条件(右侧已填的 token 可见),而 AR 教师目标只依赖因果前缀。抽象问题:当学习者可见信息严格多于监督目标的生成条件时,直接蒸馏会把学生拉向一个没有利用其可见信息的次优目标。形式化:目标是学生条件诱导的精确后验 p(v | q, z, x̂^O_i, x̂^A_i),可用教师是因果条件 p_T(Ô_i | q, z, Â_i),两者间的 token 级 KL 就是失配的度量。
共性。三种失真对应监督信号的三个正交维度:语义方向(EAPO:同一统计量在正负反馈下含义相反,却被对称处理)、量纲尺度(DN-MOPD:多源信号幅度不可比,却被等权融合)、条件结构(d-OPD:监督目标与学习器的信息集不一致,却被直接使用)。三者都发生在「信号已经存在且看起来合理」的地方——这正是盲区的定义。
四、问题解法
4.1 EAPO:符号-熵耦合的信用重分配
三步构造,全部零额外模型:
- 熵归一化:token 熵 h_{i,t} 按批次内 10/90 分位归一到 [0,1],stop-gradient + 裁剪保证权重不污染熵估计本身;
- 耦合权重:w_{i,t} ∝ exp(κ·sign(Â_i)·h_{i,t}),再按响应内均值归一。κ=log 4(由训练稳定性扫描选出)。关键在 sign(Â_i):正优势时权重随熵指数上升(惊讶的成功最值得固化),负优势时权重随熵下降(自信的失败最值得纠正)、高熵位置惩罚被衰减(保留替代路径);
- 接入 GRPO:重分配后的 token 级优势直接替换均匀广播,其余训练管线不变。
理论配套:Prop.1 证明该分配是 token 空间 KL 锚定优化问题的解;Prop.2 证明负更新使未选替代分布集中(即「惩罚高熵失败会系统性压缩探索」的形式化——反向印证耦合设计的必要性)。
4.2 DN-MOPD:批内离散度测量 + 有界乘子重缩放
保留 Label 路由的全部结构,只插入四步:
- 测量:每个 batch 内,对每个域 d 计算教师-学生 log-ratio r = ℓ_T − ℓ_roll 的离散度 σ_d,以及全域池化 σ_all——这些量本来就在 rollout 里,零额外教师调用;
- 重缩放:w_d = clip(σ_all/σ_d, 0.25, 4)。有界裁剪防极端值,正缩放保号(不改变反馈方向);
- 加权:该域蒸馏优势 Ã = stopgrad(w_d·A)(梯度不流经乘子);
- 更新:进标准 clipped OPD 目标。
MOPD 是 w≡1 的特例——这个退化关系使所有对比实验天然受控(同专家、同初始化、同提示、同更新预算,只差 w)。实现要点:尺度估计在 token 池上做、训练损失在响应均值上做,两者分工明确。
4.3 d-OPD:Bayes 未来重加权 + top-k 候选打分
目标构造分四步:
- 分解:由链式法则,把教师联合分布按 Bayes 重加权为 π̃_i(v) ∝ r_i(v)·p_T(Ô_i | q, z, Â_i, v)——因果教师先验 × 未来兼容项(使观察到的可见未来更可能出现的候选获得更高权重);
- 候选集:教师/学生 top-k 候选并集(k=16 覆盖 >99.4% 概率质量,开销仅 2.63%),用 on-policy rollout 已生成的完整块做前缀/后缀的实现样本——不需要额外采样;
- 相对未来分数:Δs_i(v) = s_i(v) − s_i(x̂_i),以 rollout 实际 token 为参考,避免未打分候选被系统性偏置;最小化前向 KL(π̃_T,i ‖ p_θ,i);
- 正确性门控:仅对通过任务 verifier 的 rollout 施加未来修正——错误 rollout 的「未来」本身不可靠,修正它等于放大噪声(消融:58.8→59.8)。
三者共同的设计纪律:修正只作用于已被诊断失真的环节(EAPO 只改权重函数、DN-MOPD 只改标量乘子、d-OPD 只改目标分布的重加权),管线其余部分与基线逐位相同。
五、评估指标与实验证据
5.1 EAPO:探索能力的全预算领先
设置:DAPO-Math-17k-Processed 训练(LoRA),6 个竞赛级数学基准,主指标 avg@32/pass@32。
主结果:Qwen3-4B-Base 六基准平均 31.0%(最强基线 +5.6pp)、8B-Base 34.0%(+4.3pp);4 种骨干(含 Olmo-3-7B-Think-DPO)全部总体第一。样本点:4B AIME24 avg@32 20.2 vs GRPO 12.5 / RLRT 15.3;AIME26 15.7 vs GRPO 7.5。
| 方法(4B) | AIME24 | AIME26 | 平均 |
|---|---|---|---|
| GRPO | 12.5 | 7.5 | 基线 |
| RLRT(特权信息) | 15.3 | — | 次强 |
| EntropyAdv / 80/20 | 13.1 / 11.9 | — | 熵基线 |
| EAPO | 20.2 | 15.7 | 31.0(+5.6) |
探索性的直接证据(比分数更重要):答案熵 H_norm 0.751 vs 基线 0.647–0.672、答案碰撞率 0.101 vs 0.159–0.173——模型保持多样性而非收窄到单一解法;AIME26 上 pass@k 到 k=256 时解出所有基线都未解出的题;且并非靠更长响应——匹配 token 预算下 EAPO 仍 20.2% vs RLRT 峰值 15.7%。
消融链条(3×3 方向网格):b₊=+1 固定时,惩罚方向从高熵改为低熵 +5.64pp;b₋=−1 固定时强化方向从低熵改为高熵 +6.22pp;(+1,−1) 组合最优、比均匀 credit 高 6.52pp——两个方向都有独立贡献,且符号耦合是必要的。OOD 泛化:Reasoning Gym 8 任务 avg@16:4B 34.89%(+1.46)、8B 43.02%(+3.02)。
5.2 DN-MOPD:梯度占比从 94% 到各域均衡
设置:Qwen3.5-9B/4B/2B 独立训练的专家池,6 公开基准(AIME25/AIME26/LCB v5/v6 avg@64/avg@6,IFEval/IFBench avg@16),16K 与 8K 两种评估长度、3 seeds。
主结果(对 Label-routed MOPD 的总分增益):
| 学生规模 | 16K 增益 | 8K 增益 | 16K 总分 |
|---|---|---|---|
| 9B | +1.17 | +2.47 | 59.6 vs Label 58.4(最强单教师 58.5) |
| 4B | +2.24 | +3.08 | 52.5 vs 50.3 |
| 2B | +2.36 | +2.92 | 29.0 vs 26.6 |
三种子平均 +1.12/+1.97/+2.34,配对 95% CI 全部 >0。
诊断证据链:IF 域 log-ratio 离散度是池化信号的 2.3–4.4×、数学约一半;初始 4B 学生下 IF 损失占联合梯度 94%;Label 路由 16K 下数学增益为零、8K 仅保留数学专家增益的 14–32%。修正后数学域每个规模都恢复增益(MATH-500 上对 Label 最高 +5.95)。
固定权重控制实验(机制归因的关键设计):仅 IF×0.25 恢复大部分增益(4B +1.79、2B +2.19),仅 Math×2 只恢复小部分(+1.20/+0.27)——收益主要来自压低过响的 IF,而非放大被压低的数学;固定全局权重 (2,1,0.25) 与 DN-MOPD 的自适应测量无可检差异——机制确实是尺度校准,与路由改进无关。
5.3 d-OPD:从 0.4444 到 0.1249 的失配消除
设置:Qwen3 0.6B–8B,6 基准(MMLU/MMLU-Pro/GPQA-Diamond/GSM8K/MATH500/AIME25),块大小 N ∈ {4,8,16}。
失配的直接诊断:49,948 个可枚举精确后验的 masked-token 边际上,因果目标与精确后验的平均 token 级 KL 0.4444,修正后 0.1249(降 71.9%)——这个数字先于任何下游指标证明问题真实存在且修正有效。
主结果(8B,六基准平均):
| N | OPDLM | BARD | d-OPD |
|---|---|---|---|
| 4 | 55.9 | 57.3 | 59.8(AIME25 23.3 vs 10.0) |
| 8 | 46.3 | — | 50.3(+4.0,最大增益) |
| 16 | 43.1 | — | 46.9 |
4B/1.7B/0.6B 全部一致占优(55.1 vs 51.5、42.3 vs 39.3、27.8 vs 25.2)。
与机制预测的一致性:块越大、学生可见未来越多、失配应该越重、修正收益应该越大——N 从 4→8 时增益从 3.9 涨到 4.0,N=16 时仍 +3.8。训练效率:达到 OPDLM 最佳性能的时间加速 1.35–1.58×(8B:17.91h vs 28.26h)——修正开销 2.63%,换来更快收敛,净收益为正。correctness gate 消融:58.8→59.8。
5.4 汇总对照
| EAPO | DN-MOPD | d-OPD | |
|---|---|---|---|
| 失真形态 | 符号不对称被抹平 | 多源尺度失衡 | 条件集失配 |
| 诊断证据 | 重采样实验 −18.8/+9.3pp | 梯度占比 94% | KL 0.4444 |
| 修正机制 | 符号-熵耦合权重 | 有界乘子重缩放 | Bayes 未来重加权 |
| 额外开销 | 零(无模型/采样) | 零(复用已有量) | 2.63%(top-k 打分) |
| 头部数字 | 4B 平均 31.0(+5.6) | 9B 总分 59.6 vs 58.4 | 8B 59.8 vs 55.9 |
| 规模 | 4B/8B ×4 骨干 | 2B/4B/9B ×3 种子 | 0.6B–8B ×3 块大小 |
三个「证明力」检查:EAPO 用匹配 token 预算的对照排除了「答案更长」的解释,用答案熵/碰撞率直接测量探索而非只报分数;DN-MOPD 的固定权重控制实验把「尺度校准」与「路由改进」两个假设干净分离;d-OPD 的可枚举后验诊断把「方法有效」追溯到「失配确实被消除」的机制层。三篇也各有诚实边界:EAPO 的 κ=log 4 是稳定性扫描的经验选择、理论刻画在锚定 KL 框架内;DN-MOPD 规模止于 9B/80 updates、方法本身是标准技巧的直白应用(作者自认);d-OPD 的未来打分依赖 verifier 可用的任务。
六、效果优势的根源解释
6.1 为何非对称耦合有效:熵的信息量以反馈符号为条件
因果链(论文实验已支持的部分):(1) Table 1 重采样实验证明不对称存在——正确响应从高熵窗口重采样,成功率 29.1→4.1(4B,−18.8pp)/29.6→4.3(8B,−20.7pp),说明高熵位置的「成功」是运气而非实力,重复采样大概率不复现;错误响应从高熵窗口重采样反而 +9.3/+12.7pp,说明失败响应的高熵窗口里替代路径仍然存活。(2) 既有熵方法对正负优势用同一熵偏好,意味着负更新把惩罚集中在高熵位置——恰是「还有救」的位置,Prop.2 形式化了这一点(负更新使条件熵非增、KL 非减,即系统性压缩替代分布)。(3) EAPO 反转负优势的熵偏好后:成功探索被固化为可重复行为(正优势高熵强化)、自信失败被针对纠正(负优势低熵惩罚)、恢复路径被保留(高熵惩罚衰减)——对应到指标:pass@k 全预算领先、答案熵更高、碰撞率更低。
外部交叉验证:HAPO(arXiv 2604.11056,HKUST-GZ+华为)从 CMI 视角独立证明 token 可携带信用以其熵为上界、且「正负更新有独特角色」——与 EAPO 的核心假设同源;ACPO(arXiv 2607.03126,北大+快手+百度)明确做「成功 rollout 强调不确定决策、失败 rollout 强调过度自信 token」的非对称调制——与 EAPO 的 (+1,−1) 设计同构且独立有效,构成不同团队对同一机制的收敛证据;GTPO(ICML 2026)用熵权重再分配奖励同样有效,说明「熵携带信用分配信息」这一前提已被多方接受。边界与相反证据:STEER(arXiv 2510.10150)指出熵干预本质是间接的、只调一两个因素有局限——EAPO 只在数学域验证、κ 为经验选值,且高熵 token 未必都有信息(也可能是噪声),负优势下衰减惩罚只是缓解而非消除这一风险;跨域(代码/长程 agent)有效性仍待验证(此句为阅读者推测,论文未测)。
6.2 为何压低 IF 恢复数学:失衡在量纲而非冲突
因果链:(1) 不同 RL pipeline 独立训练的专家,其 token 级反馈的幅度天然不可比——IF 专家的 log-ratio 离散度是池化的 2.3–4.4×(IF 任务短、逐 token 约束密集,教师-学生分歧大),数学只有约一半。(2) 所有域更新同一学生参数,等权联合下 IF 提供联合梯度的 94%——不是数学教师「不会教」,是它的声音被淹没(Label 16K 数学增益为零不是路由错了,是梯度没到位)。(3) 重缩放使 Std(w_d·r_d)≈σ_all,数学梯度占比恢复,每个规模都出现数学增益——且增益随训练持续而非只在初始化附近,与「尺度校准」机制一致、与「更好的初始路由」不一致。
外部交叉验证:同期 Open-MOPD 诊断出另一形态的失衡——长答案域霸占 token 级优化预算、短答案域(恰是 IF)被饿死,并同样发现「问题不在梯度冲突而在预算错配」——两篇从不同入口(数量 vs 幅度)得到同构结论:MOPD 的失败主要不是教师打架,而是信号权重分配失衡;多任务学习领域的经典「imbalance problem」(更响的任务主导梯度,GradNorm/MGDA 一脉)与「多教师蒸馏需防单一教师主导」(视觉多教师蒸馏的 teacher-dropping 正则)在视觉与 MTL 场景反复验证了同一机制。边界:DN-MOPD 只修尺度失衡——若失衡源于路由标签错误、数据分布、或域间收敛速度漂移(Open-MOPD 指出的动态因素),离散度重缩放不适用;固定权重在 9B/4B 与自适应无可检差异也提示,当域构成随训练变化时自适应测量才可能拉开差距(此点为阅读者推测,论文 80 updates 内未观察到差异)。
6.3 为何未来重加权有效:目标必须与信息集一致
因果链:(1) block dLLM 学生在第 i 个位置以双向可见的块状态为条件,AR 教师目标只看因果前缀——同一训练状态上两者分布不一致,KL 0.4444 是这个不一致的直接度量(不是推测,是 49,948 个可枚举后验上的测量)。(2) 学生被拉向一个未利用其可见未来的次优目标——它明明「看得见」右侧已填内容,却被要求忽略它们。(3) Bayes 重加权把目标对齐到学生条件诱导的精确后验(KL 降至 0.1249),增益 2.6–4.0 点;机制的自验证:块越大失配越重、N 增大时收益不降反增(N=8 达 +4.0)——如果是别的机制在起作用,没有理由出现这种随 N 的单调一致性。(4) 开销控制(top-k=16 覆盖 >99.4% 质量 + 仅正确 rollout 开启)使修正成本 2.63%,且目标更准意味着收敛更快(1.35–1.58×)——修正不是开销而是投资。
外部交叉验证:OPDLM 已确立「用学生自己的状态做 on-policy」的正确姿势,d-OPD 补上「目标也要对齐学生的条件集」这另一半——这与 on-policy 蒸馏的原始动机(避免学生训练在教师会遇到的局面而非自己的局面,GKD/Thinking Machines 一脉的 distribution mismatch 论证)在更高抽象层完全同构:蒸馏的一切失配归根结底是条件/分布失配;BARD 反转蒸馏方向以绕开 AR↔dLLM 鸿沟,d-OPD 选择正面修复且全面占优(59.8 vs 57.3),说明失配可修而非只能回避。边界:未来打分依赖任务 verifier 做 correctness gate——verifier 不可用的开放域生成任务中,门控策略需要重新设计;top-k 近似在教师/学生分布差异极大时可能漏掉质量(论文实测 99.4% 覆盖,但这是数学/知识域的特性)。
6.4 综合判断与未决问题
多项研究共同支持的机制:(1) 熵携带信用分配信息、且其含义以反馈符号为条件(EAPO × HAPO × ACPO × GTPO 四方收敛);(2) 多源信号融合的失败主要来自权重/尺度失衡而非内容冲突(DN-MOPD × Open-MOPD × MTL imbalance 谱系);(3) 蒸馏目标与学习器信息集/状态分布的一致性是有效蒸馏的必要条件(d-OPD × OPDLM × GKD 谱系)。仍属推测:EAPO 的跨域泛化、DN-MOPD 在长训练/域构成漂移下自适应相对固定权重的优势、d-OPD 在无 verifier 域的迁移。适用条件:三者都要求失真是「单一维度、可测量」的——当多种失真叠加(如多教师 + 块扩散学生 + 符号不对称)时,修正的交互作用未知,这是三篇共同留下的空白,也是「训练信号工程」作为方向的下一步。
七、必要知识反推
假设一个没有背景的人要独立做出这三篇工作,最少必须知道什么?
领域知识层。其一,RLVR 的信号结构:outcome 奖励如何经 GRPO 广播为 token 级优势、均匀广播在哪一步引入失真——不知道这个无法定位「重分配」的插入点。其二,熵的动力学含义:策略熵不只是正则项,而是「模型还能改主意的程度」的度量,且其信息量依赖上下文(反馈符号)——这是 EAPO 动机实验的解读前提。其三,on-policy 蒸馏的双 KL 结构与 reverse-KL 的模式寻找特性、教师-学生 log-ratio 作为反馈信号的语义。其四,块扩散模型的双向条件结构:块内位置能看见未来 token 这一架构事实,是 d-OPD 问题的存在性前提——不懂 block dLLM 的人根本不会想到教师与学生信息集不同。
方法论知识层。信用分配理论(hindsight credit assignment 的「奖励条件后验-先验偏移」视角,能推出熵上界);多任务优化的失衡诊断(梯度占比、离散度统计、GradNorm 谱系的标准差对齐思想);概率图模型的链式法则分解(把联合分布拆成先验×兼容项是 Bayes 重加权的形式基础);受控实验设计——三篇的证明力全部来自设计而非数字:EAPO 的 3×3 方向网格、DN-MOPD 的固定权重对照、d-OPD 的可枚举后验与 N 扫描的自验证。
工程知识层。stop-gradient/clip 的位置与作用(EAPO 的归一化权重、DN-MOPD 的乘子都不参与梯度);批内统计量的在线估计(σ_d 池 token 而损失池响应的分工);top-k 候选打分的开销核算与以 rollout 实际 token 为参考的相对分数设计(避免系统性偏置);verifier gate 的接入。
知识融合的关键节点。化学反应发生在三处:(1) EAPO 把「重采样实验」(统计学)与「策略优化」(RL)焊接——用一个廉价的扰动实验读出熵-符号不对称,再把它变成权重函数;(2) DN-MOPD 把「测量在先」焊接进训练循环——不学路由器、不调超参,直接用批内可测统计量做自校准,让 MOPD 退化为自己的特例;(3) d-OPD 把「信息集一致性」(几乎哲学的原则)焊接成可计算量——用可枚举后验把「目标错了」从直觉变成 KL 数字,再用最小修正把这个数字降下来。三篇共同的深层融合:诊断仪器的构造先于算法设计。
八、论文中可以提取的通用性灵感
灵感一:同一统计量在不同反馈符号下含义相反,必须非对称处理。核心思想:任何「不确定度/异常度」指标的信息价值取决于它出现在成功还是失败的语境中——成功中的高不确定是惊喜(最该强化),失败中的高不确定是生机(最不该毁灭),失败中的低不确定才是病灶。论文证据:重采样实验 −18.8/+9.3pp 的不对称;(+1,−1) 比均匀 credit 高 6.52pp。推广场景:代码评审(通过的 PR 中的争议设计 vs 失败 PR 中的争议设计应区别对待);A/B 测试中「意外胜出的变体」与「意外落败的变体」的归因分析;医疗筛查中症状在「好转病人」与「恶化病人」身上的相反意义。
灵感二:多源信号融合前先测量各源的尺度,再决定权重。核心思想:「谁参与」与「声音多大」是两个正交决策——等权融合的隐含假设「各源幅度可比」几乎从不成立,且失衡的代价由安静的一方承担。论文证据:IF 占梯度 94%、压低 IF(+1.79)比放大数学(+1.20)恢复更多。推广场景:多传感器融合的量纲校准;多专家评审的评分尺度归一化(有的评审手松有的手紧);集成学习中基模型置信度的跨模型校准;跨部门 KPI 的量纲统一。
灵感三:监督/预测目标的条件集必须与学习器实际可用的信息集一致。核心思想:当学习者能看见而监督信号看不见时,直接模仿会把学习者训练成「故意无视信息」——这是所有跨架构迁移(AR→扩散、文本→多模态)的通病。论文证据:KL 0.4444→0.1249、随块大小单调自验证。推广场景:知识蒸馏中教师与学生输入模态不同的场景;带未来信息的离线评估器训练在线策略;人类专家演示(看不到实时遥测)教具身 Agent(能看到)时的条件错配。
灵感四:先造诊断仪器,再做最小修正。核心思想:与其提出新方法再找数字支持,不如先设计一个能把「信号哪里失真」变成可测量数字的实验(重采样实验/梯度占比/KL 诊断),让修正的必要性与充分性都可被证伪。论文证据:三篇的修正分别 preceded by −18.8pp、94%、0.4444 三个钉死的数字。推广场景:数据管道的数据质量探针;生产系统先建 SLO 分解再优化;组织变革前的诊断性试点。
灵感五:有界修正优于无界重构。核心思想:修正量 clip 在安全区间([0.25,4]、top-k=16、衰减而非移除惩罚)——极端情况宁可修不满,不可修过头引入新失衡;正确方向的 2.63% 开销修正胜过推倒重来。论文证据:DN-MOPD 的裁剪界限、d-OPD 的 top-k 近似、EAPO 的 stopgrad+clip。推广场景:系统迁移的灰度放量边界;自动化决策系统的人工复核阈值;教学中的渐进式纠错。
统一的元灵感:三篇论文在更高维度共享同一个动作——把「训练信号理所当然」的隐含假设逐条审计:它的方向对吗(符号)、它的幅度可比吗(尺度)、它的条件对吗(信息集)。当社区还在争论「RL 还是蒸馏」时,真正的前沿已经移到「每一个进入梯度的信号,是否在语义、量纲、条件三个维度上都忠实于它声称传达的信息」——训练信号工程(training signal engineering)正在成为后训练的独立学科。