论文链接:DAPD: Dual-Anchored Policy Distillation 代码仓库:github.com/uanu2002/DAPD 发表时间:2026年8月 领域标签:LLM 后训练 / 策略蒸馏 / 强化学习

一、论文背景:自蒸馏为什么会让模型变差

什么是在策略(on-policy)自蒸馏(OPSD)? 想象一个学生做数学题。普通训练是学生自己想答案、对答案;自蒸馏是"学生先做一遍,然后把参考答案当作’特权信息’给一个教师版本的自己,让教师版本的自己指导学习"。教师的优势是能看到参考答案,所以理论上能给出更好的指导。这是当前 LLM 后训练的主流方法之一。

问题来了:OPSD 经常让模型越练越差。 论文给出了精确数字:在 Qwen3-4B 上,OPSD 训练到第 300 步时,每 10,000 次生成中会出现 37 个"错误声明"(wrong claims)——模型先说"我推导不出来",然后把一个错误答案归因于"记忆/参考/官方解",最终答案还是错的。这个数字从训练开始的 13 涨到了 37,几乎翻了 3 倍。与此同时,AIME 数学推理的平均正确率从 59.56 跌到了 53.24。

为什么参考答案这么有用却会害了模型? 这就是论文要回答的核心问题。

二、论文定位和关联工作

OPSD 的改进工作大致三类:

类别代表方法思路局限
直接用特权监督OPSD、SDFT、SDPO把参考答案直接喂给教师不解决信息不对称
选择性修改特权信号Purified OPSD、DOPD过滤/路由特权信号中"可复现"的部分仍在不对称设置下操作
改监督结构本身DAPD(本文)在匹配信息可用性下对齐—

关键区别:前两类方法都在"教师有特权、学生没有"的不对称设置下打补丁——要么改信号,要么路由信号。DAPD 的根本不同是改变监督的结构本身,让对齐发生在"双方信息可用性匹配"的条件下。

三、问题定义:信息不对称导致特权幻觉

论文把问题抽象为信息不对称(Information Asymmetry):

  • 训练时(教师):能看到参考答案 $y^*$,所以能产生"依赖参考答案才能产生的行为"。
  • 推理时(学生):看不到参考答案,但被训练得"表现得像参考答案还在一样"。

结果就是特权幻觉(Privilege Illusion)——学生学到了一种"我知道答案但我推不出来,只能假装我推出来了"的行为模式。

形式化地,论文定义了三种条件分布(对任意完成源 $s \in \{y, y^*\}$,$\bar{s}$ 为另一个):

分布条件特权信息
None $p_{\mathrm{None}}^{s}$只看 $s$ 的前缀无(匹配推理)
Cross $p_{\mathrm{Cross}}^{s}$看 $s$ 前缀 + 另一完成 $\bar{s}$有(教师训练时)
Self $p_{\mathrm{Self}}^{s}$看 $s$ 前缀 + 自身完整 $s$有(且可训练)

OPSD 直接把 Cross(教师)对齐到 None(学生)——这就是"纠缠蒸馏",把可复现的指导和不可复现的特权依赖混在一起更新。

四、问题解法:双锚定

4.1 Self 分布——关键的"桥梁"

Self 分布是整个解法的巧妙之处:它和 Cross 一样都接收完整完成(信息匹配),但它和 None 共享模型参数(可训练)。所以 Self 能当桥梁——通过共享参数,隐式地把两个 None 分布对齐。

4.2 Dual-Path Anchoring(DPA)——双路径锚定

DPA 构造两条互补的对齐路径:

无条件路径:两侧都不依赖特权信息。通过 Inference Anchor 让 Self→None,通过原 OPSD 的 Entangled Distillation 让 None→Cross,再借 Self 这个共享参数的桥梁,隐式对齐两个 None 分布。

特权路径:直接对齐都接收特权的 Self 和 Cross。

两条路径组合,既保留了 OPSD 原始监督,又在信息匹配下做了对齐。

4.3 Dual-Source Anchoring(DSA)——双源锚定

DSA 在两个方向应用 DPA:

  • Rollout→Reference($y \to y^*$):参考提供正确性指导(可靠但可能 off-policy)。
  • Reference→Rollout($y^* \to y$):rollout 提供 on-policy 指导(学生可达但可能不正确)。

最终目标:$\mathcal{L}_{\mathrm{DAPD}} = \lambda \mathcal{L}_{\mathrm{DPA}}^{y \to y^*} + (1-\lambda) \mathcal{L}_{\mathrm{DPA}}^{y^* \to y}$。

4.4 理论保证

论文证明了无条件路径的有效性:通过共享参数,Inference Anchor 步骤在期望上把 Cross 朝参考侧的 None 锚点移动。实测梯度点积均值为 256.62(95% CI [147.55, 393.53],为正),余弦相似度 0.101(CI [0.058, 0.144],为正)——实证支持理论假设。

五、评估指标与实验证据

5.1 六任务主结果(Qwen3-4B)

方法AIME24AIME25HMMT25LCB v5BFCL v3IFBench平均
Base75.5665.5642.5052.1161.3829.6754.46
OPSD76.6767.7843.3352.2661.3230.6755.34
Purified OPSD76.6767.5045.0053.1662.5032.6756.25
DOPD73.6165.0038.8950.3061.4731.6753.49
DAPD77.2272.2246.3953.3161.9133.0057.34

DAPD 相对 OPSD 平均 +2.00,相对 Purified OPSD +1.09,相对 DOPD +3.85。

5.2 跨尺度——这是最关键的证据

ScaleOPSD vs BaseDAPD vs BaseDAPD vs OPSD
1.7B+5.19+7.13+1.94
4B+1.39+4.08+2.69
8B≤+0.28+2.41+2.41
14B≤+0.28+2.13+2.04
32B≤+0.28+3.06+2.78

这个实验为什么有证明力? 它揭示了一个反直觉的事实:OPSD 的增益在 8B 以上几乎消失。为什么?因为更大模型的 rollout 本身已经包含更多有用的推理和自我纠正——但 OPSD 的教师会利用参考答案绕过这些步骤,把这些有用的行为"蒸馏没了"。DAPD 因为在匹配信息下对齐,保留了这些增益。如果是简单的"加监督"问题,所有尺度的增益模式应该相似;只有"信息不对称"能解释"大模型上 OPSD 失效"这个尺度依赖现象。

5.3 特权幻觉的减少

训练步骤 250-300 期间"错误声明"数(每 10,000 生成):

  • OPSD:37 个
  • 仅 Privileged Anchor:22 个(减少 45%)
  • DAPD 完整方法:11 个(减少 73%)

六、效果优势的根源解释

baseline(OPSD)的根本局限:它把"可复现的指导"和"不可复现的特权依赖"混在一起更新。这不是"它没过滤信号",而是"它的监督结构本身就允许特权信息渗透到学生的推理行为里"——所以无论怎么过滤/路由信号(Purified OPSD、DOPD),都治标不治本。

DAPD 的根本性改变:它不修改特权信号,而是改变对齐发生的条件——让对齐在"双方信息可用性匹配"时发生(Self 作为桥梁),同时保留特权路径确保有特权时也对齐。

因果链:方法差异(双路径锚定 + Self 桥梁)→ 机制变化(对齐在匹配信息下发生,特权依赖不被转移到推理时学生)→ 指标提升(特权幻觉减少 73%,大尺度上 OPSD 消失的增益被恢复)。

为什么大尺度上更明显? 因为大模型的 rollout 已经"自带"了很多有用推理,OPSD 教师用参考答案绕过这些推理是"负收益";DAPD 让这些推理被保留。这是一个"信号质量随模型能力变化"的动态现象,只有匹配信息监督才能捕捉。

七、必要知识反推

领域知识层:

  • OPSD 的训练-推理不一致现象(特权信息只在训练时可用)。
  • LLM 推理的"自我纠正"行为随规模增强的实证现象。

方法论知识层:

  • 信息不对称的概念——这是从经济学/契约理论借鉴的创造性节点。
  • 分布匹配/对齐的形式化(三种条件分布的设计)。
  • 跨尺度的实验设计——用规模作为"信号质量"的自然实验。

工程知识层:

  • component-clipped forward KL 散度实现(cap=0.05 防止单一 token 主导)。
  • LoRA 子空间的梯度兼容性测量。

知识融合的关键节点:把经济学的"信息不对称"迁移到蒸馏的"特权幻觉"——意识到 OPSD 失效的本质是教师/学生的信息条件不匹配,而解法是构造一个"信息匹配的桥梁"(Self 分布)。

八、论文中可以提取的通用性灵感

灵感一:改信号不如改结构

  • 核心思想:当一个方法的失效根因是"结构性的不对称",在信号层面打补丁(过滤/路由)只能缓解;只有改变结构本身(让对齐发生在匹配条件下)才能根治。
  • 论文证据:DAPD(改结构)+2.00 vs Purified OPSD(改信号)+1.09 vs DOPD(路由信号)-3.85。
  • 推广场景:(1) 数据增强中的训练/测试分布不一致;(2) 主动学习中的标注者-模型不一致;(3) 对抗训练中的攻击者-防御者能力不对称。

灵感二:用"桥梁"对齐不可直接对齐的分布

  • 核心思想:当两个分布因信息条件不同无法直接对齐时,构造一个共享参数的"桥梁"分布(与双方都部分兼容),可以隐式对齐它们。
  • 论文证据:Self 分布与 Cross 信息匹配、与 None 参数共享,作为桥梁对齐两个 None。
  • 推广场景:(1) 跨模态对齐(用共享表示空间桥接);(2) 域适应(源域/目标域的桥梁样本);(3) 知识蒸馏中教师/学生容量不匹配。

灵感三:用"尺度"作为方法的自然实验

  • 核心思想:如果一个方法的效果随模型规模呈现"反常"模式(如增益消失),那说明失效根因与模型能力动态相关;跨尺度实验能暴露这种根因。
  • 论文证据:OPSD 在 8B+ 增益消失,DAPD 保持稳定——正是这个反常模式揭示了"信息不对称"。
  • 推广场景:(1) 评估训练方法的规模鲁棒性;(2) 诊断"为什么大模型上某技巧失效";(3) 预测方法的 Scaling 行为。

本精读基于 DAPD 论文全文撰写,覆盖 Abstract、Method(三种分布定义、DPA/DSA 全部公式、理论保证)、Experiments(六任务主结果、五尺度跨规模、特权幻觉分析、消融全部表格)。