论文链接:DAPD: Dual-Anchored Policy Distillation 代码仓库:github.com/uanu2002/DAPD 发表时间:2026年8月 领域标签:LLM 后训练 / 策略蒸馏 / 强化学习
一、论文背景:自蒸馏为什么会让模型变差
什么是在策略(on-policy)自蒸馏(OPSD)? 想象一个学生做数学题。普通训练是学生自己想答案、对答案;自蒸馏是"学生先做一遍,然后把参考答案当作’特权信息’给一个教师版本的自己,让教师版本的自己指导学习"。教师的优势是能看到参考答案,所以理论上能给出更好的指导。这是当前 LLM 后训练的主流方法之一。
问题来了:OPSD 经常让模型越练越差。 论文给出了精确数字:在 Qwen3-4B 上,OPSD 训练到第 300 步时,每 10,000 次生成中会出现 37 个"错误声明"(wrong claims)——模型先说"我推导不出来",然后把一个错误答案归因于"记忆/参考/官方解",最终答案还是错的。这个数字从训练开始的 13 涨到了 37,几乎翻了 3 倍。与此同时,AIME 数学推理的平均正确率从 59.56 跌到了 53.24。
为什么参考答案这么有用却会害了模型? 这就是论文要回答的核心问题。
二、论文定位和关联工作
OPSD 的改进工作大致三类:
| 类别 | 代表方法 | 思路 | 局限 |
|---|---|---|---|
| 直接用特权监督 | OPSD、SDFT、SDPO | 把参考答案直接喂给教师 | 不解决信息不对称 |
| 选择性修改特权信号 | Purified OPSD、DOPD | 过滤/路由特权信号中"可复现"的部分 | 仍在不对称设置下操作 |
| 改监督结构本身 | DAPD(本文) | 在匹配信息可用性下对齐 | — |
关键区别:前两类方法都在"教师有特权、学生没有"的不对称设置下打补丁——要么改信号,要么路由信号。DAPD 的根本不同是改变监督的结构本身,让对齐发生在"双方信息可用性匹配"的条件下。
三、问题定义:信息不对称导致特权幻觉
论文把问题抽象为信息不对称(Information Asymmetry):
- 训练时(教师):能看到参考答案 $y^*$,所以能产生"依赖参考答案才能产生的行为"。
- 推理时(学生):看不到参考答案,但被训练得"表现得像参考答案还在一样"。
结果就是特权幻觉(Privilege Illusion)——学生学到了一种"我知道答案但我推不出来,只能假装我推出来了"的行为模式。
形式化地,论文定义了三种条件分布(对任意完成源 $s \in \{y, y^*\}$,$\bar{s}$ 为另一个):
| 分布 | 条件 | 特权信息 |
|---|---|---|
| None $p_{\mathrm{None}}^{s}$ | 只看 $s$ 的前缀 | 无(匹配推理) |
| Cross $p_{\mathrm{Cross}}^{s}$ | 看 $s$ 前缀 + 另一完成 $\bar{s}$ | 有(教师训练时) |
| Self $p_{\mathrm{Self}}^{s}$ | 看 $s$ 前缀 + 自身完整 $s$ | 有(且可训练) |
OPSD 直接把 Cross(教师)对齐到 None(学生)——这就是"纠缠蒸馏",把可复现的指导和不可复现的特权依赖混在一起更新。
四、问题解法:双锚定
4.1 Self 分布——关键的"桥梁"
Self 分布是整个解法的巧妙之处:它和 Cross 一样都接收完整完成(信息匹配),但它和 None 共享模型参数(可训练)。所以 Self 能当桥梁——通过共享参数,隐式地把两个 None 分布对齐。
4.2 Dual-Path Anchoring(DPA)——双路径锚定
DPA 构造两条互补的对齐路径:
无条件路径:两侧都不依赖特权信息。通过 Inference Anchor 让 Self→None,通过原 OPSD 的 Entangled Distillation 让 None→Cross,再借 Self 这个共享参数的桥梁,隐式对齐两个 None 分布。
特权路径:直接对齐都接收特权的 Self 和 Cross。
两条路径组合,既保留了 OPSD 原始监督,又在信息匹配下做了对齐。
4.3 Dual-Source Anchoring(DSA)——双源锚定
DSA 在两个方向应用 DPA:
- Rollout→Reference($y \to y^*$):参考提供正确性指导(可靠但可能 off-policy)。
- Reference→Rollout($y^* \to y$):rollout 提供 on-policy 指导(学生可达但可能不正确)。
最终目标:$\mathcal{L}_{\mathrm{DAPD}} = \lambda \mathcal{L}_{\mathrm{DPA}}^{y \to y^*} + (1-\lambda) \mathcal{L}_{\mathrm{DPA}}^{y^* \to y}$。
4.4 理论保证
论文证明了无条件路径的有效性:通过共享参数,Inference Anchor 步骤在期望上把 Cross 朝参考侧的 None 锚点移动。实测梯度点积均值为 256.62(95% CI [147.55, 393.53],为正),余弦相似度 0.101(CI [0.058, 0.144],为正)——实证支持理论假设。
五、评估指标与实验证据
5.1 六任务主结果(Qwen3-4B)
| 方法 | AIME24 | AIME25 | HMMT25 | LCB v5 | BFCL v3 | IFBench | 平均 |
|---|---|---|---|---|---|---|---|
| Base | 75.56 | 65.56 | 42.50 | 52.11 | 61.38 | 29.67 | 54.46 |
| OPSD | 76.67 | 67.78 | 43.33 | 52.26 | 61.32 | 30.67 | 55.34 |
| Purified OPSD | 76.67 | 67.50 | 45.00 | 53.16 | 62.50 | 32.67 | 56.25 |
| DOPD | 73.61 | 65.00 | 38.89 | 50.30 | 61.47 | 31.67 | 53.49 |
| DAPD | 77.22 | 72.22 | 46.39 | 53.31 | 61.91 | 33.00 | 57.34 |
DAPD 相对 OPSD 平均 +2.00,相对 Purified OPSD +1.09,相对 DOPD +3.85。
5.2 跨尺度——这是最关键的证据
| Scale | OPSD vs Base | DAPD vs Base | DAPD vs OPSD |
|---|---|---|---|
| 1.7B | +5.19 | +7.13 | +1.94 |
| 4B | +1.39 | +4.08 | +2.69 |
| 8B | ≤+0.28 | +2.41 | +2.41 |
| 14B | ≤+0.28 | +2.13 | +2.04 |
| 32B | ≤+0.28 | +3.06 | +2.78 |
这个实验为什么有证明力? 它揭示了一个反直觉的事实:OPSD 的增益在 8B 以上几乎消失。为什么?因为更大模型的 rollout 本身已经包含更多有用的推理和自我纠正——但 OPSD 的教师会利用参考答案绕过这些步骤,把这些有用的行为"蒸馏没了"。DAPD 因为在匹配信息下对齐,保留了这些增益。如果是简单的"加监督"问题,所有尺度的增益模式应该相似;只有"信息不对称"能解释"大模型上 OPSD 失效"这个尺度依赖现象。
5.3 特权幻觉的减少
训练步骤 250-300 期间"错误声明"数(每 10,000 生成):
- OPSD:37 个
- 仅 Privileged Anchor:22 个(减少 45%)
- DAPD 完整方法:11 个(减少 73%)
六、效果优势的根源解释
baseline(OPSD)的根本局限:它把"可复现的指导"和"不可复现的特权依赖"混在一起更新。这不是"它没过滤信号",而是"它的监督结构本身就允许特权信息渗透到学生的推理行为里"——所以无论怎么过滤/路由信号(Purified OPSD、DOPD),都治标不治本。
DAPD 的根本性改变:它不修改特权信号,而是改变对齐发生的条件——让对齐在"双方信息可用性匹配"时发生(Self 作为桥梁),同时保留特权路径确保有特权时也对齐。
因果链:方法差异(双路径锚定 + Self 桥梁)→ 机制变化(对齐在匹配信息下发生,特权依赖不被转移到推理时学生)→ 指标提升(特权幻觉减少 73%,大尺度上 OPSD 消失的增益被恢复)。
为什么大尺度上更明显? 因为大模型的 rollout 已经"自带"了很多有用推理,OPSD 教师用参考答案绕过这些推理是"负收益";DAPD 让这些推理被保留。这是一个"信号质量随模型能力变化"的动态现象,只有匹配信息监督才能捕捉。
七、必要知识反推
领域知识层:
- OPSD 的训练-推理不一致现象(特权信息只在训练时可用)。
- LLM 推理的"自我纠正"行为随规模增强的实证现象。
方法论知识层:
- 信息不对称的概念——这是从经济学/契约理论借鉴的创造性节点。
- 分布匹配/对齐的形式化(三种条件分布的设计)。
- 跨尺度的实验设计——用规模作为"信号质量"的自然实验。
工程知识层:
- component-clipped forward KL 散度实现(cap=0.05 防止单一 token 主导)。
- LoRA 子空间的梯度兼容性测量。
知识融合的关键节点:把经济学的"信息不对称"迁移到蒸馏的"特权幻觉"——意识到 OPSD 失效的本质是教师/学生的信息条件不匹配,而解法是构造一个"信息匹配的桥梁"(Self 分布)。
八、论文中可以提取的通用性灵感
灵感一:改信号不如改结构
- 核心思想:当一个方法的失效根因是"结构性的不对称",在信号层面打补丁(过滤/路由)只能缓解;只有改变结构本身(让对齐发生在匹配条件下)才能根治。
- 论文证据:DAPD(改结构)+2.00 vs Purified OPSD(改信号)+1.09 vs DOPD(路由信号)-3.85。
- 推广场景:(1) 数据增强中的训练/测试分布不一致;(2) 主动学习中的标注者-模型不一致;(3) 对抗训练中的攻击者-防御者能力不对称。
灵感二:用"桥梁"对齐不可直接对齐的分布
- 核心思想:当两个分布因信息条件不同无法直接对齐时,构造一个共享参数的"桥梁"分布(与双方都部分兼容),可以隐式对齐它们。
- 论文证据:Self 分布与 Cross 信息匹配、与 None 参数共享,作为桥梁对齐两个 None。
- 推广场景:(1) 跨模态对齐(用共享表示空间桥接);(2) 域适应(源域/目标域的桥梁样本);(3) 知识蒸馏中教师/学生容量不匹配。
灵感三:用"尺度"作为方法的自然实验
- 核心思想:如果一个方法的效果随模型规模呈现"反常"模式(如增益消失),那说明失效根因与模型能力动态相关;跨尺度实验能暴露这种根因。
- 论文证据:OPSD 在 8B+ 增益消失,DAPD 保持稳定——正是这个反常模式揭示了"信息不对称"。
- 推广场景:(1) 评估训练方法的规模鲁棒性;(2) 诊断"为什么大模型上某技巧失效";(3) 预测方法的 Scaling 行为。
本精读基于 DAPD 论文全文撰写,覆盖 Abstract、Method(三种分布定义、DPA/DSA 全部公式、理论保证)、Experiments(六任务主结果、五尺度跨规模、特权幻觉分析、消融全部表格)。