论文链接:β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation 发表时间:2026年7月 机构:University of Maryland, College Park(Tom Goldstein、Furong Huang团队) 领域标签:cs.LG / 强化学习 / 知识蒸馏 / 推理语言模型
一、论文背景
1.1 什么是"在线策略自蒸馏"(OPSD)?
想象一个学生准备数学竞赛——最有效的训练方式不是反复做课本上的例题(那些题他已经做过了),而是自己做新题,做错后看标准答案对照纠正。
在线策略自蒸馏(On-Policy Self-Distillation, OPSD)正是这个思路在AI训练中的应用:
- 学生模型 $\pi_\theta$ 自己生成推理轨迹 $y$(“做题”)
- 特权教师 $p_T$ 拥有标准答案 $c$(“特权信息”),对学生生成的轨迹提供监督
- 学生在自己的轨迹上学习,避免"离线蒸馏"的暴露偏差(exposure bias)——即学生永远只在教师的轨迹上训练,到了推理时自己生成的轨迹分布不同就会崩溃
OPSD是当前改进推理语言模型的主流方法之一,但在实践中极其不稳定——需要大量工程调参才能让训练不崩溃。
1.2 OPSD为什么不稳定?
标准OPSD的训练目标是让学生匹配教师:
$$\min_\theta D_{KL}(\pi_\theta(\cdot|x) \| p_T(\cdot|x,c))$$这有几个根本问题:
问题一:直接匹配教师是"all-or-nothing"的。 学生要么完全跟随教师,要么完全偏离——中间状态不受目标函数的奖励。当学生初始能力远低于教师时(如1.7B学生 vs 拥有标准答案的教师),一步跨越太大,训练发散。
问题二:token级更新是"近视"的。 实际实现中,KL散度被分解为逐token的局部损失——每个token独立计算与教师的差异。但数学推理中,早期token的错误会传播到后续所有token——比如第一步算错了数字,后面整个推导就全错了。token级更新看不到这种传播效应。
问题三:没有"桥梁"。 标准OPSD只有两个端点——学生的当前分布和教师的分布。没有任何中间目标作为过渡,学生必须在两个极端之间跳跃。
1.3 为什么这个问题重要?
β-OPSD要解决的核心问题是:OPSD的本质到底是什么?它只是教师模仿,还是属于一个更大的优化家族?
如果能揭示OPSD是某个更广泛框架的特例,就能:
- 理解为什么β=1(标准OPSD)不稳定——因为它是最激进的端点
- 找到更稳定的中间点——通过调节参数β
- 用闭式解指导训练——避免直接RL优化的高方差
二、论文定位和关联工作
2.1 研究脉络
β-OPSD连接了两条研究脉络:
脉络一:在线策略蒸馏与自蒸馏
| 方法 | 核心思路 | 局限 |
|---|---|---|
| 标准OPSD | 学生在自己的轨迹上向教师蒸馏 | β=1不稳定 |
| Anti-distillation | 反向蒸馏避免过拟合 | 未解决根本结构问题 |
| OPSDL | 在线策略序列级蒸馏 | 仍直接匹配教师 |
| Reinforcement distillation | 用RL做蒸馏 | 高方差,高成本 |
脉络二:KL正则化强化学习(RLHF)
| 方法 | 核心思路 | 与β-OPSD的关系 |
|---|---|---|
| RLHF | 奖励最大化+KL锚定到参考策略 | β-OPSD将其奖励定义为教师到参考的对数比率 |
| DPO | KL正则化目标的闭式解 | β-OPSD推导了类似的闭式最优策略 |
| GRPO | 组相对策略优化 | β-OPSD在实验中作为对比baseline |
2.2 β-OPSD的定位突破
| 维度 | 之前的OPSD | β-OPSD的突破 |
|---|---|---|
| 目标函数 | 固定β=1(直接教师匹配) | β可调,定义从参考到教师的路径 |
| 最优策略 | 教师端点 | 几何插值(参考与教师之间) |
| 训练方式 | 直接RL优化或直接蒸馏 | RL推导目标,蒸馏执行训练 |
| 信用分配 | Token级局部更新 | Return-to-go(未来感知) |
核心定位:β-OPSD首次揭示OPSD不是孤立的蒸馏技巧,而是KL正则化策略优化家族的一员——通过调节β可以在"保守(靠近学生)“和"激进(靠近教师)“之间平滑过渡,且最优路径有闭式解。
三、问题定义
3.1 从具体场景到抽象本质
具体场景:如何让一个小模型(如Qwen3-1.7B)通过拥有标准答案的特权教师指导,稳定高效地提升竞赛级数学推理能力?
抽象本质:给定学生策略 $\pi_\theta$、参考策略 $\pi_{ref}$(学生的stop-gradient副本)和特权教师 $p_T$,如何定义一个训练目标,使得学生沿着一条稳定的路径从当前分布演化到教师分布?
3.2 形式化定义
β-OPSD目标族:
$$\mathcal{J}_\beta(\theta) = \mathbb{E}_{y \sim \pi_\theta(\cdot|x)} \left[\log \frac{p_T(y|x,c)}{\pi_{ref}(y|x)}\right] - \beta D_{KL}(\pi_\theta(\cdot|x) \| \pi_{ref}(\cdot|x))$$其中奖励定义为教师到参考的对数概率比率:$R(y;x,c) = \log \frac{p_T(y|x,c)}{\pi_{ref}(y|x)}$
求:使得 $\mathcal{J}_\beta(\theta)$ 最大化的学生策略 $\pi_\theta$
约束:
- β=1必须精确恢复标准OPSD(命题2.1)
- 最优策略必须有闭式解(便于推导蒸馏目标)
- 训练不能使用高方差的RL梯度估计
3.3 抽象的精妙之处
命题2.1的核心洞察:将β-OPSD目标展开:
$$\mathcal{J}_\beta(\pi_\theta) = -D_{KL}(\pi_\theta \| p_T) - (\beta-1)D_{KL}(\pi_\theta \| \pi_{ref})$$当β=1时,第二项消失,精确得到标准OPSD(最小化学生到教师的KL散度)。当β>1时,多出一个正则化项——约束学生不要偏离参考太远。
这个分解的精妙在于:它揭示了标准OPSD放弃了所有正则化(β=1使正则化项为零),学生被完全推向教师——这正是它不稳定的原因。
四、问题解法
4.1 推导最优策略:几何插值
命题2.2:β-OPSD目标的最优策略为:
$$\pi_\beta^*(y|x,c) = \frac{\pi_{ref}(y|x)^{1-\frac{1}{\beta}} p_T(y|x,c)^{\frac{1}{\beta}}}{Z_\beta(x,c)}$$类比理解:这是一个几何加权平均——参考策略的权重为 $1-1/\beta$,教师的权重为 $1/\beta$。
| β值 | 教师权重 $1/\beta$ | 参考权重 $1-1/\beta$ | 最优策略位置 |
|---|---|---|---|
| 1 | 1.0 | 0.0 | 完全在教师端点(标准OPSD) |
| 2 | 0.5 | 0.5 | 参考和教师的中点 |
| ∞ | 0.0 | 1.0 | 完全在参考端点(不学习) |
关键洞察:标准OPSD(β=1)要求学生一步跳到教师——这是最激进的目标。当学生初始能力远低于教师时,这种跳跃太大导致不稳定。β>1时,最优策略是参考和教师之间的中间点——学生只需跳到中途,更稳定可达。
4.2 调度插值:从渐进过渡到教师
训练不是固定一个β值,而是调度——随着训练进行,逐步增大教师权重 $w_k = 1/\beta_k$:
$$w_k = w_{start} + (w_{end} - w_{start}) \frac{k}{K-1}$$论文默认 $w_{start}=0.5$, $w_{end}=0.8$——训练早期目标在参考和教师之间(50%教师),训练后期移向更强教师指导(80%教师)。
类比:就像马拉松训练不从42公里开始,而是从10公里起步逐步增加——让学生的优化路径沿着一条平滑的曲线从当前分布走向教师分布,而非一步跨越。
4.3 从RL推导到蒸馏执行
核心难题:有了闭式最优策略 $\pi_\beta^*$ 后,如何训练学生匹配它?
直接用RL优化 $\mathcal{J}_\beta(\theta)$ 需要rollout采样、优势估计和高方差梯度——计算昂贵且不稳定。
解决方案:将闭式解转化为蒸馏目标。具体来说,最优策略的token级条件分布可以通过logit插值高效近似:
$$\tilde{p}_{\beta_k}(\cdot|h_t,c) = \text{softmax}\left((1 - w_k) z_{ref}(\cdot|h_t) + w_k z_T(\cdot|h_t,c)\right)$$其中 $z_{ref}$ 和 $z_T$ 分别是参考策略和教师的logits。
为什么这是闭式解的良好近似? 在保守区域(β≥1)中,序列级最优策略的自回归分解恰好对应于每个前缀上logit的加权平均——因为softmax的指数特性使得对数空间的加法等价于概率空间的几何平均。
执行方式:训练步骤 $k$ 时,学生被蒸馏为匹配插值目标 $\tilde{p}_{\beta_k}$——只需计算两个logit向量的加权和+softmax,然后做标准的KL散度最小化。
类比:就像用RL的理论推导找到了最优策略的解析解,然后把解析解当作教师来蒸馏——绕过了RL优化的不稳定性,但获得了RL的理论最优性。
4.4 Return-to-Go信用分配
标准OPSD的近视性:token级损失 $\rho_t = \log \pi_\theta(y_t|h_t) - \log p_T(y_t|h_t,c)$ 只看当前token与教师的差异。但数学推理中,token $t$ 的误差会影响 $t+1, t+2, \ldots$ 所有后续token的分布——因为自回归生成依赖前缀。
Return-to-Go解决方案:用从当前token到序列结束的累积未来失配作为权重:
$$G_{t,\gamma}^{\beta_k}(y) = \sum_{s=t}^{T} \gamma^{s-t} \rho_s^{\beta_k}(y)$$其中 $\gamma \in [0,1]$ 是折扣因子。
无偏性保证(命题B.1):当 $\gamma=1$ 时,return-to-go估计器是序列级逆向KL梯度的无偏估计器——也就是说,它精确恢复了"将整个序列作为一个整体"的梯度信号,但只需token级计算即可实现。
实用损失:
$$\mathcal{L}_{\beta\text{-OPSD}}(\theta;y) = \frac{1}{T} \sum_{t=1}^{T} \text{sg}(G_{t,\gamma}^{\beta_k}(y)) \log \pi_\theta(y_t|x,y_{4.5 完整算法
输入:学生 π_θ,特权教师 p_T,数据集 D
调度端点 w_start=0.5, w_end=0.8,折扣 γ=0.99
for k = 0 to K-1:
1. 采样问题 x ~ D
2. 学生在策略生成轨迹 y ~ π_θ(·|x)
3. 计算进度 w_k = 0.5 + (0.8-0.5) × k/(K-1)
4. 构造插值目标(logit加权平均)
5. 计算每个token的失配 ρ_t
6. 计算return-to-go权重 G_t(累积未来失配)
7. 用 G_t 加权的token损失更新 θ
end for
五、评估指标与实验证据
5.1 评估指标体系
主指标:avg@12(12次采样的平均正确率)——衡量数学推理的可靠性和稳定性
评估基准:
- AIME 2024/2025:美国数学邀请赛,竞赛级难度
- HMMT 2025:哈佛-MIT数学锦标赛,更高难度
对比方法:
- Base model(无后训练)
- SFT(在标准答案上监督微调)
- Vanilla OPSD(标准在线策略蒸馏,β=1)
- GRPO(组相对策略优化强化学习)
5.2 核心实验结果
主实验:三种模型规模
| 方法 | Qwen3-1.7B 平均 | Qwen3-4B 平均 | Qwen3-8B 平均 |
|---|---|---|---|
| Base | 33.89 | 57.13 | 56.85 |
| SFT | 26.30 | 17.96 | 56.11 |
| GRPO | 33.98 | 56.95 | 58.52 |
| Vanilla OPSD | 31.02 | 56.11 | 58.52 |
| β-OPSD | 36.76 (+5.74) | 57.87 (+1.76) | 60.18 (+1.66) |
关键发现:
- β-OPSD在所有三种模型规模上持续超越vanilla OPSD
- 小模型收益最大——Qwen3-1.7B上AIME 2024提升9.16分(44.17→53.33),平均提升5.74分
- β-OPSD强于GRPO——在所有规模上平均分更高,说明蒸馏路径优于纯RL
- SFT在Qwen3-4B上灾难性崩溃(17.96),说明直接监督微调不如在策略蒸馏
5.3 消融实验的证明力
消融一:Logit插值 vs. 直接教师
| 方法 | AIME 2024 | AIME 2025 | HMMT 2025 |
|---|---|---|---|
| Teacher + Return-to-go | 47.30 | 35.53 | 14.44 |
| β-OPSD target(插值) | 53.33 | 40.83 | 16.11 |
| 提升 | +6.03 | +5.30 | +1.67 |
证明了什么:即使两者都用return-to-go信用分配,logit插值目标仍带来巨大提升——因为插值提供了"中间桥梁”,学生不需要一步跳到教师。
消融二:Return-to-go vs. 局部token
| 方法 | AIME 2024 | AIME 2025 | HMMT 2025 |
|---|---|---|---|
| Local Token Gradient | 49.44 | 32.78 | 13.06 |
| Return-to-go Gradient | 50.56 | 38.33 | 16.67 |
| 提升 | +1.12 | +5.55 | +3.61 |
证明了什么:return-to-go在长序列推理(AIME 2025和HMMT 2025)上提升显著——因为它能感知早期token错误对后续的传播效应。
消融三:插值调度
| 调度 | AIME 2024 | AIME 2025 |
|---|---|---|
| Fixed 0.5 | 50.56 | 38.33 |
| Linear 0.2→0.8 | 51.39 | 37.50 |
| Linear 0.5→0.8 | 53.33 | 40.83 |
证明了什么:渐进式调度(0.5→0.8)优于固定值——训练早期保守(50%教师),训练后期激进(80%教师),形成平滑过渡。
六、效果优势的根源解释
6.1 为什么β-OPSD比vanilla OPSD更稳定?
baseline(vanilla OPSD, β=1)的根本局限:最优策略恰好是教师端点——学生被要求完全匹配教师。当学生初始分布 $\pi_\theta$ 与教师分布 $p_T$ 差距很大时(如1.7B学生 vs 拥有标准答案的教师),KL散度 $D_{KL}(\pi_\theta \| p_T)$ 的梯度方向指向一个不可达的端点——学生在有限步内无法到达教师,梯度信号在高维空间中振荡。
β-OPSD的根本性改变:
β>1时,最优策略 $\pi_\beta^*$ 是参考和教师的几何插值——一个中间点。学生的梯度方向指向这个可达的中间目标,而非遥远的教师端点。
随着训练进行,参考策略逐步向教师移动(因为学生在学习),中间目标也随之移动——形成一条动态的平滑路径。
因果链:β>1 → 最优策略为中间点而非教师端点 → 学生梯度指向可达目标 → 减少振荡 → 训练稳定 → 调度逐步增大教师权重 → 学生沿平滑路径走向教师。
6.2 为什么logit插值比直接教师匹配更有效?
表面解释:插值提供了更"温和"的目标。❌
根源解释:这是一个分布课程学习(distribution curriculum)问题。
直接教师匹配要求学生一步从分布 $\pi_\theta$ 跳到 $p_T$——两个分布可能在生成空间中相距甚远(不同的推理路径、不同的token序列)。一步跨越意味着学生必须同时改变所有token的分布——这在梯度下降框架下是低效的。
Logit插值 $\tilde{p} = \text{softmax}((1-w)z_{ref} + w z_T)$ 创造了一系列中间分布——随着 $w$ 从0.5增大到0.8,中间分布从靠近学生平滑过渡到靠近教师。学生在每一步只需匹配邻近的中间分布——两个相近分布之间的梯度下降是高效的。
因果链:logit插值 → 中间分布序列 → 每步匹配邻近分布(而非远端教师) → 梯度下降高效 → 稳定收敛。
6.3 为什么return-to-go能纠正token级更新的近视性?
标准token级更新的近视性:在自回归生成 $y = (y_1, y_2, \ldots, y_T)$ 中,token $y_t$ 的损失 $\rho_t$ 只衡量当前token与目标的差异。但 $y_t$ 的质量会影响 $y_{t+1}$ 的生成——如果 $y_t$ 偏离了目标路径,后续所有token都会受到影响。
标准更新看不到这种级联效应——它会"正确地"优化每个token的局部损失,但局部最优不等于全局最优。
Return-to-go的根本性改变:
权重 $G_t = \sum_{s=t}^T \gamma^{s-t} \rho_s$ 将当前token及所有后续token的失配聚合为当前token的梯度权重。如果一个token $y_t$ 虽然局部失配小,但导致了后续大量失配(级联错误),$G_t$ 会很大——赋予该token更大的更新力度。
无偏性保证:命题B.1证明当 $\gamma=1$ 时,return-to-go是序列级KL梯度的无偏估计器——这意味着它在期望上等价于"将整个序列作为一个整体优化”,但只需要token级计算。
因果链:return-to-go聚合未来失配 → 识别导致级联错误的关键token → 赋予更大更新权重 → 纠正级联错误源 → 全局序列质量提升。
七、必要知识反推
7.1 领域知识层
- 推理语言模型的训练范式:必须理解SFT、RLHF、GRPO和蒸馏各自的机制和适用场景,才能定位OPSD在其中的位置
- 数学推理的级联特性:必须理解数学推理中早期错误传播到后续所有步骤的特性,才能设计return-to-go信用分配
- KL散度的性质:必须理解KL散度的非对称性和闭式最优策略的推导方法
7.2 方法论知识层
- KL正则化策略优化的理论框架:必须掌握RLHF中 $\max R - \beta D_{KL}(\pi \| \pi_{ref})$ 的标准形式和闭式解推导
- DPO(Direct Preference Optimization):必须理解DPO如何将RL目标转化为闭式解再转化为分类损失——β-OPSD采用了类似的"RL推导→闭式解→蒸馏训练"路径
- score-function梯度估计:必须理解REINFORCE和score-function恒等式,才能证明return-to-go的无偏性
- 课程学习理论:必须理解从易到难的渐进式训练原理,才能设计调度插值
7.3 工程知识层
- LoRA微调:必须掌握低秩适配的高效微调技术(rank=64, α=128)
- vLLM在策略生成:必须了解如何高效地在训练循环中集成vLLM推理引擎
- 数值稳定性技巧:必须了解梯度裁剪(0.1)、bfloat16精度和FlashAttention-2的使用
7.4 知识融合的关键节点
创造性融合节点:“RL推导→闭式解→蒸馏执行"的方法论贯通。这需要同时理解:
- RLHF的闭式解推导(方法论)——才能找到 $\pi_\beta^*$
- 蒸馏的训练机制(领域+工程)——才能将闭式解转化为可执行的logit插值
- 课程学习的渐进思想(方法论)——才能设计调度而非固定β
- 信用分配的因果传播(方法论)——才能设计return-to-go
八、论文中可以提取的通用性灵感
灵感一:“揭示隐式特例→参数化泛化"的理论突破模式
核心思想:当一个现有方法(如OPSD)在实践中不稳定时,检查它是否是某个更广泛优化框架的隐式特例(如β=1)。如果是,将隐式参数变为显式可控参数,就能获得从"激进端点"到"保守端点"的完整谱系——不稳定的原因往往是现有方法恰好处于最激进的端点。
论文证据:OPSD是β=1特例,β>1时更稳定。
推广场景:
- 学习率调度:检查固定学习率是否是schedule的特例(固定=恒定schedule),参数化schedule获得更大灵活性
- 损失函数权重:检查多任务损失的固定权重是否是动态调度的特例
- 正则化系数:检查Dropout率/权重衰减是否是自适应正则化的特例
- 任何"隐式固定了一个本可变化的参数"的方法
灵感二:“RL推导目标→蒸馏执行训练"的混合范式
核心思想:当直接RL优化不稳定或高成本时,可以先用RL的理论推导找到最优策略的闭式解,然后将闭式解转化为蒸馏目标用监督学习执行——获得RL的理论最优性,同时享有蒸馏的训练稳定性。
论文证据:β-OPSD用闭式解指导logit插值蒸馏,避免了直接RL的高方差。
推广场景:
- 机器人模仿学习:用最优控制的闭式解(如LQR)指导策略蒸馏
- 推荐系统:用bandit的最优策略闭式解指导推荐模型蒸馏
- 对话系统:用RLHF的DPO闭式解指导对话策略蒸馏
- 任何"理论最优可达但直接优化困难"的场景
灵感三:“Return-to-go信用分配"纠正近视更新
核心思想:在自回归/序列决策中,token级/步骤级的局部更新是近视的——它看不到当前决策对未来步骤的级联影响。用"从当前步骤到序列结束的累积未来失配"作为权重,可以将序列级信号分解到每个步骤,实现无偏的序列级优化。
论文证据:return-to-go在长序列推理(AIME 2025/HMMT 2025)上提升显著(+5.55/+3.61),在短任务上提升较小(+1.12)。
推广场景:
- 代码生成的token级优化:代码中早期语法错误级联影响后续编译——用return-to-go识别导致后续大量错误的早期token
- 多轮对话策略优化:对话早期策略错误影响后续所有轮次——用return-to-go对齐对话级目标
- Agent多步规划:规划早期步骤的错误传播到后续所有步骤——用return-to-go做规划级信用分配
- 任何自回归/序列决策的优化
灵感四:“分布课程"的渐进式训练
核心思想:当学生分布与目标分布相距甚远时,不要要求学生一步跳到目标——而是构造一系列中间分布(通过插值/混合/调度),让学生逐步匹配邻近的中间分布,形成平滑的优化路径。
论文证据:调度插值(0.5→0.8)优于固定值(0.5)和反方向调度(0.8→0.5)。
推广场景:
- 领域适应:源域和目标域差距大时,构造中间域逐步迁移
- 难度课程:从简单任务逐步过渡到困难任务
- 模型量化/压缩:从全精度逐步过渡到低精度
- 任何"起点和终点差距大"的优化问题