第一乐章:RetireOPD——教师该有退休机制
论文链接:RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning 代码仓库:github.com/ZJU-REAL/SDAR 发表时间:2026年9月 机构:浙江大学(ZJU-REAL 实验室)+ 阿里巴巴集团——高校出方法、企业提供训练基建 领域标签:Agent RL / 知识蒸馏
1.1 论文背景
OPD(在线策略蒸馏)是什么? 多轮智能体 RL(如 GRPO)每条轨迹只有末端一个标量奖励,中间几十步决策得不到监督。OPD 的解法:用一个"教师"模型对学生自己 rollout 的每个 token 给稠密信号(反向 KL),相当于给学生配一位全程跟练的教练。
两个被忽视的事实:(1) 特权信息(教师看到任务技能描述)不保证教师可靠——无显式优化时 3B/7B 教师的任务成功率仅 28.9%/23.4%,模型变大不等于教得好;(2) 教师收益随训练阶段衰减——GRPO 梯度与教师梯度早期对齐、后期分歧:教师"正确但慢"的先验在学生已经学会快速求解后变成拖累。
1.2 解法
两阶段:(1) 解耦教师优化——先用环境奖励训练技能条件教师(看到技能描述、有特权信息的专家);(2) 学生联合训练——无技能学生同时吃 RL 梯度(环境奖励)与 OPD 梯度(教师 token 级监督),联合优势逐 token 混合两者。
核心创新 Adaptive Retirement(自适应退休):学生持续监测 (a) 师生输出分歧是否停止收缩(对齐停滞信号);(b) 学生成功率是否达到教师成功率的预设比例 γ(相对能力信号)。两条件同时满足 → 丢弃教师 → 纯 RL 跑完剩余训练。没有预定义时间表,退休时刻由学生自己的成长曲线决定。
1.3 实验证据
Qwen2.5 全尺度(1.5B/3B/7B)× ALFWorld + WebShop:
| 设置 | ALFWorld(vs GRPO) | WebShop(vs GRPO) |
|---|---|---|
| 1.5B | +17.0 | +19.0(75.8% vs 56.8%) |
| 3B | +18.8(93.8% vs 75.0%) | +14.0 |
| 7B | +14.1 | +11.8 |
每个设置都反超自己的技能条件教师——学生最终超过了教练。消融(3B/ALFWorld):去掉"对齐停滞"判定 89.0、去掉"相对能力"判定 89.0、完全不退休(一直用教师)82.8、纯 GRPO 75.0——退休太晚(不退休 82.8)比退休机制的两个信号各自缺失更伤,证明教师后期确实在拖后腿。参数敏感性:γ=0.8~1.0 区间稳健(90.6–92.2)。
1.4 根源解释
因果链:轨迹级奖励稀疏 → 中间决策无梯度 → 教师稠密信号在早期提供"搜索方向先验"加速收敛;学生能力增长后,环境奖励的探索信号优于教师的固定先验 → 继续跟随教师 = 把学生上限锁死在教师水平 → 退休解除天花板 → 反超教师。【论文消融支持:不退休组 82.8 显著低于退休组 92.2,“锁死上限"的直接证据】
第二乐章:EOS 终止符失配——长度膨胀的词表级根因
论文链接:When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation 项目主页:uncsciml.github.io/opd-eos-website 发表时间:2026年9月 机构:UNC 教堂山 + Brigham Young University(高校)+ 微软(企业) 领域标签:训练动力学 / 蒸馏 / 分词
2.1 论文背景
现象:OPD 中学生回复越来越长,甚至耗尽生成预算——长度膨胀。已有解释多归于奖励设计或数据分布。
本文的发现:根因之一在词表的最底层。基座学生与后训练教师可能把停止概率质量放在不同的 EOS token 上:Qwen2.5-Math 基座用 <|endoftext|>(151643),Instruct 版同时声明 <|im_end|>(151645)与 <|endoftext|>;Llama 3.1 基座用 <|end_of_text|>(128001),Instruct 版还有 <|eom_id|>——声明的停止集相同≠停止概率的落点相同。
失配如何致膨胀:学生偏好 EOS-A、教师偏好 EOS-B → 蒸馏目标持续压低学生对 EOS-A 的概率(教师不选它)→ 但 EOS-B 的转移并不因此建立(教师的选择分布与学生前缀不匹配)→ 学生两边都不停 → 回复变长。
2.2 解法与验证
修复:把功能等价的 EOS token 视为一个共享的语义停止动作——蒸馏时对"任何合法停止"统一监督,而不是对某个特定 token ID。仅对齐解码停止集(把 B 加进 A 的停止列表)不够;语义层合并才有效。
跨三家族(Qwen3、Llama、Gemma)验证:语义停止对齐后失配型长度膨胀大幅缓解。K2-Horizon 阶段分析进一步揭示:(1) 终止偏好在训练中大幅漂移(不同阶段偏好不同 EOS);(2) 存在一种晚期长度膨胀在终止对齐之后仍然出现——终止失配是重要根因但非全部。
2.3 根源解释
因果链:蒸馏逐 token 优化 KL → 停止行为的概率质量被教师分布重新分配 → 学生与教师停止 token 身份不同时,“压低 A"与"抬高 B"不对称 → 净效应=停止概率整体下降 → 生成长度上升。修复让"停止"成为语义类别而非词表索引,梯度在类别内自由分配 → 停止能力保留。【论文三家族实验支持;不对称机制的精确形式化为论文分析】
外部对照:ThinkPrune/长度惩罚类方法在输出层截断(治标),本文在词表层对齐(治本之一);同日 When2Think 用奖励塑形控制推理长度(第三层:目标层)——三层互补而非竞争。
二重奏合流的通用性灵感
- 辅助监督应当自带退出机制(RetireOPD):任何教练/先验/正则项的价值都随学习者成长而衰减,设计"何时退出"的信号比设计"何时进入"更重要。推广:导师制、脚手架教学、新员工 onboarding。
- 监控两个信号:分歧停滞 + 相对能力:这对组合(对齐不再改善 & 追上参照物)是通用的"该放手了"判据。推广:自动化系统的降级检测、供应商切换时机。
- 相同声明的接口可能有不同的内部实现(EOS):停止集声明一致≠概率落点一致。推广:API 兼容≠语义兼容、协议合规≠行为一致——集成两个系统时永远检查行为分布而非接口文档。
- 异常要追到最底层表示:长度膨胀表面是行为问题,根因在词表索引层。推广:性能问题的根因常在数据表示、编码、单位这类"太底层以至于没人看"的地方。
- 一个修复解决一部分,诚实披露剩余:两篇论文都明确说清自己解决了什么、没解决什么(RetireOPD 的教师构建成本、EOS 的晚期膨胀)——这种克制本身就是可复现科学的模板。
精读依据:arXiv 2609.20784(21 页)与 2609.20511(30 页)全文逐页阅读,覆盖 RetireOPD 的联合优势设计与退休消融表、EOS 研究的跨家族 EOS 清单与阶段分析。外部对照引用均为可核验公开来源。