论文链接:Latent On-Policy Self-Distillation 代码仓库:github.com/bingreeky/LOPD 模型仓库:Qwen3-8B-LOPD / Olmo3-7B-LOPD (HuggingFace) 发表时间:2026年8月13日 机构:National University of Singapore(Guibin Zhang、Shuicheng Yan)+ 北京邮电大学 + Shanghai Jiao Tong University 领域标签:cs.LG / Agent自进化与经验学习
一、论文背景
OPSD的中心问题已经转移。在线策略自蒸馏去掉了外部教师:师生同源,仅教师多看到特权信息(验证过的推理轨迹、环境反馈、成功先验rollout等)。于是问题从"哪个教师够强"变成"该给自教师看什么特权上下文"。这个问题的答案决定了监督质量:上下文必须暴露有用经验、让token级监督更锐利、还须与推理时看不到该上下文的学生兼容。
手工特权的根本缺陷。现有特权上下文——oracle答案/轨迹(OPSD)、环境反馈条件化(SDPO)、技能条件(Skill-SD)、演示条件(SDFT)——都是设计师先验规定的信息格式。它们a priori决定了教师"应该看什么",而实际上不同任务、不同学习阶段需要保留的经验侧面是动态变化的。论文用实验证明这一点:同一个特权格式在一个基准上提升、在另一个上反降(OPSD在BFCL长上下文子集+7.0但整体低于vanilla)。
论文的substrate级提问:特权上下文能否从"设计规范"变成"从经验中学习的数据结构"——让自教师自己发现该保留什么、如何编码为监督?
二、论文定位和关联工作
OPSD特权格式谱系:OPSD(oracle答案/轨迹)→SDPO(当前rollout组的成功兄弟轨迹)→Skill-SD(技能条件化)→Penaloza等(动作序列)→LOPD(可学习隐上下文)。每个前序工作规定一种离散特权制品,LOPD不做规定。
隐计算线:COCONUT等隐思维扩展内部算力;隐记忆(程序性/事实性/经验性信息的连续载体)——LOPD的隐token概念上接近隐记忆,但角色不同:不是推理时增强,而是训练时教师专属的特权条件。
| 维度 | OPSD(oracle) | SDPO(兄弟轨迹) | Skill-SD(技能) | LOPD |
|---|---|---|---|---|
| 特权形式 | 固定答案/轨迹 | 当前组成功rollout | 预提取技能文本 | 学习的连续隐token |
| 任务适应性 | 无(静态) | 依赖当前策略成功率 | 预提取阶段固定 | 端到端自适应 |
| 失败模式 | 与学生前缀错位 | 成功覆盖不足时稀疏 | 技能粒度错配 | —(但需防坍缩) |
| 部署开销 | 无 | 无 | 技能库 | 无(训练后丢弃全部外设) |
三、问题定义
抽象问题:经验监督信号的表示本身能否成为优化变量——即让"保留什么、如何编码"与"学生怎么学"联合端到端优化?
形式化:给定经验库 $\mathcal{E}$(历史轨迹),作曲器 $g_\psi$ 检索J条相关经验并各压缩为K个连续隐token(共96个),自教师条件化为 $\pi_\phi(\cdot|s_t, z)$(z为隐上下文),学生 $\pi_\theta(\cdot|s_t)$ 不看z,沿学生轨迹做reverse-KL蒸馏。优化目标联合 $(\theta, \psi)$,附加特权间隔约束:教师对验证信号为正的轨迹须保持对学生的对数概率优势≥m=0.05。
精妙之处在于约束的必要性:无此约束时,最平凡的解是教师直接坍缩为学生(z被忽略),蒸馏信号归零——间隔约束强制隐上下文"必须有用"。
四、问题解法
训练管线:学生rollout(工具使用≤30环境步;编码16K token预算)→检索J=3条相关经验→作曲器各压缩为K=32隐token→自教师(EMA)条件化隐上下文对学生访问的每个前缀打分→top-M=20 logits+尾桶的reverse-KL蒸馏→特权间隔约束与蒸馏损失联合反向传播至作曲器与学生。
特权间隔约束的直觉:把隐上下文类比"教师的私人笔记"——约束要求有笔记的教师必须比没笔记的学生在成功轨迹上"更确定"(对数概率差≥0.05),否则笔记被丢弃。这个约束把"笔记质量"变成可优化的标量。
部署形态:训练后丢弃经验库、检索器、作曲器、隐上下文——只留学生。经验的价值已内化为学生参数。
类比:这像给运动员配"教练读秒器"(隐上下文)训练——教练看着仪表对学生喊节奏(蒸馏监督),但比赛日学生独自上场,训练中内化的节奏感留存下来。教练的"读什么仪表"(作曲器学到的保留内容)是在训练中根据学生反馈逐步调优的。
五、评估指标与实验证据
指标体系:工具使用(EnvScaler任务成功率200 held-out任务、BFCL-v3四子集、ACEBench多步多轮);编码(LiveCodeBench v5/v6 pass@1、HumanEval+/MBPP+);效率(相对rollout预算)。
核心数据表:
| 实验 | 关键数字 | 含义 |
|---|---|---|
| 工具使用4B | EnvScaler 61.8→63.7、BFCL-v3 25.25→27.38、ACEBench 56.0→60.6(vs最强基线) | 全面领先 |
| 工具使用8B | EnvScaler 66.4 vs 60.2、BFCL 29.88 vs 29.00、ACEBench 62.7 vs 58.0 | 优势扩大 |
| 编码4B | LiveCodeBench聚合48.78 vs GRPO 48.29;EvalPlus 81.36 vs 80.07 | 超最强基线 |
| 编码OLMo3-7B | LiveCodeBench 50.98 vs 48.29(+2.69);EvalPlus 78.41 | 跨家族跨规模 |
| 十全十美 | 全部10个骨干-基准组合最佳聚合 | 无一例外 |
| 效率 | <30% GRPO/Skill-SD预算即超越 | 蒸馏的样本效率 |
| 手工特权反例 | SDPO BFCL 22.88→15.75、LiveCodeBench 50.6→38.0(负增益);OPSD BFCL长上下文+7.0但整体-2.63 | 无手工格式普适 |
| LOPD稳健性 | 全部10设置高于vanilla(增益+1.50至+17.2) | 学习表示消除盲区 |
| 关键消融 | 移除隐上下文联合学习→增益消失 | 可学习性是必要条件 |
实验设计为何有证明力:基线保留各自原生KL方向与损失(公平——不因统一损失而削弱对手);负增益案例的展示(SDPO/OPSD在特定设置低于vanilla)不是失败披露而是论证核心——它证明手工特权存在结构性盲区,而LOPD的10/10正增益与这些反转形成对照;“相同基座相同训练数据同协议"内仅特权构造与蒸馏损失不同的设计,把差异精确隔离在substrate层面。
六、效果优势的根源解释
为什么可学习上下文优于任何手工格式。手工格式的失败各有机制:OPSD注入固定oracle轨迹——当oracle的求解路径与学生实际访问的前缀错位时,教师分布对"学生所在位置"的指导是失焦的(LiveCodeBench 40.24 vs vanilla 45.61的机制);SDPO依赖当前rollout组内的成功兄弟——策略弱时成功覆盖稀疏,特权信号断供(BFCL跌至15.75);技能粒度错配时同理。LOPD的作曲器以蒸馏损失为梯度端到端学习保留什么——它不被任何预设格式约束,可以学到"这批任务里工具调用顺序的经验重要"或"那个域里错误恢复的模式重要”,随任务与学生状态自适应。10/10正增益与手工方法的反转形成机制层面的对照实验。
为什么特权间隔约束不可或缺。无约束时优化存在平凡解:作曲器输出被教师忽略(z不改变教师分布),教师=学生,蒸馏损失=0——训练看似收敛实则无信息流动。间隔约束制造了非平凡压力:教师必须在验证为正的轨迹上比学生"更确定",唯一途径是从隐上下文中提取真实的预测性信息。这与对抗训练的判别器压力同构——防止退化解的机制是要求"差距必须可验证地存在"。
为什么30%预算就够。RLVR(GRPO)的信号是稀疏结果奖励——大量rollout只为确认少数成功路径;蒸馏信号是密集的逐token分布差——每个rollout的每一步都产生梯度。LOPD在此之上还叠加了"教师看经验"带来的信号增强(教师分布比vanilla自蒸馏更锐利),双重因素叠加使其样本效率约为RL的3倍以上。
为什么经验不会退化为记忆库查询。隐token条件的是教师而非学生——学生在推理时不带任何外设,经验的全部价值必须通过蒸馏进入学生参数。这个"教师独享"的设计切断了"学生学会依赖检索"的捷径。
七、必要知识反推
领域知识层:OPD/OPSD范式与特权信息的具体形态(不熟悉OPSD文献就理解不了"手工格式盲区"的问题定义);隐计算/隐记忆研究(连续token作为计算载体的可行性依据);多轮Agent环境的交互结构(观测-动作-状态序列)。
方法论知识层:reverse-KL与top-M logits截断的蒸馏目标(SDPO式);EMA教师更新;经验检索的嵌入相似度机制;约束优化的拉格朗日实现(间隔约束的梯度路径)。
工程知识层:工具使用rollout的环境步数控制(30步上限);编码蒸馏的16K响应预算管理;多基准评测协议(BFCL四子集、LiveCodeBench版本差异处理)。
知识融合的关键节点:最关键的融合是把"表示学习“的视角引入”监督构造"——以往OPSD工作把特权上下文当作给定的输入,LOPD把它当作与策略联合优化的可学习表示。这个视角转换的种子来自隐记忆研究(经验可以压缩为连续向量)与OPSD研究(特权上下文决定监督质量)的交叉点:既然上下文质量决定监督、而上下文又可以是连续向量,那就让它可微、让它学。
八、论文中可以提取的通用性灵感
灵感1:监督信号的表示应与被监督者联合优化,而非预先规定。手工特权有盲区,学习的表示10/10正增益。论文证据:SDPO/OPSD负增益案例 vs LOPD全面领先。推广场景:课程设计(教学材料根据学生反馈动态生成而非固定教材);绩效管理(反馈形式随员工状态调整);推荐系统(用户表示与推荐器端到端);编译优化(中间表示与优化pass联合搜索)。
灵感2:防止退化解需要"可验证的差距"约束。特权间隔约束阻止教师坍缩为学生——任何自举系统都需要"差距必须真实存在"的外部校验。论文证据:消融显示无联合学习则增益消失。推广场景:GAN训练(判别器压力防生成器坍缩);自监督学习(stop-gradient防坍缩);内部审计(独立性要求防合谋);辩论机制(双方必须可分辨)。
灵感3:训练时外设、部署时裸机——经验的价值应内化到参数。LOPD训练后丢弃经验库/检索器/作曲器。论文证据:推理无任何额外模块。推广场景:教练训练(训练用器械比赛不用);教育(脚手架逐步撤除);企业咨询(顾问的产出是能力而非报告依赖);辅助驾驶(训练期标注、部署期裸模型)。
灵感4:密集分布信号比稀疏结果信号样本效率高一个量级。30%预算超GRPO。论文证据:预算对比实验。推广场景:员工培养(过程辅导优于年终评定);质量控制(在线检测优于终检);学习方法(即时反馈优于考后对答案);体育训练(动作分解反馈优于只看比赛结果)。