论文链接:Rethinking On-Policy Distillation of Large Language Models II: One Training Example 发表时间:2026年9月(arXiv:2609.04172) 机构:中国科学院大学 × 清华大学 × 东北大学 × UIUC × 约翰霍普金斯大学(高校联盟;Zixuan Fu、Bingxiang He、Yuxin Zuo、Haohuan Huang 等,Yuxin Zuo 为 DeepSeek-R1-Distill 系列研究谱系的活跃研究者) 领域标签:cs.AI / 后训练 / 蒸馏 / RLVR

一、论文背景

On-Policy Distillation(OPD,在线策略蒸馏)是什么:一种后训练技术。传统蒸馏让学生模仿老师的输出(off-policy——样本是老师生成的);OPD 让学生自己生成轨迹(rollout),老师对每条轨迹给出逐 token 的密集监督,学生在自己的分布上学习。它是"学生自己走路、老师在旁边逐步纠偏",因此叫 on-policy。

OPD 的吸引力:相比 RLVR(可验证奖励的强化学习,靠稀疏的对/错信号试错),OPD 的监督是密集的(每个 token 都有老师的目标分布),样本效率在经验上更高——这使它成为后训练数据工程的重点投入方向。

领域的一个未被追问的假设:既然 OPD 有效,那么用更多样的训练查询应该更好——数据集越大、覆盖越广,学生学到越多。这符合深度学习"数据扩展律"的直觉,也是各家实验室堆数据集的惯性。但"OPD 的数据角色"其实没人系统拆解过:收益到底来自数据的什么属性?这是本文(系列第二篇)的核心追问。

一个帮助理解的类比:师傅带徒弟。传统观点认为徒弟要见多识广才能出师(数据多样性);本文发现,哪怕师傅只带着徒弟反复走同一条巷子,徒弟也能在几百步之内把"走路的眼力"练出来——因为纠偏信号的好坏不取决于巷子数量,而取决于徒弟走路时是否被及时纠正(on-policy 的本质)。

二、论文定位和关联工作

谱系一:On-policy 蒸馏的算法研究

  • GKD(Generalized Knowledge Distillation)、Agarwal 等的 on-policy 变体:研究"在学生分布上蒸馏"的算法性质(散度选择、序列级 vs token 级)。
  • 本文系列第一篇(Rethinking OPD I):已对 OPD 的算法行为做过反思。第二篇把镜头从"算法"转向"数据"。

谱系二:RLVR 与数据效率研究

  • RLVR 的 LIMR、少样本 RL 等工作表明 RL 的数据也可以很少——但 RL 的稀疏奖励与 OPD 的密集监督机制不同,OPD 的数据极限此前未被测过。

谱系三:课程与数据选择

  • 数据选择/课程学习假设"数据质量决定上限"。本文的发现(内容无关的状态诱导)对该假设构成了一个精确的边界条件。

定位对比表:

维度OPD 算法研究(GKD 等)RL 数据效率研究本文
研究对象损失/散度设计可验证奖励OPD 的训练数据角色
度量任务分数任务分数状态覆盖率(新度量)
极限设定常规数据量少样本 RL单条查询
核心结论算法选择重要RL 数据可少OPD 瓶颈在步数不在数据

定位结论:本文是"OPD 数据侧的第一性测量"——用极限实验(一条数据)把数据的作用逼到不可再简,再提出可迁移的度量(state coverage)解释现象。

三、问题定义

具体问题:OPD 训练集应该多大、多多样?

核心洞察——把"数据的作用"分解成两个可分离的量:

概念(学生走路类比)论文术语直觉含义
徒弟走过的路面种类状态覆盖(state coverage)学生 rollout 到达的 (查询, 部分响应) 状态集合
徒弟纠偏吸收速度对齐速率(alignment rate)学生分布向教师分布收敛的每步速率

全数据 OPD 之所以好,可能是因为覆盖了更多状态,也可能是因为更多数据加快了对齐——以前两者混在一起。本文用单查询极限强行解耦:一条查询时覆盖率是多少?对齐速率变了吗?

形式化:

  • 给定全数据 OPD 访问的状态集合 S_full,查询集 Q 的 rollout 到达状态集 S(Q),定义状态覆盖率 C(Q) = |S(Q) ∩ S_full| / |S_full|;
  • 研究问题变为:(1) 单条查询的 C 有多大?(2) C 随查询数如何增长?(3) 对齐速率是否随 |Q| 变化?

抽象的精妙之处:覆盖率把"数据多样性"这个模糊概念翻译成了学生实际到达的状态空间测度——数据本身不重要,数据诱导的状态才重要。这一步抽象直接决定了后面所有实验的解读框架。

四、问题解法

本文的"方法"是一套测量科学:极限实验设计 + 度量构造 + 机制验证。

4.1 单查询极限实验(One-Shot OPD)

跨域设置:数学推理、代码生成、指令跟随、Agent 工具调用四个域;学生-教师同家族配对(如 R1-Distill-1.5B ← JustRL-1.5B / Nemotron-1.5B;Qwen-Coder-1.5B ← Hammer-1.5B;另有 Llama-3B、OLMo-7B 对排除 Qwen 家族特殊性)。

发现:单条查询驱动的 OPD 持续改进数百步,恢复全数据 OPD 的大部分收益;收益对查询难度、响应长度、采样温度不敏感——学生永远解不出的查询与它总能解出的查询同样有效。

4.2 状态覆盖率度量

定义如上。实测:单查询 C = 71.5%,且大部分在前 100 步内达成。解释:OPD 的 rollout 是学生自己生成的,一条查询在几百步内自我探索出的部分响应状态,已覆盖全数据学生所到之处的七成——因为状态的多样性主要由"学生的采样"贡献,而非"查询的内容"。

4.3 多样性扩展覆盖

逐步增加语义不同的查询:C 与验证精度同步上升,直到 16 个查询覆盖 98.9%、匹配全数据训练。这不是"数据越多越好"的复活——增长在 16 条就饱和,且饱和点由覆盖率预测,不由数据量预测。

4.4 对齐速率的对照测量

关键对照:无论在 1 条还是全部数据上训练,对齐变慢的节奏几乎相同;甚至把状态集合固定不变,吸收这套状态也要几百步。→ 瓶颈定位:OPD 数据过饱(data-overfed)、算法饥饿(algorithm-starved)——rollout 很快把监督暴露出来,student 吸收监督却越来越慢。

4.5 极限压力测试(内容无关性)

  • 多教师 OPD(MOPD):16 个语义多样查询/域 匹配全数据 MOPD;
  • 内容空洞模板与离域 WildChat 杂乱查询也能逼近真实查询基线——任务内容与它诱导的状态覆盖可以彻底分离。

五、评估指标与实验证据

指标定义衡量的本质能力
状态覆盖率 C学生 rollout 到达状态 ∩ 全数据状态,占比数据诱导的探索广度(机制变量)
验证精度各域 held-out 基准最终能力(结果变量)
对齐速率学生-教师分布距离的每步下降吸收效率(瓶颈变量)

关键数据:

配置状态覆盖验证精度
全数据 OPD100%(定义)基线
1 条查询71.5%恢复大部分差距
16 条多样查询98.9%匹配全数据
内容空洞模板 / WildChat接近真实查询逼近基线

实验设计为什么能证明论点:论点是"OPD 的数据角色被高估、步数效率被低估"。证明力链条:(1) 极限设定(1 条)直接给出下界——任何"数据不可少"的理论必须解释 71.5% 从何而来;(2) 覆盖率与精度同步增长、且在 16 条饱和,给出机制变量与结果变量的因果耦合;(3) 对齐速率在 1 条与全数据间不变,排除了"数据加速吸收"的替代解释;(4) 跨 4 域 5+ 模型家族复现,排除家族特异性。四个设计环环相扣,这是"测量型论文"的教科书式布局。

六、效果优势的根源解释

本文的"优势"不是超越某个 baseline 的分数,而是解释力优势:state coverage 框架比"数据规模"框架能预测更多现象。

“数据规模"框架的解释失败:

  • 无法解释单查询 71.5% 覆盖(规模小到极致仍高覆盖);
  • 无法解释 WildChat 离域查询有效(内容与任务无关);
  • 无法解释 16 条饱和(规模论预测持续增长)。

状态覆盖框架的因果链:

  1. OPD 的监督来自教师对学生 rollout 的逐 token 反馈 → 学生每一步采样都在"制造"训练状态;
  2. 状态的多样性主要由学生自身的采样随机性贡献 → 一条查询的反复 rollout 就能撒满状态空间的大部分(71.5%);
  3. 新查询的边际贡献 = 它诱导的新状态数量 → 语义多样的少数查询足以补全剩余覆盖(16 条 → 98.9%);
  4. 学生吸收每个状态的信息速率存在内在上限(对齐速率恒定)→ 总训练步数由状态总量除以吸收速率决定,与提供状态的数据量无关 → “数据过饱、算法饥饿”。

反事实验证:若"数据内容"真的重要,把真实查询换成内容空洞模板应当崩溃——实测仅"逼近真实查询基线"的轻微下降,反证内容贡献很小;若"吸收速率"不是瓶颈,固定状态集的训练应当在几十步收敛——实测仍需几百步,反证瓶颈在吸收侧。

七、必要知识反推

领域知识层:

  • OPD 与 off-policy 蒸馏/RLVR 的机制差异(密集 vs 稀疏监督、学生分布 vs 教师分布)——这是全部实验设计的坐标原点;
  • RL 的状态-动作视角:把"查询+部分响应"看作状态,是把 NLP 训练翻译成 MDP 语言的关键一步。

方法论知识层:

  • 极限实验法(物理传统):把变量推到极端(1 条数据)以分离机制——类比物理中的"理想实验”;
  • 消融与替代解释排除:对齐速率对照、家族间复现、内容无关压力测试——每一步都在堵"另一个解释"的漏洞;
  • 度量构造:把抽象概念(数据多样性)操作化为可计算量(覆盖率)的能力。

工程知识层:

  • 跨域训练基础设施:4 个域的学生-教师配对与基准部署;
  • rollout 采样的状态记录与去重统计(覆盖率计算的实际实现);
  • 多教师(MOPD)训练管线。

知识融合的关键节点:核心化学反应是 “on-policy"这个算法属性 × 状态空间视角——作者意识到"学生自己生成 rollout"意味着数据集同时是状态生成器,因此数据的"内容属性"与"状态诱导属性"理论上可分离,然后设计实验验证了这种分离。没有 MDP 视角,单查询实验只会被当成怪异消融;没有极限实验,状态覆盖理论只是空洞重述。

八、论文中可以提取的通用性灵感

  1. “数据是状态生成器,不是知识容器”

    • 核心思想:在 on-policy 学习中,训练数据的最大价值是诱导学生到达多样状态,内容本身贡献有限。
    • 论文证据:单查询 71.5% 覆盖;WildChat 离域查询逼近基线。
    • 推广场景:Agent 技能训练的查询设计(多样性<16 条即可);机器人仿真任务设计;代码评审系统的评审场景采样。
  2. “瓶颈在吸收侧时停止加载数据”

    • 核心思想:先测量对齐/吸收速率,确认它是瓶颈后,把预算从数据扩展转向步数效率(优化器、课程、调度)。
    • 论文证据:对齐速率在 1 条与全数据间不变;固定状态集仍需数百步。
    • 推广场景:后训练算力分配决策;任何"加数据不涨分"项目的诊断流程。
  3. 极限实验法

    • 核心思想:把资源变量推到最小(1 条)以暴露机制的纯效应。
    • 论文证据:单查询设定直接导出覆盖率理论。
    • 推广场景:评测集最小有效规模测定;Agent 记忆的最小启动知识;教学中的"最少必要示范"研究。
  4. 机制变量中介检验

    • 核心思想:主张"X 通过 Y 影响 Z"时,同时测量 X-Z 相关与 Y-Z 相关,并验证 Y 的饱和点对应 Z 的饱和点。
    • 论文证据:覆盖率与验证精度同步增长、同步饱和于 16 条。
    • 推广场景:可解释性研究的因果主张升级(从相关到中介);产品指标的归因分析。
  5. 对"更多数据更好"的边界条件化

    • 核心思想:经验法则不是错的,而是有适用域——精确刻画"什么时候失效"本身就是高价值贡献。
    • 论文证据:本文把"数据多样性有益"精确化到"多样性经由状态覆盖起作用、且 16 条即饱和”。
    • 推广场景:任何经验法则(更多标注/更大模型/更长上下文)的边界测绘;给工程团队的"何时停止堆料"决策依据。