论文链接:Rethinking On-Policy Distillation of Large Language Models II: One Training Example 发表时间:2026年9月(arXiv:2609.04172) 机构:中国科学院大学 × 清华大学 × 东北大学 × UIUC × 约翰霍普金斯大学(高校联盟;Zixuan Fu、Bingxiang He、Yuxin Zuo、Haohuan Huang 等,Yuxin Zuo 为 DeepSeek-R1-Distill 系列研究谱系的活跃研究者) 领域标签:cs.AI / 后训练 / 蒸馏 / RLVR
一、论文背景
On-Policy Distillation(OPD,在线策略蒸馏)是什么:一种后训练技术。传统蒸馏让学生模仿老师的输出(off-policy——样本是老师生成的);OPD 让学生自己生成轨迹(rollout),老师对每条轨迹给出逐 token 的密集监督,学生在自己的分布上学习。它是"学生自己走路、老师在旁边逐步纠偏",因此叫 on-policy。
OPD 的吸引力:相比 RLVR(可验证奖励的强化学习,靠稀疏的对/错信号试错),OPD 的监督是密集的(每个 token 都有老师的目标分布),样本效率在经验上更高——这使它成为后训练数据工程的重点投入方向。
领域的一个未被追问的假设:既然 OPD 有效,那么用更多样的训练查询应该更好——数据集越大、覆盖越广,学生学到越多。这符合深度学习"数据扩展律"的直觉,也是各家实验室堆数据集的惯性。但"OPD 的数据角色"其实没人系统拆解过:收益到底来自数据的什么属性?这是本文(系列第二篇)的核心追问。
一个帮助理解的类比:师傅带徒弟。传统观点认为徒弟要见多识广才能出师(数据多样性);本文发现,哪怕师傅只带着徒弟反复走同一条巷子,徒弟也能在几百步之内把"走路的眼力"练出来——因为纠偏信号的好坏不取决于巷子数量,而取决于徒弟走路时是否被及时纠正(on-policy 的本质)。
二、论文定位和关联工作
谱系一:On-policy 蒸馏的算法研究
- GKD(Generalized Knowledge Distillation)、Agarwal 等的 on-policy 变体:研究"在学生分布上蒸馏"的算法性质(散度选择、序列级 vs token 级)。
- 本文系列第一篇(Rethinking OPD I):已对 OPD 的算法行为做过反思。第二篇把镜头从"算法"转向"数据"。
谱系二:RLVR 与数据效率研究
- RLVR 的 LIMR、少样本 RL 等工作表明 RL 的数据也可以很少——但 RL 的稀疏奖励与 OPD 的密集监督机制不同,OPD 的数据极限此前未被测过。
谱系三:课程与数据选择
- 数据选择/课程学习假设"数据质量决定上限"。本文的发现(内容无关的状态诱导)对该假设构成了一个精确的边界条件。
定位对比表:
| 维度 | OPD 算法研究(GKD 等) | RL 数据效率研究 | 本文 |
|---|---|---|---|
| 研究对象 | 损失/散度设计 | 可验证奖励 | OPD 的训练数据角色 |
| 度量 | 任务分数 | 任务分数 | 状态覆盖率(新度量) |
| 极限设定 | 常规数据量 | 少样本 RL | 单条查询 |
| 核心结论 | 算法选择重要 | RL 数据可少 | OPD 瓶颈在步数不在数据 |
定位结论:本文是"OPD 数据侧的第一性测量"——用极限实验(一条数据)把数据的作用逼到不可再简,再提出可迁移的度量(state coverage)解释现象。
三、问题定义
具体问题:OPD 训练集应该多大、多多样?
核心洞察——把"数据的作用"分解成两个可分离的量:
| 概念(学生走路类比) | 论文术语 | 直觉含义 |
|---|---|---|
| 徒弟走过的路面种类 | 状态覆盖(state coverage) | 学生 rollout 到达的 (查询, 部分响应) 状态集合 |
| 徒弟纠偏吸收速度 | 对齐速率(alignment rate) | 学生分布向教师分布收敛的每步速率 |
全数据 OPD 之所以好,可能是因为覆盖了更多状态,也可能是因为更多数据加快了对齐——以前两者混在一起。本文用单查询极限强行解耦:一条查询时覆盖率是多少?对齐速率变了吗?
形式化:
- 给定全数据 OPD 访问的状态集合 S_full,查询集 Q 的 rollout 到达状态集 S(Q),定义状态覆盖率 C(Q) = |S(Q) ∩ S_full| / |S_full|;
- 研究问题变为:(1) 单条查询的 C 有多大?(2) C 随查询数如何增长?(3) 对齐速率是否随 |Q| 变化?
抽象的精妙之处:覆盖率把"数据多样性"这个模糊概念翻译成了学生实际到达的状态空间测度——数据本身不重要,数据诱导的状态才重要。这一步抽象直接决定了后面所有实验的解读框架。
四、问题解法
本文的"方法"是一套测量科学:极限实验设计 + 度量构造 + 机制验证。
4.1 单查询极限实验(One-Shot OPD)
跨域设置:数学推理、代码生成、指令跟随、Agent 工具调用四个域;学生-教师同家族配对(如 R1-Distill-1.5B ← JustRL-1.5B / Nemotron-1.5B;Qwen-Coder-1.5B ← Hammer-1.5B;另有 Llama-3B、OLMo-7B 对排除 Qwen 家族特殊性)。
发现:单条查询驱动的 OPD 持续改进数百步,恢复全数据 OPD 的大部分收益;收益对查询难度、响应长度、采样温度不敏感——学生永远解不出的查询与它总能解出的查询同样有效。
4.2 状态覆盖率度量
定义如上。实测:单查询 C = 71.5%,且大部分在前 100 步内达成。解释:OPD 的 rollout 是学生自己生成的,一条查询在几百步内自我探索出的部分响应状态,已覆盖全数据学生所到之处的七成——因为状态的多样性主要由"学生的采样"贡献,而非"查询的内容"。
4.3 多样性扩展覆盖
逐步增加语义不同的查询:C 与验证精度同步上升,直到 16 个查询覆盖 98.9%、匹配全数据训练。这不是"数据越多越好"的复活——增长在 16 条就饱和,且饱和点由覆盖率预测,不由数据量预测。
4.4 对齐速率的对照测量
关键对照:无论在 1 条还是全部数据上训练,对齐变慢的节奏几乎相同;甚至把状态集合固定不变,吸收这套状态也要几百步。→ 瓶颈定位:OPD 数据过饱(data-overfed)、算法饥饿(algorithm-starved)——rollout 很快把监督暴露出来,student 吸收监督却越来越慢。
4.5 极限压力测试(内容无关性)
- 多教师 OPD(MOPD):16 个语义多样查询/域 匹配全数据 MOPD;
- 内容空洞模板与离域 WildChat 杂乱查询也能逼近真实查询基线——任务内容与它诱导的状态覆盖可以彻底分离。
五、评估指标与实验证据
| 指标 | 定义 | 衡量的本质能力 |
|---|---|---|
| 状态覆盖率 C | 学生 rollout 到达状态 ∩ 全数据状态,占比 | 数据诱导的探索广度(机制变量) |
| 验证精度 | 各域 held-out 基准 | 最终能力(结果变量) |
| 对齐速率 | 学生-教师分布距离的每步下降 | 吸收效率(瓶颈变量) |
关键数据:
| 配置 | 状态覆盖 | 验证精度 |
|---|---|---|
| 全数据 OPD | 100%(定义) | 基线 |
| 1 条查询 | 71.5% | 恢复大部分差距 |
| 16 条多样查询 | 98.9% | 匹配全数据 |
| 内容空洞模板 / WildChat | 接近真实查询 | 逼近基线 |
实验设计为什么能证明论点:论点是"OPD 的数据角色被高估、步数效率被低估"。证明力链条:(1) 极限设定(1 条)直接给出下界——任何"数据不可少"的理论必须解释 71.5% 从何而来;(2) 覆盖率与精度同步增长、且在 16 条饱和,给出机制变量与结果变量的因果耦合;(3) 对齐速率在 1 条与全数据间不变,排除了"数据加速吸收"的替代解释;(4) 跨 4 域 5+ 模型家族复现,排除家族特异性。四个设计环环相扣,这是"测量型论文"的教科书式布局。
六、效果优势的根源解释
本文的"优势"不是超越某个 baseline 的分数,而是解释力优势:state coverage 框架比"数据规模"框架能预测更多现象。
“数据规模"框架的解释失败:
- 无法解释单查询 71.5% 覆盖(规模小到极致仍高覆盖);
- 无法解释 WildChat 离域查询有效(内容与任务无关);
- 无法解释 16 条饱和(规模论预测持续增长)。
状态覆盖框架的因果链:
- OPD 的监督来自教师对学生 rollout 的逐 token 反馈 → 学生每一步采样都在"制造"训练状态;
- 状态的多样性主要由学生自身的采样随机性贡献 → 一条查询的反复 rollout 就能撒满状态空间的大部分(71.5%);
- 新查询的边际贡献 = 它诱导的新状态数量 → 语义多样的少数查询足以补全剩余覆盖(16 条 → 98.9%);
- 学生吸收每个状态的信息速率存在内在上限(对齐速率恒定)→ 总训练步数由状态总量除以吸收速率决定,与提供状态的数据量无关 → “数据过饱、算法饥饿”。
反事实验证:若"数据内容"真的重要,把真实查询换成内容空洞模板应当崩溃——实测仅"逼近真实查询基线"的轻微下降,反证内容贡献很小;若"吸收速率"不是瓶颈,固定状态集的训练应当在几十步收敛——实测仍需几百步,反证瓶颈在吸收侧。
七、必要知识反推
领域知识层:
- OPD 与 off-policy 蒸馏/RLVR 的机制差异(密集 vs 稀疏监督、学生分布 vs 教师分布)——这是全部实验设计的坐标原点;
- RL 的状态-动作视角:把"查询+部分响应"看作状态,是把 NLP 训练翻译成 MDP 语言的关键一步。
方法论知识层:
- 极限实验法(物理传统):把变量推到极端(1 条数据)以分离机制——类比物理中的"理想实验”;
- 消融与替代解释排除:对齐速率对照、家族间复现、内容无关压力测试——每一步都在堵"另一个解释"的漏洞;
- 度量构造:把抽象概念(数据多样性)操作化为可计算量(覆盖率)的能力。
工程知识层:
- 跨域训练基础设施:4 个域的学生-教师配对与基准部署;
- rollout 采样的状态记录与去重统计(覆盖率计算的实际实现);
- 多教师(MOPD)训练管线。
知识融合的关键节点:核心化学反应是 “on-policy"这个算法属性 × 状态空间视角——作者意识到"学生自己生成 rollout"意味着数据集同时是状态生成器,因此数据的"内容属性"与"状态诱导属性"理论上可分离,然后设计实验验证了这种分离。没有 MDP 视角,单查询实验只会被当成怪异消融;没有极限实验,状态覆盖理论只是空洞重述。
八、论文中可以提取的通用性灵感
“数据是状态生成器,不是知识容器”
- 核心思想:在 on-policy 学习中,训练数据的最大价值是诱导学生到达多样状态,内容本身贡献有限。
- 论文证据:单查询 71.5% 覆盖;WildChat 离域查询逼近基线。
- 推广场景:Agent 技能训练的查询设计(多样性<16 条即可);机器人仿真任务设计;代码评审系统的评审场景采样。
“瓶颈在吸收侧时停止加载数据”
- 核心思想:先测量对齐/吸收速率,确认它是瓶颈后,把预算从数据扩展转向步数效率(优化器、课程、调度)。
- 论文证据:对齐速率在 1 条与全数据间不变;固定状态集仍需数百步。
- 推广场景:后训练算力分配决策;任何"加数据不涨分"项目的诊断流程。
极限实验法
- 核心思想:把资源变量推到最小(1 条)以暴露机制的纯效应。
- 论文证据:单查询设定直接导出覆盖率理论。
- 推广场景:评测集最小有效规模测定;Agent 记忆的最小启动知识;教学中的"最少必要示范"研究。
机制变量中介检验
- 核心思想:主张"X 通过 Y 影响 Z"时,同时测量 X-Z 相关与 Y-Z 相关,并验证 Y 的饱和点对应 Z 的饱和点。
- 论文证据:覆盖率与验证精度同步增长、同步饱和于 16 条。
- 推广场景:可解释性研究的因果主张升级(从相关到中介);产品指标的归因分析。
对"更多数据更好"的边界条件化
- 核心思想:经验法则不是错的,而是有适用域——精确刻画"什么时候失效"本身就是高价值贡献。
- 论文证据:本文把"数据多样性有益"精确化到"多样性经由状态覆盖起作用、且 16 条即饱和”。
- 推广场景:任何经验法则(更多标注/更大模型/更长上下文)的边界测绘;给工程团队的"何时停止堆料"决策依据。