Rethinking On-Policy Distillation II: One Training Example 精读

on-policy 蒸馏到底需要多少数据?本文把实验推到’一条训练样本’的极限:单条查询即可驱动 OPD 持续改进数百步,覆盖全数据 OPD 71.5% 的状态空间;16 个语义多样查询覆盖 98.9% 并匹配全数据训练。提出状态覆盖率度量解释现象——OPD 是’数据过饱、算法饥饿’,瓶颈在步数效率而非数据规模。

September 7, 2026 · 2 min