论文链接:SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning 发表时间:2026年8月14日 机构:Shanghai Artificial Intelligence Laboratory(SU-01团队;Ning Ding、Yu Cheng等,模型与代码开源) 领域标签:cs.CL / LLM后训练与蒸馏
一、论文背景
OPD的成功与前提。在线策略蒸馏让教师对学生自身轨迹的每个token提供密集分布监督,比离线蒸馏更少遗忘、比RL更稳。但既有工作几乎都默认师生同分词器同词表——这个前提在真实场景中极其脆弱:Qwen、Intern、GLM、Gemma各用各的分词器,token序列无法逐位对齐。
长上下文教师的新矛盾。以IMO级别证明推理为代表的长上下文推理模型(如SU-01)把推理链拉到极长。蒸馏给短上下文学生时出现三重障碍:(1)分词器错位——不同词表下token边界不重合,教师对token z_i的概率无法直接指派给学生的token y_t;(2)分布失配——教师偏好远超学生上下文预算的响应;(3)长度爆炸与截断——直接OPD训练中截断率与重复率持续飙升,甚至崩溃为一token循环。
终止token的隐蔽劫持。论文观察到直接OPD的根因之一:教师监督反复抑制学生的终止token(</think>、<|im_end|>)——教师"想继续推",学生逐渐失去"停下来"的能力,响应越来越长直至截断。这个机制发现本身即是重要贡献。
二、论文定位和关联工作
跨分词器蒸馏线:已有工作探索logit映射、共享嵌入等离线方案,但OPD场景下的跨分词器对齐此前基本空白(论文引用Sun et al. 2026指出"largely underexplored")。SimpleOPD用最朴素的"文本空间对齐"绕开一切复杂映射。
OPD稳定性线:响应长度爆炸是OPD/RL已知痛点,现有方案多为长度惩罚或截断处理。SimpleOPD定位到终止token这个具体劫持点并精准屏蔽,配合KL正则从两个不同层面稳定训练。
| 维度 | 标准OPD | 直接跨分词器OPD | SimpleOPD |
|---|---|---|---|
| 对齐 | token逐位 | 无(错位) | 相同文本跨度配对 |
| 长度控制 | 无 | 失控(截断率飙升) | KL正则+终止token屏蔽 |
| 家族限制 | 同家族 | 名义可行实际崩溃 | 四家族验证 |
| 主要收益 | — | 性能退化 | ProofBench +21.2 |
三、问题定义
抽象问题:当两个策略定义在不同的离散动作空间(分词器)上时,如何在其中一个策略的轨迹上建立另一个策略的密集逐动作监督?
关键洞察:虽然token空间不同,但两个分词器编码的是同一响应字符串——每个token贡献一个确定的文本跨度 $\tau(\cdot)$。于是对齐可以退化为字符串偏移量的匹配:教师token z_i与学生token y_t配对当且仅当它们覆盖相同的起止偏移。形式化:$\mathcal{M} = \{(i,t) : P_\phi(i) = P_\theta(t) \wedge \tau_\phi(z_i) = \tau_\theta(y_t)\}$,即前缀相同且当前跨度相同的部分一一映射。
这个抽象的精妙处:把"跨词表的分布对齐"降维成"字符串上的双指针对齐"——一个线性扫描即可枚举,无需学习任何映射。
四、问题解法
机制一:共享文本空间对齐。学生rollout→解码为字符串→教师用自家chat模板+分词器重新编码→双指针扫描:前缀与跨度都一致则配对(双指针前进),否则文本消耗少的一侧前进;对齐位置继承教师log概率,未对齐位置回退学生自身log概率。词表重叠率 $\rho = |\mathcal{M}|/n$ 度量监督覆盖。
机制二:终止token优势屏蔽。对</think>与<|im_end|>等结构token屏蔽OPD损失——它们控制输出格式与终止行为,无需匹配教师分布。单用此项可缓解不稳定但治不了长度膨胀(后期截断率仍回升)。
机制三:学生参考KL损失(系数0.5)。学生与初始策略间加KL约束,防止策略漂移过大——单用此项即把截断率压至近零且性能持续上升。
组合效果:Intern-S2-Preview上OPD+Ref KL使ProofBench@4从21.70升至38.50、AnswerBench@8至79.10、AIME25@8至95.80;两者组合(SimpleOPD完整版)在同家族与跨家族都取得最大提升。
五、评估指标与实验证据
指标体系:能力指标ProofBench@4(自然语言数学证明,Gemini-2.5-Pro判分)、AnswerBench@8、AIME25@8、AMOBench;稳定性指标(截断率、重复率、响应长度曲线)。
核心数据表:
| 实验 | 关键数字 | 含义 |
|---|---|---|
| 主结果 | Intern-S2-Preview ProofBench 34.0→55.2(+21.2,+62.3%),超Gemini-2.5-Pro(47.2),逼近DeepSeek-V3.2-Speciale(56.0) | 短上下文学生获得长上下文证明能力 |
| 同家族(Qwen) | Qwen3-4B:ProofBench +12.30、AnswerBench +17.00、AMOBench +19.58 | 家族内同样有效 |
| 跨家族 | Qwen3/Qwen3.5/Intern-S2/GLM-4.7/Gemma-4全部正向增益 | 机制普适 |
| 稳定性拆解 | 仅屏蔽:截断率仍回升;仅KL:截断率≈0且性能升;组合最优 | 两机制互补 |
| 长度效应 | 适度增加蒸馏长度进一步提升长式推理 | 与"教师长响应"兼容 |
| 域外泛化 | 仅数学训练却在HLE/HiPhO科学基准提升 | 能力迁移超越训练域 |
| 教师替换 | 从DeepSeek-V4-Flash蒸馏同样有效 | 不绑定单一教师 |
实验设计为何有证明力:稳定性实验用训练动态曲线(逐步截断率/分数)而非仅终点指标,使"长度爆炸→截断→性能假升"的退化路径可见;终止token屏蔽与KL正则的分别消融定位了各自修复的环节(前者治不稳定、后者治膨胀);案例研究(AIME25正确后972次自检重复、AnswerBench一token循环)提供崩溃机制的微观证据。
六、效果优势的根源解释
为什么文本空间对齐优于学习式映射。学习映射需要在异词表间建立连续对应(嵌入对齐、logit回归),引入额外误差源与训练复杂度;文本跨度匹配是零参数、零训练的精确对应——两个分词器对同一字符串的切分虽然不同,但切分边界落在字符偏移上,偏移相同的token天然承载同一语义单元。代价是部分覆盖(只对齐完全一致的跨度,ρ<1),但实验证明这部分监督已足够——信息密度高的证明步骤token往往边界稳定。
为什么长度爆炸的根因是终止token被劫持。因果链:长上下文教师的价值恰在其长推理链→教师分布对"继续推理"的token赋予高概率、对终止token低概率→学生沿自身轨迹接受教师的逐token监督→终止token的对数概率被持续压低→学生"不敢结束"→响应长度膨胀→超过上下文预算被截断→截断的轨迹又缺乏正常终止信号,形成正反馈。两个修复各切一刀:屏蔽终止token的优势(教师不再直接压制终止)治标,KL正则限制整体策略漂移治本——消融显示KL单用即可截断率归零,因为它约束了"学生全面倒向教师偏好"这个更上游的原因。
为什么短上下文学生能学到长上下文证明能力。蒸馏不是复制教师的推理长度,而是在学生自身(预算内)轨迹上重估每个token——学生学到的是"在哪些前缀上什么样的步骤更可能正确",这种逐步判断力可迁移到学生自己的(更短)证明路径。域外提升(HLE/HiPhO)说明学到的是推理素养而非证明格式。
七、必要知识反推
领域知识层:OPD的目标函数与on-policy采样机制;分词器BPE原理与chat模板的作用(不理解"同一字符串两种切分"就无法理解对齐方案);长上下文推理模型的输出特征(长CoT、显式思考段标记)。
方法论知识层:广义JSD/top-k散度的数值稳定实现;KL正则与策略漂移控制(RLHF/DP0系方法的标准组件);训练动态监控(截断率/重复率作为早期预警信号)。
工程知识层:rollout引擎与教师重打分的管线编排;双指针对齐算法实现(线性扫描的正确性);跨家族模型的chat模板适配。
知识融合的关键节点:最关键的洞察是退一层看问题——当token级对齐不可行时,退到双方共享的更底层表示(字符串),在那一层对齐再投影回来。这与编译器设计中"通过公共中间表示连接不同前端"同构。
八、论文中可以提取的通用性灵感
灵感1:接口不兼容时找双方共享的更底层表示。异分词器→共享字符串;协议不兼容→共享字节流。论文证据:零参数对齐达到+21.2分。推广场景:跨数据库迁移(以逻辑schema而非物理格式对齐);多人协作(以共同目标而非各自术语对齐);跨语言沟通(以实物/图像绕过词汇差异);API集成(以OpenAPI规范为公共中间层)。
灵感2:崩溃的根因常在"隐藏的控制token"上。长度爆炸的元凶不是内容token而是被持续抑制的终止token——系统的稳定器往往在不起眼的位置。论文证据:屏蔽两个特殊token即显著稳定训练。推广场景:代码(哨兵值/边界条件的静默破坏);组织流程(审批出口被堵导致的流程膨胀);通信协议(缺少结束符的流);心理(无法说"完成"导致的过度工作)。
灵感3:正则化约束漂移比惩罚症状更治本。终止token屏蔽(治症状)单用会复发,KL正则(限漂移)单用即根治。论文证据:消融曲线的截断率对比。推广场景:健身(动作幅度控制优于局部护具);货币政策(通胀目标制vs逐项价格管制);教育(防刷题机制vs限时训练);软件(架构约束优于事后bug修复)。
灵感4:蒸馏学到的是判断力而非输出长度。短上下文学生获得长上下文教师的能力且域外泛化。论文证据:HLE/HiPhO提升。推广场景:师徒制(学徒学师傅的取舍判断而非工时长度);知识转移(专家规则可浓缩);跨规模模型协作(小模型承接大模型品味);文档写作(学结构决策而非字数)。