SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning 精读
把长上下文推理教师的能力蒸馏给异分词器短上下文学生,会遭遇token错位、长度爆炸与训练崩溃三重障碍。上海AI Lab SU-01团队提出SimpleOPD:在共享文本空间对齐——学生用自己分词器生成、教师用自家分词器评估同一文本,仅对占据完全相同文本跨度的token配对监督;配合终止token优势屏蔽+学生参考KL损失,截断率降至近零。Intern-S2-Preview在ProofBench从34.0提升至55.2(+21.2分),超越Gemini-2.5-Pro,跨Qwen/Intern/GLM/Gemma四大家族全部正向增益。本文拆解其对齐机制、稳定性因果链与长度爆炸的根因解释。