Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation 精读
弱到强泛化的核心矛盾:常规蒸馏把弱教师当优化目标,学生的上限被教师的容量天花板钳死。OPRD 的解法优雅而克制——在学生 rollout 上提取弱教师相对其参考策略的’政策偏移’方向,只放大学生自身 verifier 梯度在该方向上的投影分量,不建立任何教师匹配目标。理论上保住了策略优化的不动点,实践上比 GRPO 少 33–67% 更新达到教师水平、最终超越教师,多教师场景比 Mix-RL 省 55% 更新。本文精读拆解其梯度投影机制、不对称缩放调度与’加速而非转向’的证据链。