Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation 精读

弱到强泛化的核心矛盾:常规蒸馏把弱教师当优化目标,学生的上限被教师的容量天花板钳死。OPRD 的解法优雅而克制——在学生 rollout 上提取弱教师相对其参考策略的’政策偏移’方向,只放大学生自身 verifier 梯度在该方向上的投影分量,不建立任何教师匹配目标。理论上保住了策略优化的不动点,实践上比 GRPO 少 33–67% 更新达到教师水平、最终超越教师,多教师场景比 Mix-RL 省 55% 更新。本文精读拆解其梯度投影机制、不对称缩放调度与’加速而非转向’的证据链。

September 10, 2026 · 3 min

Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions 精读

LLM 会一本正经地回答 cot(-540°) 等于 0、(1).startswith(‘1’) 是 True——这些结构上不可能有答案的问题。是模型’不知道’还是’知道但不拒答’?USC/ASU 团队给出机制级答案:残差流中存在线性可解码的’不可能性方向’(AUC 0.939),但它与安全拒答方向近正交(cos 0.087),且 base 模型中该几何已存在——模型’知道’却把信号接错了线路。沿识别方向的双向因果干预以 +33~+52pp 的剂量响应翻转行为。自信地回答不可能问题的失败由此被定位为路由失败而非编码失败。

September 10, 2026 · 2 min