论文链接:RISE: Recursive Improvement via Self-Extrapolating Policy Distillation 发表时间:2026年9月(arXiv:2609.05295,HF Daily Papers) 机构:Yang Li、Semih Yavuz、Shafiq Joty——南洋理工大学(NTU)系团队(作者具企业研究背景) 领域标签:cs.AI / 后训练 / On-Policy Distillation / RLVR / 递归自我改进

一、论文背景

强化学习可验证奖励(RLVR)让语言模型通过"答案对不对"这种客观奖励自我提升,是推理模型(o1 系)的基石。但 RLVR 有个先天缺陷:奖励是序列级的——一条回答对了或错了,一个标量而已,完全不知道这条回答里哪几个 token 是成败关键。

在线策略蒸馏(OPD, On-Policy Distillation)恰好补上这一点:教师模型对学生自己生成的每个 token 给出完整的下一个 token 分布,提供逐 token 稠密监督——不只说"错了",还说"这里应该怎么写"。

但 OPD 撞上一个根本问题:教师从哪来?

  • 外部教师(用更强的模型当老师):学生的生成分布与教师差异巨大(分布失配),教师在学生轨迹上给出的监督本身不可靠;
  • 特权条件自蒸馏(让学生"带着答案提示"扮演自己的教师):依赖上下文学习能力(ICL),实验反复表明这种教师的逐 token 分布并不能反映 token 级正误;
  • 后续的补救——token 门控、散度混合、DAgger 式采样、轨迹精修——都在给一个有缺陷的教师打补丁。

所有这些工作都默认"教师是给定的"。本文提出的追问是:教师应该是什么?

二、论文定位和关联工作

谱系代表核心思想与 RISE 的区别
RLVRGRPO、DAPO组归一化结果奖励+裁剪策略梯度序列级稀疏信号,无 token 归因
经典 OPDSong & Zheng (2026)教师在学生轨迹上给逐 token 分布教师质量问题未被触碰
特权条件自蒸馏SDPO/SDAR/RLSD给教师额外条件(如答案)生成监督受 ICL 硬顶,GRPO+SDPO 实验中甚至负增益
外推教师ExOPD对外部策略做奖励外推结构相似但教师是静态外部模型,有恒定教师差距天花板
任务算术task arithmetic 文献权重向量线性运算RISE 把它用作教师构造的权重空间实例化

定位结论:RISE 是第一个把"教师来源"本身作为优化对象的工作——教师不再是找来的,而是从学生自己的训练轨迹外推构造出来的。

三、问题定义

具体问题:OPD 需要一个逐 token 可靠的教师,但强教师不可得、自教师不可靠。

核心洞察:学生不需要"世界上最好的教师",它需要的是"比自己好一点的下一个自己"。而训练轨迹里恰好藏着这个信息——当前检查点 θ’ 与之前锚点 θ 之间的位移向量,就是"最近改进的方向"。

形式化:设 φ 把策略映射到可做线性运算的空间(logit 空间或参数空间),定义外推教师:

φ(π_future) = φ(π_θ) + β·(φ(π_θ’) − φ(π_θ)),其中 β > 1。

  • β=1:教师=当前检查点(无信息);
  • β>1:沿最近改进方向越过当前状态,投影出一个"未来的自己"。

这个抽象的精妙之处:训练更新在后期由低秩子空间主导、近似线性演化(此前分析已证明),所以"沿轨迹方向外推"是对未来收敛点的一阶合理近似——教师不是玄学,是训练动力学的线性外推。

四、问题解法

4.1 两种实例化

  • logit 空间(几何混合):教师分布 = 学生新旧分布的几何加权混合,逐 token 计算,无需存两份模型;
  • 权重空间(任务算术):直接在参数上做 θ_anchor + β·(θ’−θ_anchor),一次构造、全程使用。

4.2 RLVR-OPD 互补回路

  1. RLVR 阶段:GRPO 更新 θ_n → θ’——结果奖励保证位移方向指向"验证过的改进"(外推不是盲目的,方向被奖励接地);
  2. 外推:构造 β>1 的未来教师;
  3. OPD 阶段:学生从这个教师蒸馏逐 token 分布,精修 θ’;
  4. 刷新:学生改进后位移向量更新,教师每轮前进——蒸馏从一次性压缩变成递归改进回路。

4.3 安全外推与衰减调度

实证检查发现:可容忍的外推系数 β 随训练进行急剧收缩——第 50 步时 β=2.0 还能 +7.3 分,第 100 步同样 β 变成 -15 分,第 200 步 β=1.5 已损失 7.7 分。因此 RISE 采用随训练衰减的保守 β 调度,始终保持在安全区间内。

五、评估指标与实验证据

配置基准Baseline (GRPO)RISE增益
OLMo3-7BAIME'2430.246.9+16.7
OLMo3-7BMath Avg47.656.4+8.8
Qwen3-1.7BMath Avg45.1±0.449.6±0.4+4.5(三种子)
Qwen3-8BMath Avg60.1±0.262.4±0.2+2.3(三种子)
Qwen2.5-3B-InstructALFWorld—+9.4多轮智能体
Qwen2.5-3B-InstructWebShop—+10.9 Acc多轮智能体
Qwen3-8BOOD Avg70.672.0不牺牲通用性

实验设计如何证明论点:

  1. 底座多样性(Qwen/OLMo,1.7B–8B)×两种外推空间都有效——logit 与 weight 互有胜负,说明增益来自外推原理本身而非某个实现技巧;
  2. 特权条件 baseline 的系统性失败(GRPO+SDPO 在两个规模上均低于 GRPO:55.9 vs 60.0、43.2 vs 45.4)直接验证了"ICL 硬顶"的机制分析;
  3. 样本效率曲线(图 2):RISE 在训练早期就领先——正是"稠密信号在 RL 优势估计稳定前最宝贵"的预言;
  4. 多轮智能体任务(ALFWorld/WebShop)证明外推原理可扩展到稀疏延迟奖励的序贯决策;
  5. OOD 不降反升,排除了"拿通用性换推理"的常见质疑。

六、效果优势的根源解释

Baseline 的根本局限:所有既有教师的缺陷都源于一个共同结构——教师与学生之间的差距要么不可控(外部教师),要么不可靠(特权教师),要么恒定不动(静态外推)。ExOPD 的教师是训练前固定的外部策略,教师差距 J(π*)−J(π_T) 是常数:学生再怎么练,可蒸馏的上限锁死。

RISE 的根本改变:教师变成非平稳的、随学生共进化的。每轮 RLVR 用验证奖励确保位移方向真实,外推把这一小步真实改进放大成"未来教师"的完整逐 token 分布。

因果链:教师构造方式改变 → 教师差距从"恒定天花板"变为"随训练收缩的动态量" → OPD 的稠密监督始终落在学生当前可吸收的最近发展区内 → 同预算下吸收效率提高(样本效率曲线早期领先)→ AIME +16.7、ALFWorld +9.4。

反事实:固定 β 不衰减——训练后期外推越过安全区,教师质量崩坏(-15 点的实证点),证明收益依赖"外推与训练动力学同步"而非"外推"这个动作本身。

七、必要知识反推

领域知识层:

  • RLVR/GRPO 的组归一化优势估计与裁剪目标;
  • OPD 的逐 token 反向 KL 蒸馏机制;
  • 多轮智能体训练设定(GIGPO 等)。

方法论知识层:

  • task arithmetic 与低秩更新子空间、训练轨迹近线性演化的实证结论——外推合理性的理论支点;
  • ICL 能力限制特权条件教师的机制分析——识别 baseline 病根的能力;
  • 课程/调度设计(β 衰减)与训练稳定性的关系。

工程知识层:

  • logit 混合的在线实现(不必保存教师副本);
  • 检查点锚点管理与墙钟开销控制(1.3–1.6×)。

融合的关键节点:把"任务算术的线性性"(表示学习知识)与"RLVR 更新被奖励接地"(RL 知识)拼接——前者提供外推的数学合法性,后者提供外推的方向正确性。缺任何一个,自外推教师要么是数学游戏,要么是方向未知的盲目放大。

八、论文中可以提取的通用性灵感

  1. “未来的自己"是最可达的更强教师

    • 核心思想:当外部专家不可得时,沿自己被验证过的改进方向外推,可以构造出可用的教师信号。
    • 论文证据:外推教师在四种任务域全面超越 GRPO 与特权条件基线。
    • 推广场景:Agent 技能自进化(本文读者的 SkillOpt 方向核心机制)、自动代码修复的补丁预测、组织流程的自我优化。
  2. 自改进循环需要"方向接地 + 幅度调度"双保险

    • 核心思想:递归改进的每一步外推都必须(a)方向被客观信号验证(b)步幅随收敛衰减。
    • 论文证据:β=2.0 在第 50 步 +7.3 / 第 100 步 -15 的对比。
    • 推广场景:任何"自我训练→自我评估"飞轮的安全设计、量化交易策略的迭代、自动驾驶影子模式升级。
  3. 序列级奖励与 token 级监督是互补而非替代

    • 核心思想:RLVR 定方向、蒸馏做精修的组合,优于任何单一信号。
    • 论文证据:GRPO-only 与 OPD-only 均显著落后于耦合回路。
    • 推广场景:评审系统(整体接受/拒绝 + 逐条修改建议)、教育反馈系统。
  4. 教师差距的动态性决定自改进上限

    • 核心思想:评估任何蒸馏/学习系统时,先问"教师-学生差距是恒定还是收缩”。
    • 论文证据:ExOPD 静态天花板 vs RISE 动态教师的对比论证。
    • 推广场景:师生教学系统设计、human-in-the-loop 系统的专家角色规划。