论文链接:RISE: Recursive Improvement via Self-Extrapolating Policy Distillation 发表时间:2026年9月(arXiv:2609.05295,HF Daily Papers) 机构:Yang Li、Semih Yavuz、Shafiq Joty——南洋理工大学(NTU)系团队(作者具企业研究背景) 领域标签:cs.AI / 后训练 / On-Policy Distillation / RLVR / 递归自我改进
一、论文背景
强化学习可验证奖励(RLVR)让语言模型通过"答案对不对"这种客观奖励自我提升,是推理模型(o1 系)的基石。但 RLVR 有个先天缺陷:奖励是序列级的——一条回答对了或错了,一个标量而已,完全不知道这条回答里哪几个 token 是成败关键。
在线策略蒸馏(OPD, On-Policy Distillation)恰好补上这一点:教师模型对学生自己生成的每个 token 给出完整的下一个 token 分布,提供逐 token 稠密监督——不只说"错了",还说"这里应该怎么写"。
但 OPD 撞上一个根本问题:教师从哪来?
- 外部教师(用更强的模型当老师):学生的生成分布与教师差异巨大(分布失配),教师在学生轨迹上给出的监督本身不可靠;
- 特权条件自蒸馏(让学生"带着答案提示"扮演自己的教师):依赖上下文学习能力(ICL),实验反复表明这种教师的逐 token 分布并不能反映 token 级正误;
- 后续的补救——token 门控、散度混合、DAgger 式采样、轨迹精修——都在给一个有缺陷的教师打补丁。
所有这些工作都默认"教师是给定的"。本文提出的追问是:教师应该是什么?
二、论文定位和关联工作
| 谱系 | 代表 | 核心思想 | 与 RISE 的区别 |
|---|---|---|---|
| RLVR | GRPO、DAPO | 组归一化结果奖励+裁剪策略梯度 | 序列级稀疏信号,无 token 归因 |
| 经典 OPD | Song & Zheng (2026) | 教师在学生轨迹上给逐 token 分布 | 教师质量问题未被触碰 |
| 特权条件自蒸馏 | SDPO/SDAR/RLSD | 给教师额外条件(如答案)生成监督 | 受 ICL 硬顶,GRPO+SDPO 实验中甚至负增益 |
| 外推教师 | ExOPD | 对外部策略做奖励外推 | 结构相似但教师是静态外部模型,有恒定教师差距天花板 |
| 任务算术 | task arithmetic 文献 | 权重向量线性运算 | RISE 把它用作教师构造的权重空间实例化 |
定位结论:RISE 是第一个把"教师来源"本身作为优化对象的工作——教师不再是找来的,而是从学生自己的训练轨迹外推构造出来的。
三、问题定义
具体问题:OPD 需要一个逐 token 可靠的教师,但强教师不可得、自教师不可靠。
核心洞察:学生不需要"世界上最好的教师",它需要的是"比自己好一点的下一个自己"。而训练轨迹里恰好藏着这个信息——当前检查点 θ’ 与之前锚点 θ 之间的位移向量,就是"最近改进的方向"。
形式化:设 φ 把策略映射到可做线性运算的空间(logit 空间或参数空间),定义外推教师:
φ(π_future) = φ(π_θ) + β·(φ(π_θ’) − φ(π_θ)),其中 β > 1。
- β=1:教师=当前检查点(无信息);
- β>1:沿最近改进方向越过当前状态,投影出一个"未来的自己"。
这个抽象的精妙之处:训练更新在后期由低秩子空间主导、近似线性演化(此前分析已证明),所以"沿轨迹方向外推"是对未来收敛点的一阶合理近似——教师不是玄学,是训练动力学的线性外推。
四、问题解法
4.1 两种实例化
- logit 空间(几何混合):教师分布 = 学生新旧分布的几何加权混合,逐 token 计算,无需存两份模型;
- 权重空间(任务算术):直接在参数上做 θ_anchor + β·(θ’−θ_anchor),一次构造、全程使用。
4.2 RLVR-OPD 互补回路
- RLVR 阶段:GRPO 更新 θ_n → θ’——结果奖励保证位移方向指向"验证过的改进"(外推不是盲目的,方向被奖励接地);
- 外推:构造 β>1 的未来教师;
- OPD 阶段:学生从这个教师蒸馏逐 token 分布,精修 θ’;
- 刷新:学生改进后位移向量更新,教师每轮前进——蒸馏从一次性压缩变成递归改进回路。
4.3 安全外推与衰减调度
实证检查发现:可容忍的外推系数 β 随训练进行急剧收缩——第 50 步时 β=2.0 还能 +7.3 分,第 100 步同样 β 变成 -15 分,第 200 步 β=1.5 已损失 7.7 分。因此 RISE 采用随训练衰减的保守 β 调度,始终保持在安全区间内。
五、评估指标与实验证据
| 配置 | 基准 | Baseline (GRPO) | RISE | 增益 |
|---|---|---|---|---|
| OLMo3-7B | AIME'24 | 30.2 | 46.9 | +16.7 |
| OLMo3-7B | Math Avg | 47.6 | 56.4 | +8.8 |
| Qwen3-1.7B | Math Avg | 45.1±0.4 | 49.6±0.4 | +4.5(三种子) |
| Qwen3-8B | Math Avg | 60.1±0.2 | 62.4±0.2 | +2.3(三种子) |
| Qwen2.5-3B-Instruct | ALFWorld | — | +9.4 | 多轮智能体 |
| Qwen2.5-3B-Instruct | WebShop | — | +10.9 Acc | 多轮智能体 |
| Qwen3-8B | OOD Avg | 70.6 | 72.0 | 不牺牲通用性 |
实验设计如何证明论点:
- 底座多样性(Qwen/OLMo,1.7B–8B)×两种外推空间都有效——logit 与 weight 互有胜负,说明增益来自外推原理本身而非某个实现技巧;
- 特权条件 baseline 的系统性失败(GRPO+SDPO 在两个规模上均低于 GRPO:55.9 vs 60.0、43.2 vs 45.4)直接验证了"ICL 硬顶"的机制分析;
- 样本效率曲线(图 2):RISE 在训练早期就领先——正是"稠密信号在 RL 优势估计稳定前最宝贵"的预言;
- 多轮智能体任务(ALFWorld/WebShop)证明外推原理可扩展到稀疏延迟奖励的序贯决策;
- OOD 不降反升,排除了"拿通用性换推理"的常见质疑。
六、效果优势的根源解释
Baseline 的根本局限:所有既有教师的缺陷都源于一个共同结构——教师与学生之间的差距要么不可控(外部教师),要么不可靠(特权教师),要么恒定不动(静态外推)。ExOPD 的教师是训练前固定的外部策略,教师差距 J(π*)−J(π_T) 是常数:学生再怎么练,可蒸馏的上限锁死。
RISE 的根本改变:教师变成非平稳的、随学生共进化的。每轮 RLVR 用验证奖励确保位移方向真实,外推把这一小步真实改进放大成"未来教师"的完整逐 token 分布。
因果链:教师构造方式改变 → 教师差距从"恒定天花板"变为"随训练收缩的动态量" → OPD 的稠密监督始终落在学生当前可吸收的最近发展区内 → 同预算下吸收效率提高(样本效率曲线早期领先)→ AIME +16.7、ALFWorld +9.4。
反事实:固定 β 不衰减——训练后期外推越过安全区,教师质量崩坏(-15 点的实证点),证明收益依赖"外推与训练动力学同步"而非"外推"这个动作本身。
七、必要知识反推
领域知识层:
- RLVR/GRPO 的组归一化优势估计与裁剪目标;
- OPD 的逐 token 反向 KL 蒸馏机制;
- 多轮智能体训练设定(GIGPO 等)。
方法论知识层:
- task arithmetic 与低秩更新子空间、训练轨迹近线性演化的实证结论——外推合理性的理论支点;
- ICL 能力限制特权条件教师的机制分析——识别 baseline 病根的能力;
- 课程/调度设计(β 衰减)与训练稳定性的关系。
工程知识层:
- logit 混合的在线实现(不必保存教师副本);
- 检查点锚点管理与墙钟开销控制(1.3–1.6×)。
融合的关键节点:把"任务算术的线性性"(表示学习知识)与"RLVR 更新被奖励接地"(RL 知识)拼接——前者提供外推的数学合法性,后者提供外推的方向正确性。缺任何一个,自外推教师要么是数学游戏,要么是方向未知的盲目放大。
八、论文中可以提取的通用性灵感
“未来的自己"是最可达的更强教师
- 核心思想:当外部专家不可得时,沿自己被验证过的改进方向外推,可以构造出可用的教师信号。
- 论文证据:外推教师在四种任务域全面超越 GRPO 与特权条件基线。
- 推广场景:Agent 技能自进化(本文读者的 SkillOpt 方向核心机制)、自动代码修复的补丁预测、组织流程的自我优化。
自改进循环需要"方向接地 + 幅度调度"双保险
- 核心思想:递归改进的每一步外推都必须(a)方向被客观信号验证(b)步幅随收敛衰减。
- 论文证据:β=2.0 在第 50 步 +7.3 / 第 100 步 -15 的对比。
- 推广场景:任何"自我训练→自我评估"飞轮的安全设计、量化交易策略的迭代、自动驾驶影子模式升级。
序列级奖励与 token 级监督是互补而非替代
- 核心思想:RLVR 定方向、蒸馏做精修的组合,优于任何单一信号。
- 论文证据:GRPO-only 与 OPD-only 均显著落后于耦合回路。
- 推广场景:评审系统(整体接受/拒绝 + 逐条修改建议)、教育反馈系统。
教师差距的动态性决定自改进上限
- 核心思想:评估任何蒸馏/学习系统时,先问"教师-学生差距是恒定还是收缩”。
- 论文证据:ExOPD 静态天花板 vs RISE 动态教师的对比论证。
- 推广场景:师生教学系统设计、human-in-the-loop 系统的专家角色规划。