论文链接:Cliff: Learning Process Rewards from the First Mistake 发表时间:2026年9月 机构:Amazon Web Services(Peixuan Han、Runhui Wang、Ketan Ramaneti、Jie Hao、Gerald Friedland、Chris Kong)+ University of Illinois Urbana-Champaign(第一作者为 AWS 实习期间的 UIUC 学生)——企业研究院+高校合作 领域标签:cs.LG / LLM 强化学习后训练 / 过程奖励
一、论文背景
RLVR 与它的粒度问题。强化学习加可验证奖励(RLVR)已成为 LLM 推理后训练的标准范式:数学题对答案、代码跑测试,奖励自动可验证、无需人工标注。但它的奖励是结局级的——一条推理链只拿一个 0/1。这带来两个后果:几乎满分的解与全错的解拿同样的 0 分(无法区分"差一步"和"完全不会");模型不知道自己错在第几步(信用分配缺失)。
现有过程监督方案的代价:
- 过程奖励模型(PRM):训练一个专门模型给每步打分。代价:要构造步级标注数据、训练额外模型、且容易 reward hacking(模型学会迎合奖励模型而非真正推理)。
- On-Policy Distillation(OPD):用教师模型在学生 rollout 上的 token 分布做细粒度信号。代价:需要引用教师 logits——闭源教师直接出局;且只有师生推理模式相似(最好同家族)时效果才好。
本文的起点是一个信息论直觉:推理一旦在某步走错,其后所有步骤都条件化于一个无效前缀——继续评估它们提供的增量信息极其有限。就像走迷宫走错了岔路,评价"错误岔路里走得稳不稳"毫无意义,有意义的只有"在哪个路口拐错的"。如果这个直觉成立,过程监督根本不需要逐步打分——只需要找到第一个错误步。
二、论文定位和关联工作
谱系一:结局奖励 RLVR
- GRPO(DeepSeek 系):组相对策略优化,用组内相对优势替代价值网络。本文的主要 baseline 与改良对象——Cliff 保留 GRPO 骨架,只改优势分配方式。
谱系二:过程奖励模型
- PRM 系(OmegaPRM、Math-Shepherd 等):步级标注+奖励模型训练。区别:PRM 需要专门模型与逐步打分;Cliff 只需现成 LLM 的单点定位,且定位结果直接作用于策略梯度而非奖励模型。
谱系三:在线策略蒸馏
- OPD(k1 估计器、跨 tokenizer 蒸馏):token 级教师信号。区别:OPD 信号来自教师分布、要求教师可引用(排除闭源)且师生同构;Cliff 的信号来自"教师对错误的定位",任何能判断对错并指认错误步的模型(包括闭源 SOTA)都能当教师。
谱系四:回溯与错误分析
- 与"生成反事实回溯数据"类工作不同,Cliff 不改数据分布、不造新训练样本——它是纯奖励塑形(reward shaping):同样的 rollout、同样的 GRPO 骨架,只是优势分配变了。
| 方法 | 过程粒度 | 额外模型 | 教师要求 | Reward hacking 面 |
|---|---|---|---|---|
| GRPO | 结局 | 无 | 无 | 低(可验证) |
| PRM | 每步 | 需要 | 无 | 高 |
| OPD | 每token | 无 | 可引用+同构 | 低 |
| Cliff | 单点切分 | 无 | 能定位错误步即可(闭源可用) | 低 |
定位结论:Cliff 占据了过程监督谱系上此前空缺的位置——最小充分粒度:比结局细(有定位)、比逐步粗(免打分),工程复杂度与 hacking 面都最小。
三、问题定义
具体问题:RLVR 的结局奖励无法告诉模型错在哪,PRM/OPD 的细粒度信号各有昂贵约束。
抽象问题:过程监督需要多细?找到"信号的信息增量与监督成本"的最优平衡点。
本文的核心洞察可以形式化为一条信息论论证:设推理轨迹为 token 序列,第一个错误出现在位置 p(Pitfall Step)。则:
- 对 j < p:token 在有效前缀上,其生成质量与最终成功正相关 → 值得正反馈;
- 对 j ≥ p:token 条件化于无效前缀,其"质量"已经与解题能力因果解耦(无论岔路上走得多顺滑,结局已定)→ 评估它们不提供关于策略优劣的增量信息。
于是过程监督的充分形式是:定位 p,然后对 p 前后赋予相反优势。
这个抽象的精妙之处:它把"过程监督要多少标注"从工程问题变成了有答案的信息问题——答案是"一个点"。这既解释了为什么逐步 PRM 是过度设计(大部分步级信号是冗余的),也解释了为什么 Cliff 的教师可以很弱(定位一个错误起点比逐题打分容易得多)。
四、问题解法
4.1 Pitfall Step 定位
对每个错误 rollout,用现成 LLM 教师回读轨迹,定位第一个导致错误结论的推理步。教师的提示与人类标注员完全相同(保证可比性)。正确 rollout 无需定位。
4.2 Token 级优势构造
在 GRPO 骨架上重写优势分配(论文 Eq.4):
$$A_{i,j} = \begin{cases} A_{cor} - b, & R(q,a_i)=1 \\ \lambda A_{cor} - b, & R(q,a_i)=0,\ j < p(a_i) \\ A_{inc} - b, & R(q,a_i)=0,\ j \geq p(a_i) \end{cases}$$- 正确 rollout:全序列正优势;
- 错误 rollout:Pitfall 之前 λA_cor(λ=0 时即中性零优势),之后 A_inc 负优势;
- b 为偏置项,保证组内 token 优势零均值(GRPO 的标准约束)。
λ=0 的选择是反直觉但深思熟虑的:给错误 rollout 的正确前缀正优势会诱发长度 hacking(模型学会故意写很长的"正确废话前缀"来刷正优势面积)——λ=0 让前缀零和、后缀负分,杜绝这条作弊路径。
4.3 教师质量的三维验证(第 4 节)
从 DAPO-Math 构造 50 对正确/50 对错误的平衡集,人类专家标注每个错误 rollout 的 Pitfall Step,然后从三个维度评估教师:
- 解题准确率(教师自己会不会做):Qwen3-32B 仅 65%——但教师不需要会做题;
- 判对错一致性(与学生答案对错判断的吻合):91%(SOTA 教师);
- 定位一致性:p-dis = |p_human − p_LLM|,SOTA 教师 p-dis≤1(误差一步以内)的比例达 82%,Qwen3-32B 68%。
关键发现:给定真实参考解时,定位能力与解题能力解耦——Qwen3-32B 解题只有 65% 正确,但判对错 91%、定位 57%(≤1 步)。这直接支撑"现成中等模型即可当教师"的实用性主张。
五、评估指标与实验证据
实验矩阵
- 学生模型:Qwen3-4B、Phi-4-Mini;
- 教师:SOTA(闭源前沿)、Qwen3-32B、Gemma3-27B(弱教师);
- 数学训练集:DAPO-math-17k-processed;编码训练集:Deepcoder;
- 评测:GSM8K / MATH-500 / DAPO / AIME(数学)、CodeContests / LiveCode / DeepCoder(编码,二值奖励)。
主结果(Table 2,Qwen3-4B + SOTA 教师)
| 方法 | 数学平均 | 编码平均 |
|---|---|---|
| 基座(无 RL) | 50.66 | 15.05 |
| + GRPO(标准) | 61.68 | 24.20 |
| + OPD(Qwen 教师) | 58.17 | 20.38 |
| + GRPO+教师判分 | 62.37 | 24.83 |
| + Cliff | 65.66 | 25.96 |
- Cliff 在全部 12 个设置(2 学生 × 3 教师 × 2 领域的组合)下都是最优;
- 相对提升:超 OPD 约 15%、超标准 GRPO 约 7%;
- 单点亮点:Qwen3-4B+SOTA 教师的 AIME 从 GRPO 的 32.01 提到 36.98(+4.97);DAPO 从 42.90 提到 49.30(+6.4)。
- 弱教师鲁棒性:Gemma3-27B 教师下 Cliff 数学平均 63.70,仍显著高于 GRPO+教师判分的 62.02 与 OPD 的 55.24——教师定位能力 68%(≤1 步)就足以产生有效信号。
实验为什么能证明论点:GRPO+教师判分(教师参与但无切分,整条 rollout 同一优势)是最关键的对照——它与 Cliff 的唯一差异是"是否定位 Pitfall 并分段",62.37 vs 65.66 的差距就是"切分"本身的净贡献,排除了"教师模型引入了额外信息"的替代解释。
六、效果优势的根源解释
Baseline(标准 GRPO)的结构性浪费:GRPO 把组内相对优势均摊到 rollout 的每个 token。对一条错误 rollout,这意味着错误前缀上的有效推理与错误后缀上的无效推理拿到同样的负优势。两个后果:(a) 模型被系统性劝退那些"开局正确"的推理模式——因为它们挂在一条最终错误的轨迹上;(b) 错误后缀拿到了与自身质量无关的惩罚强度,噪声大。
Cliff 的机制性修正:
- 信用分配对齐因果结构。轨迹的成败在因果上由 Pitfall Step 决定——切分让惩罚精确落在因果无效的段落上,前缀中性化使有效推理模式不再被"连坐"。学习信号的信噪比因此提高:同样的 rollout 预算,梯度里有效信息占比更高。这解释了跨 12 场景的一致性优势——凡是推理链较长、中途易错的领域(AIME +4.97、DAPO +6.4 收益最大),切分的信息收益越大。
- 与"GRPO+教师判分"对照的机制差异。教师判分只提高了奖励的准确性(知道这条 rollout 错了),但不改变优势的空间分布——错误轨迹内部的"好前缀坏后缀"仍然同罚。Cliff 的增益证明过程信号的真正价值不在"判得更准"而在"定位更细"——这与 PRM 路线的动机一致,但实现成本天壤之别。
- 为什么弱教师就够:定位错误起点本质上比解题容易——它不要求生成正确解,只要求读出"从哪一步开始答案跑偏",这是一个判别任务;且 p-dis 分析显示定位误差以 1 步以内为主,而优势分配是段级的,1 步以内的定位误差对前缀/后缀划分几乎无影响。任务的容错性 × 任务的低难度 = 弱教师可用。
- λ=0 与长度 hacking 的预防:若错误前缀拿正优势,模型可构造冗长前缀刷分;λ=0 使前缀零优势,唯一改善路径是少犯错——奖励结构与设计目标严格对齐。
如实说明:Cliff 在编码任务上的相对增益小于数学(25.96 vs 24.20,约 +7%),机制上编码是二值奖励且解通常更短,切分点附近的"有效前缀"占比小,可回收的信号自然少——这符合本文自己的理论框架,也是诚实的边界声明。
七、必要知识反推
领域知识层:
- LLM 推理链的失败形态学:错误通常始于某个可定位的推理步而非均匀崩坏——这一经验信念来自大量 rollout 人工检视,是整个方法的经验前提。
- RLVR 的工程现实:奖励验证器怎么搭、DAPO/Deepcoder 训练集的性质、编码任务的二值奖励结构。
方法论知识层:
- GRPO 的组相对优势机制与零均值约束——Cliff 是在完全保留 GRPO 骨架的前提下重写优势函数,不懂 GRPO 的细节就无从做这种最小侵入式改良。
- 信用分配理论(temporal credit assignment):把 RL 文献中"谁该为结局负责"的经典问题落到 token 级。
- 反事实的谨慎态度(λ 的选择与长度 hacking 的预防):知道"给前缀正优势"会诱发什么退化行为,来自对 reward hacking 文献的熟悉。
工程知识层:
- 教师标注管线:与人类标注相同的提示协议、p-dis 一致性度量、50+50 平衡集的构建。
- 多基准评测基建:7 个评测集 × 3 教师 × 2 学生的训练-评测矩阵运维。
- 人类标注的质控:标注指南、一致性检查。
知识融合的关键节点:核心融合点是信息论直觉(无效前缀无增量信息)× GRPO 优势机制(token 级优势可自由重写)——前者回答"过程监督最少要多细",后者回答"在哪个机制上动刀"。只有同时站在 LLM 行为分析与 RL 算法两个视角,才会想到"不改数据、不改奖励模型、只重排优势"这个最小干预方案。第二个融合点是教师评估协议:把"教师不需要会做题"这个反直觉命题变成可测量的三维评估(解题/判错/定位分离),来自评测科学素养。
八、论文中可以提取的通用性灵感
过程监督的最小充分单元是"第一个分歧点"
- 核心思想:评估链条式过程时,分歧点之后的信息已被污染,监督资源应集中投向定位分歧点本身。
- 论文证据:仅定位 Pitfall Step 的切分信号即超越逐步打分的 OPD 约 15%;教师定位与人类 80% 一致。
- 推广场景:代码评审(先找引入 bug 的提交再细看);SRE 故障复盘(第一个异常变更点);教育批改(先定位概念性错误起点)。
“判别比生成容易"是教师系统的设计杠杆
- 核心思想:让教师做判别任务(定位错误、判断对错)而非生成任务(自己解题),能力门槛大幅下降,中等模型即可胜任。
- 论文证据:Qwen3-32B 解题正确率仅 65%,但判对错 91%、定位 p-dis≤1 达 68%,作为教师依然带来一致增益。
- 推广场景:AI 辅助审核(判别而非重做);低成本蒸馏(用小模型当裁判筛选大模型输出);众包标注任务设计。
奖励结构要预判并封堵 hacking 路径
- 核心思想:任何给"部分正确"正奖励的设计都会被长度/格式攻击利用;λ=0 式的"中性化而非奖励"是更稳的默认。
- 论文证据:论文明确以 λ=0 避免 length hacking(第 6.2 节与附录 C 专门分析)。
- 推广场景:评分系统设计(部分分规则的反作弊审查);prompt 激励设计;供应链考核指标。
最小侵入式改良的证明力最强
- 核心思想:保留 baseline 全部骨架、只改一个组件的方案,其增益归因最干净、工程采纳成本最低——比"全新框架"更容易建立因果可信度。
- 论文证据:Cliff vs GRPO+教师判分的对照只差"切分"一个变量,62.37→65.66 的差距无可辩驳地属于定位机制。
- 推广场景:算法改良论文的实验设计;工程系统迭代(先做单变量版本再谈架构升级);A/B 实验的变量控制纪律。
任务容错性决定教师/标注质量的门槛
- 核心思想:下游机制对上游信号误差的容忍度(段级分配容忍 1 步定位误差)决定了可用的最小信号质量——先算清容错预算再选供应商。
- 论文证据:段级优势分配使 1 步以内的定位误差几乎不影响梯度;27B 弱教师即可产生有效信号。
- 推广场景:数据标注的精度要求设定;模型级联系统中路由模型的选型;外包质检的抽检率设计。