论文链接:Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening 发表时间:2026年9月 机构:上海交通大学 × 上海人工智能实验室(项目主导)× 西湖大学 × 南京大学 × 清华大学 × 香港中文大学 × 南洋理工大学 领域标签:cs.LG / 强化学习 / LLM 后训练


一、论文背景

PPO 是什么? Proximal Policy Optimization(近端策略优化)是 RLHF 时代的经典算法:一个"演员"(策略,即 LLM 本体)负责生成,一个"评论家"(critic,价值网络)负责预估每步状态的"期望回报",两者的差(优势函数)告诉演员"这步比平均好多少"。critic 的核心价值是把整条轨迹的最终奖励分摊到每个 token 上——这就是 token 级的 credit assignment。

为什么 critic 会出问题? 在 LLM 推理场景(长思维链数学题),一条响应几百上千个 token,奖励只在结尾给一次。要正确分摊,critic 必须能识别"响应内哪些时刻解题形势发生了实质变化"——比如找到了关键引理、犯下了不可逆的计算错误。

论文发现的 Value Flattening(价值平坦化):用同一策略多次独立续写、以平均终局奖励作为每个中间状态的蒙特卡洛(MC)价值估计——这是"真值"的诊断代理。对比发现:MC 价值经常在响应内出现陡峭的局部跃迁(形势突变),而 critic 预测却是一条近乎平坦的曲线,甚至方向相反。在受控 FrozenLake 环境中复现该现象,且状态空间越大越严重。

这不是小毛病:critic 平坦 → 优势估计处处接近基线 → 演员的 token 级学习信号被系统性抹平 → 只剩响应级的粗粒度信号(退化成变相的 REINFORCE/GRPO)——PPO 相对 GRPO 的理论优势(响应内细粒度 credit assignment)名存实亡。

二、论文定位和关联工作

谱系代表工作与本文关系
Critic-free 阵营RLOO、GRPO、DAPO用整条响应构造优势、回避 critic——本文指出它们等于接受了平坦化的损失
Critic-based 改进[Kim K1.5 / 各家 value 预训练与初始化工作]、异步 PPO 变体改初始化与工程,未回答"critic 是否真的跟踪了价值变化"
隐式价值函数VIMPO(由策略导出隐式 critic)试图无 critic 地恢复细粒度 credit——侧面印证需求
过拟合/泛化视角的 critic 研究GAE 偏差-方差分析(Schulman 2015/2016)经典分析关注估计精度,本文关注表示层面的系统性压缩

定位结论:本文是"诊断驱动"的研究——先建立可测量的失效现象(MC 值 vs critic 预测的偏差),再溯因,最后给出最小干预的修复。这类"发现现象→机理分析→极简解法"的工作在顶会评审口径下属于高新颖性类别。

三、问题定义

具体场景:LLM 推理的 PPO 训练中,critic 无法跟踪响应内状态价值的变化。

抽象后的本质问题:在时间强相关、监督稀疏(仅终局奖励)的序列上,用一个回归损失训练价值函数时,何种监督采样策略能使学到的价值函数保留"响应内的判别性结构"?

精妙之处:问题被从"如何改进 critic 架构/损失"重构为"在哪里施加监督"——一个纯采样几何问题,因此解法可以极简(选 K 个点)且可在受控环境(FrozenLake)里分离验证。

四、问题解法

4.1 诊断:两大根因

根因一:MSE 的隐含方差惩罚。critic 损失是逐点 MSE。当相邻状态的真实价值相近但不同(微小的真实梯度)时,回归理论告诉我们:最小化期望 MSE 的预测会向"局部平均"收缩——MSE 天生惩罚预测的局部方差。响应内价值跃迁被平滑掉,正是这种收缩的宏观表现。【论文理论+实验支持】

根因二:时间相关状态的冗余更新。同一响应内相邻 token 的状态高度相似,梯度方向也高度相似。PPO 对整条响应做稠密 token 级监督,等于把相似的梯度重复施加——有效学习率被放大且方向集中,进一步把局部差异抹平(过拟合到"响应间差异"而忽视"响应内差异")。【论文实验支持:扰动实验显示去掉相关性后平坦化减轻】

4.2 解法:SP3O(SParse Proximal Policy Optimization)

做法简单到令人怀疑:每条响应只在 K 个"位置分离良好"的锚点状态上计算 value loss,其余 token 的 critic 输出不进损失(advantage 仍按 GAE 正常算)。

两个设计点:

  • 锚点位置:按响应长度的固定相对位置放(消融显示 0.3/0.6/0.9 优于随机放置);
  • 为什么有效:锚点间距大→状态去相关→梯度方向多样→隐含方差惩罚失去"相邻可平均"的对象。等于同时拆掉两个根因的物理基础。

4.3 与相关方法对比

方法critic 监督响应内 credit问题
PPO全部 token理论上最细平坦化毁掉实际分辨率
GRPO/DAPO无仅响应级无 token 级信号
SP3OK=3 锚点保留且可学超参 K 需粗调

五、评估指标与实验证据

5.1 指标体系

  • 现象度量:critic 预测 vs MC 价值的响应内相关性/方差比(诊断图);
  • 主指标:数学推理基准(AIME/MATH 系列平均)与 OOD 推理套件准确率;
  • 训练动力学:验证准确率、rollout 奖励、响应长度、更新幅度。

5.2 主结果(Qwen3-4B/8B-Base,数学 RL 训练)

对比4B 提升8B说明
SP3O vs PPO(域内数学)+7.97pp一致正向同时超 GRPO
SP3O vs PPO(OOD 推理)+7.33pp一致正向泛化非过拟合
在线动力学更稳的更新、更高验证准确率—响应更长(探索更多)

5.3 消融:监督密度的反直觉曲线

K(锚点数)训练奖励
3最高
4 / 8略降但稳定
16明显下降
64接近稠密 PPO
Dense(标准 PPO)最低档
随机放置(对照)36.59% vs PPO 37.60%(无效!)

锚点放置消融(4B 准确率):随机 36.59 < PPO 37.60 < 0.2/0.5/0.8 位置 44.65 < 0.3/0.6/0.9 位置 45.57。

证明力分析:这两个消融是全文最有力的证据——(1) “随机稀疏无效、位置稀疏有效"排除了"减少计算量/正则化"的平庸解释,锁定去相关性才是机制;(2) K=3→64 的单调退化把"稀疏"与"有效性"的因果钉死。FrozenLake 受控实验(状态空间增大→平坦化加剧)进一步提供了跨环境的机理佐证。

六、效果优势的根源解释

6.1 根源机制与证据链

因果链:稀疏且位置分离的监督 → (a) 相邻相似状态不再同时进损失 → MSE 的局部平均失去对象 → critic 得以保留响应内方差;(b) 相似梯度不再重复叠加 → 优化压力从"拟合响应间均值"转向"分辨响应内变化” → 价值函数重新获得判别性 → GAE 分解出的 token 级优势信号恢复精度 → 演员学到细粒度策略 → 数学/OOD 准确率提升。

每步证据: 与 由随机放置消融+K 曲线【论文实验支持】; 由诊断图(训练后 SP3O critic 的 MC 相关性恢复)【论文实验支持】;【阅读者推测:论文未直接展示"优势估计误差下降"的中间量,属合理推断】。

6.2 相关工作检索与对照

研究相似尝试相关结论与本文差异影响
GAE(Schulman 2015)偏差-方差权衡的 advantage 设计指出 value 误差直接污染 advantage不涉及表示层面平坦化补充:经典前提,本文发现该前提在 LLM 长响应上系统性失效
GRPO(DeepSeek)干脆放弃 critic响应级优势足够有效—限定:说明平坦化后 PPO≈GRPO 的现实;SP3O 证明 critic 路线仍可救
ReMax/RLOO无 critic 基线族训练稳定无 token credit对照:SP3O 优于它们的实验是 critic 路线复兴的证据
DeepSeek Math / Kimi 长思维链 RL 报告工程上先预训练 value 模型初始化能缓解但未根除改的是起点不是动力学补充:与本文互补(初始化+稀疏监督可叠加,未验证)
主动学习/coreset 文献选代表性样本训练回归器去相关采样提升回归质量非RL场景支持(推测级):稀疏监督有效性有跨领域统计根基

6.3 综合判断与未决问题

多项证据共同支持:稠密 token 级 value 监督在长响应上是负因素;位置选择的稀疏监督恢复 critic 判别力。

仍属推测:0.3/0.6/0.9 的最优性是否跨模型规模/任务类型稳定;SP3O 与 value 预训练、异步 PPO 的叠加效应。

适用边界:短响应场景(<100 token)平坦化空间小,收益应有限;K 的选择与响应长度分布相关——超长思维链可能需要自适应锚点。论文未在 RLHF 偏好奖励(非可验证奖励)上验证。

七、必要知识反推

领域知识层:PPO/GAE 的完整数学( Advantage 如何由 critic 导出);MC 价值估计原理(诊断工具的基础)。

方法论知识层:回归的统计性质(MSE 收缩效应——根因一的识别需要回归理论直觉);时序数据的相关性理论(去相关采样的合理性);受控实验设计(FrozenLake 分离变量)。

工程知识层:大规模 LLM RL 训练框架(rollout 管理、显存布局);诊断可视化(响应内 value 曲线对比图的设计)。

融合关键节点:把"critic 学不好"这个模糊抱怨,转译为"MC 值 vs 预测值的响应内方差比"这一可测量——诊断先行是整个工作的支点;随后"回归统计 × RL 采样"的交叉知识把解法指向采样几何而非损失函数或架构。

八、论文中可以提取的通用性灵感

  1. 稠密监督可能是毒药:当监督点强相关时,删点比加点好

    • 论文证据:K=3 > K=8 > K=64 > Dense 的单调排序。
    • 推广场景:多模态训练中的时间稠密标注(抽帧监督);模仿学习的轨迹采样(去相关 demo);在线评估的重复测量设计(分离测量点)。
  2. 诊断一个学习系统,给它一个"真值代理"并对齐坐标系

    • 论文证据:MC 续写估计充当每状态真值,一眼照出平坦化。
    • 推广场景:RAG 系统诊断(检索质量真值代理)、奖励模型审计(人类重评抽样当真值)、教师模型蒸馏监控(能力断面测试)。
  3. “随机对照无效、结构化干预有效"是锁定机制的黄金实验

    • 论文证据:随机放置锚点 36.59% vs 位置锚点 45.57%。
    • 推广场景:任何"我的改进是机制性的还是工程性的"自证需求——加一个"同预算随机化"对照即可。
  4. 失效模式命名本身是重要贡献

    • 论文证据:“Value Flattening"命名后,FrozenLake 复现、状态空间扫描、根因分解顺理成章。
    • 推广场景:团队内部把反复出现的坏现象命名(如"评测泄漏"“提示漂移”)能显著加速知识沉淀与传播。

本精读基于 arXiv:2609.18708 全文撰写;实验数字均出自论文表图;外部检索截至 2026-09-18。