论文链接:Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening 发表时间:2026年9月 机构:上海交通大学 × 上海人工智能实验室(项目主导)× 西湖大学 × 南京大学 × 清华大学 × 香港中文大学 × 南洋理工大学 领域标签:cs.LG / 强化学习 / LLM 后训练
一、论文背景
PPO 是什么? Proximal Policy Optimization(近端策略优化)是 RLHF 时代的经典算法:一个"演员"(策略,即 LLM 本体)负责生成,一个"评论家"(critic,价值网络)负责预估每步状态的"期望回报",两者的差(优势函数)告诉演员"这步比平均好多少"。critic 的核心价值是把整条轨迹的最终奖励分摊到每个 token 上——这就是 token 级的 credit assignment。
为什么 critic 会出问题? 在 LLM 推理场景(长思维链数学题),一条响应几百上千个 token,奖励只在结尾给一次。要正确分摊,critic 必须能识别"响应内哪些时刻解题形势发生了实质变化"——比如找到了关键引理、犯下了不可逆的计算错误。
论文发现的 Value Flattening(价值平坦化):用同一策略多次独立续写、以平均终局奖励作为每个中间状态的蒙特卡洛(MC)价值估计——这是"真值"的诊断代理。对比发现:MC 价值经常在响应内出现陡峭的局部跃迁(形势突变),而 critic 预测却是一条近乎平坦的曲线,甚至方向相反。在受控 FrozenLake 环境中复现该现象,且状态空间越大越严重。
这不是小毛病:critic 平坦 → 优势估计处处接近基线 → 演员的 token 级学习信号被系统性抹平 → 只剩响应级的粗粒度信号(退化成变相的 REINFORCE/GRPO)——PPO 相对 GRPO 的理论优势(响应内细粒度 credit assignment)名存实亡。
二、论文定位和关联工作
| 谱系 | 代表工作 | 与本文关系 |
|---|---|---|
| Critic-free 阵营 | RLOO、GRPO、DAPO | 用整条响应构造优势、回避 critic——本文指出它们等于接受了平坦化的损失 |
| Critic-based 改进 | [Kim K1.5 / 各家 value 预训练与初始化工作]、异步 PPO 变体 | 改初始化与工程,未回答"critic 是否真的跟踪了价值变化" |
| 隐式价值函数 | VIMPO(由策略导出隐式 critic) | 试图无 critic 地恢复细粒度 credit——侧面印证需求 |
| 过拟合/泛化视角的 critic 研究 | GAE 偏差-方差分析(Schulman 2015/2016) | 经典分析关注估计精度,本文关注表示层面的系统性压缩 |
定位结论:本文是"诊断驱动"的研究——先建立可测量的失效现象(MC 值 vs critic 预测的偏差),再溯因,最后给出最小干预的修复。这类"发现现象→机理分析→极简解法"的工作在顶会评审口径下属于高新颖性类别。
三、问题定义
具体场景:LLM 推理的 PPO 训练中,critic 无法跟踪响应内状态价值的变化。
抽象后的本质问题:在时间强相关、监督稀疏(仅终局奖励)的序列上,用一个回归损失训练价值函数时,何种监督采样策略能使学到的价值函数保留"响应内的判别性结构"?
精妙之处:问题被从"如何改进 critic 架构/损失"重构为"在哪里施加监督"——一个纯采样几何问题,因此解法可以极简(选 K 个点)且可在受控环境(FrozenLake)里分离验证。
四、问题解法
4.1 诊断:两大根因
根因一:MSE 的隐含方差惩罚。critic 损失是逐点 MSE。当相邻状态的真实价值相近但不同(微小的真实梯度)时,回归理论告诉我们:最小化期望 MSE 的预测会向"局部平均"收缩——MSE 天生惩罚预测的局部方差。响应内价值跃迁被平滑掉,正是这种收缩的宏观表现。【论文理论+实验支持】
根因二:时间相关状态的冗余更新。同一响应内相邻 token 的状态高度相似,梯度方向也高度相似。PPO 对整条响应做稠密 token 级监督,等于把相似的梯度重复施加——有效学习率被放大且方向集中,进一步把局部差异抹平(过拟合到"响应间差异"而忽视"响应内差异")。【论文实验支持:扰动实验显示去掉相关性后平坦化减轻】
4.2 解法:SP3O(SParse Proximal Policy Optimization)
做法简单到令人怀疑:每条响应只在 K 个"位置分离良好"的锚点状态上计算 value loss,其余 token 的 critic 输出不进损失(advantage 仍按 GAE 正常算)。
两个设计点:
- 锚点位置:按响应长度的固定相对位置放(消融显示 0.3/0.6/0.9 优于随机放置);
- 为什么有效:锚点间距大→状态去相关→梯度方向多样→隐含方差惩罚失去"相邻可平均"的对象。等于同时拆掉两个根因的物理基础。
4.3 与相关方法对比
| 方法 | critic 监督 | 响应内 credit | 问题 |
|---|---|---|---|
| PPO | 全部 token | 理论上最细 | 平坦化毁掉实际分辨率 |
| GRPO/DAPO | 无 | 仅响应级 | 无 token 级信号 |
| SP3O | K=3 锚点 | 保留且可学 | 超参 K 需粗调 |
五、评估指标与实验证据
5.1 指标体系
- 现象度量:critic 预测 vs MC 价值的响应内相关性/方差比(诊断图);
- 主指标:数学推理基准(AIME/MATH 系列平均)与 OOD 推理套件准确率;
- 训练动力学:验证准确率、rollout 奖励、响应长度、更新幅度。
5.2 主结果(Qwen3-4B/8B-Base,数学 RL 训练)
| 对比 | 4B 提升 | 8B | 说明 |
|---|---|---|---|
| SP3O vs PPO(域内数学) | +7.97pp | 一致正向 | 同时超 GRPO |
| SP3O vs PPO(OOD 推理) | +7.33pp | 一致正向 | 泛化非过拟合 |
| 在线动力学 | 更稳的更新、更高验证准确率 | — | 响应更长(探索更多) |
5.3 消融:监督密度的反直觉曲线
| K(锚点数) | 训练奖励 |
|---|---|
| 3 | 最高 |
| 4 / 8 | 略降但稳定 |
| 16 | 明显下降 |
| 64 | 接近稠密 PPO |
| Dense(标准 PPO) | 最低档 |
| 随机放置(对照) | 36.59% vs PPO 37.60%(无效!) |
锚点放置消融(4B 准确率):随机 36.59 < PPO 37.60 < 0.2/0.5/0.8 位置 44.65 < 0.3/0.6/0.9 位置 45.57。
证明力分析:这两个消融是全文最有力的证据——(1) “随机稀疏无效、位置稀疏有效"排除了"减少计算量/正则化"的平庸解释,锁定去相关性才是机制;(2) K=3→64 的单调退化把"稀疏"与"有效性"的因果钉死。FrozenLake 受控实验(状态空间增大→平坦化加剧)进一步提供了跨环境的机理佐证。
六、效果优势的根源解释
6.1 根源机制与证据链
因果链:稀疏且位置分离的监督 → (a) 相邻相似状态不再同时进损失 → MSE 的局部平均失去对象 → critic 得以保留响应内方差;(b) 相似梯度不再重复叠加 → 优化压力从"拟合响应间均值"转向"分辨响应内变化” → 价值函数重新获得判别性 → GAE 分解出的 token 级优势信号恢复精度 → 演员学到细粒度策略 → 数学/OOD 准确率提升。
每步证据: 与 由随机放置消融+K 曲线【论文实验支持】; 由诊断图(训练后 SP3O critic 的 MC 相关性恢复)【论文实验支持】;【阅读者推测:论文未直接展示"优势估计误差下降"的中间量,属合理推断】。
6.2 相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| GAE(Schulman 2015) | 偏差-方差权衡的 advantage 设计 | 指出 value 误差直接污染 advantage | 不涉及表示层面平坦化 | 补充:经典前提,本文发现该前提在 LLM 长响应上系统性失效 |
| GRPO(DeepSeek) | 干脆放弃 critic | 响应级优势足够有效 | — | 限定:说明平坦化后 PPO≈GRPO 的现实;SP3O 证明 critic 路线仍可救 |
| ReMax/RLOO | 无 critic 基线族 | 训练稳定 | 无 token credit | 对照:SP3O 优于它们的实验是 critic 路线复兴的证据 |
| DeepSeek Math / Kimi 长思维链 RL 报告 | 工程上先预训练 value 模型 | 初始化能缓解但未根除 | 改的是起点不是动力学 | 补充:与本文互补(初始化+稀疏监督可叠加,未验证) |
| 主动学习/coreset 文献 | 选代表性样本训练回归器 | 去相关采样提升回归质量 | 非RL场景 | 支持(推测级):稀疏监督有效性有跨领域统计根基 |
6.3 综合判断与未决问题
多项证据共同支持:稠密 token 级 value 监督在长响应上是负因素;位置选择的稀疏监督恢复 critic 判别力。
仍属推测:0.3/0.6/0.9 的最优性是否跨模型规模/任务类型稳定;SP3O 与 value 预训练、异步 PPO 的叠加效应。
适用边界:短响应场景(<100 token)平坦化空间小,收益应有限;K 的选择与响应长度分布相关——超长思维链可能需要自适应锚点。论文未在 RLHF 偏好奖励(非可验证奖励)上验证。
七、必要知识反推
领域知识层:PPO/GAE 的完整数学( Advantage 如何由 critic 导出);MC 价值估计原理(诊断工具的基础)。
方法论知识层:回归的统计性质(MSE 收缩效应——根因一的识别需要回归理论直觉);时序数据的相关性理论(去相关采样的合理性);受控实验设计(FrozenLake 分离变量)。
工程知识层:大规模 LLM RL 训练框架(rollout 管理、显存布局);诊断可视化(响应内 value 曲线对比图的设计)。
融合关键节点:把"critic 学不好"这个模糊抱怨,转译为"MC 值 vs 预测值的响应内方差比"这一可测量——诊断先行是整个工作的支点;随后"回归统计 × RL 采样"的交叉知识把解法指向采样几何而非损失函数或架构。
八、论文中可以提取的通用性灵感
稠密监督可能是毒药:当监督点强相关时,删点比加点好
- 论文证据:K=3 > K=8 > K=64 > Dense 的单调排序。
- 推广场景:多模态训练中的时间稠密标注(抽帧监督);模仿学习的轨迹采样(去相关 demo);在线评估的重复测量设计(分离测量点)。
诊断一个学习系统,给它一个"真值代理"并对齐坐标系
- 论文证据:MC 续写估计充当每状态真值,一眼照出平坦化。
- 推广场景:RAG 系统诊断(检索质量真值代理)、奖励模型审计(人类重评抽样当真值)、教师模型蒸馏监控(能力断面测试)。
“随机对照无效、结构化干预有效"是锁定机制的黄金实验
- 论文证据:随机放置锚点 36.59% vs 位置锚点 45.57%。
- 推广场景:任何"我的改进是机制性的还是工程性的"自证需求——加一个"同预算随机化"对照即可。
失效模式命名本身是重要贡献
- 论文证据:“Value Flattening"命名后,FrozenLake 复现、状态空间扫描、根因分解顺理成章。
- 推广场景:团队内部把反复出现的坏现象命名(如"评测泄漏"“提示漂移”)能显著加速知识沉淀与传播。
本精读基于 arXiv:2609.18708 全文撰写;实验数字均出自论文表图;外部检索截至 2026-09-18。