ERPO: Environmental Regularization for LLM Policy Optimization 精读
论文链接:arXiv:2608.23311 代码仓库:AlibabaResearch/ERPO 发表时间:2026年8月 机构:阿里巴巴 AMAP(一作二作+通讯)+ 西安交通大学 + 京东 + 北京师范大学 + 新加坡国立大学——企业主导的五机构产学研:阿里出生产 RL 环境与问题,高校参与理论分析 领域标签:cs.CL / cs.LG(RLVR 后训练)
一、论文背景
RLVR 是什么? RL with Verifiable Rewards——用可验证奖励(数学答案对错、代码测试通过与否)做强化学习,是 DeepSeek-R1 以来推理模型后训练的主流范式。GRPO(Group Relative Policy Optimization)是其中最常用的优化器:对同一问题采样一组回答,组内比较算优势,无需价值网络。
稳定性-探索两难是什么? RL 训练中为了防止策略跑飞,标准做法是加 KL 正则(惩罚当前策略偏离初始策略太远);但 KL 约束直接压在动作分布上——模型探索新解法的行为本身会被惩罚。放开 KL 则训练崩溃。这就是两难:稳定和探索在动作侧正则化下此消彼长。
现状的问题:工业界普遍观察到 GRPO 训练在两个场景崩溃——高温解码(temperature > 1.2 时成绩断崖)和长程训练(400 步后先崩高温区再蔓延)。社区把根因归结为"KL 系数没调好"或"熵坍缩",治标不治本。
二、论文定位和关联工作
本工作处在 LLM RL 稳定性研究脉络中:
- KL 正则设计线:RPG(On the Design of KL-Regularized Policy Gradient)、Future-KL Regularized GRPO 等——都在动作侧 KL 的变体上做文章(未来 KL、过程级 KL),没有质疑"正则应该放在动作侧"这个前提。
- 熵管理线:DAPO 等通过 clip-higher、熵奖励对抗坍缩——把探索问题当熵问题处理。
- 本文的差异化定位:第一次指出真正的漂移源在输入侧——策略变强后,它"偏好哪些问题"的分布变了(对简单问题给出高确信答案、对难问题生成更长推理),这个查询分布漂移等于不断更换训练环境,梯度方差随之放大。动作侧 KL 约束的是"怎么答",管不住"答哪种题时进入哪种状态"。
| 对比维度 | 动作侧 KL(GRPO/RPG 等) | 熵管理(DAPO 等) | ERPO(Query-KL) |
|---|---|---|---|
| 约束对象 | 响应分布 π(o|q) | 输出熵 | 查询分布 ρθ(q) |
| 对探索的影响 | 直接惩罚新解法 | 不惩罚但也不稳定输入 | 梯度不流经响应,探索零损伤 |
| 高温崩溃 | 无法根治 | 部分缓解 | 根治(80.8% vs 25.2%) |
三、问题定义
具体场景:RLVR 训练中模型先在中等温度表现良好,随后高温区成绩崩塌、长程训练发散。
抽象问题:LLM 策略优化的"环境"由查询分布诱导——策略自身决定了它将遇到哪些(状态,查询)对。若正则化只作用于动作而放任输入过程漂移,训练环境的非平稳性将成为不稳定的根源。 能否构造一个正则项,它约束输入过程(稳定环境)但对动作分布零直接梯度压力(保留探索)?
形式化:约束 E_{q~ρθ}[KL(ρθ(q)‖ρθ0(q))],且要求 ∂(该项)/∂π(o|q) = 0。
四、问题解法
4.1 Query-KL:梯度解剖
命题 1 是全文的理论核心:查询似然 ℓθ(q) 只通过策略对 q 的选择概率进入梯度,∇ℓθ(q) 不含响应 score function ∇log π(o|q)。这意味着惩罚查询分布漂移时,梯度严格只流向"改变选哪些题",不会拉动"怎么答题"。论文用机制证据支撑:实测 GRPO 训练中 Query-KL 比 Policy-KL 高一个数量级——约束动作分布远不足以稳定输入过程。
4.2 参考导出的逐查询权重
w(q) ∝ ℓθ0(q)(参考模型下的查询似然,一次缓存、无额外前向)对 advantage 重加权:偏向参考下的典型查询、降方差。类比重要性采样中的 proposal 校正——让梯度估计集中在对参考策略"有意义"的样本上。
4.3 即插即用
两项设计兼容 GRPO/PPO/REINFORCE——ERPO 不是新优化器,而是任何策略优化器的"环境稳定器"。
五、评估指标与实验证据
主实验(Qwen2.5-Math-7B,6 个数学基准 AIME24/25、AMC、MATH500、Minerva、OlympiadBench,温度 0.1-1.5 聚合):
| 指标 | ERPO | GRPO | 差距 |
|---|---|---|---|
| Avg@32 均值 | 0.336 | 0.274 | +6.2pp |
| 单项最高(AMC) | 0.478 | 0.398 | +8pp |
| Pass@1 | 0.332 | 0.275 | +5.7pp |
高温稳定性(决定性证据,32B 模型 T=1.5):ERPO 80.80% vs GRPO 25.20%。这个实验的证明力在于:它不是"平均分更高"而是"崩溃模式消失"——GRPO 的高温崩溃是训练不稳定的直接症状,ERPO 的根治说明根因(查询漂移)被正确处理。
长程训练 1000 步:GRPO 在 400 步后高温区先崩并蔓延到全温区;ERPO 仅缓降且高温区反升。
消融:仅换 QKL(不加权)比 GRPO 平均 +15.9%——QKL 是主增益源;w(q) 主要贡献训练稳定性。实测 ERPO Query-KL 0.0828 vs GRPO 0.9679(漂移被压缩 11.7 倍),而两者 Policy-KL 相当(0.073 vs 略高)——证明查询约束没有干扰策略收敛。
六、效果优势的根源解释
baseline 的根本局限:动作侧 KL 的机制盲区——它约束"回答的分布",但训练梯度方差爆炸的来源是"模型变强后遇到的(问题,状态)分布持续改变"。这就像在流动的河面上建桥:动作 KL 加固了桥墩(回答方式),但河水(输入环境)还在流。
ERPO 的机制改变:QKL 直接绑定漂移源(查询分布),把训练环境钉在参考点附近;同时由命题 1 保证,这个约束通过参数空间中近似正交的子空间流动(实测 Policy-KL 不升),不与策略优化互相挤压。环境稳定 + 探索自由——两难在输入侧正则化下解耦。
因果链:QKL → 查询分布漂移被抑制(0.97→0.08)→ 有效训练环境平稳 → 梯度方差下降 → 高温解码与长程训练的崩溃消失 → 平均成绩 +6.2pp。消融(去 QKL 增益消失、去 w(s) 稳定性下降)逐环验证了这条链。
七、必要知识反推
- 领域知识层:RLVR 训练动力学(哪里崩、何时崩)——没有生产级训练的观察,提不出"高温崩溃"这个具体症状;GRPO 的组内优势机制。
- 方法论知识层:策略梯度与 KL 正则的梯度解剖(能对 ∇ℓθ(q) 做分解是命题 1 的前提);重要性采样与方差控制(w(q) 的来源);非平稳环境下的 RL 理论(环境漂移导致方差放大是经典结论)。
- 工程知识层:大规模 RL 训练基建(多温度评测协议、千步长程训练的稳定性监控)。
知识融合的关键节点:把"非平稳环境 RL 理论"(教科书知识)反过来用到"策略自身诱导环境漂移"这个 LLM 特有现象上——理论不新,洞察是新的:LLM 的策略同时是环境的采样器。
八、论文中可以提取的通用性灵感
正则化要对准漂移源,而不是对准可观测输出(机制类)
- 证据:动作侧 KL 管不住查询漂移(Query-KL 高一个数量级),QKL 一击根治高温崩溃。
- 推广:任何自适应系统(推荐系统、在线 A/B 平台、经济系统调控)的稳定器设计都应先问"真正的非平稳源在哪"——通常不是显式输出,而是系统的输入构成。
梯度解耦可以让两个目标互不打扰(机制类)
- 证据:命题 1 证明 QKL 梯度不流经响应分布,实测 Policy-KL 不升。
- 推广:多目标系统(多任务学习、产品迭代中的质量与速度)中,寻找参数空间中的正交分解,比加权折中更高效。
诊断先行:先测"崩在哪"再开药(方法论类)
- 证据:论文先量化"GRPO 的 Query-KL 比 Policy-KL 高一个数量级"这一诊断事实,再设计对策。
- 推广:任何性能调优(模型训练、系统运维、个人习惯养成)都应先建立"症状的量化画像",避免在未定位根因前堆叠补丁。