论文链接:Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO (arXiv:2608.27351) 发表时间:2026年8月27日 机构:南方科技大学、新加坡国立大学、华为诺亚方舟实验室、香港城市大学、哈尔滨工业大学(威海)——典型的「企业实验室 + 多所高校」合作模式,华为诺亚方舟实验室为核心工业方 领域标签:cs.LG(机器学习),LLM 后训练 / 强化学习 / 进化策略 开源资源:GitHub 开源(github.com/yunpengba7/understanding-es)
一、论文背景
1.1 什么是进化策略(ES)?
先从最基础的概念说起。进化策略(Evolution Strategies, ES) 是一种诞生于上世纪的梯度无关优化方法:不计算梯度,而是给模型参数随机加扰动(可以理解为「生出一群略有差异的变异个体」),让每个变异个体去完成任务拿奖励,最后按「谁奖励高就朝谁的方向走」的原则聚合出一个更新方向。打个比方:传统梯度下降像在浓雾中用指南针精确导航,ES 则像撒出一群侦察兵分头探路,谁的路线好就全军向谁靠拢。
对 LLM 而言,ES 有两个极具吸引力的工程特性:不需要反向传播(只需前向推理即可评估扰动个体),因此显存占用极低、天然可大规模并行。2026 年以来,一系列工作(Qiu et al. 的 ES at Scale、Sarkar et al. 的 ES at the Hyperscale 等)证明 ES 确实能微调 LLM 提升推理能力。
1.2 争议:ES 只是「省钱版 GRPO」吗?
然而 ES 的江湖地位一直尴尬。主流观点把它当作 GRPO(Group Relative Policy Optimization,DeepSeekMath 提出的主流 RL 后训练方法)的内存高效替代品——隐含的判断是「效果不如 GRPO,但便宜」。同时,先前有工作(Abdi et al., 2026)报告 ES 会导致大规模参数漂移并引发灾难性遗忘(catastrophic forgetting,即学新任务时把旧能力忘掉),给 ES 的实用性蒙上阴影。
但 ES 的优化行为究竟和 GRPO 有什么本质区别?它到底擅长什么、不擅长什么?这些基础问题此前几乎没有系统研究——这正是本文的切入点。
1.3 关键线索:GRPO 的熵坍缩
另一个背景是 GRPO 的已知病灶:熵坍缩(entropy collapse)。GRPO 从单一策略采样一组回答,把组内相对优势回传到 token 级别。当高概率动作恰好获得正优势时,策略分布会越来越集中——模型越来越「确信」少数几种解法。先前多项研究发现,RL 后训练后的模型在大 K 值 Pass@K(重复采样 K 次至少对一次的概率)上甚至低于 base 模型——多样性被优化过程「吃掉」了。
一个自然的问题随之而来:ES 在参数空间里维护一整个「种群」,它是否天生规避了这种多样性坍缩?
二、论文定位和关联工作
本文属于分析型研究而非「提出新算法」型研究,定位类似「给 ES 画出准确的势力范围图」。围绕三个研究问题(RQ)展开:
| 研究问题 | 对比的既有工作 | 本文新发现 |
|---|---|---|
| RQ1: ES 与 GRPO 的后训练特性是否相同? | 熵坍缩分析(Cui et al. 2025; Petrenko et al. 2026)、Pass@K 退化报告(Yue et al. 2025) | ES 覆盖更广:Pass@K 全面高于 GRPO 且无熵坍缩 |
| RQ2: ES 是否必然导致灾难性遗忘? | Abdi et al. 2026(报告 ES 大漂移→遗忘) | 大漂移≠遗忘:更新呈幅度稀疏性,held-out 性能基本保持 |
| RQ3: 什么超参/估计器让 ES 有效可扩展? | 零阶优化文献(Malladi et al. 2023 的 MeZO 等) | z-score 归一化是关键;模型越大种群可越小;两点估计器在推理任务无优势 |
与关联工作的关键差异:此前 ES vs GRPO 的对比(Hoy et al. 2026)只看「最终精度差不多」,本文则把比较维度从 Pass@1 扩展到 Pass@1/16/32 三档 + 熵动态 + 参数几何,第一次系统界定了 ES 相对 GRPO 的优势范围。理论层面,论文用 Fisher 信息与 Jensen–Shannon 散度把「参数扰动→策略多样性→采样成功率」这条链路形式化,这在 LLM 后训练文献中是新的。
三、问题定义
论文要回答的核心问题可以拆成三层:
优化行为层:ES 与 GRPO 同样优化「验证器奖励的期望」,但机制完全不同。GRPO 在单一策略上采样 G 个回答、回传 token 级优势;ES 在参数空间采样 N 个扰动方向、按标准化奖励加权聚合参数更新。这两种机制各自塑造了什么样的推理覆盖(reasoning coverage)?衡量指标是 Pass@K——重复采样 K 次能找到至少一个正确答案的概率,K 越大越考验「低概率正确解」的可及性。
能力保持层:ES 的全参数扰动会累积巨大参数漂移(后面会看到是 GRPO 的 40 倍以上)。这种漂移是否必然破坏预训练能力?衡量方式是 held-out 基准(训练时没见过的任务)上的性能变化。
实用配置层:z-score 奖励归一化、扰动尺度 σ、种群大小 N、单点/两点估计器——这些设计选择如何影响 ES 的有效性与可扩展性?
四、问题解法
4.1 理论:种群多样性为何利好 Pass@K
论文的证明链路由三个引理和一个命题构成(不需要读懂全部数学,抓住直觉即可):
- Lemma 1(扰动诱导策略多样性):给参数加高斯扰动 σϵ,经 Fisher 信息度量,种群内策略间的 KL 散度期望约为 (σ²/2)(1−1/N)·tr I_x(θ)——即扰动天然产生互不相同的策略。
- Lemma 2(多样性提升找到正确答案的概率):定义「每成员各采样一次的成功概率」P_pop 与「从平均成功率的单一策略采 N 次的成功概率」P_same,则 P_pop ≥ P_same,且差距恰好由成功率的 JS 散度刻画。直觉:N 个不同的策略各试一次,比一个策略试 N 次更容易命中正确解——好比从不同角度各射一箭,好过同一角度连射 N 箭。
- Lemma 3(奖励加权利用异质性):当权重与成员成功率正相关时,奖励加权混合策略优于均匀平均——即 ES 的「朝高分个体走」确实利用了种群差异。
- Proposition 1(ES 更新可提升 Pass@K):只要中心迁移误差足够小(更新后的模型足够接近奖励加权混合策略),种群层面的 Pass@K 优势就能保留在更新后的中心模型中。
4.2 实验设计与顺序混合训练
实证部分设置两个训练难度档:
- Easy Setting:Qwen2.5-1.5B/7B、Llama-3.2-3B 在 GSM8K 上后训练 2 epoch,测 6 个基准(GSM8K/CSQA/HotpotQA/Countdown/GPQA/MBPP)。
- Hard Setting:DeepSeek-R1-Distill-Qwen-1.5B 在 DeepScaleR 上后训练,测 AIME24/25、AMC23、MATH500 等。
此外,基于「GRPO 强在 Pass@1、ES 强在 Pass@K」的发现,论文提出顺序混合训练:在相同总更新预算下先 ES 后 GRPO(ES→GRPO)或反序(GRPO→ES),试图两头兼得。
五、评估指标与实验证据
5.1 RQ1:ES 的覆盖优势
训练动态(以 GSM8K 训练、GPQA 为 held-out 观察点):GRPO 训练中 token 级熵从约 0.40 一路降到 0.25 附近,Pass@16/32 最终低于 base;ES 的熵基本稳定,两项指标收在 base 之上。
测试结果(Easy Setting,Qwen2.5-1.5B 六基准平均):
| 方法 | Pass@1 | Pass@16 | Pass@32 |
|---|---|---|---|
| Base | 41.0 | 75.4 | 80.2 |
| GRPO | 42.9 | 75.1 | 79.9 |
| ES | 41.5 | 76.0 | 80.9 |
Hard Setting(DeepScaleR 训练,数学四基准平均):ES Pass@32 78.9 vs GRPO 78.0 vs Base 77.4。代表性单点:MATH-500 上 ES 的 Pass@32 提升 +5.05pp,GRPO 反而 −2.02pp。GRPO 在 18 组对比中 15 组 Pass@16/32 低于 base——Pass@K 退化不是偶然现象而是系统性规律。
顺序混合:Hard Setting 下 ES→GRPO 拿到最高平均 Pass@1(52.3,超过 GRPO 单独的 52.9 需按逐任务看,但平均意义上二者接近)且最高 Pass@32(79.2)——帕累托前沿被显著扩展,说明两种范式的增益确实可叠加。
5.2 RQ2:大漂移不等于遗忘
- 漂移量化:ES 训练后参数离初始点的相对 L2 距离是 GRPO 的 40.7–44.1 倍(如 Qwen2.5-1.5B:ES 1.933×10⁻² vs GRPO 0.0475×10⁻²)。
- 幅度稀疏性:把幅度 ≤1.5×10⁻³ 的小更新(占非零更新的 77.6–93.0%)全部抹零,目标任务 Pass@1 几乎不变;继续抹到 97% 稀疏度才出现明显退化。即 ES 的性能增益集中在稀疏的大幅更新子集。
- 更新位置:ES 的最大更新集中在 LayerNorm 与注意力投影(DeepSeek-R1-Distill 模型 top-100 中 80 个是归一化参数);GRPO 则集中在 token embedding 和 LM head——两种范式改动的「功能位置」完全不同,ES 像在调「信号路由与缩放」,GRPO 像在改「输入输出词表表示」。
- held-out 表现:Easy Setting 三个模型上,ES 的 held-out Pass@32 平均变化为正,GRPO 为负。作者据此反驳 Abdi et al. 的「ES 灾难性遗忘」结论——后者的证据来自单一模型、小训练集,更可能是训练集过拟合而非广泛遗忘。
5.3 RQ3:配置指南
- z-score 奖励归一化:把种群内奖励标准化后再加权,全程优于不归一化——因为推理奖励是离散的(对/错),绝对值不稳定,相对排名才可靠。
- 种群大小随模型规模缩小:0.5B 模型需要 N=32 才接近 N=64 的效果,1.5B 和 3B 用 N=16 即可(差距仅 0.003–0.005)。模型越大,「有效扰动方向」越密集,少量方向就够用——这对 ES 的可扩展性是重大利好。
- 两点估计器无优势:零阶优化(如 MeZO)常用对称扰动相减降噪,但推理任务每次评估都要重新自回归生成回答,早期 token 的微小分歧会让配对协方差失效,减法降噪失效。单点估计器够用。
六、效果优势的根源解释
第六部分必须建立「方法差异→机制变化→指标提升」的完整因果链。本文的优势根源可以写成两链条:
链条一(覆盖优势):GRPO 在单一策略上回传 token 级优势 → 高概率动作获得正优势时策略熵下降(ΔH ≈ −η·Cov(log p_a, p_a·A_a) 为负)→ 熵坍缩,重复采样趋向同一批解法 → 低概率正确解不可及 → 大 K 的 Pass@K 退化。ES 在参数空间采样种群 → 扰动诱导异构策略(JS 多样性)→ 每个成员各采样一次的成功概率 ≥ 单策略匹配采样(Lemma 2)→ 奖励加权把成功成员的方向聚合进中心(Lemma 3 + Prop. 1)→ 无熵坍缩且 Pass@K 提升。这就是「Easy Setting 下 ES Pass@32 平均 80.9 vs GRPO 79.9、GRPO 15/18 组低于 base」的机制根源。
链条二(不遗忘之谜):ES 全参数扰动 → 总漂移巨大(40 倍)→ 但大更新稀疏集中在 LayerNorm/注意力参数 → 这些参数只调整隐藏状态的缩放与信息路由,不广泛改写知识 → 抹掉 93% 小更新后性能不变 + held-out 平均提升 → 大漂移 ≠ 灾难性遗忘。反过来,GRPO 的梯度集中在 embedding/LM head,token 级优化的功能位置不同。
两条链合起来支撑论文的核心论点:ES 不是 GRPO 的廉价替代品,而是一个有独立优势区间(广覆盖、能力保持)的后训练范式,两者顺序组合(ES→GRPO)还能帕累托兼得。
七、必要知识反推
要真正读懂这篇论文,以下知识点需要提前掌握(按依赖顺序):
- Pass@K 的定义与计算:K 次独立采样中至少一次正确的概率(通常用无偏估计修正)。核心是理解它与 Pass@1 的互补性——Pass@1 衡量「最拿手的解法」,Pass@K 衡量「解法空间的覆盖」。
- GRPO 机制:组内相对优势 A_i = (r_i − mean)/std、PPO 式裁剪目标、为何不需要独立 critic。
- 熵坍缩的数学直觉:ΔH(s) ≈ −η·Cov(log p_a, p_a·A_a),高概率动作拿正优势时协方差为正、熵下降。
- ES 基础(Salimans et al. 2017):高斯平滑目标、单点梯度估计器、reward 标准化加权。
- Fisher 信息与 KL 散度的局部关系:D_KL ≈ ½δᵀI(θ)δ,这是 Lemma 1 把「参数距离」翻译成「策略距离」的桥梁。
- Jensen–Shannon 散度:对称、有界的分布差异度量,这里是刻画「成员间成功率差异」的统计工具。
- 灾难性遗忘与持续学习:以及「参数漂移」与「功能变化」为何不是一回事。
- 彩票假说:大模型内含稀疏的有效子网络——本文借此解释为何全参数 ES 在十亿参数空间仍有效、为何大模型可以用小种群。
八、论文中可以提取的通用性灵感
即使不做 ES 研究,以下几条洞察可迁移到广泛的技术工作:
对比方法时先统一「优化目标」,再区分「优化机制」。ES 和 GRPO 优化同一个目标(验证器奖励期望),差异全在机制层面——这种「同目标、异机制」的受控对比是产生干净结论的实验设计范式。做任何 A/B 对比前,先问自己:除了想比较的那个因素,其它条件真的对齐了吗?
单一指标会掩盖帕累托结构。如果只看 Pass@1,ES 确实「不如」GRPO;加上 Pass@16/32 后结论完全反转。当你得到一个「A 不如 B」的结论时,值得问:换了评价指标或评价预算,结论还成立吗?
「大参数漂移」是聚合统计量,会掩盖幅度分布结构。40 倍漂移听起来可怕,但分解到幅度分布后发现 93% 是无害的小更新。很多看似 alarming 的整体性度量(平均延迟、总错误数、总代码变动量)都可能藏着一个稀疏的主要贡献子集——先做分布分解再下结论。
弱信号的理论形式化可以先从「直觉不等式」入手。「N 个不同策略各试一次 ≥ 一个策略试 N 次」本质上是个组合不等式,却足以支撑核心论证。写分析型论文时,不必追求最深的定理,把关键直觉凝练成可证明的命题就是贡献。
顺序组合不同范式是低成本取长补短的捷径。ES→GRPO 并非新算法,只是把两种已有方法串联,却拿下了双最高指标——在工程实践中,「先广探索后强收敛」的阶段性策略(先发散找解空间、再收敛 sharpen)在很多场景通用。
零阶优化的技巧迁移要检查任务属性假设。两点估计器在 SST-2 这类固定数据任务上有效,在自回归再生的推理任务上失效——根因是「同一输入可以复用」的假设被打破。移植任何技术前,先列出它隐含的前提条件清单。