论文链接:Boosting LLM Exploration via Weak-Model Guidance in RLVR (arXiv:2608.27420) 发表时间:2026年8月27日 机构:北京大学王选计算机研究所、新闻出版智能媒体技术全国重点实验室(新电子出版技术国家工程研究中心)——纯高校团队 领域标签:cs.CL(计算语言学),LLM 后训练 / 强化学习 / 探索增强

一、论文背景

1.1 RLVR 的熵坍缩问题

RLVR(可验证奖励的强化学习) 是当下提升 LLM 推理能力的主力后训练手段:模型对一道题生成回答,验证器判对错并给出奖励,算法(通常是 GRPO)据此更新参数。DeepSeek-R1、GPT-5 等模型的推理能力都受益于此。

但训练有个系统性副作用:熵坍缩。GRPO 不断提高高奖励轨迹的概率,模型很快对少数几种解法变得过度自信——策略熵在训练早期就急剧下降。后果是:模型的「单发命中率」(pass@1)上去了,但「重复采样 K 次至少对一次」(pass@k,K 很大时)反而下降——Yue et al. (2025) 发现 K 足够大时 base 模型能反超 RLVR 训练后的模型。直觉上说:RLVR 只是让模型对已经会做的题更有把握,并没有学会新的解法,反而把原本可能找到的另类解法路径「挤掉」了。

1.2 现有解法都在「内部」打转

已有缓解方案包括:熵正则化(把熵作为奖励的一部分)、token 梯度校准、奖励/优势函数设计等。这些方法的共同点:都在修改训练目标或梯度分配,探索范围仍限于目标模型自己的生成分布之内。模型再怎么被鼓励探索,探索的起点还是它熟悉的那些推理状态。

1.3 一个被忽视的资源:别的模型的输出

不同模型(不同预训练数据、不同架构)对同一道题会产生相当不同的推理轨迹。这提示了一个外部视角:如果强制目标模型从一个陌生模型生成的部分推理轨迹继续写下去,它就被迫进入自己高概率分布之外的状态——探索被「物理性」地拓宽了。这就是本文的核心想法:用弱模型的前缀做非参数化的转向信号。

注意它与蒸馏的区别:蒸馏是用强模型的高质量输出教弱模型;这里恰恰相反,是用更弱的小模型的(常常是错误的)输出去扰动更强的大模型——收益机制完全不同。

二、论文定位和关联工作

本文属于「简单方法 + 机制深挖」型研究。关联工作三条线:

  1. 熵坍缩与 pass@k 退化分析(Cui et al. 2025 的熵机制研究、Yue et al. 2025 的覆盖率分析、Brown et al. 2024 的大规模重复采样)——确立问题存在的文献基础。
  2. 算法侧缓解方案(熵正则 Peng et al. 2025、clip-cov 等梯度控制、Dong et al./Chen et al. 的探索性奖励设计)——本文定位为与之「正交」的外部扰动路线。
  3. 知识蒸馏(Park et al. 2019 等)——本文刻意区分:辅助小模型不是教师,前缀的正确性与最终收益解耦。

论文的差异化贡献在于两处:一是系统量化了跨模型前缀对目标模型策略熵的影响(图 1 的熵动态分析);二是通过前缀质量评估实验揭示了「扰动效用与语义指导质量解耦」这一反直觉机制——这是对「为什么弱模型能帮强模型」的干净回答。

三、问题定义

形式化地说:标准 RLVR 优化 E[R(q, r)],其中 r ∼ π_θ(·|q),每一步推理只以模型自己前文为条件——高奖励轨迹被强化、低概率路径被进一步忽视,探索空间单调收缩。

论文要解决的问题:如何在不做熵正则、不改奖励设计、不加额外 SFT 的前提下,让 RLVR 训练保持探索多样性,使大 K 值 pass@k 不退化(甚至提升)?

约束条件也值得注意:推理时模型必须能裸答题(没有前缀可用),所以训练时的任何前缀引导最终都要「退化回」无前缀场景——这决定了方法必须设计成混合训练而非完全替换。

四、问题解法

方法(Prefix-Completion RLVR)由三个组件构成,整体流程极简:

4.1 前缀补全训练

辅助小模型(Gemma-2-2B 或 LLaMA-3.2-1B)对训练题生成完整解,然后截断为部分推理前缀 r̃。训练时目标模型以前缀为条件生成剩余部分 r_suf ∼ π_θ(·|q, r̃),奖励按 R(q, r̃ ∘ r_suf) 计算。一旦某个「陌生起点 + 自己续写」的组合拿到正奖励,RLVR 就会提高这类替代轨迹的概率——低概率正确路径变得可达且可强化。

4.2 熵基前缀截断

前缀多长合适?太长则模型只需照抄结论、跳过推理,学习信号消失。论文的截断策略来自第 3 节的关键观察:跨模型前缀在早期推理步诱导目标模型高熵,随后熵逐步回落(模型适应了陌生上下文)。于是定义最优截断点为相邻步熵落差最大处(式 5):L* = argmax_L [H(s_L) − H(s_L+1)],保留熵暴跌之前的部分——恰好保留最强探索信号的区域。由于步级熵趋势在训练中基本稳定,截断点只需用 base 模型算一次。

4.3 混合训练

推理时没有前缀,因此以概率 p=0.2 用前缀补全、1−p 用标准 question-only GRPO,兼顾「探索拓宽」与「裸答能力」。消融显示 p=0.2 最优:p=1.0 因训练-推理条件不一致而全面退化。

五、评估指标与实验证据

设置:Qwen2.5-7B 与 Qwen2.5-Math-7B 为目标模型,MATH 训练集 7500 题,GRPO 训练;评测 6 个数学基准(AIME24/25、AMC23、MATH500、Minerva、OlympiadBench)的平均 pass@k,每题采样 128–200 次。

主结果(Qwen2.5-7B,六基准平均):

方法pass@1pass@128
Base27.8372.15
+ GRPO38.2967.76
+ GRPO + LLaMA-3.2-1B 前缀38.1569.06
+ GRPO + Gemma-2-2B 前缀39.0170.71

三个关键事实:① GRPO 把 pass@1 从 27.83 拉到 38.29,但 pass@128 从 72.15 跌到 67.76——熵坍缩的直接证据;② 加 Gemma 前缀后 pass@1 再涨 0.72、pass@128 恢复 2.95,且 k 越大增益越明显;③ Qwen2.5-Math-7B 上同样成立(pass@128:71.22 vs GRPO 的 69.30,超过 base 的 72.71 的大部分差距被挽回)。

训练动态:前缀法的策略熵全程高于 vanilla GRPO(早期尤其明显);平均奖励略低(探索的代价);但零奖励样本比例大幅下降——vanilla GRPO 常出现组内全对或全错(相对优势为零、梯度为零的奖励稀疏),外来前缀使组内轨迹多样化、奖励模式更丰富,附带缓解了奖励稀疏问题,后期零奖励样本可忽略。

前缀质量评估(机制核心):用 DeepSeek-V4-Flash 对随机抽取的 200 条 Gemma/LLaMA/Qwen 前缀分四类评估(无实质指导/完全错误误导/有瑕疵但可用/完全正确)。结果:小模型前缀大多数落在「无实质指导」或「误导」类别——语义质量很差。而对比实验给出决定性证据:同源 Qwen-1.5B/7B 的前缀语义质量更高(更多正确指导),pass@128 却毫无增益(67.22/68.79,均低于异源 Gemma 的 70.71)。

六、效果优势的根源解释

完整因果链(方法差异→机制变化→指标提升):

主链:辅助模型与目标模型异源(不同预训练数据/架构)→ 其前缀与目标模型自身输出分布存在系统性偏移 → 目标模型以前缀为条件时,早期推理步的策略熵显著升高(图 1 实证:Gemma 前缀诱导的步熵明显高于 Qwen 自生成前缀)→ 模型被推出高置信轨迹、进入平时低概率的推理状态 → 其中包含部分能通向正确答案的路径 → RLVR 强化这些「陌生的成功」,低概率正确解的概率被永久性提高 → 策略坍缩被延迟、大 K 值 pass@k 恢复至接近 base 水平。

为什么弱模型的『错』反而是资产:论文用「解耦」来总结——收益不来自前缀的语义正确性,而来自分布扰动强度。同源 Qwen 前缀质量高但分布像自己 → 熵扰动小 → 无增益;异源小模型前缀常常错误,但「与伪答案不一致的 rollout 无论伪标签对错大多本身是错的」这一不对称性意味着:错误前缀引导出的轨迹要么错(不强化,无害)、要么意外正确(强化,有益),不会系统性把模型带偏。错误的代价是局部的,扰动的收益是全局的。

附带收益链:外来前缀使组内采样轨迹异质化 → 组内奖励从「全对/全错」(零优势、零梯度)变为有分化 → GRPO 的有效梯度信号更密集 → 训练早期学习效率更高。

七、必要知识反推

读懂本文需要以下前置知识:

  1. GRPO 算法细节:组内归一化优势 A_i = (R_i − mean)/std、PPO 式裁剪目标、为何不需要价值模型。
  2. 策略熵与探索的关系:熵低 = 分布集中 = 探索弱;熵坍缩的动力学(训练早期骤降)。
  3. pass@k 的无偏估计:pass@k = 1 − C(N−c, k)/C(N, k),以及它与 pass@1 分别度量什么。
  4. 自回归条件分布:理解「以前缀为条件」如何改变 π_θ(·|q, r̃) 的生成分布——这是整个方法的数学基础。
  5. KL 散度与分布偏移:跨模型输出分布的差异为何等价于一种「转向信号」。
  6. 奖励稀疏问题:GRPO 组内全对/全错时优势为零、梯度消失——理解为何轨迹多样性等价于信号密度。
  7. 蒸馏的监督方向:为何「强教弱」与本文「弱扰强」机制完全不同。
  8. 训练-推理一致性原则:理解 p=1.0 为何失败(训练总有前缀、推理从无前缀,条件分布错配)。

八、论文中可以提取的通用性灵感

  1. 当所有方案都在系统内部做文章时,检查外部资源是否被闲置。熵正则、梯度校准都在改训练目标,本文只是「借别人的输出用一下」。跨模型输出是一种免费的、无限的多样性来源——这个视角可迁移到任何探索不足的优化场景(如优化器设计、数据增强、测试生成)。

  2. 区分「指导质量」与「扰动效用」两种独立价值。同源前缀指导好但无用、异源前缀指导差但有效——评估一个输入的价值时,除了「它传递了什么信息」,还要问「它把我带到了什么状态」。有时候错误的输入比正确的更有用,只要它打破了惯性。

  3. 不对称的代价结构是安全试错的护城河。「与错误前缀不一致的 rollout 大多是错的」意味着错误扰动天然低毒。设计探索机制时,主动构造这种不对称性(坏起点很难污染、好起点可能被发掘)比追求扰动正确性更关键。

  4. 用「最大熵落差」定位干预点是个通用技巧。截断点不选固定长度、不选随机位置,而选目标模型「从不确定到确定」的相变点——系统的状态突变点往往就是信息量最大、干预杠杆最大的位置。同理可用于主动学习选样本、课程学习切分难度。

  5. 保持训练-推理条件一致,或者用混合比例补偿。p=0.2 这个小比例说明:为推理时不存在的能力(前缀补全)做训练投入,只需少量即可收获探索红利,投入过猛反而因条件错配受害。任何「训练有辅助、部署无辅助」的设计都要回答这个配比问题。

  6. 探索的副产品可能比主目标更值钱。本文主目标是保 pass@k,意外发现零奖励样本比例大幅下降(奖励稀疏缓解)。做实验时对训练动态的全面监测(熵、奖励、样本利用率)常常能挖出论文没预设的「第二增长曲线」。