Locked at the Entrance 精读:RLVR 的多样性坍缩发生在推理的门口

论文:Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space(arXiv:2608.29188,cs.LG,2026-08-29) 作者:Qiancheng Zhou(上海大学未来技术学院), Ruizhe Li(伯明翰大学计算机学院) 代码:https://github.com/ershiyidian/early-branch-locking


一、题目

  • 会议/期刊:arXiv 预印本(2026 年 8 月),机制分析+干预验证完整度对标 ICLR/NeurIPS 分析论文(类似"和 PLM 谈谈"系但更定量)。
  • 发表单位:上海大学 + University of Birmingham 双人合作。
  • 一句话概括:用可穷举解空间的 Countdown 任务把"多样性丢失"精确定位到轨迹的第一个算术决策——模型训练后依然能执行各种解法,只是概率上不再选择进入它们。

二、背景

研究脉络

RLVR 与测试时扩展存在根本张力:RLVR 大幅提升 pass@1,但训练后的 policy 坍缩到狭窄的答案支撑上,重复采样、自洽性、树搜索等推理时技术的边际收益随训练急剧衰减(Yue et al. 等系列工作)。已有应对——奖励整形、探索 bonus、修改 rollout 目标——都只在聚合层面(最终答案计数/轨迹聚类)度量多样性。

聚合度量的致命模糊:分不清两种失败——policy 是"进不了解法族"(从未发起该路径),还是"进了做不完"(下游计算脱轨)。两种失败的修复机制完全不同:前者需要重开入口选择,后者需要修复执行能力。不定位就干预,等于盲打。

与既有工作的差异

  • 与聚合多样性度量:本文利用 Countdown 解空间可穷举的独特性质,把分支分析锚定在 ground-truth 解图上——连"policy 从未访问过的有效族"都能检测(采样聚类做不到);
  • 与 forking token 研究(Bigelow 等发现稀疏高熵分叉 token):本文给出分支分析的真值基座,并直接因果干预验证;
  • 与 checkpoint 插值/混合等缓解手段:本文给出这些手段为什么有效的机制解释。

三、定位

  • 领域:LLM 推理机制分析 / RLVR 训练动力学。
  • 问题层级:现象定位→机制解释→干预设计三层递进。
  • 关键洞察预告:训练后 policy 的执行能力严格变好、坍缩集中在入口选择——“reasoning breadth is lost at the door, not inside the room”。

四、问题定义

任务:Countdown(给定数字集与目标数,用 +−×÷ 和括号精确构造目标)——解空间可被符号求解器穷举并按交换/结合律规范化。

核心分解:把解空间组织为决策树,深度一层的分支由"首操作数+首算子"(o₁, ⊙₁)定义,称为入口族(entrance family)。求解经由族 b 的概率分解为:

π(solve via b) = π(access: 选 b) × π(execution: b 之后有效完成)

测量指标:

  • 解覆盖 Cov(x, Y₁ₙ):n 条采样命中的规范解比例;
  • 自由生成覆盖:衡量族 access;
  • 入口钳制 rollout:把 prompt 钳制到求解器指定的入口、下游全部放开——衡量条件 execution。

训练设定:Self-trained PPO(TinyZero 框架,Qwen2.5-3B,11 个 checkpoint)+ 开源 GRPO checkpoint 序列(Qwen2.5-3B-Instruct);评估集 135 个可解问题与训练集严格不相交。

五、解法(分析框架+干预)

5.1 训练动力学的精度-广度天平

全程追踪 pass@1 与解覆盖:PPO 下 pass@1 涨 50 倍、覆盖 0.337→0.111(-67%);GRPO 准确率三倍、覆盖 -43%。关键是:在所有 checkpoint 都能解对的问题子集上,覆盖照样减半——坍缩不是难度混淆。

5.2 机制定位:似然相位归因+入口钳制

  • 相位归因:per-token 似然散度在首个算术操作之前是其后所有推理步的 16×(PPO)/11×(GRPO)——概率质量迁移集中在门口;
  • 入口钳制:只给一个未入选族的极小入口前缀,低覆盖族完成率 0.018→0.212(提升超一个数量级);且匹配前缀上的下游执行能力在训练中严格变好。

→ 结论:能力在,选择没了。

5.3 入口定向干预

对三类干预做对照:

  • 表面干预失败:方法提示(prompt 要求多样化)无效;强制算子偏移无效;温度调节以 pass@1 为代价;
  • 入口感知干预成功:后层参数插值(20–28 层与 step-50 checkpoint 混合)恢复 37% 覆盖、pass@1 零损失;checkpoint 采样与推理相位 logit 混合同样显著恢复广度。

5.4 规模与范式泛化

六大数学基准(GSM8K/MATH500/Minerva/OlympiadBench/AMC23/AIME24)× 7B/14B Qwen:早步熵坍缩一致出现;长推理域下游执行成为复合第二瓶颈,但入口选择仍是主闸门。范式对照:SFT 模型保持 2 倍以上覆盖;OLMo-3 的 SFT–DPO–RLVR 阶梯在提升 pass@1 的同时保留早步计算熵——坍缩不是推理优化的必然副产品。

六、实验结果(机制→干预的证据链)

证据数字
PPO 解覆盖坍缩0.337→0.111(-67%)
GRPO 解覆盖坍缩-43%
全对子集覆盖照样减半
入口前似然偏移倍率16×(PPO)/ 11×(GRPO)
入口前缀钳制的族完成率0.018→0.212
后层插值恢复覆盖+37%(pass@1 不降)
SFT 对照覆盖>2× RLVR 模型

一条完整证据链:坍缩真实存在(覆盖↓)→ 不是难度效应(全对子集照样塌)→ 位置在入口(偏移 11–16×+钳制救援)→ 执行能力反而变好(匹配前缀严格改进)→ 干预入口可修复(插值+37%)→ 不是宿命(SFT/阶梯范式免疫)。

七、知识反推

  1. 现象定位先于干预设计:聚合多样性度量下的"保多样性"方法大多在盲打——温度调节、方法提示失败的根因是它们不触及入口选择的权重结构;定位到入口后,干预设计变得有的放矢。
  2. checkpoint 插值的机制解释:此前"checkpoint 混合有效"是经验现象;本文揭示其作用位点是重开休眠入口分支同时保留下游精炼能力——权重空间干预与表示空间的门控结构对上了。
  3. access/execution 分解是通用分析框架:任何自回归生成任务(代码生成、评审、规划)的多样性损失都可以问同一个问题——是"不再发起"还是"发起后做不完"?两者需要完全不同的修复。
  4. 训练范式的自由度:SFT–DPO–RLVR 阶梯保留早步熵的发现提示:坍缩程度是训练配方的可调属性而非 RL 的固有代价。

八、通用灵感

  • 对强化学习训练监控的启发:监控 pass@1 之外应监控"入口熵"类指标(首决策分布的熵/覆盖),作为多样性坍缩的早期预警——比最终答案多样性更灵敏。
  • 对本课题(评审 Agent 多样性)的启发:自迭代评审系统中,若评审意见随训练/迭代趋于同质化,可复用此框架检查是"评审切入角度塌缩"(access)还是"角度选定后分析不完整"(execution)。
  • 方法迁移:Countdown 的"可穷举解空间"设计思路可推广到其他可枚举域(SQL 查询模板、评审检查表项)做同类机制研究。
  • 开放问题:自然语言推理任务没有可穷举解空间,入口族的 ground-truth 划分如何近似;入口坍缩与猝灭 token/好奇心奖励等探索机制的形式关系。

基于论文全文逐页阅读撰写;数字出自原文摘要与 §4–7。