Critical-State RL:为多轮工具调用诊断「可训练的模型调用」 —— 精读
论文链接:https://arxiv.org/abs/2609.24985
标题:Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use
发表时间:arXiv:2609.24985v1,2026 年 9 月 21 日
发表机构:Salesforce AI Research
作者:Zixiang Chen、Wenting Zhao、Zhepeng Cen、Akshara Prabhakar、Jielin Qiu、Jianguo Zhang 等(含 Silvio Savarese、Huan Wang)
备注:本文属纯企业研究院工作,提出一套「训练前先诊断、再局部训练」的范式,把多轮工具调用里的信用分配问题拆成可计算的三闸门 + 嵌套采样。
一、背景与问题:多轮工具调用的信用分配难题
1.1 多轮工具调用是什么
现代智能体常需多轮(multi-turn)工具调用:面对一个任务,模型不是一步给出答案,而是连续做决策——调哪个工具、传什么参数、读返回结果、再决定下一步。典型场景是函数调用(function calling):一个需要查天气的助手,可能先发现「天气工具当前不可用」,于是先问用户补充信息或暂存意图,等工具上线后再发出真正的调用。
这类任务的一个反直觉事实是:整条轨迹的成败,往往取决于「某一个」模型调用。然而轨迹级(trajectory-level)奖励只告诉你「最后成了还是败了」,并不告诉你「中间哪一次决策才值得拿去训练」。
1.2 奖励有差异 ≠ 该调用值得训练
论文点破一个关键误区:即使某个候选调用在多次 rollout 里奖励有高有低(mixed reward),也不能直接推出「改这个调用的动作就能提升表现」。
原因在后面的核心定理。打个比方:你在考试里某一题忽对忽错,但「忽对忽错」可能是因为你这一题本身写得好坏在变,也可能只是因为后面两题的运气在变——如果真正决定总分的是后面的运气,那么苦练这一题毫无用处。多轮工具调用里,奖励依赖后续交互,于是「奖励的方差」把「动作本身的差异」和「后续交互的随机性」混在了一起。
真正该问的问题是:改变当前这个动作,会不会改变它的期望奖励? 只有会,这个调用才「可训练」。
1.3 为什么不能「整条轨迹都训」或「固定角色都训」
- 整轨迹训练(trajectory-level):给每个 turn 都更新梯度,把大量算力浪费在「无论怎么训都没信号的无关 turn」上,还容易引入来自兄弟结果的噪声。
- 固定角色局部 RL(fixed-role local RL):永远选同一个角色(例如「永远训练决策步」或「永远训练恢复步」)。但论文的四格实验证明——哪个 turn 值得训,取决于具体任务与模型,固定规则在一个类别上有效、在另一个类别上反而有害。
1.4 与同日 FLARE 的映照
同日另一篇精读(FLARE,arXiv:2609.23808,北大+南大+北邮+独立研究者)在长程 SWE 轨迹上用生成式奖励模型做实时诊断与稠密奖励。Critical-State RL 则从多轮工具调用切入同一大主题「过程监督与信用分配」:FLARE 回答「长程轨迹上何时干预、如何给稠密奖励」,本文回答「多轮交互里该对哪一调用下梯度」。两篇互补,见本文第六部分与 FLARE 第六部分互相引用。
二、相关工作:状态选择与信用分配
2.1 局部训练的状态选择
- PivotRL(Yi et al., 2026,arXiv:2603.21383):复用 SFT 轨迹,在冻结参考策略下给状态做 profile,保留「低均值 + 非零验证器方差」的状态做 GRPO。其验证器奖励「局部可接受动作」而非严格匹配演示。
- Critical Step Optimization(CSO)(Li et al., 2026,ACL Findings):在失败策略轨迹里用过程奖励模型找候选步,通过策略延续验证专家提出的替代步,再在步级偏好对上训练。
- Karino et al. 的 critical states(2020,arXiv:2008.11332):用「动作期望回报的方差」识别关键状态,偏向利用——这是本文「动作依赖方差」原则的早期来源(详见第六部分)。
Critical-State RL 的不同:从任务定义的候选模型调用 + 局部标签出发,分离「动作依赖方差」与「后续噪声」来选一个调用做局部 RL。
2.2 轮级奖励与信用分配
- MT-GRPO 用每轮奖励;过程监督方法给中间步打分。
- GiGPO 把反复出现的环境状态分组,估计步级相对优势。
- 其他方法重分配回报、以未来事件或反事实为条件做信用分配(如 TCPO、hindsight 对比)。
- ArCHer / AgentPRM / SWEET-RL 学价值或奖励模型;TRACE 推导工具边界的时序差分奖励;CAST 从博弈求解器得轮优势;CrEST 结合轮级验证优势与 token 级调制。
- Executed-replay auditing(Zhang, 2026)通过重采样动作并继续执行的「重放审计」估计策略条件步贡献;LOTAPO 用固定占位符替换某轮及其检索观测来估计其效应。
2.3 状态选择之后的训练目标
- RLSTA 用锚定在「模型全信息单轮似然」上的奖励训最后一轮;Critical-State RL 诊断的是「训哪个调用」。
- 选中之后怎么训:SFT 学目标动作、DPO 学偏好对、拒绝采样微调学候选批里最高奖励样本——这些是「选中后怎么训」,本文的 targeted-SFT 对比评估的正是这一后选择阶段。
三、核心方法:训练前三闸门诊断
Critical-State RL 先选要训哪个模型调用,再用局部奖励更新那个调用。一个具体的模型调用叫 occurrence(发生),它的局部奖励叫 occurrence-local label(发生局部标签)。被选中的 occurrence 才是训练单元,周围调用只提供上下文或奖励,不拿梯度。
3.1 候选阶段与关键状态
一个候选阶段(candidate phase)把「有共同任务结构」的上下文归一组,例如「某个必需工具尚不可用」。当该阶段在每个保留的 occurrence 上满足三个条件时,才对一个模型与任务配置构成关键状态(critical state):
(i) 动作充分性(action-sufficiency):局部标签 $z$ 在给定 $(x_i, z_i)$ 时与终端回报 $R$ 条件独立,即标签真正「中介了动作与基准回报的关系」。用任务结构提供阶段、标签与充分性论证。
(ii) 提升空间(headroom):存在某个动作的标签均值超过参考策略均值:
$$\max_a Q(x,a) - \mathbb{E}_{a\sim\pi_0}Q(x,a) \ge \Delta_{\text{head}} > 0$$即「相对参考策略,还有可改进的余地」。
(iii) 可训练性(trainability):在基策略下,动作条件的标签均值有差异:
$$\operatorname{Var}_{a\sim\pi_\theta(\cdot\mid x)} Q(x,a) > 0$$即「换动作真的会改变期望标签」。
一个混合奖励的组并不蕴含可训练性。DAPO 式动态采样(见第六部分)过滤掉「全对或全错」的组,反映的是 $\operatorname{Var}(z\mid x)>0$ 的组样本层面;但即使奖励边缘分布与提升空间完全相同,不同动作信号也可能被掩盖(论文图 3 给出反例:两组都有 Bernoulli(1/2) 标签、1/2 提升空间,但动作依赖方差分别为 1/4 与 1/8,排名完全相反)。
3.2 具体反例:干净拒绝、混合奖励
在 no-think Gemma 的 miss_func 试点里,一个采样出「混合奖励」的 prompt 组暴露了这个区别:每一次保留的 rollout 中,决策回复都是「干净拒绝、不调用工具」,但奖励在 0↔1 之间摆动,组内 std 0.477。一个混合结果过滤器会保留这个组,尽管它的奖励差异根本区分不了被观测到的决策行为——这正是需要嵌套方差分解的原因。
四、嵌套同前缀采样:分离动作依赖方差与后续噪声
4.1 全方差定律的拆解
按标准全方差定律:
$$\operatorname{Var}(z\mid x) = \underbrace{\operatorname{Var}_a Q(x,a)}_{\text{动作依赖}} + \underbrace{\mathbb{E}_a\operatorname{Var}(z\mid x,a)}_{\text{后续噪声}}$$其中 $Q(x,a)=\mathbb{E}[z\mid x,a]$ 是给定上下文与动作的条件标签均值。左侧是「组里的总方差」,右侧第一项是「换动作带来的期望标签差异」,第二项是「固定动作后,后续 continuation 的随机性」。
4.2 嵌套同前缀采样(nested within-prefix sampling)
不更新模型参数,在模型自己的 rollout 分布上做嵌套采样:
- 采样一个策略前缀(prefix);
- 在该固定前缀上抽取候选动作;
- 固定每个动作,再重采样其「仅奖励的延续(reward-only continuation)」。
于是动作均值与「动作内变异」被分离——前者是信号,后者是后续噪声。附录 B 推导了有限样本修正并给出排名误差上界。
为什么不能直接用「真实 teacher-forced 前缀」或「跨模型生成前缀的原始标签」?前者会在候选 occurrence 处饱和动作分布,掩盖恢复步的可训练性;后者把「动作变异」和「上游随机性」混在一起。因此要先筛动作充分性与提升空间,再在同一标签下对合格 occurrence 按 $\arg\max_t \operatorname{Var}_a\mathbb{E}[z\mid x_t,a_t]$ 排名。
4.3 理论支撑:动作依赖方差主导局部改进潜力
命题 1(延续噪声与 occurrence 梯度):固定基线 $b$,有 $\mathbb{E}[g(z-b)]=\mathbb{E}_p[g(Q-q)]=\mu$,且 $\operatorname{Var}(g(z-b)) = \operatorname{Var}_p(g(Q-b)) + \mathbb{E}_p[\|g\|^2\operatorname{Var}(z\mid x,a)]$。因此 $V_{\text{act}}=0 \Rightarrow \mu=0$,即便采样标签在变。
定理 1(固定 KL 预算下的局部改进):在固定前缀与延续核下,当动作依赖方差 $V_{\text{act}}>0$ 时,最优无约束局部标签增益 $G_x(\epsilon)=\sqrt{2\epsilon V_{\text{act}}}+O(\epsilon)$;当 $V_{\text{act}}=0$ 时,任意预算下增益都为 0。换句话说——在 leading order,能否通过局部训练取得改进,由「动作依赖方差」决定,而非由总奖励方差决定。这正解释了为什么「混合奖励」不一定值得训。
五、occurrence-local RL:只对关键调用做局部训练
5.1 核心操作
occurrence-local RL 把损失只施加在每个训练单元里被选中的那一个模型调用上。它用两种形式为选中调用提供上下文:
- 作为预计算 prompt(无环境循环),例如记忆应用与 no-think Gemma 的 miss_func 恢复训练;
- 作为一条轨迹,其下游「无梯度」的 turn 提供后果信号,例如 Nemotron 的 miss_func 决策训练。
选中的调用生成 token 上才施加 RL 损失;它的前缀提供上下文,任何延续提供奖励但不拿梯度。
5.2 算法流程(诊断 → 训练)
- 筛候选:从任务结构评估动作充分性,并对每个候选 occurrence 检查参考策略提升空间。
- 分离信号与噪声:从基策略采样前缀与动作,固定每个动作重采样「仅奖励延续」,估计动作均值与延续方差,做有限样本修正估计动作依赖方差。
- 选 occurrence:对每个候选,跨采样前缀取修正估计均值;在共同标签下通过闸门者中,选均值最大者。
- 局部训练:用局部标签优化策略,损失只施加在选中调用的生成 token 上。
5.3 任务特定的局部奖励构造
任务结构提供诊断与训练用的局部奖励,把「对当前动作的检查」与「对下游行为或保留信息的打分」结合:
- 缺失函数交互(Nemotron):乘式奖励 $z_{\text{tool}} = \text{no\_write}(a_{\text{dec}}) \times \text{consequence}(y_{\text{rec}})$。门 $\text{no\_write}\in\{0,1\}$ 在决策不写状态时为 1;$\text{consequence}\in[0,1]$ 给恢复是否含必需工具调用打分。采样的恢复提供奖励但不拿梯度。
- 记忆存储:加式奖励,对正确操作顺序与「答案关键信息」的保留给分,对无效动作设硬门;用一个预计算关键词代理(GPT-4o 提取的 2–5 个必需词,包括对「not married」中 not 这类有意义否定的识别)给存储文本打分。
六、WebSearch 交叉验证:多轮 RL 中的信用分配
本文身处「信用分配 + 局部状态选择」研究簇。检索确认下列工作的方法相似与结论相近。
6.1 基于方差的状态选择(variance-based state selection)
- Karino et al., Identifying Critical States by the Action-Based Variance of Expected Return(2020,arXiv:2008.11332):用「Q 函数对动作的方差」识别关键状态,并在这些状态上高概率利用。本文明确承认沿用这一「条件均值方差」原则,但在基策略下用嵌套固定前缀采样估计 occurrence-local 标签均值来选调用。
- PivotRL(arXiv:2603.21383):用「低均值 + 非零验证器方差」筛 pivot 做 GRPO。其定理 3.2 也把 GRPO 信号与奖励标准差联系起来。
方法相似:都用「方差」做状态/调用的可训练性筛选,都想避开「全对/全错无梯度」的 turn。结论相近:集中在高信息量的局部状态比整轨迹训练更高效。差异:PivotRL 的「方差」来自对演示的参考策略 profile、用验证器奖励且相对演示做功能等价;Critical-State RL 的「动作依赖方差」来自嵌套同前缀采样,且额外施加动作充分性 + 提升空间两道闸门,理论更强地绑定到「局部标签改进潜力」。
6.2 DAPO 式动态采样过滤
- DAPO(ByteDance, 2025,arXiv:2503.14476):Decoupled Clip + Dynamic Sampling Policy Optimization。其 Dynamic Sampling 过滤掉组内正确率全为 1 或全为 0 的 prompt,保留有效梯度的样本,提升效率与稳定。
方法相似:Critical-State RL 在文中直接用 DAPO 风格动态采样作对照,指出「混合结果组(组样本层面 $\operatorname{Var}(z\mid x)>0$)」只是 DAPO 过滤的反映,不等于动作可训练。结论相近:都主张丢弃无梯度信号组。差异:DAPO 在 prompt 组层面过滤;Critical-State RL 进一步在固定前缀、固定动作下拆出「动作依赖方差 vs 后续噪声」,因为同边缘分布下动作信号可能截然不同(见第三部分的图 3 反例)。
6.3 过程奖励 / 信用分配的其他近邻
- AgentPRM(arXiv:2511.08325):智能体步级过程奖励,用 TD+GAE 估计进展——与本文「局部标签 + 条件均值」同属智能体信用分配,但 AgentPRM 是训一个 PRM 做评分,本文是「训练前免训练的诊断 + occurrence-local RL」。
- Math-Shepherd / OmegaPRM(arXiv:2312.08935、arXiv:2406.06592):数学推理的自动过程监督,提供「步级监督有效」的方法论先例(详见 FLARE 第六部分)。
- CodeTracer(arXiv:2604.11641):长程智能体失败归因与重放恢复,与 FLARE 的 RADAR 目的一致。
与同日 FLARE(arXiv:2609.23808)的关系:FLARE 用生成式奖励模型给长程 SWE 轨迹做实时步级诊断,并把诊断用于推理时断点再生 + 训练时 SFT/RL 稠密奖励;Critical-State RL 用免训练诊断选出多轮工具调用里值得下梯度的那一调用,做 occurrence-local RL。两者都主张「精细信用分配 > 整轨迹稀疏奖励」,但一个偏向「生成式诊断 + 全生命周期闭环」,一个偏向「方差拆解 + 局部训练单元」。
七、实验结果与跨设置应用
7.1 BFCL 四格研究(occurrence 选择)
在 BFCL v4 multi_turn(base / miss_func / long_context / miss_param)上,用冻结的 no-think Gemma-4-26B-A4B rollout。诊断在训练前把 miss_func → 恢复步(recovery)、miss_param → 决策步(decision)。随后固定这两个赋值,在每类里分别训 decision 与 recovery,形成四格。
| 单元与诊断赋值 | 修正动作方差 | BFCL 准确率(起→训) | Δ |
|---|---|---|---|
| miss_func / recovery(选中) | 0.0267 | 0.14 → 0.283 ± 0.015 | +14.3pp |
| miss_func / decision(替代) | 0.0103 | 0.14 → 0.095 | −4.5pp |
| miss_param / decision(选中) | 0.0361 | 0.435 → 0.473 ± 0.010 | +3.8pp |
| miss_param / recovery(替代) | 0.0000 | 0.435 → 0.445 | +1pp |
核心发现:
- 选中 occurrence 的动作方差估计更高,与诊断一致。
- miss_func 上恢复步训练 +14.3pp,决策步训练反而 −4.5pp;miss_param 上决策步 +3.8pp,恢复步仅 +1pp。错位训练会掉点。
- 选择规则对比:always-decision 与 always-recovery 两种固定规则各在一个类别有效、另一个持平或更差;诊断在两者中都选对了提升的 turn。
- 迁移到新桥接语:把评测里的标准桥接换成不点名任何工具的未见措辞(「I adjusted things on my end.」),seed-123 step-30 检查点下准确率从 0.095 升到 0.225(+13.0pp),与标准桥接的 0.140→0.270 增益相当——说明增益不依赖训练时桥接措辞。
- 对照实验:Monte-Carlo 返回到步(RTG,全多轮训练)gym 验证 0.997 但 BFCL 仅 0.45,低于 Critical-State RL 的 0.473;targeted-SFT 在 miss_func/recovery 上比 base 还低约 6pp(过偏于发工具、破坏了必需的拒绝),而 Critical-State RL 同时保住两种行为;turn-mask 控制(full/recovery/random/decision 都改 mask)无法单独复现 occurrence-local RL 增益——说明增益来自「选对调用 + 局部训练」,不是单纯改 mask。
7.2 跨设置应用
保持「occurrence-local 训练单元 + 三闸门」,适配训练位置与标签,覆盖三种标签来源:
- 重复调用避免(日志交互轨迹):Nemotron-Super-120B 在 30% 标记步上重复一个非错误的历史调用;用确定性的
repeat_of_history标签(仅依赖当前动作,故无下游采样项)。Critical-State RL 把「与 GPT-4.1 的调用-答案一致性」从 37% 提到约 75%(三种子 72–78%)。 - Nemotron 缺失函数应用:必需工具被暂扣、下一轮重新引入;决策 occurrence 拿全部梯度,no-write 门给动作打分,后果来自采样的「仅奖励恢复」。配对的 miss_func 增益 +4.4pt(注意:Gemma 在同设置选的是恢复 occurrence,说明训练位置因模型与推理配置而异)。
- 记忆管理(xLAM 与 Gemma):xLAM 下,add 因内存满失败时,元数据选「失败后的存储回复」训练(需先删安全条目再加新条目),加式行为-内容奖励;BFCL v4 agentic/memory 子任务均值从 34.54% 升到 50.54%。Gemma 扩展到存储与检索两类 occurrence,记忆子任务均值从 38.1% 升到 52.7%。
八、贡献、局限与展望
8.1 主要贡献
- 免训练的诊断选调用:训练前分离「动作依赖奖励方差」与「后续噪声」;理论把该信号与「小 KL 预算下无约束局部标签改进潜力」绑定,并给出有限样本选择误差上界。
- 诊断引导的局部训练:四格研究对比选中与替代 turn,并把配方跨设置应用(重复调用、Nemotron、记忆),给出「小局部更新改善全 rollout 回报」的充分条件(命题 5)。
- 强调「先诊断、后训练」:可训练的调用依赖任务与模型配置——四格研究跨类别选不同 turn,Gemma 试点显示 miss_func 可因模型/推理配置从 decision 变 recovery,因此新方法意味着重新评估候选调用,而非复用固定训练 turn。
8.2 局限
- 四格研究测的是类别化 turn 选择,而非校准方差幅度或诊断阈值。
- 重复调用、Nemotron、记忆是应用而非对诊断或设计选择的配对测试。
- 四格、Nemotron 缺失函数、记忆设置均为 K=1;日志重复调用训练用标记位置的单步样本。
- 递归与漂移结果是有条件的(附录 E.1、E.2)。
8.3 展望与关联
Critical-State RL 把「多轮工具调用里的信用分配」落成一套可计算、免训练的诊断流程,与同日 FLARE(长程 SWE 轨迹的生成式诊断 + 全生命周期闭环)共同勾勒出 2026 年过程监督研究的一条主线:与其在稀疏的终端奖励上盲目训练整条轨迹,不如先精细诊断「哪里值得训、怎么给稠密信号」。未来值得探索二者结合——用 FLARE 式生成诊断产出 occurrence-local 标签,再用 Critical-State RL 式方差诊断决定把梯度下在哪一调用。
一句话总结:Critical-State RL 用「动作充分性 + 提升空间 + 可训练性」三闸门与嵌套同前缀采样,把「奖励在抖」拆成「动作本身值得训」与「后续运气在抖」,只对真正可训练的模型调用做局部 RL——在 BFCL 上把缺失函数恢复率拉高 14.3pp,而错位训练反而会掉 4.5pp。