Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents —— 精读

论文链接:https://arxiv.org/abs/2608.13179

发表时间:2026 年 8 月(arXiv:2608.13179v1,2026-08-13 提交)

发表机构:浙江大学、上海创新研究院、蚂蚁集团 Inclusion AI AWorld 团队、西湖大学、南京大学——五机构"企业 + 高校"合作;共同一作王泽川(浙大)、卢思远(浙大 / 上海创新研究院 / 西湖大学),主要工作完成于两人在蚂蚁集团的实习期间

领域标签:Agent 后训练、强化学习(RLVR)、功劳分配(Credit Assignment)、多轮工具调用


一、论文背景

1.1 Agent RL 后训练是什么

让大语言模型从"会聊天"进化成"会干活"的 Agent,业界主流路径是可验证奖励的强化学习(RL with Verifiable Rewards,RLVR):先让模型与环境交互生成完整轨迹,再由一个验证器按规则打分(比如"这一轮的工具调用后,环境最终状态是否与人工标注的目标状态一致"),用这个奖励信号做策略梯度更新。这套范式的好处是性能上界由奖励质量决定——论文称之为 verifier-bounded ceiling(验证器约束的性能天花板):只要验证器是可靠的,模型理论上能逼近验证器所能确认的最好水平,不会像模仿学习那样被教师的能力锁死。

如今典型的 Agent 场景是多轮多步(multi-turn multi-step):一个会话由多轮用户请求组成,每一轮又需要一串"行动—观察"步骤才能完成。比如用户先问"帮我查下周五北京到纽约的航班",接着追问"把最早那班改成靠窗座位",这是两轮请求,每轮内部都要经历多次工具调用。

1.2 轨迹级奖励的功劳分配困境:“一步错,全盘输”

标准 RLVR 有个结构性缺陷:它只给整条轨迹打一个分,然后把这个分数像广播一样平均分给轨迹上的每一个 token。这在单轮场景里只是"有噪声";但在多轮场景里就是"系统性错误"——因为各轮结果是独立的,奖励却是共享的。

举个例子:一个两轮会话,第一轮成功了,第二轮失败了,整条轨迹奖励为 0。轨迹级 RL 会把"这是个差轨迹"的信号均匀广播到所有 token——于是第一轮里那些正确的决策也被打了负分,模型在被错误地惩罚好行为。反过来,一条"失败轮碰巧混在成功轨迹里"的轨迹会把错误决策一并强化。论文用**功劳分配(credit assignment)**来描述这个问题的本质:轨迹得了个总分,到底哪些动作该记功、哪些该记过?在 WildToolBench 上,57 个 LLM 没有一个 session 准确率超过 15%,且性能随轮数急剧退化——功劳分配失败正是长会话崩盘的核心原因之一。

1.3 自蒸馏路线 OPD / OPSD 及其上界问题

另一条路线是在策略蒸馏(on-policy distillation):不再用稀疏的轨迹奖励,而是让一个教师模型对学生轨迹上的每个 token 给出密集的概率评分(反向 KL 散度),天然实现了 token 级功劳分配。但它有两个变体、两个坑:

  • OPD(外部教师版):需要同家族、同 tokenizer、同训练配方的教师模型。这个约束在现实中极难满足——论文中为了让 OPD 跑起来,4B 学生得配 235B-A22B 的巨型教师,单是部署教师就要额外 8 张 GPU。
  • OPSD(自蒸馏版):去掉外部教师,让学生自己看到"特权信息"(ground truth)后充当自己的教师。这解决了匹配问题,但论文指出两个致命伤:其一,性能上界是教师约束的(teacher-bounded)——学生无法超越"看到答案后的自己"那个分布的水平;其二,梯度会向极少数 token 崩塌式集中,此前的公开研究发现没有逐 token KL 裁剪时,OPSD 会在约 100 步内训崩。论文的实测更极端:直接搬到多轮工具调用上,约 20 步就崩。

于是核心矛盾浮现:RL 方向可靠但信号稀疏,蒸馏信号密集但方向不可靠。能不能两全?这就是论文要回答的中心问题。

二、论文定位和关联工作

把这条研究谱系拉直了看,每个工作都在"功劳分配的粒度"上往前挪一步:

方法轮级分配(哪一轮的功过)token 级分配(轮内哪个 token 重要)上界由谁决定
GRPO无(轨迹级广播)无(所有 token 同一优势)verifier
MT-GRPO有,但采用折扣累计方式,把未来结果折给前面的轮无(轮内 token 仍同权)verifier
EnvTuning部分(细粒度过程奖励,但仍聚合为单轨迹优势)无verifier
OPD无有(外部教师逐 token 反向 KL)教师(teacher-bounded)
OPSD无有(自教师 + 特权信息)教师,且梯度易集中崩塌
CREST(本文)有,且每轮独立计算(只看本轮奖励)有(自教师调制幅值,熵门聚焦)verifier(方向门保证)

几点定位说明:

  • 相对 GRPO:CREST 保留了 GRPO 的组相对优势骨架和 verifier 上界,只是把"一条轨迹一个分"改成"一轮一个分",再在轮内做 token 加权。论文强调 CREST 相对标准 GRPO 只引入一个新超参 λ。
  • 相对 MT-GRPO:MT-GRPO 虽按轮(agent step)算优势,但用折扣把后续轮的结果也折进前面轮的优势里(累计式);CREST 则每轮只看本轮奖励(独立式),失败轮拿到负优势不受其他轮成功的影响。且 MT-GRPO 轮内 token 仍无差别。
  • 相对 OPD/OPSD:两者占据的设计空间是"教师信号直接当优势用",方向和幅值都由教师定,因此上界被教师锁死;CREST 把教师降级为幅值调制器,方向完全交给 verifier。
  • 相对同期混合方法(SDAR、RLSD):论文在相关工作中说明,这些方法要么缺乏对梯度集中的原则性控制,要么没有针对多轮场景特有的轮间功劳分配结构。CREST 的差异化在于给出了完整的形式化保证(方向保持、扰动上界、符号一致放大三条性质)。

一句话定位:CREST = GRPO 的轮级分割(拿方向)+ OPSD 的自教师信号(只拿幅值)+ 两道门(方向门、熵门)做安全约束。

三、问题定义

3.1 抽象表述

论文把多轮多步 Agent 训练中的功劳分配问题拆成两个正交子问题:

  1. 方向子问题:对每个 token 而言,这一步该奖还是罚(优势的符号)?——粗粒度问题,本质上要先回答"这一轮干得好不好"。
  2. 幅值子问题:在方向确定后,轮内各个 token 的更新强度该差多少(优势的大小)?——细粒度问题,要区分"关键决策 token"和"格式填充 token"。

这两级分别对应"轮间“和”轮内“两个层次:轮间的问题是轨迹混合了成功轮和失败轮,平均化会互相稀释;轮内的问题是同一条轮里,真正的高价值决策 token 和低熵的格式 token(括号、引号、工具名模板)被同等对待。

3.2 形式化

CREST 的统一目标仍是标准策略梯度,核心在每 token 优势的结构化分解:

$$A_t = \underbrace{A^{turn}_{[t]}}_{\text{轮级:哪一轮?}} \times \underbrace{\phi_t}_{\text{token 级:哪个 token?}}$$
  • $A^{turn}_{[t]}$:轮级验证奖励优势,决定 token $t$ 所在轮的功过方向;
  • $\phi_t \in [1, 1+\lambda\epsilon]$:幅值调制因子,由自教师信号经门控后得到,只能放大、不能翻转方向。

这个因式分解本身就是问题定义的答案雏形:方向 × 幅值两个正交维度,分别由两个信任级别不同的来源负责——方向交给可靠的 verifier,幅值借力信号密集但不完全可靠的教师。

四、问题解法

4.1 轮级方向:verifier 组相对优势

CREST 对轨迹里的每一轮独立打分:轮 $k$ 从环境验证器拿到自己的奖励 $R_k$,然后在 GRPO 式的 rollout 组(组大小 G=16)内做组相对归一化:

$$A^{(i)}_k = \frac{R^{(i)}_k - \text{mean}(\{R^{(j)}_k\})}{\text{std}(\{R^{(j)}_k\}) + \epsilon}$$

同一轮内的所有 token 共享 $A^{(i)}_k$。这样,一条轨迹里失败的那轮无论其他轮多成功,都会拿到负优势——轮间稀释问题被结构性消除。(一个前提:组内各 rollout 的轮次语义对齐,即第 k 轮在组内都对应同一个用户请求;这在 BFCL/WildToolBench 这类固定会话结构的基准上成立,但论文也明说该假设不直接推广到变轮数、只有终端奖励、轮间强耦合无局部验证的场景。)

4.2 token 级幅值:自教师散度

轮内细化用一个特权自教师(privileged self-teacher):把同一个学生模型条件在 ground-truth 上下文上(即让它"看到答案"再重走学生轨迹),对每个 token 计算师生对数概率差:

$$\Delta_t = \frac{\log \pi_T(y_t \mid h^T_t) - \log \pi_\theta(y_t \mid h_t)}{\tau}$$

直觉是:看到答案后教师更倾向的 token($\Delta_t$ 大),说明它"更接近正确做法”,值得加大更新。原始偏好转成有界权重 $w_t = \text{clip}(\exp(\text{sign}(A^{turn}_{[t]}) \cdot \Delta_t), 1-\epsilon, 1+\epsilon)$,注意指数里乘了轮级优势的符号——教师信号必须顺着 verifier 的方向起作用。

4.3 两道门:方向门与熵门

不加约束的教师信号会重蹈 OPSD 梯度集中崩塌的覆辙,CREST 用两个门控制"用在哪、用多强":

  • 方向门(direction gate):$g^{dir}_t = \mathbb{1}[\text{sign}(A^{turn}_{[t]}) \cdot \Delta_t > 0]$。教师与 verifier 方向不一致时,教师信号被完全屏蔽。这是保证性能上界留在 verifier 而非教师的关键机制——教师永远没有机会把某个 token 的更新方向掰反。
  • 熵门(entropy gate):以学生自身的 surprisal(惊讶度) $u_t = -\log \pi_\theta(y_t \mid h_t)$ 作为 token 重要性的轻量代理,经 Z-score 归一化 + sigmoid 映射到 [0,1],再线性拉伸到 $[1-\rho, 1+\rho]$($\rho=0.5$)。低熵的格式 token 调制强度打折,高不确定性的内容 token(如 get_flight、"JFK" 这类函数名和实体)加强。注意熵门只重新分配梯度预算、不把任何 token 清零。

两门复合成有效调制强度 $\lambda^{eff}_t = \text{clip}(\lambda \cdot g^{dir}_t \cdot m^{ent}_t, 0, \lambda)$,最终:

$$\phi_t = 1 + \lambda^{eff}_t (w_t - 1) \in [1, 1+\lambda\epsilon]$$

附录 A 证明了三条形式性质:P1 方向保持($\phi_t$ 恒正,故 $\text{sign}(A_t) = \text{sign}(A^{turn}_{[t]})$ 永远成立);P2 扰动有界(教师引起的单 token 梯度扰动不超过 $\lambda\epsilon \approx 8.4\%$,默认 λ=0.3、ε=0.28);P3 符号一致放大(方向门开启时 $\phi_t \geq 1$,教师只能沿 verifier 认可的方向放大,不能削弱)。论文还特别诚实地注明:这是 token 级局部保证,聚合梯度方向、驻点、全局上界并不因此完全由 verifier 决定,token 间梯度的相互抵消仍可能改变聚合行为。

4.4 一个类比:方向 vs 幅值,就像梯度方向 vs 学习率

理解这套设计最直观的方式是类比优化器。深度学习里我们早已习惯把"往哪走"(梯度方向)和"走多快"(学习率/自适应缩放)分开管理——Adam 对每个参数配自适应学习率,但从不改变梯度符号。CREST 做的事一模一样,只是把这套自适应预条件从参数级搬到了 token 级(附录 A.4 的原话就是 “token-level adaptive preconditioning”):

维度优化器视角CREST 视角
方向(谁该奖谁该罚)梯度方向,神圣不可侵犯verifier 奖励的轮级优势符号
幅值(更新多强)Adam 的逐参数自适应学习率教师-学生散度 × 熵门调制
保护方向的机制不动符号,只缩放方向门硬性屏蔽反向教师信号
上界来源损失函数定义的最优verifier 定义的天花板

超参也继承了这种极简:唯一需要调的只有 λ(教师影响强度),τ=2.0、ε=0.28、ρ=0.5 全部是跨所有实验固定的设计常数。

五、评估指标与实验证据

5.1 评估体系:每个指标在量什么

  • BFCL V3 多轮赛道(伯克利函数调用排行榜):固定 100 个训练 ID、400 个评测样本,分四个子集——Base(标准多轮)、Miss Func(故意藏掉一个该用的函数,考模型能否发现"无解"并正确说明)、Miss Param(藏掉必要参数,考追问或拒绝)、Long Context(超长上下文多轮,考长轨迹下的稳定性)。Average 为四子集均值。奖励按"执行后环境状态是否匹配逐轮人工标注的目标执行"判定,含只读工具的结果覆盖检查。
  • WildToolBench:256 个真实感更强的多轮会话(含代词指代、省略、任务切换、闲聊穿插),128 个训练、其余评测。Task Acc. 量任务级动作与参数正确性,Session Acc. 量整条会话全对——最严苛的端到端指标,只要一轮错就归零,对轮间功劳分配最敏感。
  • 基座模型:Qwen3-4B-Instruct(指令模型)与 Qwen3-8B(思考模型);所有方法共用同一 rollout 基础设施、组大小 G=16、学习率调度。评测用温度 1e-6 三次解码测解码一致性。

5.2 主结果:4B / 8B 完整对比

BFCL V3 多轮 + WildToolBench(%)——Qwen3-4B-Instruct:

方法BFCL AverageBaseMiss FuncMiss ParamLong CtxtWT TaskWT Session
基座(不训练)22.1226.521.015.525.537.893.13
+ GRPO43.6353.542.531.547.040.234.69
+ MT-GRPO49.2563.046.035.053.043.366.25
+ EnvTuning47.2560.047.032.050.044.924.69
+ OPD44.5052.043.038.045.042.586.25
+ OPSD38.7546.041.026.042.038.884.69
+ CREST52.00 (+29.88)67.048.038.060.048.447.03

Qwen3-8B:

方法BFCL AverageBaseMiss FuncMiss ParamLong CtxtWT TaskWT Session
基座33.3841.538.527.026.543.754.69
+ GRPO43.2553.046.036.038.045.435.47
+ MT-GRPO44.0057.045.036.038.049.617.03
+ EnvTuning46.0054.045.040.045.049.027.81
+ OPD44.7550.052.039.038.045.253.91
+ OPSD41.7548.043.039.037.043.953.91
+ CREST50.00 (+16.62)60.051.042.047.052.349.38

关键读数:CREST 在两个规模、两个基准共 14 个单元格中拿到 13 项最佳或并列最佳(唯一旁落的是 8B Miss Func,OPD 以 52.0 险胜 51.0);4B 上相对最强 RL 基线 MT-GRPO 净赚 +2.75,相对 GRPO 净赚 +8.37;8B 上 50.00 vs EnvTuning 46.00。值得注意的反直觉现象:OPSD 拿着"看过答案的教师"却在 4B 上只有 38.75、低于 GRPO——教师约束上界的直接实证。训练动态上,CREST 约 20 步即超越 OPSD 平台期并收敛到约 0.70 训练准确率,GRPO 到 160 步才爬到约 0.57,OPSD 则停在约 0.49 后下滑。

5.3 消融:两级功劳分配缺一不可

BFCL V3(Qwen3-4B)上的层级消融:

变体Average增量来源
GRPO 基线43.63—
仅轮级(inter-turn only)47.88Base +8.5,跨轮稀释最严重处受益最大
仅 token 级(intra-turn only)48.75Miss Func +7.5,区分内容/格式 token 最关键处受益最大
两者合用(CREST)52.00长上下文协同最强(47.0 → 60.0)

门控消融同样支撑设计:去掉方向门掉到 46.75(Miss Param 从 38.0 掉到 28.0,教师会在模糊参数 token 上越权覆盖 verifier);去掉熵门掉到 46.25(Long Context 从 60.0 崩到 49.0,长序列放大格式 token 的梯度集中);两门全去掉 43.50,直接跌回 GRPO 水平——不受控的自蒸馏相对标准 RL 没有任何好处。λ 敏感性分析显示 λ=0.3 最优(训练准确率约 0.69),λ=0(无教师)约 0.63,λ=0.5 过度集中反而只剩约 0.61——校准的选择性放大,而非最大化的集中,才是正解。

5.4 梯度分布分析:集中度的"金发姑娘区间"

论文用"top-p% token 占总梯度的份额"量化梯度集中度:OPSD 极端集中,top-1% token 就吃掉约 42% 梯度、top-5% 占约 77%——信号被少数 token 劫持,训练失稳;GRPO 最平均(top-10% 仅约 31%),但等于放弃 token 区分;CREST 居中:top-10% 约 57%,比 GRPO 集中(说明教师信号确实提供了有意义的 token 区分),又远不及 OPSD 极端(说明熵门有效阻止了崩塌)。

六、效果优势的根源解释

把因果链完整捋一遍,CREST 的优势不是黑魔法,而是三个机制各自堵住一条失败路径:

路径一:GRPO 的轨迹广播 → 失败轮 token 被错误强化。 GRPO 把一个 0/1 轨迹奖励均摊给所有 token,多轮会话中"成功轮 + 失败轮"的组合必然产生符号错标。CREST 的轮级独立优势从结构上保证每个 token 的正负号来自它所在轮的真实结果——符号对了,这是后面一切的前提。这解释了为什么"仅轮级"消融就有 +4.25,以及为什么对轮数敏感的指标(Session Acc.、Long Context)增益最大:轮数越多,轨迹广播的错标率越高,轮分割的纠错价值越大。Session Acc. 尤其受益——它是"全对才算对"的严格指标,任何一个失败轮被错误强化都会在长会话里累积放大错误率,CREST 恰好在"哪轮该罚"这个层面精确止血。

路径二:OPSD 的双重死穴 → 教师上界 + 梯度集中。 OPSD 把教师信号当优势本身用,方向和幅值都由教师定。上界方面,学生被锁死在"看过答案的自己"的水平之下(附录 C.2 的三种教师更新策略实验:在线教师 20 步崩、固定教师停在 0.44-0.48 平台、EMA 教师退化成学生的滞后副本——三条路都到不了更高处)。集中方面,top-5% token 占 77% 梯度意味着更新被几个极端 token 支配。

路径三:CREST 的对症下药。 轮分割负责正确正负号;熵门把梯度预算从低熵格式 token 搬到高不确定性内容 token,让梯度分布落在集中度的"金发姑娘区间"(top-10% ≈ 57%);方向门则保证教师只能在 verifier 认可的方向上放大、且单 token 扰动不超过 8.4%——上界因此留在 verifier 一侧。训练曲线上 CREST 约 20 步就冲破 OPSD 的教师平台期,正是"幅值解耦于教师方向"的直接证据。

为什么 4B 增益(+29.88 相对基座、+8.37 相对 GRPO)大于 8B(+16.62)?一个合理的读法是:越小的模型,基座越弱、轮间混淆和 token 无差别更新的伤害越大,CREST 精细功劳分配可挽回的空间也越大;8B 作为思考模型基座已强(33.38),剩余空间被压缩。

七、必要知识反推

要读懂并复现这篇论文,需要三层前置知识:

领域层(Agent 与训练范式)

  • RLVR / GRPO:什么是可验证奖励、组相对策略优化(组内均值-标准差归一化算优势)的运作方式。不熟 GRPO 就无法理解 CREST 是"站在 GRPO 骨架上的最小改动"。
  • 多轮工具调用基准:BFCL V3 的多轮评测协议(逐轮环境状态比对)、WildToolBench 的路径匹配奖励,以及 Miss Func/Miss Param 这类"考失败处理"的子集设计。
  • 在策略蒸馏(OPD/OPSD):反向 KL、教师-学生 token 概率差、以及"特权信息条件化"(把 ground truth 塞进上下文构造自教师)这一构造。

方法论层(策略梯度 + 蒸馏的数学)

  • 策略梯度 $\nabla J = \mathbb{E}[\sum_t A_t \nabla \log \pi(y_t)]$ 中优势系数如何逐 token 缩放梯度贡献——这是理解"幅值调制不改方向"的载体。
  • 裁剪、温度、Z-score 归一化、sigmoid 映射等一连串把无界信号压进有界区间的工程手法(式 4-10 全是这类操作的组合)。
  • 读懂附录 A 三条性质的证明所需的梯度范数与三角不等式基础。

工程层

  • 单机 8×H200 的训练配置、SGLang 部署教师(4 卡教师 + 4 卡学生训练与 rollout)、组大小 16、批 32×16=512 rollout/步、lr 1e-6 恒定、PPO 裁剪 0.2/0.28、无显式 KL 惩罚——复现的最低配置清单。
  • OPSD 稳定化细节:固定教师 + 逐 token KL 裁剪(阈值 0.2)才能让基线不至于 20 步崩掉,保证对比公平。

融合节点:这篇论文真正值得收进工具箱的思想只有一个——方向与幅值的解耦(“teach the magnitude, not the direction”)。它同时统一了两条看似竞争的训练路线(RL 给方向、蒸馏给幅值),并用门控机制解决混合时的信任与稳定问题。这个解耦视角可以作为理解后续所有 “RL + 蒸馏混合” 工作的坐标系。

八、通用性灵感

跳出工具调用训练,这篇文章有五条可迁移的思想:

  1. 把"功劳分配"显式分解为方向 × 幅值两个正交子问题。 遇到任何"总分如何分给局部决策"的问题——代码评审得分如何分到每一行、多阶段 pipeline 的转化率如何归因到每个环节、推荐系统的长期留存如何归因到每次曝光——先问:符号(谁该奖谁该罚)和强度(差多少)能不能拆开、分别用不同可靠性的信号源处理?论文证据:正是这个分解让 CREST 同时拿到 verifier 的可靠方向和教师的密集幅值。推广场景:多阶段系统归因分析、团队绩效分解、流水线优化。

  2. 不完全可信的信息源,降级为"调制器"而非"决策者"。 教师信号再密集,也不能让它定方向——用一道硬门(方向一致才放行)把它限制在"顺着可信方向放大"的角色上,并给扰动一个显式上界(λε ≈ 8.4%)。这是"如何安全使用不可靠信号"的通用范式。推广场景:人机协同决策(AI 建议只调节置信度不翻转决策权)、多源数据融合中低可信源的受限加权、RAG 中低质量检索结果的保守使用。

  3. 熵 / surprisal 是现成的"不确定性聚焦"信号。 模型自己输出的惊讶度(-log π)零成本可得,却能区分"格式 token"与"内容 token"。凡是需要判断"这个位置的信息量值不值得多花预算"的场合——数据标注优先级、编辑距离加权、课程学习难度排序——surprisal 都是一个轻量候选代理。论文证据:熵门让去掉熵门的 46.25 回到 52.00(Long Context 从 49.0 回到 60.0),λ 调到 0.5 反而退化到约 0.61,说明校准的选择性放大优于最大化的集中。

  4. 性能上界跟着"谁定方向"走,而不是"谁提供信号"。 这是对混合系统的一个深刻观察:决定天花板的是方向控制权,不是信息量。OPD/OPSD 信号再密集,方向交给教师,上界就是教师;CREST 信号同样密集,但方向归 verifier,上界就是 verifier。推广场景:人机协作系统的能力上限由"最终拍板者"决定;蒸馏 + RL 的任何混合设计都应先问"方向权在谁手里"。

  5. 层级问题要层级解,且要验证两级的互补性。 论文用"单用轮级 47.88 / 单用 token 级 48.75 / 合用 52.00"的消融证明两级各自堵住不同的失败模式、缺一不可——这种"分解-单独验证-组合验证"的实验设计本身就是方法论范本,适用于任何声称"多组件协同"的系统设计。

九、结语

CREST 的贡献可以浓缩成一句话:教师不必决定方向也能发挥作用——把自教师限制在幅值调制上、用学生不确定性门控,就能在保住 verifier 上界的同时解锁密集的 token 级功劳分配。 在多轮工具调用这个功劳分配最难啃的场景里,它用 GRPO 之上仅一个新超参的代价,换来了 4B 模型 +29.88、8B 模型 +16.62 的平均准确率提升,并在最考验轮间分配的 Session 级和长上下文指标上增益最大。它也留下了诚实的边界:评测限于两个基准与 4B/8B 规模,surprisal 作为 token 重要性代理仍是启发式,轮次语义对齐假设限制了向变轮数场景的直接推广。

本文基于论文全文逐页阅读撰写。