题目区
本篇是四篇论文的合读(quartet 模式),主题是 agentic RL 的信用分配(credit assignment):
- My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning(arXiv:2610.01161,代码:GitHub)——阿里巴巴 + 京都大学 + NII LLMC + 北京大学 + UCLA + ASU + 港中深 + 清华 + 国科大的大联盟,第一作者在阿里巴巴 AI Data 实习期间完成,企业-高校合作产出。
- SHARPO: Segment-Level Credit Assignment for Agentic Reinforcement Learning(arXiv:2610.00838,代码未见)——LinkedIn Corporation + Georgia Tech,第一作者在 LinkedIn 实习期间完成,短小精悍的 9 页正文 + 4 页附录。
- T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning(arXiv:2610.00388,代码未见)——南京大学(新颖软件技术全国重点实验室)+ 字节跳动,第一作者在字节实习,企业与高校联合指导。
- DARS: Dependency-Aware Reward Shaping for Agentic Reinforcement Learning(arXiv:2610.01207,代码:GitHub)——UIUC + 新加坡国立 + 浙江大学 + 罗切斯特大学,纯高校联盟,三位共同一作。
四篇都发布于 2026 年 9 月 30 日至 10 月 2 日,共同回答一个问题:当智能体 RL 的终端奖励只告诉一条轨迹「成了/没成」,训练信号该怎么落到每一步上? 它们给出四条互补的路线:FAULT 走结构化自诊断 + 结果定价,SHARPO 走段级 hindsight 重加权,T2SPO 走免训练表格模型进度估计,DARS 走谓词依赖图势函数塑形。四条路线的底色是同一句话:过程信号必须可信——要么锚定在终端结果上,要么可验证,要么免学习,否则就会重蹈「学习型过程奖励被策略 hack」的覆辙。
一、论文背景:终端奖励的两个盲区
1.1 什么是信用分配问题
Agentic RL 是什么。 大语言模型智能体通过多轮交互解决任务:在 ALFWorld 里做家务(找到莴苣、洗干净、放进边桌)、在 WebShop 里按需求购物(「8 盎司无香型润肤露,10 美元以下」)、在搜索 QA 里多跳检索证据后作答。训练方式通常是强化学习:智能体跑完一整条轨迹,环境在终点给一个奖励——任务成功得 1(或 10),失败得 0。这条路从 DeepSeekMath 提出的 GRPO(Group Relative Policy Optimization)开始主流化:同一个任务采样一组(比如 8 条)轨迹,组内归一化终端奖励得到每条轨迹的优势(advantage),再把这个优势广播给轨迹内所有 token——不需要训练一个价值网络(crit),工程上极其省心。
信用分配(credit assignment)是 RL 的经典难题,Minsky 1961 年就提出了:当奖励延迟到达时,如何把功劳/责任分配给序列中的每个决策?对 LLM 智能体这个问题格外尖锐,FAULT 的开篇给了两个精确的病灶:
- 盲区一:同结果组零信号。 GRPO 的优势靠组内奖励归一化。如果一组 8 条轨迹全失败(或全成功),奖励全相同,减去组均值后优势恰好为零——整组 rollout 白跑,哪怕 8 条失败的方式截然不同(有的差一步、有的南辕北辙)。FAULT 在 ALFWorld 的初步实验里测出:这种同结果组占训练组的 59–64%,训练后期还会涨到约 75%。也就是说,GRPO 系下六成算力产生的梯度信号为零。
- 盲区二:轨迹级信号定位不了错误。 即便组内有成功有失败,失败轨迹的每一步都继承同一个负优势。SHARPO 的例子很形象:购物智能体搜到了合适商品,却在选规格时选错——整条轨迹得负分后,有用的搜索和无误的选择一起挨罚。步数上限越长(ALFWorld 30 步、WebShop 15 步、搜索 QA 仅 4 步),这个问题越严重。
1.2 已有过程信号为什么不让人放心
给中间步骤加分段奖励并不是新想法,但现有的几条路都有各自的坑:
- 学习型过程奖励模型(PRM):用模型给每步打分。FAULT 引用 DeepSeek-R1 的判断——神经过程奖励本身会被策略 exploit;更早的实践显示进一步优化 agent PRM 反而会降低真实成功率。信号本身是学出来的,策略可以学着骗它。
- GiGPO 的锚态比较:识别不同轨迹中重复出现的环境状态,在同一状态上比较不同动作的后续回报,得到步级优势——不需要学习模型,是当前最强的免 critic 步级方案。但 FAULT 的命题 2 证明:全失败组里所有回报都是零,锚态组内对比也归零;而且它的信用来自时间折扣回报,错误步之后的「错误后缀」会分摊惩罚(FAULT 实测 GiGPO 的最大惩罚步通常落在裁判判定步之后好几步)。DARS 补刀:GiGPO 的折扣由「还剩几轮」决定,而不是由「这一步建立了哪个子目标、后续哪些决策依赖它」决定。另外 T2SPO 指出 GiGPO 依赖状态复现——ALFWorld 的状态会重复出现,WebShop 的状态几乎不复现,所以 GiGPO 在 WebShop 上优势骤减。
- 自然语言反思(Reflexion 一族):让 LLM 事后分析轨迹哪里错了。信息丰富,但是描述性的——错误主张不校验、严重程度不上量化、更不能直接变成步级优势。FAULT 引 TRAIL 基准:最好的模型在 agent 轨迹上「识别+定位」错误的联合准确率只有约 11%。文本分析离 RL 可用的数值信号之间隔着三道沟:可验证性、可量化性、可优化性。
四篇论文就是从这三道沟的不同的岸边出发的:FAULT 把语言诊断结构化+校验+定价,SHARPO 把 hindsight 信息压缩成有界权重,T2SPO 把历史成功经验变成免训练的进度回归,DARS 把任务结构显式建成依赖图。共同点是一律保留终端结果作为唯一可信的监督源,过程信号只做「再分配/重加权/塑形」,绝不喧宾夺主。
二、论文定位与关联工作
把四篇放进研究脉络图:
GRPO (DeepSeekMath, 2024) ──组归一化终端奖励──> 同结果组零信号、轨迹级广播
│
├─ GiGPO (2025) ──锚态重复状态比较──> 全失败组仍归零;依赖状态复现
├─ ARPO/AEPO (2026) ──熵引导分支采样──> 不确定性≠重要性
├─ PRM/Math-Shepherd (2024-25) ──学习型步级奖励──> 可被 hack
└─ Reflexion/SEED (2023-26) ──语言反思/技能蒸馏──> 不校验、不定量、不进 RL 信用
│
┌───────────┼───────────────┬─────────────────┐
v v v v
FAULT SHARPO T2SPO DARS
自诊断+定价 段级hindsight TabPFN进度估计 依赖图势函数
(2610.01161) (2610.00838) (2610.00388) (2610.01207)
信号覆盖率95% +14.32 ALFWorld WebShop +12.7 1.5B +10.0 ALFWorld
各自的直接对手与差异化:
- FAULT 对标 GRPO/GiGPO(原始与诊断 SFT 初始化两版)和 SEED(教师 hindsight 技能 SFT + 在策略蒸馏,ALFWorld/WebShop 上此前最强)。它明确指出自己填补的是 SEED 一族的三个缺口:分析文本不设 RL 信用、错误主张不校验、权重不随结果学习。它的姊妹对照系是 TRAIL(错误定位基准)——FAULT 的自诊断定位质量正是在 TRAIL 式的盲评下验证的。
- SHARPO 的对手是同属「自蒸馏增量」的 RLSD(token 级自散度重加权)、SDAR(token 级门控辅助蒸馏损失)、GRPO+OPSD、StepOPSD(动作中心 span 内 token 级权重)。差异化一句话:别人在 token 粒度上做,它在「交互段」(interaction segment,一次完整动作或一段思考)粒度上聚合后再定权重——一个段的正负证据被联合考虑,权重反映教师对该完整决策的整体支持度。同期还有 AgentOPSD(整轮反馈+检索技能)与 TRIAGE(角色类型段),SHARPO 用「独立打分的环境段 + 同组成功同伴」区别于两者。
- T2SPO 的参照系是 PPO/RLOO/GRPO/GiGPO(沿用 GiGPO 论文的公开数字),概念上的近亲是 V0/V0.5——同样用「语义表示 + TabPFN 条件预测」,但 V0 预测初始状态成功概率用于分配 rollout 预算,T2SPO 预测中间状态的剩余距离并取相邻差作为步级信用。它的独特卖点:编码器和 TabPFN 全程冻结、零梯度更新、只靠上下文刷新——历史经验进入「上下文」而非「参数」。
- DARS 与 GiGPO/ARPO/AEPO 的关系是组合而非替代:它只替换步通道的奖励序列,不动 rollout 策略与优化器,因此在 GiGPO、AEPO、token 级接口上即插即用。它与 SPA-RL(步级进展归因)、Cheng et al. 2026(访问状态图归因)等「超越时间位置的信用」工作是同路人,差异在于 DARS 建的是任务谓词图而非轨迹图,信用是标注事件经过图势函数确定性算出的——可审计、可离线重算。这一点与其同期三篇构成 2026 年秋「过程信号可信化」的四重奏:结构化标注(FAULT/DARS)、hindsight(SHARPO)、进度估计(T2SPO)。
三、问题定义:从「一条轨迹一个分」到「每步一个可信的分」
剥掉四篇的具体机制,它们解的是同一个抽象问题:
给定仅可验证的终端结果 $R^{out}$(唯一可信的监督源)与一批完整轨迹 $\{\tau_i\}$,构造步级信号 $\tilde{r}_t$(或步级优势修正),使其满足:
- 结果锚定:过程信号的强度/符号最终由终端结果校准,不引入第二个可被 hack 的学习型奖励;
- 定位性:信号能区分同一轨迹内「建立进展的步」「引入错误的步」「错误后依赖性的浪费」「与错误无关的独立进展」;
- 覆盖性:在终端奖励无信息的情况下(全成功/全失败组)仍能产生组内对比信号;
- 有界性:过程修正不颠覆终端结果的排序(成功轨迹的总回报仍高于失败轨迹);
- 低成本:不训练额外的价值/奖励模型,或只用轻量组件。
四篇对这个抽象骨架做了不同维度的实例化,对偶如下:
| 抽象要求 | FAULT | SHARPO | T2SPO | DARS |
|---|---|---|---|---|
| 过程信号来源 | 自诊断器的结构化错误记录 | 成功同伴条件下的师生 log-prob 差 | 历史成功轨迹的「剩余步数」标签 | 标注器的谓词验证/失效/修复事件 |
| 结果锚定方式 | 条件似然回归从终端结果学错误类价格 | 权重只调制 GRPO 结果优势,不改符号 | 标签来自真实成功轨迹的观测长度 | 势函数差叠加进步通道,episode 通道保留 |
| 定位粒度 | 被引证的具体步骤 | 交互段(action/thinking span) | 相邻状态的势能差 | 谓词图上的图距离衰减 |
| 覆盖性来源 | 同结果组内诊断不同→预算不同 | 只需同组有一条成功轨迹(要求混合组) | 无需组内对比,历史上下文即可 | 无需组内对比,失败轨迹也有谓词事件 |
| 有界性保证 | 命题 1:预算封顶 $\eta\Delta R$ 保序 | 权重 clip 在 $[1-\alpha,1+\alpha]$,保优势符号 | asinh+RMS 归一化 + clip + 门控 | $\kappa$ 截断 + 望远镜求和性质 |
| 额外组件 | 策略自诊断(共享权重) | 教师副本(定期刷新冻结) | 冻结编码器 + 冻结 TabPFN | LLM 标注器(可蒸馏到 8B) |
| 主要适用场景 | 长程任务、全失败组多 | 混合组、多步协同任务 | 奖励稀疏、状态难复现 | 谓词/先决关系可显式化的任务 |
一个关键的观察:这四个实例化恰好覆盖了「过程信号从哪里来」的四种互补的来源——模型自己说(FAULT)、同伴对照(SHARPO)、历史统计(T2SPO)、任务结构(DARS)。没有一条单独占优,第四、五部分的实验将展示它们各自的甜区。
四、问题解法:四条路线的机制设计
4.1 FAULT:自诊断、定价、守恒再分配
FAULT(Self-Diagnosis-guided Terminal Credit Redistribution)的核心思想是把错误定位与错误定价分离:自诊断负责「哪里错了、错在哪一步」,终端结果负责「这类错误多致命」。它分两个阶段:
阶段一:诊断冷启动。 用 GPT-5.6 Sol 教师读初始策略的 2,880 条 ALFWorld 轨迹,对每个错误记录「错误类标签 + 步骤号 + 该步原文的逐字引文」。然后做证据校验:引文必须与被引步骤的文本逐字(区分大小写)匹配,不匹配直接剔除——冷启动 14,484 条错误主张里 95.4% 通过校验,被拒的每一条都败在引文检查。通过的错误聚合成冻结的两层分类表(8 个 L1 家族、25 个 L2 机制,ALFWorld 取 K=20 个定价类)。再用校验后的诊断做诊断 SFT:让策略模型自己学会输出同样格式的结构化诊断。此后教师退役。
阶段二:自演化 RL。 每个 batch 走四步循环:
- 自诊断:actor 用 rollout 温度对每条完成的轨迹采样 M=3 份诊断(JSON:错误类+步骤+引文),每条都要过证据校验;多数诊断须正确报告轨迹成败才让该轨迹进定价(防止诊断器瞎报)。值得注意的是成功轨迹也诊断——审计发现 61.85% 的成功轨迹(8,719/14,097)含有可罚的过程错误(成功不等于过程完美)。
- 定价(terminal-anchored error pricing):这是 FAULT 最有辨识度的部件。把「哪些轨迹成功」建模为条件的 logistic 模型——固定每组成功数,条件似然恰好消掉任务难度截距,只剩共享的错误类系数 $\beta_k$(「控制其他错误率不变,错误 k 的发生率每高一分,成功概率的对数几率降多少」)。负系数变成非负价格 $w_k$。冷启动拟合带 Firth 小样本校正 + 收缩,RL 期间每 10 个 update 在滑动窗口(50 updates)上重拟合一次,符号门控 EMA 平滑(旧值 0.7 新值 0.3)。这个设计把「错误的严重程度」锚在唯一可信的东西上——终端结果,而不是让 LLM 自己拍脑袋打 severity 分。
- 守恒再分配:轨迹的错误率向量加权求和得分数 $S\in[0,1]$,乘以强度 $\lambda_u$(warm-up + 余弦退火,最终 update 归零)得总预算 $P=\min(\lambda_u S,\ \eta\Delta R)$——封顶在成败奖励差的 90% 之下,保证成功轨迹的回合分仍严格高于失败轨迹(命题 1 的阶序保持)。预算按各步骤被引证错误的价格占比分配到具体步骤:$\delta_t = P\cdot h_t/\sum_r h_r$,被引证的错误步骤拿惩罚,没被引证的步骤分文不动,总额始终守恒。首个被引证步骤获 1.5 倍权重(错误往往有级联,源头最重要)。
- 双通道优势:步惩罚 $\delta_t$ 局部扣除后进入 GiGPO 式双通道——episode 通道在任务组内中心化 $R^{out}-\delta_t$,step 通道在锚态组内中心化折扣回报减惩罚——最后合成策略梯度。防 hack 设计:诊断器与 actor 共享权重,但诊断 token 不收策略梯度——策略无法通过「少报错误」来避罚,因为报错的能力是在 SFT 目标下学的,不在 RL 目标下。
三重共演化闭环:actor 进化 → 诊断随权重进化 → 价格随新 batch 的结果在线重拟合 → 新价格驱动下一轮惩罚。
4.2 SHARPO:成功同伴作教师,段级重加权
SHARPO(Segment-level Hindsight Advantage Reweighting for Policy Optimization)的切入点最小巧:同一 GRPO 组里不是常常恰好有一条成功轨迹吗?把它当作教师的特权上下文。五步流程:
- 识别交互段:轨迹里的
<action>...</action>或<thinking>...</thinking>连续片段,每条轨迹选 $K_i$ 个不相交的非空段。 - 构造教师上下文:组内选一条成功 rollout,把它的全部 agent 回复按交互顺序拼成参考文本 $h_i$,组内所有低分轨迹共享这条参考。
- 段级评分:教师是策略自身的副本(参数在每次刷新时从学生拷贝、冻结到下次刷新)。教师在「原上下文 + 参考文本」条件下给学生的每个采样段打 log-prob,与学生在原上下文下的 log-prob 求长度归一化差:$\Delta_{i,k}$。正的差 = 见过正确答案的教师比学生更支持这个段。
- 有界权重:$\Delta$ 经 sigmoid 映射并 clip 到 $[1-\alpha, 1+\alpha]$($\alpha=0.2$),配合长度均衡因子 $\rho$(防长段垄断系数总量),得到段的乘子 $g = 1+\lambda(\rho w -1)$,插值调制 GRPO 基础优势:$\tilde{A}_{i,k} = g_{i,k} A_i$。
- 策略更新:用段级优势替轨迹优势进原目标,clip 与 KL 正则不变。
理论保障(命题 1)是全文的定海神针:在理想成功条件参考 $q^\star(a|c)=\Pr_\pi(a|c,R{=}1)$ 下,贝叶斯法则给出 $q^\star/\pi = Q^\pi(c,a)/V^\pi(c)$——即师生对数差的符号恰好等于段局部价值 $D^\pi = Q^\pi - V^\pi$ 的符号;且 hindsight 修正项不恶化「优势与局部价值冲突」的上界($[-\tilde{A}^\star D]^+ \le [-BD]^+$)。翻译成人话:失败轨迹里有用的段($D>0$)惩罚被减弱,有害的段($D<0$)惩罚被加重,且数学上保证不会帮倒忙。需要注意边界:SHARPO 依赖组内存在成功轨迹,全失败组无参考可用——这正是 FAULT 主攻的场景,两篇恰好互补。
4.3 T2SPO:TabPFN 当免训练 critic
T2SPO(Trajectory-to-Step Policy Optimization)回答的问题是:不训练任何价值模型,历史轨迹能不能给当前 rollout 提供步级反馈? 它的答案是拿表格基础模型 TabPFN 当「上下文学习型回归器」:
- 监督信号构造(trajectory-to-step):一条成功轨迹的每个状态天然带标签——沿它自己的成功续路还剩几步:$y_{j,t} = T_j - t$。这是「成功条件下的剩余距离」的免费代理,不需要任何人工标注或额外模型。失败轨迹不提供距离(失败增强变体给它们贴 rollout 上限 H 作启发标签,效果好坏参半)。
- 状态表示:冻结的 Qwen3-Embedding-0.6B 编码「指令+当前观察+选中历史」,拼接步数与采样轮次特征,标准化后做截断 SVD 降维(ALFWorld 64 维/WebShop 32 维)。特征变换在支撑集上拟合、参考与查询共享。当前动作、未来观察、结局一律排除——防泄漏。
- 冻结 TabPFN 预测:TabPFN V2 回归器以 256 个历史「状态-标签」对为上下文,给当前 rollout 的每个状态预测剩余距离 $\hat d_t$(clip 到 $[0, D_{max}]$)。编码器与回归器全程零梯度。关键纪律:先打分后入库——当前 batch 的所有查询在 $C_n$ 上评分,只有评分完成后其结局才能进入 $C_{n+1}$,轨迹永远不会用自己的结局评自己。
- 势能差→步级信用:$\Phi = -\hat d$ 作势函数,相邻状态的势能差 $F_t = \hat d_t - \gamma\hat d_{t+1}$(势函数塑形的标准形式,Ng et al. 1999)就是这一步的辅助信用:预测剩余距离缩短→正信用。成功终止的后继势能置零;失败终止不给过程信用(防止「快点结束失败」骗奖励)。再经 asinh 压缩 + batch 内 RMS 归一化 + clip(±5) + 支持度门控(支撑不足时关闭),乘权重 $w_n$(burn-in 后爬坡到 0.10),直接加到 GRPO 结果优势上:$\hat A^{T2SPO}_{i,t} = \hat A^{base}_{i,t} + p_{i,t}$。同样的信用也可以加进 PPO 的环境奖励走 GAE(actor-critic 扩展)。
- 上下文刷新:新轨迹完成并评分后,其成功状态(每轮至多 64 个)进入容量 256 的池,老样本逐出,下个 batch 换上下文——经验进上下文,不进参数。
离线验证了估计器本身的质量:在 1,951 个 WebShop 成功状态上,上下文从 256 加到 512 让 MAE 从 0.82 降到 0.65(-20.9%),最低 0.5948(512 上下文+SVD64);同上下文、同特征、同查询下,TabPFN 比最优 kNN 的 MAE 低 13.5%–35.1%——回归能力不是靠检索最近邻糊弄的。
4.4 DARS:把任务画成依赖图,奖励是势函数差
DARS(Dependency-Aware Reward Shaping)的出发点是一个所有步级方法都忽略的语义事实:建立在未修复错误之上的后续工作是浪费,而与错误无关的分支工作仍然有效。GRPO 广播同一个 0,GiGPO 按时间位置衰减,都不区分这两者。DARS 把任务完成条件显式表示为谓词 + 先决关系的依赖图:
- 依赖图:WebShop 的购物需求「8 盎司无香型润肤露 10 美元以下」拆成谓词:产品类型 $c_1$(润肤露)、尺寸 $c_2$(8oz)、香型 $c_3$(无香)、价格 $c_4$(≤$10),边 $c_1\to c_2, c_1\to c_3$(尺寸和香型以选对产品为前提),$c_4$ 独立。ALFWorld 是每物一条链 locate→pick→treat→place;搜索 QA 是 hop:1→hop:2→…→answer;数学是 step:1→…→answer。
- 三类事件:标注器(LLM,一次调用读完整轨迹)对每步报告每个受影响谓词的事件集合 $E_i(t)\subseteq\{V,B,P\}$——验证(该步建立了谓词)、失效(该步破坏了它)、修复(解除失效;注意修复本身不重新建立谓词,必须伴随新的验证才恢复信用)。标注器只输出结构化 JSON,从不输出数字——奖励数值完全由确定性规则计算,这带来后文的可审计性。
- 图状态与依赖衰减:每个谓词维护持久状态(已验证/已破坏/未建立)。衰减权重:谓词到最近的未修复破坏祖先的图距离为 $d$ 时权重 $w = e^{-\lambda d}$,无破坏祖先则为 1(默认 $\lambda=1$)。这个设计同时实现三个语义:错误后的依赖工作被衰减(浪费)、独立分支不受影响(有效)、修复后恢复(救回)。
- 势函数与步奖励:$\Phi_G(t) = \frac{1}{M}\sum_i S_i(t) w_i(t)$,步奖励 = 势函数带符号差 $\tilde r_t = \rho\cdot clip(\Phi_G(t)-\Phi_G(t-1), -\kappa, \kappa)$(默认 $\kappa=0.3$)。论文开头的示意例子里,选错规格的步 5 让 $\Phi$ 从 0.75 跌到 0.34($\tilde r_5=-0.41$),重选润肤露的修复步 7 拿 +0.57。
- 即插即用:只替换步通道的奖励序列,episode 通道、锚态分组、优化器全保留——GiGPO、ARPO/AEPO、token 级接口(无锚态比较的学习器)都能直接挂。标注器可蒸馏:从 DeepSeek-V4-Flash 蒸馏的 Qwen3-8B 标注器以 r=0.81 复现教师步级信用(教师自一致性 0.86),端到端成功率 92.2% vs 教师的 89.1%——差异在解码噪声内,DARS 不依赖前沿 API。
五、评估指标与实验证据:数字在证明什么
四篇的主战场高度重叠(ALFWorld/WebShop),正好构成横向可比的证据网。逐篇看实验设计如何支撑各自的主张:
5.1 FAULT:先证「信号变多了、变准了」,再证「性能变好了」
FAULT 的证据链分三层,层次感是四篇中最好的:
第一层:信号覆盖率(对应盲区一)。 从同一诊断 SFT 检查点出发,在 ALFWorld 上测量「信用差超过混合组均值 5% 的组」占比:GRPO 41.4%、GiGPO 72.5%、FAULT 95.1%。机制解释(附录命题 2):GRPO 同结果组减均值后严格归零;GiGPO 的折扣能区分全成功组里「离成功还剩几步」不同的轨迹(约用上 75% 全成功组)但全失败组回报全零、彻底没辙;FAULT 的诊断惩罚在两类同结果组里都制造对比(全失败组 100% 覆盖、全成功组 90%)。信号留存指数(对比度加权和)FAULT 0.821 vs 两基线约 0.42——翻倍的可用训练信号。
第二层:定位准确性(对应盲区二)。 盲评协议:独立裁判 LLM(Qwen3.8-Max)只看动作与反馈文本(不知方法名与惩罚值),在 300 条失败轨迹里标出「纠正哪一步最可能翻盘」的决定性步骤;各方法按自己给的惩罚给步骤排序,算决定性步骤的 MRR。FAULT 0.494 vs GiGPO 0.303 vs 随机 0.266——FAULT 的最重惩罚步与裁判步骤恰好重合的 82/300,GiGPO 只有 21/300 且中位偏移 +5 步(时间折扣信用散在错误后缀上)。集中度:FAULT 的归一化信用熵 0.29 vs GiGPO 0.72、GRPO 0.91;28% 的被罚轨迹把全部惩罚压在一步上。一个精彩的旁证:对「格式合法的无效动作」(no-op,不被任何机械标志捕获),FAULT 分配 3.67 倍均匀份额的负信用,GRPO/GiGPO 只有 0.48/0.57 倍——诊断信用确实捕捉到了规则之外的行为学浪费。
第三层:端到端性能。 Qwen3-4B:ALFWorld 91.0%(GRPO 49.3 / GiGPO 73.9 / SEED 84.3);WebShop score 88.5(SEED 86.2);搜索 QA avg 43.8(SEED 44.4,短程任务让步 0.6)。1.7B:ALFWorld 68.7、WebShop 87.5,同样全面领先。三个精妙的设计让数字更可信:
- 冷启动/RL 解耦对照:GRPO/GiGPO 也从 FAULT 的诊断 SFT 检查点出发(diag-SFT 版)——GiGPO(diag-SFT) 在 ALFWorld 涨到 80.6,但仍比 FAULT 低 10.4 点;说明收益不止来自初始化。
- 增益随步数上限单调:对 GRPO/GiGPO 原始初始化的领先幅度按 ALFWorld(30 步)→WebShop(15 步)→搜索 QA(4 步) 递减(17.1–41.7 → 8.7–21.0 → 3.0–5.1 点);对 GiGPO(diag-SFT) 同样 10.4→5.0→−2.7。「步级信用在长程任务价值最大」的机制预测与数据完全一致——4 步任务里终端奖励本来就离错误步不远。
- 消融:去在线定价 89.6、常数 λ 79.1、冻结裁判 82.8、广播式诊断惩罚 77.6 vs 完整 91.0——三个组件(定价/调度/共享诊断器)各有贡献。
5.2 SHARPO:同骨干同预算的干净对照 + 对方差的控制
SHARPO 用 Qwen2.5-7B-Instruct 在 ALFWorld/WebShop 上与五个基线全共享骨干/提示/环境/奖励/优化器/rollout 设置,200 步训练、128 held-out 任务、三次独立运行取均值±标准差:
- 主表:ALFWorld SHARPO(λ=0.05) 84.90±1.19 vs GRPO 70.57±7.83(+14.32);WebShop 75.26±1.19 vs 66.15(+9.11)。比次优的 StepOPSD 高 6.77(ALFWorld)/5.99–7.55(WebShop)。GRPO+OPSD(蒸馏损失直接加)只有 +2.34,RLSD +3.39,SDAR 反而 −3.39——把同样的自蒸馏信息做成「段级优势乘子」远比做成「辅助损失」或「token 级重加权」有效。
- 稳健性:λ 相差四倍(0.2 vs 0.05)均值只差 0.52/0.26 点;标准差从 GRPO 的 7.83 收到 1.19——不只均值高,波动也小。
- 机制预测的落点:增益集中在需要多步协同的任务——Pick2(双物体)+7.02/+10.10、Cool +6.89、Heat +6.67(λ=0.05 对最强基线)。这类任务「失败轨迹里有用动作+局部错误并存」最典型,正是段级信用该起作用的地方。WebShop task score 0.8822 vs StepOPSD 0.8231——买了更多符合要求的属性,不只是成功率。
5.3 T2SPO:WebShop 大增益与「甜区自证」
Qwen2.5-1.5B/7B,150 updates,三种子:
- WebShop(15 步,状态难复现):1.5B score 88.5±0.3 vs GRPO 75.8(+12.7)、成功率 73.7 vs 56.8(+16.9);7B +6.1/+9.7。WebShop 全面超过 GiGPO(score 88.5 vs 83.1;85.4 vs 84.4)。
- ALFWorld(30 步,状态复现容易):+1.9/+6.0 超 GRPO 但低于 GiGPO(74.7 vs 86.7;83.6 vs 90.8)。
- 这个不对称恰好是论文机制的自我验证:GiGPO 的步级优势靠锚态(重复状态)对比——ALFWorld 里 agent 反复回到同一位置,锚态组丰富,GiGPO 吃满红利;WebShop 的浏览状态几乎不复现,GiGPO 退化为 GRPO。T2SPO 不依赖状态复现(特征空间近邻即可),所以在 GiGPO 的盲区反超。四篇合读的启示:没有普适最优的信用分配器,只有与任务结构匹配的信用分配器。
- 成本:状态估计占步时 21.06%(80.08s/380.21s),上下文准备 0.075%——TabPFN 免训练换来的是工程上可接受的恒定开销。
- 附带一个诚实的负结果:失败增强上下文(25% 失败样本贴 H 标签)效果不稳定——7B ALFWorld +5.7 但两个 WebShop 设定都降,「失败该标多远」仍无好答案。
5.4 DARS:预算匹配对照 + 全谱系任务 + 可审计性
DARS 的实验设计有三处值得单独点名:
- 预算匹配的公平对照:主表的 GiGPO 参照是自己用 DARS 脚本/超参/评估 harness 同预算复训的(发表版 GiGPO 只训 150 步),配上解码级配对检验。ALFWorld 1.5B 500 步:DARS 96.9±0.0 vs 同预算 GiGPO 86.9±0.8(+10.0,p=0.001,4/4 draws 全胜);7B 98.6 vs 98.1(+0.5,基准饱和)。Search-R1 held-out 41.6% vs 39.5%(+2.1);WebShop 7B 从 GiGPO 父策略续训 success 88.5/task score 94.6(父策略 +4.2/+1.5,12/12 draws)。跨 5 个任务族(ALFWorld/WebShop/Search-R1/带 Python 的 AIME/无工具推理)单一奖励接口全部正向——其中 AEPO+DARS 的 AIME24/25 best 67.5%(初始 57.9,+9.6,同期 AEPO 只 +5.4)。
- 消融钉死每个组件的因果:去步级信用(同标注坍缩为轨迹标量)58.23→56.90(1.7B 数学);去依赖衰减(λ=0)ALFWorld 92.0→86.0、98.6→95.2(p<0.001, 15/15);图拓扑换成时间序链(让错误按「顺序」而非「依赖」传染后续)WebShop 掉 14.2 点 success/18.4 task score——离线普查显示四分之一的受影响轨迹损失过半信用,「错误只应传染依赖它的东西」是实打实的性能来源。更早的图无关消融极具警示性:首错前缀信用(给首错前的步骤发奖励)在 ALFWorld(链式目标)+3.2,但在 WebShop −42 task score(光浏览不下单也拿分)、在 Search-R1 崩到 0% 成功率(96% 轨迹永不作答狂刷检索分)——前缀不是任务需求的模型,谓词图才是。
- 行为级证据:配对 episode 中 DARS 的错物拾取 1 次 vs GiGPO 10 次(vs GRPO 12 次);350 个 held-out 搜索问题上 DARS 每题必先搜索,GiGPO 有 31% 不搜就答。标注质量单独审计:54 条人工复核 63% 全对/22% 小错/15% 大错;测试-重测一致性 κ=0.84(验证事件);蒸馏 8B 标注器追平 API。每步奖励是标注的确定性函数——同一批标注可以在不同规则下离线重放重算(λ 扫描就是这么做的),这种可审计性在四篇中独一份。
六、效果优势的根源解释:为什么「可信化的过程信号」赢
四篇的增益都不能用「加了过程奖励所以好」来敷衍——直接加过程奖励的对照(SHARPO 的 GRPO+OPSD、DARS 的图无关前缀奖励、FAULT 的广播式诊断惩罚)全都显著更差甚至崩坏。根源在机制层。
FAULT:覆盖率的算术 + 定位的力学。 因果链可以逐步核验:同结果组占 59–64% 且 GRPO 在其中梯度为零 → 诊断让同结果组内产生预算差(全失败组 100% 覆盖)→ 可用信号从 41% 到 95% 近乎翻倍 → 更多组产生有效梯度。定位侧:广播式惩罚变体(77.6%)与 FAULT(91.0%)的差距说明惩罚必须落在被引证的步骤上——广播让好步骤陪绑,梯度信噪比反而恶化;守恒再分配保证「罚多重的错」不改变「总分谁高谁低」(命题 1 的 $(1-\eta)\Delta R$ 下界),所以过程信号不可能翻转终端结果的语义。在线定价的必要性有独立证据:冷启动时「搜索状态遗忘症」的价格为零(初始系数为正 +0.18),却在线第一次重拟合就成为最负的类(update 30 时出现于 70% 轨迹)——策略进化会改变错误的代价结构,价格必须跟着结果在线重学;到 update 160,初始定价为零的类占到已部署类权重的 68%。
SHARPO:特权信息的最小可信使用。 为什么段级乘子比 token 级(RLSD/StepOPSD)好?回到命题 1:理想参考下信号符号=段局部价值符号——这个对齐是段级别的语义(一个决策帮没帮忙),token 级的 log-prob 差会把「同一决策内的措辞偏好」也当成信用来源,注入与任务无关的噪声。乘子设计还保证 $\tilde A$ 永远与 $A$ 同号——hindsight 只调节强度、永不翻转方向,终端结果的符号权威不被挑战,这是它不会被 hack 的结构性原因。Pick2/Heat/Cool 的最大增益与「多步协同、失败轨迹内好坏混杂」的任务画像精确匹配,是机制预测的直接落点。
T2SPO:把「见过多少类似状态的成功」变成连续信号。 WebShop +12.7 的来源:奖励稀疏(严格成功才得分)且状态难复现(GiGPO 锚态失效)→ 剩余距离估计提供不依赖状态重复的稠密势能差 → 组内全失败时仍有「谁离成功更近」的对比。TabPFN 优于 kNN 13.5–35.1% 的离线 MAE 差距说明增益不是「检索相似状态抄标签」,而是真正的上下文回归——表格基础模型「在小样本上做贝叶斯回归」的预训练先验,恰好匹配「几百个状态-标签对、在线分布漂移、不能训练」的场景约束。「先打分后入库」与「失败终止零信号」两个纪律堵住了自证与速败两条 hack 路径。
DARS:错误传播的显式模型。 核心证据链:λ 扫描给出非单调排序——无衰减 90.2 < 软衰减 91.4–94.3 < 硬掩蔽 84.2。这说明两个相反的失败模式同时存在:不衰减(错误后的依赖工作拿满分)高估了浪费;硬掩蔽(破坏祖先之下全归零)抹掉了依赖步里仍然正确的局部内容、且对标注错误零容忍。软衰减是「浪费」与「噪声鲁棒」之间的工程最优点。串行链消融(−14.2)证明传染必须沿依赖边而非时间轴。行为证据(错物拾取 1 vs 10)来自身份门设计:拿起肥皂瓶不验证 soapbar 的 pick 谓词——规则里的「对象身份必须同时匹配类型与属性」直接翻译成了「错误类型拾取零信用」。
交叉验证与边界。 四篇互相构成对照组:SHARPO 的理论依赖组内有成功轨迹(全失败组失效),FAULT 恰以全失败组 100% 覆盖为卖点;GiGPO 在 ALFWorld 碾压 T2SPO、在 WebShop 被反超,T2SPO 用状态复现率解释了这个交叉——两者也与 DARS 的「时间位置 vs 任务依赖」批评一致。外部互洽的证据:FAULT 的 41% 覆盖率与 DAPO 直接过滤零优势组的工程实践同源;DARS 引用的模仿学习复合误差文献(Ross et al. 2011)为「依赖后缀 off-distribution」提供了理论根据。反例同样有价值:FAULT 在 4 步搜索 QA 上不敌 diag-SFT 对照(−2.7)——步级信用在超短程任务里是负资产(信号本身带噪声而终端奖励已足够精细);DARS 承认开放域任务谓词依赖难显式化、且未系统探索规模;T2SPO 的失败增强标签不稳定;SHARPO 未测全失败组场景。四篇合起来给出的不是「谁赢了」,而是一张信号来源×任务结构的适配地图。
七、必要知识反推与通用性灵感
7.1 要做出这四篇,作者必须掌握什么
- 共同底座:GRPO 系组相对优化的全景(含 DAPO 的零优势组处理、GiGPO 的锚态机制及其失效条件)、势函数塑形理论(Ng et al. 1999 的策略不变性及其在归一化/门控下的失效)、以及「终端结果是唯一可信监督」这一后-R1 时代的共识纪律。
- FAULT 独需:计量经济学的条件似然估计(Chamberlain 条件 logit、Firth 小样本校正、L-BFGS-B 有界优化——把「错误定价」做成了正经的统计推断问题而非 LLM 打分)、错误分类学工程的诀窍(两层表冻结、引文逐字校验、off-table 通道)、以及「诊断 token 不收梯度」这类激励相容设计。
- SHARPO 独需:自蒸馏谱系(OPD→OPSD→StepOPSD)的细微差异、贝叶斯式的 hindsight 推导(成功条件分布之比=局部价值之比)、以及把理论保证(同号、不恶化)做成轻量乘子而非新增损失的克制。
- T2SPO 独需:表格基础模型(PFN/TabPFN/TabICL)的能力边界与 V0/V0.5 的先例、表征工程(冻结编码器+SVD+标准化纪律)、以及「预测先于插入」这类数据库式的防泄漏思维。
- DARS 独需:逻辑程序设计的谓词思维(作者自引 Kowalski「算法=逻辑+控制」)、每个域的依赖拓扑抽象能力(对象链/需求图/跳链/推导链)、确定性与可审计工程(标注只出结构、数值由单元测试覆盖的内核计算、离线重放重算)、以及预注册式的对照实验设计(WebShop 延续实验的锁定-确认-新鲜种子三段协议、Holm 校正)。
7.2 可迁移到其他领域的通用灵感
- 当你只有延迟而稀疏的结果信号时,「结构化的事后归因 + 结果定价」是一个通用补丁。 FAULT 的「诊断定位 × 结果定权」分离可以平移到任何有终态指标的系统:代码评审(哪些 warning 类别真的导致 bug?回归系数说话)、销售漏斗(哪类触达行为与成交负相关?)、甚至医院的不良事件分析。关键是严重程度永远从结果回归,不从 LLM 的直觉打分。
- 特权信息的最安全用法是「调制」而非「指挥」。 SHARPO 的乘子永远不翻转基础优势的符号、FAULT 的预算封顶在奖励差之内、DARS 保留 episode 通道——三个设计同构:过程信号只能在结果信号划定的方向内调节强度。任何「辅助信号叠加进主目标」的系统(多任务学习、RLHF 的奖励混合)都值得检查这条红线。
- 免训练组件 + 上下文进化,是「不引入新 hack 面」的架构模式。 T2SPO 的编码器与 TabPFN 全程冻结,经验只进上下文——被 hack 的面从「可训练参数」缩到「检索池准入」。对一切担心「辅助模型被策略带偏」的场景(推荐系统的 user model、自动调参的代理指标)都是可借鉴的拓扑。
- 错误的传染范围应该由依赖结构决定,不由时间或广播决定。 DARS 的串行链 vs 依赖图消融(−14.2)是普适教训:问责系统(事故归因、pipeline debug、多 agent 系统的故障定位)里,「出错时间点之后的都算」与「全部均摊」都错,正确的问题是谁依赖这个错误。
- 同结果样本不是废数据,是「过程对比」的免费载体。 FAULT 95% 覆盖率的本质洞察:全失败的组里,失败的方式仍然不同。任何 A/B 测试、对照组实验设计里,「结果无差异的样本对」恰是研究过程差异的最佳材料——前提是你有过程的结构化记录。
- 验证手段要跟信号粒度匹配。 FAULT 用盲裁判 MRR 证明定位准、DARS 用离线普查证明消融落在哪些轨迹上、T2SPO 用离线 MAE 证明回归器本身好——三者都在「端到端分数」之外单独测量了信号质量。给过程监督系统做验收时,「信号本身准不准」应该是一等公民指标。
- 标注者只输出结构,数值由确定性规则计算。 DARS 的「标注器永不输出数字」让奖励可单元测试、可离线重放、可蒸馏而不失审计性。对一切 LLM-in-the-loop 的评分系统(数据标注、评估管线、奖励合成),这是把「不可测的判断」转化为「可测的规则+可抽检的判断」的关键一步。
- 没有普适的信用分配器,先诊断任务结构再选信号源。 四篇的甜区地图:全失败组多/错误可枚举→FAULT;混合组/多步协同→SHARPO;状态难复现/奖励极稀疏→T2SPO;谓词依赖可显式化→DARS;状态高频复现→GiGPO 仍是强基线。选型问题应当前置为对任务结构(步数、状态复现率、组内成功率分布、需求可分解性)的测量问题。
回到开头的判断:这四篇同期工作共同宣告的是,「过程奖励 vs 结果奖励」的争论已经结束,接棒的问题是过程信号的可信化工程——锚定(FAULT 的结果定价)、有界(SHARPO 的 clip 乘子)、免学习(T2SPO 的冻结回归器)、可审计(DARS 的确定性内核)。当 LLM 智能体的轨迹越拉越长,一个奖励要监督的决策数只会更多;让每一步拿到既细又可信的分数,是 agentic RL 从「能训」走向「训得动长程」的分水岭。