论文链接:Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay 发表时间:2026年8月(arXiv:2608.19760v1,预印本,Under review) 机构:University of Southern California(南加州大学,单作者 Heady Zhang) 领域标签:cs.LG / LLM Agent / 强化学习 / 信用分配 / 因果推断 开放科学:预注册(KS1/KS2/A3B 三层冻结协议)、匿名仓库发布 29,402 文件(4.7GB 回放档案)与全部训练适配器
一、论文背景
1.1 Agent RL 正在集体押注「给每一步打分」
LLM Agent 的强化学习训练正在收敛到一个赌注:不再只看任务最终成败,而是在长程工具使用轨迹的每一个步骤上打分,用步级信号引导策略学习。当前进入训练循环的步级信用信号基本分三大家族:
- LLM judge 分数:让一个更大的判别模型通读整条轨迹和结局,对每个回合打分(如 TARL 的 {1, 0, -1} 三档打分);
- 结果条件化 logprob 比值:把「成功结局」注入提示后重新计算每个动作的概率,与先验概率做自归一化比值(如 HCAPO 的 ρt);
- 策略自身置信度:策略对自己动作的 logprob,直接当作该步可靠性的代理。
这一赛道近两年空前拥挤:GiGPO 用相同状态分组、ProxMO 用状态相似度软聚合、iStar 交替优化隐式过程奖励模型、CW-GRPO 用 LLM judge 给每轮检索打贡献分、HCAPO 报告在 ALFWorld 上比 GRPO 高 13.8%——各方法在基准上互相超越,步级信用分配被默认为有效训练原料。
1.2 这个赌注的隐含假设从未被检验
所有这些方法都依赖一个从未被直接验证的假设:信号分配给某一步的信用,确实反映了这一步对结局的实际因果贡献。注意这不是「分数是否高」的问题,而是「分数排序是否对应因果重要性排序」的问题——训练循环真正付费购买的是后者。
现有评测量的是另一个东西:步级基准(如 Who&When 系列)用人工标注的步骤正确性给信用信号打分。但正确性与贡献是两个可以完全脱节的量:一个正确的步骤可能毫无贡献(轨迹早已被前面步骤决定);一个错误的步骤可能至关重要(正是它打开了恢复的状态)。论文的动机图景正在于此——用「步骤是否标注正确」来评测信用信号,等于用体重秤量身高。
1.3 为什么因果贡献需要「执行回放」
「这一步对结局有多重要」本质是反事实问题:换了动作,结局会变吗?要回答它不能靠看文本推断(那又是相关性),必须回到环境里真的执行:在每个决策点把动作替换成策略自己支持的候选,向前滚动到终局,度量结局分布移动了多少。这需要环境可重放、确定性可验证、有足够采样预算——论文把这套仪器完整建了出来,然后把它对准整个赛道。
二、论文定位和关联工作
2.1 被审计对象:三大家族的原型方法
| 方法 | 家族 | 核心机制 | 与本文关系 |
|---|---|---|---|
| TARL(Tan et al., 2025) | LLM judge | 72B judge 对每回合打 {1,0,-1} | judge 提示词、响应契约、量表被逐字复用;因 ALFWorld 无金标注,以 w/o-gold 模式运行(偏离已披露) |
| HCAPO(Tan et al., 2026) | 结果条件化 | ρt = clip(π_hind(a_t)/π̄_hind),事后概率比 | Eqs. 6-7 与常数(T=5.0、clip[0.8,1.2])逐字复用;其 scorer 即策略本身的设计被论文指出是「仪器与被测对象不可分」的结构性特征 |
| 策略置信度 | 自我评估 | 策略对动作的 logprob | 作为路由规则与被审计信号 |
值得强调的选址逻辑:被审计的两个仪器家族(HCAPO 与 StepOPSD 一系)都在 ALFWorld 上报告头条结果——论文特意在被审方法自己的主场开审计庭,「审计环境不代表方法适用环境」的辩护空间被预先封死。
2.2 因果回放谱系:从失败归因到信用审计
- CAR(Causal Agent Replay, Shah 2026):同期工作,把 Agent 运行建模为结构因果模型,对步骤做 do 干预并前滚,在植入已知效应的合成 SCM 上验证估计器本身有效;本文则把同类仪器部署到真实环境给已投入训练使用的信号定罪。两者构成一条链的两端:CAR 证明尺子准,本文用尺子量人。
- CARL(Shen et al., 2025):报告熵在分布层面区分关键/非关键状态(Cliff’s δ=0.42)。论文附录 L 仔细调和了这与本文「置信度路由器召回率等于随机」的不冲突:CARL 的临界性信号从未以分类阈值形式进入训练,也没有报告任何 precision/recall——分布层面的分离与成本匹配阈值下的随机召回并不矛盾。
- C3(Chen et al., 2026):多智能体信用的「方法无关审计工具」,但其保真度判据是与它自己计算的回放优势的 Spearman 相关——自我指涉的认证。本文的判据是外部执行的因果真值,且真值构造过程不咨询任何被审计信号。
- CVT-RL:策略条件化反事实贡献估计器,与本文测量对象同构,但目标是构造新训练信号而非审计既有信号。
- Who&When / Who&When Pro:LLM judge 做步骤归因的准确率已知很低(步级归因 SOTA 约 14%);本文把「judge 不可靠」的证据从归因任务推广到信用保真,并给出机制解释。
2.3 定位总结
| 维度 | 之前的路线 | 本论文的突破 |
|---|---|---|
| 评测口径 | 步骤标注正确性(相关性) | 步骤因果贡献(干预 + 执行回放) |
| 真值来源 | 人工标注 / judge 自评 | 外部执行反事实,不咨询任何被审信号 |
| 审计对象 | 单一方法或方法家族 | 正在训练循环中的全部三大信号家族 |
| 对照设计 | 点估计与 0 比较 | 冻结判定顺序 + 边际匹配 shuffle 对照(安慰剂级判定) |
| 训练层验证 | 无 | 七臂预注册训练闭环 + 剂量分析 |
| 开放科学 | 常规开源 | 三层预注册、裁决顺序冻结、完整性事故目录随论文发布 |
一句话定位:这不是「新方法涨点」的论文,而是给整个步级信用分配赛道做「测谎」的审计论文——用因果仪器证明目前所有在用的步级信用信号在「识别因果关键步骤」上不比随机好,并解释了为什么、以及训练增益的表面差异从何而来。
三、问题定义
3.1 从具体场景到抽象问题
具体场景:一条 40 步的 ALFWorld 轨迹最后成功了,训练算法需要给每一步分配权重——哪些步是关键转折,哪些步是无所谓的闲棋?
论文的深层洞察是一个概念切割:把通常混为一谈的「步骤质量」拆成两个数学上独立的量——
- 正确性(correctness):这一步的动作是否符合任务规范(可人工标注);
- 贡献(contribution):这一步的动作相对其反事实替代动作,实际改变了多少结局分布(只能靠干预度量)。
两者的分离是结构性的:轨迹动力学强吸收时(大半状态改变已不可逆),正确的步骤贡献为零;恢复性转机处,错误的步骤贡献巨大。训练循环付费购买的是贡献,而非正确性——所以审计口径必须换成贡献。
3.2 形式化定义
在决策点 t,执行回放定义回放优势:
A_replay(t) = mean(outcome | 事实动作在 t 处的重放) − mean(outcome | K=4 个替代动作各自前滚)
关键约定:
- 事实项永远不用原轨迹的实际延续,而是在 t 处把事实动作重新执行至少 3 次取均值——估计量与「原轨迹碰巧走出的那条路」解耦;
- 替代动作从同一策略快照、同一采样温度(0.7)中抽取,每个至少前滚 3 次到终局(每回合至多 300 次种子化抽取内取 K=4 个不同合法动作);
- 当策略在预算内抽不出 4 个不同合法替代动作时,该回合的策略支持反事实未定义,排除并计数(不插补);
- 每回合噪声底 σ_floor(t) = 事实重放结局的标准差;pivotal 的定义是存储值上 A_replay(t) ≠ 0——无显著性过滤、无阈值;
- 每个 A_replay = 0 都是分辨率有界陈述:双臂全零的 1184 个回合,数据在 95% 单侧置信下仅排除 |Δp| > 0.632——「测不出」永远不写成「没有效应」。
3.3 这个抽象的精妙之处
三点。其一,真值构造完全独立于被审计信号——没有任何环节咨询 judge 分数或 logprob 比,否则就是 C3 式的自我指涉。其二,用「策略自己的替代动作」定义反事实,对应的是「该策略在此状态下真实可达的其他选择」,而非全动作空间的极端反例——这正是训练循环关心的操作对象。其三,测量地图本身(哪里可测、哪里不可测)作为一等科学产出报告,而不是当作技术障碍藏起来。
四、问题解法
论文的方法是「审计流水线」,分五层:造真值仪器 → 审计保真度 → 机制检验 → 训练闭环 → 实用规则。每层都带预注册的判定规则。
4.1 第一层:执行回放仪器(KS1)
环境与策略:ALFWorld(TextWorld 后端),Qwen2.5-7B-Instruct 策略,50 条轨迹、任务列表在采集前冻结,温度 0.7 采样。环境确定性在采集前及每个接触数据的主机上验证(一条轨迹哈希、四个独立环境)。前缀恢复确定性横扫 20,538 次回放滚动,零发散。
被审计信号:
- implicit 家族:HCAPO 的 ρt,逐字按其发表的公式与常数计算,scorer 是策略 checkpoint 本身(忠实于 HCAPO 设计);
- judge 家族:Qwen2.5-72B 判别器,TARL 提示结构逐字复用,w/o-gold 模式;
- 置信度:策略对自身动作的每 token 几何平均 logprob。
保真度统计:在消费信用的地方计分——轨迹内。每族计算信用值与 A_replay 的轨迹内 Spearman 相关,按轨迹取中位数、10,000 次 bootstrap 区间。退化轨迹(<4 个完整回合或 A_replay 恒定)对称排除并计数。随机、均匀、轨迹内 shuffle 信用(保持轨迹边际分布)走完全相同的流水线。
冻结的判定顺序(这是全文最讲究的设计):Controls 门 → INFEASIBLE → H3 → H2 → H1 → H4。Controls 门永远先于效应门:一族信号的区间若与自身 shuffle 对照区间重叠,无论点估计多高,一律判 H3(安慰剂级)。这防的是「点估计漂亮但信息量为零」的假阳性。三族六假设配 Holm 校正;阈值、排除规则、判定顺序在数据存在之前以不可变标签签名冻结。
4.2 第二层:可测性地图
在问「信用是否追踪贡献」之前先问「贡献在哪里可测」——这一层产出了论文的第一个意外发现(详见第五部分):
- 因果贡献稀疏:仅 30.5% 完整回合 pivotal;
- 动力学强吸收:86.0% 完整回合 σ_floor = 0(怎么换动作结局分布都不动);
- 可测性依赖模型且双向:Llama 无反事实比例是 Qwen 的 2.05 倍,但可测处 pivotal 比例反而更高(38.3% vs 30.5%)。
排除不是随机的:无反事实回合系统性集中在低熵(高概率)动作上——被排除的恰是 implicit 家族自己的预测变量所覆盖的区域(Qwen 的纳入-排除组平均策略 logprob 差 -0.70,区间不含零)——所以分析集在流畅度轴上右截断,论文如实报告这对保真度估计的影响。
4.3 第三层:机制检验(T3 预注册预测)
如果信用不追踪因果效应,它追踪什么?论文在数据前注册了答案并获证实:implicit 信用随策略对被评分动作自身的概率上升——信用是流畅度的回声。定量拆解用联合回归:把 implicit 信用同时回归到动作流畅度(平均策略 logprob)和因果增量上,流畅度权重 0.955 对增量 0.402(约 2.37 倍);条件掉流畅度后,信用与增量的偏相关 -0.004(p=0.87)——因果信号一丝不剩。
4.4 第四层:训练闭环(KS2,七臂预注册)
对审计最自然的反驳是:「保真度低又如何,训练有效就行。」论文封了这条路:七个训练臂——outcome-only、implicit、judge、各自 shuffle 对照、inverted-ρ、pivotal-masked(低分辨率回放真值)——在共同随机数(CRN)与相同预算下训练 LoRA,在 128 个留出任务上评估。所有确认性比较走 ±3pp 等价带(TOST)+ Holm 校正,设计 MDE ≈ 11.8pp。臂间checkpoint 的动作分布差异(JS 散度)与参数位移分析进一步追问「差异从哪来」。
4.5 第五层:置信度路由器(R ROUTE)
唯一正面产出的实用件:冻结的置信度路由规则——低置信回合送 judge、高置信回合跳过,阈值是策略自身置信度的顺序统计量。定位是成本机制而非探测器:它以随机水平召回 pivotal 回合,但每回合省 13.1%(每轨迹 14.0%)的 judge 调用。论文坚持「带着否定结果一起发布」——一个不带评估的规则会被用于它做不到的事。
4.6 全景对照表
| 层 | 输入 | 输出 | 判定机制 |
|---|---|---|---|
| 回放仪器 | 50 轨迹 × 2,034 干预回合 | A_replay、σ_floor、pivotal 标签 | 确定性验证 + 噪声底 + 分辨率界 |
| 保真审计 | 信用分数 vs A_replay | 秩保真 + 符号一致 + 精度提升 | 冻结判定顺序,Controls 门优先 |
| 机制检验 | 信用 vs 流畅度 vs 增量 | T3 秩相关、偏相关、回归分解 | 预注册方向预测 + Holm |
| 训练闭环 | 七臂 CRN 训练 | 留出胜率 + JS 结构 + 剂量中介 | TOST 等价带 + MDE 阶梯 + 预注册分区 |
| 路由规则 | 置信度 | 召回 + 成本 | 六阈值扫描(敏感性)+ 主结果单一阈值 |
五、评估指标与实验证据
5.1 指标体系
| 类别 | 指标 | 定义 | 衡量什么 |
|---|---|---|---|
| 主指标 | 轨迹内秩保真 ρ̂ | 信用值 vs A_replay 的轨迹内 Spearman 中位数(10k bootstrap) | 信用排序与因果排序的一致性 |
| 主对照 | 边际匹配 shuffle 对照 | 轨迹内打乱信用(保边际)后同一统计量 | 信号携带的信息量是否为零(安慰剂检验) |
| 辅指标 | 符号一致率 | 每步信用与 A_replay 相对各自轨迹中位数的符号一致比例 | 逐级方向的巧合水平 |
| 辅指标 | precision-at-pivotal 提升 | 高信用步中 pivotal 的富集比(1.0 为随机) | 信用是否集中在关键步上 |
| 机制指标 | T3 秩相关 | Δt 与策略 logprob 的轨迹内 Spearman | 信用是否为流畅度回声 |
| 机制指标 | 偏相关 | 条件掉流畅度后信用 vs 因果增量 | 结果条件化的信息增量 |
| 训练指标 | 留出胜率差 | 七臂 vs base(0.422, 54/128),±3pp TOST | 信用内容在训练中的净价值 |
| 结构指标 | JS 散度 / 预注册分区 | 臂间 vs 臂内动作分布距离;仪器分区 vs 信息分区 | checkpoint 记住了什么 |
| 剂量指标 | partial Mantel | 控制参数位移后的仪器对应 | 签名是内容还是剂量 |
| 成本指标 | 召回/节省 | 路由器 pivotal 召回与 judge 调用节省 | 规则的可用边界 |
5.2 核心证据一:保真审计全灭(表 1 / 图 1)
家族 vs 自身 shuffle 对照(冻结判定顺序,全部判 H3):
| 家族 | ρ̂(中位) | 95% CI | n_eff | 自身 shuffle 对照 CI | 判定 |
|---|---|---|---|---|---|
| Qwen implicit(HCAPO ρt) | 0.0193 | [−0.109, 0.081] | 37/50 | [0.005, 0.114] | H3 安慰剂级 |
| Qwen judge(72B) | 0.1142 | [0.027, 0.168] | 37(32 可算) | [−0.049, 0.117] | H3 安慰剂级 |
| Llama implicit(修正仪器) | −0.043 | [−0.125, −0.016] | 21/28 | [−0.102, +0.024] | H3 安慰剂级 |
三行各有讲头:implicit 点估计中心在零;judge 点估计弱非零(0.1142)但落在自身对照带内——判定门绑定的是与对照的比较而非过零;Llama 点估计为负且 CI 不含零,但绑定的仍是对照比较,论文明确「注意到符号但从中不做任何主张」。
三独立测度同一零假设:秩保真(上表)、符号一致(implicit 267/527 = 50.7% [46.4, 54.9],Llama 0.449 [0.393, 0.505],皆随机水平)、偏相关(−0.004)——估计量、检验统计量、失效模式互不共享,结论一致。
judge 的一面清了随机、但买不到集中:judge 符号一致 84/139 = 60.4% [52.1, 68.2],区间不含 50%——论文先直说再定位其极限:识别「哪一步因果重要」是排序-集中主张,precision-at-pivotal 上 implicit 的提升 0.940 [0.760, 0.997](整段低于随机线 1.0,轻度反集中),judge 的 1.000 [0.935, 1.001] 含随机线——judge 的逐步符号信号没有转化为对关键步的集中。另外 judge 分数对 judge 模型高度敏感:与锚 judge(GPT-4.1)的精确一致仅 74.1% [68.0, 79.4],Cohen κ = 0.496。
跨家族复现与仪器修复的鲁棒性:T3(流畅度回声)在 Llama 修正仪器下 +0.7008 [0.6482, 0.7683](n=27),落在 KS1 注册区间 [0.647, 0.793] 内——下缘超出注册下界仅 0.0008,论文主动披露「以本质为零的余量同时满足点判据与区间判据」;其 shuffle 对照 −0.0155 [−0.1290, +0.0844] 不重叠,控制判据触发。两代仪器(chat 模板缺陷前后)使可测性地图实质移动,但没有移动任何一个判定类别——结果在自己的仪器被修复后仍存活,是此类审计最接近内部复现的东西。
5.3 核心证据二:真值自身的结构
| 量 | Qwen2.5-7B | Llama-3.1-8B(修正仪器) |
|---|---|---|
| 无策略支持反事实比例 | 13.1% [11.7, 14.6](n=2,034) | 26.8% [24.2, 29.5](n=1,082) |
| pivotal 比例(完整回合) | 30.5% [28.4, 32.7](n=1,768) | 38.3% [34.9, 41.7](n=792) |
| 吸收回合比例(σ_floor=0) | 86.0% [84.3, 87.6] | 80.6% [77.7, 83.2] |
两个方向相反的分歧:更难定义反事实的家族,在反事实存在处因果信号反而更多——可测性是(策略, 环境)对的属性,不是环境常数。机制是概率质量集中度而非能力高低:Llama 在部分决策点的分布太紧,预算内抽不出 4 个不同合法动作。
5.4 核心证据三:机制——seed017 的完整故事
轨迹 seed017 中策略连续四次发出同一动作「take cloth 1 from toilet 1」,环境第一次回答「Nothing happens.」;第 12/16/20 回合 scorer 对这些重复的置信度超过 0.9999,而回放判定同样这些回合 pivotal(因果增量 +0.333 / −0.167 / +0.250)。卡在循环里的策略是最大置信的,因为下一个 token 最大可预测——回声置信度的信用信号会把确定性精确花在轨迹已经停止前进的步骤上。 这是全文最锋利的一段机制叙事。
5.5 核心证据四:七臂训练实验(表 3)
| 臂 | s0 | s1 | s2 | 均值 |
|---|---|---|---|---|
| 1 outcome-only | 0.438 | 0.445 | 0.438 | 0.440 |
| 2 implicit(ρ) | 0.352 | 0.414 | 0.344 | 0.370 |
| 3 judge | 0.359 | 0.531 | 0.445 | 0.445 |
| 4 shuffled-ρ | 0.375 | 0.383 | 0.422 | 0.393 |
| 5 inverted-ρ | 0.406 | 0.391 | 0.094† | 0.297† |
| 6 pivotal-masked | 0.469 | 0.344 | 0.320 | 0.378 |
| 7 shuffled-judge | 0.445 | 0.375 | 0.406 | 0.409 |
| base(未训练) | — | — | — | 0.422(54/128) |
† 臂 5 种子 2 是格式坍缩仪器注记(87.7% 动作嵌套标签致不可受理,非能力坍缩),预注册排除。
六项确认性比较(C1 implicit vs shuffle −2.34pp,Holm p=0.4273;C2 judge vs shuffle-judge +3.65pp,p=0.5326;C3 implicit vs outcome −7.03pp,p=0.9116;C4 judge vs outcome +0.52pp,p=0.3266;C5/C6 单边优越均未证明)全部「不结论」——冻结读法是 inconclusive(MDE≈11.8pp 对 ±3pp 带),永远不是「无差异」。论文明说:implicit 训练比自身 shuffle 低 2.3pp、比 outcome-only 低 7.0pp,只是这个功效分辨不了。
分布层的签名与剂量解释:七臂在离散选择上一致(差距 +0.41pp / +0.50pp,远低于 5pp 冻结门槛),但动作分布干净分离:臂间 JS 0.0520 对臂内 0.0198(2.6 倍,p=0.0001)——信用移动了概率落点,尚未移动贪心行为。预注册分区检验(矩阵算出前冻结):仪器分区两阶段都分离(Stage 2 +0.0346,p=0.0002),信息分区两阶段都不分离(−0.0126,p=0.9777)——权重记住的是哪个仪器打了分,不是分数说了什么。而这个签名又被剂量完全解释:稀疏信用丢弃零权重样本 → 各臂优化器步数从 112 到 8 相差一个数量级;控制实际参数位移后仪器对应消失(partial Mantel +0.078,p=0.774),同一检验对正控制(信用稀疏度)给出 +0.912(p=0.0001)。
5.6 核心证据五:路由器与否定性副业
置信度路由召回 pivotal 回合 11.9% [9.4, 14.9](n=540),对路由比例 13.1%——随机水平,机制恰是第五部分的发现:卡住的 pivotal 步是高置信步,置信度阈值与它们背向。两个 13.1% 数字重合是定义使然(阈值设为使路由比例等于无反事实率)。成本侧良好:省 judge 调用 13.1%/回合、14.0%/轨迹,两个粒度随扫描反向移动、必须同报。论文的立场写在脸上:拿它省钱,别拿它找关键步。
5.7 指标如何支撑主张
审计主张(三家族皆安慰剂级)由三独立测度 + 自身对照门 + 两代仪器 + 两模型家族共同支撑;机制主张(流畅度回声)由预注册方向预测 + Holm 存活 + 联合回归分解 + 跨家族 +0.70 复现支撑;训练层主张(表面差异是剂量)由 TOST 全不结论 + 预注册分区 + partial Mantel 中介 + 正控制支撑。每个否定都带着自己的功效账单(MDE 阶梯)——「设计只能说没有这么大的效应」与「没有效应」被严格区分。这正是「指标真的证明主张」而非「指标好看」的范本。
六、效果优势的根源解释:正确性与贡献分离之后,信号为什么全部失效
本文是审计/否定性结论,没有「效果优势」可解释;要解释的根源问题是:当评测口径从「步骤正确性」换成「步骤因果贡献」后,为什么所有在用的步级信用信号同时失效? 论文给出的不是三个独立的意外,而是一条环环相扣的因果链。
6.1 先看 baseline 为什么曾经有效
三大家族在旧口径下各有可信的理由:judge 分数与人工标注的步骤正确性确有相关(judge 逐字推理、rubric 明确,符号一致 60.4% 高于随机并不奇怪——人标注正确性的信息它确实捡到了一部分);ρt 的构造在数学上是重要采样比值的自归一化估计,其「事后概率升高 = 关键步」的直觉在 HCA 里理论成立;置信度作为「模型知道自己在干什么」的代理在分类文献里反复被用。旧口径没有说谎——旧口径量错了东西。
6.2 根源链之一:implicit 信用的信息源被流畅度垄断
ρt 的分子分母都来自同一个策略 checkpoint 的 logprob。一个动作的概率高,可以因为它因果关键(事后看非它不可),也可以仅仅因为它可预测——下一个 token 在该上下文里本来就顺。当「流畅」与「关键」两种原因都抬高同一个分数时,谁占主导是经验问题。论文的分解给出答案:联合回归中流畅度权重 0.955 对因果增量 0.402,条件掉流畅度后偏相关 −0.004——增量在联合模型中的表观权重,是流畅度投在它身上的影子。seed017 把这一机制演成了哑剧:循环重复的动作在模型分布里最大可预测,于是最流畅、于是最高分——恰是轨迹的死点。更结构性地,被排除的「无反事实」回合系统性是高概率回合(logprob 差 −0.70),意味着即便在可测集上,信号也工作在流畅度轴被右截断的样本里——回声在完整样本上只会更强。这不是 ρt 实现的 bug,是「用策略自己的概率给自己打分」这一仪器设计的必然:仪器与被测对象在 HCAPO 里本来就是同一个对象(论文特意说明跨家族换模型是同时换被测对象、测量仪器和标尺三件事,只能检验系统级主张)。
6.3 根源链之二:结果条件化没有注入因果信息
「看到结局再打分」的哲学承诺是事后诸葛式的因果洞察。检验方法干净利落:hindsight 增量(看到结局对 logprob 的改变)与因果增量的相关,在注册集上为零(偏相关 −0.004,p=0.87)。直觉解释:结局 s_final 改变的是「这类轨迹通常长什么样」的全局叙述概率,而不是「该状态下换一个动作结局会否不同」的局部反事实判断——知道故事怎么结尾,不等于知道哪句台词改变了结局。修正仪器下 Llama 的两个估计量(Pearson −0.086 名义显著 vs Spearman −0.019 不显著)分歧且未注册、缺失非随机,论文只作描述性报告并拒绝从中引出任何确认性主张——这本身就是审计纪律的示范。
6.4 根源链之三:judge 捡到了正确性、捡不到贡献
judge 的 60.4% 符号一致说明它对「步骤看起来对不对」确有信号——这正是旧基准给它发通行证的原因。但识别因果关键步需要的是排序与集中:把分数最高的步压到 pivotal 步上。precision-at-pivotal 上 judge 提升恰为 1.000(含随机线)——符号信号完全买不到集中。机制不难理解:judge 读的是文本轨迹与结局的相关性模式,而贡献由「吸收态动力学 + 反事实可达性」决定,后者在文本表面几乎不留痕迹(86% 回合怎么换动作结局都不动,judge 无从知道)。加上 judge 对 judge 模型的敏感(κ=0.496),它的可用信号连跨模型都不稳定。implicit 的 0.940 反而轻度反集中——流畅度回声恰好把高分撒在因果死点上。
6.5 根源链之四:训练层的表面差异为什么是剂量
保真失效后训练层本该全平,但臂间 JS 分布又确实分离了 2.6 倍——最后的嫌疑落在哪?论文排摸出的链条:信用规则决定零权重比例 → 零权重样本在更新步被一行过滤代码丢弃 → 稀疏信用买到更少的优化器步数(112 到 8,一个数量级)→ 参数位移幅度不同 → 分布签名不同。控制实际参数位移后签名消失(+0.078, p=0.774),正控制(稀疏度 +0.912)同检验下确认设计有检测力。预注册分区(仪器分区赢、信息分区输)先排除了「内容」解释,partial Mantel 再排除了「仪器」解释——最后剩下的只有剂量。这条链的方法论价值不亚于结论本身:任何允许信用规则改变有效样本量的比较,测的是训练剂量而不是信用内容——论文称之为赛道里普遍未被控制的混杂。
6.6 因果链总装
把四条链拼起来:
评测口径混同(正确性 ≈ 贡献)
→ 三家族信号的信息源其实是「文本表面模式 + 策略自身可预测性」
→ implicit:分数 ∝ 流畅度(回声),judge:分数 ∝ 表面正确性,置信度:分数 ∝ 可预测性
→ 贡献由反事实动力学决定,在文本表面与策略概率上均不可读
→ 三家族在贡献排序上等价于自身 shuffle(安慰剂级)
→ 训练循环中「信用内容」无净效应;残存的臂间差异 = 稀疏度带来的剂量差
反事实推理可以反证:如果给 implicit 换一个独立于策略的 scorer(信息源不再垄断于流畅度),回声机制即被切断——但那时它也不再是 HCAPO 意义上的 implicit 家族;如果让 judge 只做符号判断不做排序(它唯一清随机的测度),它能提供的信息又不足以支撑步级加权。三家族的失效不是三个巧合,而是同一枚硬币的三面:它们的可观测输入里本来就没有贡献这个变量。
七、必要知识反推
一个有 ML 训练功底但完全不了解这个领域的人,要独立完成这篇审计,最少需要什么?
7.1 领域知识层
- Agent RL 训练管线:GRPO 一系 value-free 方法的轨迹级信用如何分配、步级信号以何种形式(加权、过滤、优势分解)进入更新步——不知道「信用在哪被消费」就无法把保真度统计放在正确的粒度(轨迹内)上。
- 被审计方法的具体构造:HCAPO 的 ρt 公式、TARL 的 judge 契约必须逐字复刻——审计的效力量于「审的确实是他们训练用的那个信号」,错一个常数(如温度 5.0、clip [0.8,1.2])辩护空间就全开。
- LLM Agent 环境工程:ALFWorld/TextWorld 的可重放性、确定性验证、前缀恢复、合法动作解析——不懂这些细节做不出 20,538 次滚动零发散的仪器,也接不住 chat 模板缺陷这种语义级仪器事故。
7.2 方法论知识层
- 因果推断基础:do 干预、反事实分布对比、重要采样比值——A_replay 的定义与「事实项不得用实际延续」的约定直接来自这里。
- 测量与统计推断:bootstrap 中位数聚合、Wilson 区间、Holm 校正、TOST 等价检验、MDE 计算、配对置换检验——特别是「对照门先于效应门」的安慰剂逻辑与「等价不显著 ≠ 无差异」的报告纪律,是全文判定系统的骨架。
- 评测方法论谱系:知道 Who&When 一系用标注正确性评 judge、知道 C3 的自我指涉问题——才能定位「外部因果真值」这一空位。
7.3 工程知识层
- 大规模受控实验运维:CRN 种子配对、离线评分循环、LoRA 多臂并行、GPU 预算阶梯($40 停机门)——七臂实验在预算内可比的唯一途径。
- 数据完整性与溯源:哈希钉住预注册、逐 shard 内容验证、账本再生成(每个数字由脚本从原始工件再生、两次再生成字节一致才放行)——这是「每个数字可追溯」承诺的物理基础。
- 训练动力学诊断:梯度范数逃逸先于 KL 越界、方向性漂移与单步过大的区分(PC3 基底修复线)——否则「训练层无效」会被错误归因为基底缺陷(论文测试并否定了这个替代解释:修复后的基底在任何配置下都无法稳定训练)。
7.4 知识融合的关键节点
三个化学反应点:
- 概念切割 × 因果推断:把「正确性/贡献」的哲学区分翻译成一个可执行的干预估计量(A_replay)——没有前者是无的放矢,没有后者是空谈。
- 安慰剂对照逻辑 × 信用审计:把临床试验的对照门移植到信号评测,发明「边际匹配 shuffle + 冻结判定顺序」的判读系统——这是结论可信度的关键放大器。
- 计量混杂分析 × 训练实验:识别「信用稀疏度 → 有效样本量 → 参数位移」的剂量通道,用 partial Mantel + 正控制完成中介拆解——把一个可能的「训练有效」假阳性拆成了方法论教训。
八、论文中可以提取的通用性灵感
8.1 「量错了口径」的评测悖论普遍存在
核心思想:一个信号家族可以在错误口径下长期「表现良好」,因为错误口径与真口径存在相关但不同的结构——换口径是范式级审计,不是增量改进。 论文证据:judge 符号一致 60.4%(对正确性有信号)与 precision-at-pivotal 1.000(对贡献零信号)并存;三家族在标注正确性口径下通行、在贡献口径下全灭。 推广场景:RAG 评测中「检索命中率」vs「答案因果依赖度」;代码生成中「测试通过率」vs「变更实际被下游使用的程度」;模型可解释性中「忠实性基准分」vs「干预下的因果解释力」;推荐系统中「点击率」vs「长期留存贡献」。
8.2 用「执行反事实」给任何粒度的评分器做测谎
核心思想:要检验一个评分器是否度量了它声称度量的东西,构造一个与其输入完全独立的干预式真值,然后对照「评分器排序 vs 真值排序」——比「与人类标注一致」严格得多。 论文证据:A_replay 的构造不咨询任何被审信号;三独立测度(秩保真、符号一致、偏相关)交叉验证;判定门绑定自身 shuffle 对照而非零点。 推广场景:AI 编程助手的「测试生成质量分」用注入缺陷重跑来审计;医疗诊断辅助系统的「关键特征归因」用消融重诊来审计;自动驾驶规划的「场景风险评分」用闭环重放来审计;教育 AI 的「知识点掌握度估计」用随机干预练习来审计。
8.3 系统自我评分的回声陷阱
核心思想:当一个系统用自己的内部量(概率、置信度、自洽性)给自己或自己的行为打分时,分数会系统性回声「可预测性」而非「有效性」——两者在分布上强相关但在因果上无关。 论文证据:implicit 信用与流畅度中位秩相关 +0.75(跨家族 +0.70 复现);控制流畅度后因果信息残差 −0.004;seed017 循环重复动作置信度 >0.9999 而 pivotal。 推广场景:自监督模型的「不确定性估计」可能只度量样本常见度;Agent 自我反思(self-reflection)的置信度可能度量的是生成一致性而非正确性;RAG 的自评相关性分数可能回声检索文本的流畅度;代码模型的「自查通过」可能回声风格可预测性。
8.4 任何比较实验都要做剂量匹配
核心思想:只要处理条件能改变有效样本量/训练步数/曝光量,「行为差异」就会被剂量差冒充——不匹配剂量,比较测的是待遇不是内容。 论文证据:优化器步数 112 vs 8 每轮(同预算!);控制参数位移后仪器签名消失(+0.078, p=0.774);正控制 +0.912 确认设计有检测力。 推广场景:数据增强方法比较(增强率改变了有效样本量);提示工程 A/B 测试(输出长度改变了解码预算);课程学习比较(课程改变了梯度步数分配);蒸馏 vs 微调比较(有效监督信号密度不同)。
8.5 「带着否定结果发布规则」的责任格式
核心思想:一个在 A 维度失败、B 维度有效的工具,必须与它的否定结果捆绑发布——否则它一定会被用于它做不到的事。 论文证据:置信度路由器随机水平召回 pivotal(11.9% vs 13.1%)但省 13.1% judge 成本,论文拒绝单独发布成本侧。 推广场景:成本敏感的模型路由(快模型不知道何时该升级);缓存系统(不知道何时失效安全);医疗分诊 AI(不知道哪类病人被漏);安全过滤器(不知道哪类攻击被放行)。
8.6 对照组的强度也要测量
核心思想:「shuffle 对照」不是天然等强度的操纵——不同格式的信号被 shuffle 破坏的程度天差地别,未测强度的对照会制造虚假的家族差异。 论文证据:轨迹内 shuffle 改变连续信用 90.4% 的位置,却只改变平局多的离散 judge 分数 26.0%——比较两个家族「各自的 shuffle」曾混淆了信息破坏与扰动强度。 推广场景:消融实验的「随机化基线」强度校准;心理学安慰剂对照的操作等价性;鲁棒性测试的扰动预算归一;LLM 评测的「打乱选项」对照。
8.7 完整性检查的四维分类学
核心思想:校验系统要按「查的是不是同一对象 / 写入时对不对 / 现在还读得出来吗 / 保留了行动所需证据吗」四维分别设防——任何单一检查只回答其中一问,最常见失败是假设一检查回答了另一检查的问题。 论文证据:四维各自附真实事故(哈希错文件通过校验、NUL 文件哈希合法、文件数通过但一个不可读、guard 丢弃 errno);分类学做出可证伪预测「下一个事故落在两个从未被测试的防御上」并被 e58 应验。 推广场景:ML 数据管线的来源校验;金融系统的对账设计;CI/CD 的工件溯源;科学软件的可复现性声明。
附录 A:预注册与治理时间线速查
| 日期 | 事件 |
|---|---|
| 2026-07-31 | KS1 预注册签署(阈值、判定顺序、H1-H4 判读不可变) |
| 2026-08-02 | KS2 v1.2 训练实验签署(七臂、±3pp、CRN) |
| 2026-08-03/04 | KS2 v1.3/v1.4 修正(臂 6 降级阶梯;更新规则 PPO 化) |
| 2026-08-07 | A3B 结构预注册 + 跨家族修正签署(Llama 臂,T3 唯一主终点) |
| 2026-08-08 | 跨家族续跑门冻结(MDE ≤ 0.50 才继续) |
| 2026-08-10/11 | chat 模板缺陷发现 → 全量重放(预测 12.0pp、实测 12.3pp 移动,判定类不变);GPU 撞帽 → 分析暂扣 → 两次独立裁决后以部分覆盖率标签发布 |
| 2026-08-19/20 | 附录定稿、v1 提交 arXiv |
附录 B:关键数字速查表
| 主张 | 数字 |
|---|---|
| Qwen implicit 秩保真 | 0.0193 [−0.109, 0.081],n_eff=37/50;自身对照 [0.005, 0.114] |
| Qwen judge 秩保真 | 0.1142 [0.027, 0.168];自身对照 [−0.049, 0.117] |
| Llama implicit(修正) | −0.043 [−0.125, −0.016],n=21/28,覆盖率 88.3% |
| pivotal 稀疏度 | Qwen 30.5%(n=1,768);Llama 38.3%(n=792) |
| 吸收态比例 | 86.0% / 80.6% |
| 无反事实比例 | 13.1% vs 26.8%(2.05 倍) |
| 流畅度回声 T3 | +0.752 [0.647, 0.793](n=47,Holm p=0.0002);跨家族 +0.7008 [0.6482, 0.7683] |
| 偏相关(条件掉流畅度) | −0.004(p=0.87) |
| 联合回归权重 | 流畅度 0.955 vs 增量 0.402(≈2.37 倍) |
| judge 符号一致 | 60.4% [52.1, 68.2];precision-at-pivotal 1.000 |
| judge 锚一致 | 74.1%,κ=0.496(vs GPT-4.1) |
| 七臂 | base 0.422(54/128);六比较全不结论(MDE≈11.8pp);C1 −2.34pp(p=0.43)、C3 −7.03pp(p=0.91) |
| JS 臂间/臂内 | 0.0520 vs 0.0198(2.6×,p=0.0001);仪器分区 +0.0346(p=0.0002)、信息分区 −0.0126(p=0.98) |
| 剂量中介 | partial Mantel +0.078(p=0.774);正控制 +0.912(p=0.0001);优化器步 112→8 |
| 路由器 | 召回 11.9% [9.4, 14.9] vs 路由率 13.1%;省 13.1%/turn、14.0%/trajectory |
| 重放规模 | 20,538 滚动零发散;29,402 文件 4.7GB;确定性四环境验证 |
附录 C:读完可以带走的判断题
如果有人向你推销一个新的步级信用信号,这篇论文教你先问五个问题:
- 它的保真度是对因果贡献(干预回放)还是对标注正确性(相关性)验证的?
- 对照是什么——零点,还是信号自身边际匹配的 shuffle?判定顺序是否事前冻结?
- 信号的信息源是否与被评对象独立?如果 scorer 就是策略自己,有没有做流畅度回声检验(控制 logprob 后还剩多少)?
- 训练增益的比较是否匹配了有效样本量(剂量)?优化器步数报了吗?
- 否定结果的分辨率是多少——每个「零」带着它的 MDE 和采样分辨率界吗?
五问过不了任何一问的信号,按本文的标准,目前赛道里还没有。