论文链接:arxiv.org/abs/2609.26355 代码仓库:github.com/AllSpark-Research/PACT 发表时间:2026年9月 机构:AllSpark Team(通信作者信息显示作者与北京大学、小红书有关联) 领域标签:cs.LG / cs.CL,LLM 后训练、强化学习、信用分配
一、论文背景
1.1 什么是信用分配问题
想象一个团队项目最终拿了大奖,奖金要分给团队里的每一个人——谁该拿多少?这就是**信用分配(Credit Assignment)**问题。在大语言模型(LLM)的强化学习后训练中,这个问题以最尖锐的形式出现:
- 模型生成一条可能长达数万 token 的轨迹(推理链、代码修改、工具调用序列);
- 训练信号却常常只是一个标量——答案对了得 1 分,错了得 0 分,且只在轨迹结束后揭晓;
- 而优化更新却要施加在每一个具体 token 上。
一个 token 一个 token 地更新策略,却只有一个总体分数可用——「这笔奖金到底该记在谁的头上?」这就是 LLM RL 的根本困难。Minsky 在 1961 年就把它列为学习系统的基本难题,至今没有公认答案。
1.2 现有方法如何绕开这个问题
正因为 token 级信用没有定义,现有算法各自发明了不同的替代品:
- PPO:训练一个价值网络(critic)逐 token 预测期望回报,用 GAE(广义优势估计)组合 TD 误差得到逐 token 的优势——把信用分配问题转化为「学一个逐 token 的预测器」;
- GRPO / RLOO:对同一 prompt 采样一组回答,用组内其他回答的奖励作为基线——把信用分配问题转化为「跟同伴比」;
- 蒸馏 / SFT:让教师模型逐 token 打分——把信用分配外包给教师。
这些方法都有效,但没有一个说得清自己算出来的量为什么配得上「信用」这个名字。不同的算法用不同的算法相关量来操作化(operationalize)信用,概念本身始终悬空。
1.3 为什么现在需要回答它
随着 Agent 任务的兴起,问题变得更严重了:agentic 轨迹中夹杂着环境观察(工具返回、执行结果),长度动辄上万 token,奖励更加稀疏。这带来两个新痛点:
- 细粒度信号越来越贵:粗粒度的响应级基线(GRPO/RLOO 式)把结局的随机性广播到每个 token,长轨迹下方差爆炸;
- 细粒度信号又特别脆:逐 token 信用是「相邻两次预期的差」,单步幅度极小(本文定理 4 将证明其总能量有界),critic 稍有误差或与策略稍有错位,误差就会淹没真实信用。
论文开篇引用了 Shannon 的名言:「这些定义的真正辩护,将在于其推论。」这篇论文做的事,正是先给信用一个严格的数学定义,再让定义的推论去解释已有算法的现象、指导新算法的设计。
二、论文定位和关联工作
PACT 位于四条研究脉络的交汇处。
2.1 谱系一:critic-free 家族(组基线)
- RLOO(Ahmadian et al., ACL 2024):对同一 prompt 采样多条回答,用「留一法」(leave-one-out)平均奖励做基线,保证梯度估计无偏,是经典 REINFORCE 的现代化版本;
- GRPO(DeepSeekMath, arXiv 2402.03300):DeepSeek 提出,用组内奖励的均值和标准差做归一化优势,砍掉 PPO 的价值网络,节省一半显存与计算,成为 R1 及后续开源推理模型的主力算法;
- 改进变体:Dr. GRPO 修正长度归一化与 std 归一化偏差;DAPO 引入 Clip-Higher、动态采样;GSPO 把重要性采样提升到序列级;REINFORCE++ 加入全局优势归一化。
这一族的核心哲学:与其训一个不准的 critic,不如用同伴比较。它们回避了信用分配,而不是解决了信用分配。
2.2 谱系二:value-based 家族(学习 critic)
- PPO(Schulman et al., 2017):actor-critic 加 GAE,经典范式,但在长链推理上屡屡崩溃;
- VC-PPO(What’s behind PPO’s collapse in long-CoT?, arXiv 2503.01491):把长 CoT 中 PPO 的崩溃归因于价值初始化偏差与 GAE 中终端奖励信号衰减,提出价值预训练与解耦 GAE;
- VAPO(arXiv 2504.05118):集成 value pretraining、解耦 GAE、长度自适应 λ,是首个在长 CoT 任务上显著超越 value-free 方法的 value-based 框架;
- SAO(arXiv 2607.07508):单 rollout 异步优化 + 学习型价值模型 + 长度自适应 GAE 系数(长度增加时 λ 趋近 1)。
这一族一直在修 critic,但修的是工程症状(初始化、衰减、异步),缺乏统一的原理性诊断。
2.3 谱系三:信用分配理论
- 经典工作:RUDDER 的回报分解、Hindsight Credit Assignment 的后见之明归因、Counterfactual Credit Assignment 的反事实基线、Temporal Value Transport 的注意力价值传输;
- VinePPO(ICML 2025, arXiv 2410.01679):利用语言环境可从任意前缀重放的特性,用蒙特卡洛续写替代学习型 critic 做无偏逐 token 价值估计,并发现学习型 critic 在推理任务中的排序能力接近随机;
- 综述:Pignatelli et al.(arXiv 2312.01072)与 From Reasoning to Agentic(arXiv 2604.09459)都指出:现有方法用不同的目标量与估计流程操作化信用,缺乏统一数学刻画。
PACT 的定位正是补上这一层:给出 token 级信用的公理化定义与唯一表示定理,然后把上述所有算法放进同一个坐标系里比较。
2.4 谱系四:在线策略蒸馏(OPD)
- On-Policy Distillation(Thinking Machines Lab 博客, 2025;Qwen3 采用):学生自己采样轨迹,教师对每个 token 给出反向 KL 作为密集信号。Qwen3 报告 OPD 以约十分之一的 GPU 时数达到与 RL 相当的推理成绩;后续研究(Rethinking On-Policy Distillation, arXiv 2604.13016)指出有效蒸馏要求教师与学生思维模式兼容且提供新知识;
- 已有工作把 OPD 目标代数化简为「密集 KL 正则的 RL」,教师-学生对数概率比扮演 token 级优势——但这只证明了优化层面的等价,没证明该信号与结局奖励一致。
PACT 的定理 2 补上了缺失的一环:在理想教师假设下,OPD 的期望策略梯度与唯一信用诱导的策略梯度成比例。
2.5 定位总结
| 维度 | 之前的路线 | PACT 的突破 |
|---|---|---|
| 概念基础 | 信用 = 各算法自定义的量 | 三正则条件唯一确定,公理化 |
| 解释力 | 各说各话 | 统一解释 OPD / RLOO / GAE-λ 现象 |
| critic 诊断 | 工程症状(初始化、异步、衰减) | 误差量级 vs 信用量级的结构性失衡 |
| 改进方向 | 修修补补 | 从定理直接推导:λ=1、先 actor 后 critic、IS 修正、BCE |
| 成绩 | GRPO 64.07 / PPO 59.71(数学平均) | 72.87 |
一句话定位:这是第一个把「LLM RL 里的信用到底是什么」讲清楚的工作,并顺手用这个定义造出了一个更强的训练算法。
三、问题定义
3.1 从具体困惑到抽象问题
具体困惑:我们想让每个 token 知道「你对最终结果贡献了多少」,但奖励只在结尾出现一次。
论文的核心洞察是:信用分配的本质不是「把奖励切开分给 token」,而是刻画关于最终奖励的统计信息如何随着生成过程逐步展开。这类似于一个赌局:你的期望收益随每一局的进行不断更新,每一局的「真实贡献」就是那一瞬间期望的变化量。
3.2 形式化设定
给定 prompt q,一条实现轨迹为:
Y = (q, T₁, O₁, T₂, O₂, …, T_τ, O_τ)
其中 Tᵢ 是策略生成的第 i 个 token,Oᵢ 是环境返回的观察(工具返回、环境转移、用户反馈;允许为空,普通自回归生成是 Oᵢ 恒为空的特例)。终端奖励 R = R(Y) 是整条轨迹的函数,不必归属于任何具体 token。
定义信息滤流 Fᵢ = σ(q, T₁, O₁, …, Tᵢ, Oᵢ),即第 i 步之后「已公开的信息」,以及条件奖励预测:
Vᵢ = E[R | Fᵢ]
这就是「看到目前为止的所有剧情,对结局的最新预期」。
3.3 三个正则条件:什么样的分配配叫「信用」
设 Cᵢ 为分配给第 i 个 token 的信用。论文提出三条公理:
| 条件 | 直觉含义 | 排除的病态 |
|---|---|---|
| 完备性(Completeness) | Σᵢ Cᵢ = R − E[R|F₀]:全部分信用加起来,要恰好解释「实际结果与最初预期的偏差」 | 全体不发钱(分配与结果无关) |
| 前缀一致性(Prefix Consistency) | 前缀一旦生成,其累计信用就固定下来;未来不同实现不得回头修改已结算的部分 | 用「事后诸亮」篡改历史贡献 |
| 中性性(Neutrality) | E[Cᵢ | Fᵢ₋₁] = 0:在生成第 i 个 token 之前看,它的期望信用为零——既不系统性高估也不低估 | 在 token 之间做可预测的零和转账 |
用团队项目类比:奖金总额要对得上实际业绩(完备性);某成员的贡献不能因为项目后来的走向而被改写(前缀一致性);评价一个决定好不好,不能事先就内定了它的分数(中性性)。
3.4 抽象问题定义
给定轨迹空间、终端奖励 R 与信息滤流 {Fᵢ},求满足上述三条件的 token 级信用分配 {Cᵢ}。
这个抽象的精妙之处在于:它不假设信用是奖励的一部分、不假设信用可观测、不绑定任何算法,只用「信息如何随生成展开」这一最本质的数学结构。马尔可夫化(把完整历史当状态)只是表示,不构成信用分配;信用需要的是对信息流的额外刻画——这正是论文补上的东西。
四、问题解法
论文的解法分三层:先证明唯一表示定理,再用定理重新解释三个已有现象,最后从解释中推导出 PACT 算法。
4.1 第一层:唯一表示定理
定理 1:满足三条件的 token 级信用分配存在且唯一(在几乎必然相等的意义下),且
Cᵢ = Vᵢ − Vᵢ₋₁ = E[R | Fᵢ] − E[R | Fᵢ₋₁]
即条件奖励预测的增量序列,且 {Cᵢ} 是关于 {Fᵢ} 的鞅差分序列。
鞅差分的通俗理解:把生成过程想成一个公平赌局,Vᵢ 是第 i 步后你的「账面期望」。鞅差分 Cᵢ 就是每一局结束后期望的净变化——开奖前它的期望为零(公平),开奖后它就是这一局带给你的真实输赢。每局的净输赢加起来,恰好等于最终盈亏与入场预期的差。
论文还在附录 C.2.3 用一个两步 Rademacher 反例证明:三个条件缺一不可,去掉任何一个都能构造出满足其余两条但面目全非的分配。推论 1 进一步说明:任何更粗粒度的信用(如轮次级)都是 token 级信用在连续段上的聚合——所以研究最细粒度就够了。
4.2 第二层:用唯一表示重读三个现象
现象一:OPD 的教师是隐式 critic(定理 2)。 把理想教师定义为在 KL 约束下最大化期望 token 动作值 Qπ 的分布(教师比学生强,但贴着学生的 on-policy 分布),则 OPD 的期望更新方向满足:
G_OPD(q★) = (1/β) · E_π[Zₜ Cπₜ | Fₜ₋₁]
即与唯一信用诱导的策略梯度成比例。教师没有价值头,却在扮演 critic 的角色——这解释了为什么蒸馏能以低得多的算力逼近 RL 效果。
现象二:RLOO 的响应级基线梯度等价(定理 3)。 虽然留一基线 R̄₋ᵢ 定义在响应级别、广播到所有 token,但可以证明:
E[∇log π(Tₜ)·(Rᵢ − R̄₋ᵢ)] = E[∇log π(Tₜ)·Cₜ]
组基线方法在期望意义上「歪打正着」。但论文强调:期望等价 ≠ 统计效率等价。条件期望 Vₜ 是所有 Fₜ 可测预测器中均方误差最小的,而响应级基线保留着结局的随机性——长轨迹下这些波动相对局部信用可能很大。这就是 GRPO/RLOO 在超长轨迹上的结构性劣势。
现象三:信用是近似稀疏的,GAE 的中间 critic 误差会淹没它(定理 4)。 对归一化到 [0,1] 的奖励,有
E[Σᵢ Cᵢ² | F₀] = Var(R | F₀) ≤ 1/4
且超过任意阈值 κ 的信用个数期望不超过 1/(4κ²)——与响应长度无关。一条上万 token 的轨迹,其信用总能量不超过 1/4,均摊到每步是天文数字级的小量。而 GAE 分解表明:λ < 1 时估计优势中保留一项中间 critic 误差 (1−λ)Σλⁱ⁻ᵗεᵢ;λ = 1 时该项消失,只剩 ¹ = R − V̂ₜ₋₁。
用秒表类比:信用稀疏意味着要测的每段时间极短。λ<1 的 GAE 相当于把一块不太准的秒表反复起停累计——每次的微小误差乘以指数衰减后仍随步数累积;λ=1 则是只看起点的钟和终点的钟,中间秒表完全不参与。当待测信号本身极小时,宁可承受蒙特卡洛的方差,也不要承受秒表的系统性噪声。这解释了 DeepSeek-R1 报告的 λ=1 优于 λ=0.95,也解释了 SAO 的长度自适应 λ 为何趋向 1。
4.3 第三层:PACT 算法
定理 1 和 4 合起来给出行动纲领:信用 = 相邻条件预测之差,而每步信用极小,所以 critic 必须准且与当前策略同步。PACT 由三个组件构成。
组件一:Actor-then-Critic 更新顺序。 标准 PPO 中 actor 与 critic 的更新相互独立,导致用于计算优势的 critic 值总是「上一个策略版本学的」——策略-critic 滞后(policy-critic lag)。PACT 强制顺序:先用当前 critic 支持的所有 actor 更新完成,再做一次额外前向计算新旧策略的对数概率比,最后训练 critic,让每轮结束时 critic 对齐刚更新完的 actor。
组件二:重要性采样修正 critic 目标。 关键问题是:rollout 数据来自旧策略 μ,凭什么训练新策略 π 的 critic?测度变换给出答案:Vπ = E_μ[IₜR | Fₜ₋₁],其中 Iₜ 是续写重要性比率。所以只需把 critic 的训练目标从 R 换成 Iₜ·R,旧数据就能训练新策略的价值函数。工程上,完整续写比率方差太高,PACT 用 detach 的当前 token 比率 ρₜ·R 作为一步截断代理(附录 C.7 证明它是「第一步换新策略、其余沿用旧策略」的混合策略的精确价值,是一阶修正的截断),并屏蔽比率落在 [0, 6] 之外的 token。代价仅为一次额外前向传播,无需新 rollout。
组件三:BCE 替代 MSE 训练 critic。 奖励归一化到 [0,1] 后,critic 用 sigmoid 参数化 V̂ = σ(z),用二元交叉熵训练。数学上 BCE 与 MSE 的最优解相同(都是条件期望 Vᵢ),但分类式目标的梯度性质更好;论文消融显示 BCE critic 收敛显著更快、正负样本的价值分离度更大。
三个组件全景对比:
| 组件 | 类比 | 输入 → 输出 | 解决什么 |
|---|---|---|---|
| Actor-then-Critic | 先改岗位、再按新岗位校准评估员 | rollout → 顺序依赖的更新图 | 策略-critic 滞后 |
| IS 修正目标 I·R | 给旧报表乘汇率换算系数 | 旧策略数据 → 新策略价值 | 用旧数据训新 critic 的分布错位 |
| BCE 损失 | 把打分题改成判断题 | logit → 概率化价值 | MSE 在小信号上的梯度退化 |
伪代码一览(每轮迭代):rollout → 记录旧 log-prob → 用当前 critic 算信用更新 actor(B 步)→ 新策略前向得 ρ → 屏蔽 [ρmin, ρmax] 外样本 → 以 Y = ρ·R 为目标用 BCE 更新 critic(B 步)。
五、评估指标与实验证据
5.1 评估体系
| 指标类型 | 指标 | 定义 | 衡量的能力 |
|---|---|---|---|
| 主指标(数学) | Avg@16 准确率 | 每题采样 16 次的平均答对率 | 策略分布的整体正确率(比 pass@1 更稳) |
| 主指标(编码) | SWE-bench Verified pass@1 | 真实 GitHub issue 的单次解决率 | agentic 长程任务完成能力 |
| 消融指标 | 训练奖励曲线稳定性 | EMA 平滑后的均值轨迹奖励 | 训练是否崩溃/发散 |
| 消融指标 | 价值分离度 ΔV | 正负样本平均预测值之差 | critic 的判别质量 |
| 消融指标 | 平均步间预测差 |V̂ₜ−V̂ₜ₋₁| | 相邻前缀的预测变化幅度 | 验证信用稀疏性(定理 4) |
5.2 实验设置
- 数学推理:Qwen3.5-4B,DAPO-Math-17k 子集(3200 题,优先保留初始策略 pass@1 失败的题),OpenCode agentic harness(Python 沙盒 + \boxed{} 格式奖励),结果奖励为最终答案正确性。评测:AIME 2025 / AIME 2026 / BeyondAIME / HMMT Nov. 2025。这些竞赛基准区分度高、污染风险低(BeyondAIME 与 HMMT 2025 尤为新颖),能拉开方法差距。
- agentic 编码:Qwen3.6-35B-A3B,OpenSWE 环境,Codex agent 经 Harbor 执行,终端奖励来自任务验证器。SWE-bench Verified 是真实软件工程任务的金标准。
- 训练框架:Dressage(基于 slime);每轮 512 条轨迹;GRPO 为 64 prompt × 8 采样;上下文 128k、单轮生成上限 64k token;actor 学习率 1e-6,critic 5e-6。
5.3 主结果
数学推理(Avg@16 准确率 %)
| 方法 | AIME 25 | AIME 26 | BeyondAIME | HMMT | 平均 |
|---|---|---|---|---|---|
| Base Model | 46.67 | 51.25 | 28.63 | 37.50 | 41.01 |
| GRPO(κhigh=0.28) | 76.50 | 74.78 | 41.81 | 63.19 | 64.07 |
| PPO(λ=0.95) | 32.33 | 29.38 | 17.86 | 25.67 | 26.31(训练中崩溃) |
| PPO(λ=1.0) | 66.04 | 73.96 | 40.31 | 58.54 | 59.71 |
| SAO | 51.25 | 63.33 | 36.63 | 53.33 | 51.14 |
| PACT w/o IS | 76.04 | 82.50 | 51.38 | 61.04 | 67.74 |
| PACT | 83.12 | 85.21 | 51.69 | 71.46 | 72.87 |
SWE-bench Verified(Qwen3.6-35B-A3B,pass@1 %)
| 方法 | Base | GRPO | PPO(λ=1) | SAO | PACT |
|---|---|---|---|---|---|
| pass@1 | 60.8 | 65.4 | 65.0 | 63.6 | 67.4 |
5.4 实验如何证明论点
- PACT 超 GRPO +8.80pp、超 PPO(λ=1) +13.16pp、超 SAO +21.73pp(数学)——证明「修好 critic」路线的上限高于「绕开 critic」路线,直接支撑论文「信用需要好的价值估计」的核心主张;
- PPO(λ=0.95) 崩溃至 26.31(低于基线的 41.01),λ=1 则正常——这是对定理 4 最有力的证据:中间 critic 误差在长轨迹上可以大到摧毁训练,λ=1 消除该项后立刻恢复。四项基准上方向一致,不是单一数据集的偶然;
- PACT w/o IS(67.74)→ PACT(72.87),+5.13pp 且四项全升——反事实验证组件二:去掉重要性修正,优势幅度恰好退化 5 个点,证明「critic 对齐新策略」不是锦上添花而是实质来源;
- BCE vs MSE 固定策略消融——同初始化、同数据下 BCE critic 的 BCE 与 MSE 损失都更低、ΔV 分离更大,排除「只是换了个度量」的解释;
- 附录图 4:训练中响应越来越长,而平均 |V̂ₜ − V̂ₜ₋₁| 反而下降——与定理 4 的稀疏性预言定量一致:更长的轨迹把固定总能量摊得更薄。
需要诚实指出的边界:SWE-bench 上的领先幅度(+2.03.8pp)明显小于数学(+8.821.7pp),说明在更强的基座、更长的 agentic 轨迹上,critic 对齐的边际收益收窄;PPO(λ=1) 在编码上其实与 GRPO 几乎打平(65.0 vs 65.4),PACT 的编码增益是否全部来自理论所指向的机制,论文未做编码侧消融。
六、效果优势的根源解释
6.1 根源机制与证据链
因果链一(为什么赢 GRPO):响应级基线保留结局随机性 → 长轨迹下方差相对局部信用爆炸 → 逐 token 差分提供方差最小的信号。 RLOO/GRPO 的基线由有限条同伴样本的平均构成,本身是随机变量;而 Vₜ = E[R|Fₜ] 是均方误差意义下最优的 Fₜ 可测预测器。信用总能量 ≤ 1/4(定理 4)意味着「值得估计的信号」极小,基线自身的抖动很容易比信号还大。链条中「GRPO 基线有随机性」是论文实验+定理 3 已支持的事实;「方差差主导了 8.8pp 的差距」是论文的机制解释,属合理推断——论文未直接测量两组梯度的方差比,此步标注为部分推测。
因果链二(为什么赢 PPO):PPO 的 critic 同时受困于两个问题——λ<1 保留中间误差(被定理 4 放大到淹没量级)+ critic 滞后策略一个版本(差分后误差直接进入信用)。 PACT 的三个组件逐一对应:λ=1 消掉中间误差项(数学证据:λ=0.95 崩溃 vs λ=1 正常,26.31 vs 59.71);Actor-then-Critic + IS 修正把滞后一轮的 critic 搬到新策略分布上(反事实证据:去 IS 掉 5.13pp);BCE 让小信号下的价值学习更快更稳(固定策略消融)。这条链的每一环都有论文内实验直接支撑,是三条链中最扎实的。
因果链三(为什么 PPO(λ=0.95) 会崩溃):中间 critic 误差 × 长轨迹 = 优势估计被噪声主导 → 策略被噪声梯度推离数据分布 → 崩溃。 这是论文对现象的归因。注意 VC-PPO 给出过另一种归因(价值初始化偏差 + 终端信号衰减),两者并不互斥:初始化偏差本身就是 εᵢ 的来源之一。此链条的「策略被噪声梯度推离分布」一步是推测性机制假设(论文未展示崩溃时的策略熵或 KL 轨迹)。
6.2 相关工作检索与对照
围绕上述因果假设,我进行了外部检索交叉验证(检索关键词包括 GRPO DeepSeek、RLOO advantage baseline、GAE lambda bias variance、on-policy distillation teacher、critic lag PPO、DeepSeek-R1 PPO lambda 1、VinePPO、importance sampling critic、cross-entropy value function 等):
| 研究(可核验链接) | 相似尝试 | 相关结论 | 与本文的差异与适用边界 | 对根源解释的影响 |
|---|---|---|---|---|
| VinePPO, ICML 2025 | 用 MC 续写替代学习 critic 估计逐 token 价值 | 发现学习型 critic 在推理任务中排序能力仅略好于随机;MC 无偏价值显著改善 PPO | 用采样换精度,开销 O(K·L) 额外前向;PACT 用 IS+BCE 修 critic 而非绕开 | 强支持因果链二的前提「critic 质量是瓶颈」——独立团队用完全不同方法得出同结论 |
| DeepSeek-R1, arXiv 2501.12948 | PPO λ=1 优于 λ=0.95 | 长链推理上 λ=1 更稳 | 经验报告,无理论解释 | 支持定理 4 的预言;本文把经验观察升级为可证明机制 |
| VC-PPO, arXiv 2503.01491 | value pretraining + 解耦 GAE 救 PPO | 把崩溃归因于价值初始化偏差与 GAE 终端衰减 | 归因侧重不同(初始化 vs 中间误差累积),修法不同(预热 vs λ=1) | 补充并部分限定:说明 critic 修复路径不唯一,本文归因非唯一解释 |
| VAPO, arXiv 2504.05118 | 集成式修 PPO(长度自适应 λ→1 等) | 首个显著超越 value-free 的 value-based 框架(AIME24 60.4) | VAPO 策略侧用 λ_P=0.95(解耦),本文主张策略侧也该 λ=1 | 支持「修好 critic 能赢」+「长序列 λ→1」;限定:解耦 λ 是否与统一 λ=1 等价,本文未对比 |
| Stop Regressing, ICML 2024 | 分类交叉熵训练价值函数 | Categorical CE 在 Atari/机器人/Transformer 任务上全面优于 MSE 回归,抗噪抗非平稳 | 非 LLM RL 场景;本文用二值 BCE 而非分箱 CE | 支持组件三;跨域独立证据,非本文自证 |
| Retrace(λ), NeurIPS 2016 / V-trace (IMPALA) | 截断重要性采样修正 off-policy critic 训练 | 截断 IS 是处理 critic-数据分布错位的成熟工具 | 原目的为数据复用/异步去偏;PACT 将其转用于「向更新后策略对齐」,并配 BCE 处理 [0,1] 外的目标值 | 支持组件二的方法学根基;用法迁移是本文新意 |
| On-Policy Distillation, Thinking Machines 2025;Qwen3 报告 | 学生采样、教师逐 token 反向 KL 密集监督 | Qwen3 以约 1/10 GPU 时数达到 RL 相当的推理成绩 | OPD 不依赖 outcome reward;本文定理 2 仅在理想教师(KL 约束最优)下证等价 | 补充定理 2 的现实意义:解释 OPD 为何有效的必要条件,但真实教师未必满足理想化假设 |
| RLOO, Ahmadian et al. ACL 2024 | 留一基线保证无偏 | 与组基线同族,广泛使用 | 本文定理 3 证明期望等价的同时指出统计效率差距 | 支持因果链一的「期望正确」前提,同时被本文「方差差距」论述所深化 |
| 信用分配综述, arXiv 2604.09459 | 系统梳理 69 篇工作的信用粒度谱系 | 明确指出 REINFORCE/GRPO=episode 级、PPO=学习型 token 级、DPO=隐式 token 级,无统一刻画 | 综述视角 | 定位:确认本文填补的正是综述指出的概念真空 |
| Dr. GRPO, arXiv 2503.20783 等组基线修正 | 修 GRPO 的长度/std 归一化偏差 | 组基线的偏差在特定问题分布下有害 | 修 advantage 的统计性质,不涉及信用定义 | 限定因果链一:GRPO 的劣势部分来自归一化偏差等实现细节,非全部来自基线随机性 |
在本次检索范围内未发现与本文核心主张(信用 = 鞅差分表示)直接竞争的同期公理化工作;也未发现证明「λ=1 在 LLM RL 中普遍有害」的相反结论——最接近的反向证据是经典 GAE 文献(Schulman et al. 2015)中「λ<1 降方差」的传统智慧,但那是「critic 准确」前提下的结论,与本文「critic 误差 » 信用幅度时」的条件化论述不构成矛盾,而是同一权衡在不同信噪比区间的两个解。
6.3 综合判断与未决问题
得到多项独立研究共同支持的机制:
- critic 质量是 LLM RL 的主要瓶颈——VinePPO(绕开)、VC-PPO/VAPO(修复)、本文(理论+修复)三条独立路径同结论;
- 长序列下 λ 趋近 1 有利——DeepSeek-R1 经验、SAO 与 VAPO 的设计选择、本文定理 4 与 PPO(λ=0.95) 崩溃实验;
- 分类式目标训练价值函数优于 MSE——Stop Regressing 跨域证据 + 本文固定策略消融;
- 截断 IS 修正分布错位可靠——Retrace/V-trace 十年工程传统 + 本文去 IS 消融。
仍属单源或推测的部分:
- Actor-then-Critic 更新顺序本身的独立贡献未被拆解(消融只移除 IS,未在保持 IS 的情况下打乱顺序);
- BCE 在 LLM RL 场景的增益目前只有本文一个消融 + 跨域类比;
- 定理 2 的理想教师是理论构造,真实教师与学生的思维模式偏差(Rethinking OPD, arXiv 2604.13016)会在多大程度上破坏等价性,论文未量化;
- PPO 崩溃的「噪声梯度推离分布」机制是合理假设而非直接观测。
优势成立的前提条件: outcome-only 稀疏奖励、有界奖励、长 horizon、能负担 critic 前向、轨迹由完整历史构成状态。可能失效的条件: 若奖励本身是过程级密集信号(定理 4 的稀疏性论证不适用,λ<1 或重新占优);信用是统计概念而非因果概念(论文自己声明),干预式归因需求下该定义未必合适;三条件是公理选择——作者以非欧几何自况,换一组公理会得到不同表示;若未来 critic 架构(如过程奖励模型)能把误差压到信用量级以下,λ<1 的经典权衡可能重新主导。
七、必要知识反推
假设让一个完全没有背景的人重做这项工作,最少需要哪些知识?
7.1 领域知识层
- LLM 自回归生成与 token MDP 建模:不理解「完整历史=状态、下一 token=动作」,就无法把生成过程写成滤流 Fᵢ——这是全部形式化的起点;
- outcome 奖励的稀疏性:必须知道 LLM RL 的信号通常只有一个标量且延迟揭晓,否则不会意识到信用分配是瓶颈而非细节;
- agentic 轨迹结构:token 与环境观察交替出现、Oᵢ 可为空——不理解这点就无法让定义同时覆盖纯生成与智能体交互两种场景。
7.2 方法论知识层
- 测度论概率:条件期望、σ-代数与滤流、停时、鞅与鞅差分序列——定理 1 的存在性与唯一性证明完全建立在这些工具上(有限时域鞅由终端值唯一确定是关键引理);
- 策略梯度与方差缩减:REINFORCE、基线不引入偏差的证明、GAE 的偏差-方差分解——没有这些就无法识别「期望等价但统计效率不同」的微妙差距;
- 重要性采样与测度变换:E_μ[IₜR|F] = E_π[R|F] 的换测度技巧,以及 Retrace/V-trace 的截断实践——组件二的数学根基;
- 信用分配研究脉络:RUDDER、HCA、反事实方法用不同目标量操作化信用的事实——知道「别人没统一」,才谈得上统一。
7.3 工程知识层
- actor-critic 训练系统:rollout-训练循环、旧/新 log-prob 记录、DIS/PPO 裁剪、TIS 训练-推理偏移修正——PACT 的三个组件都要落在这些机制上;
- 大规模 RL 基础设施:Dressage/slime 框架、512 轨迹/轮的采样预算、128k 上下文管理;
- 评测协议:Avg@16 与 pass@1 的差异、AIME/HMMT/BeyondAIME/SWE-bench 的区分度与污染风险、训练子集按 pass@1 失败优先的构造法(保证 RL 有学习空间)。
7.4 知识融合的关键节点
- 节点一:把「信用」从名词变成「期望增量」。 需要同时握住鞅论(差分序列的数学性质)和 LLM 信息流(Fᵢ 的具体含义),二者缺一就无法写下 Cᵢ = Vᵢ − Vᵢ₋₁ 这个既抽象又具体的形式;
- 节点二:把换测度从「数据复用工具」变成「策略同步工具」。 Retrace 式 IS 修正本是 off-policy 学习的老技巧;洞察到 Actor-then-Critic 的顺序能把这个技巧重新目的化为「用旧数据训练新策略的 critic」,是排序上的创造性重组;
- 节点三:把数值误差分析与概率界结合。 单独有 Var(R) ≤ 1/4 只是习题;把它解读为「信用总能量有界 → 相对误差爆炸 → 经典偏差-方差权衡在低信噪比区间失效」,需要同时在两个领域间翻译;
- 节点四:方法论自觉。 引用 Shannon「定义的辩护在其推论」并自曝公理的可替换性(非欧几何类比),这种「公理 → 表示定理 → 解释现象 → 指导算法」的科研路线本身就是可迁移的方法论知识。
八、论文中可以提取的通用性灵感
灵感一:公理化优先——先让争议概念唯一化,再让推论干活。 核心思想:对一个各家自定义、互相吵架的概念,不急于提出第 N+1 种定义,而是找出少数几条人人都会默认同意的正则条件,证明它们唯一确定概念,然后让表示定理去裁决争论。 论文证据:三条件唯一确定信用后,OPD 教师等价、RLOO 梯度等价、λ=1 三个现象被同一框架解释,PACT 由推论直接导出。 推广场景:Agent 的「任务完成度」评测定义;对齐研究中「有用性」的公理化;软件工程中「技术债」的度量;统计学中「公平性度量」的公理比较。
灵感二:已有方法的成功是理论正确性的证据。 核心思想:当多个独立发明的方法都意外有效时,检查它们是否在某个更深层的量上等价——等价点往往就是问题的本质结构。 论文证据:蒸馏(教师监督)与 RL(奖励信号)表面是两条路,定理 2 证明理想教师下期望梯度成比例;RLOO 的粗糙基线被证明梯度等价。 推广场景:分析为什么多种 prompt 技巧都有效(是否都等价于某种分布约束);比较 RAG 与长上下文的等价条件;复盘组织里多个「土办法」同时奏效时的共性机制。
灵感三:误差必须与信号比量级,而非看绝对大小。 核心思想:判断一个近似好不好,不能只看误差本身多大,要看误差与待测信号的比值;信号极小时,「温和的误差」也是灾难。 论文证据:critic 误差未必惊人,但信用总能量 ≤ 1/4 且与长度无关,均摊后 critic 误差相对淹没信号——这直接推出 λ=1 的选择。 推广场景:A/B 测试中微小提升的显著性判断(信号低于基线抖动时结论无效);长链微服务中单步延迟归因;小样本下的模型能力差异检测;传感器融合中噪声下限设计。
灵感四:顺序也是算法——组件执行次序可以解锁新的修正能力。 核心思想:同样的组件,改变执行的先后依赖关系,可以创造出原本不存在的修正机会。 论文证据:Actor-then-Critic 的顺序使得「更新后策略的 log-prob」可用,从而 IS 修正才能把 critic 目标搬到新策略分布上;标准 PPO 的并行更新下这一修正无从谈起。 推广场景:数据管线中「先过滤后生成」与「先生成后过滤」的质检顺序;编译器 pass 顺序优化;先定价后成本核算 vs 先成本后定价的财务流程;先写测试后写代码的 TDD。
灵感五:把回归题改写成判断题。 核心思想:当回归目标又小又噪时,同样的最优解,换成分类式损失能获得更良性的梯度景观与更快的收敛。 论文证据:BCE 与 MSE 最优解相同(都是条件期望),但消融显示 BCE critic 收敛更快、正负样本价值分离更大;Stop Regressing 在多个深度 RL 域提供了跨域佐证。 推广场景:推荐系统评分预测改偏好分类;持续学习中的漂移检测;低信噪比下的医学指标预测;回归任务中梯度消失的替换方案。
灵感六:用换算系数复活旧数据,而非重新采集。 核心思想:分布发生了已知的变化时,与其丢弃旧数据,不如对旧数据乘上换算系数(重要性权重)使其在新分布下重新无偏。 论文证据:旧 rollout 乘以 token 级重要性比 ρ 后,即可训练更新后策略的 critic,代价仅一次前向传播,省下整轮重新采样。 推广场景:数据漂移下的模型在线校准;历史 A/B 实验数据在新人群上的复用;汇率/通胀调整后的跨期财务对比;仿真到实测的域偏移修正。
至此可以回到 Shannon 那句话:这篇论文对「信用」定义的全部辩护,确实都在它的推论里——四个被解释的现象、一个被推导出的算法、两张领先的成绩单。