DRACO 精读:没有验证器时,如何给长程 Agent 训练信号分步定责
论文:DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training(arXiv:2609.04094,cs.AI,2026-09-03) 作者:Shubham Gandhi(CMU), Saurabh Goyal, Kiran Kate, Yara Rizk(IBM Research) 机构:Carnegie Mellon University + IBM Research(共同一作制,企业+高校合作) 代码:https://github.com/IBM/draco
一、题目
- 会议/期刊:arXiv 预印本(2026 年 9 月),方法+实验完整度对标 ICLR/NeurIPS 主会长文。
- 发表单位:IBM Research(Almaden/Yorktown 系)与 CMU 联合。IBM 出问题域(企业级 Agent 无验证器场景)与工程化能力,CMU 出研究方法论。
- 一句话概括:在"训练全程接触不到任何成功/失败真值"的最难设定下,DRACO 用动态 rubric + 闭式步级优势再分配,把长程 Agent 的 GRPO 训练做到了反超"偷看真值"的基线。
二、背景
研究脉络
RLVR(可验证奖励强化学习)是当前 LLM 后训练的主流配方:代码有单元测试、数学有精确匹配、Agent 有任务通过检查——verifier 供给可靠的终端奖励。但配方有一个未被充分正视的假设:存在程序化 oracle。客服 Agent、开放研究 Agent、企业流程 Agent 的"任务成功"往往无法用一段检查代码定义,构造 oracle 的难度与任务本身相当。
即便奖励存在,长程轨迹还有第二层困难——信用分配:AppWorld 一条轨迹几十步工具调用,把单一标量奖励平均摊给每一步,等于假设"成功轨迹每步都对、失败轨迹每步都错",统计上浪费且可能有害(成功轨迹里有冗余/侥幸步骤,失败轨迹里大多步骤是正确的)。
既有研究要么依赖终端验证器做步级信用(进度估计器、跨 rollout 递归、gold answer 似然),要么用 LLM 逐步打分(每次前向都要判官调用,且把"步"绑死在任务分解上)。outcome-blind 设定下的步级信用分配是一片空白。
与既有工作的差异
- 与 rubric 奖励系(轨迹级打一次分):DRACO 保留其"演化 rubric+逐轨迹打分"结构,但新增把判断按标准归属分摊到步骤的闭式机制。
- 与逐步打分法:无需每步一次判官调用,成本可控;“步"不由任务分解预设。
- 与训练判别器传播分数的方法(如 Xu et al.):不引入任何可学习归因模块——零新增训练组件。
三、定位
- 领域:LLM Agent 强化学习 / 信用分配。
- 问题层级:训练信号构造——介于奖励建模与策略优化之间。
- 核心声明:verification horizon 视角下,“任务自适应覆盖 + 忠实步级归因"是验证难于生成时必须同时满足的两轴;DRACO 是首个在 outcome-blind 设定下同时满足两轴的方法。
四、问题定义
设定:outcome-blind regime——训练全程不可访问任何 ground-truth 成功信号(无单元测试、无 gold answer);判官(frontier LLM)可用,但只在轨迹结束后调用一次。
目标:在 GRPO 框架内,把轨迹级的 rubric 判断转化为步级差异化优势 a_j,使得信用集中于 rubric 实际涉及的步骤。
约束(DRACO 的设计红线):
- 归因闭式解,无可学习模块;
- 满足七条形式化性质:总优势守恒、无信号使步总分为零、符号保持、单调正确性、步总分与轨迹长度无关、奖励尺度不变、胜负对称(附录 E.9 全部精确成立)。
五、解法
5.1 动态 rubric 生成(对应"任务自适应覆盖”)
- 每个任务,判官先从指令本身提出标准,再对 group 内每条采样轨迹各提一次标准(观察它实际怎么做的);
- 提案合并去重成规范集合后逐轨迹打分(0/1 或等级),得到 outcome-blind 奖励 R_i;
- rubric 随训练进程动态演化——policy 能力变了,评价标准跟着变,这是与"任务发布时冻结一套 rubric"的关键区别。
5.2 rubric 条件优势再分配(对应"忠实步级归因”)
- GRPO 先把 R_i 组内归一化成轨迹优势 A_i(这一步与标准 GRPO 完全一致);
- DRACO 的核心:根据判官给出的"哪个步骤触发了哪条标准的判定",把 A_i 按标准归属闭式重分摊到步骤——某步骤涉及的判分项越多,它分到的优势份额越大;
- 全程无梯度、无学习模块、无额外判官调用。
5.3 与 GRPO 的组合
再分摊发生在 GRPO 的 ratio/clip 之前——即 DRACO 完全兼容 GRPO 训练循环,只替换 advantage 的构造。
六、实验结果
6.1 主结果(AppWorld + τ-bench)
- Qwen3.6-27B:AppWorld TN(168 任务)TGC/SGC 69.4/41.1 → 85.3/70.6(+15.9/+29.5);TC(417 任务,未见 app)TGC 49.7→61.5;
- Qwen2.5-32B-Instruct:TGC/SGC 35.7/17.3→62.9/42.3(+27.2/+25.0),逼近使用真值奖励的步级信用方法 SALT(66.2/47.9);
- τ-bench 零样本迁移:SR 15.8→20.4——训练全程没见过 τ-bench、没用过任何验证器。
6.2 反超"偷看真值"的基线
- vs GRPO+AppWorld 单元测试真值奖励(同模型同超参):+5.3 TGC / +11.3 SGC(TN),一致性 p³ 下扩大到 +9.5/+13.7;TC 上 +1.6/+2.4;
- 随机奖励对照(检验"是不是随便什么信号都行"):74.0/50.0,远低于 DRACO 的 85.3/70.6——信号内容本身重要。
6.3 消融(两组件的贡献定位)
四路对比(完整 DRACO / 无动态 rubric / 无步级信用 / 两者都无):
- 动态 rubric + 步级信用合计:+4.2 TGC / +10.7 SGC(vs 固定 rubric 无步级信用),p³ 时 +8.1/+14.3;
- 单组件各自只有 +0.8/+1.0——两轴互补,单开任何一个都接近无效,直接验证了"覆盖×归因必须同时满足"的框架预测。
6.4 一致性提升 > 探索提升
TGC p³ 提升 +25.2 而 pass@3 仅 +3.9——DRACO 的主要贡献是让"本来偶尔能做对的任务变得稳定可复现"(retention 最高),这恰是生产环境最需要的性质。
6.5 判官消融
用 self-judge(policy 自己当判官)替换 frontier judge 仍优于真值基线——方法对判官强度不过度敏感。
七、知识反推
- “结果不可验证"不等于"不可训练”:把验证问题转化为评价标准的动态生成问题,评价的粒度从"任务成败"降级为"标准是否满足",前者无 oracle 而后者 LLM 可判。
- 轨迹级标量是长程任务的统计瓶颈:rubric 判断的分摊不是锦上添花——消融显示步级信用单独贡献 +5.7 SGC,是 SGC 增益的主要来源。
- 闭式归因 > 学习式归因:七条性质全部精确成立是闭式解独有的(学习模块只能近似),这也让方法免于归因模块自身的过拟合风险。
- 一致性是比峰值更值钱的指标:p³ 大幅领先而 pass@k 基本持平——训练方法的价值应该用"可靠性提升"而非"能力上限"度量。
八、通用灵感
- 与本课题(代码评审 Agent)的直接关联:代码评审同样缺乏"评审正确性"的程序化 oracle——评审意见的 Precision/Recall 依赖人工标注。DRACO 的"动态 rubric+闭式分摊"可直接迁移:把"评审应该发现哪些问题"作为 rubric 标准,把轨迹级评审质量分摊到"每条评审意见的生成步骤",可在标注稀疏下放大训练信号。
- 对 V5 迭代的启发:P/R 双指标之外,可引入 pass^k 式的"评审一致性"指标——同一 PR 多次评审的意见稳定性。
- 通用方法论:任何"判官可用但真值缺失"的训练场景(数据合成质量、Agent 输出安全性)都可套用 DRACO 的两轴框架:先问"评价标准怎么随能力演化",再问"判断怎么精确归属到行为"。
- 开放问题:判官自身的偏差如何进入 rubric(论文未系统分析判官偏见传导);rubric 演化的收敛性理论。
基于论文全文逐页阅读撰写;所有数字出自原文摘要、正文 §4 与附录 E.9。