DRACO 精读:没有验证器时,如何给长程 Agent 训练信号分步定责
DRACO(IBM×CMU)形式化’outcome-blind’训练设定——长程 Agent 任务往往没有程序化验证器可依赖。方法用训练中动态生成的 rubric 逐轨迹打一次分,再按’步骤涉及哪些标准’闭式分摊到每步 GRPO advantage,不引入任何可学习归因模块。AppWorld TN 上 Qwen3.6-27B TGC/SGC 69.4/41.1→85.3/70.6,反超偷看真值奖励的 GRPO +5.3/+11.3,τ-bench 零样本迁移 SR 15.8→20.4。