论文链接:
- AED: Agent Error Dataset: Scaling 50,000 Error–Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training
- AREX-2: AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
代码仓库:AED 承诺开源(agenterrordata.apodex.com,接受后放出代码、数据与检查点);AREX-2 开源(GitHub: VectorSpaceLab/AREX-2,HuggingFace: BAAI/arex-2) 发表时间:AED 2026 年 10 月 1 日(arXiv v2,正文+附录 73 页);AREX-2 2026 年 9 月 29 日(arXiv v1,12 页) 机构:AED——Apodex(企业研究,Heng Ji 领衔,作者含 UIUC 系 AgentDebug/AgentDebugX 团队,特别鸣谢 Tianqiao Chen 项目主导);AREX-2——北京智源人工智能研究院 BAAI(Zheng Liu 领衔,企业级研究院) 领域标签:cs.AI / cs.LG / cs.CL
为什么要把这两篇放在一起读
Agent 后训练领域有一条无人明说的会计准则:失败 rollout 是费用。任务发出去、模型跑一遍、验证器打个分,通过的轨迹进训练集,没通过的直接核销。AgentTuning 用奖励过滤的成功轨迹做 SFT,RAGEN 和 AgentRL 把策略优化扩展到多轮环境反馈——但一条失败轨迹里到底哪一步错了、该改成什么、改了之后真的会变好吗?这些问题在「费用」科目下没人追问。
2026 年 9 月末,两家机构在同一周内各自提交了一篇把「失败」从费用改成资产的论文,而且选择了两种几乎对偶的做法:
- AED(Apodex)把失败拆开卖。单步粒度:一个失败执行 + 一条诊断(定位到步、归因到 agent、引用证据、提议替换动作)+ 一次受控重放(同检查点、同预算、同验证器,替换修正与原动作重试双臂对照)。50,228 对、33 环境、19 harness 族、23 策略模型,全部自然失败、零注入。
- AREX-2(BAAI)把失败整条囤。轨迹粒度:教师 agent 在可执行环境里跑多小时、数百次工具调用的多轮迭代,整条轨迹按「终分高+过程合规」整体入选,失败轮、回退、被放弃的方案全部保留在上下文里,但损失只打在跟随失败之后推动进展的决策上。
一个在单步上做精细的因果审计,一个在轨迹上做粗粒度的行为模仿。它们共同回答的问题是:Agent 的错误怎么变成训练信号? 而它们各自的边界——AED 诚实到近乎自虐的 73 页附录,与 AREX-2 十分简洁的 12 页工程报告——恰好构成这个新方向的上下两面。
一、论文背景
1.1 失败数据目前的处理方式:丢弃
先看一个数字感受一下浪费的规模。AREX-2 论文开篇即指出:当前 agent 训练数据的通行构建方式是「任务提出→模型产出→验证器判过/不过→通过的留下」。因为一次通过的解最容易收集,需要长时间迭代的改进过程恰恰是第一批被丢掉的。结果是:一个 agent 在一个问题上工作数小时、反复测量反复修订、最终远超起点的轨迹,在训练数据里几乎不存在。模型学到的是「正确解长什么样」,而不是「解是怎么被改进出来的」。
AED 论文从另一个角度论证同一件事:一条失败的 rollout 包含的信息远多于它的最终奖励——agent 当时能看到什么、它选择了什么动作、环境如何回应。要把这些经验变成训练样本,需要回答三个问题:哪个决策该改?为什么错?改成什么?结局奖励(outcome reward)一个信号都不提供。AgentTuning、RAGEN、AgentRL 这些后训练工作都绕开了这个问题,因为它们只在「通过/不通过」的粒度上使用经验。
1.2 已有的失败分析资源:标注了「哪里错」,没标注「改成什么」
失败分析本身不是新领域。AED 的 Table 1 系统对比了 11 个先行资源,这里摘关键几项:
- MAST(Why do multi-agent LLM systems fail?)给多智能体失败做了分类学,标注 1,642 条 trace 的失败模式,但不定位到具体决策步,也没有修正动作。
- Who&When / Who&When Pro:定位哪个 agent 在哪一步造成失败(184 条自然失败;Pro 版用故障注入扩到 12,326 条),有定位无修正,无执行验证。
- AgenTracer:训练定位模型,构造归因数据(超过 2,000 条,混合自然+注入),但主要学习目标是诊断器(debugger)而非行动策略。
- AgentDebug / AgentDebugX:用矫正反馈从失败中恢复,AED 的诊断桥正是调用了 AgentDebugX 的 Python 归因 API。
- STeP:用教师合成失败构造 708 条样本做 actor 训练——但失败是合成的,不是自然发生的。
把这些资源摆在一起,缺口清晰可见:没有任何一个资源同时具备「自然失败(非注入非合成)+ 步级定位 + 轨迹证据引用 + 执行过的修正 + 同检查点原动作对照」。前四项是「失败资产」的定价要素,最后一项是这份资产能否兑现为因果结论的关键——我们后面会看到 AED 如何用它拆穿一个 30% 的统计幻觉。
1.3 反思训练的既有路径:能反思,但学不到「长程」
另一条相关脉络是反思训练。Reflexion(2023)用语言化的自我反思做上下文内强化;Agent-R(2025,复旦+字节 Seed)用 MCTS 从错误轨迹拼接恢复路径,训练 agent 及时反思——这是与本篇两文最直接的先例之一;ROFT(2026 年 9 月,UCSD+KAIST+Mila+MSR)证明仅对自我回顾解释做微调(无 RL 无教师)就能在 SWE-bench Verified 上达到 49.2%、追平 GRPO。这些工作证明了「解释/恢复行为本身是可训练的」,但有两个共同局限:其一,反思通常发生在单轮或短 horizon 内,缺乏「数小时、数十轮仍保持有效」的长程执行能力;其二,多数工作中失败轨迹只是构造正确样本的脚手架,最终训练目标仍然是正确答案。
AREX-2 把这两条局限挑明了:自我提升能力 = 反思(每轮增益 r̄)× 长程执行(有效轮数 T*),现有数据两者都示范不足。AED 则补充了第三块拼图:即便有了失败数据,「错误的上下文保留」与「错误的信号提取」必须分离处理——这是它训练视图设计的核心,也是后文反复出现的主题。
1.4 为什么现在做:基础设施齐了
两篇论文都不约而同地依赖同一批前置条件:可复现的执行环境与验证器(AED 用环境适配器统一任务、工具、成功验证器;AREX-2 用教师模型从 GitHub 仓库和在线判题机构造「任务+评分函数」环境)、够强的教师模型(AED 的诊断器用 GPT-5 mini 到 GPT-5.6 Sol、裁判用 Claude Opus 5 和 Gemini 3.1 Pro;AREX-2 的轨迹由教师 agent 生成)、以及足够便宜的重放/执行(AED 能对 3,062 对做双臂重放,每输入诊断成本 0.5-2.5 美分)。没有这些基础设施,「失败资产化」只能是口号。
二、论文定位和关联工作
2.1 AED 在失败学习谱系中的位置
AED 的定位是一份基础资源 + 一套标准化流水线,而非一个算法。它站在四条研究线的交汇处:
| 研究线 | 代表工作 | 与 AED 的关键区别 |
|---|---|---|
| 失败分类学 | MAST、AdaMAST | MAST 标注失败模式类别,AED 标注可执行的修正并验证之;AED 的错误类型学是事后归纳的侧车标签,不作为训练目标 |
| 失败归因/定位 | Who&When (Pro)、TRAIL、AgenTracer、AEGIS、TraceElephant、AgentRx | 定位资源回答「哪一步错」;AED 同时回答「改成什么、改了是否有效」,并首次提供同检查点对照(Ctrl. 列) |
| 从失败中恢复 | AgentDebug、AgentDebugX、TrajDebug、CUADebug | 这些工作研究恢复算法;AED 把恢复证据做成数据集字段(E0/E1/E2 证据分级),并训练 actor 使用之 |
| 失败数据用于训练 | STeP(合成失败)、EEF(失败专家轨迹中的有益动作)、Agent-R(MCTS 拼接) | STeP 失败非自然;EEF 只提取有益动作不保留诊断;Agent-R 面向短 horizon 交互环境;AED 面向 33 个环境的文本 agent 系统并分离诊断/恢复/偏好三种训练视图 |
值得单独一提的是 AED 与 AgenTracer 的正面对决(论文 Table 11):同一个底模(Qwen3-8B)、同一配方、同一评分器,各自数据训练后互测——AED 数据在 AED 自家 holdout 上 exact step 48.14 对 AgenTracer 数据 45.71(+2.44),在 AgenTracer 测试集上 31.65 对 40.72(-9.07)。两个资源各自主场领先,AgenTracer 的最大优势恰恰出现在注入错误子集(+13.31),而 AED 不含注入错误。这是「训练分布决定测试优势」的干净例证,也提示我们:自然失败与注入错误是两种不同的资产类别。
2.2 AREX-2 在自我提升谱系中的位置
AREX-2 自我定位为 AREX(Lu et al., 2026,深研递归自改进 agent)的续作,但其真正的知识谱系是「测试时扩展 + 数据蒸馏」的合流:
| 研究线 | 代表工作 | 与 AREX-2 的关键区别 |
|---|---|---|
| 上下文内反思 | Reflexion、ERL | 不改权重,反思写在上下文里;AREX-2 把反思行为蒸进权重 |
| 反思微调 | Agent-R、结构化反思(2509.18847)、ROFT | 证明反思可训练;AREX-2 把 horizon 从几轮拉到数小时数百轮,并显式建模 T* |
| 可验证环境训练数据 | SWE-Gym、SWE-smith、R2E-Gym、TOUCAN | 为 SWE/工具任务造成功轨迹;AREX-2 造的是「改进过程」轨迹,单轮允许失败 |
| 环境自动构造 | SWE-Gym 系 | AREX-2 的环境准入多了「简单基线必须显著低于参考解」的条件——保证环境有改进空间 |
| ML 工程 agent | AIDE、AI Scientist、Frontis-MA1 | 这些是 scaffold 里的循环;AREX-2 的口号是把循环搬进模型 |
2.3 两篇论文互为对方缺失的对照
把两张定位表叠起来看会发现一组漂亮的互补:AED 有 AED 没有的——单步因果审计(同检查点双臂重放)与大规模环境/harness/模型多样性;AREX-2 有 AED 没有的——整条轨迹的长程结构与端到端任务性能验证。AED 的 actor 训练只在六个开发环境上做单种子实验且真实环境倒退;AREX-2 的模型在六个大基准上全面开花但没有步级归因与净因果分析。一个证明了「失败数据可以被精确估值」,一个证明了「失败数据可以被粗粒度变现」——这是把它们放在一起读的最大收益。
三、问题定义
两篇论文面对的是同一个具体困境的两种抽象。
3.1 AED 的抽象:失败复用 = 定位一个可修订决策 + 检验一个具体替代
AED 的核心洞察是:失败 rollout 的复用价值取决于能否把它约减成「一个决策 + 一个替代动作 + 一对受控执行结果」。形式化地说,对失败轨迹 τ、被归因的步 t*、责任单元 u*、解释 e* 与替换动作 a*,重放在固定执行协议 η(同策略、同 harness、同预算、同验证器、同温度计划)下跑双臂:
- 治疗臂 p̂T = 通过次数/试验数(执行 a*)
- 对照臂 p̂C = 同上(重做原动作)
净因果增益 Δ̂η = p̂T − p̂C。注意失败的源 rollout 本身不能充当对照——它是在不同采样条件下产生的,这正是 AED 方法论上最较真的一条边界。
一个漂亮的类比:这相当于给 Agent 的每个错误做了一次随机对照试验(RCT)。以往你看一个修正「跑通了」就断定它有价值,相当于观察性研究里看到「吃药的人好了」;AED 的设计逼你回答「不吃药的人(重做原动作的人)是不是本来也会好」。这个抽象的精妙之处在于它把「修正是否有用」从语义争论(解释看起来合理吗)变成了可复算的统计量——而且证据分级 E0/E1/E2 全部可以从记录的结果重新推导,不需要再跑环境。
3.2 AREX-2 的抽象:自我提升 = r̄ × T*
AREX-2 把「自我提升」定义为测试时单任务扩展:给定更多轮次,agent 能凭自身判断把解变得更好。设 st 为 t 轮后的最佳得分,rt = E[st − st−1] 为第 t 轮期望增益,则:
总改进 E[sT] − s0 = Σrt ≈ r̄ × T*
其中 T* 是增益仍不可忽略的轮数,r̄ 是这些轮的平均增益。反思决定 r̄(每轮值多少),长程执行决定 T(能值多少轮)*。预算 T 是测试时扩展的资源,策略决定的是能把这个预算中多少轮变成有效的。
这个分解的精妙之处在于它把「自我提升」从一个营销词变成了两个可分别测量、分别训练的量:Frontier-CS 的五小时曲线直接画出了 T*(AREX-2 到第 5 小时仍 +2.2,DeepSeek-V4-Pro 第 2 小时就停在 44.7);BrowseComp 无反馈设置下的每轮增益比 AREX-122B 高约 3 倍,直接量化了 r̄。
3.3 两个抽象的对应关系
| 概念 | AED | AREX-2 |
|---|---|---|
| 失败的单位 | 单个错误决策(error–diagnosis 对) | 整条多轮轨迹(含失败轮) |
| 学习信号的位置 | 错误步之后的替换动作 | 失败轮之后的恢复性决策 |
| 因果验证 | 同检查点双臂重放(步级 RCT) | 整条轨迹终分筛选(轨迹级选择) |
| 防幻觉机制 | 对照组:原动作重试 | 环境:简单基线必须显著低于参考解 |
| 形式化目标 | Δ̂η = p̂T − p̂C | r̄ × T* |
注意最后一行的对应:AED 度量的是单步干预的因果效应,AREX-2 度量的是整个循环的累积效应。前者精确但局促(只在可重放环境可用),后者粗放但完整(覆盖不可重放的真实任务)。没有一个同时做到两者——这是这个领域目前最明显的空白。
四、问题解法
4.1 AED:AET 五阶段流水线
AET(Agentic Error-to-Training)把失败变成训练数据分五步,每步有明确的准入契约:
阶段 1:采集自然失败。环境适配器提供任务、指令、工具与成功验证器;保存策略、harness、环境身份、动作、观察与最终结果(含成功)。失败自然发生、不注入;基础设施故障、harness 故障、不可用评分器保留供审计但排除在 agent 错误目标之外。一个重要的边界区分:预算耗尽/循环/提前停止是「合理预算下的候选失败」(检查进展在哪里断裂,不默认归咎截断步);工具报错后任务仍成功的,整个排除出失败队列。
阶段 2:诊断。遵循 AgentDebug 到 AgentDebugX 的路径,产出:错误步、责任 agent/组件、带轨迹引用的解释、替换动作。特权信息(参考答案、验证器信号)单独记录,不进学生输入。多个 debuger 可复用同一存储失败——失败是持久资产,诊断是可再生产的服务,这是「数据集」区别于「一次性管线」的关键设计。
阶段 3:接地。解析被引步、引用文本在学生可见输入中的逐字对应,检查工具有效性与信息可得性(修正不能使用动作之后才出现的未来信息)。语义裁判评估归因与修复;被拒提案与接受提案一起保存。诊断 SFT 不要求重放成功——这是刻意的:标签语义与重放证据解耦。
阶段 4:受控重放。从恢复/重建的检查点启动两次新执行:一臂替换修正、一臂重做原动作,匹配策略、harness、预算、验证器与温度计划,保存种子、样本数、检查点保真度与双臂结果(含修复失败与对照通过的情形)。证据分级从存储结果直接推导:E0=接地未重放;E1=观察到恢复但不满足对照要求;E2=双臂各至少 2 次试验、治疗全过对照全败。一次成功重放只建立「观察到的恢复」,不建立唯一根因或可靠效应——这句话在附录里出现的方式让人想起临床医学对单例报告的态度。
阶段 5:构建训练视图。三种视图各有独立准入:诊断 SFT(失败轨迹→归因+解释+证据+修正提案,不要求重放);恢复 SFT(pre-error 历史→来自通过分支的已执行动作;post-error 变体把原错误动作及其拒绝作为被掩码的上下文,再监督修正);动作偏好(同状态执行过的备选+正向结果对比)。AED 论文里的一个诚实的注脚:action-DPO 离线试点(333 对,LoRA r=16)偏好一致率 54.6% 对底模 54.3%——无恢复收益,论文明确不把它当成果。
看一个具体例子(论文 Case A,AgentBench-OS):任务是统计 home 目录 .txt 文件中含 Linux 的行数、每个文件只处理一次。agent 找到文件、筛出含匹配的三个文件,然后执行 cat file1 file2 file3 \| wc -l 得 5,提交 5,验证器判负。诊断器归因到第 2 步:筛出「包含匹配的文件」不等于「文件里的每行都匹配」,命令丢失了行级过滤。shell 没有报任何执行错误——错误在「数的是什么」而不在「怎么执行的」。修正为 grep -h "Linux" file1 file2 file3 \| wc -l 得 4,双臂重放:修正臂过、原动作臂败。这就是一个最小的「失败资产」样本:定位、解释、替代、因果证据齐备。
4.2 AREX-2:三步数据构造 + 选择性损失
AREX-2 的流水线同样三步,但单位是轨迹。
第一步:构造环境。教师模型从 GitHub 仓库和在线判题机造「任务+评分函数」对:仓库类,教师读代码、识别仓库度量的指标,写一个「改进这个指标」的任务、一个在 agent 不可见的 held-out split 上算分的评分脚本、一个装好仓库与数据的沙箱;判题类,任务即题目陈述,评分尽量用 graded 分数(通过测试的比例、启发式解相对最优解的质量)而非二元判定——graded 评分让每一轮都有信息,二元判定只能告诉你还没成功。环境准入双条件且都靠执行验证:参考解(仓库自带模型或判题机 AC 提交)必须能跑通(证明环境工作),简单基线(原样仓库或朴素程序)必须显著低于参考解(证明有改进空间)。不满足第二条的环境直接丢弃——它们生产不出「持续改进的轨迹」。
第二步:跑长程轨迹。三个设计条件:
- 更多轮:小时级预算、数百次工具调用,且明确告知预算。知道预算改变工作方式:先建基线、用早期轮测量、后期轮做测量提示的修订,而不是一上来就交最优猜测。轨迹示范的正是「如何把更大的轮预算变成累积改进」——轮预算就是测试时要扩展的那个资源。
- 操作知识:改进一个解需要知道这个环境怎么运作——仓库暴露什么 API、数据加载器期望什么格式、约束允许哪些优化。这些知识不在任务陈述里,agent 在工作中按需获取:读源码与文档、搜依赖的论文与库、跑小实验,然后用于后续轮次。这些动作全部留在轨迹里。两类技能文档(skills)作为紧凑上下文提供:通用技能(从 ML 仓库与常见实践预编)与任务特定技能(搜索任务相关信息构建,任务本身的材料被排除)。
- 反馈在环:每轮以提交结束,agent 看到分数与环境报告后再决定下一步。降分轮不删除——每轮降分之后紧跟 agent 对它的反应,而「这个反应」正是要模型学的东西。
第三步:整条选择 + 选择性监督。轨迹整体保留的条件:终分高(最佳提交相对参考解达到阈值)+ 过程合规(用户-助手-工具格式、每个工具调用有观察、良好终止、不违规——例如不得从 held-out split 重构答案)。对单轮零要求。监督的分配是整个方法最精细的部分:整条轨迹保留为上下文,损失只打在「推动解前进」的决策上——诊断失败、修复它、更换策略、跑下一个实验、提交改进解。无进展的步骤(重复轮询、无新观察的调用、近重复轮次)零损失;系统消息、环境报告、检索文档零损失(它们条件化模型但不是要模仿的输出)。失败尝试留在上下文里让模型看到「必须从中恢复的状态」,损失打在随后做出进展的决策上——模型由此学会「如何响应失败并把它变成后来的改进,而失败本身留在上下文里」。
训练上,新轨迹与 AREX 前作的深研数据(原封不动)混合,SFT Qwen3.8-27B 得到 AREX-2。深研数据不变这一点是整个跨域实验的设计支点:AREX-2 在深研基准上相对前作的任何增益都只能来自新增的 ML/算法改进轨迹——即来自在「完全不同的领域」学到的长程反思。
4.3 两条流水线的核心设计收敛点
把两个解法并排放,会看到同一个设计决策出现了两次,措辞几乎雷同:
| 设计要素 | AED(Q.3 节) | AREX-2(2.4 节) |
|---|---|---|
| 错误/失败的处理 | 错误动作及其拒绝作为被掩码上下文保留 | 失败轮与回退保留为上下文 |
| 损失落点 | 只监督其后的修正动作 | 只对恢复性决策施加损失 |
| 理由 | 上下文/观察/被拒动作零损失(Eq. 1 掩码) | 「模型看到必须从中恢复的状态」 |
| 反思文本 | 诊断派生的反思作为被监督 Thought 字段的变体(实验显示无额外收益) | 反思发生在提交之间的决策里,无独立反思 token |
这不是巧合。两团队独立得出了同一条原则:错误上下文是条件,不是目标;训练信号在恢复里,不在错误里。第六部分会用外部文献解释为什么这条原则几乎必然成立。
五、评估指标与实验证据
5.1 AED:四个实验问题与各自的证据边界
AED 的实验部分组织成四个相互独立的人群(cohort),论文反复强调各人群分母不同、结论不可互换——这个纪律本身就值得学习。
问题一:修正有用吗(配对重放)。3,062 对配对尝试、1,284 个源任务。结果分层呈现:
| 提案规则 | 对数 | 原动作通过率 | 修正通过率 | 净增益 [任务聚类 95% CI] |
|---|---|---|---|---|
| 首提案 | 3,062 | 18.4% | 51.1% | +32.7 [28.4, 37.0] |
| 选定提案(最多搜 10 个) | 3,062 | 13.7% | 59.1% | +45.3 [41.3, 49.2] |
| 同 harness、状态完全恢复 | 871 | 6.1% | 53.2% | +47.1 [42.3, 51.7] |
| 替换 ReAct 延续 | 1,846 | 19.2% | 62.7% | +43.5 [39.5, 48.2] |
| 多智能体状态部分恢复 | 345 | 4.1% | 54.8% | +50.7 [44.2, 57.8] |
McNemar 不一致对 1,454 对修正赢、66 对原动作赢。这个实验证明的是修正的执行效用,不证明归因准确性、也不证明训练收益——三个问题需要三份证据。
这里必须停下来讲 AED 全文最重要的一个披露(附录 B.2):首提案「成功」的 1,564 次配对尝试中,原动作重试也成功的有 470 次(30.1%)。完整四格表:双过 470(15.3%)/仅修正过 1,094(35.7%)/仅重试过 93(3.0%)/双败 1,405(45.9%)。如果只统计「修正后任务通过」,你会把 15.3% 的双过案例也算成修正的功劳;净增益真正来自两个不一致格之差(1,094 − 93)。「通过的分支」与「有用的修正」是两个概念——这是所有做执行验证的人都能背走的一句话。同理,修订行为分析显示 1,744 次相邻诊断转移中 61.0% 停在同一步(解释与动作变、位置不变),说明「多轮诊断」更多是在原地改假设而不是在逐个排查独立错误——修订历史必须保留,因为只看最终诊断看不到这些。
问题二:诊断产出率。共同失败池(1,068 源任务、16 环境、10 harness 族、15 策略模型)上,AED 的 citation-first 裁判产出 93.5% 的结构化带引用诊断($0.0067/输入),对比 AgentDebugX all-at-once 49.0%、deep analysis 65.8%、多模型共识 48.4%(贵 3.7 倍)。注意这是产出兼容性测量而非标注精度——不按引用格式输出的方法可能定位很好但产量低。
问题三:AED 能训出有竞争力的诊断模型吗。冻结诊断发布(4,319 行、2,309 源任务、15 环境),1,656 任务全诊断 SFT Qwen3-8B(3 种子):
| 模型 | 943 案例 exact-step 一致率 |
|---|---|
| Qwen3-8B base | 47.19 |
| GPT-6 Astra(prompted) | 50.69 |
| Claude Sonnet 5(prompted) | 51.64 |
| Gemini 3.8 Flash(prompted) | 53.23 |
| Claude Opus 5(prompted) | 54.72 |
| AED SFT(1,656 任务,3 种子) | 63.56 ± 0.82 |
配对对比对最强 prompted 参考 +8.59 [3.81, 13.24]。四个训练规模单调上升:240 任务 53.13 → 480 任务 57.26 → 948 任务 60.59 → 1,656 任务 63.56。每个更大规模都意味着更多优化器更新,所以这是「记录的训练过程」而非干净的规模定律——论文自己标注了。
但公共基准迁移是另一幅图景,AED 没有回避:TrajErrBench 上三种子均值 15.43 vs 底模 18.72(两个种子倒退);Who&When 统一提示 +7.07 名义显著(p=0.049)但 13 个测试 Holm 校正后不存活;训练格式提示下 Who&When AG 大幅倒退(−21.4 到 −29.4,Holm 显著损失,主因答案契约违反);任务重叠审计后 Who&When 增益区间含零(+4.92 [−2.24, 12.08])。结论的原话值得抄录:内部定位是得到支持的训练结果;公共迁移仍是局限。
问题四:修复监督能改进行动策略吗。六个开发环境、单种子、与 success-only SFT 对照:WebShop-lite action-only/reflective +6.67(Holm 存活);TextQuest −8.33 到 −9.67(Holm 存活的损失,许多新丢的任务撞了步数上限);真实 ALFWorld 上 preventive 臂从底模 5.97% 掉到 0.75%,真实 ScienceWorld 从 9.67% 掉到 0.34%——开发 harness 上的 ALFWorld-lite 同一底模是 88.00%,说明 harness 与真实环境度量的根本不是同一件事。反思文本相对 action-only 无检测到的收益。结论限定为:修复效用是环境依赖的。
另有一个精巧的小实验回答「诊断内容到底加什么」(Table 27,150 个定位好的失败,四臂只换教练文本):原动作重做 18.7% → 通用「再考虑一下」27.1%(+8.4)→ 诊断+替换动作 32.2%(+13.5)→ 部署教练文本 36.1%(+17.1)。诊断减去通用再考虑的配对增益 +5.6,区间 [0.0, 11.3]——恰好在零的边缘。「给第二次机会」的效应比「给诊断」的效应更稳健,这个结果对整个「诊断即学习信号」的方向是一剂必要的清醒剂。
5.2 AREX-2:三层证据
第一层:训练域内的绝对水平(Table 1):
| 模型 | 规模 | Frontier-CS | MLE-Lite(Any Medal) |
|---|---|---|---|
| GPT-5.6 Sol | 闭源 | 76.4 | 72.7 |
| Claude Opus 4.8 | 闭源 | 74.5 | 63.6 |
| GPT-5.5 | 闭源 | 72.1 | 68.2 |
| Kimi-K3 | 2.8T | – | 72.7 |
| Naive-N0.5-Flash | 309B | – | 73.7 |
| Kimi-K2.6 | 1T | 46.9 | 66.7 |
| GLM-5.3-Flash | 320B | 50.4 | – |
| AREX-2 | 27B | 70.7 | 81.8 |
MLE-Lite 81.8 超最强基线 8.1 分、超最强闭源 9.1 分;Frontier-CS 70.7 为开源第一、距最强闭源 5.7 分。27B 对抗 1.6T-2.8T 依然站得住。
第二层:轮次扩展(对 r̄ 与 T 的直接测量)*。Frontier-CS 五小时曲线:AREX-2 起点不是最高的,1 小时 54.4、2 小时 65.9、5 小时 70.7,第 2 到第 5 小时再涨 4.8、最后一个小时仍 +2.2;DeepSeek-V4-Pro 第 2 小时后停在 44.7,V4-Flash 第 3 小时后停在 39.1。优势不在于起跑,而在于别人都停了它还在涨——这就是长 T* 的直接观测。无反馈设置(BrowseComp,评估期间无任何正确性信号):47 轮 64.8 → 143 轮 84.0;同等约 140 轮预算下超前代 AREX-122B 12 分以上,每轮增益约 3 倍,用不到一半轮数超过其终值。没有外部正确性信号也能改进——增益来自模型自己继续搜、重估、修订的判断,这排除了「被告知错了才改」的平庸解释。
第三层:阶段消融(MLE-Lite,五阶段,Figure 6):
| 阶段 | 配置 | 得分 |
|---|---|---|
| M0 | 底模 Qwen3.8-27B | 28.8 |
| M1 | +通用技能 | 41.2 |
| M2 | +任务技能+更多轮 | 68.2 |
| M3 | AREX-2,同 M0/M1 轮数 | 75.8 |
| M4 | AREX-2,同 M2 轮数 | 81.8 |
三个读数:操作知识很值钱(技能+轮数让底模从 28.8 到 68.2,零训练);训练在技能之外净加 +13.6(M4−M2,同技能同轮数只换模型);训练让轮数更值钱(M3−M2 = +7.6 用更少轮数反超,M4−M3 = +6.0 说明训练后的模型把新增轮变成进一步改进)。技能、训练、预算三者各自独立贡献,这是这篇 12 页报告里最扎实的一张图。
5.3 跨域迁移:AREX-2 的关键证据
深研四个基准上 AREX-2 全面超越用完全相同深研数据训练的前代:BrowseComp 84.0(AREX-122B 82.5)、HLE 52.6(52.4)、GAIA 92.2(85.4)、DeepSearchQA 93.8(89.9)。GAIA +6.8 的量级尤其说明问题——新轨迹里没有任何搜索任务,增益只能来自 ML/算法域学到的「反馈利用、操作知识获取、挫折恢复」这些行为。这是「长程反思是领域无关元技能」假说目前最硬的证据。当然边界也存在:BrowseComp 与 HLE 的绝对榜首仍是 GPT-5.6 Sol(90.4/58.0 全集)与 Claude Fable 5,27B 的跨域迁移有天花板。
六、效果优势的根源解释
6.1 根源机制与证据链
机制一:损失不打在错误上,打在恢复上——「条件化-目标分离」原则
- 因果链:错误动作/失败轮保留为上下文(零损失)→ 模型在训练时始终以「搞砸了的状态」为条件 → 监督信号全部落在「从这个状态出发做对的事」→ 模型学到的是错误后验条件下的良好策略,而非只见过全程顺利的分布。
- AED 侧证据(论文实验支持):post-error SFT 把原错误动作及其拒绝作为被掩码上下文、只监督修正;Eq. 1 的掩码设计使「actor padding 贡献零损失零 token」。
- AREX-2 侧证据(论文实验支持):失败轮不删、损失只打恢复性决策;Frontier-CS 上错误密度最高的 WebShop-lite(33.4% 步骤含错误)恰是 repair 训练增益最大(+6.67)的环境——修复监督在错误多发处收益最大,与机制的预测一致(此关联为阅读者推测,论文自己说「不能从暴露/更新差异中分离预算机制」)。
机制二:对照组剥离安慰剂增益
- 因果链:重试本身就有通过率(温度采样、环境随机性)→ 不设对照会把「重试通过」记为「修正有效」→ AED 的 30.1% 双通过率量化了这个安慰剂规模 → 净增益从不一致格之差来 → 修正的真实效用(+32.7)显著低于表观通过率(51.1)但仍稳健为正。
- 这是论文实验直接支持的(3,062 对、四格表、任务聚类 CI)。
机制三: graded 信号与改进空间的制度化保证(AREX-2)
- 因果链:环境准入要求简单基线显著低于参考解 → 保证每个环境都有可示范的改进弧 → graded 评分让每轮都有信息 → 轨迹能展示「更大预算→累积改进」的映射 → 训练后的模型在测试时把预算变成进步(T* 长)。对照实验:DeepSeek-V4-Pro 两小时后 r_t → 0,AREX-2 到第 5 小时仍 r_t > 0。
- 论文实验支持的部分:五小时曲线与消融 M4−M3。推测的部分:「环境有改进空间→轨迹有改进可学」的传导没有单独消融(论文未做「无改进空间环境」对照组)。
机制四:诊断信号本身的价值有限而真实
- AED 的定位帮助研究给出精确刻度:通用「再考虑」+8.4 [2.7, 14.8](稳健);诊断内容再加 +5.6 [0.0, 11.3](边缘)。诊断 SFT 在内部标签上 +16.4 点且随规模单调上升。综合读法:「第二次机会」是稳健收益,「知道错在哪」是边际收益——后者真实但脆弱(协议一换就消失)。这一条同时是两篇论文张力的核心:AREX-2 的数据里没有显式诊断标注,它的模型学到的更接近「结构化的再考虑」而非「步级归因」。
6.2 相关工作检索与对照
围绕上述机制,本次检索(关键词覆盖 learning from failure trajectories / negative examples agent tuning / reflection training / expert failures 等,2026-10-02 执行)找到如下外部证据:
| 研究(可核验链接) | 相似尝试 | 相关结论 | 与本文两篇的差异与边界 | 对根源解释的影响 |
|---|---|---|---|---|
| Agent-R(复旦+字节 Seed,arXiv:2501.11425) | MCTS 定位首个错误步、与相邻正确路径拼接,构造「从错误恢复」的修订轨迹做 SFT | 恢复能力可训练,三交互环境 +5.59%,且更早修正 | horizon 短(交互环境数轮);无受控重放对照;与 AED 的替换动作/AREX-2 的恢复决策同构 | 支持机制一:三团队独立发现「错误后接正确」是最小可训练单元 |
| EEF:Exploring Expert Failures(UCLA 等,arXiv:2504.13145) | 从失败专家轨迹提取有益动作混入 RFT 训练集,谨慎排除有害动作 | WebShop 62% 胜率超 RFT 53.6%,解掉此前不可解的子任务 | 轨迹级筛选、无诊断标注、无重放验证;AED 相当于它的「步级+因果验证」版 | 支持「失败轨迹含可提取信号」,并提示需要过滤(有害动作剔除) |
| NAT:Learning From Failure(EMNLP 2024 Findings,arXiv:2402.11146) | 给失败轨迹加「请生成一个错误解」的前后缀标签后混入训练 | 带标签负例提升三任务;无标签混入(NUT)反而降性能 | 单轮 QA/数学,非多轮 agent;标签方式是提示级而非掩码级 | 限定机制一:负例必须被恰当标记/结构化才能利用——裸混有害。AED/AREX-2 的掩码与选择性损失正是「恰当标记」的两种实现 |
| Microsoft debug-gym 负轨迹博客(2026-08,官方页) | 编码 agent 负轨迹按错误率过滤后训练;错误率 ≥80% 的剔除 | 最优过滤阈值 +4.1 pass@1;全收负例反而回落。两阶段效应:负轨迹教「坚持探索/回溯」,特权诊断信息教「快速定位」 | 工程博客、单模型;与 AED 的诊断视图/恢复视图分工惊人对应 | 支持机制一+四:负例教韧性、诊断教定位,两种信号可分离——正是 AED 双视图的独立证据 |
| ROFT(UCSD+KAIST+Mila+MSR,arXiv:2609.35741) | 仅对自我回顾解释微调(无 RL 无教师无正确轨迹) | SWE-bench Verified 49.2% 追平 GRPO 48.0%,且能解 64 次采样全败的任务 | 训练目标是解释 token 而非动作;与 AED 诊断 SFT 互为镜像(它训练「解释」,AED 训练「定位+改」) | 补充:解释本身即训练信号,支持 AED 诊断视图的合理性;但 AED 自己的反思无益结果提醒「解释」与「行动中的反思」可能不是同一能力 |
| GLOW(Tian 等,2026,负推理样本;本次检索自二手摘要,arXiv 编号未核验) | 纯负 CoT 样本 SFT vs 纯正样本 | 负例训练在 OOD 泛化上反超正例(负例含大量有效中间步) | 推理链非 agent 轨迹;未核验原文,证据等级降档 | 方向性支持「失败数据含独立价值」,标注为待核验 |
| 北大「弹簧效应」研究(2025-10,媒体报告) | 反向微调少量负样本即快速摧毁对齐 | 负样本未经结构化直接用于训练的破坏力极强 | 任务设定为安全对齐非 agent 技能;只能类比 | 反向限定:印证 NAT 的警示——失败数据的利用方式比数量更关键 |
诚实的检索记录:在本次检索范围内,未发现任何工作同时做过「同检查点双臂重放对照」——AED 在这一点上确属首创;也未发现对 AREX-2 式「数小时级改进轨迹」的独立复现(论文发表仅数天,尚不可能有)。亦未发现直接反驳「保留失败上下文+监督恢复决策」设计的同行工作;最接近的反例是 NAT 的 NUT 变体与 AED 自己的 TextQuest/真实环境损失——它们反驳的都是「无结构地用失败」,而非这条设计本身。
6.3 综合判断与未决问题
多研究共同支持的机制(三项以上独立证据):(1) 失败轨迹含可提取的学习信号(EEF、Agent-R、NAT、ROFT、debug-gym、AED、AREX-2);(2) 信号利用必须结构化——标记、掩码、过滤或对照(NAT 的 NUT 反例、debug-gym 的过滤曲线、AED 的掩码与准入规则、EEF 的有害动作剔除);(3) 恢复行为本身是可训练目标(Agent-R、ROFT、AREX-2、AED 恢复视图)。
仍属推测的机制:(1) AREX-2 的跨域增益具体来自哪个行为成分(反馈利用、操作知识获取、挫折恢复)没有分离消融,「元技能」是对一揽子行为的效果标签;(2) AED 诊断 SFT 的内部增益在公共基准上蒸发,究竟主因是答案契约(格式漂移)还是任务重叠(分布泄漏),论文的重训实验(+7.79 存活但接口间不一致)未能定论;(3) 「环境改进空间保证→轨迹可学性」的传导无对照实验。
优势成立的条件:AED 的重放结论只在 11 个可确定性重放的环境成立(GAIA/WideSearch 因 live web 不可重放被排除,MCPMark 因重放分歧被排除);actor 增益只在开发 harness 成立,真实环境明确倒退。AREX-2 的轮次扩展依赖 graded 评分环境(Frontier-CS)或自建深研 harness(BrowseComp 无反馈设置仍是自家流程),在二元 verdict 环境的 T* 未测。
可能失效的条件:当错误密度极低(Warehouse 0.0%)时修复监督无素材可用(AED Table 53 的直接含义);当环境不可重放时 AED 的整套因果审计失效;当预算小于单轮所需时 AREX-2 的长程优势无法展开(其起点分数并不占优);当负例未过滤/未标记时(NUT 情形)混入失败数据 actively 有害。
七、必要知识反推
假设让一个没有任何背景的人从零做出这两篇论文,最少需要掌握什么?
领域知识层:
- Agent 系统解剖学:策略模型、harness、环境、验证器四层的职责与故障边界。AED 的失败准入规则(基础设施故障≠agent 错误;工具报错后任务成功≠失败)要求作者能对 33 个环境的每一种异常形态做归类——这是数年 agent 基础设施工作的内化。不理解这一层,第一步「采集自然失败」就会把评分器 bug 标成 agent 错误(AED 的 verifier 校验发现 AgentBench-DB 的金 SQL 在 234/455 个任务上无法复现表哈希、BFCL 金调用列表在 112/386 实例上失败——连基准自身的参考答案都过不了自己的评分器,没有这层知识整个数据集会被污染)。
- 机器学习工程与算法竞赛的作业模式:AREX-2 的作者必须知道 MLE 和算法竞赛的工作流是什么样的——先建基线、逐步消融、集成调优、边界测试——否则无法设计「教师 agent 值得模仿的多轮行为」,更写不出环境准入的第二个条件(基线与参考解之间要有改进空间)。
方法论知识层:
- 因果推断与实验设计:对照、配对、任务聚类 bootstrap、多重比较校正(Holm)、McNemar 检验。AED 的灵魂是「一次成功重放≠因果结论」,E0/E1/E2 的分级实际上就是证据等级(evidence hierarchy)框架从临床流行病学到 agent 评估的移植。没有这套框架,作者不会想到去数那 470 个双通过案例。
- 概率图模型式的轨迹形式化:AREX-2 把自我提升写成分解式 r̄×T*,才能分别设计实验(五小时曲线测 T*、每轮增益比测 r̄)。形式化不是装饰——它直接决定了消融的轴。
- SFT 损失工程的细节:token 掩码、每样本均值 vs 每窗口 token 均值(AED 附录 S 里专门用 CPU 检查验证了损失归约实现,误差 4.7×10⁻⁸——这个检查的存在说明作者知道「掩码写错」是这类工作最常见的沉默事故)。
工程知识层:
- 大规模异构环境的适配与重放:状态恢复(前缀重演 vs 记录轨迹回放)、温度计划匹配、检查点保真度证明(AED 附录 D.3 的 lineage 检查:分支身份、原生消息匹配、动作作者归属、5% 的无效谱系排除上限)。1,846 对重放用的是替换 ReAct 延续——因为 smolagents/AutoGen/LangGraph 等源 harness 重放器不支持;这类「哪里能重放、哪里不能」的知识只能从工程里来。
- 成本核算:AED 的 Table 50 给出完整的准入经济学:无检查 19,904 行×$0.04、仅接地 2,628 行(13.2%)×$0.31、AET 全管线 767 行(3.9%)×$1.25。质量准入让单行成本涨 31 倍——「失败资产」的精加工是有价格的,这个数字对后续复用者比任何口号都有用。
- 开源模型训练与评估 harness:AREX-2 的五阶段消融要求同一模型在不同技能/轮数配置下可控重评;27B 全参 SFT 的基础设施。
知识融合的关键节点:两篇论文各自的「化学反应」都发生在两种知识的交界处。AED 的临界点是把数据集建设的文档规范(datasheets)与因果推断的证据分级融合进 agent 数据管线——于是「一条失败数据」变成了一个带来源、带证据等级、带被拒历史的多字段记录,而不是一个 (x, y) 对。AREX-2 的临界点是把测试时扩展的形式化(Σrt)与数据构造的选择标准融合——「整条轨迹按终选、单轮零要求」这个反直觉的选择规则,只有在想清楚「要模仿的是改进过程本身」之后才会出现。
八、论文中可以提取的通用性灵感
灵感一:负资产的资产化需要记账标准,不是口号
- 核心思想:一个组织里被系统性丢弃的副产物(失败日志、废弃方案、被拒提案),要变成可复用资产,前提是建立定价要素完备的「记账标准」——AED 为每个错误记录:来源链接、错误步、逐字证据、被拒提案、重放双臂结果、证据等级。
- 论文证据:AED 的记录 schema(附录 T)使「再诊断无需重跑 rollout」成为可能;440 条 GAIA/WideSearch 检索故障行、54 条评分器矛盾行因为字段完备而被隔离而不是污染全库。
- 推广场景:(1) 软件工程:崩溃报告从「重启试试」变成带复现双臂的因果记录;(2) 内容平台:被拒稿件的审稿意见结构化归档,训练审稿一致性;(3) 制造业:产线不良品与返工路径配对记录,区分「返工后通过」与「不返工也能通过」;(4) 医疗:治疗方案失败的分级证据(单例 vs 配对 vs 复现);(5) 风控:被拒贷款的后续表现追踪,校准拒贷模型的反事实。
灵感二:设对照组来剥离「安慰剂增益」
- 核心思想:任何「干预后变好」的观测都混着「不干预也会好」的基线漂移;给核心主张配一个同条件对照,是廉价而致命的诚实装置。AED 用原动作重试对照揭穿了 30.1% 的双通过幻觉。
- 论文证据:3,062 对配对重放的四格表;净增益 +32.7 显著低于表观 51.1。
- 推广场景:(1) A/B 测试中「重发一次 vs 改文案」的分离;(2) 教育干预中「重考一次 vs 补课」的效应分离;(3) 运维中「重启 vs 修配置」的归因;(4) 销售「二次跟进 vs 换话术」的对照;(5) LLM 评估中「重采样 vs 换 prompt」的增益归属(AED 附录 M 对错误定位提示的敏感度检查就是范本)。
灵感三:把「过程的合规」与「结果的达标」作为双重准入,但只监督过程里的进步决策
- 核心思想:选择数据(或人、或方案)时按整体结果筛,训练(或反馈、或复盘)时只强化其中推动进展的行为、让失败保留为背景条件——整条保留、损失选择。
- 论文证据:AREX-2 轨迹选择双条件(终分阈值+格式/终止/规则合规)与选择性损失(无进展步骤零损失);AED 的 post-error 视图(错误与拒绝为被掩码上下文,只监督修正)。
- 推广场景:(1) 企业培训:保留完整项目复盘(含弯路),但绩效考核只锚定关键转折决策;(2) 案例教学:商学院案例保留失败决策链,讨论焦点放在「下一步该怎么做」;(3) 代码评审:保留全部提交历史(含被拒 PR),评审意见聚焦恢复性提交;(4) 体育训练:完整录像回放,训练课只练丢分后的应对;(5) 个人知识管理:错题本记「错在哪之后做了什么」而非只抄正确答案。
灵感四:给「第二次机会」的效果先定价,再为「知道错在哪」单独收费
- 核心思想:很多看似需要智能的增益,其实来自朴素的重试;先量化重试的效应,剩余部分才是知识/诊断/解释的真实边际价值。
- 论文证据:AED 定位帮助研究:通用再考虑 +8.4(稳健),诊断内容再 +5.6 [0.0, 11.3](边缘)——诊断的钱只值半个 sigma。
- 推广场景:(1) 客服:重发工单 vs 附加诊断信息的分层解决率;(2) LLM 推理:self-consistency(重试族)与 step-level verifier(诊断族)的贡献分离;(3) 医疗:安慰剂组之外再分「仅复诊」组;(4) 调试:橡皮鸭(重述=再考虑)与断点单步(诊断)的效率对比;(5) 教育:订正重做 vs 错因标注的成绩增益分离。
灵感五:环境本身要有「可示范的改进弧」
- 核心思想:要训练(或培养)任何「持续改进」的行为,练习环境必须同时满足:参考解可执行(环境是好的)、朴素起点显著更低(有距离可走)、反馈是 graded 的(每一步都有信息)。
- 论文证据:AREX-2 环境准入双条件+graded 评分设计;对照反例是二元 verdict 环境「只能告诉你还没成功」。
- 推广场景:(1) 教练系统设计:分级评分 rubric 而非过/不过;(2) 员工成长体系:把「可改进空间」显式化(基线差距),否则没有成长轨迹可走;(3) 游戏 AI 训练场:graded reward 塑形;(4) 自动评分的作业系统:部分分制;(5) 个人技能训练:选「基线差、反馈密」的项目练迭代能力,而非一步到位的任务。
灵感六:论文写作层面——证据分级文化本身就是贡献
- 核心思想:在结果汇报中内置证据等级(E0/E1/E2)与失败会计(run error 单列、crash 归因臂别、四格表),让每个结论的强度可被读者直接读取。
- 论文证据:AED 全文 73 页附录里每个 claim 旁边都站着它的分母和 CI;连「人类审查 85.5% 步骤一致」都标注了「这是 AI 辅助下的、覆盖选择的 69/80 样本,不能外推全库」。
- 推广场景:(1) 企业实验报告模板;(2) 基准排行榜的置信区间规范;(3) 尽职调查的分级证据清单;(4) 新闻核查的信源强度标注;(5) 内部 AI 评估的「结论-分母-反例」三件套汇报格式。
结语:两种论文文化的对照,与一个共同的未来
把这两篇放在一起读到最后,最耐人寻味的已不是技术,而是两种论文文化的对照。AED 是「审计文化」的极致:每一个正向结论旁边都站着它的反例(内部 +16.4 对公共迁移蒸发;WebShop-lite +6.67 对真实环境 5.97→0.75;93.5% 产出率对 37/60 抽样被拒的机器标注审计),73 页附录像一份上市公司年报的附注。AREX-2 是「工程报告文化」的典型:12 页、六个基准、一条主线,没有负结果章节、没有多种子方差、训练细节从简——但它的开源 27B 模型让所有结论都可以被社区直接检验。
哪种文化更可信?答案取决于你要什么。要「失败资产如何定价」的方法论,AED 的每一页反例都是教材;要「失败资产能变现到什么规模」的存在性证明,AREX-2 的 81.8 和五小时曲线更有说服力。而两条线在下一次迭代中大概率合流:用 AED 式的对照审计给 AREX-2 式的改进轨迹逐步定价(哪一类恢复决策贡献了 r̄?),用 AREX-2 式的端到端验证给 AED 的三视图找回真实环境的失地。AREX-2 结尾那句话——「让模型自己的轨迹成为它的下一份训练数据」——与 AED 的第五阶段「构建视图」之间,隔着的正是这个尚未建成的闭环。
失败正在成为资产。但这两篇论文合起来告诉我们的是:资产化不等于乐观——它意味着记账标准、对照组、准入经济学和证据分级。能把失败卖出价钱的人,恰恰是对失败的成色最挑剔的人。