论文链接:Adaptive Influence Graphs for Failure Attribution in Multi-Agent Systems 发表时间:2026年8月 机构:AWS Agentic AI + Tel Aviv University(特拉维夫大学)。第一作者 Yarden Bakish 为特拉维夫大学学生,本工作在其 AWS 实习期间完成,属典型"高校学生 + 企业实验室"产学研合作;通讯作者 Amir Dudai 来自 AWS。全程 training-free,builder 与 reader 均为 prompt 驱动的前沿模型,无任何微调。 领域标签:cs.AI / 多智能体系统 / 智能体可观测性 / 失败归因

一、论文背景

多智能体系统为什么需要"失败归因"?

想象一家公司里有六个 AI 员工协作完成任务:一个查资料、一个写初稿、一个核对事实、一个汇总提交。当最终答案出错时,你拿到的只有一份几千行的聊天记录(执行轨迹)。要回答"第一个把事情搞砸的是谁、在哪一步"——这就是多智能体 LLM 系统的失败归因(failure attribution)问题。

这个问题随着 Agent 系统部署规模扩大变得越来越贵:人类工程师要通读冗长、交错的多智能体日志才能定位源头。Who&When 基准(Zhang et al., 2025)把这个任务形式化为:给定原始任务查询和失败的最终答案,识别首个把执行带偏的 agent(a*)和决定性错误步骤(t*)。

现有方法的核心缺陷:给模型的"接口"太原始了

此前的研究大多在改进"推理程序"——比如多阶段诊断流水线、 abduction 提示、跨角色投票等,但诊断模型接收到的始终是一份平铺的转录文本(flat transcript),最多加了步骤编号或固定切分。另一条路线会重构轨迹(如 CHIEF 把日志重建成层次因果图),但表示结构是预先固定的——节点边界、层次模式、关系词表都是提前定义好的,无法适应每条失败轨迹的具体形态。

论文的关键洞察来自一个类比:人类工程师从不逐行读原始日志。他们用的是 LangSmith、Phoenix、Amazon Bedrock AgentCore Observability 这类可观测性平台——把执行组织成组件、动作、依赖关系的层次结构,按需展开检索。既然现代 LLM 已具备规划、工具调用、迭代推理能力,它们是否也能受益于同样的范式?由此引出论文的核心假设:失败归因部分程度上是一个接口设计问题——它不仅取决于诊断模型本身,还取决于轨迹如何被表示和遍历。

图1 给了一个直观例子:同一条失败轨迹,读原始日志时模型会被"可见的症状"(第3步文献专家编造差异)吸引,而结构化的影响图能把错误回溯到真正起源(第2步检索专家的检索失败返回空结果)。

二、论文定位和关联工作

论文把自己放在三条研究脉络的交汇处:

谱系一:改进推理过程(轨迹接口不动)

  • Who&When 基线只改日志切分方式;A2P(West et al., 2025)用 abduction 提示搭建脚手架;RAFFLES(Zhu et al., 2025)把判断分散给一个 judge 加多个按标准划分的 evaluator,是此前 Algorithm-Generated 分区的最佳方法(51.60%);CORRECT 检索既往标注轨迹中的浓缩错误知识;VerifyMAS 先验证预定义错误假设再定位。共同点:诊断模型拿到的仍是平铺转录,改的只是推理姿势。
  • AgenTracer 用合成失败微调小模型、MASPrism 用 prefill 阶段信号做轻量归因——开始引入训练信号,但接口仍是平的。

谱系二:重构轨迹表示(结构固定)

  • FAMAS 把每条记录抽象成 ⟨agent, action, state⟩ 三元组做频谱分析;CDC-MAS 用确定性规则导出数据依赖图再恢复因果 DAG;StepFinder 干脆训练小模型替代 LLM;CHIEF(Wang et al., 2026b)把平日志重建成层次因果图,是最近的最强对手;FALAT 做依赖引导搜索。共同点:构造策略是先验固定的——记录类型、节点边界、层次或关系词表预先定义,论文的 builder 则为每条轨迹联合选择节点粒度与边拓扑。

谱系三:轨迹可观测性(人类工具)

  • OpenTelemetry、Arize Phoenix 等平台把轨迹渲染为层次化、可过滤、可按需展开的对象。AIG 把这一设计从人类消费者迁移到自动化消费者。
维度推理改进路线(RAFFLES 等)固定重构路线(CHIEF 等)本论文 AIG
轨迹接口平铺转录(+索引/切分)预定义结构的图每条轨迹自适应构造的图
读取方式单次/多阶段推理固定层次遍历agent 式按需遍历 + 原始日志核验
是否需训练部分需微调免训练免训练
验证证据模型判断图本身图声明必须回到原始日志验证

定位结论:AIG 是首个把"表示"与"读取"拆开、用受控阶梯实验逐级隔离贡献的工作,并证明两者应联合设计。

三、问题定义

具体问题:多智能体系统失败了,从原始日志定位 (a*, t*)——首个出错的 agent 与决定性步骤。直接读原始日志会被下游症状误导:可见的错误往往发生在源头之后好几步。

核心洞察的抽象:失败归因的本质结构是错误传播链的逆向求解。原始日志按时间顺序排列,呈现的是"症状序列";而归因需要的是"因果结构"——哪个上游输出被下游继承、继承之后如何变质。论文把这抽象为一个接口设计问题:给定轨迹 τ = (a₁,s₁),…,(a_T,s_T) 和失败的最终答案,求一个中间表示 G(图)和一个读取策略 R,使得 R(G, τ) → (â, t̂) 尽可能接近 (a*, t*)。

用表格类比深度学习来理解这一定义:

失败归因深度学习对应物
原始日志(flat transcript)未预处理的原始像素流
影响图 G数据的归纳偏置(如 CNN 的局部性假设)
builder 构造 G特征工程/骨干网络的表征学习
reader 遍历 G推理时的注意力分配
继承边(inheritance edge)梯度回传路径(因果链的显式编码)

精妙之处:这个抽象把"模型能力"与"信息呈现方式"解耦——即使诊断模型完全不变,改变接口就能大幅改变归因质量。这为后文的受控阶梯实验(固定 reader、逐级丰富表示)提供了概念基础。

四、问题解法

AIG 是一个两阶段 agentic 框架:builder 建图,reader 读图。两个阶段通过"节点锚定原始日志步骤"耦合。

4.1 Build 阶段:从轨迹到影响图

论文先定义了一个builder 阶梯来隔离不同构造策略的贡献:

Builder 1——结构化日志:确定性、无 LLM。把同一 agent 的连续步骤合并成一个节点,形成按执行顺序的链。只改表面形式、不动证据内容,用来隔离"显式结构本身"的价值。

Builder 2——影响图(IG):用 LLM 单次加工这条链,为每个节点添加四字段抽象 α(v) = ⟨summary, input, output, authorship⟩(这段做了什么、收到什么、产出什么、是否亲笔产出),并添加继承边——当后一个节点复用了前一个节点的工作且与出错相关时,画一条有向边,边带两个注解字段:inherited(继承的是什么)与 effect(它如何在下游变质)。关键约束:只有存在继承才画边,全新开始的节点不引边;边集保持稀疏,因为无根据的因果链接会误导读者。

Builder 3——自适应影响图(AIG):把 IG 的固定单次构造换成 agentic builder。它从空图开始,交替使用两类工具:

  • 检查工具 T_log:get_overview(步骤数/各步agent/大小)、read_step、read_step_range、search(正则)、get_story 等——按需查看轨迹片段而不必全文进上下文;
  • 构造工具 T_build:add_block、add_inheritance_note、modify_block、delete_block 等——创建、修改、删除节点和继承边。

builder 联合决定节点边界(可把同一 agent 的多步合并为一个动作级节点,也可拆细)、角色分派(节点类型词表:task(根)/orchestrator(协调轮)/agent(工作轮,带 input/output)/conclusion(汇))和继承拓扑(可连接不相邻的动作)。

Critic–Refiner 校验环:图必须满足有效性谓词 Φ(G)——连通、无环、单根、单汇。提交后 critic 最多审计 R=3 轮:程序化检查结构违规,对照日志检查语义违规(如节点不忠实于其引用的步骤);refiner 做最小修复,直至无违规或预算耗尽。

类比:builder 就像代码评审前的"文档工程师"——把杂乱的执行流水账改写成一张带引用的结构图,每个论断都能追溯到原始日志行号;critic–refiner 则是质检员,确保图既结构合法又不歪曲事实。

4.2 Read 阶段:从图到归因

论文同样定义了reader 阶梯:

单次读取:把序列化的图连同原始日志一次性塞进 prompt,直接输出归因。

Agentic 读取(完整 AIG):reader 拿到定稿的图 G 和只读工具集(图访问器 + T_log),从图指向的候选节点出发,沿入边继承边逆向回溯。核心规则:只有当原始日志证实当前节点的输出确实表现出该边 effect 注解描述的下游错误时,才把责任移交给边的源节点。回溯持续到没有继承边能解释观察到的失败为止,最后用节点的步骤引用把选定节点解析为精确的 (â, t̂)。

这一规则让图成为"聚焦地图"而非"替代品"——图声明必须接受原始日志的验证,防止 builder 的幻觉污染最终结论。

4.3 实现要点

每阶段是独立的 Strands Agents SDK agent(工具即 Python 函数,图为共享可变状态);骨干模型 Opus-5 / Sonnet-4 / DS-V3.2 / GPT-5.6-sol,经 Bedrock Converse API 调用,无任务特定微调。

五、评估指标与实验证据

基准:Who&When 两个分区——Algorithm-Generated(算法生成失败,用于受控消融)与 Hand-Crafted(人工构造失败)。

指标体系:

  • 主指标:exact step accuracy(步骤精确定位准确率)——归因任务最难的部分,论文的核心主张载体;
  • 辅助指标:agent accuracy(agent 定位准确率)与 ±1/±2/±3 步容差窗口;
  • 消融指标:接口阶梯(固定模型逐级换表示)与图结构统计(节点数/边数/hub 出度/跨距)。

主结果表(Algorithm-Generated 分区,无 ground-truth 访问)

方法模型Step Acc.(%)Agent Acc.(%)
All-at-OnceOpus-546.4067.20
CHIEFOpus-5(复跑)45.2464.29
A2PGPT-4o47.5065.40
RAFFLESSonnet-4(此前最佳)51.60–
CHIEFDS-V3.245.6068.80
AIGDS-V3.253.1765.08
AIGSonnet-453.9767.46
AIGGPT-5.6-sol54.7667.46
AIGOpus-555.20(新 SOTA)71.20

同模型对比中 AIG 超 CHIEF 达 +9.96pp(Opus-5)与 +7.57pp(DS-V3.2);四个模型族全部超过此前最佳,说明增益非单一模型产物。

接口阶梯(Opus-5 固定,逐步升表示)

表示Step Acc.(%)Agent Acc.(%)
Raw log46.4067.20
Structured log48.8063.20
Influence Graph52.0070.40
AIG(单次 prompt 读)50.4064.80
AIG(agentic 读)55.2071.20

阶梯在 Sonnet-4 与 DS-V3.2 上同样成立且更陡:DS-V3.2 从 raw 19.84% 一路升到 AIG 53.17%(+33.3pp)——弱骨干从结构中获益更大。

容差窗口与后段失败分析

表示精确±1±2±3
RAFFLES (Llama-3.3-70B)43.6558.7373.8182.54
AIG55.2064.0078.4084.00

关键发现:增益集中在轨迹后段的失败——第5步及以后的失败,raw log 读法仅 10.8% 精确率,AIG 达 40.5%;raw-log 错误预测中 76% 仍能指对 agent,说明难点在步骤精确定位而非 agent 识别。这恰是"下游后果掩盖起源"最严重的场景,直接支撑"继承边让错误可回溯"的机制主张。Hand-Crafted 分区上 AIG 以 29.31% 并列 step acc 最高,但 agent acc 63.79% 低于 CHIEF 的 72.41%——论文如实报告了这一未延伸的优势。

六、效果优势的根源解释

对比对象:raw log 直读基线。它为何曾经"够用"?因为小轨迹里症状离源头近,强模型(Opus-5)能靠自身隐式恢复部分结构。

根本局限:原始日志的信息组织与因果结构错位。日志按时间排序,而错误归因需要沿因果链回溯——两者方向相反。失败发生越晚、传播链越长,症状与源头的距离越远,模型的注意力被中间的可见错误捕获,无法"逆流而上"。这是表示层面的障碍,推理技巧再强也绕不过——你无法从不含因果边的序列里"读出"因果链,只能猜。

AIG 的因果链:

  1. 结构化(+2.4pp):分段分组让"谁在说话"的执行结构显式化,减少了模型解析负担。弱模型获益巨大(DS-V3.2 +25.4pp)证明这层此前是纯浪费在解析上的算力。
  2. 继承边(+3.2pp):边上的 ⟨inherited, effect⟩ 注解显式编码了"上游输出如何传播出错"——这正是 raw log 中缺失的因果信息。它把"回溯"从模型必须内隐完成的推理变成沿边的机械遍历。
  3. 自适应构造 + agentic 遍历(再 +4.8pp):builder 产出的图统计证实了机制——AIG 比固定 IG 节点更多(9.5 vs 7.5)、hub 出度翻倍(3.6 vs 1.8,一个上游动作影响多个下游)、最长跨距 5.6 vs 4.2 步。自适应 builder 暴露的是长程影响结构而非局部顺序。reader 行为分析显示图是聚焦地图而非替代品:61.3% 的执行中 reader 第一个检查的原始步骤就是最终答案,但 86.5% 仍会多步核查原始日志,只有 1.6% 只信图——图的导航价值与日志的证据价值互补。
  4. 验证规则守门:reader 转移责任前必须在原始日志验证边效应,防止 builder 幻觉误导——单次 prompt 读 AIG 只有 50.40%(甚至低于固定 IG 的 52.00%),说明图的价值必须靠"可控遍历+验证"才能兑现,裸塞进 prompt 反而引入噪音。

反事实验证:去掉 agentic 遍历(退回单次读)→ 掉 4.8pp;去掉继承边(退回结构化日志)→ 掉 6.4pp;去掉全部结构(退回 raw)→ 掉 8.8pp。每一层结构都对应可测的增益。

一句话总结根源:AIG 不是让模型更聪明,而是把"从症状回溯到源头"所需的因果结构从模型的内隐推理负担变成了接口的显式供给——信息流的方向被扭正了。

七、必要知识反推

假设一个零背景的人要复现这项工作,最少需要哪些知识?

领域知识层

  • 多智能体 LLM 系统的执行形态:agent 轮转、消息传递、工具调用如何形成交错日志——不理解就无法定义"步骤"与"agent 边界";
  • 失败归因任务的评估协议:Who&When 的部分可观测设定(只见 agent 输出、不见输入)、exact step/agent accuracy 的计算方式。

方法论知识层

  • 可观测性系统的设计范式(OpenTelemetry span 树、Phoenix 的层次化按需展开)——这是论文灵感源头,builder/reader 的分工直接映射 instrumentation 层与 drill-down 行为;
  • 图论基础与有效性约束(连通、无环、单根单汇)——critic 的程序化检查依赖于此;
  • 前序归因方法的全景(推理改进 vs 重构轨迹两条线)——否则无法定位"自适应构造"这一差异点,也无法设计 matched-model 对比;
  • LLM 的上下文敏感性研究(lost-in-the-middle、位置偏置、图编码格式影响)——这解释了为什么表示形式本身就能大幅改变结果。

工程知识层

  • Agentic 工具调用框架(Strands SDK 的工具 schema 推导、共享可变状态管理);
  • 受控实验设计:接口阶梯的逐级隔离逻辑(固定 reader 换表示、固定表示换 reader)、跨模型一致性验证、容差窗口分析。

知识融合的关键节点

  • “人类调试实践 → LLM 接口设计"的迁移:把可观测性平台的 span/属性/按需展开三层设计压缩成"节点抽象 + 继承边 + 按需检查"三要素——这是整个工作的创造性核心;
  • “接口与读取联合设计"的实验化:意识到 AIG 单次读反而不如固定 IG,从而发现图的全部价值在于被 agent 式遍历,这需要同时懂信息呈现与信息消费两端。

八、论文中可以提取的通用性灵感

灵感1:把"接口设计"当作独立于模型能力的研究轴

  • 核心思想:同一模型、同一任务,仅改变信息的组织方式就能带来 +8.8pp 的差距——能力瓶颈可能不在模型,在接口。
  • 论文证据:接口阶梯 46.40% → 55.20%(固定 Opus-5);DS-V3.2 弱骨干从 raw 到 AIG 提升 33.3pp,远超 Opus-5 的 8.8pp。
  • 推广场景:①长文档问答的上下文组织(按实体/时间线重组 vs 平铺);②代码库理解的文件呈现顺序;③RAG 检索结果的图结构化;④任何"模型读不懂数据"的场景先检查表示再怪模型。

灵感2:弱模型从结构化中获益更大——结构是能力的补偿

  • 核心思想:显式结构相当于把强模型内隐具备的归纳偏置外化,因此对弱模型的边际价值更高。
  • 论文证据:结构化日志这最朴素的一层,Sonnet-4 提升 +27.8pp、DS-V3.2 提升 +25.4pp,而 Opus-5 仅 +2.4pp;结构化后三模型差距缩到4分以内。
  • 推广场景:①小模型部署场景优先投入数据结构化;②蒸馏场景中把教师模型的结构推理能力做成显式中间表示;③成本敏感系统的"用结构换参数量”。

灵感3:摘要类中间表示应设计为"可验证的接口"而非"可信的结论”

  • 核心思想:LLM 生成的中间结构(图/摘要/大纲)不应被下游直接采信,每个节点锚定原始证据、消费方按需核验,才能兼得导航价值与抗幻觉。
  • 论文证据:reader 仅 1.6% 只信图提交,86.5% 多步核查原始日志;转移责任前必须验证边效应的规则;单次 prompt 读 AIG(50.40%)反而低于固定 IG(52.00%)的教训。
  • 推广场景:①LLM 生成的知识图谱用于问答时保留溯源指针;②多 agent 系统中规划器的输出附验证义务;③自动摘要系统的 claim-level 引用要求。

灵感4:症状与源头的时间错位是归因问题的普适结构

  • 核心思想:任何传播性系统(信息、错误、影响)中,可观察的都是下游症状;解决归因的关键是显式编码传播路径,使回溯成为遍历而非猜测。
  • 论文证据:增益集中在第5步后的失败(10.8% → 40.5%);继承边的跨距(平均 3.6 步、最长 5.6 步)与 hub 出度(3.6)量化了传播结构。
  • 推广场景:①微服务分布式系统的根因分析;②数据管道的数据质量溯源;③组织管理中的决策责任追溯;④ RL 训练中多步信用分配。

灵感5:受控"阶梯消融"是分离耦合因素贡献的方法论模板

  • 核心思想:当一个系统由多个叠加组件构成时,设计单调递增的最小变更序列,固定其余因素逐级测量,比端到端对比更能揭示每层结构的独立价值。
  • 论文证据:raw → structured → IG → AIG(prompt) → AIG(agentic) 五级阶梯,每级只改一个维度;且跨三个模型重复验证排序不变。
  • 推广场景:①prompt 工程中逐条添加指令的增量测试;②系统设计中缓存/索引/预取的分层归因;③任何"多个改进叠加"的论文写作范式。