论文链接:Procedural Graphs: Self-Evolving Execution Structures for LLM Agents 发表时间:2026年9月 机构:Google(Yicheng Chen、Shanchan Wu、Sercan Ö. Arık)+ Georgia Institute of Technology + Peking University —— “企业+高校"合作:Google 团队主导系统设计与实验,GT/北大研究者参与 领域标签:cs.AI / LLM Agents / Procedural Memory / Self-Evolution

一、论文背景

LLM Agent 干活的基本循环是:读历史、想一步、动一步。ReAct 范式下,“想"完全靠自由生成——模型面对一条不断变长的扁平日志,自己判断哪些观察相关、哪些步骤没做、下一步该调哪个工具。轨迹短时这没问题;轨迹一长,三类经典失败就浮现:丢失目标(忘了最初要干什么)、乱序调用工具(前置条件未满足就执行)、重复无效动作(在死循环里打转)。

问题出在:过程性知识(procedural knowledge)——“先做什么、后做什么、什么条件下做什么”——是隐式的。它没被显式表示,只能靠模型从上下文里临时重建。

已有方案分三派。记忆派(Reflexion、MemoryBank、ExpeL)把过往经验存成自由文本、检索后塞进上下文——但"怎么用这段经验约束当前步骤"还是得靠模型现场推理。指南派(AutoGuide 等状态条件化指南)更有针对性,但规则之间没有连接,不知道"这一步做完下一步是什么”。工作流派(工作流、状态机、AWM 的 workflow)把步骤显式化了、也约束了执行,但通常需要人工设计,且离线搜索出的工作流结构僵硬。

三类方案各缺一角:显式表示、步骤间连接、以及能从经验中改进。同时满足三者,就是本文的空隙。

二、论文定位和关联工作

脉络一:结构化规划先验。 KnowAgent(文本动作规则)、workflow 工作流(Xiao et al.)、AWM(自动搜出的工作流)、工具图谱(ToolKB 类)。这些工作把过程知识组织成规则/流/图,但要么静态、要么离线优化。Procedural Graph 的组合创新:属性化过程转移 + 从当前执行上下文的局部检索 + 拓扑与属性的在线精化三者合一。

脉络二:记忆与自反思。 ExpeL 从经验中提炼洞察、MemoryBank 持久化记忆、RAP 提炼轨迹模式。共同局限:非结构化文本,检索后模型需要自行重建适用条件。

脉络三:CoALA 认知架构框架。 论文自觉地把 Procedural Graph 定位为 CoALA 术语下的程序性记忆——长期过程知识在权重之外的可检存储。与情景记忆(存"发生了什么”)不同,程序性记忆存"该怎么做",本文给出了它的一种图结构实现。

维度记忆派工作流派Procedural Graph
表示形式自由文本固定工作流属性化过程图(三元组)
步骤间约束无强(结构固定)中(允许转移+引导不强制)
可进化性文本追加离线搜索在线拓扑+属性编辑,验证门保护
推理自由度完全自由受限于流结构引导但可偏离(“引导不规定”)

定位结论:本文给出了程序性记忆的第一个"可进化图结构"实现,并在推理自由度上取了中间态——比自由生成有序、比硬工作流灵活。

三、问题定义

具体问题:让长程 Agent 具备显式、可编辑、可自进化且能逐步引导执行的过程性知识。

核心洞察(抽象):知识图(KG)成功地把"是什么"类事实组织成 (实体, 关系, 实体) 三元组,使事实可存储、可检索、可推理。那么"怎么做"类知识也应有同构的结构:(过程, 关系, 过程) 三元组——节点抽象工具动作、推理步骤与状态,边表示允许的转移并携带文本属性(怎么走、何时走)。这是一个结构同构类比:把 KG 十年积累的工程直觉(图存储、局部遍历、子图引导)整体迁移到过程域。

形式化:给定任务域 D,构建有向图 G = (V, E),V 为过程节点,E ⊆ V×V 为转移,每边 e 附属性向量 a_e(自然语言描述的执行方式与条件)。在线执行时:定位当前活跃节点 v_t → 引导模型读取 v_t 邻域子图 → 生成步级情境引导 g_t → 引导注入而非规定求解器的下一步动作。离线进化:LLM refiner 对比失败与成功轨迹,提出对 G 的拓扑/属性编辑;候选图 G’ 若在 held-out 验证集上不劣于 G 则采纳,被拒候选存入拒绝记忆以防重复提议。

抽象的精妙:三元组类比让"过程知识"从方法论口号变成数据结构;“引导不规定"的定位让图约束与 LLM 的生成自由各安其位;验证门+拒绝记忆则让自进化成为单调不减的过程。

四、问题解法

4.1 图的构建与在线引导

从最小骨架起步(初始只有少量入口节点)。执行时每步两件事:节点定位(从轨迹判断当前处于哪个过程节点)与生成式引导(引导模型读活跃节点的邻域子图——含边属性——翻译成当前情境的步级建议)。关键设计:引导是"软"的,求解器可以偏离——这保住了 LLM 处理意外情况的能力,同时把大概率正确的次序知识注入。

4.2 自进化循环

每批训练任务后:

  1. 对比分析:LLM refiner 把失败轨迹与成功轨迹并排对比,定位失败归因于缺失的节点/边、误导性的属性、或多余的转移;
  2. 候选生成:提出编辑——加节点、删边、改属性等;
  3. 验证门:候选图在 held-out 验证集上评估,不劣于当前图才采纳——保证进化单调不减;
  4. 拒绝记忆:被拒候选及其被拒原因留存,喂回 refiner 抑制重复提议——这是进化的"教训本”。

论文展示了三种图的来源:零骨架自进化(从最小骨架长出)、专家先验修复(有缺陷的人工图被循环自动修好)、以及两者混合。

4.3 与求解器的关系

求解器可以是任意 LLM+工具循环(论文用 Claude Sonnet 4.6、Gemini 3.1 Pro、Gemini 3.5 Flash 三个不同量级的模型验证)。图存在模型权重之外——不训练、可审计、可人工检查与编辑。

五、评估指标与实验证据

基准:HotpotQA(多跳问答,Agent 化环境)、MultiChallenge、GDPval(职业任务,rubric 评分)、ALFWorld(具身家务模拟,成功率)、τ-bench(用户-agent-工具多轮交互,Pass@1)、BFCL v3(函数调用,准确率)。六个基准覆盖问答、具身、工具、职业任务四类形态。

主结果(Gemini 3.1 Pro 为求解器,vs 六个基线):

方法HotpotQAMultiChallengeGDPvalALFWorldτ-benchBFCL v3
Vanilla ReAct85.9087.9556.3994.7872.1759.00
ExpeL(最强记忆基线)86.0092.7764.6997.7664.3563.00
AWM(工作流)85.1093.9863.8599.2567.8364.00
KnowAgent85.0095.1869.1095.5264.3561.00
Procedural Graph87.3095.7878.78100.0080.0066.00

读表要点:增益的分布有结构意义——在长程、多步、过程性强的基准上增益最大(GDPval +22.4、τ-bench +7.8、ALFWorld 到满分),在近乎静态的问答上增益小(HotpotQA +1.4)。这正是"过程性知识"假设的预测:方法只在过程密集的任务上发挥,静态任务上无从发挥。如果增益来自"塞了更多上下文",增益分布不该呈现这种选择性。

自进化证据:从零骨架自进化出的图匹配或超越手工设计图;对被注入缺陷的专家图,循环能自动修复;EnterpriseArena 长程压力测试(含危机事件调度)中,PG 的存活曲线显著优于基线。

证明力评估:三模型×六基准×七方法的大矩阵、95% 置信区间、以及增益分布与任务过程性的相关性分析,让"表示设计带来收益"的归因有据可依。局限:引导模型引入额外推理开销(论文有效率分析但引导步的 token 成本仍在)。

六、效果优势的根源解释

记忆派基线的瓶颈:自由文本经验检索后,“如何约束当前步"的重担在模型身上。过程知识被压平成散文,步骤间的先后与条件关系在生成时才被临时重建——长程任务中重建必然出错(丢失目标、乱序、循环)。

本文的三个机制改变与因果链:

  1. 显式图结构 → 步骤依赖不再依赖现场重建 → 乱序与循环消失。转移边把"什么之后能做什么"编码为拓扑约束,节点定位把"现在该干什么"锚定在图上。模型不再从长日志里猜次序,而是读邻域。这直接对应 τ-bench(用户-agent-工具多轮,最考验次序)上 +7.8 的最大幅度提升。
  2. 引导不规定 → 注入先验同时保留纠错能力 → 稳态提升而不牺牲灵活性。与工作流的硬约束相比,软引导允许模型在图没覆盖的意外情况下自由行动;与纯自由生成相比,大概率正确的路径被提前注入。ALFWorld 满分与 GDPval +22.4 显示这种"有序但不僵硬"的中间态在具身与职业任务上都是最优工作点。
  3. 验证门+拒绝记忆 → 进化单调不减 → 自进化图反超手工图。手工图的缺陷(遗漏路径、过时属性)在验证门下被持续修剪;拒绝记忆让 refiner 不在同一个坑里跌两次。零骨架图追平手工图证明:过程知识可以完全从执行经验中生长,不必依赖人工先验——这是对"过程知识不可自动获取"直觉的反驳。

反事实对照:屏蔽引导(退化为 ReAct)掉回 72.17;去掉自进化(静态图)损失 GDPval 上约一半增益;去掉拒绝记忆,进化循环震荡(论文附录案例)。

七、必要知识反推

领域知识层:

  • Agent 执行循环的失败模式学(丢失目标/乱序/循环的临床分型)——不知道病灶就无法对症设计表示;
  • 知识图的工程传统(三元组、子图检索、图编辑)——结构同构类比的"源域”;
  • CoALA 认知架构对记忆类型的划分(程序性 vs 情景 vs 语义)。

方法论知识层:

  • 轨迹对比分析(成败对照的归因方法);
  • 自进化系统的单调性保障设计(验证门、负样本记忆);
  • 多基准评测的方差控制(95% CI、多次运行)。

工程知识层:

  • 节点定位的实现(轨迹到图节点的匹配);
  • 引导生成的提示工程与 token 预算;
  • 图存储与检索基建。

知识融合的关键节点:融合发生在"KG 的结构工程学“与”Agent 执行失败学“之间。KG 社区有成熟的图工具但很少碰 Agent 执行;Agent 社区知道失败模式但缺少可进化的过程表示。作者看到两者的接口:失败模式(乱序/循环)恰好是图结构(转移约束)最能约束的对象——病灶的形状决定了药方的形状。而"引导不规定"的剂量控制,则来自对 LLM 生成自由与结构约束之间权衡的实践直觉。

八、论文中可以提取的通用性灵感

1. 成功的表示结构可以跨"知识类型"同构迁移。 核心思想:KG 之于事实 = 过程图之于操作——找到目标领域的"实体-关系"对应物,就能整体继承源领域的工程红利。 论文证据:三元组结构让过程知识可存储、检索、编辑,六个基准全面收益。 推广场景:组织流程的"过程图谱”(审批流的知识化管理);教学课程的技能依赖图;临床诊疗路径的可进化图。

2. 软引导优于硬约束与无约束的两端。 核心思想:对具备自主判断能力的执行者,注入先验但不剥夺偏离权,是稳健性的最优工作点。 论文证据:比工作流派更灵活、比自由生成更有序,在四类任务上同时占优。 推广场景:驾驶辅助(提示不接管);代码规范的 lint 警告 vs 强制 CI 拦截;管理中的原则性指导 vs 流程卡点。

3. 自进化的单调性靠"验证门+负样本记忆"双保险。 核心思想:任何自动改写系统的循环,必须有"不劣于现状才采纳"的门,以及"被拒方案及原因留档"的记忆。 论文证据:零骨架图追平手工图;缺陷专家图被自动修复。 推广场景:自动化运维的变更管理(灰度门+变更档案);数据管线的自动重构;个人知识库的自动整理规则。

4. 程序性知识应该在权重之外、可审计地存储。 核心思想:组织/系统的"怎么做事"的知识放模型权重里不可审计,放散文里不可检索,图是可审计与可检索的平衡点。 论文证据:图在权重外,可人工检查编辑,进化全程留痕。 推广场景:企业 SOP 的图化管理;开源社区的贡献流程文档;AI 系统合规审计所需的决策流程留痕。

5. 增益的任务选择性是机制假设的最好验证。 核心思想:如果方法真的作用于 X 机制,其收益应集中在 X 密集的任务上;均匀收益反而可疑。 论文证据:增益在过程密集基准(GDPval/τ-bench)最大、静态问答最小,与过程性知识假设一致。 推广场景:评估任何"通用增强"产品的真实机制(看收益分布而非均值);实验科学中的机制验证设计。


本文基于 arXiv:2609.09153 全文精读撰写。数据与结论均引自原文。