Procedural Graphs: Self-Evolving Execution Structures for LLM Agents 精读

知识图把事实组织成 (实体, 关系, 实体) 三元组来回答’是什么’;Google 团队的 Procedural Graph 用 (过程, 关系, 过程) 三元组回答’怎么做’。Agent 每步决策时定位活跃节点,引导模型把邻域子图翻译成步级情境引导;离线自进化循环对比成败轨迹编辑图拓扑与属性,验证门通过才采纳、拒绝项存为负约束。六个基准三个 LLM 全面超越 ReAct/ExpeL/AWM 等记忆基线——Gemini 3.1 Pro 上 τ-bench 72.17→80.00、GDPval 56.39→78.78、ALFWorld 满分,零骨架自进化图匹配乃至超越手工设计。本文精读拆解过程性知识的表示设计与’验证门+拒绝记忆’的进化机制。

September 10, 2026 · 2 min

InterOPT/OR-Clarify: 运筹学建模中'何时该问'的选择性完备性决策 精读

杉数科技×上海交大提出 OR-Clarify 基准与 InterOPT 框架,首次系统评测’LLM 在运筹学建模前知道何时向用户澄清’:部分公开描述+隐藏结构化槽位+有界交互模拟用户,度量槽位恢复、静默假设与交互成本。InterOPT 用 Dynamic Gap Search 识别规格关键缺口,choice-based 设定下 exact slot recovery 大幅超越全部基线。本文精读’澄清即决策’这一新问题定义。

September 8, 2026 · 1 min

TROVE: 轨迹锚定的最小充分路线编辑 — 智能体编排的运行时修正 精读

TROVE 把智能体编排的结构决策从’执行前锁定’改为’运行时最小充分编辑’:离线把工作流搜索轨迹蒸馏为原子/复合技能+结果条件转移图,在线对挂起路线执行保留/插入/替换失效后缀三操作。代码生成、QA、数学推理上质量-效率权衡全面优于 AFlow/MaAS/LAS。本文精读’route 即临时品’的编排新原则。

September 8, 2026 · 2 min

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents 精读

亚利桑那州立大学与思科研究的 CAST 解决长程工具调用 Agent 的可靠性死穴:在电商退款、医疗分诊这类有状态环境中,一个错误动作(退错订单)就造成不可逆失败。CAST 把稀疏任务结果转化为动作级监督——合成解释’该动作在部分可观测下为何有效/无效’的结构化批评理由训练批评模型,再用批评模型构造数据优化策略模型。微调后的 Qwen3 系小模型在 Retail 任务可靠性超 GPT-OSS-120B 逾 10 个百分点,域外 Telehealth 再 +9%。

September 2, 2026 · 2 min

SPT: Skills as Pre-Training Data for Agentic Language Models 精读

深度精读北京邮电大学与清华大学论文 SPT。论文提出把公开的多文件技能包当作预训练中段(mid-training)数据:清洗 ClawHub 上 38,040 个技能包构建 SkillCorpus(约 3.48 亿 token),用 Reference Insert 序列化策略把被引用文件插入到指令首次提及处,使引用距离缩短 94.92%。7B 模型四个 Agent 基准平均分从 28.50 提升到 53.46(+24.96),通用能力几乎无损,30% 技能混合配比效果最佳。

August 31, 2026 · 4 min

Agent Seer: Synthesizing Scenarios from Specification Understanding 精读

Apple 团队提出 Agent Seer,一条仅以 MCP 工具规范为输入的四阶段流水线:工具语义解释、分层场景生成、mock 输出合成、数据接地多轮扩展,无需人工标注与真实工具执行即可产出完整评估 harness。在 7 个开源 MCP 规范(14–64 工具)上生成 337 个场景,平均工具调用正确性 0.911、对话连贯性 0.855,6 个中型规范实现工具 100% 覆盖。论文进一步给出三个反直觉发现:参数 schema 复杂度是质量变化最强相关因子而工具数量作用正交、argument 值准确性是主导失败模式、跨家族 judge 复验确认结论稳健。本精读逐部分拆解其方法设计、实验证据与优势根源。

August 29, 2026 · 8 min

Agentic AI for operating scientific instruments for nanoscale characterization 精读

EPFL 团队用三个基于 MCP 的 Agent(AFM Messenger / Pilot / Doctor)让未经微调的通用 LLM 直接操作原子力显微镜:Messenger 自然语言转经校验的仪器命令、Pilot 用 LLM 视觉评估图像伪影并闭环调参、Doctor 做透明的伪影后处理。在 2747 场景构建的测试集上,Claude-MCP 加歧义检查层把错误命令率从裸模型 89.2% 降到 0.0%;与 5 名人类操作员对比,迭代数、调参时间、最终伪影严重度四项终点均无显著差异。本文精读覆盖背景概念、方法细节、实验证据与错误归零的因果链,并提炼可推广到其他科学仪器自动化的通用灵感。

August 29, 2026 · 5 min

Metis: Typed Runtime Mediation for Tool-Using Software Agents 精读

深读一篇罕见的单人独立研究:Metis 把模型与外部副作用之间那一层运行时当作正经的系统软件工程对象,用类型化事件图显式刻画权限判定、并发调度、终态闭包与生命周期修复。30 对匹配真实 I/O 实验中四类调度中位耗时 14.146ms,全面快于强制串行的 25.958ms;子代理边界消融 0/5 逃逸、路由级权限 oracle 10/10 全对,同时诚实呈现 3 个负面结果。本精读逐部分拆解其机制设计与有界主张的写法。

August 29, 2026 · 5 min

SARA: When Tool Outputs Become Commands 精读

深度精读中科院信工所的 Agent 安全论文 SARA。核心思想是把「动作诱导」与「执行授权」拆开:工具输出可以参与任务实例化,但绝不能自行获得执行权威。通过上下文隔离的 Action Probe、持久动作来源追踪、审计执行证据与参数级支持检查,SARA 在 AgentDojo 与 AgentDyn 上把间接提示注入攻击成功率压到 0.63% 以下,而良性任务代价远小于强隔离方案 CaMeL。

August 28, 2026 · 2 min

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval 精读

深度精读吉林大学 + 蚂蚁集团论文:把大规模技能库的图检索形式化为「预算约束的边置信度校准问题」——多信号诱导高召回候选图后,用移除/替换/逆序三个反事实探针验证每条边是否真为操作依赖,Beta 平滑聚合后按状态门控发布。6 个骨干 × 2 基准的全部 12 个组合全部第一,ScienceWorld 宏平均 72.62→80.50,步数全线下降。

August 27, 2026 · 2 min