Automata from Agent Traces: Failure and Next-Step Prediction 精读

深度精读 Holistic AI、PUC-Rio 与 UCL 合作的 Agent 轨迹自动机研究(ICML 2026 AIWILD workshop)——把整条语料库的 LLM Agent 执行轨迹坍缩成一台 7-43 个状态的紧凑有限状态机(FSM),无超参数、毫秒级构建。这台 FSM 同时充当四件任务的统一结构基底:工作流记忆(8/8 数据集胜过 Agent Workflow Memory)、下一步预测(交叉熵降 21%)、失败预测(held-out AUROC 最高 0.94)、运行时监控(32% 完成度即触发早停)。本文拆解其’前缀树+最后活动右同余合并’构造、紧凑性为何是全部下游收益的根源,以及’拓扑由 harness 而非模型决定’的核心发现。

August 27, 2026 · 4 min

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment(Station v2)精读

Station v2(DualverseAI × 剑桥 × 港大 × UCSD)把 AI 数学发现从『固定管线里的工具』搬进开放世界多智能体环境:6 个跨模型家族的 agent 在无中央协调器的房间制生态里自选方向、跑实验、发论文积累共享文献。在 AlphaEvolve 目录 12 个构造类问题上 5 题产出相对既有文献新颖的结果——kissing 数 d=11 三个精确 604 点构型(两个为新等距类)、Erdős 最小重叠下界 0.37912→0.380552(闭合已发表区间约 82%)、有限域 Kakeya 新无穷族、离散 Kakeya 针 CT(128)≤0.107067、符号不确定性 0.3089;还独立重构 Jacobian 猜想反例。机制归因:高度自主使 agent 能直接追求不可打分的广义数学目标,评估耗时上限倒逼理论引导构造,46.4% 的亮点结果来自跨模型家族协作。

August 27, 2026 · 3 min

AWM: Answerable Working Memory for Long-Document VQA Agents 精读

深度精读 AWM 论文——Oslo 大学、Stuttgart 大学、HKUST(广州)、清华与 Bosch AI 中心合作提出的工作记忆质量评估与优化框架。论文发现:即便给了金标证据页,42.5% 答对的长文档 VQA 样本留下的工作记忆依然不足以独立支撑答案——现有评测存在「记忆质量盲区」。AWM-GRPO 用四格奖励把 memory-only answerability 信号注入 GRPO,同源受控对比下比 answer-only GRPO 再涨 2.3-2.7 点。本文拆解「答案对 ≠ 记忆对」的诊断设计、四格奖励的机制推演与蒙特卡洛验证,以及中间产物监督这一通用方法论。

August 27, 2026 · 4 min

Beyond the Editing Canvas: Evidence Divergence in OOXML-to-LLM Ingestion 精读

深度精读 Tulane 大学与武汉大学的 OOXML 供应链安全论文——首个规范驱动、跨 Word/Excel/PPT 三格式的「模型所见证据 vs Office 画布所见内容」分歧系统测量。论文从 15,884 条 schema 记录 + 5,206 段规范文本中挖出 639 个候选、确认 21 个 evidence forks(六维分类),用 210 份真实财报文档 × 4 API × 7 网页聊天机器人测试传播:四 API 陷阱返回率 48-76%,20/21 机制至少被一个接口吐出。关键发现:暴露由摄取路径与抽取器配置决定而非模型——同厂 API 与网页端行为不同、三个 Claude 模型走同一 skill 暴露完全一致。本文拆解「合法规范构造里埋只被机器看见的陷阱」的完整机制链。

August 27, 2026 · 5 min

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback 精读

CAFE(复旦大学 × 腾讯 LLM 部门)把纠正性反馈做成搜索智能体轨迹内可请求的干预:共享参数模型分饰 agent/critic 两角色,冷启动 SFT 用『保留自身错误前缀+教师插入反馈+成功续跑』的恢复演示;在线 RL 用比较反馈估计(同提示请求组 vs 跳过组的成功率差)塑造请求回报,反馈感知优势塑形按请求边界分离『跑偏前缀』与『修复续段』的信用;离线 RDPO 从前缀匹配的成功/失败对学反馈生成;100 步在线×1 次 RDPO 交替 5 轮。7 个 SearchQA 基准上 Qwen2.5-7B 平均 EM 52.5/F1 60.7 为最强 RL 搜索方法,6 个 OOD 基准全保持,答案级幻觉率 17.6%→12.6%;单向消融证明只改 agent 或只改 critic 都会平台化,交替优化持续上升——末代 critic 配末代 agent 84.0 vs 配 SFT critic 80.6。

August 27, 2026 · 3 min

Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks 精读

斯坦福单作者实证研究:固定模型、系统性变化任务描述本身,量化 prompt 信息量对编码 agent token 开销的影响。2,700 次受控运行显示——把完整规格砍到裸 user story 使成本 +29.7%、轮数 +16.4%(五个任务全部同向);prompt 只动均值不动方差(重复运行几何标准差恒为 ×1.34);输出 token 仅占 2.7% 却占 51.1% 花费;单次 $0.11 探测可把未知任务成本预测误差从 161% 降到 36%。「具体性而非要求的存在」才是省轮数关键。

August 27, 2026 · 3 min

Candidate supply and answer selection shape the value of LLM judging in multi-agent systems 精读

复旦大学(华山医院+类脑智能研究院)联合上海交大、上海科学智能研究院的多智能体实证研究(Nature 子刊风格):把 MAS 推理分解为「候选生成→同行通信→终端选择」的演化管线,发现核心瓶颈是「生成-保留鸿沟」——正确答案常已在候选中却被多数偏置级联丢弃(差距 13-14pp)。15,336 题离线排序基准证明裁判可靠性随正确答案可用率 sigmoid 上升(半升中点 14.7%);81,390 个冻结候选池重放显示,频率+排序混合选择规则把准确率从 63.82% 提到 70.82-70.95%。

August 27, 2026 · 3 min

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval 精读

深度精读吉林大学 + 蚂蚁集团论文:把大规模技能库的图检索形式化为「预算约束的边置信度校准问题」——多信号诱导高召回候选图后,用移除/替换/逆序三个反事实探针验证每条边是否真为操作依赖,Beta 平滑聚合后按状态门控发布。6 个骨干 × 2 基准的全部 12 个组合全部第一,ScienceWorld 宏平均 72.62→80.50,步数全线下降。

August 27, 2026 · 2 min

Code World Model: Coding Agent as World Brain 精读

西湖大学 AGI Lab 与南洋理工提出 Code World Model:让编码 Agent 充当「世界大脑」,用可执行代码维护持久世界状态并驱动世界演化,再通过 proxy(粗粒度代理视频)接口把状态翻译成帧级时空约束,交给视频模型渲染高保真画面。该框架把「世界演化」与「视觉实现」解耦,直面视频世界模型只能从画面反推规则、上下文不足一分钟、离屏后果无法延续三大结构性缺陷。在仅 5.6 小时 GTA V 游戏数据上 LoRA 微调 MiniMax-H3 后,模型即可跟随 proxy 指定的角色位置、轨迹、场景布局与相机运动,并泛化到训练之外的角色与风格。本精读覆盖其问题定义、方法组件、数据管线与局限。

August 27, 2026 · 3 min

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild 精读

开源模型能否拥有专业级网络安全能力?北航联合 ELLIS、IQuest Research 与新加坡管理大学发布 CyberFactory——一个把野外真实 CVE 工件转化为可执行、可验证训练监督的统一开源框架,覆盖 PoC 生成、漏洞修补、安全问答三任务。其核心是一条’可验证差分 oracle → 技能引导轨迹合成 → SFT 内化’的流水线:差分判定器(补丁前崩溃、补丁后不崩溃)使 agent 能无人监督地 propose-verify-refine;可复用’漏洞分析技能’改变教师模型的工作流(领域引导探索覆盖率 3.78%→99.85%);训练出的 OpenAegis(Qwen3.5-397B-A17B)在 CyberGym 上 Pass@1 达 58.1%,超基座 28.5 个百分点、超 1T 参数的 Kimi K2.7,且推理时不需要技能——工作流已被内化为模型参数。

August 27, 2026 · 4 min