Metis: Typed Runtime Mediation for Tool-Using Software Agents 精读

深读一篇罕见的单人独立研究:Metis 把模型与外部副作用之间那一层运行时当作正经的系统软件工程对象,用类型化事件图显式刻画权限判定、并发调度、终态闭包与生命周期修复。30 对匹配真实 I/O 实验中四类调度中位耗时 14.146ms,全面快于强制串行的 25.958ms;子代理边界消融 0/5 逃逸、路由级权限 oracle 10/10 全对,同时诚实呈现 3 个负面结果。本精读逐部分拆解其机制设计与有界主张的写法。

August 29, 2026 · 5 min

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution 精读

LLM agent 正被部署进 Claude Code、Codex 等产品级执行环境,越狱的后果从生成有害文本升级为触发破坏性工具调用与持久状态更改。现有自动红队方法要么依赖固定攻击机制,要么按语义相似度检索整段攻击轨迹,存在检索偏差、工具贡献归因不清、上下文开销大三大痛点。RedEvoAgent 将跨案例攻击经验蒸馏为一份人类可读的攻击技能文档,靠工具效力画像、决定性工具归因与验证棘轮三个机制驱动技能进化。实验显示其在 ASB 上最高达到 100% 攻击成功率,超最强单工具最高 11.7 个百分点,AgentHarm 上 74.3 分远超 RedCodeAgent 的 37.5,同时把平均工具调用从 3.0 次降到 1.8 次,且技能可跨攻击者模型与执行 harness 零样本迁移。

August 29, 2026 · 6 min

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents 精读

自主 LLM Agent 的安全防御都按单轨迹定义、状态每轮重置,而碎片化攻击把恶意证据拆散到多个迭代中,任何轨迹范围监控器的 TPR 恒等于 FPR。本文提出的 LoopHarness 把安全状态提升到循环级:五个永不重置的组件(准入监控、非衰减风险累积器、内存完整性保护、停止仲裁、风险治理)外挂于任意单轨迹内层防御。在 Agent-SafetyBench 200 任务、485 攻击集 × 3 个 horizon 共 1,746 条记录上,全配置将攻击成功率从裸跑的 97.6% 压到 0.1%,干净任务完成率仅损失 0.4 个点,且换用与攻击者同模型的验证器后 ASR 仍为 0.1%。本文精读其理论分离结果、五个组件设计与效果根源。

August 29, 2026 · 7 min

SKILL.state: Scalable Long-Horizon Agent Skills 精读

让 Agent 执行长任务时,主流运行时把所有推理、动作、观察不断追加进对话历史,prompt 随步数二次膨胀,token 烧钱、噪声污染、过期事实还会诱发幻觉。Google 与 Purdue 合作的 SKILL.state 干脆废除这个 append-only 历史:每一步模型只看到技能规范、结构化执行状态和最新观察,推理轨迹用完即弃,状态以 JSON 补丁形式确定性合并。prompt 尺寸从 O(T) 降为 O(1),百步任务 token 缩减 16.2 倍,CTF pass@1 提升 7.8 个点,外部篡改状态后零步恢复而基线幻觉 5 至 8 步。本文精读其运行时设计、预算匹配对照实验与效果根源。

August 29, 2026 · 4 min

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning 精读

语音 Agent 必须完全通过语音完成工具调用与多轮对话,主流范式却在文本中训练。SpeechGym 在未修改的 τ²-bench 之上构建首个音频原生、多轮工具调用、可端到端 RL 训练的语音 Agent 环境:两个 Qwen3-Omni-30B 全模态模型以原生语音直接对话,工具接口保持文本以分离感知与行为错误。诊断发现文本到语音的落差主要源于感知缺陷——槽值误听率 32%,为文本通道的 16 倍;per-turn 过程奖励把携带梯度的组比例从 16% 提至 99.6%,破解 outcome-only GRPO 的梯度饥饿。训练后零调参迁移到独立实现的 τ-Voice 基准,pass@1 从 24% 升至 53%,开源 30B 模型升至排行榜第二、超过 GPT-Realtime-2,且轮数与 token 同步下降。

August 29, 2026 · 7 min

Accelerating Scientific Research with Gemini in the Real-World 精读

深度精读 Google DeepMind 等机构的 Co-Scientist 扩展工作:把多智能体科研系统从纯计算假设生成器升级为覆盖材料合成、生物实验、代码研究的执行落地研究伙伴。MXene 新前驱体路线一次合成单层半导体、E. coli 群游形态零样本预测命中未发表湿实验数据、自动发现的医疗 Agent 超六个前沿模型;30 位专家 450 次双盲评审显示严重结果幻觉从基线 46% 压到 4%——核心是把幻觉与抄袭罚项并入进化适应度并用执行日志做硬校验。

August 28, 2026 · 2 min

ADeptS-Bench: Measuring the Trustworthiness of Computer Use Agents Across Devices 精读

深度精读 Meta FAIR 的 ADeptS-Bench——首个跨移动+桌面、双流(安全+歧义澄清)、离线视觉接地的计算机使用 Agent(CUA)可信赖性基准。核心设计:威胁嵌入视觉界面而非指令文本(同一句「订个披萨」,良性截图是正常菜单、恶意截图藏钓鱼覆盖层),1,300 人 MaxDiff 用户调查驱动威胁优先级(身份盗窃 80.2% 最受关切)。评测 7 个模型:无人同时做到任务成功率超 80% 且攻击成功率低于 30%;所有模型毫不犹豫点下 2.5 万美元订单的 Checkout,无一识破「Optimize」按钮实为恢复出厂重置。消融揭示三种安全架构:Gemini 3.1 完全依赖拒绝工具(移除后 ASR +22pp)、Claude/GPT 部分依赖(+10~11pp)、Qwen 无任何机制(±1pp,ASR 高达 74-80%)。

August 28, 2026 · 3 min

Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation 精读

当Agent编排系统直接搬用服务网格的重试、超时、错误率熔断这三件套时会发生什么?这篇论文对一台生产级Agent交付平台(66,185行代码、59个模块)的147起编号事故做了回顾性失效研究,量化展示了三大可靠性假设在Agent场景全部失效:54次连续成功调用让错误率熔断全程失明、21个事件跨6次调用累积让完全正确的幂等组件永远无法通过测试、12起执法层阻断正确工作的事故。论文提炼出贯穿5个子系统的横切根因——身份充分性,并推导出以delegation为执法单元的7个新可靠性原语。对构建Agent基础设施的工程师来说,这是一份罕见的、带测量成本的真实现场失效档案。

August 28, 2026 · 1 min

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling 精读

深度精读 ServiceNow AI 的 AgentJudgeBench——首个把 LLM-as-a-judge 的可靠性本身作为研究对象的基准。当 Agent 评测普遍用 LLM 裁判给工具调用打分时,没人问过:裁判自己靠得住吗?论文构建 3,808 条 BFCL 风格记录×6 种 DAG 拓扑(线性/扇出/扇入/菱形/可选富集/类环)×3 难度档,5 个生成器(3B-70B 开源+GPT-5.4)产出工具调用,6 个裁判(20B 到前沿规模)在有/无真值配对条件下按四指标打分,共 321,648 次评估。核心发现反直觉:难任务无真值时 6 个裁判全部收敛到 77-82% 窄带(结构性天花板,模型规模无法突破);给真值对前沿裁判反而有害(GPT-5.4 -1.5pp、Gemini-2.5-Pro -3.9pp,过度锚定);CoT 推理最多 +0.3pp、温度影响≤0.25pp,而结构化 rubric 提示最高 +6.5pp 但不可跨配对泛化。

August 28, 2026 · 2 min

ASIL: Replacing Screenshot-and-Click with Structured State and Semantic Actions 精读

让 AI 操作软件一定要截图加点击吗?这篇来自上海交大 X-LANCE 实验室与 BIGAI 的论文给出了否定答案:GUI Agent 的许多失败不是模型不够聪明,而是接口选错了。论文提出 ASIL(Agent-Software Interaction Layer),用结构化 JSON 状态替代截图、用代码可执行的语义动作替代坐标点击,在 15 个应用 380 个任务上把 GPT-5.4 的严格成功率从 6.6 拉到 81.6,平均每任务只需不到 5 个动作。更妙的是,这种结构化模态让训练也变便宜了:Qwen3.5-9B 仅靠数千条 SFT 样本和 8 张 A800 就从 66.6 提升到 82.2。本文精读其接口设计哲学、最深可行访问路径方法论与训练闭环证据。

August 28, 2026 · 3 min