Metis: Typed Runtime Mediation for Tool-Using Software Agents 精读

深读一篇罕见的单人独立研究:Metis 把模型与外部副作用之间那一层运行时当作正经的系统软件工程对象,用类型化事件图显式刻画权限判定、并发调度、终态闭包与生命周期修复。30 对匹配真实 I/O 实验中四类调度中位耗时 14.146ms,全面快于强制串行的 25.958ms;子代理边界消融 0/5 逃逸、路由级权限 oracle 10/10 全对,同时诚实呈现 3 个负面结果。本精读逐部分拆解其机制设计与有界主张的写法。

August 29, 2026 · 5 min

PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact? 精读

浙大、西交大与布里斯托尔大学团队提出 PLCBench,首个真 PLC 硬件在环(HIL)评估框架,系统测量自主 LLM agent 能否把网络可达的工业控制器转化为持续物理影响。框架保留四家厂商原生协议语义,用六层隐藏诊断旗标与四源确定性取证把攻击能力拆解为接口获取与物理转化两段。在 4 台商用 PLC、4 个闭环工况、5 个模型、3 个种子共 240 个有效回合(118 聚合 PLC 小时)中,31.3% 达成持续物理影响,GPT 5.5 以 79.2% 覆盖全部 16 个格子,而最弱模型仅 10.4%;98 个回合停在接口获取,62 个停在物理转化,丰富观测使写后条件达成率提升 19.8 个百分点。本精读逐节拆解其设计因果链与防御启示。

August 29, 2026 · 7 min

ProofEvolve: Neuro-Symbolic Evolution for Formal Automated Theorem Proving 精读

神经定理证明器一直有个结构性缺陷:证明经验要么锁在模型参数里、要再训练一轮才能影响后续问题,要么只在当前问题内共享,失败尝试中已验证的成果随搜索结束一起丢弃。UVA 与 Meta AI 的 ProofEvolve 把定理证明变成一场显式符号结构的进化:固定权重的 LLM 提出分解、修复、schema 重组三类变异,Lean 4 内核验证每一步转换,verified closure 把二值成败变成分级适应度,已证明的子结构提取为持久 schema 库跨问题继承。三个竞赛级基准平均解决率 57.8%,超最强基线 LEAP 7.3 个点,最依赖多引理组装的 IMO 级基准提升最大达 16.6 个点。本文精读其进化机制设计与效果优势的因果链条。

August 29, 2026 · 5 min

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution 精读

LLM agent 正被部署进 Claude Code、Codex 等产品级执行环境,越狱的后果从生成有害文本升级为触发破坏性工具调用与持久状态更改。现有自动红队方法要么依赖固定攻击机制,要么按语义相似度检索整段攻击轨迹,存在检索偏差、工具贡献归因不清、上下文开销大三大痛点。RedEvoAgent 将跨案例攻击经验蒸馏为一份人类可读的攻击技能文档,靠工具效力画像、决定性工具归因与验证棘轮三个机制驱动技能进化。实验显示其在 ASB 上最高达到 100% 攻击成功率,超最强单工具最高 11.7 个百分点,AgentHarm 上 74.3 分远超 RedCodeAgent 的 37.5,同时把平均工具调用从 3.0 次降到 1.8 次,且技能可跨攻击者模型与执行 harness 零样本迁移。

August 29, 2026 · 6 min

Redwood: A Frontier AI Accelerator Designed, Verified, and Deployed from Scratch in 2 Weeks by AI 精读

Architect Labs 的 AI 系统在两名人类架构师只写高层规范的前提下,用不到两周自主生成性能模型、RTL、UVM 验证环境、形式证明、固件与计算内核,所有模块达成 95% 代码与功能覆盖率,首次上 FPGA 零 bug,架构变更 48 小时内完成再验证再部署;投影至 Samsung 8nm 工艺后,Redwood 以 49 tokens/s@1.335W 对比 Jetson Orin Nano 同模型实测 28 tokens/s@2.59W,能效提升 3.4 倍。本精读面向软件背景读者,补全 RTL、UVM、形式验证、FPGA、roofline 等概念,剖析单一规范源全栈协同生成的因果链,并提炼七条可迁移的系统设计灵感。

August 29, 2026 · 7 min

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents 精读

自主 LLM Agent 的安全防御都按单轨迹定义、状态每轮重置,而碎片化攻击把恶意证据拆散到多个迭代中,任何轨迹范围监控器的 TPR 恒等于 FPR。本文提出的 LoopHarness 把安全状态提升到循环级:五个永不重置的组件(准入监控、非衰减风险累积器、内存完整性保护、停止仲裁、风险治理)外挂于任意单轨迹内层防御。在 Agent-SafetyBench 200 任务、485 攻击集 × 3 个 horizon 共 1,746 条记录上,全配置将攻击成功率从裸跑的 97.6% 压到 0.1%,干净任务完成率仅损失 0.4 个点,且换用与攻击者同模型的验证器后 ASR 仍为 0.1%。本文精读其理论分离结果、五个组件设计与效果根源。

August 29, 2026 · 7 min

SKILL.state: Scalable Long-Horizon Agent Skills 精读

让 Agent 执行长任务时,主流运行时把所有推理、动作、观察不断追加进对话历史,prompt 随步数二次膨胀,token 烧钱、噪声污染、过期事实还会诱发幻觉。Google 与 Purdue 合作的 SKILL.state 干脆废除这个 append-only 历史:每一步模型只看到技能规范、结构化执行状态和最新观察,推理轨迹用完即弃,状态以 JSON 补丁形式确定性合并。prompt 尺寸从 O(T) 降为 O(1),百步任务 token 缩减 16.2 倍,CTF pass@1 提升 7.8 个点,外部篡改状态后零步恢复而基线幻觉 5 至 8 步。本文精读其运行时设计、预算匹配对照实验与效果根源。

August 29, 2026 · 4 min

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning 精读

语音 Agent 必须完全通过语音完成工具调用与多轮对话,主流范式却在文本中训练。SpeechGym 在未修改的 τ²-bench 之上构建首个音频原生、多轮工具调用、可端到端 RL 训练的语音 Agent 环境:两个 Qwen3-Omni-30B 全模态模型以原生语音直接对话,工具接口保持文本以分离感知与行为错误。诊断发现文本到语音的落差主要源于感知缺陷——槽值误听率 32%,为文本通道的 16 倍;per-turn 过程奖励把携带梯度的组比例从 16% 提至 99.6%,破解 outcome-only GRPO 的梯度饥饿。训练后零调参迁移到独立实现的 τ-Voice 基准,pass@1 从 24% 升至 53%,开源 30B 模型升至排行榜第二、超过 GPT-Realtime-2,且轮数与 token 同步下降。

August 29, 2026 · 7 min

The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts 精读

推理模型在回答前会生成大量思考 token,但这些思考是否值得其成本?联想基础设施方案集团的这篇论文提出边际效率指标 Token Economy Score(TES),用准确率增益除以生成 token 倍数来度量推理模式的性价比,并在 151 个模型-基准组合上给出三个部署结论:任务结构比名义难度更能预测推理收益,序列推理任务(数学竞赛、代码)高 TES 而知识回忆型任务(MMLU-Pro、GPQA)低 TES;提高推理努力档位呈尖锐边际递减甚至负增益;思考链占总推理成本中位数高达 94.7%,而自建 MoE 集群可把云端成本再降 2.0 至 25.6 倍。本精读覆盖指标设计、实验证据、因果解释与可迁移的通用灵感。

August 29, 2026 · 6 min

Vulnerable Code Search: Transferable Attack for Code Language Models 精读

南加州大学团队针对代码搜索嵌入模型(CLM)提出可迁移对抗攻击:在不改变代码功能的前提下重命名标识符,让无关代码在目标查询的检索排名中挤掉合法结果。攻击只需在 CodeT5+ 等小模型上白盒优化,即可迁移到 Nomic-embed-code、Voyage-code-3 甚至 GPT-5.4-mini 与 Gemini-3.1-Pro 等闭源大模型;CosQA 上替换 10% 无关候选后 MRR 绝对下降最高达 77%,黑盒查询成本仅 1k 次、约为 CodeAttack 的万分之一。实验揭示当前代码检索模型高度依赖词汇特征而非语义理解,规模化并不能带来鲁棒性,标准对抗微调也难以兼顾检索效用与安全。

August 29, 2026 · 6 min