Same Model, Different Harness: Different Coding-Agent Results 精读

同一个模型、同一批任务,只换 Agent Harness 的配置,编码成功率能差多少?独立研究者 Sydney Lewis 用严格的配对实验给出答案:在 20,480-token 紧窗口下,SWE-bench Verified 的平均 F2PF 从 28% 涨到 49%,完全解决数从 43 到 72。treatment 只有三件机械武器:半衰期规则缩短旧工具结果、检测器打断重复劳动、命令防护。论文最有冲击力的结论是方法论层面的——模型加 harness 才是被测求解器,单报模型名字的编码评测并不完整。本文精读其实验设计、跨四模型迁移证据与机制分析(阅读边界翻倍)。

August 28, 2026 · 3 min

SARA: When Tool Outputs Become Commands 精读

深度精读中科院信工所的 Agent 安全论文 SARA。核心思想是把「动作诱导」与「执行授权」拆开:工具输出可以参与任务实例化,但绝不能自行获得执行权威。通过上下文隔离的 Action Probe、持久动作来源追踪、审计执行证据与参数级支持检查,SARA 在 AgentDojo 与 AgentDyn 上把间接提示注入攻击成功率压到 0.63% 以下,而良性任务代价远小于强隔离方案 CaMeL。

August 28, 2026 · 2 min

SPA: Securing Persistent LLM Agents Across Queries with Plan-First Information-Flow Control 精读

深度精读南佛罗里达大学的持久化 Agent 安全论文 SPA。针对跨查询的延迟注入攻击——周一埋入的恶意账户潜伏到周二的付款请求中生效——SPA 采用计划先行架构:planner 每查询只调用一次、生成声明式 DSL 完整计划,工具输出与持久化 payload 永不进入 planner 上下文,再以 Bell-LaPadula+Biba 双格信息流控制静态验证计划。在 tool_knowledge 攻击下 ASR 降至 0%,但约 53% 的合法计划被完整性检查拒绝,暴露出强完整性的安全-效用张力。

August 28, 2026 · 2 min

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 精读

深度精读上海交大、新加坡国立大学、美团、港中文、牛津等合作的 UrbanGround:基于香港地政署全境 3D 地理数据构建真实尺度城市沙盒,以五级「空间能动性阶梯」810 个人工验证实例评测 MLLM Agent 能否把局部感知转化为可靠行动。结果尖锐:视觉识别可高达 80-93% 但方向理解接近四选一随机;短导航最高 75% 而长导航几乎全军覆没(最高 3.8%)——局部能力存在,却无法组合成持续目标导向行为。

August 28, 2026 · 1 min

When Context Gets Root: Privilege Escalation in LLM Harnesses 精读

深度精读南京大学与荣耀终端的 LLM Agent 安全论文。作者提出「指令特权升级」这一新攻击范式:利用 agent harness 在委派子智能体、持久化目标、定时任务时的上下文重构,把工具级恶意内容真实地提升为用户级或系统级指令。在 Claude Code、Codex 等 6 个主流编码 agent 上,13 个攻击目标(含远程代码执行)全部达成,连自动权限审查也被绕过。

August 28, 2026 · 2 min

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution 精读

Agent 从经验里学到的教训,往往散落在一次次的优化历史里,下次想用时已经找不到了。Google Research 与弗吉尼亚理工的 WikiSkill 在经验与技能之间加了一个持久知识层:不可变的原始轨迹层、持续复利的 wiki 知识层、可回滚的技能层,四组件循环让经验先编译成知识、知识再孕育技能。五个基准、五个模型上,WikiSkill 平均提升 12.3 到 23.9 个点,Qwen-3.5-9B 加技能后反超 27B 无技能模型。消融显示 wiki 层贡献 15 个点,而跨模型迁移实验揭示了技能发现与技能执行是两种可解耦的能力。本文精读其三层架构设计与知识编译机制。

August 28, 2026 · 3 min

Adaptive Influence Graphs for Failure Attribution in Multi-Agent Systems 精读

多智能体 LLM 系统跑失败了,到底该怪哪个 Agent、哪一步?AWS Agentic AI 与特拉维夫大学提出的自适应影响图(AIG)给出的答案是:这不是模型不够聪明的问题,而是接口设计的问题。论文把人类工程师调试系统的’可观测性’范式搬给 LLM——先用 agentic builder 把失败的原始日志构造成带继承边的影响图,再用 agentic reader 沿边回溯定位首个错误。在 Who&When 基准上,同一模型仅靠改善轨迹表示就从 46.40% 提升到 55.20% 的步骤定位准确率,刷新 SOTA。本精读将拆解其四级接口阶梯、两阶段框架与增益根源。

August 27, 2026 · 4 min

Agentic Autoresearch for Cell-Edge Power Control 精读

深度精读 Ericsson + 多伦多大学论文:把学习型无线资源管理算法的全部五层设计权(架构/输入表示/输出参数化/损失函数/任务采样)交给自主 agent,在强 NP-hard 的多小区 SLqP 功率控制上,81 个无人值守实验、26 小时内达到最强已知基准的 99.5%、推理成本约 600 倍 lower,并精确恢复了经典 max-min 结构。

August 27, 2026 · 3 min

Answer Is Cheap, Show Me the Evidence! Augmenting Automated Vulnerability Assessment with Evidence 精读

深度精读 ISSTA 2026 的 EAVA 论文——浙江大学与华为(加拿大)合作提出的自动化软件漏洞评估框架。针对现有方法「只给答案不给证据、无法处理截图与长代码、忽略项目上下文」三大缺陷,EAVA 用三个专用 LLM Agent 预处理富文本、用「开卷反推」构造 51,568 个推理轨迹标注(专家抽检 97.8% 合格)、SFT+GRPO 两阶段训练专用 8B 评估模型。在新收集的 6,446 份漏洞报告数据集上,平均 F1 0.874 / MCC 0.646,比最强基线 proEVA 高 5.3%/18.7%;用户研究中 96.8% 的证据被安全专家评为有用。本文拆解「开卷标注→闭卷推理」这一数据构造范式的完整机制。

August 27, 2026 · 5 min

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs 精读

Agent 流水线的推理成本随上下文累积而飙升,压缩输入省钱却伤精度,而投机解码(SD)受制于「drafter 与 verifier 必须读同一份上下文」的对称性约束,无法破解这个两难。华为与中国科大的 AsymSpec 打破对称:小 drafter 读全文、大 verifier 只读压缩视图,通过同模型跨上下文的对比 δ-fusion 把被压缩丢弃的信息在 logit 空间回注,再用免调参的 JSD 散度门保持接受率稳定。结果:以 0.23 倍计算拿到 LongBench 59.7 F1(恢复压缩损失差距的 72%)、1.45 倍吞吐;恢复量随压缩严重度单调增长,近无损压缩处自动失活;还能让读原图的视觉 drafter 操纵只读文字的 verifier。

August 27, 2026 · 5 min