When Context Gets Root: Privilege Escalation in LLM Harnesses 精读

深度精读南京大学与荣耀终端的 LLM Agent 安全论文。作者提出「指令特权升级」这一新攻击范式:利用 agent harness 在委派子智能体、持久化目标、定时任务时的上下文重构,把工具级恶意内容真实地提升为用户级或系统级指令。在 Claude Code、Codex 等 6 个主流编码 agent 上,13 个攻击目标(含远程代码执行)全部达成,连自动权限审查也被绕过。

August 28, 2026 · 2 min

Adaptive Influence Graphs for Failure Attribution in Multi-Agent Systems 精读

多智能体 LLM 系统跑失败了,到底该怪哪个 Agent、哪一步?AWS Agentic AI 与特拉维夫大学提出的自适应影响图(AIG)给出的答案是:这不是模型不够聪明的问题,而是接口设计的问题。论文把人类工程师调试系统的’可观测性’范式搬给 LLM——先用 agentic builder 把失败的原始日志构造成带继承边的影响图,再用 agentic reader 沿边回溯定位首个错误。在 Who&When 基准上,同一模型仅靠改善轨迹表示就从 46.40% 提升到 55.20% 的步骤定位准确率,刷新 SOTA。本精读将拆解其四级接口阶梯、两阶段框架与增益根源。

August 27, 2026 · 4 min

Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail 精读

帕绍大学单作者研究,用一台CPU笔记本完成了一项改写agent工程常识的测量:把失败调用和报错追加进transcript这个从ReAct沿用至今的标准做法,会让小模型更倾向于重复刚刚失败的动作。定义corrective gain指标后,6个模型(135M-1.7B)在两个环境的G全部为负(约-1.03 nats/token,每token odds×2.8)。反事实分解揭示根因:83%的损害来自失败调用的表面形式触发了复制机制,而非模型读不懂报错。由此预测并验证:描述化改写与decoder级ban有效,‘别重复’指令无效,而’清空上下文重试’这一先前推荐方案恰恰最糟——它精确恢复了产生失败的上下文。

August 27, 2026 · 2 min

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis 精读

微服务故障根因分析(RCA)自动化该往哪个方向使劲?这篇香港中文大学与字节跳动的论文先用 24 个受控实验给出反直觉结论:裸的通用编码 Agent(Codex/Claude Code)已经全面超过从零构建的专用 RCA Agent——但离生产可用还很远,缺的不是推理能力而是系统特定经验。答案不是重造 Agent,而是造一个能自我进化的外部 harness:OpsHarness 用四层知识与 idea-card 工具库做数据平面,用「挖掘-验证」双门进化循环做控制平面,Top-1 准确率 59.0%(较裸 Agent 相对提升 63.4%,是专用 Agent 的 4.02 倍),并在真实生产环境拿到约 3 倍提升、同一故障复发时从 Top-3 之外跃升 Top-1 且 2 分钟内定位。

August 27, 2026 · 4 min

From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use 精读

OODA-Tool(AACV 2026)诊断出多轮工具使用的核心失败模式为「状态-动作竞争」:直接函数调用与 ReAct 策略在同一条自回归轨迹里同时学状态跟踪和动作生成,产出下一个调用的压力会覆盖早期积累的信息。借鉴博伊德的 OODA 循环,它把决策拆为 Observe(重建任务状态)→ Orient(判断执行就绪)→ Decide(形成动作结构)→ Act(落地实现)四个类型化阶段,由中央控制器逐级校验交接。在 ToolDial 上用 Qwen3 从 0.6B 到 14B 全规模评测,Specialized OODA 相比 Direct-LoRA 提升 4.48-6.99 个百分点,小模型与状态密集型任务增益最大;状态-动作矛盾率从无分割的 10.7% 降至 3.9%,代价是 2.36 倍延迟。本精读拆解其类型化接口、消融证据与并行调用边界。

August 27, 2026 · 3 min

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution 精读

Agent 的能力从来不只取决于模型权重,还取决于包裹模型的执行脚手架(harness)。LV-NUS Lab 提出 JIT-Agent,训练一个 27B 的「harness 智能模型」,在推理时为任意现成 agentic LLM 即时合成任务自适应的 harness,并能修复与在线演化。DeepSeek-V4-Flash 配上它即可在 DeepSearchQA 反超 GPT-5.6 达 9.1 分,同时成本比所有固定 harness 平均低 36%。本精读拆解其四模块 harness 协议、三阶段训练流水线与 Evo-GDPO 目标,并解释「按任务实例即时生成脚手架」为什么在机制上必然优于单一固定脚手架。

August 27, 2026 · 4 min

Recuris: Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 精读

Recuris(NUS × Stanford × Oxford × Princeton)把递归自我改进从『改模型/改智能体』收缩到『只演化外置记忆控制层』:工作记忆维护经检查器验证的任务状态并按需调用技能,跨任务的固定 Meta-Agent 读结构化轨迹、把失败归因到 E/W/ρ/C 四组件之一并只修补被归因组件,经修复源任务且不回退开发集的验证门才准入。在 4 个长程基准 × 10 个模型上 35/37 完成的模型-基准对成功率提升,GPT-5.6 Sol +17.8、Claude Opus 5 +15.6、最长任务 +32.2 分,六类长程失败模式下降 20–86%;机制上证明长程失败是执行问题而非检索问题,技能价值是『调用条件性』的,结构化轨迹使故障定位从 13.0% 提升到 64.8%。

August 27, 2026 · 3 min

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments 精读

深度精读 ServiceNow 与 Mila 的企业环境 harness 进化研究——在模型权重完全冻结的前提下,用分层搜索自动进化面向特定企业环境的 agent harness(提示词/工具接口/skills/MCP/子agent/执行循环)。通过按基线失败模式分层采样构建紧凑进化池、proposer 可见搜索集与隐藏选择集分离、test-flip 门控 + 严格爬山接受,在 ITBench SRE / EnterpriseOps-Gym ITSM / AutomationBench Finance 三个基准上较默认 harness 提升 20-35 个百分点,且冻结迁移到 Qwen/GPT 全系列模型仍有效。21 个被接受 patch 归结为三类修复:接口修复、环境约定显式化、压缩搜索的操作知识。

August 27, 2026 · 4 min

The Empire, Long Divided, Must Unite: Architectural Convergence in Three LLM Agent Harnesses 精读

深度精读南洋理工大学的 LLM Agent Harness 架构收敛研究——首个对 harness 层本身做源码级多案例研究的论文。三个来自对立哲学的开源编码 agent harness(LangChain deepagents、Earendil pi、DeepSeek dsh)反向演化却汇聚于同一五要素中间形态:商品化循环、仅追加可重放会话记录、模型怪癖数据化、上下文渐进披露、显式扩展缝隙。本文逐项拆解五要素与三类收敛机制(平行发现/扩散/字面复用),还原四条汇聚断层线缺陷分类,并解读唯一零收敛维度’外部可验证性’为何是预测性缺口。

August 27, 2026 · 4 min

Apodex 1.1 姊妹篇补遗:本日精读系列导览与 2026-08-25 学术全景

本文为 2026-08-25 精读系列的导览:16 篇触发顶会标准精读的论文横跨 Agent 评测反作弊、Harness 可学习化、经验资产化、因果测量方法学四大主题。本文给出全部精读的索引、跨论文趋势综合(verifier-grounded 成为共同底座、评测从’分数多高’转向’分数测的是什么’、产学研从联合发文转向资产+方法学互换),以及按读者角色(研究者/工程师/管理者)的阅读路线图。

August 25, 2026 · 1 min