Super Library Agent: Joint Generation and Maintenance of Multiple Applications Beyond the Single Codebase 精读

KAIST 与 DeepAuto.ai 的 Super Library Agent 为代码智能提出了一个被所有人忽视的新问题设定:LLM 编码 Agent 逐应用生成时会在代码库间复制共享逻辑,长期自主维护还会积累冗余与结构侵蚀。论文定义’Super Library Agent’问题——顺序生成 N 个相关应用的同时维护一个共享组件库,并用三项技术(候选引导抽取、抽取前巩固、调用图条件化迁移)在 WebGen-Bench/PaperBench 上同时保住功能与可维护性:共享策略更新时补丁量从 936 行降到 256 行。这是把软件工程的’库’概念引入 Agent 时代的开创性工作。

September 2, 2026 · 2 min

WebWorld: The Browser as a World Model for Self-Improving Web Code 精读

北航联合上交、澜舟科技等机构的 WebWorld 直击 VLM 代码自改进的结构性缺陷:提出修复的模型同时是评判修复的模型,这种’自己批改自己’的闭环注定产出视觉可信但功能残缺的页面。解法是引入一个 VLM 骗不了的对手方——浏览器本身:作为确定性可执行模拟器,它扮演 Web 代码的’世界模型’,只有同时满足目标前进与既有能力保持的转换才能获得验收证书,认证数据形成只升不降的质量棘轮。WebWorld-27B 在 MiniAppBench-Val 提升 14.9 分,达到 Kimi-K2.6/GPT-5.4 水平;等尺寸消融证明去掉证书后增益几乎消失。

September 2, 2026 · 2 min

CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks? 精读

当 LLM Agent 遇到从未见过的提示注入攻击时,防御系统能否不靠人工写规则、自主合成出经过验证的新防御?香港理工大学与香港中文大学提出的 CAITLYN 用双系统架构回答了这个问题:System I 以两级技能库(零成本规则层 + 合并双调用 LLM 层)实现低开销高精度检测,System II 借鉴程序合成的 CEGIS 思想,把每次漏检当作反例规格,驱动『生成—验证—审查』闭环自动产出新防御技能。在新基准 Emerging 上,静态防御攻击成功率高达 72.5-80.0%,进化后的 CAITLYN 净降约 40 个百分点。本精读拆解其技能表示、合成机制、实验证据与适应性攻击下的再免疫能力。

August 31, 2026 · 5 min

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning 精读

深度精读 MirroS 联合清华、北大、南洋理工的技术报告 Code as Worlds。论文提出用可执行代码表示物理世界的组成、演化与外观(EWR 三元组),把’从观测恢复世界表示’建模为溯因式的 agent 发现环:提出-实例化-执行-渲染-验证迭代修正。再用验证过的世界免费生成带精确物理量标签的 VQA 数据训练 VLM,9B 模型在 QuantiPhy 上 55.4 分超过 Gemini-3.1 Flash 的 54.8,27B 推理变体 58.6 分超过全部基线。

August 31, 2026 · 3 min

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL 精读

深度精读清华大学、腾讯优图实验室与上海AI Lab 合作的 ContextPilot:一个主动上下文管理框架。针对现有方法工具集贫乏(只有搜索/删除/摘要)、探索低效(上下文编辑动作影响悬殊却被均匀采样)、信用分配粗粒度(轨迹级奖励平摊给所有编辑动作)三大缺陷,它扩展出规划、长期记忆、软卸载三类工具,并用上下文变化量+熵变化识别关键编辑决策做分支采样(context-aware partial rollout),再用所有后续分支的平均回报估计动作级优势(细粒度信用分配,方差降为 1/n)。8B-RL 在四基准平均 69.40 超 StateLM-8B-RL 的 65.85;深搜任务上每轮输入 token 稳定在 8-10K(基线线性涨到 30K);消融证明细粒度信用分配贡献最大且在全部基准一致提升。

August 31, 2026 · 5 min

CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases 精读

深度精读 Epiq AI Labs 与康奈尔大学联合发布的企业级问答基准 CorporateBench。论文用程序化生成的时序知识库(KB)构建四家虚拟公司(12 到 10210 名员工、共 26.3 万封邮件),并从 KB 用人工验证的 SPARQL 查询确定性导出标准答案,保证任意规模下的跨文档逻辑一致性。五个前沿模型测试显示:实体抽取基本不随规模衰减,但关系抽取与时序关系严重崩坏;KB 直连(SQL 工具)显著优于 RAG,且两者差距随规模从 0.24 扩大到 0.37,揭示大规模企业通信网络仍是当前 LLM 的重大短板。

August 31, 2026 · 3 min

EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses 精读

精读独立研究者团队的 EvoUndo。论文直面 LLM Agent 自进化的安全盲区:能提升能力的变异未必能被安全撤销,正确恢复往往依赖变异前状态。EvoUndo 把自变异表示为四元组(前向变异+见证捕获+恢复程序+效果契约),在反事实状态上做往返验证。600 个任务中 197 个能力正向但恢复失败的变异构成失败库:原始语言下常规修复 0/197;oracle 审计分解出双瓶颈——S0 层是 grounding 瓶颈(精确地址后 0/48→38/48),S1 层是表达力瓶颈(扩展语言后 142/143),组合修复 180/197。另发现丰富语言加精确诊断反而降效。把能改与改回去拆开的开创工作。

August 31, 2026 · 5 min

GameWAM: A World Action Model for Video Games 精读

复旦、腾讯光子与清华深圳研究生院团队提出 GameWAM,首个面向电子游戏原生键鼠闭环控制(游戏玩法+GUI)的世界-动作模型。它用并行 Video-DiT 与 Action-DiT 做块因果联合流匹配,同时生成未来视觉观测与可执行动作;用每步动作路由器区分 gameplay/GUI 两种控制分布,用预测长执行短的块周期控制解耦规划与承诺,用分层历史压缩维持长时程记忆。在 Minecraft MCU 上平均成功率 50.7(次优 36.8)且执行步数全面最少,零样本迁移 VoxeLibre 达 59.2%。论文还发现并命名了 LASI 失效模式:采样动作源的低频分量会系统性牵引生成相机运动,复用可致原地旋转。整篇论文训练仅 2.79B token,是 Game-TARS 配方的 1/200。

August 31, 2026 · 3 min

HARTS: Efficient Agentic Reinforcement Learning for Hybrid-Attention Models over Arbitrary Rollout Trees 精读

深度精读蚂蚁集团的 HARTS 训练系统。Agentic RL 的 rollout 呈不规则树状、轨迹共享长前缀,逐轨迹独立训练重复计算共享前缀(实测冗余约 5.63 倍);而现有树结构训练系统只支持全注意力模型。HARTS 首次在真实混合注意力模型(MLA+KDA 的 Ling-3.0-tiny)上实现任意 rollout 树的前缀共享:联合微批规划、线性时间的最少调用执行规划、可微状态交接与语义多重性恢复 RL/MoE 目标。实测前向/反向/梯度加速 4.81–4.87 倍,logit 余弦相似度大于 0.9997,在线训练奖励趋势与基线一致。

August 31, 2026 · 4 min

Logos: An Agent Harness on a Cross-Process Bus 精读

深度精读 Sussex、浙江工商大学与上海书缘信息技术合作的 Logos(AAMAS 2027)。针对单进程 agent 框架插件与会话共存一个进程的单点故障问题,论文用四个引理证明时空可组合性演算的可逆性保证可跨进程成立——可靠性不变量只定义在状态空间上,而模型推理是无状态的;再构建 ROS 风格跨进程 harness:插件即进程、路由器只存路由表、唯一共享状态是 append-only 转录。80 个会话在四个击杀点上全部冷切换恢复且零重复效应,总线跳 0.215ms 仅为首 token 的 1/823;同故障下单进程停机 547.1ms 中断全部会话,对等构造只影响一个节点。

August 31, 2026 · 4 min