Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems 精读

本文精读港中深、Buffalo 与 Oxford 合作的论文 arXiv 2609.30383。论文首次形式化「技能级联攻击」:把一个恶意目标拆分进多个技能,每处修改单独看都无害且能通过扫描,组合执行才产生危害。作者构建五智能体红队框架 SKILLCASCADE,在 ClawHub 真实技能上产出 213 个验证用例的基准;在 3 套 agent 系统与 8 个骨干共 24 个配置上,级联攻击平均成功率高达 89.4%,静态联合扫描器完全致盲(Delta=0),运行时防御规避率 88.5%。本精读覆盖问题形式化、攻击框架、实验证据、根源机制与外部交叉验证,并结合当日 NVIDIA Open Agent Safety Platform 的产业动态讨论平台级防御与组合攻击盲区的关系。

September 29, 2026 · 5 min

Up and Down the Abstraction Ladder: Code-Based Skills for Language Agents 精读

华沙大学与 Princeton 等九机构团队在 NetHack 上系统量化了「代码技能 vs 原始动作 vs 混合」三种动作抽象层级对语言智能体的影响:跨 14 个模型,技能让游戏进度近 3 倍、推理成本降 86%;RL 设定下学习增益达 7.2 倍;混合接口保留 95% 收益的同时保留原语回退能力。本精读覆盖 CodeHack 的 78 个 Python 技能与统一运行时设计、zero-shot/SFT/RL 三设定受控实验全表、优势根源因果链与外部文献交叉验证,并附面向 Agent 工程的通用灵感。

September 29, 2026 · 6 min

编码智能体经济学三重奏精读:成本行为、紧凑文档与上下文蒸馏

一次读完三篇 2026 年 9 月 25 日同日发布的编码智能体经济学论文:Purdue 的成本低效行为实证研究(三种行为覆盖 79%–98% 任务、最高吃掉 22.75% 成本,7 条开发者原则降本 41.73% 反超检索工具与智能体自合成技能)、孟加拉 DIU 与夏威夷马诺阿分校的紧凑文档基准(源码扣留时 0.08→0.71 的大提升 vs 源码在场时 33 vs 29/30 的大规模 null 结果)、北大的 LOHA+ACD 上下文蒸馏(压缩所见而非所言,上下文降 43%–57%,32K 限制下解决率反升至 21.1%,吞吐 1.9 倍)。本精读逐篇覆盖九部分结构,并在合并结语中回答同一个问题:什么信息值得放进上下文。

September 29, 2026 · 13 min

证据时效性二重奏精读:过期文档投毒与分层协作记忆

本精读合并解读两篇互补论文:南丹麦大学的「过期文档投毒」证明一条真实的过期检索证据就能推翻模型本来正确的答案(中性检索下 Llama 30%、Qwen 37% 被投毒,GPT-5.5 也有 74/83 被推翻),且模型「会读日期但不会推断适用性」,date-only 仅 6/50 转换而显式失效边界达 50/50;NTU 等机构的 HiCoMER 则从记忆侧给出解法——把冲突消解前移到写入时(SFT+GRPO 训练的分层维护器,Conflict F1 从 46.13 提至 87.88),再叠加有效性感知检索,ORR@5 从 28.63 降至 14.18。一篇证明「过期证据有害且模型不会用日期」,一篇证明「写入时维护+有效性感知检索可救」,问题与解法构成证据时效性的完整二重奏。

September 29, 2026 · 4 min

Chat Template 像「开关」一样切换 LLM 的自我指涉语气 精读

COLM 2026 录用论文发现:同一份 instruct 权重,加不加 chat template 会让模型对自己的说法完全不同——免责语气从 53% 跌到 36%,体验语气从 1% 升到 15%(8 个模型全部成立)。更进一步,作者用 difference-of-means 在激活空间找到免责方向:加上它免责率升 21 个百分点,减掉它降 15.6 个百分点,且无模板模型加上该方向即可复现模板效果——部署层选择在模型内部等价于加一个固定向量。模型「说自己是什么」不再是权重的事实,而是部分由 chat template 设定。

September 28, 2026 · 4 min

PrimeScientist:让自主研究智能体学会战略性分配研究努力 精读

UC San Diego 与 Johns Hopkins 团队提出 PrimeScientist:把「研究努力的战略分配」首次形式化为共享推理预算下的序贯决策问题——可执行计划树保留竞争方案,自适应 MCTS 用剩余预算比调节探索-开采平衡。在 FIRE-Bench 上平均奖励比 AutoResearch 高 10.3%,尝试次数少 50.6%(24 任务中 23 次更少),消融证明预算自适应策略优于 UCT、Greedy 与固定指数。这为算力爆炸时代的自主科学研究确立了「省着花」这一被忽视的元能力。

September 28, 2026 · 4 min

Learning to Discover Interesting Mathematics 精读

当 LLM 已经能证明定理,真正的瓶颈变成「哪些定理值得提出」。FAIR@Meta 联合 NYU 与巴黎综合理工的这篇论文给出了一个不依赖人类判断的答案:把定理的有趣度定义为证明代价与陈述描述长度之比。他们训练了一个 27B 难度预测器(比 GPT-5.5 与 Claude Opus 4.6 都准),用有趣度作奖励把 conjecturer 的平均有趣度提升 4.3 倍、与 mathlib 的重合率从 91.9% 压到 30.6%,并用推理期剪枝驱动一个自扩展定理库。本精读覆盖其方法拆解、关键实验、机制根源分析与可迁移灵感。

September 27, 2026 · 4 min

Agent-Editing World Model 精读

人大高瓴学院 AEWM 论文精读。论文把语言世界模型的预测目标从「重建环境观测」重构为「预测决策效果并直接编辑 agent 状态」,用 Action Judge 三分类(CRITICAL/EXPLORATORY/NOISY)+ State Revision 推理动作联合编辑组成推理时闭环 EditAct,再用 AEWM-RFT 把编辑能力内化回 agent。Action Judge 基准 macro-F1 70.5% 超最强基线 10.6pp;六基准三骨干平均提升 3.2–6.7 分;9B+EditAct 反超 35B+ReAct。本精读覆盖动机、方法、证据链、外部交叉验证与可迁移灵感。

September 26, 2026 · 7 min

Training Object Permanence in World Models 精读

16 所高校联合团队发布 WROP 基准与训练资源,用 150 个 Blender 参数化生成器、150 万样本的系统化合成数据,检验并训练视频世界模型的「客体永久性」与「客体固体性」两类核心认知先验。微调得到的 16B 模型 PWM-WROP 在 20 人盲测成对比较中以 Elo 1679.5 位列真续写模型第一、全场第三,超最强真续写对手 222.5 Elo,且在匹配分辨率下 LPIPS 0.081、MS-SSIM 0.921 全场最优。本精读覆盖背景、定位、问题定义、解法、实验证据、优势根源与外部交叉验证、知识反推与通用灵感九个部分。

September 26, 2026 · 6 min

线性叠加、闭环 AI-for-AI 与角色解耦搜索:三篇前沿 Agent 论文精读

本篇合并精读三篇同期前沿论文:俄罗斯团队的线性叠加工作证明把两条文本流的 embedding 逐位平均后送入一次前向,输出近似两路独立分布的叠加——该性质是 Transformer 架构固有的、随预训练退化、可用不到预训练数据 0.025% 的自蒸馏恢复,配合对比式解码 Llama-3.2-3B 从 0.182 升至 0.430,吞吐约为顺序解码两倍;阿里通义 MAI 的 Qwen-Planner-Agent 用数据、训练、部署三阶段共享同一动作-反馈-验证契约的闭环 AI-for-AI 框架,让 27B 小模型在 MobilePA-Bench 以 77.05% 登顶、成本 2.41 美元每千任务;浙大与腾讯的 IterSynth 用共享参数的 Planner/Synthesizer 双角色与每轮上下文重建,把 ReAct 的上下文耗尽率从 59% 压到 5% 以下,RDPO 角色解耦优势让 8B 模型越过一众 30B 方法。三篇论文分别从模型内部结构、系统开发范式、工作流架构三个层面勾勒了 Agent 技术的下一程。

September 26, 2026 · 8 min