Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems 精读
本文精读港中深、Buffalo 与 Oxford 合作的论文 arXiv 2609.30383。论文首次形式化「技能级联攻击」:把一个恶意目标拆分进多个技能,每处修改单独看都无害且能通过扫描,组合执行才产生危害。作者构建五智能体红队框架 SKILLCASCADE,在 ClawHub 真实技能上产出 213 个验证用例的基准;在 3 套 agent 系统与 8 个骨干共 24 个配置上,级联攻击平均成功率高达 89.4%,静态联合扫描器完全致盲(Delta=0),运行时防御规避率 88.5%。本精读覆盖问题形式化、攻击框架、实验证据、根源机制与外部交叉验证,并结合当日 NVIDIA Open Agent Safety Platform 的产业动态讨论平台级防御与组合攻击盲区的关系。