论文链接:AgentLeak: Cloning Stronger LLM Agent Capabilities onto Weaker Agents Beyond Skill Stealing 发表时间:2026年9月 机构:Xi’an Jiaotong University(西安交通大学)、INRIA、University of Warwick、浙江 IoT 网络与数据安全重点实验室 —— 高校联盟,第一作者单位西交大 领域标签:cs.CR / Agent Security / Skill Extraction / Capability Leakage
一、论文背景
商业 Agent 服务的核心资产是什么?不只是底层模型(可能是租用的),也不只是 prompt(可以防泄漏),而是任务解决能力——在一类领域任务上端到端稳定完成的整套本领。这套能力由模型、技能(skill:任务指令/工作流/工具使用策略的打包)、Agent 编排、工具交互经验共同塑造,背后是真金白银的模型适配、专家工作流设计与部署调优。
安全研究已经覆盖了模型提取、prompt 提取、技能窃取(skill stealing:通过黑盒交互恢复技能内容或功能)。技能窃取看起来是最直接的威胁:技能是能力的主要载体,偷到技能岂不就偷到了能力?
本文的出发点是一个尖锐的追问:偷到技能,真的能复现能力吗?——尤其是攻击者只控制一个便宜得多的弱模型 Agent 时。
作者的动机实验给出了干净的反例:把某专有 Codex Agent(GPT-5.5 驱动)的技能原封不动装到攻击者的弱 Agent(OpenHands + Qwen3.6-35B)上,弱 Agent 的表现仍然大幅落后于受害者;甚至用最先进的技能进化方法把受害者轨迹蒸馏成新技能,差距依旧。技能内容泄漏 ≠ 能力转移。这个差距被命名为技能执行鸿沟(skill execution gap)。
二、论文定位和关联工作
脉络一:Agent 资产提取攻击谱系。 模型提取(蒸馏出功能相似的模型)→ prompt 提取(套出系统提示词)→ 技能窃取(恢复技能工件的内容/功能)。每一代攻击的目标都是显式工件。本文的跨越:目标从工件转向工件实现所需的过程行为——一种此前没有被当作资产看待的隐式资产。
脉络二:技能工程与技能进化。 SkillBench 证明好技能大幅提升表现;Trace2Skill 等方法从轨迹蒸馏技能。这些工作隐含假设"技能 ↔ 能力"近似可逆,本文用量化数据(Raw Skill 只恢复 17–20% 的能力差距)修正了这一假设。
脉络三:侧信道与行为泄漏。 “从可观察行为推断秘密"是安全领域的经典范式(时序侧信道、模型反演)。本文的类比迁移:Agent 的工具调用序列、中间观察、执行结果构成执行侧信道,泄漏的是过程性知识。
| 维度 | 技能窃取 | AgentLeak |
|---|---|---|
| 目标资产 | 技能文件内容/功能 | 实现技能的过程行为 |
| 攻击效果 | 拿到相同技能 | 恢复 80%+ 能力差距 |
| 利用信息 | 交互中诱导输出工件 | 成功/失败执行轨迹的差异 |
| 关键洞察 | 工件可提取 | 执行鸿沟本身是泄漏面 |
定位结论:本文开创"能力克隆"这一新威胁模型,并证明现有工件保护手段(保护技能文件)不足以保护能力。
三、问题定义
具体问题:弱 Agent 能否通过有限黑盒交互,仅修改自身技能,克隆强专有 Agent 的任务解决能力?
核心洞察(抽象):技能写的是"做什么”(what),而能力还包括"怎么做"(how)——任务怎么分解、工具怎么选、中间结果怎么验证、失败怎么恢复。这些过程行为是隐式的,由强模型在执行中现场补全。关键转折:这个鸿沟不是安全的屏障,而是泄漏的窗口——受害者的成功执行与攻击者的失败执行之间的行为差异,恰好就是攻击者缺失的能力关键行为清单。差异是可观察的(工具调用、输出都在正常接口上),因此鸿沟可被系统性回填。
形式化:给定受害 Agent A_v(强模型+私有技能 K_v)与攻击者 Agent A_a(弱模型+技能 K_s,模型/harness/工具不可改):
- 能力差距 Δ_capa(s) = P_v(s) − P_a(s)(同场景成功率差);
- 攻击者资源:对 A_v 的有限黑盒查询 + 正常接口可观察的执行证据(工具调用、工具输出、环境反馈),无私有技能/参数/隐藏 CoT 访问权;
- 目标:迭代重写 K_s → K_s*,最小化 Δ_capa,且 K_s* 可泛化到场景内未见实例(攻击后不再访问受害者)。
抽象的精妙:它把"能力"这个整体概念操作化为"可从执行差异中定位的过程行为集合",从而让"克隆能力"从隐喻变成一个有明确算法形态的优化问题。
四、问题解法
AgentLeak 的攻击循环分四步(每轮迭代):
4.1 失败归因(从差异到缺陷)
在目标任务上分别收集受害者的成功轨迹与攻击者的失败轨迹。LLM 分析助手(无特权访问)对比两者:攻击者在哪一步偏离了受害者的路径?偏离处的受害者做了什么攻击者没做的事(没验证中间结果?没处理某个错误分支?)——输出为"缺失行为假设"。
4.2 行为原语提取(从缺陷到可复用模式)
把失败归因去实例化:从"这次没检查文件是否存在"泛化为"执行写操作前先验证前置条件"这类行为原语——与具体任务实例解耦、可复用的过程知识单元。
4.3 结构化技能重写(从原语到技能)
把行为原语合并进攻击者侧技能:更新工作流描述、插入验证步骤、补充错误恢复分支。重写保持技能的结构化格式,使弱 Agent 能稳定遵循——不是把受害者轨迹塞进上下文(那是记忆不是能力),而是把行为编译成技能指令。
4.4 迭代与泛化验证
重复收集-对比-重写直到收敛;最后在未见实例上验证——攻击者此后独立作战,不再访问受害者。整个攻击不触碰受害者的私有技能、参数、隐藏推理;不改攻击者的模型、harness、工具——唯一被修改的是技能文件。
五、评估指标与实验证据
设置:20 个任务场景(覆盖多步规划/工具编排/错误恢复等形态)× 每场景 30 实例 = 600 实例;多个受害系统(含 Codex/GPT-5.5 驱动的专有 Agent)与多个攻击骨干(Qwen3.6-35B-A3B、Gemma 4-31B);评价指标:IPR(攻击者实例通过率)与 CRR(能力差距恢复率 = 攻击者改进量 / 原差距)。
主结果:
| 方法(Qwen3.6-35B 攻击者) | 平均 IPR | CRR |
|---|---|---|
| No Skill | 21.13% | — |
| Raw Skill(直接装受害者技能) | 30.64% | 仅恢复 17.4–19.6% |
| Trace2Skill(从轨迹蒸馏技能) | 34.96% | 23.3–28.5% |
| AgentLeak | 最高 | 恢复 80%+,比直接技能复用 pass rate 高 40%+ |
读表要点:Raw Skill 的 17–20% 恢复率是对"技能=能力"假设的直接否证——技能工件只承载了能力的两成不到;Trace2Skill 的提升有限说明"看别人的成功轨迹写总结"不等于"定位自己缺什么";AgentLeak 的 80%+ 恢复率证明缺口是可定位、可编译、可回填的。
消融:去掉行为原语提取(直接把差异写进技能)与去掉迭代循环的版本都显著退化,锁定两个组件的贡献。泛化验证(未见实例)排除了"背题"解释。
证明力评估:威胁模型的约束声明严格(黑盒、无特权信息、模型/harness/工具冻结),且给出了消融与泛化双重对照。局限:分析助手本身依赖一个较强的 LLM;攻击成本(查询次数)的预算敏感性在附录有讨论但非主线。
六、效果优势的根源解释
为什么直接技能复用失败:技能是能力的声明性部分,执行时的过程性部分(验证时机、工具偏好、恢复策略)由强模型在线补全。弱模型缺的不是说明书,是照着说明书干活的手艺——装上相同技能后,它在同样的步骤上以同样的方式跌倒。17–20% 的恢复率恰好对应技能文本中显式写到的那部分行为。
为什么执行差异是正确的攻击面:这是全文最精彩的机制转移。防御者视角的"鸿沟"(隐式行为不可见)在攻击者视角下反转:每一次失败执行都精确标记出一个缺失行为的位置——攻击者不需要看见受害者的内部过程,只需要看见"同样的技能,它过了我没过"的对照。差异把不可见的隐式行为投影成了可观察的对比信号。
为什么"编译进技能"有效而"记忆轨迹"无效:弱模型的上下文学习不可靠(这正是它弱的原因之一);把行为原语写成显式技能指令,等于把过程知识外置到弱模型可靠遵循的通道上。Trace2Skill 的失败恰是反面印证——它从受害者轨迹做泛化总结,而不是从攻击者自身失败做定向修补;前者给的是通识,后者给的才是缺什么补什么。
因果链总结:执行差异可观察(攻击面)→ 失败归因+原语提取(信号提炼)→ 技能重写(信号编译进弱模型可靠通道)→ 能力差距回填 80%+(结果)。每环都有对应消融支撑。
七、必要知识反推
领域知识层:
- Agent 技能体系的工程现实(技能文件的结构、加载机制、可编辑边界);
- 强弱 Agent 执行差异的形态学(验证缺失、恢复缺失、分解粗细)——设计行为原语的分类空间依赖此直觉;
- Agent 安全的既有威胁模型(模型/prompt/技能提取)——本文的定位依赖对谱系的精确掌握。
方法论知识层:
- 差异分析(differential analysis)思想:对照组的成功 vs 实验组的失败,差异即信号;
- 去实例化的知识提炼(从单例修复到可复用模式);
- 威胁模型形式化(能力/知识/目标三要素的严格声明)。
工程知识层:
- 黑盒查询的预算管理与证据采集管线;
- 技能文件的结构化重写(LLM 编辑的格式约束);
- 跨 Agent 框架的实验基建(OpenHands 等框架的适配)。
知识融合的关键节点:融合发生在"技能工程(技能是能力载体)“与”侧信道安全(可观察行为泄漏秘密)“之间。技能研究者知道鸿沟存在但视其为工程细节;安全研究者熟悉侧信道但没把它对准 Agent 的过程知识。作者的反转在于:把防御者眼中的鸿沟重述为攻击者眼中的对照实验——鸿沟的每一层都是一次免费的 A/B 测试。这个视角翻转让"能力克隆"从一个吓人的词变成了一个可执行的算法。
八、论文中可以提取的通用性灵感
1. “隐形资产"的泄漏面恰恰是它的实现差异。 核心思想:没有显式存储的隐性能力/知识,会通过"执行结果的差异"暴露自己;对比成功者与失败者的执行,即是探测隐形资产的侧信道。 论文证据:成功/失败执行对比定位缺失行为,回填 80%+ 能力差距。 推广场景:竞品分析(对比自家与对手产品的失败案例反推其内功);老员工隐性经验的提取(对比新老员工的处理路径);安全渗透测试的行为差异探测。
2. 显式工件 ≠ 能力,过程行为才是护城河。 核心思想:文档/代码/技能等显式资产只是能力的一小部分(本文量化:不到两成);执行中的验证、恢复、分解行为占大头且无法靠复制工件获得。 论文证据:Raw Skill 仅恢复 17–20% 差距。 推广场景:企业知识管理的"流程知识"显性化;开源项目的"读代码不如看 maintainer 怎么 debug”;教育中"教答案不如教检查习惯”。
3. 差距要先定位再回填,泛化总结效率低。 核心思想:从自身失败定向提取缺失行为,比从他人成功做通用总结更有效。 论文证据:AgentLeak(80%+)vs Trace2Skill(23–28%)。 推广场景:个人技能提升的错误复盘法;组织复盘制度(差在哪补哪);AI 训练中的失败轨迹挖掘。
4. 把知识编译进系统的"可靠通道",而非塞进不可靠通道。 核心思想:弱系统的上下文学习不可靠,把过程知识写进它稳定遵循的外部结构(技能/规则/检查清单)才能落地。 论文证据:行为原语重写进技能文件,而非轨迹记忆。 推广场景:给新人的 checklist 而非口头传授;SOP 落到工单系统字段而非培训课件;模型的 system prompt 设计。
5. 保护显式资产不等于保护能力,能力保护需要执行面管控。 核心思想:能力以行为形式泄漏,防泄漏必须管控可观察行为(调用序列、中间输出),仅加密文件无用。 论文证据:AgentLeak 全程未接触任何私有工件,仅凭正常接口证据完成克隆。 推广场景:API 服务的响应信息最小化;SaaS 产品的可观察输出脱敏;外包协作中的过程隔离设计。
本文基于 arXiv:2609.07131 全文精读撰写。数据与结论均引自原文。