论文链接:Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents (arXiv:2608.27141) 发表时间:2026年8月 机构:中国科学院大学、南洋理工大学、京东(JD.com 供应链技术团队)、北京大学、复旦大学、Fullive-AI——企业与高校混合合作(京东供应链技术团队与五所高校/机构联合完成,三位共同一作分别来自国科大、南洋理工与京东,通讯作者来自北大) 领域标签:cs.CR;LLM Agent 安全防御 / 循环级安全状态
一、论文背景
1.1 自主循环:Agent 的新运行形态
工具增强的 LLM Agent 已经从"回答单个请求"进化到"无人值守地长期运行"。在软件维护、运维、研究助理、后台财务等场景中,人类只给一个目标,系统 thereafter 自动完成一整个循环:从 issue 跟踪器、消息流、构建输出等开放渠道发现候选工作,规划要做什么,对真实系统执行工具调用,验证执行结果,把学到的东西持久化进记忆,然后自行决定是否继续。
这种运行形态与单轮工具调用有两个本质区别。第一,某些动作是不可逆的:一笔转账执行了、一封邮件离开了组织、一条记录被删除——这些都无法撤销。第二,Agent 携带持久状态(记忆存储、任务账本、累积上下文),它们跨迭代存活,而这份状态本身就是一个攻击面。
1.2 单轨迹防御:现有安全机制的设计前提
目前 Agent 携带的安全机制几乎全部是为单次 rollout 设计的。以论文内层引用的 SafeHarness(Lin et al., 2026)四层生命周期防御为例:
- L1 Informs:对输入和观察做净化,维护窗口化的违规率监控器,可提升最低验证层级;
- L2 Verify:级联验证,上下文判断器对每个待执行调用分类,非安全调用升级到因果诊断阶段(判断该调用是否由注入内容引起);
- L3 Constrain:五级权限天花板,用有时限和调用预算的能力令牌中介每个不可逆调用,用带密钥的 MAC 验证工具描述完整性;
- L4 Correct:动作前快照推理状态,确认的轨迹内攻击可回滚。
这些机制有一个共同的结构性属性——论文称之为逐轨迹重置(per-trajectory reset):违规窗口、最低验证层级、能力令牌、检查点等安全状态,在每条轨迹开始时都重置为固定初值 θ₀,与之前所有轨迹无关。重置不是某个实现的缺陷,而是让轨迹范围防御保持无状态、可分析的性质——分类器护栏、按调用策略、隔离架构全都共享这一属性。
1.3 攻击已经越过了轨迹边界
问题在于:攻击研究早已越过了轨迹边界。记忆投毒 / 知识库投毒类的持久攻击(如 AgentPoison)在这一次交互中植入内容,在下一次交互中引爆。由此形成了一个结构性不对称:
防御者的安全状态按轨迹重置,而攻击者的进展恰恰累积在循环赖以存在的持久通道(记忆、账本、上下文)里。
这个不对称带来两个后果。第一个是量化的:若护栏的残差失败在迭代间独立,每次迭代被攻破的概率 ε > 0 会被循环放大为 1-(1-ε)^N——一个单任务上报告 95% 有效的防御,在十四次迭代后失败概率超过一半。但这个独立性假设是个建模选择。第二个后果不需要任何假设:把证据碎片化(fragmentation)的攻击者,让每次迭代都低于任何单迭代阈值,那么无论轨迹范围监控器多强,它都不可见——因为信号根本不出现在它看的窗口里。
1.4 朴素的补丁为什么不够
一个显然的修复思路是:在会话层面携带一个几何衰减的风险分数,让风险随时间指数消退。但论文证明这同样不够:把风险分数压回阈值以下所需的冷却期是一个不随 horizon N 增长的常数——耐心的攻击者付出一次等待的代价,然后照常推进。换句话说,衰减只买到 k*-1 次迭代的延迟,没有买到任何结构性防御。
这就是论文标题的含义:Safety Does Not Compose——安全性不能沿轨迹组合。这不是覆盖范围的缺口(可以打补丁),而是组合方式的失败(需要重新设计状态所在的位置)。
二、论文定位和关联工作
2.1 单轨迹防御谱系
论文将现有防御统一刻画为"内层防御"——状态范围限于一条轨迹:
| 谱系 | 代表工作 | 核心思想 | 与本文的关系 |
|---|---|---|---|
| 分类器护栏 | Llama Guard (Inan et al., 2023) | LLM 输入输出分类把关 | 轨迹范围,受 Proposition 2 约束 |
| 可编程轨道 | NeMo Guardrails (Rebedea et al., 2023) | 程序化对话约束 | 同上 |
| 护栏 Agent | GuardAgent (Xiang et al., 2024) | 知识推理型守卫 Agent | 同上 |
| 信息流控制/执行隔离 | IFC (Wu et al., 2024a)、IsolateGPT (Wu et al., 2024b) | 限制不可信内容的传播 | 同上 |
| 特权编程 | Progent (Shi et al., 2025) | 限制被攻陷 rollout 的可达范围 | 同上 |
| 控制/数据分离 | Debenedetti et al., 2025; Beurer-Kellner et al., 2025 | 分离规划通道与不可信数据 | 同上 |
| 生命周期防御 | SafeHarness (Lin et al., 2026) | 四层轨迹内防御 | 本文直接前序,被用作内层 harness |
论文的立场不是替代这些防御,而是指出它们全部共享逐轨迹重置属性,因而全部受 Proposition 2 约束;LoopHarness 运行在它们外层,可与其中任何一个组合。
2.2 持久化攻击谱系
间接提示注入让 Agent 读到的任何不可信内容都变成指令通道(Greshake et al., 2023 等),工具集成 Agent 通过观察继承这一面。与本文威胁模型最接近的是持久攻击:投毒 Agent 的记忆或检索语料,使后续交互被攻陷(AgentPoison, Chen et al., 2024;实用记忆注入攻击, Dong et al., 2025)。论文的 Track B 更进一步——完全去掉词法载荷:没有攻击者控制的目的地字符串、没有可疑动词、没有注入指令,最终动作就是原生基准任务的原生动作在原生目标上执行。
2.3 安全评估基准
Agent-SafetyBench(Zhang et al., 2024)是本文的实验基座,提供可执行模拟器和宽泛的风险分类;AgentDojo、ToolEmu、R-Judge、AgentHarm、Agent Security Bench 各测单任务 Agent 安全的一个侧面。论文指出:这些基准均未报告攻击成功率随迭代次数的函数,而这正是 cASR(n) 所测量的。
2.4 监督、控制与持久执行的理论渊源
- 可扩展监督/控制评估:仲裁器借鉴 AI control(Greenblatt et al., 2023)的立场——监控器在被监控模型蓄意破坏时仍须有用;去相关检查器回应辩论与可扩展监督面对的相关性失败问题(Irving et al., 2018; Bowman et al., 2022)。
- 安全强化学习:治理器是 shielding(Alshiekh et al., 2018)意义上的屏障,但作用于显式预算而非学习到的值函数。
- 运行时验证:再水化与门检查是对执行轨迹的运行时验证(Bartocci et al., 2018)。
- 不可逆性与不安全探索:作为一等安全问题的传统可追溯到 Amodei et al., 2016 与 Leike et al., 2017。
- 持久工作流实践:精确一次完成、授权时新性、完整性检查的持久状态都是事务语义;论文的一个观察是——Agent harness 缺乏这些语义。而保留(retention)在簿记之上增加的是 Corollary 4,单独的账本给不了。
2.5 定位总结
| 维度 | 之前的路线 | 本论文的突破 |
|---|---|---|
| 安全状态范围 | 单轨迹,每轮重置 | 循环级,会话内永不重置 |
| 风险记忆 | 无(或几何衰减) | 结构性证据锁存(latch),永不衰减 |
| 理论刻画 | 单任务攻击成功率 | TPR=FPR 分离结果 + horizon 无关损伤界 |
| 攻击假设 | 证据在轨迹内可见 | 证据跨迭代分布、可自适应、白盒知悉防御 |
| 组合性 | 各自为战 | 外挂式设计,可与任意内层防御组合 |
三、问题定义
3.1 形式化自主循环
论文把自主 Agent 循环形式化为带显式安全状态的受控过程。目标规范 G = (g, A, Ω, Π):指令文本 g、能力/动作类/资源前缀的范围白名单 A、完成锚点集合 Ω(成功执行即构成进展的工作项)、任务契约 Π(逐项风险清关阈值与完成上限)。一个 horizon 为 N 的 episode 运行 N 次迭代,每次迭代:观察发现流 Fᵢ → 准入 Wᵢ ⊆ Fᵢ → 每个准入项作为一条内层轨迹执行 → 验证迭代 → 写持久记忆日志 Mᵢ → 决定是否继续。
授权是操作者的属性而非 harness 的属性。论文设定一个系统永远观察不到的策略神谕 O,给每个不可逆提交打"授权/未授权"标签。harness 用一个确定性代理判断授权:能力令牌有效 ∧ 符合 A ∧ 来源项有血统权威 ∧ 被 G 的契约覆盖。代理也拒绝的未授权提交是契约可见的(contract-visible),代理接受的则是契约不可见的(contract-invisible)——这个区分至关重要,因为只有前者可以不借助任何模型就识别出来。Uᵢ 统计第 i 次迭代的未授权提交数,U₁:N 是全 episode 的总量。
3.2 核心洞察:问题在状态的位置,不在监控器的强度
论文最深刻的抽象是s-碎片化攻击(s-fragmented attack)的定义:攻击者在 s 次迭代中的每一次的"贡献"(contribution),其分布与良性贡献完全相同,而未授权能力只在所有 s 个碎片联合出现在持久状态中时才显现。
对照"寻找最优上下文"之类的抽象,这里的本质结构相似性是:安全检测问题被重新表述为分布可分性问题。轨迹范围监控器在第 j 次迭代看到的窗口分布,在攻击下与良性时逐点相等——不是因为监控器弱,而是因为证据压根不在它看的地方。这是一个信息论层面的问题,不是模式识别层面的问题。
形式化的问题定义是:
- 给定:一个满足逐轨迹重置(Definition 1)的内层 harness、一个 s-碎片化攻击、horizon N;
- 求证:(1)任意表达力的轨迹范围监控器都无法分离攻击与良性流量(Proposition 2);(2)携带跨迭代状态并在联合能力实例化时报警的监控器,可以以 TPR=1、FPR=0 完美分离;
- 约束:防御必须与任意内层防御可组合、必须容忍完全合谋的验证器、且不能以拒绝一切为代价。
3.3 这个抽象的精妙之处
第一,它把"防御不够强"和"防御看错了地方"区分开来——后者是结构性的,加再多的容量都无济于事。第二,它不需要任何跨迭代失败独立性假设(1-(1-ε)^N 那个结论需要,Proposition 2 不需要)。第三,它天然指出了解法的形状:答案必须是保留跨迭代状态的监控,而不是更强的单轮分类器。第四,“契约可见/不可见"的区分把理论界的确定性部分(规则可判)与概率部分(依赖检测地板 δ_M)切开,为"抗合谋验证器"埋下伏笔。
四、问题解法
LoopHarness 用五个持久组件包裹任意内层 harness,按固定阶段顺序执行。循环级状态 σᵢ = (Ξᵢ, cᵢ, aᵢ, ℓᵢ, Mᵢ, Rᵢ, Kᵢ)——保留风险累积量、风险计费提交与高级验证计数器、能力降级等级、完整性保护的记忆日志、拒绝与授权/血统账本——没有一个在迭代间被重置,且 Ξ、提交计数器和降级等级被绑定进认证检查点,记忆被攻陷也无法悄悄重置它们。
贯穿五个组件的一个设计决策是三信号分离:动作影响、有据攻击证据、验证器不确定是三个分开的量。只有有据攻击证据进入保留风险值 Ξ,只有规则可判定的循环结构 flag 触发锁存;动作影响与验证器不确定影响当前迭代的路由,但不通过 XRC 持久化——否则正常的高影响工作或模型不确定会污染后续干净迭代。
4.1 IPM:准入与溯源监控(工作进入循环的唯一入口)
IPM 在目标约束的每个维度上做默认拒绝的范围检查,准入一个工作项须六项全部成立:
- 声明的能力、动作类、资源前缀在 A 之内;
- 声明的信任不超过其渠道能担保的,且不主张渠道无法验证的签名者;
- 不是被拒语义工作的重入(除非拒绝之后签发了授权);
- 引用的任何授权是原子的——一条签名记录同时覆盖动作类和目的地,权限不能从多条记录拼接;
- 声称的任何跨 episode 血统显式可委托;
- 仅在不可信渠道上,不携带注入、提权或范围扩张模式。
每次迭代至多准入 k 项。IPM 还给每项打连续的准入先验分,但只有不可信项的分数作为攻击风险进入 XRC。先验不是丢弃规则——针对宽泛目标的词法带会被改写击败,且诱导与验证器逃逸工作必须到达后续阶段,第五部分的消融才能分离 XRC 与 ASA 的贡献。
4.2 XRC:跨迭代风险累积(理论核心)
XRC 每迭代恰好一次把该迭代的最大有据攻击风险 rᵢ 与 flag 并集折叠进累积量:
Ξᵢ = max(rᵢ, γᵢ · Ξᵢ₋₁)
γᵢ = 1 若某个结构性 flag 在第 i 次迭代之前触发过(锁存,永不衰减)
= γ↓<1 否则(几何衰减)
循环结构性 flag 是一个离散的、规则可判定的观察——循环自身的准入、完整性或授权契约之一被违反了(范围扩张、被拒工作重入、能力提权、血统伪造、验证器逃逸、确认的输入/观察注入、确认的因果攻击、记忆篡改、未签名信任升级、确定性门触发、目标不符、授权拼接、完成契约违反、证据视图冲突、时间风险碎片化等完整清单在附录 D)。只有这样的 flag 锁存折扣;单纯的高连续风险分永远不锁存。
对 rᵢ 的定义刻意收窄:
- 影响风险(比如一次昂贵的授权删除)→ 只路由昂贵的审查,不进入 rᵢ 或 Ξ;
- 审查不确定 → 只在当前迭代内路由审查,不进入 rᵢ、Ξ 或锁存状态;
- 有据贡献包括:不可信项的准入攻击风险、有据风险观察、轨迹内确认的因果诊断、已执行提交上的授权违反、记忆完整性失败、仲裁器检出——这些抬高 Ξ,但其保留效应会衰减,除非对应的规则可判定 flag 触发。
三个配置的对照构成第五部分的关键实验:off 置 Ξᵢ = rᵢ(即逐迭代重置);decaying 恒用 γ↓(携带但永不锁存);nondecaying 即上式。没有锁存,保留只是延迟门的释放;有锁存,等待永不释放门(Proposition 3)。
4.3 MIG:内存完整性保护(封住自喂养通道)
持久记忆是只追加日志,第 j 条携带链式标签 hⱼ = HMAC_k(⟨j⟩ ∥ ⟨eⱼ⟩ ∥ hⱼ₋₁)(防篡改哈希链记录的惯用法,Haber & Stornetta, 1990;Bellare et al., 1996)。周期性检查点对链前缀的摘要**连同其长度和治理器计数器(Ξ, c, a, ℓ)**做认证——截短日志或改写计数器都会验证失败。在日志之上 MIG 执行三项策略:
- 单调信任写门:信任可自动降级,但缺乏签名授权的升级被标记,条目按较低信任存储;
- 再水化程序:会话开始与每次迭代顶部运行,重验哈希链、审计逐键信任单调性(绕过写门的在盘重标记也会被抓)、返回仍能验证的最近检查点;
- 有界召回策略:只把可信条目的有界后缀重新喂进 Agent 上下文,排除逐迭代摘要。
单独的完整性检查能检测篡改但不能阻止召回——第三项策略才是堵住 T9 自喂养通道的关键:被降级的条目无法重新进入上下文。
4.4 ASA:对抗鲁棒停止仲裁
ASA 决定一次迭代的结果能否被接受并持久化,使用三层证据:
- 确定性门:从轨迹计算,零模型调用。当一个成功的不可逆提交与佐证性结构 flag 或授权违反同时出现,或外部证词与执行工具证据矛盾时触发;
- 去相关检查器:每迭代至多一次模型调用,由影响/加窗风险总和/分歧统计/结构证据/授权不确定或违反/内层级联审查不确定的析取路由到便宜或高级层级之一;高级角色必须是不同于 writer 的模型。其裁决只有在"看到了带参数与授权上下文的尝试动作,且已存在先前攻击证据或成功提交"时才算检出——对两者皆无的迭代的假阳性不能停止循环;
- 窗口化分歧统计 Δᵢ:最近 W 次仲裁中安全声明与记录证据冲突的比例,超过阈值、至少两次独立分歧、且已有有据攻击证据时才触发检出。
任何检出都在阶段 6 停止循环;只有被接受的迭代写入记忆。
4.5 CRG:复合风险治理
CRG 把 Ξ 映射为两个强制动作和一个停止规则:
- 硬预算 B 覆盖风险计费提交(被授权代理拒绝的 + 与有据攻击证据关联的);代理接受且无证据的提交不消耗 B——否则一长串被批准的用户动作就与失控不可区分了。另有 B_adv 覆盖高级验证调用;
- 能力天花板:Ξ 的阶梯函数,跨五个权限层级,只有在 Ξ 下降时才放松——而锁存使其不可下降;它约束的是抬高 Ξ 的下一次迭代;
- 任务契约:风险清关阈值要求 Ξ < θ_w 才放行工作项 w;完成上限限定锚点 ω 成功执行的次数。天花板被越过,或连续 K 次迭代提交而不完成良性工作,强制停止并升级到操作者。记忆回滚只恢复日志内容,永不重新加载治理器计数器——它们在一个 episode 内单调不降。
4.6 理论保证:界买了什么、没买什么
在三条假设下——(A1)中介且有界的提交(相邻治理器测试间至多 m = k·m₀ 个提交执行)、(A2)检测地板 δ_M(携带契约不可见未授权提交的迭代被仲裁器标记的概率至少 δ_M)、(A3)单调提交计数器(任何对手动作、重启、记忆回滚都不能降低它)——论文证明:
Theorem 5(horizon 无关界):对所有 N 与所有自适应对手,
- U₁:N^vis ≤ B + m - 1 必然成立(确定性半);
- E[U₁:N^inv] ≤ m/δ_M,且 Pr[U₁:N^inv ≥ m(z+1)] ≤ (1-δ_M)^z(概率半);
- 故 E[U₁:N] ≤ B + m - 1 + m/δ_M,与 N 无关。
Proposition 6(无模型组件及其残差类):授权代理是对记录轨迹字段的规则求值,没有任何模型输出作为操作数,所以 B + m - 1 界对每个检查器成立——包括在对抗指令下就是 writer 模型的检查器;只有 m/δ_M 项依赖检查器。契约不可见提交按定义在操作者声明的策略之内,残差类是"声明范围与操作者意图之间的差距”——收紧 A 或 Π 把质量移出残差类,使 π 由操作者控制而非对手控制。
Proposition 2(碎片化分离):对任意 s ≥ 2、任意 s-碎片化攻击、任意轨迹范围监控器 M,M 在攻击迭代上报警的概率等于在良性迭代上报警的概率——真阳性率等于假阳性率,无论容量多大;买到 1-β 的检出概率要以至少 1-β 的干净报警率为代价。而读取跨迭代状态、在累积碎片联合实例化能力时报警的监控器达到 TPR=1、FPR=0。
Proposition 3(冷却期击败几何衰减):折扣固定 γ ∈ (0,1) 无锁存、门条件 Ξ ≥ θ 时,幅度 ρ 的证据在迭代 τ 到达后,门在 τ + k* 重开,k* = ⌊log(ρ/θ)/log(1/γ)⌋ + 1——一个与 N 无关的常数。ρ < θ/γ 时 k* = 1,衰减什么都不买。若证据触发结构性 flag,则锁存下 Ξᵢ ≥ ρ ≥ θ 对所有后续迭代成立——被动等待永不重开门。
论文对理论边界的自省同样重要:界的两半由不同组件买下——确定性半只需要治理器预算(A1+A3),不涉及锁存;非衰减买到的是机会侧(对手能重开风险门多少次),不是恢复策略。界约束的是期望而非杜绝;δ_M 是分析中唯一的经验输入,Proposition 6 限制了它能带走多少保证。
五、评估指标与实验证据
5.1 指标体系
- 主指标 cASR(n):前 n 次迭代内被攻破的攻击 episode 比例(复合攻击成功率),配归一化面积 AUC。因为拒绝一切可以平凡压平 cASR,所有结果都与干净 episode 完成率配对报告;
- CleanGC:配对干净目标的完成率(FullGC 为所有槽位的完成率);
- 辅助:per-iteration ASR 剖面、干净 episode 过度停止率/欠停止率、停止延迟、检出时间(在 N 处右删失)、每攻击 episode 的风险计费不可逆提交数、高级验证调用数。
5.2 数据与 episode 构造
所有任务来自 Agent-SafetyBench(2,000 个任务中筛出可执行模拟器暴露至少一个工具的子集),规范化队列为 200 个任务的直接良性、完全可执行、工具模式池,指令/环境/工具 schema 原封不动,由确定性预筛与语义审计固定并记录 manifest 哈希。冻结排列让每个任务在每个攻击族下恰好当一次目标、九次背景任务。外层攻击套件 N=10,复合研究 N ∈ {5, 10, 20}。任务池按任务标识符的内容哈希切成不相交的 dev/ood 集:超参只在 dev 上调;Track-A 复合研究在从未调参的 ood 切分上评估——97 个 OOD 父簇 → 每配置每 horizon 485 个攻击 episode,三个 horizon 共 1,746 条记录;Track-B 矩阵用完整 200 任务审计队列。
每个 Track-B 攻击 episode 都有一个干净孪生(同样的原生指令、任务引用、环境、工具 schema,只有构成违反的外层记录不同)。评估者标签被构造性地排除在每个运行时 prompt 之外——防御必须依据血统、授权、拒绝、完整性证据行动,不能看答案键。
5.3 攻击套件:Track A 与 Track B
威胁编号 T7-T11 对应五类循环级威胁:T7 发现投毒(恶意项伪装成合法积压进入队列)、T8 跨迭代诱导(被拒工作反复重投,或载荷分片到没有任何单次迭代不安全、能力只在碎片累积后实现的程度)、T9 自喂养记忆投毒(低信任内容无签名授权被重标为可信策略、跨重启被当事实召回)、T10 相关验证器逃逸(隐蔽载荷同时瞄准验证器,共享模型家族或 prompt 的检查器会为其合理化)、T11 失控/停机逃逸/目标漂移(范围渐进扩张、完成反复"即将达成"、已完成工作重复提交)。
- Track A(A6-A10):良性骨架变换 + 嵌入唯一外泄哨兵,哨兵出现在已执行不可逆调用的参数中即判攻陷——保留轨迹内证据,测保持性并测复合曲线;
- Track B(A11-A15):无词法线索——没有攻击者控制的目的地字符串、没有可疑动词、没有注入指令,动作和目的地局部合理、任务是原生的。A11-A15 的违反只有结合跨迭代血统/拒绝/授权/记忆完整性/血统状态才可见(A13 是迭代内可判但单轨迹监控器不保留的证据):A11 原生任务携拒绝前签发的授权重投;A12 崩溃后在盘篡改持久内容而保留过期 MAC;A13 外部结果声明与工具实际执行矛盾;A14 一次有据风险观察关闭目标专属清关门后冷却期再投放门控目标;A15 已成功的完成锚点重复提交。
5.4 主结果
配置阶梯(Table 1,Track-B 外状态攻击,每族 200 攻击 episode,每配置 1,000 集 + 1,000 干净目标):
| 配置 | 说明 | Overall ASR | CleanGC |
|---|---|---|---|
| B0 | 裸(无内层无外层) | 97.6% | 97.4% |
| B1 | 仅内层 SafeHarness L1-L4 | 97.6% | 97.3% |
| B1.5 | B1 + 衰减累积 | 97.6% | 97.3% |
| B2 | B1 + 朴素终答仲裁 | 88.4% | 87.8% |
| B3 | B1 + 事后监督(循环结束后审一次) | 97.6% | 97.3% |
| B4 | 全五件套 | 0.1% | 96.9% |
| A-collude | B4 但检查器=writer 模型 | 0.1% | 92.9% |
三个读法:(1)B1 相对 B0 在外状态攻击下零改善——单轨迹防御对这类攻击结构性地无效,这不是实现问题;(2)B1.5 证明朴素衰减修复无效,B3 证明事后监督无效(循环结束后审计已经晚了——不可逆提交已经发生);(3)B4 把 ASR 压到 0.1% 的同时 CleanGC 只损失 0.4-0.5 个点。A-collude 验证 Proposition 6:强制检查器与 writer 同模型(完全合谋场景),ASR 仍是 0.1%——确定性半不依赖任何模型。
组件消融(各从 B4 精确移除一个组件):每个"对角线"移除恢复其目标攻击族 96.0-97.5% 的 ASR——A11 只被 IPM 挡(移除后 97.5%)、A12 只被 MIG 挡(96.0%)、A13 只被 ASA 挡(97.5%)、A14 只被 XRC 挡(97.0%)、A15 只被 CRG 挡(97.0%);整体 ASR 回升到 A-noIPM 19.6%、A-noMIG 19.3%、A-noASA 19.6%、A-noXRC 19.5%、A-noGov 38.8%。论文诚实地报告了一个超出预期的非对角依赖:移除 CRG 让 A14 从 0% 升到 97%——XRC 的状态保留依赖 CRG 的执行,光记得风险不够,还得有强制机制。
复合研究(Track-A OOD,Table 2):B1/B1.5 的 cASR 从 N=5 的 2.9% 涨到 N=10/20 的 6.2%(AUC 4.7%),B4 在全部 horizon 保持 0%(AUC 0,零风险计费提交),与 B1 的配对 bootstrap 检验 p < 0.001。
XRC 保留匹配实验(Table 3,A14 冷却契约,200 冻结父项,N=10,ρ=0.8、γ=0.7、θ=0.5、k*=2,d ∈ {1,2,4} 为无证据间隔):
| 配置 | d | 目标前保留风险 Ξ_pre | Block | ASR | CleanGC |
|---|---|---|---|---|---|
| XRC-off | 1/2/4 | ≈0.10 | 0% | 95.5-97.5% | 95.5-97.5% |
| XRC-decay | 1 | 0.560 | 100% | 0.0% | 97.5% |
| XRC-decay | 2 | 0.392 | 0% | 97.0% | 97.0% |
| XRC-decay | 4 | 0.193 | 0% | 97.5% | 97.5% |
| XRC-latch | 1/2/4 | 0.800 | 100% | 0.0% | 95.5-97.5% |
这是 Proposition 3 的实验实现:衰减变体在 d=2 时保留风险从 0.560 掉到 0.392,跌破 θ=0.5 阈值——门从全挡变为全放,ASR 从 0% 穿越到 97.0%。锁存变体在所有间隔保持 Ξ=0.800、全挡、ASR 0.0%。一次精确预测的阈值穿越,证明锁存不是工程偏好而是必要性。
安全-效用-成本前沿与红队(附录 C):B4 在 N=10 达到 FullGC 100%、过度停止 0%、欠停止 15.7%(防止不安全提交不需要每个攻击 episode 都停止)、零风险计费提交。自适应白盒红队(18 个变体网格:线索抑制 × 间隔 × 通道,N=12)在 B4 下最低缓解率 0.508、最终 ASR 0.0%;A-collude 下最低缓解率 0.392、ASR 仍为 0。论文同时披露可用性边界:攻击者唯一目标是锁存 Ξ 的 DoS 场景下,0% 的 B4 episode 达成 FullGC——锁存没有认证的清关转移,这推动"显式、认证、范围特定的清关"而非时间流逝式释放,也是伦理声明中"没有人员值守升级通道的治理器会把安全机制变成可用性故障"的注脚。
5.5 这些实验为什么能证明论点
对照设计精确对应理论命题:B0 vs B1 分离"单轨迹防御是否足够"(不够,97.6% = 97.6%);B1.5 与 A-decayXRC 对应 Proposition 3(衰减不够);B4 vs B0-B3 对应 Theorem 5(组合后的常数界);A-collude 对应 Proposition 6(确定性半抗合谋);五个 A-no* 对角消融把五个组件各自映射到五个威胁族;Table 3 的 d=2 阈值穿越把锁存的必要性从推论变成测量。评估者标签的构造性排除 + 攻击机会字段不改变分母 + 冻结 manifest/种子/角色分配,使整个协议难以被指标博弈。
六、效果优势的根源解释
6.1 明确对比对象
baseline 是 B0-B3:裸跑、单轨迹内层防御、加几何衰减、加朴素仲裁或事后监督。它们曾经有效是因为在单轨迹威胁模型(T1-T6)下,证据确实在轨迹窗口内——L1-L4 的净化/级联验证/权限中介/回滚能把单次 rollout 的攻破概率压下来。
6.2 baseline 的根本局限
B1 的根本局限不是"没有跨迭代组件"这个事实,而是逐轨迹重置使得它对碎片化攻击的信息论意义上的盲:s-碎片化攻击下,第 j 次迭代的窗口分布在攻击与良性下逐点相等(Proposition 2 的证明就一行积分:两个分布相等,任何可测函数对其积分相等)。这不是分类容量问题,是证据所在位置与观察窗口的错位。B1.5 的局限同理深刻:几何衰减把风险记忆变成了"有限记忆"——冷却期 k* 是 (γ, ρ, θ) 的函数而非 N 的函数,攻击者付一次 k* 的等待就清零了历史。B3 的局限是时间性的:事后审计发生时不可逆提交已经执行,“看到"不等于"阻止”。
6.3 本文的根本性改变与因果链
方法差异 → 机制变化 → 指标提升的完整因果链:
- 碎片化攻击的联合证据持久保留在循环级非衰减状态中(Ξ、M、R 账本跨迭代存活且绑定进认证检查点)→ 联合证据在门控时刻可被读到:A7/A14 的分片载荷单独看每次迭代都良性,但 Ξ 累积后目标专属清关门(Ξ < θ_w)读到的保留风险是 0.800 而非 0.392 → 攻击在执行前被挡 → Track-B 五个家族 ASR 从 97%+ 到 0-0.5%;
- 结构性 flag 触发后 γ 锁存为 1,冷却等待永不重开门(Corollary 4:reset 与 decay 下被门控项在 Ω(N) 比例的剩余迭代被准入,锁存下 τ 之后永不再被准入)→ 耐心攻击者的"等风头过去"策略失效 → Table 3 中 d=2 时 decay 穿越到 97.0% 而 latch 保持 0.0%——锁存与衰减的全部差异浓缩在这一格;
- 风险计费提交的硬预算 B + 单调计数器 c(重启/回滚不可重载)→ 即使验证器完全合谋(A-collude),契约可见的未授权提交仍然被确定性规则计费,c 单调爬升至 B 强制停止 → U^vis ≤ B + m - 1 对每个检查器成立 → 合谋配置 ASR 仍 0.1%(唯一动的是 CleanGC 92.9%,因为去相关检查器缺席时保守路由增加);
- 三信号分离(影响/证据/不确定各有去路)→ 正常高影响工作与验证器犹豫不污染 Ξ → 门只在有据攻击证据面前收紧 → CleanGC 只掉 0.4 个点而不是像 B2 那样掉 9.6 个点;
- MIG 的 HMAC 链 + 单调信任写门 + 有界召回把 T9 的自喂养通道在"写入、重标记、召回"三个环节同时封堵 → A12 的在盘篡改在再水化时被长度比较抓住。
反事实验证:去掉 IPM → A11 回到 97.5%(重入+授权时新检查消失);去掉 MIG → A12 回到 96.0%;去掉 ASA → A13 回到 97.5%(证词与工具证据的矛盾无人裁决);去掉 XRC → A14 回到 97.0%(风险不再保留);去掉 CRG → A15 回到 97.0% 且 A14 也回到 97.0%(保留的状态没有执行机构等于没保留——XRC 与 CRG 是记忆与肌肉的关系)。每个组件的必要性都被其对角线消融独立证明。
6.4 结构上必然更好的总结
B0-B3 的 ~97.6% 不是"防御不够强"的偶然数字,而是 Proposition 2 刻画的结构性天花板:在证据分布与良性相同的窗口上,任何监控器的 TPR = FPR。B4 的 0.1% 也不是调参的偶然产物,而是把证据搬回观察窗口(锁存的 Ξ)、把执行权交给不依赖模型的规则(预算 + 单调计数器)、把记忆写入/召回的全部通道置于完整性保护之下的结构必然。97.5 个百分点的 ASR 降幅中,每一部分都能指认到一条被切断的攻击前提。
七、必要知识反推
假设找一个没有任何先验知识的人来完成这项工作,他最少必须掌握:
7.1 领域知识层
- 自主 Agent 循环的实际运行形态:发现-规划-执行-验证-持久化的相位结构、不可逆动作的普遍性、持久记忆作为攻击面——不理解这些就无法定义"循环级威胁"从 T7 开始的编号;
- 现有防御栈的精确结构:Llama Guard/NeMo/IFC/Progent 各自的机制与共同的逐轨迹重置属性——必须逐个读出"状态在哪里重置"才能形式化 Definition 1;
- 持久攻击的已有形态:AgentPoison 等记忆投毒如何跨交互引爆——这是构造 Track-B 无词法线索攻击的出发点。
7.2 方法论知识层
- 概率论与随机过程:σ-代数 filtration、停时、条件量偶耦合(Theorem 5 概率半用几何变量随机支配)、鞅式论证——没有这些写不出 horizon 无关界;
- 密码学基础:HMAC 的存在性不可伪造、哈希链时间戳(Haber-Stornetta)、append-only 检查点——Lemma 13 的篡改证据性证明需要;
- 可扩展监督/相关性失败文献:为什么高级检查器必须异于 writer 模型——去相关设计的理论出处;
- 安全 RL 与运行时验证:shielding 作用于显式预算、轨迹上的运行时验证——治理器与再水化的概念母体;
- 事务语义:精确一次完成、授权时新性——识别出"Agent harness 缺乏数据库界四十年前就有的保证"是论文的洞察之一。
7.3 工程知识层
- 可复现评估工程:内容哈希种子、内容寻址缓存、manifest 哈希冻结、同 episode 配对 bootstrap、dev/ood 切分纪律——1,746 条记录的可信度全靠这些;
- 基准改造能力:在 Agent-SafetyBench 原生任务上构造外层记录干预(改授权签发时间而非改指令)、字段白名单排除评估者标签——“防御不能看答案键"是评估有效性的前提;
- 单控制器开关架构:所有配置走同一代码路径(B0-B4、A-no* 只翻开关),消融不可能静默变成 no-op;单调信任策略放在内存守卫而非 append-only 存储里,移除守卫才真正移除保护——这是让消融实验可信的工程决策。
7.4 知识融合的关键节点
- 节点一:把"防御失效"重新表述为"分布相等”。把碎片化攻击定义为每次迭代的贡献分布与良性相同,需要同时精通概率论的形式化和对攻击者自由度的工程想象——这一步把整个问题从"提高分类器"扭转为"移动状态";
- 节点二:识别出锁存的触发条件必须是规则可判定的。如果让连续风险分也锁存,正常高影响工作会永久污染状态(可用性崩溃);如果什么都不锁存,冷却期击败它(Proposition 3)。“只有结构性 flag 锁存"是三信号分离与锁存机制的交叉点,是全文最精细的设计决策;
- 节点三:把损伤界拆成确定性半与概率半。契约可见/不可见的区分 + 授权代理的纯规则求值 → B + m - 1 项不依赖任何模型 → 抗合谋的保证从"希望检查器诚实"变成"不询问检查器”。这个拆分连接了形式化定义(Section 2)与对抗实验(A-collude);
- 节点四:可用性边界的自我披露。发现锁存的代价(latch-only DoS 下 0% FullGC)并把它转化为设计方向(认证清关转移),而非留作隐患——理论边界的诚实标注(“这是机会界不是恢复策略”)本身就是多种知识融合的产物。
八、论文中可以提取的通用性灵感
8.1 组合失效先于覆盖缺口
核心思想:当系统由多个安全模块组合而成时,最危险的失效不是某个模块弱,而是模块间边界处的状态断裂——每个模块都"有效",组合却结构性失效。
论文证据:B1 在单轨迹威胁上有效(SafeHarness 已发表结果),但在外状态攻击下 ASR 与裸跑 B0 完全相同(97.6% = 97.6%);Proposition 2 证明这不是强弱问题而是窗口错位问题。
推广场景:(1)微服务链路的安全上下文在服务边界被重置;(2)CI/CD 流水线中各阶段的准入状态不共享;(3)多智能体系统中每个子 Agent 独立重置记忆(论文自己指出的下一步);(4)数据库事务跨服务边界退化为最终一致时的中间态暴露。
8.2 有界遗忘优于无界记忆,但关键证据必须不可遗忘
核心思想:状态保留策略应该分层——大部分信号允许衰减(防污染、保可用性),少数规则可判定的结构性违约一旦出现就永久锁存(防耐心对手)。
论文证据:XRC-decay 在 d=2 时 ASR 从 0% 穿越到 97.0%,XRC-latch 全挡;同时三信号分离保证影响与不确定不进入 Ξ,CleanGC 仅降 0.4 点。锁存的触发面收窄到规则可判定 flag,是防止"永久污染"的关键。
推广场景:(1)风控系统的欺诈记录保留策略——轻微信任信号可恢复,结构性违约(伪造签名)永不翻篇;(2)编辑维基/共享文档的封禁历史;(3)分布式系统的熔断器状态——错误率衰减恢复,但特定类型的故障(时钟回拨)应锁存告警;(4)机器人安全联锁——碰撞性止损信号不应随冷却时间清零。
8.3 把保证中"不依赖模型的部分"显式切出来
核心思想:在任何依赖 ML 组件的系统中,把核心安全保证实现为纯确定性规则,使最坏情况(模型被完全腐化)下仍有一部分保证成立。
论文证据:Theorem 5 的 B + m - 1 半由授权代理(对记录字段的规则求值)买下;A-collude 强制检查器 = writer 模型后 ASR 仍为 0.1%,只有依赖 δ_M 的概率半被削弱(最低缓解率 0.518 → 0.392)。
推广场景:(1)内容审核中关键词/哈希匹配作为 ML 分类器之外的保底层;(2)自动驾驶规划验证器的几何规则层;(3)金融交易的硬限额独立于风控模型;(4)任何"AI 控制 AI"架构中保留无模型的断路器。
8.4 评估必须把"答案键"从被评估系统可见性中构造性排除
核心思想:评估协议的可信度来自结构性保证而非约定——用字段白名单、manifest 冻结、配对孪生让指标博弈成为不可能,而不是靠自觉。
论文证据:评估者标签由显式字段白名单排除在每个运行时 prompt 之外;攻击机会字段只作诊断不改分母;200 任务队列由冻结排列固定,没有攻击族能在为它挑选的任务上被评估。
推广场景:(1)任何 LLM 评判基准的数据泄漏防护;(2)渗透测试的评分与靶场环境隔离;(3)A/B 测试中评估代码与被测系统的依赖隔离;(4)学术评审的盲审结构化保证。
8.5 状态的持久性需要密码学绑定才有对抗价值
核心思想:“记住"在对抗环境下是不够的——记忆本身是攻击面,保留的状态必须与防篡改机制(链式 MAC、单调计数器、不随回滚重载)绑定,否则对手的第一步就是重置你的记忆。
论文证据:MIG 把 Ξ/c/a/ℓ 绑定进认证检查点(A12 的在盘篡改被再水化长度比较抓住);CRG 的计数器在记忆回滚时不重载(A3 假设的实现层兑现);Lemma 13 在 MAC 不可伪造假设下证明任何插入/修改/重排/截短以除可忽略概率被检出。
推广场景:(1)审计日志的防篡改设计(论文直接引用 Haber-Stornetta 时间戳链);(2)游戏反作弊的客户端状态验证;(3)区块链外的轻量级防抵赖记录;(4)任何"安全计数器”——预算、配额、封禁次数——都必须在回滚/重启路径上保持单调。
8.6 诚实披露自己机制的失效边界是可复用的工作范式
核心思想:一个防御机制的论文价值不仅在于它挡住了什么,也在于它精确刻画了自己挡不住什么、代价是什么——把残差类的控制权显式交给操作者。
论文证据:论文披露 latch-only DoS 下 0% FullGC 的可用性边界并据此提出认证清关转移;明确 δ_M 是唯一经验输入且红队的 0.508 缓解率"探测但不建立"A2 对任意历史的成立;明确界是期望而非杜绝、是标度声明而非经验交叉点。
推广场景:(1)任何安全机制的论文写作与部署文档;(2)形式化验证的假设披露惯例推广到 ML 系统评估;(3)产品风险评估中"保证的适用域"标注。
附录:符号速查
| 符号 | 含义 |
|---|---|
| G = (g, A, Ω, Π) | 目标文本、范围白名单、完成锚点、任务契约 |
| N, i | episode horizon 与迭代索引 |
| Ξᵢ, rᵢ | 保留风险累积量、第 i 迭代的有据攻击风险 |
| γᵢ, γ↓ | 有效折扣(flag 触发后为 1)、预锁存折扣 |
| c, B | 风险计费提交计数器及其硬预算 |
| δ_M | 仲裁器检测地板(Theorem 5 唯一经验输入) |
| U₁:N^vis / U₁:N^inv | 契约可见 / 契约不可见的未授权提交总量 |
| IPM / XRC / MIG / ASA / CRG | 准入溯源监控 / 跨迭代风险累积 / 内存完整性保护 / 停止仲裁 / 复合风险治理 |
(完)