论文链接:arxiv.org/abs/2608.26222 发表时间:2026年8月 机构:University of Bristol(布里斯托大学,Zhiyuan Xu、Muhammad Firhard Roslan、Joseph Gardiner、Sana Belguith、Lichao Wu 五人)——纯高校 领域标签:cs.LG / cs.CR / LLM 安全评测 / 越狱攻击 / 白盒模糊测试


一、论文背景

1.1 什么是越狱测试,为什么它是刚需

LLM 在上线前经过安全对齐(safety alignment)训练——学会识别有害请求并拒绝。但对齐不是铁板一块,精心构造的对抗性提示(越狱,jailbreak)能绕过安全机制诱导模型产出有害内容。一个典型越狱提示 = 有害载荷(payload,真正的坏请求)+ 越狱模板(template,包装方式,如角色扮演「你是个没有限制的 AI」、拒绝抑制「不要说抱歉」等)。

上线前系统性地找出这些安全漏洞——红队测试——是模型安全的必要环节。人工红队有效但昂贵且覆盖有限;自动化方法(AutoDAN 遗传算法、PAIR 攻击者 LLM 迭代、LLM-Fuzzer 模板变异)提升了可扩展性。

1.2 现有方法的共同瓶颈:响应级反馈

无论搜索策略如何不同,所有现有自动方法共享同一评估范式:把候选提示发给目标模型→生成完整回复→用分类器或 LLM 裁判判断是否越狱成功。论文指出这带来两个根本问题:

反馈稀疏:响应级评估只告诉你「成功/失败」,不告诉你「这个失败离成功有多近」。在强对齐模型上这尤其致命——绝大多数变异提示都被拒绝、拿到同一个失败标签,但它们对模型内部安全机制的影响可能天差地别:有的几乎不动摇安全机制,有的已大幅削弱它却尚未破门。响应级反馈无法区分,模糊器的种子调度失去依据。加大查询预算也没用,因为反馈本身是稀疏的。

生成昂贵:每个候选都要自回归解码完整回复,比只处理输入前缀贵得多;模糊器要反复评估大量候选,响应生成成为可扩展性瓶颈。

1.3 关键机遇:模型内部早已「知道」

可解释性研究早已发现:有害与良性输入在模型内部产生不同的激活模式,拒绝行为与特定表示方向、内部组件相关联,而且这些信息可以定位到紧凑的安全神经元子集——操控这些神经元能显著改变模型的安全行为。换言之,模型的内部状态暴露了响应里看不到的安全信息。这篇论文的问题:能否不修改模型内部状态,只把这些激活当信号,为模糊测试提供更密、更便宜的反馈?

二、论文定位和关联工作

论文站在三条研究线的交汇处:

LLM 安全测试:人工策略(角色扮演、指令冲突、上下文框架)与自动化方法(GCG token 级梯度优化、AutoDAN 层级遗传、PAIR 攻击者 LLM、LLM-Fuzzer 模板变异模糊测试)。前者的可扩展性差,后者全部依赖响应级反馈——GCG/AutoDAN 虽不用响应反馈,但优化「肯定前缀似然」这个代理目标在新型推理模型上已不可靠(模型可能输出肯定前缀却不产出真正有害内容)。

内部安全分析:Arditi 等发现拒绝由单一方向介导;后续神经元级研究把安全信息定位到小子集。这些工作主要用途是修改内部状态(编辑安全行为),本文反其道行之——只读不写,把内部信号用作测试反馈,模型行为完全不被干预。

模糊测试:从软件测试借来的覆盖引导范式(种子调度、变异器、运行时插桩、执行反馈四件套)。NeuronFuzz 把「代码覆盖率」换成「安全警报分数」,把「崩溃」换成「越狱」,是对经典灰盒模糊测试的忠实白盒化改造。

三、问题定义

威胁模型分两种身份:授权评估者(模型开发者、服务商或授权审计方)持有白盒访问权限——参数、MLP 激活、输入梯度——用于构建 SafetyOracle 并引导变异,但不修改参数、激活、系统提示或解码设置;恶意攻击者在本地代理模型上白盒优化模板,可直接攻击源模型或零样本迁移到其他目标(迁移场景只需输入输出访问)。

要解决的核心问题:为 LLM 安全模糊测试设计一个反馈信号,满足三个性质——(i) 在 prefill 阶段(处理完输入前缀、尚未生成任何回复时)即可获得,消除搜索循环中的响应生成;(ii) 连续而非二值,能区分「同样失败标签但不同接近程度」的候选;(iii) 对输入可微,能通过梯度定位哪些 token 位置最影响安全表示,从而指导变异。

同时信号本身必须可靠:原始激活空间高维、含噪、冗余,越狱模板还会引入与有害意图无关的风格性激活捷径——需要紧凑、稳定、聚焦「意图」而非「模板风格」的信号提取方法。

四、问题解法

NeuronFuzz = SafetyOracle(一次性离线构建)+ 模板变异模糊循环(在线)。

4.1 SafetyOracle:三步构建连续安全分数

第一步:模板不变激活提取。关键设计是配对构造——同一个越狱模板 τ,分别包装一个有害载荷和一个良性载荷,形成 x_h = τ⊕p_h(标签 1)与 x_b = τ⊕p_b(标签 0)。因为两类输入共享同一模板,标签差异只能来自载荷而非模板风格——从源头切断「模板风格捷径」。对每个输入做一次 prefill 前向传播,前向钩子收集每个 Transformer MLP 块的 gate/up 投影输出,对输入 token 位置做逐元素最大池化,得到与提示长度无关的定长激活向量,每个维度视为一个候选神经元特征。

第二步:稳定性感知神经元选择。单次训练集估计的神经元重要性对采样波动敏感。作者做 B=100 次 bootstrap(每次抽 70% 训练样本拟合线性分类器),统计每个神经元的选择率 s_j(被选中的频率)与符号一致性 c_j(系数方向是否稳定),最终保留 s_j≥0.6、c_j≥0.75、且主导方向为正(与有害标签一致)的神经元——一个紧凑、跨重采样稳定的安全神经元集。

第三步:Elastic-Net 逻辑回归打分头。把选中神经元的标准化激活映射为连续分数 S_alarm(x) ∈ (0,1)。ℓ1 正则清零无信息特征、ℓ2 正则稳定相关特征的权重,进一步压缩冗余。分数含义:高=模型内部强烈识别有害意图;低=内部安全警报弱。整个 Oracle 构建是一次性离线成本,平均仅 18 分 32 秒。

4.2 模糊循环:梯度定「在哪」,掩码模型定「换成什么」

每次迭代:MCTS-Explore 调度器(每个节点一个模板,边记录变异关系)选出待变异模板 → 拼接有害载荷得 x → 把 S_alarm 反传到输入 embedding,按梯度范数排名取前 3 个模板 token 位置(where)→ 用轻量掩码语言模型 ModernBERT-base(149M)在被选位置填掩码,提出上下文兼容的流畅替换(what)→ 每个父模板保留 8 个候选 → 每个候选做一次 prefill 读取安全神经元激活,SafetyOracle 打分,奖励 R = −S_alarm → 更新 MCTS 树。

两个纪律性约束:有害载荷冻结——所有变异只动模板,保证成功的测试反映的是安全绕过而非篡改了坏请求本身;只用流畅替换——保持提示长度与自然语言结构,不引入附加 token 或辅助优化变量(这正是后面能穿透困惑率过滤器伏笔的原因)。响应生成只发生在最终验证阶段。

五、评估指标与实验证据

5.1 Oracle 有效性(EO1)

5 个白盒源模型上 SafetyOracle 区分干净有害/良性输入的 AUROC 达 0.969–0.999。更有价值的发现是分数与越狱的关系:(1) 有害载荷被模板包装后警报分数系统性下降(Δwrap 0.031–0.195)——越狱语境确实削弱了模型内部的有害意图识别;(2) 成功越狱的分数显著低于失败尝试(Δsep 0.327–0.482,如 DeepSeek-R1-14B 上成功 0.557 vs 失败 0.937);(3) 把 4,000 个包装输入按分数分十档,ASR 与分数档位呈强逆相关——Spearman 系数 −0.927 至 −0.976。这证明 S_alarm 不只是二分类器,而是对「越狱接近程度」的连续排序信号。

5.2 模糊效果与效率(EO2)

StrongREJECT 100 个有害问题、预算 20 轮变异:

模型种子 JDRGCGAutoDANPAIRLLM-FuzzerNeuronFuzz
DeepSeek-R1-14B18%19%47%94%93%100%
Llama-3.1-8B25%91%86%81%97%100%
Gemma-3-4B36%97%94%100%100%100%
Gemma-4-E4B4%28%21%37%49%76%
GPT-OSS-20B0%0%19%43%48%96%

强对齐模型上优势最大:GPT-OSS-20B 上超最佳基线 48pp(96% vs 48%)、Gemma-4-E4B 上超 27pp(76% vs 49%)。效率上 RGD(每次发现所需响应生成数)= 1.0(仅最终验证需生成),而 LLM-Fuzzer 为 179.6–304.1、PAIR 为 15.6–22.3;ETD 在两个模型上最低、三个上次低(PAIR 条件 ETD 略低但其 JDR 低 6–53pp)。StrongREJECT 评分 0.558(说服力 4.27/5、具体性 4.23/5)说明发现的越狱产出的是实质有害内容而非仅仅突破拒绝。

5.3 迁移能力(EO3/EO4)

在 Llama-3.1-8B 与 GPT-OSS-20B 上联合优化 160 轮得到的通用模板,零样本(无任何目标侧优化)迁移:8 个推理型开源/开放权重模型平均 ASR 69.6% / top-5 集成 EASR 92.6%(Qwen3.6-35B-A3B 67.6%/98.0%);6 个专有 API 模型平均 44.1%/60.0%(Gemini-2.5-Pro 高达 85.2%/98.2%)。跨模态:同一批纯文本模板直接用于视觉语言模型——T2I 任务 ASR 基线 1.6%→64.4%,NSFW 3.6%→74.8%。跨数据集(HarmBench)保留 67.0%/87.3%。

5.4 消融与防御

消融(Llama-3.1-8B):去掉模板不变提取,AUROC 0.989→0.834、JDR 100%→74%;换成 Z-score 统计排序,AUROC 尚可(0.974)但相关性掉到 −0.737、JDR 82%——分类准确不等于有用的排序信号;随机选神经元 JDR 仅 16%。GPT-OSS-20B 上(100 轮预算):去掉梯度引导 JDR 99%→21%;换成二值响应反馈+随机位置仅 4%。

防御侧:困惑率过滤器只降 JDR 2–8pp(掩码替换保持流畅性);SmoothLLM 降 11–29pp 但仍留 65–79%。反向复用:把 D_jb = 1−|2S_alarm−0.5| 定义为越狱检测分数(成功越狱聚集在中间分数区),AUROC 0.948–0.963、TPR@5%FPR 87.9%——同一 Oracle 既当攻击指南又当防御检测器。

六、效果优势的根源解释

因果链「方法差异→机制变化→指标提升」:

差异一:反馈信号的密度。响应级反馈是二值的(成功/失败),强对齐模型上成功样本近乎零、所有候选同标签——搜索等价于随机游走(消融:二值反馈 JDR 仅 4%)。SafetyOracle 在解码前给每个候选一个连续分数,即使零成功时也能区分「接近成功」与「远离成功」。机制变化:MCTS 调度器有了排序依据、搜索获得方向性 → GPT-OSS-20B 上 JDR 从 4%→99%(完整版),这是全部证据里最极端的一组对照。

差异二:反馈获取的时机。响应级方法每个候选都要自回归解码;SafetyOracle 只需 prefill 前向。机制变化:RGD 从 179.6–304.1(LLM-Fuzzer)降到 1.0,端到端时间保持在最低档 → 同等预算内可探索更多候选,间接支撑 JDR。

差异三:变异的方向性。梯度定位敏感位置(where)+ 掩码模型流畅替换(what),对比随机位置变异。机制变化:变异集中打击对安全信号影响最大的少数 token → 消融中去梯度 JDR 99%→21%;同时流畅性约束让优化模板天然绕开困惑率过滤器(仅降 2–8pp)。

差异四:信号提取的纯净度。模板不变配对消除风格捷径、稳定性选择剔除跨采样不稳的神经元。机制变化:分数与 ASR 的 Spearman 相关从 −0.437(无模板不变)修复到 −0.964 → 排序信号可靠是整个搜索方向性的前提条件,缺失时 JDR 掉到 74%。

四个差异是嵌套关系:纯净度保证分数可靠(前提)→ 密度提供排序(方向)→ 时机降低成本(速度)→ 梯度提供定位(精度),共同解释了为何在越「难被攻破」的模型上相对优势越大。

七、必要知识反推

读懂本文需要(按依赖顺序):

  1. LLM 安全对齐与越狱:对齐训练、拒绝行为、payload/template 分解——理解被测对象是什么。
  2. 模糊测试基础:种子语料、调度器、变异算子、执行反馈、oracle 的四件套范式;覆盖引导灰盒测试如何用反馈驱动搜索。类比:NeuronFuzz 把「程序覆盖率」换成「安全神经元激活」,把「崩溃」换成「越狱成功」。
  3. Transformer 内部结构:MLP 块、gate/up 投影、激活向量、prefill vs 自回归解码的区别(前者并行处理输入前缀,后者逐 token 生成——成本差一个数量级)。
  4. 可解释性的神经元级发现:安全信息可定位到紧凑神经元子集、拒绝方向、激活操控改变安全行为——理解「内部信号比响应更早暴露信息」的证据基础。
  5. 统计学习工具:bootstrap 稳定性选择(选择率+符号一致性)、Elastic-Net 正则(ℓ1 稀疏+ℓ2 稳定)、逻辑回归校准打分、AUROC/Spearman 相关——Oracle 构建与验证的全部工具箱。
  6. 梯度归因:对输入 embedding 求梯度范数定位敏感 token(类似显著性图)——「where to mutate」的原理。

八、论文中可以提取的通用性灵感

  1. 稀疏反馈是搜索类方法的天花板。任何「大量候选+少数成功」的场景(漏洞挖掘、对抗样本、超参搜索、分子生成)都受同样制约:二值反馈无法区分失败候选的接近程度。寻找解码前可得的连续代理信号(内部激活、中间状态、能量函数)是把搜索从盲试变成定向优化的通用钥匙。
  2. 配对构造剥离混杂因素。「同一模板×不同标签载荷」的配对设计强制信号只反映意图差异、不反映风格差异——这是因果推断中控制变量的思想,可迁移到任何「想学 A 但数据里混着 B 的相关信号」的特征提取任务(如评测模型能力时控制提示风格)。
  3. 稳定性选择比单次拟合可信。bootstrap 重采样下「被一致选中且方向一致」的特征才保留——这个廉价技巧适用于所有「从高维特征里挑可靠子集」的场景(生物标志物筛选、金融因子筛选)。
  4. 可微性是免费的导航系统。连续分数天然可微,梯度直接指出「改哪里最有效」——设计系统时保留可微性等于同时获得了排序与定位两种能力,本例中梯度引导贡献了 99% vs 21% 的差距。
  5. 同一信号攻防两用。SafetyOracle 既是模糊器的指南针又是越狱检测器(D_jb 分数 AUROC 0.95+)。白盒评测得到的内部信号天然具有防御价值——「发现弱点的方法」与「修补弱点的方法」应共享基础设施。
  6. 约束即武器。掩码模型替换保证流畅性,结果困惑率过滤器几乎失效(降 2–8pp)。「让生成结果落在自然流形上」不仅美观,还直接免疫一类统计检测——对生成对抗内容、水印规避、数据增强都是同一课。
  7. 跨模态迁移暗示安全机制的通用脆弱性。纯文本优化的模板竟能攻破视觉模型(NSFW ASR 3.6%→74.8%),说明「包装弱化内部有害识别」的机制独立于模态——安全评测不应按模态割裂,一条线的漏洞可能是全系统的漏洞。