题目信息

论文:A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families 时间:2026 年 8 月 27 日提交 arXiv 机构:RIKEN AIP(日本理化学研究所先进智能研究中心)、东京科学大学、浙江大学(研究机构+高校合作)

一、论文背景

开源大模型生态里,模型合并(model merging)已经成为一种流行的高效建模方式:把多个从同一预训练骨架微调出来的任务模型直接在参数层面加权组合,不用任何额外训练,就能得到一个"多面手"模型。Hugging Face 上托管的合并模型检查点数量庞大,这个范式因为简单高效而被快速采纳。

但合并模型的安全性如何?此前的研究给出了一个看似安心的答案:合并的风险主要来自"成分污染"——如果参与合并的某个模型本身是不安全的(比如带后门或未对齐),合并后的模型会继承它的有害行为。反过来说,只要每个成分模型都各自做了安全对齐,合并就应该是安全的。现有讨论基本把合并的危险归因于"混进了坏模型"。

这篇论文挑战了这个假设。作者的关键洞察是:现代基础模型在预训练后保留了广泛的 harmful 能力,而安全对齐更多是一种行为抑制机制,并没有真正移除这些能力。参数层面的聚合可能扰动这些抑制机制,暴露出与共享预训练骨架相关的脆弱方向——哪怕所有成分模型都各自对齐得很好。这就引出核心问题:模型合并是否会暴露与预训练骨架本身相关的共享脆弱方向?

这个问题之所以重要,是因为它改变了威胁的性质:如果答案是肯定的,那么风险就不是"某个下游模型坏了"这种个案问题,而是整个模型家族的结构性问题——一个攻击者只需攻破一次,就能横扫同骨架的所有合并模型。

二、论文定位和关联工作

论文的 Related Work 覆盖三条线:

越狱攻击。白盒方法利用模型内部信号优化提示:GCG 用梯度迭代修改对抗后缀 token 最大化目标响应前缀的概率;后续工作包括基于遗传算法的搜索(AutoDAN)、表示空间引导的攻击(TUJA、SCAV)、改进的梯度优化(LSGM_LILA、Guiding-GCG)等。黑盒方法靠迭代查询改进提示(PAIR、Tree of Attacks);无盒方法(DAN、ArtPrompt、Multilingual)靠提示工程和变换策略。这些攻击都针对单个模型设计,没有考虑合并家族的共享结构。

模型合并。从线性合并(Model Soups)、任务算术(Task Arithmetic),到 TIES、DELLA、DARE-TIES、Model Stock 等,方法谱系庞大。结构性解释研究表明:同一预训练检查点微调出的模型往往位于共享的低损盆地(low-loss basin),这正是参数插值可行的原因——这个本来用来解释"合并为什么有效"的性质,在这篇论文里被攻击者反过来利用了。

合并安全。既有工作研究后门通过参数聚合传播(BadMerging、BadTV),以及不安全成分模型污染合并结果(Hammoud 等的"One bad model spoils the bunch")。这些工作的归因都是"不安全的成分"。本文的差异点:研究全部成分都独立对齐时,合并是否仍会暴露源自共享骨架的可迁移脆弱方向。安全侧,Safety-Aware Merging 会根据风险估计调整合并系数,本文也把它纳入防御评估。

三、问题定义

论文提出的威胁模型(threat model)是核心概念创新之一,值得仔细理解:

攻击场景。攻击者面对的是通过模型合并产出的 LLM,但不知道目标模型具体合并了哪些微调模型、用了哪种合并方法、什么超参——部署时 exact 的合并配置对攻击者未知。

攻击目标。构造一个通用越狱后缀(universal jailbreak suffix),对从同一预训练骨架派生的一整族合并模型都有效。评估指标是族级迁移成功率 TSR(Transfer Success Rate):在一批未见过的合并模型上,平均每个模型被成功越狱的比率。

攻击者能力。知道目标模型用的预训练骨架 θ_pre(这在开源生态里通常不是秘密);能收集或自行微调同骨架的替代微调模型来构造代理合并模型。攻击者无法访问目标合并模型本身。

关键判据。如果在"所有成分模型各自对齐、合并模型自身不攻击时 ASR≈0"的设定下,越狱提示仍能系统性地跨独立对齐的合并模型迁移,那么漏洞就不能归因于任何特定下游组件——它必然源自预训练骨架本身、且通过参数聚合被保留和暴露。

四、问题解法

BAJ(Basin-Aware Jailbreak,盆地感知越狱)的方法设计围绕一个结构性事实:同骨架合并模型位于参数空间一个连通的低损盆地内,这约束了合并模型的多样性,也保留了与骨架相关的相关脆弱方向。攻击要做的是找到在整个盆地内都有效的后缀,而不是过拟合某个检查点。

形式化:合并空间上的 min-max 优化。

$$\min_s \max_{\theta \in \mathcal{B}} \; L(x \oplus s, \theta)$$

内层最大化在盆地 B 中找对当前后缀最抵抗(最难攻击、对齐最强)的合并模型;外层最小化优化后缀 s,让它连这个最难构型都能攻破。直觉:被迫攻破"最安全"的合并模型,后缀就无法依赖任何单一检查点的特异漏洞,只能抓住全族共享的漏洞方向。

参数化盆地。直接在连续盆地 B 上优化不可行。BAJ 用任务算术参数化:给定任务向量 Δ_k = θ_k − θ_pre,任意合并模型写成 θ(α) = θ_pre + Σ α_k Δ_k。于是 min-max 问题变成对系数空间 A 的优化:min_s max_{α∈A} L(x⊕s, θ(α))。

交替优化。两个步骤轮换:

  • 后缀更新(α 固定):退化为对单个合并模型的标准越狱攻击,用类似 AutoDAN 的变异进化搜索——维护候选后缀种群,按目标值排序保留精英,对剩余个体做 token 替换/插入/删除/重排产生后代。
  • 系数更新(s 固定):对合并系数做梯度上升 α ← α + η∇_α L(x⊕s, θ(α)),把代理合并模型推向对当前后缀最抵抗的"最安全对齐区域"。

表示引导的目标函数。攻击目标 L 不是 GCG 式的响应似然,而是表示空间信号:先在代理合并模型最后一层隐表示上,用 100 条有害 + 100 条良性提示训练线性 SVM 探针,取归一化权重向量 u 作为"有害方向";目标函数 L = (h(x⊕s) − h(x))ᵀu,即让加了后缀的提示表示沿有害方向移动、远离无害区域。探针方向随系数动态重训。

计算成本。合并操作只是参数加法和缩放,CPU 上几乎瞬时完成;探针是小型线性分类器,训练几十秒;单条提示生成时间与同类攻击相当,总体开销适中。

五、评估指标与实验证据

实验设置。6 个主流指令微调骨架(Llama2-7B/13B-chat、Llama3-8B-Instruct、DeepSeek-LLM-7B-chat、Qwen-7B-chat、Gemma-7B-it,全部 SFT+RLHF 对齐);每个骨架在 5 个任务数据集(Alpaca、Dolly、CodeAlpaca、GSM8K、CodeEvol)上各微调一个任务模型;每次配置取 3 个任务模型合并为代理模型、剩下 2 个合并为评估模型,枚举 C(5,2)=10 种配置。基线覆盖 GCG、AutoDAN、TUJA、SCAV、LSGM_LILA、Guiding-GCG、GCG-Ensemble(白盒)与 DAN、ArtPrompt、Multilingual(无盒)。

主结果 1:族级迁移成功率(TSR,%):

方法Llama2-7BLlama2-13BLlama3-8BDeepSeek-7BQwen-7BGemma-7B
有害提示(无攻击)0.00.00.00.00.00.0
GCG20.711.017.416.319.823.5
AutoDAN10.43.219.277.255.026.6
TUJA22.823.728.741.220.129.6
SCAV31.228.639.876.855.444.7
Guiding-GCG27.625.430.437.024.531.3
GCG-Ensemble43.60.41.217.47.69.2
BAJ65.861.368.289.177.674.8

BAJ 在全部 6 个骨架上一致领先,比最强基线高约 22-34 个百分点。即使给基线匹配同样的代理访问与计算预算(Appendix F),GCG-Ensemble 41.6 vs BAJ 65.8,领先仍有 24-48 点——证明增益来自盆地感知的 min-max 机制而非代理优势。

主结果 2:跨合并方法与部署设置(TSR,%):目标模型改用 6 种合并方法(Linear/Task Arithmetic/TIES/DELLA/DARE-TIES/Model Stock)和 4 种部署配置(水印、NF4/INT8 量化、FP16),TSR 稳定在 56.6-69.3 区间。攻击只在任务算术参数化下优化,却对其他合并算法的目标同样有效——漏洞不绑定具体合并实现。

主结果 3:现有防御效果有限(TSR,%):

防御Llama2-7BLlama3-8BQwen-7B
无防御65.868.277.6
Perplexity 过滤65.868.277.6
ICD62.361.073.7
Self-Reminder61.662.368.4
Intent-FT55.257.967.5
Safety-Aware Merging63.266.473.6

最好的非自适应防御(Intent-FT)也只降 10 个点左右。自适应防御(用 BAJ 生成的后缀+拒绝对做微调)可把 TSR 压到 15.6-20.7,说明合并后的针对性安全微调是一条可行出路,但这是"知道攻击存在"之后的防御。

主结果 4:跨骨架迁移显著弱于同骨架。交叉实验矩阵对角线(同骨架)高、非对角线(跨骨架)低——脆弱方向与特定预训练骨架绑定,证明漏洞来源确实是骨架。

消融证据:把系数最大化搜索换成随机采样,TSR 从 65.8 跌至 32.4(六个骨架一致下降 6-33 点),证明 min-max 机制是关键;BAJ 攻击未合并的普通微调模型 TSR 降至 27-51%,明显低于合并模型,证明合并结构是漏洞暴露的必要条件。

输出质量人工评估:50 个成功越狱样本中 68% 完全连贯(含可操作的步骤化有害内容)、32% 部分连贯、0% 不连贯(κ=0.81),排除了"LLM 裁判被表面伪影欺骗"的疑虑。

前提核查:合并模型自身不攻击时 ASR≈0(0-0.04),成分任务模型也保持对齐——风险不是合并破坏了对齐,而是合并暴露了被抑制的骨架级漏洞。

六、效果优势的根源解释

BAJ 为什么能比既有攻击强这么多?因果链如下。

方法差异 → 机制变化:

  1. 优化对象从"点"变成"区域"。GCG/SCAV 等在单个(或集成几个)固定模型上优化,后缀容易过拟合该模型的特异漏洞,迁移到不同合并配置就失效(GCG-Ensemble 在 Llama2-7B 上 43.6 但在 Llama2-13B 上只有 0.4,极不稳定)。BAJ 的系数更新步(Eq.11)主动把优化推向盆地内对齐最强、最难攻击的区域——这等价于一种对抗训练式的"最坏情况搜索",逼着后缀放弃单点捷径、只利用全族共享的脆弱方向。消融数据(最大化 65.8 vs 随机 32.4)直接支持这个机制解释。

  2. 合并盆地的结构性保证。合并之所以可行,是因为同骨架微调模型位于共享低损盆地——盆地约束了合并模型的多样性,也意味着骨架级脆弱方向在参数聚合中被保留。BAJ 恰好在参数化了这个盆地的系数空间上做最坏情况优化,与漏洞的几何结构对齐。这也解释了为什么任务算术参数化下优化的后缀对 TIES/DELLA 等其他合并方法的目标依然有效:不同合并方法产出的模型仍在同一盆地内。

  3. 表示级目标比似然目标更贴近漏洞本质。探针方向 u 直接编码"有害 vs 无害"的表示分界面,后缀优化沿这个面推动表示,比最大化特定响应前缀概率更接近对齐机制本身的作用位置。

机制变化 → 指标提升:

  • 同骨架族内迁移:后缀学到的是骨架级共享方向 → TSR 61.3-89.1,且六骨架一致;
  • 跨合并方法稳定:盆地不随合并算法改变 → TSR 56.6-69.3;
  • 跨骨架弱迁移:方向骨架绑定 → 非对角线显著低;
  • 对普通微调模型减弱:合并是暴露的必要条件(聚合扰动抑制机制)→ TSR 降至 27-51%;
  • 防御无效:单模型防御不针对族级共享漏洞 → 最好的防御也只降 10 点。

反向控制也完备:无攻击时合并模型 ASR≈0 排除了"合并本身破坏对齐"的替代解释;人工评估排除裁判伪影;匹配代理与预算后仍领先 24-48 点排除了资源优势解释。这是一条从威胁建模、机制设计到因果验证都相当完整的故事线。

七、必要知识反推

理解这篇论文需要以下背景知识:

  1. 安全对齐与 RLHF:SFT+RLHF 如何让模型学会拒答有害请求,以及"对齐是行为抑制而非能力移除"这一关键假设的理论与实证背景(Bai et al. 的 helpful/harmless 训练)。
  2. 越狱攻击基础:GCG 的梯度优化框架(最大化肯定前缀概率)、对抗后缀的概念、白盒/黑盒/无盒攻击的访问假设差异。
  3. 模型合并与任务算术:任务向量 Δ = θ_task − θ_pre 的定义、线性组合 θ(α) = θ_pre + Σα_k Δ_k 的含义,以及 TIES(修剪/选举/符号合并)、DELLA 等改进方法。
  4. 损失盆地(loss basin)理论:为什么同一预训练初始化微调出的模型位于连通低损盆地(模式连通性,mode connectivity)、为什么参数插值可行——Wortsman 等与 Zhou 等的跨任务线性研究。
  5. min-max 优化与对抗训练:内外层交替的鲁棒优化范式,与 GAN、对抗样本训练的联系。
  6. 线性探针(linear probing)与表示空间分析:在冻结表示上训练线性分类器提取语义方向的方法(SCAV、TUJA 一脉),以及 SVM 权重向量作为方向的含义。
  7. 进化搜索算法:种群、精英保留、变异算子的基本流程,理解 AutoDAN 式离散文本优化。
  8. LLM-as-judge 评估:HarmBench 的裁判分类器协议、ASR/TSR 指标定义、人工评估一致性(Cohen’s κ)。

八、通用性灵感

这篇论文的价值远超"又一个越狱攻击",它揭示了几个深层思想:

1. 安全边界要按"家族"而非"个体"划定。传统安全评估逐模型进行,这篇论文证明同源模型家族存在结构性共享漏洞。这提示所有依赖共享基础组件的系统——无论 LLM、视觉模型还是其他软件供应链——安全审计都必须考虑"血缘"带来的相关性风险:单个组件各自合规不等于组合安全。

2. “合并有效"的几何解释可以反转为攻击面。低损盆地是合并技术的福音(解释了为什么参数平均可行),同一几何结构却是安全的软肋(脆弱方向在盆地内共享)。一个领域的核心机制往往同时定义了它的核心风险,这个对偶性值得每个研究者在自己的方向上反思。

3. min-max 对抗搜索是发现"系统性弱点"的通用工具。BAJ 的系数上升步本质上是自动化的红队对抗:主动找最难攻击的构型来训练攻击。这个范式可迁移到任何需要测试"一族系统最坏情况"的场景——鲁棒性基准构建、防御机制压力测试、协议安全审计。

4. “能力存在但被抑制"是比"能力移除"更准确的模型。安全对齐更像在模型上打的行为补丁,预训练注入的能力一直在参数里。任何后续的参数扰动(合并、量化、微调)都可能扰动补丁。这对部署侧的启示是:合并后的模型需要重新做安全评估,不能沿用成分模型的安全认证——就像食品成分各自合格不代表混合后安全。

5. 防御需要与攻击同层的结构性设计。单模型防御(困惑度过滤、系统提示、防御性微调)对族级漏洞无效,而针对 BAJ 后缀的自适应微调有效——说明防御必须理解攻击利用的结构。论文呼吁的"安全感知合并方法”(在合并系数选择时显式考虑共享漏洞)是正确方向,也是开放问题。

6. 开源生态的透明性是双刃剑。攻击假设"知道预训练骨架”,这在开源世界里默认成立。模型能力的血缘公开性让攻击者可以低成本构建代理家族——社区需要在可复现性与攻击成本之间寻找新的平衡点。

对安全研究者,这篇论文提供了一个干净利落的研究范本:从对既有共识(“成分安全则合并安全”)的质疑出发,提出可检验的威胁模型,设计机制化的攻击验证假设,再用消融和交叉实验把因果链钉死。对开源模型的使用者和平台方,它是一份明确的警示:Hugging Face 上那些来路清晰的合并模型,其安全性可能比你以为的更脆弱。