论文链接:arxiv.org/abs/2608.25429 代码仓库:github.com/Yi1-Chen/FRAG 发表时间:2026年8月 机构:KAIST(韩国科学技术院)+ The University of Tokyo——高校合作(KAIST 主导方法与实验,东大负责理论分析) 领域标签:cs.AI / 机器遗忘 / AI 安全


一、论文背景

1.1 什么是机器遗忘?

机器遗忘(Machine Unlearning) 指从已训练模型中移除特定数据的影响,同时保留其余数据上的行为。动机很实际:用户行使"被遗忘权"(GDPR)要求删除个人数据、下架版权内容、移除危险知识(如生物武器制造)。类比:图书馆要从读者脑子里"撕掉某一页"——但不能撕坏相邻的页,也不能让读者忘记其他知识。

1.2 复活问题:遗忘经不起"重学习攻击"

LLM 的遗忘有个尴尬真相:编辑时忘了,微调几下就回来了。攻击者甚至不需要被遗忘的原始样本——仅在保留集(retain data)等良性数据上微调一小会儿,被"删掉"的知识就会复活(relearning attack)。这说明多数遗忘方法只是抑制了知识的表达,而非真正移除——学生考试前"忘掉"了答案,复习相关内容后答案又浮现了。

1.3 流行假说与其漏洞

Siddiqui et al.(2025)提出:鲁棒性取决于遗忘后模型在权重空间离原模型多远——移得越远,知识越难恢复。这个"距离假说"直觉有力,还催生了用全局 ℓ2 距离做鲁棒性预测器的做法。但论文一针见血:距离只测"动多远",不测"动了谁"。一个随机扰动或破坏性更新也能造成巨大 ℓ2 位移——模型崩溃了、离原模型很远,但那不是"鲁棒的遗忘",是废模型。就像评价搬家质量只看搬了多远:把家当随机扔到 100 公里外确实"远",但那是灾难不是搬迁。

1.4 核心洞察

重学习鲁棒性取决于更新的结构,而非幅度:鲁棒的遗忘应集中在 forget 关键权重上、同时放过 retain 关键权重。为什么?微调只能移动梯度可达的权重——线性层权重 W_ij 的梯度携带其输入通道激活因子 x_j。只在 forget 内容上激活、retain 内容上不激活的通道,编辑放在那里,retain-only 攻击的梯度碰不到它——编辑对攻击"惰性"。这就是"放置"决定"存活"。


二、论文定位和关联工作

2.1 LLM 遗忘方法谱系

  • 似然抑制类:GA(梯度上升)、GradDiff(梯度差)、NPO(偏好优化)——用 forget 派生损失压低似然。
  • 表示工程类:RMU——操纵中间表示。
  • 直接权重编辑:剪枝、归因方法;Selective Pruning(SP,Pochinkov & Schoots 2024)用 forget-retain 激活对比做神经元级阈值剪枝——FRP 的直接前身,但 SP 未评估重学习鲁棒性。
  • 其他:丢弃 retain 集、推理时干预等。

2.2 重学习鲁棒性谱系

Hu et al.(2025)、Lynch et al.(2024)等确认复活现象;防御包括锐度感知遗忘、潜在对抗训练、防篡改护栏、局部化编辑。最近邻是 Siddiqui et al.(2025)的距离假说——本文的核心靶子。

2.3 权重重要性与剪枝谱系

Wanda(权重×激活范数)、RIA、SparseGPT 是剪枝经典;知识定位(FFN 记忆、知识神经元、ROME)证明知识可定位到局部。SalUn/WAGLE 用梯度归因做遗忘剪枝。没有前作针对 forget-retain 对齐结构与重学习鲁棒性的关系。

定位结论:本文贡献三件套——(1) 反驳距离假说的机制论证与反例;(2) FRAG 预测器(诊断);(3) FRP 剪枝(同原理的治疗)。预测器与方法同源自同一原则并交叉验证,是"理解→预测→干预"完整闭环的少见范例。


三、问题定义

具体问题:不实际运行重学习攻击,能否预判一个遗忘后的模型有多容易"复活"?以及能否直接构造更难复活的遗忘模型?

抽象洞察:把"鲁棒性"从结果变量变成结构变量——不是"攻击后还剩多少遗忘"(要跑攻击才知道),而是"更新放在了哪里"(看权重就知道)。类比:预测一栋建筑抗不抗震,不必真做地震实验——检查承重结构是否符合规范即可。

形式化:给定原模型 M₀、遗忘模型 M_u、小规模 forget/retain 校准集,寻求免攻击评分函数 φ: (M₀, M_u, D_f^cal, D_r^cal) → ℝ,使其预测 M_u 在重学习攻击(在 D_r、D_f 或其混合上微调)后的知识恢复程度。约束:评分免训练、免攻击、对崩溃模型不给高分。

精妙之处:利用了微调的一阶局部性——攻击者用的梯度恰好携带输入通道激活信息,因此"哪个通道激活"这个可测属性决定了"哪里的编辑能幸存",免攻击预测因此可能。


四、问题解法

4.1 FRAG:Forget-Retain Alignment Gap(预测器)

第一步:定义 forget/retain 关键权重。对每层,输入通道 j 在 forget 校准数据与 retain 校准数据上分别统计激活范数 x_j^f、x_j^r。仿 Wanda 式重要性:

  • F_ij = |W_ij| · x_j^f / (x_j^r + ε)(forget 关键:权重大 + forget 激活远高于 retain)
  • R_ij = |W_ij| · x_j^r / (x_j^f + ε)(retain 关键,对称定义)

注意二者是相对的、数据依赖的重要性而非互斥集合——几乎所有权重都兼具两种属性,重要的是比值。

第二步:计算对齐差。令 D = (ΔW)²(平方更新,聚合选定层),FRAG = cos(F, D) − γ·cos(R, D)(γ=1)。用余弦相似度因为尺度不变——只看方向对齐不看幅度,一个"对准了但幅度小"的更新与"对准且幅度大"的更新方向得分一致,而全局 ℓ2 会把两者混淆。高 FRAG = 更新对齐 forget 关键权重且避开 retain 关键权重。

计算只需校准前向传播 + 权重对比:无需运行攻击、无需额外优化。

4.2 FRP:Forget-Retain Pruning(干预方法)

同一原则直接构造鲁棒更新:剪掉"forget 重要、retain 不重要、且足够大到构成实质编辑"的权重。对每个输出行 i,逐权重打分:

S_ij = rank_j(F_ij) − β·rank_j(R_ij) + λ·rank_j(|W_ij|)

三项分别:偏好 forget 关键、惩罚 retain 关键、加幅度先验(保证剪枝产生非平凡编辑)。按行剪 Top ⌊ρ·d⌋ 个。与前身 SP 的区别:SP 在神经元级对原始重要性比值做阈值化;FRP 在权重级、rank 空间组合三个信号,且首次面向重学习鲁棒性评估。

4.3 机制:为什么"放置"决定"存活"

微调可达性论证:对线性层,∂L/∂W_ij = δ_i · x_j——梯度更新天然携带输入通道激活 x_j。放在"仅 forget 激活"通道上的编辑,在 retain-only 攻击下梯度近乎为零 → 编辑惰性 → 幸存。FRAG 恰好度量这种放置。作者诚实声明:该论证是一阶局部的,当攻击者持有 forget 数据(能重新激活那些通道)时会减弱——因此实验包含该更强攻击。


五、评估指标与实验证据

5.1 指标与设置

  • 基准:TOFU(LLaMA-3.2-1B/3B,forget01/05/10)+ WMDP-cyber(Qwen2.5-14B-Instruct)+ MUSE-News(附录)。框架 OpenUnlearning。
  • 遗忘指标:ES(遗忘分数,越低越好)、ΔES(攻击引起的 ES 变化,越低越鲁棒)、utility(保持能力)。
  • 攻击:三种重学习攻击——retain 集微调、forget 集微调、forget+retain 混合。
  • 基线:GA、GradDiff、NPO、RMU、SP。

5.2 FRP 主结果(TOFU,三攻击平均)

方法(1B)平均 post-attack ES ↓平均 ΔES ↓utility ↑全局 L2FRAG
SP0.0790.0790.513120.60.393
RMU0.4200.4200.5940.7690.004
NPO0.1220.1220.5830.7480.000
FRP(β=0.15)0.0580.0580.51781.43.020

3B 上 FRP(β=0.05) 平均 ES 0.058 同样全面最优。1B 上 FRP(β=0) 低至 0.029。

关键反例(距离假说的死刑):SP 的全局 L2 高达 120.6(远超 FRP 的 81.4),但鲁棒性反而更差——距离误导排序。跨家族验证(WMDP-cyber,Qwen2.5-14B):FRP post-attack Acc 0.417 vs RMU 0.552 / SP 0.513;FRAG 给 FRP 最高分 9.198,尽管 SP 的 L2 更大(464.1 vs 443.4)。

5.3 FRAG 预测器质量

预测器1B ρ3B ρPooled ρ
全局 ℓ2−0.56−0.17−0.36
FRAG−0.92−0.72−0.78

(与 forget+retain 攻击下 ΔES 的 Spearman 相关,仅健康检查点,n=30)

排除循环性:FRAG 是 FRP 的设计依据,预测好会不会只是"给自己人打高分"?剔除全部 FRP 检查点后(n=24),FRAG 仍 −0.74,而 ℓ2 跌到 −0.10(3B 甚至反号)——排序能力不来自自评自利。

噪声对照:在 utility 崩溃的随机扰动上,全局 ℓ2 与单侧余弦恰好达峰(虚假高分),FRAG 峰值落在低 ES 且 retain-sparing 的 FRP 检查点——retain 项(γ=1)防止 forget-only 对齐奖励破坏性更新。

5.4 诚实的代价报告

FRP 的 MMLU 降幅(0.788 → 0.707)超过 RMU/SP——FRP 描绘的是鲁棒性-效用前沿而非双优。作者不回避:更强遗忘鲁棒性以更大通用能力损失为代价,β/ρ 提供前沿上的移动旋钮。

5.5 为什么实验设计能证明论点

主张是"结构比距离更解释鲁棒性"。证明结构:(1) 反例——SP 的 L2 巨大而鲁棒性差,直接证伪距离排序;(2) 正例——FRAG 在剔除自身方法后仍强预测;(3) 噪声对照排除"高分来自崩溃"的混淆;(4) 跨模型家族(LLaMA→Qwen)、跨基准(TOFU→WMDP)双重复制。


六、效果优势的根源解释

(1)为什么 FRP 比优化式方法(GA/NPO/RMU)更鲁棒?

因果链:优化式方法的更新沿 forget 损失的梯度走 → 梯度方向由全体高激活通道构成,其中大量通道 retain 也激活 → retain-only 攻击的梯度同样触及这些通道 → 攻击"顺便"恢复遗忘知识(RMU 在 forget 攻击下 ES 飙到 0.755 是极端例证)。FRP 把编辑钉在"forget 激活/retain 沉默"的通道 → 攻击梯度在这些位置近零 → 编辑惰性幸存。机制预测:retain 攻击下差距最大(FRP ΔES 0.039 vs GA 0.211),forget+retain 攻击下差距缩小(攻击者能重新激活通道)——数据完全吻合。

(2)为什么 FRAG 比 ℓ2 预测得准? ℓ2 把"对准 forget 的更新"与"随机破坏"都记为"大距离";余弦对齐 + retain 惩罚项把两者分开——只有"方向对准 F 且背离 R"才得高分。噪声对照(ℓ2 在崩溃扰动上达峰)证明这种区分不是锦上添花而是预测有效性的核心。

(3)为什么 utility 代价更大? 剪掉的 forget 关键权重中难免混有部分承载通用能力的参数(F 与 R 是相对而非互斥),rank 组合中 β 只能部分缓解——这是原则的固有代价,论文选择呈现在前沿上而非掩盖。

(4)边界:FRAG 对 dense 方法间的分辨率较粗(dense 更新的分数比 selective 编辑小一个数量级,区分"dense vs selective"锋利、区分"dense 方法之间"粗)——工具的适用域被明确界定。


七、必要知识反推

7.1 领域知识层

  • 机器遗忘的目标与评测:ES/utility 双指标的权衡结构——不理解"遗忘要删什么、保什么"就无从定义 F/R。
  • 重学习攻击的形态:攻击者可用的数据(retain/forget/混合)决定威胁模型——预测器必须对准实际攻击面。
  • LLM 线性层梯度结构:∂L/∂W_ij 携带输入通道激活 x_j——“放置决定存活"论证的数学基础。

7.2 方法论知识层

  • 权重重要性度量:Wanda 式 |W|×激活范式——F/R 的构造模板。
  • 余弦相似度与尺度不变性:为什么测方向不测幅度——预测器设计的几何选择。
  • 剪枝方法论:rank 空间组合多信号、逐行 TopK——FRP 的工程实现。
  • 预测器验证科学:Spearman 相关、剔除自身循环性检验、噪声对照——让"预测器可信"的统计纪律。

7.3 工程知识层

  • OpenUnlearning 评测框架的使用;TOFU/WMDP 基准协议;校准集前向传播的轻量实现。

7.4 知识融合的关键节点

  • 节点一(梯度可达性洞察):把"攻击会恢复什么"翻译成"攻击的梯度能碰到什么”——威胁分析与优化力学的对接,全文最关键的一步。
  • 节点二(预测与干预同源):FRAG(度量放置)与 FRP(构造放置)用同一 F/R 定义——诊断工具和治疗工具共享机理,互相验证。
  • 节点三(反例思维):构造"距离大但不鲁棒"的 SP 案例,一发命中距离假说的要害——比罗列相关性更有力的反驳方式。
  • 节点四(诚实的代价呈示):主动报告 utility 前沿而非宣称全面占优——科学可信度的来源。

八、论文中可以提取的通用性灵感

灵感一:“改在哪"比"改多少"更决定持久性

  • 核心思想:对系统的修改能否抵抗后续扰动,取决于修改落在扰动梯度可达还是不可达的位置,而非修改的幅度。
  • 论文证据:SP 的 ℓ2=120.6 远大于 FRP 的 81.4 却更易复活;FRP 编辑放在 retain 梯度惰性通道,post-attack ES 0.058 全面最低。
  • 推广场景:组织变革落在既得利益触及不到的结构处更持久;安全补丁修在攻击面之外无意义;习惯养成嵌入日常流程(不可达)比意志力承诺(易被侵蚀)持久;代码重构中改接口 vs 改实现的稳定性差异。

灵感二:预测器要惩罚"破坏性高分”

  • 核心思想:构造度量时应内置"负项"(retain 惩罚),防止把崩溃误判为成就——只奖励正面对齐的指标会被废品刷分。
  • 论文证据:全局 ℓ2 与单侧余弦在 utility 崩溃的噪声扰动上达峰;FRAG 的 −γ·cos(R,D) 项使峰值落在低 ES 且 retain-sparing 的检查点。
  • 推广场景:代码覆盖率指标需惩罚删测试刷分;销售指标需扣除退单;模型评测需防"全输出空"骗高 F1;KPI 设计的防 gaming 原则。

灵感三:尺度不变的方向度量优于幅度度量

  • 核心思想:当关心"质量结构"而非"数量"时,余弦类方向度量天然免疫幅度混淆,比绝对量(距离、总量)更稳健。
  • 论文证据:FRAG(余弦、尺度不变)pooled ρ=−0.78 vs ℓ2(幅度)−0.36;剔除 FRP 后差距进一步拉大(−0.74 vs −0.10)。
  • 推广场景:推荐系统的兴趣方向 vs 消费金额;文档相似度用角度 vs 长度;投资组合的风格暴露 vs 仓位大小;人才评估的能力结构 vs 工作总量。

灵感四:诊断与治疗同源于同一机制模型

  • 核心思想:先建立机制理解(放置决定存活),再让预测器(度量机制)与干预器(操纵机制)同源构造——两者交叉验证能同时提升可信度。
  • 论文证据:FRAG 与 FRP 共用 F/R 定义;FRAG 对非 FRP 方法同样预测良好(剔除循环后 −0.74)反证机制普遍性。
  • 推广场景:医学的诊断标志物与靶向药共享通路;软件的监控指标与自愈操作共享故障模型;生态的指示物种与保护措施共享栖息地模型。

灵感五:用更强攻击检验防御的真实边界

  • 核心思想:防御声明必须在其设计的威胁模型内评估,且要主动测试模型边缘(攻击者持有 forget 数据)以暴露机制的适用域。
  • 论文证据:一阶论证在 forget+retain 混合攻击下减弱,论文如实评估该场景而非只报 retain 攻击的好成绩。
  • 推广场景:安全审计的红队升级测试;疫苗对新变体的边界测试;金融风控的极端压力情景;任何防御性设计的对抗性评估。