Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness 精读
KAIST 与东京大学合作研究机器遗忘的「复活」问题:遗忘后的 LLM 经短暂微调即可恢复已删知识。论文反驳「权重移动距离决定鲁棒性」的流行假说,提出免训练预测器 FRAG——度量遗忘更新是否集中在 forget 关键权重而避开 retain 关键权重,Spearman 相关达 −0.78(全局 L2 仅 −0.36);同原理 instantiated 为剪枝方法 FRP,在三种重学习攻击下 post-attack 遗忘分数全面最优。「哪些权重动了」比「动了多远」更能解释鲁棒性。