Circuit Condensation: Post-Training that Concentrates a Behavior's Causal Circuit 精读
机制可解释性的电路发现方法常返回几百条边,大到无法穷举验证、无法逐边理解。这篇论文提出Circuit Condensation:与其在冻结权重里更努力地搜索行为住在哪里,不如通过后训练把行为搬进更小的因果电路。方法是一个迭代「剪枝-愈合-回退」循环——EAP-IG给边排名、剪掉最弱30%、只训练LoRA适配器以KL蒸馏匹配原模型,任务精度与通用能力都存活才接受。在4种行为×8个模型×3种子共96组实验中,C1电路在30/32组合里比最强冻结基线更小,平均缩小8.1倍、最高316倍。关键对照C0证明收益来自权重重塑而非搜索本身。范式层面的洞见:电路的可发现性是模型可训练的属性。