Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective —— 精读

论文链接:https://arxiv.org/abs/2605.17967

发表机构:上海交通大学可解释性与理论驱动深度学习实验室(张拳石副教授课题组)、北京通用人工智能研究院(BIGAI)、UniDT

作者:张俊鹏(上海交通大学博士生,第一作者)、程磊(上海交通大学)、张国玺(北京通用人工智能研究院)、蔡华(UniDT)、徐清(UniDT)、张拳石*(上海交通大学副教授,通讯作者)

备注:本研究由上海交通大学张拳石团队主导,联合北京通用人工智能研究院和 UniDT 共同完成。张拳石副教授长期致力于神经网络可解释性研究,是国内该领域的代表性学者。第一作者张俊鹏为张拳石老师指导的博士生。本文暂无公开代码仓库。


一、论文背景

1.1 监督微调(SFT):大模型的"必修课"

在深度学习领域,监督微调(Supervised Fine-Tuning,SFT) 是一种极其常见的训练策略。它的基本思路很简单:先在海量数据上训练一个通用模型(预训练),再用特定任务的标注数据对模型进行二次训练(微调),使其适应具体应用场景。

对于传统的中小规模神经网络,SFT 的效果通常是稳定且可预期的——模型在微调后普遍能在下游任务上获得性能提升。这就好比一个已经掌握基础数学的学生,通过针对性的练习题来强化某一类题型的解答能力,效果通常立竿见影。

然而,当这套方法被搬到大语言模型(LLM) 上时,事情变得复杂了。

1.2 SFT 在 LLM 中的矛盾现象

围绕 SFT 在 LLM 中的有效性,学术界形成了两种截然不同的观点:

正方——SFT 是必不可少的:

  • 许多研究认为,SFT 是提升 LLM 指令遵循能力的关键步骤。没有经过 SFT 的预训练模型虽然知识丰富,但往往不能理解用户的指令格式,会以不自然的方式回答问题。
  • SFT 可以帮助模型学习"如何回答"——即从原始的知识储备中,学会以对话的形式为用户输出有用的信息。
  • 代表性工作如 InstructGPT、Alpaca、Vicuna 等,都证明了 SFT 后的模型在可用性上有了质的飞跃。

反方——SFT 可能带来副作用:

  • 有研究指出,SFT 可能导致模型过度特化到微调数据的格式和风格上,从而削弱模型原本的泛化能力和上下文学习能力。
  • 更有甚者,SFT 可能只是让模型学会了"模仿"更强模型的回答风格,而并未真正获取其底层推理能力——这被称为"表面对齐假说"(Superficial Alignment Hypothesis)。
  • 持续的指令微调还可能引发灾难性遗忘(Catastrophic Forgetting),即模型在学习新任务的同时遗忘了旧知识。

1.3 已有的线索:SFT 可能"学得很快"

有趣的是,近期一些研究已经暗示 SFT 的有效阶段可能非常短暂:

  • LIMA(NeurIPS 2023) 提出"少即是多"——仅用 1000 条高质量样本就能让 65B 参数模型获得不错的对齐效果,说明几乎所有知识在预训练阶段就已经学到了,SFT 只是"激活"这些知识的接口。
  • Becoming Self-Instruct(2023) 发现模型在 SFT 过程中极早就学会了遵循指令,继续训练反而会改变模型的底层语义。
  • A Theoretical Framework for LLM Fine-tuning Using Early Stopping(2026) 从统计理论角度证明,最优停止时间存在且有限,过早或过晚停止都会损害性能。

但这些工作大多停留在现象观察或理论推导层面,缺乏一个能深入模型内部、可验证、可量化的分析工具来解释"SFT 到底在做什么"以及"为什么它有时有效有时无效"。

1.4 一个全新的视角:交互解释方法

这篇论文引入了一个独特的技术工具——基于交互的解释方法(Interaction-based Explanation)。这不是论文作者的新发明,而是张拳石团队多年积累的理论体系。其核心思想是:

一个深度神经网络的输出,可以忠实地分解为少量词/token 之间的交互模式(Interaction) 的数值效应之和。

这里的"交互",可以理解为模型在推理时自动使用的短语组合模式。例如,给定输入 “Isaac Newton’s laws of motion describe…",模型可能在 “laws”、“of” 和 “motion” 三个词之间建立一个交互模式——当这三个词同时出现时,该交互被激活,贡献一个正数值来提升模型预测 “acceleration” 这一 token 的置信度。

这套理论体系有几个关键特性:高保真性(能精确近似模型输出)、稀疏性(只需少量交互即可表示整个模型的推理逻辑)、可解释性(每个交互对应一个明确的语义模式)。

论文作者的核心洞察是:如果交互可以忠实地量化 LLM 的推理模式,那么通过追踪 SFT 过程中交互的演化,就能从最根本的层面理解 SFT 到底在做什么。


二、论文定位与关联工作

2.1 研究方向定位

本文处于三个研究方向的交汇处:

方向一:LLM 的监督微调研究

这个方向关注 SFT 在 LLM 后训练中的角色。代表性工作包括:

工作核心观点与本文的关系
LIMA(Zhou et al., NeurIPS 2023)仅 1000 条数据即可对齐,说明知识主要来自预训练本文从交互层面验证了这一现象——SFT 很少学习新的可靠交互
Becoming Self-Instruct(AlShikh et al., 2023)模型极早学会遵循指令,继续训练损害语义本文从交互演化角度精确量化了"极早"是多早(约前 1000 步)
Theoretical Framework for Early Stopping(Sun & Raskutti, 2026)从 NTK 理论证明最优停止时间有限本文提供了互补的经验验证和可解释指标
Massive SFT Experiments(EMNLP 2025)大规模实验揭示 SFT 的多面性本文提供了统一的底层机理解释

方向二:基于交互的神经网络可解释性

这是张拳石团队深耕多年的领域,形成了一套完整的理论体系:

工作贡献
Defining and Quantifying AND-OR Interactions(Li & Zhang, 2024)严格定义了 AND-OR 交互的数学框架,证明其高保真性
博弈交互理论综述(张拳石团队)系统性地用博弈论方法解释 DNN 的编码知识
Learning to Understand via Möbius Transform(NeurIPS 2024)提出高效的稀疏莫比乌斯变换算法用于交互提取

本文的创新在于:首次将交互解释方法应用于分析 LLM 的 SFT 过程,将一个实践经验问题转化为可量化、可验证的科学问题。

方向三:LLM 的可解释性分析

工作方法局限
Probing用探针任务检测模型内部表征间接推断,非因果性分析
Attention Visualization可视化注意力权重难以反映全局推理逻辑
Circuit Analysis识别模型内部的因果回路计算开销大,难以量化训练动态
本文:交互分析直接量化模型的推理模式演化计算开销仍较大(但可接受)

2.2 本文的独特定位

本文的核心贡献在于它不仅提出了一个新方法或新指标,而是用可解释、可验证的交互指标统一了关于 SFT 有效性的矛盾观点。它既不站在"正方"也不站在"反方”,而是揭示了 SFT 的双阶段本质——短暂的"去噪"和漫长的"过拟合"。


三、问题定义

3.1 核心问题的抽象

本文面对的表面问题是:为什么 SFT 对 LLM 的效果时好时坏?

但要真正回答这个问题,需要将其转化为一个可以严格量化分析的科学问题。论文的核心抽象思路如下:

第一步:定义"LLM 的推理模式"是什么。 论文并不直接分析 SFT 前后模型在具体任务上的表现差异(如准确率变化),因为这种外在指标无法揭示内部机理。相反,它将 LLM 的推理模式定义为交互(Interaction) 的集合——即词/token 之间的组合模式。每个交互都有一个数值效应值,表示该交互对模型输出的贡献大小。

第二步:定义"好的推理模式"与"坏的推理模式"。 并非所有交互都是等价的。论文从三个维度评估交互的质量:

  • 复杂度(阶数):交互涉及的词/token 数量。低阶交互(涉及少量词)通常更稳定、更可靠;高阶交互(涉及大量词)更可能对应噪声模式。
  • 泛化性:一个交互能否跨不同架构的 LLM 被稳定提取?如果能,说明它对应一种可迁移的推理模式,而非模型特有的偶然模式。
  • 效应一致性:一组交互中,正向和负向效应是否大量相互抵消?如果几乎完全抵消,说明这些交互对最终输出没有净贡献,更像是噪声。

第三步:将"SFT 的效果"重新定义为"交互集合的演化"。 论文将 SFT 过程中交互的变化分为三类:

  • 被移除的交互:SFT 前存在,SFT 后消失
  • 被保留的交互:SFT 前后一直存在
  • 新出现的交互:SFT 前不存在,SFT 后新产生

通过分析这三类交互的质量特征(复杂度、泛化性、效应一致性),就能从底层回答"SFT 到底在做什么"。

3.2 问题定义的本质

论文将一个模糊的实践经验问题(“SFT 好用吗?")转化为一个精确的科学问题:

在排除外部指标干扰的条件下,SFT 过程中 LLM 内部交互集合经历了怎样的演化?这些演化对应的是"去噪”(移除低质量交互)还是"学习"(获取高质量新交互)?这两种过程的相对强度和时序关系如何?

这个定义的精妙之处在于:它不依赖于任何外部评估指标(如准确率、BLEU 等),而是直接审视模型内部推理模式的本质变化。


四、问题解法

4.1 技术框架概述

论文的解法可以分为四个步骤:交互提取 → 交互分类 → 质量评估 → 演化分析。

第一步:交互提取——用 AND-OR 逻辑模型分解 LLM

论文使用了一种叫做 AND-OR 逻辑模型 的方法来分解 LLM 的推理过程。这个模型的核心思想是:

  • AND 交互:当一组特定的词全部同时出现在输入中时才被激活。例如,“laws” AND “of” AND “motion” 必须同时存在,该交互才会生效。
  • OR 交互:当一组词中至少有一个出现在输入中时就被激活。

每个交互都有一个数值效应值 $I$,表示它对 LLM 输出分数的贡献。LLM 的完整输出可以被分解为:

$$\text{LLM输出} = \sum (\text{AND交互效应}) + \sum (\text{OR交互效应}) + \text{偏置项}$$

这个分解具有高保真性——论文证明,用 AND-OR 交互可以几乎完全精确地重现 LLM 的原始输出。同时,有效交互的数量非常稀疏,通常只有 50-150 个,远少于理论上的所有可能组合。

第二步:交互分类——追踪 SFT 前后的变化

论文在不同 SFT 训练步数(如第 100、500、1000、2000 步等)的检查点上提取交互集合,然后按照变化类型分类:

  • 如果一个交互在 SFT 前(第 0 步)存在,但在某个步数后消失了,它就是被移除的交互。
  • 如果一个交互在 SFT 前后始终存在,它就是被保留的交互。
  • 如果一个交互在 SFT 前不存在,在某个步数后出现了,它就是新出现的交互。

第三步:质量评估——三个维度的指标

论文定义了两个核心量化指标来评估交互质量:

指标 1:可泛化交互比例 $\gamma$

$$\gamma = \frac{\text{可跨模型泛化的交互效应总量}}{\text{所有交互效应总量}} \times 100\%$$

计算方法是将目标模型的交互与另一个不同架构的基线 LLM 的交互进行比对。如果一个交互同时在两个模型中存在,且效应方向一致(同为正向或同为负向),就视为可泛化的。$\gamma$ 越高,说明交互集合中可迁移的可靠推理模式越多。

指标 2:未抵消效应比例 $\rho$

$$\rho = \frac{|\text{所有交互效应的代数和}|}{\text{所有交互效应的绝对值之和}} \times 100\%$$

如果一组交互中正向贡献和负向贡献几乎彼此抵消,那么 $\rho$ 接近 0,意味着这些交互对最终输出的净贡献很小,更像是噪声。$\rho$ 越高,说明交互对模型预测的贡献越一致和有意义。

第四步:演化分析——发现两阶段模式

通过在 SFT 的不同时间点重复上述三个步骤,论文观察到了一个清晰的两阶段模式:

4.2 核心发现:SFT 的"去噪-过拟合"双阶段

发现一:SFT 主要是在"去噪",而非"学习新东西"

论文发现,SFT 过程中被移除的交互具有非常鲜明的噪声特征:

  • 高复杂度:被移除的交互大多涉及大量词/token 的高阶组合,这类复杂模式通常不稳定、不可靠。
  • 几乎不可泛化:$\gamma \approx 0$,即被移除的交互几乎不可能在另一个不同架构的 LLM 中被找到,说明它们是模型特有的偶然模式。
  • 正负效应几乎完全抵消:$\rho \approx 0$,即被移除的正向交互效应和负向交互效应相互抵消,对模型输出的净贡献极小。

这三个特征一致表明:SFT 移除的是噪声式的推理模式。

与此同时,新出现的交互呈现出两极分化:

  • 在 SFT 早期出现的新交互相对较少,但质量较高——阶数较低、泛化性较好、效应一致性较强。
  • 在 SFT 后期出现的新交互数量暴增,但质量很差——多为高阶交互、泛化性极弱、正负效应大量抵消。

而被保留的交互则表现出最高的质量:

  • 主要是低阶交互,结构简单且稳定。
  • 超过 50% 可以跨模型泛化。
  • 正负抵消最弱,对模型预测有最一致的贡献。

结论:SFT 的主要作用是快速清除预训练模型中的噪声推理模式,而真正学到的新可靠交互极少。

发现二:去噪阶段极短,过拟合接踵而至

更关键的发现是时间维度上的模式:

  • 去噪阶段(Phase 1):通常只发生在 SFT 的前几百到一千个训练步。在这个极短的窗口内,模型大量移除噪声交互,并学习少量高质量新交互。
  • 过拟合阶段(Phase 2):去噪一旦完成,继续训练几乎不再移除交互,反而开始大量涌现新的高阶、低泛化性、效应抵消的噪声交互。这些过拟合交互的出现与训练/测试损失差距的增大密切相关。

论文用了一个很形象的比喻——“涮火锅”:

SFT 就像涮火锅里的肉片。刚下锅时,短时间加热可以让肉变得更好吃(去噪阶段);但如果一直涮下去,肉很快就会变老(过拟合阶段)。关键在于掌握火候,及时捞出。

4.3 验证:保留的交互是 LLM 推理的"骨架"

论文进一步验证了一个关键假设:被保留的少量交互是否构成了 LLM 推理的核心骨干?

从三个角度进行了验证:

  1. 预测充分性:仅使用被保留的交互进行预测,产生的测试损失低于使用被移除的交互或后期出现的过拟合交互。这说明保留交互确实承载了模型的核心推理能力。
  2. 个体贡献:被保留交互的平均效应值显著高于被移除交互和过拟合交互,说明每个保留交互对目标 token 预测的贡献更大。
  3. 正负效应一致性:被保留交互的未抵消效应比例 $\rho$ 在所有类型中最高,说明它们的贡献方向最一致、最可靠。

4.4 实验设置与模型覆盖

论文在多个 LLM 和数据集上进行了验证,确保结论的普适性:

维度具体内容
LLMQwen2.5-3B-Instruct、Qwen2.5-7B-Instruct、Llama-2-7B-Chat、Llama-3-8B-Instruct、Gemma-3-4B-it
数据集GoEmotions(Reddit 情感分类,~58K 样本)、Unilaw-R1-Data(法律推理)、Databricks-Dolly-15k(指令遵循,>15K 样本)
微调方法LoRA(秩 r=8),应用于所有合格线性模块
训练配置最大序列长度 8192,30 个 epoch,峰值学习率 1×10⁻⁴,余弦调度器,8 块 V100 GPU
基线模型使用不同架构但在相同数据集上微调的模型作为泛化性评估的基线

所有实验结果高度一致:无论使用哪个 LLM、哪个数据集,都观察到了相同的两阶段模式——短暂的去噪之后是漫长的过拟合。


五、必要知识反推

如果要完成这项研究,研究者需要掌握哪些知识和信息?我们从一个"零基础"研究者的视角进行反推:

5.1 发现问题阶段需要的知识

  1. SFT 的实践经验与争议现状:研究者必须了解 SFT 在 LLM 社区中的争议——既要知道正方的论据(SFT 提升指令遵循、任务适配),也要知道反方的论据(过拟合、灾难性遗忘、表面模仿)。只有了解这些矛盾观点,才能提出"如何调和"这个研究问题。

  2. LLM 内部工作机制的基本理解:需要理解 LLM 是如何进行推理的——token 的概率预测、注意力机制、上下文学习等。这些知识帮助研究者将"效果好/坏"这种表象与模型内部状态关联起来。

  3. 现有评估方法的局限性认知:需要认识到仅靠外在指标(loss、准确率、benchmark 分数)无法解释"为什么"——它们只能告诉你结果,不能揭示原因。这种认知缺陷驱动研究者寻找更本质的分析工具。

5.2 选择分析工具阶段需要的知识

  1. 交互解释理论体系:这是本研究最核心的技术基础。研究者需要深入理解 AND-OR 交互的定义、高保真性证明、稀疏性条件,以及如何从 DNN 输出中提取交互。这套理论由张拳石团队经过多年积累建立,是本研究得以进行的前提。

  2. 博弈论与可解释性 AI 的交叉知识:交互的概念源自博弈论(如 Shapley 值),理解这种跨学科联系有助于研究者将交互方法与更广泛的 XAI(可解释 AI)框架对接。

  3. 高效交互提取算法:交互提取在最坏情况下计算开销指数级增长,因此需要了解 Sparse Möbius Transform、Spectral Explainer 等近似算法来控制计算成本。

5.3 设计实验阶段需要的知识

  1. LLM 微调的工程实践:包括 LoRA 等参数高效微调方法的使用、训练超参数的选择、检查点保存策略等。

  2. 统计评估方法论:如何设计泛化性实验(跨模型对比)、如何定义和计算量化指标($\gamma$ 和 $\rho$)、如何控制变量确保结论的可靠性。

  3. 多模型、多数据集的实验设计:需要在多个不同架构(Qwen、Llama、Gemma)和多个不同类型的数据集上验证结论,这要求对各个模型的特性和数据集的特点有充分了解。

5.4 知识融合的关键

上述知识并非独立使用,而是需要创造性地融合:

  • 交互理论 × SFT 实践:将交互作为"显微镜"来观察 SFT 过程中模型内部的变化。这不是简单地将两个领域的知识拼接,而是需要深刻理解交互理论中"什么是好的交互"的定义,并将其映射到"SFT 是否在学习好的东西"这个问题上。

  • 量化指标 × 两阶段观察:定义了 $\gamma$(泛化性)和 $\rho$(效应一致性)两个指标后,需要在时间维度上追踪它们的变化,从而发现两阶段模式。这需要实验设计与数据分析能力的结合。

  • 可解释性 × 实践指导:最终将发现转化为可操作的建议(如早停策略),需要将理论发现与实际训练流程对接。


六、论文中可以提取的通用性灵感

6.1 “有效窗口"假说:很多优化过程都有短暂的有效期

本文最深刻的发现是:SFT 的有效阶段极其短暂,超过这个窗口继续训练反而有害。 这个结论很可能不限于 SFT:

  • 强化学习的人类反馈(RLHF) 中,奖励模型的训练和对齐优化是否也存在类似的"有效窗口”?过早停止会浪费潜力,过晚停止则导致 reward hacking。
  • 预训练的数据配比中,不同领域数据的引入时机可能也存在最优窗口。
  • 持续学习(Continual Learning) 中,每个新任务的学习是否也有一个"去噪-过拟合"的分界点?

通用启发:在面对任何"训练/优化时间越长越好"的直觉时,应该警惕——可能存在一个隐藏的有效窗口,超出后边际收益为负。关键是要找到能够检测这个窗口拐点的内部指标。

6.2 “去噪优于学习”:很多时候优化本质上是做减法

论文揭示了一个反直觉的事实:SFT 的主要作用不是"教会模型新东西",而是"清除模型中已有的噪声"。这与多个领域的洞察一致:

  • 大脑的神经修剪:人类大脑发育过程中,神经元连接数量在幼年期达到高峰,随后通过大量修剪(而非新增)来优化。SFT 对 LLM 的作用可能类似——不是在增加推理模式,而是在修剪噪声模式。
  • LIMA 的"少即是多"哲学:仅用 1000 条数据就能对齐 65B 模型,说明对齐的本质可能不是知识注入,而是接口激活。
  • 软件开发中的重构:优秀的代码重构往往不是添加新功能,而是消除冗余和不一致。

通用启发:在评估一个优化过程的成效时,不要只看"增加了什么",还要看"减少了什么"。有时做减法的价值远大于做加法。

6.3 内部指标的诊断价值:用"显微镜"而非"温度计"

传统的 SFT 评估主要依赖外部指标(loss、准确率),这就像用温度计量体温——只能知道"有没有发烧",但不知道"哪里发炎"。论文展示了使用内部指标(交互分析)的价值——它能揭示模型内部正在发生什么,而不仅仅是结果好不好。

  • 在软件工程中,性能剖析(Profiling) vs 黑盒监控 就是类似的对比。
  • 在医学中,影像学检查 vs 体温测量 也是类似的关系。

通用启发:当面对"为什么有时有效有时无效"这类不一致现象时,寻找一个高保真的内部诊断指标往往比收集更多的外部数据更有价值。一个好的内部指标可以统一地解释表面矛盾。

6.4 可解释性研究的"工具化"路径

本文展示了一个可解释性研究从"纯学术探索"到"实用工具"的转化路径:

  1. 基础理论(交互的定义与性质)→
  2. 提取算法(高效计算交互)→
  3. 应用场景(用交互分析训练过程)→
  4. 实践指导(基于交互指标的早停策略)

这个路径可以推广到其他可解释性研究方向:如果能找到一个忠实、稀疏、可量化的内部表征,就有潜力将其应用于训练监控、模型诊断、质量评估等实际场景。

通用启发:可解释性研究的最终价值不在于"解释了什么",而在于"基于解释能做什么"。从理论到工具的闭环是可解释性研究走向实用的关键。

6.5 “质量而非数量"的数据哲学

论文的一个隐含推论是:在 SFT 数据同质化程度高的情况下,增加更多数据可能只有极其有限的额外收益——因为去噪窗口不会因为数据增多而显著延长(数据多样性增加可以拉长窗口,但同质数据不行)。

  • 这与"质量大于数量"的直觉一致,但给出了更精确的表述:关键不是数据的绝对数量,而是数据带来的有效信息增益。一旦模型已经完成了去噪,更多同质数据只会推动模型进入过拟合。

通用启发:在资源受限的情况下,优先提升数据多样性而非数据量,可能是更高效的投资策略。


总结

这篇论文用可解释的交互指标,从模型内部的微观层面揭示了 SFT 的本质:一次短暂的"去噪手术”,而非越久越好的能力灌输过程。 它不仅调和了关于 SFT 有效性的矛盾观点,更为实践者提供了一个可操作的指导——通过监控交互质量指标来判断何时应该停止训练,避免无效算力的浪费。

正如论文作者所言:

SFT 的关键未必是"喂更多数据"或"训得更久",而是如何抓住这个短暂的有效窗口,并在模型从"去噪"转向"过拟合"之前及时停止。