论文链接:victorchen96.github.io/continual_learning_survey.pdf 发表时间:2026年5月 作者:陈德里(Deli Chen),DeepSeek 研究员 机构:DeepSeek(个人独立研究项目) 协作框架:Deli AutoResearch(AI 辅助自主科研框架,使用 DeepSeek-V4-Pro 进行文字生成与推理,GPT-Image-2 进行图像生成) 论文规模:47页,151篇参考文献,系统分析超过100篇论文


一、论文背景

1.1 一个根本性矛盾:静态模型 vs 动态世界

大语言模型(LLM)已经展现出惊人的能力——从开放生成到复杂推理,从代码编写到数学证明。然而,这些模型存在一个根本性的矛盾:它们在训练完成后就被"冻结"了。模型的参数不再改变,其知识被锚定在训练数据的分布上。

但世界是不断变化的。新的事实每天都在涌现,社会规范在演变,用户偏好在转移,模型被要求的任务复杂度也在持续增长。这种"静态模型与动态世界“之间的张力,是现代 AI 面临的最紧迫的挑战之一。

这种矛盾具体表现为三个方面:

(1)知识截断问题(Knowledge Cutoff)

每个 LLM 都存在一个隐含的"知识截止日期”——一个时间边界,超过这个边界的世界事件模型无法直接感知。虽然检索增强生成(RAG)可以在一定程度上缓解事实回忆的问题,但它无法解决更深层的挑战:模型的内部表征、推理策略和校准能力都会随时间逐渐偏离不断演进的数据分布。对于拥有数千亿参数的模型来说,周期性全量重新训练在成本上是不可接受的。

(2)对齐漂移(Alignment Drift)

比事实过时更微妙的是,模型的对齐属性(价值观、行为规范等)也可能逐渐失效。在模型部署后,最初指导其训练的偏好和规范可能不再适应新的社会期望或新的使用场景。更严重的是,当模型被迭代更新时,初始训练中建立的对齐属性可能退化——这是一种应用于行为约束(而非知识)的灾难性遗忘。

(3)自我改进的迫切需求(Self-Improvement Imperative)

最新一代推理模型(如 OpenAI o1、DeepSeek-R1)表明,LLM 可以通过自己生成的训练信号来提升性能——无论是通过自我对弈(Self-Play)、宪法式自我批评(Constitutional Self-Critique),还是奖励引导的搜索。这种自我改进能力提供了一条诱人的路径:模型可以自主增强能力,而无需持续的人工监督。但自我改进本身也带来风险:反馈循环可能放大偏见,奖励黑客行为可能产生表面正确但实质有缺陷的输出。

1.2 什么是持续学习(Continual Learning)?

持续学习指的是模型能够从非平稳的数据流中顺序学习,同时保留先前获得知识的能力。

用一个生活中的比喻来理解:假设你是一个高中生,你需要先学语文、再学数学、再学英语。理想情况下,学数学时不应该把语文全忘了,学英语时不应该把数学丢了。但对神经网络来说,这恰恰是最困难的事情之一——它在学习新知识时,倾向于覆盖旧知识,这就是著名的"灾难性遗忘"(Catastrophic Forgetting)问题。

形式化地说,持续学习的核心目标是:

$$\theta^* = \arg\min_{\theta} \mathcal{L}(\theta; D_{new}) \quad \text{s.t.} \quad \mathcal{L}(\theta; D_{old}) \leq \epsilon$$

即在新任务上表现好的同时,保证旧任务上的性能下降不超过某个阈值。

持续学习有三种经典设定:

  • 任务增量学习(Task-IL):模型在推理时知道自己在处理哪个任务,最简单
  • 类别增量学习(Class-IL):新类别不断出现,但推理时没有任务标识,更难
  • 领域增量学习(Domain-IL):任务结构不变但输入分布在变化,对 LLM 最相关

1.3 什么是自我改进/自我迭代(Self-Improvement / Self-Iteration)?

自我改进指的是模型利用自身输出来生成训练信号,从而增强未来性能的过程。

如果说持续学习是"如何在学习新东西时不忘记旧东西",那么自我改进就是"如何自己教自己变得更聪明"。二者的交汇点在于:更新模型参数时,如何在不退化已掌握能力的前提下取得进步。

1.4 为什么需要将两者统一起来?

尽管持续学习和自我改进长期以来被当作两个独立的研究方向来对待,但它们共享一个共同的底层挑战:如何在不导致已掌握能力灾难性退化的情况下,根据新信息或新目标来更新模型参数。

作者认为,统一处理这两种范式不仅是方便的,更是必要的——下一代 LLM 训练管线将不可避免地将外部数据流(持续学习)与自生成训练信号(自我改进)组合在紧密耦合的反馈循环中。理解它们的交互需要一个共同的理论和方法框架。


二、论文定位与关联工作

2.1 在持续学习综述谱系中的位置

持续学习领域的综述工作并不少,但此前的工作要么聚焦于计算机视觉场景,要么只覆盖持续学习或自我改进中的一个。本论文的独特定位在于:

综述年份覆盖范围局限
De Lange et al.2021分类任务中的持续学习不涉及 LLM,不涉及自我改进
Wang et al. (A Comprehensive Survey)2023LLM 持续学习不涉及自我改进/自我迭代
Huang et al.2024LLM 持续学习不涉及自我改进
本论文(Chen)2026首次统一覆盖 LLM 持续学习 + 自我改进—

本论文是第一个将大语言模型的持续学习和自我改进两个交织的研究线索进行统一处理的综述。

2.2 关键前序工作

本论文建立在以下关键工作之上:

持续学习基础:

  • EWC(Elastic Weight Consolidation)(Kirkpatrick et al., 2017):里程碑式工作,首次提出用 Fisher 信息矩阵量化参数重要性来防止灾难性遗忘
  • Synaptic Intelligence(SI)(Zenke et al., 2017):在线计算参数重要性的方法
  • LoRA(Hu et al., 2022):低秩自适应,为 LLM 持续学习提供了参数高效的基础设施
  • L2P / DualPrompt / CODA-Prompt(2022-2023):基于提示的持续学习方法,特别适合 LLM

自我改进基础:

  • AlphaGo Zero(Silver et al., 2017):证明了纯自我对弈可以达到超人水平的里程碑
  • Self-Instruct(Wang et al., 2023):LLM 自举指令数据
  • Constitutional AI(Bai et al., 2022b):自我批评与修订循环
  • STaR(Zelikman et al., 2022):自教推理器
  • SPIN(Chen et al., 2024):自我对弈微调

推理模型突破:

  • OpenAI o1(2024):推理时计算扩展
  • DeepSeek-R1(2025):通过强化学习激发推理能力

2.3 与相邻领域的关系

论文清晰地辨析了持续学习、自我改进与以下概念的区别:

  • 迁移学习:单阶段适配,无顺序性
  • 元学习:优化快速适应能力,不积累跨任务知识
  • 终身学习:最广义的术语,持续学习 + 自我改进是其技术实现机制
  • 在线学习:流式处理数据,但不强调跨分布变化的知识保留

本论文聚焦的是上述范式的交集:一个能(1)顺序学习、(2)保留旧知识、(3)自生成训练信号的系统。


三、问题定义

3.1 论文如何抽象核心问题

论文面对的核心挑战可以拆解为两个互相关联的子问题:

子问题一:稳定性-可塑性困境(Stability-Plasticity Dilemma)

这是持续学习的根本矛盾:模型必须足够可塑以吸收新知识,同时足够稳定以保留旧知识。形式化地说,如果 S(θ) 衡量稳定性(旧任务性能),P(θ) 衡量可塑性(新任务性能),理想模型需要最大化:

$$\max_{\theta} \alpha \cdot S(\theta) + (1 - \alpha) \cdot P(\theta)$$

这个困境的本质是:不可能在旧知识"完全不动"的情况下完美学到新知识。任何参数更新都在某种程度上改变模型对旧知识的编码。关键在于找到一种平衡。

子问题二:自我改进的收敛与坍塌

自我改进的核心问题是:迭代自我训练在什么条件下保证收敛到更好的性能,而不是退化到模型坍塌?

论文将自我改进形式化为一个迭代算子 T,其中 M_{t+1} = T(M_t)。系统收敛的条件是 M* = T(M*)——一个不动点。关键洞察是:这个不动点的质量取决于评估信号的质量。

3.2 两个子问题的统一

论文最核心的抽象是将持续学习和自我改进的交互建模为一个双层优化问题:

$$\min_{\theta} \mathcal{L}_{CL}(\theta; D_{new}, D_{old}) \quad \text{s.t.} \quad \theta \in \arg\min_{\theta'} \mathcal{L}_{SI}(\theta'; r_\phi)$$

外层是持续学习目标(吸收新知识并保留旧知识),内层是自我改进目标(最大化奖励)。这个双层结构揭示了根本张力:自我改进内循环驱动参数向奖励最大化区域移动,但这些区域可能与持续学习外循环要求的知识保留区域重叠不佳。

3.3 不可能性结果

论文甚至给出了一个不可能性定理(Proposition 2):当任务具有多样性(γ-diverse)时,同时实现最优持续学习和最优自我改进是不可能的——遗忘程度 ϵ 和自我改进差距 δ 必须满足 ϵ + δ ≥ γ(T-1)/(d/r)。这解释了为什么更大的模型(d 更大)能更自然地缓解遗忘,以及为什么低秩更新(r 更小,如 LoRA)能更好地保留知识。


四、问题解法

论文提出的不是一个单一方法,而是一个全景式的方法论地图——一个三轴分类框架,覆盖五大方法族。

4.1 三轴统一分类法(Three-Axis Taxonomy)

论文最核心的组织贡献是提出了一个三轴分类框架,用于精确刻画任何"部署后学习系统":

轴含义取值
What(更新什么)被更新的知识类型知识、技能、对齐、推理
How(如何更新)学习信号的来源外部监督、自生成信号、架构适应
When(何时更新)更新的时间粒度离线、在线、推理时

这个框架揭示了一个此前未被注意到的结构缺口:在(What=对齐,How=自生成信号,When=在线)这个位置几乎是空白的——没有任何现有方法能在没有人类偏好数据参与的情况下,实现连续的自主对齐改进。

4.2 五大方法族详解

方法族一:参数隔离(Parameter Isolation)

核心思想:为每个任务分配独立的参数子集,从根本上消除跨任务干扰。

代表方法:

  • Progressive Neural Networks:每个新任务添加一个新列(子网络),冻结所有旧列
  • Adapter-Based CL(如 LoRA):在冻结的 Transformer 层之间插入轻量适配器模块,每个任务一个适配器
  • AdapterFusion:独立训练任务特定适配器,然后学习融合层来组合表示

关键数据:在 TRACE 基准上,LoRA 隔离方法达到 73.5% 平均准确率,BWT(后向迁移)仅 -3.1%,远优于无 CL 方法的 52.3% / -31.4%。

优缺点:遗忘防止最强,但参数量线性增长,需要推理时的任务标识,缺乏后向迁移。

方法族二:正则化(Regularization)

核心思想:在损失函数中添加辅助项,惩罚对旧任务重要参数的修改。

代表方法:

  • EWC(弹性权重巩固):用 Fisher 信息矩阵的对角线近似参数重要性,对重要参数施加二次惩罚。直观理解:如果某个参数对旧任务很"关键",那么在学新任务时就不应该大幅改动它
  • SI(突触智能):在线累积每个参数对损失减少的贡献作为重要性分数
  • LwF(Learning without Forgetting):把旧模型当作教师,通过知识蒸馏保持新旧模型输出一致

关键数据:EWC 在 TRACE 上达到 64.8% / -18.2%,虽不如参数隔离但优于无 CL 方案。

可扩展性挑战:对于有数十亿参数的模型,计算完整的 Fisher 信息矩阵是 O(n²) 级别的,实践中只能用对角线或块对角线近似。

方法族三:回放(Replay)

核心思想:维护旧任务的样本表示(真实数据或生成数据),在新任务训练时交错回放。

代表方法:

  • 经验回放(Experience Replay):存储固定大小的旧样本缓冲区,与新数据共同训练
  • GEM(梯度情景记忆):约束梯度更新方向,确保旧样本上的损失不增加
  • 生成式回放:用生成模型产生旧任务的合成样本(LLM 自身可作为生成器)
  • 数据混合:将新领域语料与原始预训练数据的一小部分混合。实践表明,仅 1-5% 的旧数据回放就能显著缓解遗忘

实践意义:数据回放在实际中几乎被普遍采用作为辅助策略,无论主要方法是什么。

方法族四:基于架构的方法(Architecture)

核心思想:通过模块化或稀疏设计修改网络结构来容纳新知识。

代表方法:

  • MoE(混合专家):维护一组专家子网络和门控路由机制。不同任务激活不同专家,天然减少干扰。Switch Transformer 证明了稀疏 MoE 可以高效扩展到万亿参数
  • 模块化网络:将模型分解为可重用组件,新任务通过组合现有模块来解决

方法族五:基于提示/指令的方法(Prompt-Based)

核心思想:在输入前添加可学习的提示词(Prompt Tokens),完全不修改模型权重。

代表方法:

  • L2P(Learning to Prompt):维护一个可学习提示词池,用键值匹配为每个输入选择子集
  • DualPrompt:将提示分为通用提示(编码任务不变知识)和专家提示(编码任务特定知识)
  • CODA-Prompt:引入基于注意力的提示组合,实现跨任务的平滑知识共享
  • Progressive Prompts:顺序累积提示词,每个新任务向现有序列追加学习到的词元

为什么提示方法特别适合 LLM? 三大原因:(1) 预训练 LLM 已经强烈依赖输入上下文来调节行为;(2) 骨干网络完全冻结,保留所有通用能力;(3) 每个任务的参数开销可忽略不计(通常 < 0.01% 模型大小)。

4.3 自我改进方法谱系

论文将自我改进方法组织为从训练时到推理时的光谱:

自我对弈与自我训练

  • SPIN:当前模型学习区分自己生成的文本和人类撰写的文本,上一轮迭代的副本作为对手
  • Self-Instruct:从小种子集自举指令数据
  • Constitutional AI:根据一组"宪法"原则进行自我批评和修订
  • STaR:引导链式推理,只保留导向正确答案的推理路径

迭代精炼

  • Self-Refine:生成→批评→修订的三步循环,纯推理时操作
  • Reflexion:维护语言化失败记忆来指导未来行为
  • ReST:生长(采样多个输出并过滤)→改进(在过滤集上微调)的两阶段循环

推理时计算扩展(Test-Time Compute)

  • Best-of-N 采样:生成 N 个候选解,选最优的,性能与 N 呈对数线性改进
  • 过程奖励模型(PRM) vs 结果奖励模型(ORM):PRM 评估每个中间推理步骤,提供更密集的奖励信号
  • 推理缩放定律:最优分配推理计算可能比同等投入于模型参数更有效

4.4 自我改进的收敛性定理

论文最精彩的理论贡献之一是 Proposition 1——验证器引导的自我改进收敛条件:

如果一个系统满足三个条件:

  1. 覆盖性:模型对每个问题至少给出一个正确解的概率 ≥ p_min
  2. 验证器质量:验证器的精确度超过先验正确率
  3. 可实现性:策略类中包含能达到完美性能的策略

那么性能序列 V(π_t) 单调递增且收敛到 V* ≥ V(π_0) + (1-α)(1-β) - α·(1-V(π_0)) / (1-α+β),收敛速率为 O(1/t)。

直觉解读:自我改进要成功,需要三个条件——模型多少能碰对一些答案(覆盖)、验证器比瞎猜准(质量)、模型有潜力做到完美(可实现性)。当验证器完全不准时(α = β = 0.5),退化到模型坍塌。

4.5 多模型交叉验证实验

论文还进行了一项跨 4 个前沿模型的控制实验(GSM8K,20 道题,3 次重复),比较三种条件:

模型BaselineSI-only (iter 3)CL+SI (iter 3)
DeepSeek-Chat85.0%85.0% (±0.0)85.0% (±0.0)
GPT-5.290.0%75.0% (-15.0)85.0% (-5.0)
Claude Sonnet 4.690.0%90.0% (±0.0)95.0% (+5.0)
Gemini 3 Flash50.0%50.0% (±0.0)65.0% (+15.0)

关键发现:

  1. 自我精炼存在确定性坍塌吸引子:GPT-5.2 的 SI-only 条件在所有温度下都精确收敛到 80%,与基线无关
  2. 回放缓冲区能逃离坍塌吸引子:CL+SI 在所有 4 个模型上都优于 SI-only
  3. CL 的收益与自我验证质量成反比:验证器越弱(如 Gemini 3 Flash),CL 带来的增益越大

五、必要知识反推

从论文发现问题和解决问题的过程中,我们可以反推出完成这项工作所必须掌握的核心知识和信息:

5.1 持续学习基础知识

必须掌握:

  • 灾难性遗忘的机制:理解为什么梯度更新会覆盖旧知识——因为共享参数的修改没有保留旧任务性能的约束
  • Fisher 信息矩阵:理解 EWC 的理论基础——如何用一个对角近似来量化参数对特定任务的重要性
  • 稳定性-可塑性困境:理解持续学习的根本张力——不能只看新任务性能或旧任务性能,需要在两者间取得平衡
  • 三种持续学习设定(Task-IL / Class-IL / Domain-IL)及其难度差异

5.2 自我改进的博弈论基础

必须掌握:

  • 自我对弈(Self-Play)的博弈论原理:理解 AlphaGo Zero 的成功条件——完美的博弈环境提供了天然的验证器
  • LLM 自我对弈的独特挑战:语言没有像围棋那样的完美验证器,这是自我改进在 NLP 中更困难的根本原因
  • 模型坍塌(Model Collapse)的数学机制:理解为什么在自身输出上递归训练会导致分布尾部丢失、模式坍塌
  • 信息论边界:理解一个系统在原则上不能生成其训练数据或交互历史中不存在的信息

5.3 LLM 训练范式知识

必须掌握:

  • RLHF / DPO 的完整流程:理解奖励模型训练、策略优化、偏好数据收集的循环
  • LoRA 的低秩分解机制:理解为什么低秩更新既能学习又能减少遗忘
  • MoE 架构的稀疏激活机制:理解门控路由如何天然实现任务分离
  • 提示学习(Prompt Tuning):理解为什么在输入空间操作而非参数空间可以避免遗忘

5.4 评估方法论

必须掌握:

  • BWT(后向迁移)/ FWT(前向迁移)/ AA(平均准确率) 的定义和计算
  • 推理缩放定律(Inference Scaling Laws):理解推理时计算与性能的关系
  • 过程奖励模型 vs 结果奖励模型:理解密集信号和稀疏信号的权衡

5.5 知识融合的关键洞察

将上述知识融合为统一理论的能力:

  1. 双层优化视角:将 CL 和 SI 的交互理解为一个内层-外层结构
  2. 收敛条件的抽象:从博弈论、信息论、优化理论三个角度同时分析自我改进的边界
  3. 三轴分类法的设计:将 what/how/when 三个正交维度抽象出来,使得任何方法都能被精确定位
  4. 不可能性定理的推导:从参数空间几何出发,证明 CL 和 SI 同时最优化的理论极限

六、论文中可以提取的通用性灵感

灵感一:评估信号的质量决定系统的上限

自我改进的轨迹不取决于生成机制的复杂度,而取决于评估信号的质量和独立性。

这一洞察远超 LLM 领域。在任何需要迭代改进的系统中——无论是软件开发中的测试套件、科学研究中的实验验证、还是产品设计中的用户反馈——评估信号的质量和独立性才是决定系统天花板的关键因素。如果评估信号与被评估对象高度相关(如模型评估自己的输出),系统必然退化。如果评估信号独立且准确(如数学证明的执行验证),系统可以持续进步。

推广:在设计任何自我改进系统时,首先应该投入资源构建高质量的评估器,而不是优化生成器。

灵感二:规模本身只能缓解但不能消除根本矛盾

论文发现,更大的模型确实更不容易遗忘(过度参数化提供了更多容量让任务特定子网络共存),但规模只是移动了遗忘阈值,并没有消除它。即使在 GPT-4 级别的模型上,没有显式缓解策略的持续指令微调仍然会退化旧任务性能。

推广:在任何工程系统中,“通过增加资源来解决问题"的策略通常只是推迟问题而非解决问题。根本性的设计缺陷需要根本性的解决方案。

灵感三:混合策略几乎总是优于单一策略

论文发现,实际中最有效的持续学习系统几乎都组合了多种方法族——例如,将软掩蔽(隔离)与知识蒸馏(正则化)结合,或将数据回放作为所有主要方法的通用补充策略。没有任何单一方法族在所有维度上占优。

推广:在复杂系统设计中,组合多种互补机制(每种机制解决一个特定方面的问题)通常比追求"银弹"式单一解决方案更稳健。这类似于软件工程中的"防御性编程”——多层防御比单点依赖更可靠。

灵感四:分类法本身是一种研究贡献

论文的三轴分类法不仅帮助组织现有工作,更重要的是揭示了一个未被探索的研究空白——(对齐 + 自生成信号 + 在线)这个位置几乎是空白的。这个空白是通过系统性的分类才变得可见的。

推广:在任何一个快速发展的领域,构建一个结构化的分类框架不仅能帮助理解现状,更能识别未来的机会。好的分类法本身就是重要的研究贡献。

灵感五:自我改进需要"外部锚点"

论文反复强调的一个主题是:纯粹的自我参照循环不可避免地退化。无论是自我对弈、迭代蒸馏还是宪法式自我批评,所有成功的自我改进方法都需要某种形式的"外部锚点"——验证器、人类数据、可执行反馈或问题结构。

推广:在任何自我参照的改进过程中(包括个人学习、组织改进、产品迭代),都需要引入外部视角或独立验证来防止"信息茧房"式的退化。完全封闭的自我改进系统在理论上是不可能持续进步的。

灵感六:最小可行实验也能产生有价值的洞察

论文中的多模型实验只用了 20 道题和 3 次重复,在统计力度上并不强。但它仍然产生了有价值的定性洞察——特别是 GPT-5.2 的"80% 确定性吸引子"现象。这与论文自己引用的"小规模先导实验能显著区分综述与文献总结"的观点一致。

推广:在研究和工程中,不要等到拥有完美的实验条件才开始验证。精心设计的小规模实验可以快速产生方向性洞察,指导后续的大规模投入。

灵感七:训练-部署的二元对立正在消解

论文最终的愿景是:未来的模型不是"训练完再部署",而是"为了学习而部署"。持续学习和自我改进的融合意味着训练和部署不再是一个先后的两阶段过程,而是一个统一的、持续进行的生命周期。

推广:在软件工程中,类似的趋势已经在发生——CI/CD 管道模糊了开发和部署的边界;在线学习系统模糊了训练和推理的边界。任何将"构建"和"运行"严格分离的范式,在面对持续变化的环境时都需要被重新思考。


总结

这篇综述的独特价值在于它不是简单的方法罗列,而是一个统一的理论框架——将两个看似独立的研究方向(持续学习和自我改进)纳入同一个分析体系,揭示了它们共享的核心挑战、互补的方法论、以及必须协同设计的原因。

对于初学者来说,这篇论文提供了一张"导航地图":你可以从三轴分类法中找到任何方法的精确位置,理解它属于哪个方法族、解决什么类型的问题、在什么时候应用。对于研究者来说,论文揭示的空白(如自主在线对齐改进)和不可能性定理提供了明确的研究方向。

最重要的是,论文传递了一个核心信念:最理想的 AI 系统,应该是能够永不停止学习的系统——不仅能吸收新知识,还能主动改进自己的学习策略。这不仅是技术目标,更是一种关于智能本质的哲学主张。


本文由 AI 辅助深度阅读论文并撰写,旨在以通俗易懂的方式帮助初学者理解这篇重量级综述的核心思想。