论文链接:arxiv.org/abs/2605.12357 代码仓库:github.com/declare-lab/delta-Mem 发表时间:2026年5月 机构:南洋理工大学(NTU)DeCLaRe Lab + MindLab Research 一作:Jingdi Lei(南洋理工大学),通讯作者:Soujanya Poria(南洋理工大学副教授,DeCLaRe Lab 负责人)


一、论文背景

1.1 为什么大语言模型需要"记忆"?

我们日常使用 ChatGPT、Claude 等 AI 助手时,可能已经注意到了一个现象:AI 的"记忆力"很差。你在今天告诉它你的偏好,明天再聊它就忘了。这不是 AI 不够聪明,而是大语言模型(LLM)的固有设计限制——模型在推理时参数是固定不变的,它无法像人脑一样在学习新知识后自动更新自己的"神经元连接"。

具体来说,LLM 的信息来源有两种:

  • 参数记忆(Parametric Memory):模型训练时写入网络权重的知识。一旦训练完成,这些知识就被"冻结"了,无法在推理时动态更新。
  • 上下文记忆(Contextual Memory):模型在当前对话窗口中看到的文本。受限于上下文窗口大小(如 128K token),且成本随长度线性增长。

当一个 LLM 被用作长期对话助手或自主 Agent(智能体)时,问题就变得尖锐了。Agent 需要在跨越数天甚至数月的交互中持续积累和重用历史信息——记住用户的偏好、之前执行的任务、积累的经验教训。单纯扩大上下文窗口不仅代价高昂,而且往往无法保证有效利用长上下文。

1.2 现有记忆方案的困境

学术界和工业界已经提出了多种记忆方案,但各有其局限:

(1)扩展上下文窗口(Context Window Extension)

做法简单粗暴——让模型一次能"看到"更长的文本。但问题是:注意力机制的计算复杂度随序列长度二次增长(O(n²)),上下文越长,推理成本越高。而且实验表明,即便有长上下文窗口,模型也不一定能有效利用其中的信息(即"中间迷失"问题——位于上下文中部的信息容易被忽略)。

(2)文本检索记忆(Retrieval-Augmented Generation, RAG)

将历史信息存储在外部数据库中,需要时通过检索取回相关文本,拼接到当前输入中。这种方式的瓶颈在于:

  • 信息被压缩和截断,容易丢失关键细节
  • 检索结果包含噪声,可能引入不相关信息
  • 检索模块与模型前向计算之间是"松耦合"的——检索出来的文本只是被拼到输入里,模型内部并没有为"记忆利用"做专门优化

(3)参数化适配(如 LoRA、Prefix-Tuning)

通过微调少量参数来编码新知识。但问题是训练完成后参数就固定了,无法在推理过程中动态更新。你不可能让模型在每次对话后都重新微调一遍。

(4)外部记忆模块(如 MLP 记忆库)

在模型外部挂一个独立的记忆模块,推理时额外查询。缺点是引入了额外的检索开销,且记忆模块与主干模型之间的信息传递效率低——相当于人脑的"记忆中枢"和"思考中枢"是分开的,需要来回传话。

1.3 理想的记忆方案应该是什么样的?

综合以上困境,一个理想的 LLM 记忆方案应该同时满足:

需求说明
动态可更新在推理过程中就能实时写入和更新记忆,无需重新训练
计算高效不显著增加推理成本,记忆读写操作轻量
与模型深度耦合记忆直接参与模型的内部计算过程,而非外部拼接
极低参数开销不需要大量额外参数,更不需要全量微调
与冻结部署兼容能在冻结(不修改)的预训练模型上直接使用

δ-mem 正是瞄准这个理想目标设计的。它提出了一个极其简洁的方案:在冻结的 Transformer 模型上,附加一个仅 8×8 大小的状态矩阵作为"在线联想记忆",通过经典的 delta-rule(增量规则)学习来实时更新这个矩阵,并将记忆信号直接注入到注意力计算中。


二、论文定位和关联工作

2.1 研究领域定位

δ-mem 处于 “LLM 在线记忆” 这一新兴交叉领域,它将经典神经网络的联想记忆思想引入了现代大语言模型架构中。从研究谱系上看,它可以被定位在以下三条研究路线的交汇点:

经典联想记忆(1980s-2000s)
        │
        ▼
现代在线记忆机制(2024-2026)
  ├── Titans(Google DeepMind, 2025)─── 神经长时记忆模块
  ├── Native Memory(Meta, 2025)     ─── 原生训练时记忆
  ├── MLP Memory(2026)              ─── MLP-based 记忆模块
  └── δ-mem(本文, 2026)             ─── delta-rule 在线联想记忆
        │
        ▼
高效低秩适配(LoRA, 2022)─── 参数高效的模型适配方法

2.2 三大类别记忆方法对比

论文将现有 LLM 记忆方法系统性地分为三大类别,并在每一类中定位了自己的工作:

类别一:文本记忆机制(Textual Memory Mechanisms, TMMs)

代表性工作包括:

  • MemGPT(2023):借鉴操作系统的虚拟内存管理,将 LLM 的上下文当作"内存",外部存储当作"磁盘",通过"换页"机制管理长对话
  • MemoryBank(2024):为 LLM 提供一个可检索的记忆库,按重要性存储和召回历史信息
  • Mem0(2025):为 AI 应用提供结构化的记忆层,自动从对话中提取和更新记忆

这类方法的共同特点是:记忆以文本形式存储在外部系统中,通过检索取回。δ-mem 与之的区别在于——它不扩展输入文本、不依赖外部检索,记忆直接嵌入模型内部计算。

类别二:参数化记忆机制(Parametric Memory Mechanisms)

  • LoRA(2022):通过低秩矩阵适配来编码知识,但训练后参数就固定了
  • Prefix-Tuning:学习一组可训练的"前缀"向量,在推理时拼接到输入中,但同样是静态的

δ-mem 的区别在于:虽然它也使用低秩矩阵,但这个矩阵是在线动态更新的,推理时每一步都在变,而非训练后固化。

类别三:外部通道记忆机制(External Channel Memory Mechanisms)

  • Titans(Google DeepMind, 2025):这是与 δ-mem 最密切相关的前序工作。Titans 提出了一个神经长时记忆(Neural Long-term Memory)模块,同样使用 delta-rule 进行在线更新。但 Titans 的设计是替代整个注意力架构,需要从头训练模型。
  • MLP Memory(2026):使用多层感知机(MLP)作为记忆模块,参数量较大。

δ-mem 与 Titans 的关键区别在于:δ-mem 不替换也不重新训练主干模型,而是在冻结的预训练模型上附加轻量记忆层,实现了部署友好的"即插即用"。

2.3 关键前序工作:Titans

特别值得一提的是 Google DeepMind 的 Titans: Learning to Memorize at Test Time(ICLR 2025)。这是 δ-mem 最核心的前序工作,两者都使用了 delta-rule 进行在线记忆更新。

Titans 的核心贡献在于:它提出了"神经长时记忆"的概念,证明了可以在推理时通过类似 delta-rule 的机制让模型动态记忆新信息。但 Titans 的局限在于——它是一个全新的架构,需要从零开始训练模型,无法直接应用于现有的预训练 LLM。

δ-mem 在此基础上的突破是:将 delta-rule 记忆机制"移植"到了冻结的预训练模型上,通过低秩修正的方式让记忆信号参与注意力计算,从而实现了"即插即用"的高效在线记忆。


三、问题定义

3.1 核心问题的抽象

论文面对的核心挑战可以被表述为一个**“高效信息压缩与动态利用”**问题:

如何在不修改预训练模型参数、不扩展输入序列长度的前提下,让 LLM 能够持续地将历史交互信息压缩存储到一个固定大小的记忆状态中,并在需要时从这个记忆状态中准确提取相关信息来指导当前生成?

这个抽象背后有三层含义:

  1. 压缩层:历史信息是无限的(可能累积数百轮对话),但记忆容量是有限的(固定大小的状态矩阵)。需要一种高效的压缩机制,将有用的信息提炼出来存入有限空间。

  2. 动态更新层:记忆不是训练好后就不变的,而是要在推理过程中持续更新——新的信息要写进去,过时的信息要被遗忘或覆盖。

  3. 有效利用层:存储的记忆不能只是"沉睡"在外部,它必须能直接、有效地影响模型的内部计算过程,让模型真正"记住"并"利用"历史经验。

3.2 为什么这个问题很困难?

这个问题的难点在于多个约束同时存在:

  • 容量有限 vs. 信息无限:如何用一个小矩阵(8×8)来概括可能长达数千轮的交互历史?
  • 在线更新 vs. 稳定性:每次更新记忆时,新写入的信息可能覆盖旧有记忆。如何在"写入新知识"和"保持旧记忆"之间取得平衡?
  • 模型冻结 vs. 记忆注入:模型参数不能改,那记忆信号该从哪里注入?注入的方式既不能破坏模型原有的能力,又要让记忆真正发挥作用。

3.3 问题类比

用人脑打个比方:δ-mem 解决的问题类似于——

你有一个已经完成全部学业、知识固化的"专家大脑"(冻结的 LLM),现在需要在不改变这个大脑任何神经连接的前提下,给它加装一个极小的"便签本"(在线记忆状态),让它能在日常工作中学到的新经验都记在这个便签本上,并在需要时自动翻阅这个便签本来辅助决策。


四、问题解法

4.1 整体架构一览

δ-mem 的整体架构可以用一句话概括:在冻结的 Transformer 主干网络的每个注意力层上,附加一个在线联想记忆状态,通过 delta-rule 实时更新这个状态,并将记忆读出结果以低秩修正的方式注入注意力计算。

核心组件包括:

  • 在线联想记忆状态(Online State of Associative Memory, OSAM):一个固定大小的矩阵 S ∈ ℝ^(r×r),其中 r 通常取 8(即 8×8 = 64 个数值)
  • 记忆投影层:将隐藏状态投影为记忆查询(Memory Query)、记忆键(Memory Key)、记忆值(Memory Value)
  • Delta-rule 更新机制:基于预测残差动态更新记忆状态
  • 低秩修正注入:将记忆读出信号注入注意力的查询和输出分支

4.2 每一步的详细计算过程

在每个序列位置(即每个 token 处理时),δ-mem 执行以下四个步骤:

步骤 1:投影到记忆空间

当前 token 经 Transformer 层处理后产生的隐藏状态 h(一个高维向量),通过三个独立的线性投影层,被转换为三个记忆专用向量:

  • 记忆查询(q_mem):用于从记忆状态中"查找"相关历史信息
  • 记忆键(k_mem):用于标识当前信息,后续写入记忆时作为"索引"
  • 记忆值(v_mem):当前信息的"内容",写入记忆时存储的具体内容

这类似于图书馆系统:q_mem 是你拿着的"借书卡",k_mem 是书架上的"编号标签",v_mem 是书本的"实际内容"。

步骤 2:从记忆读取

使用上一步得到的记忆查询 q_mem,从前一时刻的记忆状态矩阵 S_prev 中读取联想信号。

读取过程本质上是一个矩阵向量乘法:用查询向量去"探测"记忆矩阵中存储的键值关联,返回一个低维的"记忆信号"向量。这个信号包含了与当前查询最相关的历史信息的压缩表示。

直觉上,这就像你在大脑中搜索与当前话题相关的记忆片段——不是逐条回忆所有经历,而是通过联想直接定位到相关信息。

步骤 3:低秩修正注意力

将步骤 2 读出的记忆信号转化为低秩修正,注入到主干注意力计算中。

这里的"低秩修正"是什么意思?简单来说,注意力计算中有三个关键向量——查询(Query)、键(Key)、值(Value)。δ-mem 选择在查询和输出两个位置注入记忆修正:

  • 查询侧修正(Query-side Correction):调整注意力计算中的查询向量,相当于给模型一个提示——“根据你的历史记忆,现在应该更加关注这类信息”。这会偏置注意力的焦点,让模型更倾向于关注与记忆相关的输入位置。
  • 输出侧修正(Output-side Correction):将记忆衍生的信号直接加到注意力层的输出上,相当于在模型的"思考结果"中融入来自记忆的额外信息。

实验发现,同时注入查询侧和输出侧修正效果最好。这好比一个人在做决策时,既参考过去的经验来调整自己看待问题的角度(查询侧修正),又直接将过去的经验教训融入当前的判断中(输出侧修正)。

步骤 4:通过 Delta-Rule 更新记忆

这是整个机制最核心的步骤——如何在推理过程中动态更新记忆状态。

Delta-Rule(增量规则) 是一种经典的误差修正学习规则,最早由 Widrow 和 Hoff 在 1960 年提出(也被称为 Widrow-Hoff 规则或最小均方算法 LMS)。它的核心思想很简单:

根据预测结果与真实结果之间的差异(即"残差"或"误差"),来调整记忆的内容。如果记忆对某个键的预测值与实际值不一致,就按误差方向修正记忆。

在 δ-mem 中,具体的更新过程包含以下要素:

  1. 计算预测残差:用当前的记忆键 k_mem 去读取记忆状态,得到记忆对"当前键应该对应什么值"的预测,然后与实际的记忆值 v_mem 对比,得到残差(即预测误差)。

  2. 写入门(Write Gate):一个由当前隐藏状态控制的门控信号,决定新信息写入的强度。当预测误差大时(即记忆中还没有存储类似信息),写入门打开得更大,写入更多新信息。

  3. 保持/遗忘门(Retention Gate):同样由隐藏状态控制,决定已有记忆保留多少。这使模型能够逐渐遗忘过时信息,为新的重要信息腾出空间。

  4. 门控使用 sigmoid 函数:sigmoid 函数的输出在 0 到 1 之间,适合做"门"——0 表示完全关闭,1 表示完全打开。

整个更新可以理解为:

新记忆 = 保持门 × 旧记忆 + 写入门 × 残差更新量

这种设计有一个优雅的数学性质:记忆更新可以被视为优化一个在线回归损失函数——每一步都在最小化"记忆预测值"与"实际目标值"之间的均方误差。这意味着 delta-rule 不仅仅是一个启发式方法,而是有明确优化目标的学习过程。

4.3 三种写入策略

记忆"什么时候写入"和"以什么粒度写入"是一个重要的设计选择。δ-mem 提出了三种写入策略:

(1)Token 级别滑动窗口(TSW, Token-State Write)

每个 token 处理时都更新一次记忆。

  • 优势:粒度最细,对局部变化最敏感,能捕捉到 token 级别的细微信息变化
  • 劣势:容易受噪声影响——标点符号、常见虚词等无关 token 也会写入记忆,可能冲淡重要信息
  • 类比:像一个人在听演讲时,每听到一个词就往笔记本上记一笔——虽然信息很全,但可能被大量无关内容淹没

(2)段级别滑动窗口(SSW, Segment-State Write)

将连续的 token 分成段(如一条完整的对话消息),每个段处理完后更新一次记忆。段内所有 token 的表示取平均后作为该段的记忆键和值。

  • 优势:更鲁棒,减少了 token 级别的噪声干扰,一段完整消息的"平均表示"通常比单个 token 更有意义
  • 劣势:可能丢失一些细粒度信息(比如消息中某个关键的细节词)
  • 类比:像听完一段完整的话后再总结记录——抓住了大意,但可能遗漏某些细节
  • 适用场景:实验表明,SSW 在大多数场景下是最佳选择

(3)混合滑动窗口(MSW, Mixed-State Write)

维护多个并行的记忆子状态矩阵(比如 4 个),每个子状态独立更新,读取时聚合所有子状态的结果。

  • 优势:不同的子状态可以专门记忆不同类型的信息(一个记事实、一个记偏好、一个记任务),减少不同类型信息之间的干扰
  • 劣势:参数量增加(从约 4.87M 增加到 19.47M),计算量也相应增大
  • 类比:像一个人同时携带多本不同主题的笔记本——一本记人名,一本记时间安排,一本记技术细节,查询时同时翻阅所有笔记本
  • 适用场景:实验表明,较小的模型(如 SmolLM3-3B)从 MSW 中获益最大

4.4 训练方式

值得强调的是,δ-mem 的训练方式极其"轻量":

  1. 主干模型完全冻结:预训练的 LLM(如 Qwen3-4B)的参数一动不动,不做任何修改
  2. 只训练记忆相关的组件:记忆投影层、门控参数等少量参数
  3. 使用标准监督微调(SFT)损失:不需要特殊的训练技巧
  4. 训练时模拟记忆的使用过程:训练数据被组织成长序列,模型在处理过程中通过记忆状态的持续更新来学习"记住什么"和"如何利用记忆"

这种训练方式意味着:部署时只需要加载原始的预训练模型,然后"挂上"训练好的 δ-mem 适配器即可,原有的模型权重和部署流程完全不受影响。

4.5 为什么 8×8 就够用了?

这是一个非常反直觉的结果——一个 8×8 的矩阵只有 64 个数值,它怎么可能记住数百轮对话中的关键信息?

关键在于:这个矩阵存储的不是原始文本信息的逐字记录,而是高度压缩的键值关联。通过 delta-rule 的持续更新,这个矩阵学会了将"哪些查询模式应该联想到哪些值模式"提炼成一个紧凑的数学表示。就像人的大脑中,关于某个人的所有记忆(外貌、声音、性格、经历)最终可能只对应着几个神经元连接模式的激活——信息被极度压缩,但在需要时可以被有效提取和利用。

实验也证明了这一点:即使在移除全部显式上下文的情况下(“no-context"设置),仅凭这个 8×8 的记忆矩阵,模型仍然能在问答任务上显著超越无记忆基线,证明记忆中确实存储了有用信号。


五、必要知识反推

假设找一个完全没有相关背景知识的人来完成这项工作,他需要掌握哪些知识和信息?让我们从"发现问题"到"解决问题"的角度逐步反推。

5.1 发现问题所需的知识

要意识到"LLM 需要高效在线记忆"这个问题,需要了解:

  1. Transformer 架构的工作原理:理解自注意力机制的 O(n²) 复杂度限制,理解上下文窗口的概念,才能知道为什么"简单扩大窗口"不是好方案。

  2. LLM 的推理机制:理解 LLM 推理时参数是固定的,不存在"边推理边学习"的能力,才能认识到需要一个额外的记忆机制。

  3. 长期 Agent 场景的特殊需求:理解 Agent 系统需要跨越长时间、多轮交互来累积和利用信息,才能感受到当前 LLM 在这方面的重要缺口。

  4. 现有方案的局限性:逐一分析 RAG 检索、LoRA 微调、外部记忆模块等方案的不足,才能明确"理想方案应该满足什么条件”。

5.2 设计解法所需的知识

要设计出 δ-mem 这个方案,需要融合以下多领域的知识:

  1. 经典联想记忆理论:了解 Hopfield 网络、Widrow-Hoff 规则等经典方法,才能想到用 delta-rule 来做在线记忆更新。这是连接"传统神经网络"和"现代 LLM"的桥梁。

  2. 低秩适配技术(如 LoRA):理解 LoRA 的核心思想——通过低秩矩阵来近似全参数更新,才能想到用低秩修正的方式将记忆信号注入注意力计算。

  3. 注意力机制的内部结构:深入理解注意力计算中 Query、Key、Value 的作用,才能设计出在查询侧和输出侧注入修正的策略。

  4. 门控机制设计:理解 LSTM 中的门控思想(遗忘门、输入门),才能设计出写入门和保持门来平衡新旧信息。

  5. 在线学习理论:理解在线回归、随机梯度下降等概念,才能将 delta-rule 更新形式化为一个优化问题。

  6. 参数高效微调(PEFT):理解如何在冻结主干的情况下只训练少量参数,才能实现"即插即用"的部署方式。

5.3 知识融合的关键洞察

这篇论文的核心创新不在于任何一个单独的技术组件——delta-rule 是 1960 年代的,LoRA 是 2022 年的,注意力修正也是已有思想。真正的创新在于融合多个领域的知识,发现了一个简洁而有效的组合方式:

  • 将经典联想记忆的更新规则(delta-rule)与现代Transformer 的注意力机制结合
  • 将低秩适配的参数注入方式(LoRA 式低秩修正)改造成动态在线更新的记忆通道
  • 将LSTM 式的门控机制简化为仅控制记忆的写入和遗忘

这种跨领域的知识融合和精妙组合,是这篇论文最有启发性的地方。


六、论文中可以提取的通用性灵感

灵感 1:极简状态 + 经典算法的组合力量

δ-mem 用一个 8×8 矩阵和 1960 年代的 delta-rule 就实现了显著的效果提升。这启示我们:不一定需要最复杂的方法来解决问题,经典算法与恰当的架构位置组合可能带来意想不到的效果。 在其他领域(如推荐系统、时序预测),类似的"极简状态 + 经典更新规则"思路也值得尝试。

灵感 2:记忆读写与模型计算的紧耦合

δ-mem 的记忆不是"外部挂件"——它直接参与了注意力的计算过程。这种紧耦合设计让记忆的利用效率远高于 RAG 式的"先检索再拼接"方案。通用灵感:将辅助信息直接注入到模型的核心计算流程中,比在外部进行信息拼接更有效。 这一原则可以推广到知识增强、多模态融合等场景。

灵感 3:冻结骨干 + 动态适配层的设计范式

“不动原有系统,在外围添加动态适配层"是一种极具工程价值的设计范式。它保证了原始系统的能力不被破坏(通用能力维持不变),同时通过轻量级的适配层引入新功能。这种范式可以推广到:

  • 数据库系统中添加动态缓存层
  • 操作系统中添加可插拔的调度策略
  • 任何需要"在不修改核心系统前提下引入动态行为"的场景

灵感 4:误差驱动更新的普适价值

delta-rule 的核心思想——根据预测误差来更新记忆——具有超越 LLM 记忆的普适价值。在机器学习中,基于残差/误差的迭代改进是一种强大且通用的策略:

  • 梯度提升(Gradient Boosting)就是基于残差逐步修正预测
  • 行动学习中的"反思-改进"循环也是误差驱动
  • 任何需要从反馈中学习的系统都可以借鉴"误差驱动的增量更新”

灵感 5:写入粒度是关键设计选择

论文对比了 token 级别、段级别、多状态并行三种写入粒度,发现没有"一刀切"的最佳选择——不同场景和模型规模受益于不同的策略。通用灵感:信息写入/存储的粒度是一个需要根据具体场景仔细调整的设计选择,而非一个可以忽略的实现细节。 在知识管理、数据缓存、日志系统等领域,写入粒度的选择同样至关重要。

灵感 6:高效方案需要多角度验证

论文不仅在记忆密集型任务上展示了提升,还特别验证了通用能力不被损害。这种**“增益验证 + 无损验证"的双重验证思路**在系统设计中非常重要——引入新功能时,不仅要证明新功能有效,还要证明原有功能不受损害。这对任何增量式系统改进都有参考价值。


总结

δ-mem 的核心贡献在于:证明了 LLM 的在线记忆不需要复杂的架构改造,一个冻结的预训练模型配合一个极小的(8×8)动态状态矩阵,通过经典的 delta-rule 更新和低秩修正注入,就能实现高效的长期记忆能力。这种"以最简洁的方式解决问题"的研究风格,以及跨领域融合经典理论的思想,使其不仅仅是一个 LLM 记忆方案,更是一份关于"如何优雅地解决复杂问题"的方法论参考。


参考文献:

  1. Lei, J. et al. (2026). δ-mem: Efficient Online Memory for Large Language Models. arXiv:2605.12357.
  2. Behrouz, A. et al. (2025). Titans: Learning to Memorize at Test Time. ICLR 2025.
  3. Hu, E. et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022.
  4. Packer, C. et al. (2023). MemGPT: Towards LLMs as Operating Systems. arXiv:2310.08560.
  5. Widrow, B. & Hoff, M. (1960). Adaptive Switching Circuits. IRE WESCON Convention Record.