2026-06 arXiv「智能体记忆系统(Agent Memory)」领域综述

0. 范围、方法与数据

  • 数据源:work/june2026_papers.jsonl(2026 年 6 月,cs.AI/SE/LG/CL/CV/stat.ML,共 11,930 篇)。按 memory 关键词筛 259 篇候选,排除硬件/医学/纯机器人等非 LLM-agent-memory 论文,审定 113 篇核心集(work/agent_memory_final.jsonl)。
  • 方法:113 篇全部下载 arXiv PDF 并用 PyMuPDF 抽全文(work/fulltext/,平均 75KB/篇,0 缺失)-> 分 19 批每批约 6 篇逐篇精读 title+abstract+body -> 按 6 字段(relevance/problems/formulas/approaches/techniques/key_finding)结构化抽取(work/mem_extract/ext_001.jsonl-ext_020.jsonl,共 113 条,0 遗漏)-> 对声称新公式/新数学框架的论文用 anysearch 联网交叉验证。
  • 相关性分布:high 62 / med 44 / low 7。低相关如 2606.22263(Revelio,C/C++ 内存安全漏洞检测,非 agent memory)标注为误分类。
  • 交叉验证:6 个最关键的新框架已联网确认 2026-06 原创(arXiv 全文 + 0 引用 + 多数有参考实现),文中标【已验证】;其余新公式基于摘要/全文自述,标【摘要】。
  • 本稿与同批 outputs/tool_agent_survey_2026-06.md(工具智能体)、codegen 综述互补:本桶是「记忆」子领域纵深,与工具桶重叠 85 篇已扣除。

1. 提出的问题

1.1 大家都在提的问题(普遍共识)

P1. 记忆「检索 != 使用」——证据可达却不被用。 本期最深刻的共识性发现。MemTrace【2606.17328】用知识点(单个类型化用户事实)作测量单位,证明系统失败时「证据可检索」的频率是「证据缺失」的约 10 倍:主导瓶颈是证据的使用而非存储/检索。StreamMemBench【2606.14571】、SubtleMemory【2606.05761】、Supersede【2606.27472】(更多记忆 28%->28% 无恢复)、EMBER【2606.05894】一致指向:加更多记忆/检索不解决使用问题。

P2. 什么该记、什么该忘的固化决策。 长程智能体历史远超上下文窗口,必须在固化时(未来查询未知)做保留/遗忘决策。Multi-factor value【2606.12945】指出语义相似度与近因对「遗忘决策」都是错配(相似度只在查询时定义、近因丢弃旧的过敏/约束);OSL-MR【2606.10616】、Selective Memory Retention【2606.29178】、EMBER、Learning What Not to Forget【2606.20954】都在形式化「预算约束下的最优保留」。

P3. 长程上下文管理与成本爆炸。 上下文向窗口极限增长导致 stale-state、注意力稀释、token 成本爆炸。Less Context More Accuracy【2606.09900】(lean 配置 9.6k 切片 83.6% vs 全上下文 73.2%,8x 更少 token)、Segment Tree【2606.04555】、ActiveMem【2606.10532】、Memory-Managed Attention【2606.28876】共同处理「在不丢关键证据的前提下压短上下文」。

P4. 记忆一致性与矛盾解决。 信念随时间漂移、过时事实未失效、矛盾更新覆盖正确记忆。TOKI【2606.06240】、TRUSTMEM【2606.25161】、Memory Contagion【2606.23195】、Manufactured Confidence【2606.29279】、DynamicMem【2606.22877】(>93% 失败源于检索而非写答案)都暴露:生产系统普遍不声明隔离级别,矛盾解决是隐式的、不可审计的。

P5. 评测只看终态、且混淆变量。 终态对错无法定位记忆哪里出错,且报告的增益常无法归因于架构。MemDelta【2606.29914】(【负面】仅换嵌入模型即翻转 Mem0 vs RAG 结论)、MemTrace(过程级)、ForgetEval【2606.15903】、MEMPROBE【2606.24595】(成功辅助 != 可恢复记忆)、Poker Arena【2606.13815】(标量排行误排)共同要求:记忆评测需固定嵌入、按模型族分层、报告写入成本、并区分检索与使用。

P6. 安全:记忆是新攻击面。 持久记忆跨会话累积,对手可通过正常通道注入 crafted memory 在检索时操纵未来用户响应,无需触碰权重/代码。From Untrusted Input【2606.04329】(写/检索越激进越易被利用,提示注入防御完全不覆盖记忆投毒)、FragFuse【2606.15609】(86.3% 绕过访问控制)、SMSR【2606.12703】、Membrane【2606.05743】、Forensic【2606.30566】、Memory as Attack Surface【2606.29030】构成完整攻防图谱。

P7. 遗忘/删除的完备性与治理。 当 agent 从聊天走向行动,记忆的写入/访问/删除需被治理。GateMem【2606.18829】(无方法同时实现强效用+鲁棒访问控制+可靠遗忘)、MemLeak【2606.29788】(多模态删除泄漏)、Control-Plane Placement【2606.15903】、GovMem【2607.02579】、PROJECTMEM【2606.12329】指出:删除常只删它知道如何寻址的表示(文本),而事实已扩散到嵌入/图像/图边/派生事实。

1.2 偶尔几篇提出的新颖问题(原创问题定义)

  • 文本-动作脱节(text-action disconnect)【2606.29824 NPM】:RAG 式显式文本程序记忆常常无法激活正确执行任务所需的内部神经表示——符号指令注入不等于把模型引导到正确的激活状态。
  • 被动记录 vs 主动执行状态【2606.31612 ATMem / 2606.06090】:检索到一个值不揭示其当前工作流角色(现在用 / 已用过 / 等待后续依赖);被动存储迫使 agent 从无序记忆推断进度,导致重复/遗漏操作。
  • 记忆投毒的分布式轨迹签名【2606.30566】:记忆投毒在工具调用轨迹上留下过决定性(overdetermined)的行为不变量——成功攻击必经 memory_recall->send 这类信息依赖迁移。
  • 多模态删除泄漏【2606.29788 MemLeak】:已删事实可从保留的、标记到无关事实的用户图像中恢复(VLM 用隐式视觉线索),47% 图像泄漏无法从文本恢复。
  • 记忆传染(memory contagion)【2606.23195】:评估器偏差(如长度偏差)经记忆跨时间传播给后续评估,且代际依赖(旧模型 DeepSeek V4-Chat 被传染、新模型免疫)。
  • 制造信心(manufactured confidence)【2606.29279】:记忆巩固把道听途说(heearsay)变成自信事实;被动「未验证」标签被忽略,单个承重记忆即危险,一个冗余源即可恢复正确决策。
  • 记忆动量异常【2606.31121 Janus】:更多更新 != 更好未来行为;帮助当前任务的局部更新会覆盖有用知识、引入过专规则、偏向近期样本。
  • 虚假晋升(false promotion)【2607.02579 GovMem】:跨 agent 重复观测非独立证据(共享源复制 / 共享提示诱导 / 新环境下过时 / 仅窄范围有效),相关轨迹被错误地写入记忆。
  • 记忆作为折旧资产【2606.18144】:闪存耐久性是有限资本,需用单一持久力影子价格 chi 定价;chi>0 时最优放置非单调(最有价值记忆反而送离闪存)。
  • 记忆写入路径治理【2607.02579】:关键安全问不是「记什么」而是「何时拒绝写」——写入路径应作为风险控制的证据治理系统评估。


2. 新范式与新变化

本节聚焦范式级迁移(旧范式 -> 新范式)。每个范式标注【交叉检验后的新颖性边界】:是 2026-06 首创、还是有更早前身(延续但推进)、还是集群涌现。基线参照:综述 arXiv:2603.07670(2026-03)已把 continual consolidation / learned forgetting / trustworthy reflection / causally grounded retrieval 列为开放前沿。

范式 A:存储 -> 预测(记忆即世界模型)

  • 旧:记忆 = 事实库,检索 = 查表;遗忘 = 删条目。
  • 新:记忆 = 维护一个能预测世界的模型;新观测用信息论惊讶打分、贝叶斯后验更新;存储主工件是「信念位移 delta」而非事实本身;遗忘 = 向均匀分布的熵衰减;矛盾解决是隐式的(矛盾证据自然把概率质量从旧值移走)。
  • 代表:Nous【2606.22030,已验证】;前身 BeliefMem【2605.05583,Noisy-OR 合并】;T-Mem(记忆即预期)、AI Engram(记忆痕迹几何)。
  • 新颖性边界:预测编码(predictive coding)是神经科学经典,但「把 agent 记忆重构成预测世界模型 + 遗忘=熵衰减 + 存储 delta」是 2026-06 的新范式表达。Nous 明确把自己与 BeliefMem 区分(闭式贝叶斯后验 + 惊讶作 first-class 可报告信号)。属延续但范式级推进。

范式 B:检索 -> 重构(retrieve-then-reason -> active reconstruction)

  • 旧:静态「先检索后推理」(RAG、top-k、预定义子图遍历),记忆是被动的读出策略。
  • 新:记忆访问 = 多步主动重构;由上下文线索驱动、经中间表示传播、把 LLM 推理直接嵌入记忆访问,迭代探索并剪枝检索路径。
  • 代表:MRAgent【2606.06036,Cue-Tag-Content 图,ICML 2026 poster,0 引用,已验证】;RaMem(上下文复现诱导)。
  • 新颖性边界:认知神经科学背景(Semon 1921 / Rugg & Renoult 2025);MRAgent 是首个把「主动重构」做成可计算机制并被 ICML 2026 接收,属范式级转变。

范式 C:上下文记忆 -> 参数化记忆(look up -> learn from)

  • 旧:记忆只在 prompt 空间(文本摘要 / 检索段落),参数全程冻结——agent「能查但不能学」,离开上下文即永久丢失。
  • 新:经验蒸馏进 LoRA 权重 / 激活导向向量 / 知识原子,单 episode 内真正改变未来行为。
  • 代表:TMEM【2606.04536,快权重 rollout 动力学,已验证】、NPM【2606.29824,激活导向向量,免训练】、Doc-to-Atom【2606.12400,知识原子编译】、Selective Parametric Consolidation【2606.26806,惊讶+效价门控】。
  • 新颖性边界【关键更正】:参数化记忆不是 2026-06 才出现——有明确前身 ParamMem【2602.23320,参数化反思记忆】、PEAM【2605.27762,参数化具身记忆,Minecraft】、LoRA 记忆定律【2605.30260】。2026-06 的推进在:(1) 单 episode 内在线更新(TMEM);(2) 抽取策略可被 RL 直接优化(TMEM);(3) 惊讶+效价门控的选择性固化;(4) 免训练的激活导向(NPM)。属延续但快速推进,非首创。

范式 D:被动记录 -> 主动执行状态(record -> drive)

  • 旧:记忆 = 被动存储,检索到一个值不揭示其当前工作流角色(现在用 / 已用过 / 等待后续依赖),迫使 agent 从无序记忆推断进度。
  • 新:记忆 = 持续更新的执行状态,每个值带角色 + 状态,直接驱动动作选择。
  • 代表:ATMem【2606.31612,STR-GRPO 记忆开关对比】、Memory-as-Execution-State【2606.06090,层次状态树 Grow/Compress/Maintain/Revise】。
  • 新颖性边界:新颖。把记忆从「过去的记录」重构为「当前工作流状态」是 GUI / 长程 agent 的新表达。

范式 E:读写黑盒 -> 受治理系统(memory as governed distributed system)【集群涌现】

  • 旧:记忆 = 读写黑盒;矛盾解决隐式、不可审计、不声明隔离级别。
  • 新:记忆 = 带出处 / 签名 / 隔离级别 / 作用域 / 可审计的受治理(分布式)系统。
  • 代表(2026 集群):TOKI【2606.06240,写时并发控制,已验证】、MemLineage【2605.14421,RFC-6962 Merkle 日志 + Ed25519 + lineage DAG】、TMA-NM【2606.24322,non-malleable origin-bound + TLA+ 机器检验分离定理】、CMGL(github,certified memory governance layer)、Governed Shared Memory【2606.24535,scope/time/provenance/propagation 四维】、GovMem【2607.02579,写入路径治理】、PROJECTMEM【2606.12329,事件溯源】。
  • 新颖性边界【集群涌现,本期最显著】:数据库并发控制理论(TOKI)、密码学 custody(MemLineage)、信息流控制(TMA-NM)、分布式系统治理(Governed Shared Memory)在 2026 年同时涌入 agent 记忆,且多篇带机器检验证明(TOKI 紧致性、TMA-NM T1/T2/T3 分离定理)。是本批最明确的范式级集群涌现。

范式 F:单因子 -> 多因子可解释价值(similarity/recency -> cognitive value)

  • 旧:相似度或近因单因子排序记忆。
  • 新:多因子可解释认知价值函数,单标量统一控制编码深度 / 遗忘风险 / 检索排序,权重可从下游目标学习。
  • 代表:Multi-factor value【2606.12945,7 认知因子,已验证】、DMF【2606.03463,确定性 Survival Score】。
  • 新颖性边界:新颖。把认知心理学(价值导向记忆 / 加工水平 / 适应性记忆 / 情绪巩固)系统化进 agent 记忆价值函数,并证明单因子对遗忘决策是错配(相似度只在查询时定义、近因丢弃旧的重要事实)。

范式 G:只记成功 -> 含负知识(positive -> failure-aware)

  • 旧:记忆只存成功经验。
  • 新:把失败作为有界类型化记录纳入共享库,检索时惩罚失败路径。
  • 代表:Negative Knowledge【2606.21024】、DELTAMEM【2606.03083,残差树 + 失败惩罚】、NPM(对比经验)、PEAM(failure-correction 轨迹对)。
  • 新颖性边界:部分新颖。对比学习是经典,但「失败作 first-class 记忆 + 可跨问题共享的负知识库」是 agent 记忆的新表达。

范式 H:启发式过滤 -> 认证鲁棒性(heuristic -> certified)

  • 旧:启发式过滤 / 检测记忆投毒,可被流利企业文本绕过。
  • 新:密码学出处 + 认证鲁棒界,给出形式化保证(含不可能结果)。
  • 代表:SMSR【2606.12703,HMAC + 超几何证书 + 不可能结果,已验证】、MemLineage、TMA-NM。
  • 新颖性边界:新颖。把认证鲁棒性从对抗样本领域引入记忆投毒,配机器检验与密码学硬边界。

范式 I:内容检测 -> 行为取证(content -> trajectory signature)

  • 旧:检测记忆投毒需存储访问 / 白盒模型内部 / 检索层介入。
  • 新:仅从工具调用日志检测,不查记忆内容(EDR / 端点检测响应类比)。
  • 代表:Forensic【2606.30566,行为不变量 AUC 0.99,跨模型泛化】。
  • 新颖性边界:新颖。把网络安全 EDR 范式引入 agent 记忆投毒检测,且签名是过决定性(overdetermined)、分布式的。

范式 J:终态评测 -> 过程级 / 因果评测(accuracy -> retrieval-vs-use)

  • 旧:只看最终答案对错。
  • 新:区分检索到达(R)与证据使用(U)、知识点级测量、受控单变量归因、人工裁决高影响结论。
  • 代表:MemDelta【2606.29914,嵌入混淆揭露】、MemTrace【2606.17328,R/U 分分】、Multi-factor value(盲 regime 方法论)、GovMem(人工裁决)。
  • 新颖性边界:新颖。评测方法论本身成为研究对象;核心论断是「检索 != 使用」——加更多记忆/检索不解决使用问题。

3. 解决思路(具体方法层面)

本节聚焦「怎么解决」(具体方法路径),范式层面的「转向了什么」见第 2 节,二者不重叠。

3.1 用 RL 把记忆训练成可优化对象

记忆从「人工设计 + 检索」转为「可被强化学习优化的策略」。

  • 信息增益奖励写入(InfoMem【2606.03329】):r_gain=log P(y*|x,M) - log P(y*|x),奖励「让答案似然提升」的写入,仅对成功轨迹应用。
  • 自监督记忆训练(MemTrain【2606.03197】):从记忆更新后的最终记忆重建掩码实体,端到端掩码重建 + GRPO 双代理任务。
  • hindsight 信用分配(HiMPO【2606.16285】):hindsight 相关性作有界回顾过滤器,当局部记忆效用不被目标结果支持时衰减记忆信用,减少 blame leakage。
  • 记忆感知 GRPO + 源索引信用路由(ECHO【2606.31650】、SWE-MeM【2606.28434】):把信用路由到支撑答案的证据轮次与记忆选择动作,解决上下文坍缩使 RL 失去信用路径。
  • 抽取策略可被 RL 优化(TMEM【2606.04536】):训练 theta0 不仅改任务动作,也改「用于在线 LoRA 适应的数据质量」。
  • 记忆开关对比 rollout(STR-GRPO,ATMem):z_i=1/0 启用/掩蔽记忆通道,对比估计记忆贡献,成本感知奖励抑制无益高成本记忆。

3.2 时序一致性与矛盾解决

  • 双时态数据模型(Bi-Temporal Engine【2606.09900】、TOKI):valid_at/invalid_at + supersedes 链,失效不删除、保留出处,使 lean 上下文反超全上下文(83.6% vs 73.2%)。
  • 写时并发控制(TOKI):把 4 个生产启发式类型化为双行 schema 上的双时序算子族,带隔离前提 + 出处注解 + 审计行。
  • 可信固化(TRUSTMEM【2606.25161】):WRITE/REVISE/PRUNE 动作 + 验证器评分(覆盖/保留/忠实度),转移级遗漏/破坏/幻觉分别减 40.1%/79.1%/50.0%。

3.3 成本、预算与上下文管理

  • 预算证据保留(EMBER【2606.05894】):摄入时写入逐字源摘录 + 检索键 + 更新元数据(insert/merge/overwrite/skip),查询后反馈训练写入器。
  • 确定性压缩(DMF【2606.03463】):完全确定性 Survival Score,零 LLM 评分,5-242x 更少 token 与 Mem0 同精度。
  • 压缩与可寻址证据的调和(ECHO):源索引让被压缩的轮次仍可寻址,调和「压缩省成本 vs 保留证据」。
  • 几 KB 学习遗忘(Learning What Not to Forget【2606.20954】):CPU-only、无语言模型评分器,匹配完整历史精度、峰值上下文减 52%。

3.4 选择性与门控

  • 选择性保留(Selective Memory Retention【2606.29178】、OSL-MR【2606.10616】):在预算约束下做保留/遗忘决策,干扰下保 97/100 任务。
  • 选择性参数固化(Selective Parametric Consolidation【2606.26806】):惊讶+效价门控决定何时把记忆写进参数,200 事件仅 2-3 次写。
  • 记忆动量触发器(Janus【2606.31121】):m_t=beta*m_{t-1}+(1-beta)*z_t 检测更新轨迹可疑偏差,决定接受/拒绝候选更新。
  • 反事实决策效用(Decision-Aware Memory Cards【2606.08151】):用「记忆是否改变决策」而非相似度排序,承重消融验证(移除 top 效用单元 F1 0.245->0.000)。

3.5 版本控制与事件溯源

记忆作为 append-only 不可变日志 + 确定性投影读模型,价值在可审计 / 可 diff / 可 merge / 可交接,而非检索。代表:GitOfThoughts【2606.14470】、PROJECTMEM【2606.12329】、ESAA【2606.23752】。

3.6 值得注意的负面 / 诊断思路(诚实结果)

  • GitOfThoughts【2606.14470】【负面】:对新问题记忆不提升精度(除非余弦相似度>0.8 近乎相同);4.5x 大模型仍无法从样例提取可复用方法——git 价值在可审计性而非检索。
  • Budget-Constrained Web Agents【2606.15017】【负面】:在 token 预算匹配下,技能/记忆模块的增益常消失,vanilla 基线常匹配或超越增强方法。
  • GovMem【2607.02579】【负面诊断】:真实高影响编码 agent 候选记忆无一可安全自动晋升;方法高度保守(0.692 审查负担)。
  • MemDelta【2606.29914】【负面】:智能体自记忆(42%)低于基础检索(47%)。

4. 解决技术(特别是新技术)

4.1 新出现的技术力量

  • 快权重 rollout 动力学(TMEM):单 episode 内在线 LoRA 更新 + SVD 子空间初始化,让 agent「从经验学习」而非仅「查阅」。
  • 激活导向记忆(NPM):把对比经验(成功/失败轨迹)蒸馏成激活空间的导向向量 h_l<-h_l+alpha*v_l(x),免训练即匹敌显式文本指令。
  • 双时序算子代数(TOKI):把数据库并发控制理论(Berenson/Adya 隔离层级)移植到 agent 记忆的矛盾解决。
  • 认证鲁棒性界 + 超几何证书(SMSR):把认证鲁棒性(certified robustness)从对抗样本领域引入记忆投毒,配 HMAC 出处签名。
  • HMAC-SHA256 出处签名(SMSR):写时密码学硬边界阻断未签名注入。
  • 行为不变量取证检测(Forensic):随机森林 19 轨迹特征 + recall-to-send 比,AUC 0.99,跨模型及前沿模型泛化,仅前缀即可实时拦截。
  • 信息溯源图删除级联(MemLeak):G_f=(V_f,E_f,delta) 分类记忆表示的删除可行性,全覆盖集 FCS(f) 度量删除完备性,内容感知语义删除。
  • 记忆动量触发器(Janus):更新特征的指数移动平均检测异常。
  • 源索引信用路由(ECHO):带记忆溯源的 GRPO 变体,credit 路由到证据轮次。
  • STR-GRPO 记忆开关对比(ATMem):记忆 on/off 对比 rollout + 成本感知奖励。
  • 证据胶囊 + 预算保留(EMBER):摄入时写入逐字源摘录 + 检索键 + 更新元数据(insert/merge/overwrite/skip),查询后反馈训练写入器。
  • 反事实动作偏移效用(Decision-Aware Memory Cards):用反事实决策变化而非相似度排序记忆,承重消融(移除 top 效用单元 F1 0.245->0.000)验证机制。
  • 注意力感知重要性(G-Long【2606.13115】):复用 T5 摘要器内在交叉注意力信号识别显著记忆,免额外模型。
  • 图记忆 + 主动重构(MRAgent):Cue-Tag-Content 图以关联标签作语义桥梁,pi(t) 迭代探索重构。
  • 多因子无梯度权重学习(Multi-factor value):CPU-only、无 API、神经网络与线性模型持平。
  • 知识原子(Doc-to-Atom):微 LoRA + 检索键 + 可选微 KV,多目标损失 L_route/L_irrel/L_protect/L_sparse。
  • 符号验证策略记忆(ISM【2606.31191】):符号工具检查中间步骤并认证答案,紧凑自精炼策略模式库,少 64-86% 模式反超基线。
  • 联合记忆与探索学习(2606.01528):用确定性代码覆盖率作免标注新颖性信号 r_t=1[C(t)>C(t-1)] 驱动探索。
  • Bayes 因子显著性检索(2606.02976):Sal_a=log p(a|q,c_i)-log p(a|q),并证明充分条件下与查询条件显著性排序等价(Theorem 3)。
  • 对比安全记忆(Membrane):CSM 细胞 m=(P,D,T),自演化对比记忆做越狱防御,F1=2(1-ASR)(1-FRR)。

4.2 成熟但被强化的技术

图/属性图记忆(REAL、G-Long、HyphaeDB、KG-Enhanced)、分层记忆(SaliMory、PersonaTree、HMARS、Organize-then-Retrieve)、原子事实(AtomMem、DELTAMEM 残差树)、双过程认知(Dual-Process【2606.09483】 System1/2)、Ebbinghaus 遗忘曲线(MASS、DMF)、LoRA 蒸馏(DuoMem 4B->77.9%)、多 agent 交易记忆(MATM【2606.19911】)、Mixture-of-Agents 推理记忆(ReM-MoA)。


5. 关键判断与警示

  1. 「检索 != 使用」是本期第一定律。 十余篇独立工作证明:给更多记忆/检索不解决使用问题;下一步应投资「证据使用」而非「存储/检索容量」。评测必须区分 R(检索到达)与 U(使用)。
  2. 记忆正在获得独立理论基础。 数据库理论(TOKI 写时并发控制)、认证鲁棒性(SMSR)、信息论/贝叶斯(Nous)、认知心理学(多因子价值)、复杂性理论(OSL-MR NP-hard)同时进入——它不再是 RAG 的附庸。
  3. 参数化记忆是真实趋势但需克制。 TMEM/Doc-to-Atom/NPM/Selective Parametric Consolidation 一致把记忆推进权重空间;但 GitOfThoughts 与 budget-constrained 研究警示:在 token/算力受限时记忆模块增益常消失,不要假设记忆总是划算。
  4. 安全是显学,攻防不对称。 写/检索越激进越易被投毒(From Untrusted Input);HMAC 出处 + 认证界(SMSR)与行为不变量取证(Forensic)是目前最有理论根底的防御;提示注入防御完全不覆盖记忆通道。
  5. 评测方法论本身在被重写。 MemDelta(嵌入混淆)、MemTrace(过程级/知识点)、Multi-factor value(盲 regime 测遗忘而非检索)、GovMem(人工裁决)共同要求:固定嵌入、按模型族分层、报告写入成本、人工验证高影响结论。
  6. 诚实负面结果增多是好信号。 GovMem(无一可自动晋升)、GitOfThoughts(记忆不助新问题)、MemDelta(自记忆<检索)、Supersede(给更多记忆无恢复)表明领域在成熟,不再只报增益。
  7. 多模态与跨智能体是新前线。 MemLeak(图像保留线索)、Memory Contagion(偏差跨时间传播)、MATM/HyphaeDB(跨 agent 经验共享)把记忆从单 agent 单模态文本推向多模态多主体。

6. 与既有子领域的关系

  • 与 RAG 的关系:Agent Memory 正在从 RAG 分化出来。RAG 假设静态语料 + 只读检索;Agent Memory 是写密集、跨会话、带固化/遗忘/矛盾解决/治理的活基底(TOKI、PROJECTMEM)。MemDelta 进一步证明许多「记忆增益」实为嵌入差异。
  • 与长上下文 / 注意力的关系:Memory-Managed Attention、ActiveMem、Segment Tree 把记忆与注意力压缩协同设计;核心张力是「压缩省成本 vs 保留可寻址证据」(ECHO 用源索引调和)。
  • 与 agent RL 的关系:记忆正成为 RL 的可优化对象——InfoMem(信息增益奖励)、MemTrain(自监督)、HiMPO(hindsight 信用)、ECHO/SWE-MeM/STR-GRPO(记忆感知 GRPO)、TMEM(抽取策略可被 RL 优化)。
  • 与工具智能体的关系:见 outputs/tool_agent_survey_2026-06.md。两桶重叠 85 篇已扣除;本桶聚焦「记忆」,工具桶聚焦「工具行为的度量/约束/验证」。共享主题:信用分配、长程可靠性、治理、过程级评测。
  • 与知识编辑的关系:Route-Specialized Dual Adapters【2606.14668】、Supersede 把知识编辑的 reliability-locality 平衡引入 agent 记忆更新。

附录:已联网交叉验证的 6 个新框架(2026-06 原创,0 引用)

  1. Nous 预测世界模型【2606.22030,已验证】S=-log2 P(obs|D)+闭式贝叶斯后验;遗忘=熵衰减。前身 BeliefMem【2605.05583】Noisy-OR。PyPI nous-state 实现确认。
  2. OSL-MR【2606.10616,已验证】Huawei Noah Ark;NP-hard 证明;首个形式化记忆保留决策问题。arXiv v4 确认。
  3. TOKI 双时序算子代数【2606.06240,已验证】Ziming Wang(HKUST);矛盾解决=写时并发控制;4 健全性定理+紧致性伴证明(键控日志必要);K-半环出处;参考实现 github.com/ZenAlexa/toki-bitemporal-memory;目标 PVLDB/VLDB 2027。
  4. SMSR 认证防御【2606.12703,已验证】Tarun Sharma;首个 MSMP 认证鲁棒界;HMAC-SHA256 出处+超几何证书(Theorem 2)+不可能结果+Consistent Minority Effect;参考实现 github.com/tarun-ks/smsr。
  5. TMEM 参数化记忆【2606.04536,已验证】Qwen-Character(阿里)+北大;快权重 rollout 动力学 pi_{theta0+Delta_t}+SVD LoRA 初始化;HuggingFace papers 页确认。
  6. 多因子认知价值函数【2606.12945,已验证】Zhibao Chen(华泰证券)/Qian Cheng;V(m)=Sum w_i f_i(m) 7 因子+无梯度权重学习+盲 regime 方法论;arXiv v2 确认。