论文链接:MobileMem: Learning from a Year of Mobile Experiences 代码仓库:github.com/zjunlp/MobileMem 发表时间:2026年8月11日 机构:OPPO + OpenKG(浙江大学Ningyu Zhang团队主导;企业+高校合作——企业提供移动场景需求与产品视角,高校提供知识工程方法论) 领域标签:cs.AI / Agent记忆与个性化
一、论文背景
从问答系统到持久智能。AI Agent正从"回答孤立问题"走向"持续陪伴的个人助手"——AI手机、AR眼镜、个人副驾驶、车载助手。这类智能的定义不再只是"知道什么",而是**“记住什么、从经验学到什么、如何随用户演化”**。长期记忆成为个人AI的基础能力。
现有基准与移动场景的四重错配。论文识别出移动场景的本质特征:(1)异构——聊天记录、照片、截图、购物信息跨App分布;(2)多模态——事件以视觉/文本/行为多形态存在;(3)演化——用户偏好与生活状态随时间变化,记忆需要更新;(4)深度个人——问题依赖个体历史的细粒度细节。现有记忆基准(LoCoMo、LongMemEval等)多基于合成对话或单一模态,无法反映这四重复杂性。
端侧的独立命题。移动设备是下一代Agent的主战场,但端侧记忆不能假设无限存储、云端计算与集中数据库——记忆构造的token成本、延迟都是硬约束。
二、论文定位和关联工作
记忆基准线:LoCoMo(长对话)、LongMemEval(长期记忆五能力)等——多轮对话形态。MobileMem以移动App使用轨迹为 grounding,时间跨度年尺度。
记忆系统线:Mem0(事实抽取+覆写)、MemOS/EverMemOS(记忆操作系统)、A-MEM(原子记忆+元数据)、HippoRAG2(实体图+个性化PageRank)、LangMem(LangChain记忆)——本文首次在统一移动场景下对比它们的端到端表现与token成本。
| 维度 | LoCoMo/LongMemEval | MobileMem |
|---|---|---|
| 数据形态 | 对话记录 | 用户-App会话轨迹(年尺度) |
| 构造方式 | 人工/简单合成 | 知识引导合成(用户先验→KEME→事件模拟) |
| 问题类型 | 检索/推理为主 | +知识更新+隐式偏好+对抗问题 |
| 成本度量 | 无 | 记忆构造的输入/输出token |
| 多模态 | 无/有限 | MobileMem-Omni全模态 |
三、问题定义
抽象问题:当记忆的原料是"一个人一年的数字生活流"而非受控对话时,现有记忆构建-检索机制在保真、时效、成本三轴上的真实边界在哪里?
形式化为:给定用户年度轨迹 $\{T_1,...,T_n\}$(App会话流),记忆系统 $M$ 构造记忆表示 $M(\{T_i\})$,回答问题集 $Q$(单跳/多跳/时序/关系/摘要/对抗/偏好七类)。评测三个轴:任务性能(LLM-as-judge)、构造成本(输入/输出token)、失效模式(错误归因)。
精妙之处:知识引导的合成保证了轨迹的"人格一致性"与"时间一致性"——从用户先验知识(人口画像、生活模式、偏好)出发生成事件序列,使"跨月偏好演变"“多App事件关联"等真实结构可控出现,这比爬取真实数据(隐私不可行)或无约束合成(人格漂移)都更贴近真实。
四、问题解法
三阶段管线:(1)用户先验知识构建——人口属性、生活模式、长期偏好、社交关系形成结构化画像;(2)KEME(知识引导经验合成)——按画像生成时间一致的App会话轨迹(跨App事件关联、偏好演变弧、重复行为模式);(3)事件模拟与QA合成——从轨迹生成七类问题(多跳需跨App证据链、时序需排序事件、知识更新需检测新旧覆写、对抗问题故意不可答)。
移动记忆层:定义端侧记忆系统的操作面(构造/更新/检索)与成本模型。
双骨干评测:GPT-4.1-mini与GPT-5.4-mini(1M vs 400k窗口)×八个记忆系统(Long Context 128k、NaiveRAG、HippoRAG2、LangMem、A-MEM、Mem0、Mem0g、MemOS、EverMemOS),Qwen3.5-397B-A17B做判官。
类比:这像给记忆系统做"年度体检”——不是考单道题(现有基准),而是给系统一整年的生活流水,看它年末能不能回答"我三月换工作前常去哪家健身房"“我对某餐厅的评价变过几次"这类需要时间线+多源关联的问题。
五、评估指标与实验证据
指标体系:任务性能(七类问题+总体,LLM判官0-100);token成本(构造期输入/输出);错误归因(MemTrace+人工修正)。
核心数据表(GPT-5.4-mini骨干):
| 实验 | 关键数字 | 含义 |
|---|---|---|
| 总体排名 | HippoRAG2 80.06 > A-MEM 78.39 > MemOS 74.00 > EverMemOS 61.18 > Long Context 45.19 > Mem0 42.61 > LangMem 30.33 | 保真派碾压压缩派 |
| 保真机制 | A-MEM/HippoRAG2保留原始对话信息+元数据/实体图增强检索 | 高分根源 |
| 压缩代价 | Mem0事实抽取聚焦用户消息,系统性遗漏App/助手侧关键事实 | 低分根源 |
| Long Context悖论 | GPT-4.1-mini(1M窗)54.51 > GPT-5.4-mini(400k窗)45.19 | 窗口更大反而更好(5.4-mini窗口小) |
| 任务难度阶梯 | 单跳>多跳>摘要(证据需求递增);时序推理全面薄弱 | 记忆机制不保时间依赖 |
| 对抗悖论 | LangMem总体最差却在对抗问题上最佳;强记忆系统检索弱相关强干扰记忆→过度自信 | 记忆强度与抗干扰负相关 |
| 成本 | A-MEM最高11170 token/轨迹(5.4-mini下翻倍——关键词提取更多);EverMemOS 11184 | 保真的代价 |
| 失效模式 | Long Context 13/20为记忆更新错误;NaiveRAG 12/20为目标证据未检索;Mem0多为事实抽取失败 | 各系统死法不同 |
| Omni多模态 | 视觉类问题所有系统均弱(最佳仅15-16分档) | 多模态记忆是空白 |
实验设计为何有证明力:双骨干设计分离"记忆系统效应"与"模型效应”(Long Context的翻转证明窗口大小的影响);对抗问题作为"压力测试"暴露检索-置信度耦合(强检索诱导过度自信——与RAG中已知的风险一致);成本与性能并列报告(避免只看分数不看代价);错误归因用MemTrace自动+人工修正(方法透明)。
六、效果优势的根源解释
为什么保真派(A-MEM/HippoRAG2)碾压压缩派(Mem0/LangMem)。移动轨迹的本质是异构细粒度细节流——问题的答案常是"某次购物车里的具体商品"“某条聊天里的具体措辞”。压缩策略(事实抽取、摘要、覆写)在构造时不知道哪些细节日后会被问到,抽取必然丢失长尾细节;A-MEM/HippoRAG2保留原始会话并以元数据/实体图增强检索而非压缩存储——细节在需要时可达。这与"宁可存原始数据也不要提前聚合"的数据仓库原则同源。
为什么时序推理全面失守。Mem0类系统按事实条目存储,事件间的时序关系(先于/期间/重复模式)不是显式结构;A-MEM的元数据含时间戳但检索按语义相似度——时序问题需要的是时间轴上的排序与区间推理,语义检索提供不了。HippoRAG2相对最好(实体图天然保留部分时间边),但仍不充分。这是记忆表示的结构性缺口而非调参问题。
为什么记忆越强对抗越差。对抗问题(如"我上周说过喜欢X吗"——实际没说过)的正确答案是"没有"。强检索系统总能找到"语义相近"的记忆(用户确实讨论过类似话题),这些弱相关但高干扰的证据使LLM过度自信地回答"说过";弱检索系统反而检索不到干扰项,靠参数知识回答"不确定"。机制根源:检索质量与证据判别力的失衡——系统优化"找到相关的"而不优化"判断证据是否充分"。这与RAG领域"检索增强幻觉"现象呼应。
为什么Long Context在更强模型上更差。GPT-5.4-mini窗口(400k)小于GPT-4.1-mini(1M),年度轨迹溢出窗口导致截断——被截断的早期信息在提问时不可见。这暴露Long Context路线的窗口军备竞赛本质:记忆需求随时间线性增长而窗口固定,Long Context不是记忆方案而是缓存方案。
七、必要知识反推
领域知识层:记忆系统架构谱系(抽取式/图谱式/操作系统式/上下文式——不熟悉各自的构造/检索机制就无法解释性能分化);移动端约束(延迟/存储/隐私对记忆设计的限制);个性化Agent的交互形态(用户-App会话的结构)。
方法论知识层:知识引导的数据合成(保证人格与时间一致性的控制变量——这是基准效度的根基);LLM-as-judge的校准(与人类评估80.7%一致性验证);错误归因框架(MemTrace的应用与人工修正);对抗样本构造(不可答问题的设计原理)。
工程知识层:token成本核算(构造期输入/输出分别统计);八系统集成(各系统的嵌入模型/检索器/重排器配置对齐——Qwen3-Embedding-4B统一);多模态数据管线(Omni版的截图/照片处理)。
知识融合的关键节点:最关键的融合是把知识图谱工程(先验知识结构化→约束生成)用于合成数据质控——以往合成数据的失效模式是"人格漂移与时间错乱",用结构化先验作为生成约束解决了这个问题。其次是把数据库评测的成本-性能权衡视角(不只有accuracy还有$)引入记忆系统对比,使"保真的代价"(A-MEM 11170 token)可见。
八、论文中可以提取的通用性灵感
灵感1:宁可保真存储+智能检索,不要提前压缩——未来需求不可预知。压缩派全面落败的根源是构造时的信息损失。论文证据:A-MEM/HippoRAG2领先Mem0约36-38分。推广场景:数据仓库(原始层+聚合层分离);日志系统(全量存储+索引查询);个人笔记(原文摘录优于纯摘要);法务存档(原件优先原则)。
灵感2:时间维度需要原生结构而非事后检索。时序推理全面薄弱。论文证据:所有系统时序类得分显著低于单跳。推广场景:数据库设计(时间序列类型vs时间戳字段);项目管理(甘特图vs任务列表);病历系统(病程时间线);新闻存档(事件演化链)。
灵感3:检索能力必须与证据判别力配套,否则检索越强越自信错。对抗问题悖论。论文证据:LangMem最差却对抗最佳。推广场景:搜索引擎(权威性权重);司法证据(关联性vs充分性区分);专家系统(知识边界意识);面试评估(区分"听说过"与"深入了解")。
灵感4:缓存不是记忆——线性增长的记忆需求与固定窗口的结构性矛盾。Long Context在长轨迹上的失效。论文证据:1M窗口优于400k窗口的悖论反转。推广场景:工作记忆与笔记系统的分工;CPU缓存层次vs磁盘;组织知识管理(人走茶凉的对策);版本历史(分支策略vs全量快照)。
灵感5:评测基准应内建"成本轴"——性能分数脱离代价无意义。A-MEM高分伴随11170 token成本。论文证据:成本列与性能列并列。推广场景:模型选型(延迟/价格/质量三角);云服务选型(性能vs账单);招聘(薪资期望与产出);开源决策(维护成本vs许可证收益)。