Memory as Plans 精读:把记忆从执行期条件重构为规划期证据

题目:Memory as Plans: World-Action Modeling with Memory-Grounded Planning 链接:https://arxiv.org/abs/2609.11561 团队:哈尔滨工业大学(Sizhe Zhao, Weiyu Zhao, Chenchu Zhang, Chenyang Wang, Qinglin Liu, Shengping Zhang 等)+ 南洋理工(Haozhe Xie)+ 山东大学(Huan Wang) 数据日:2026-09-12(HF 日榜第 7 名,26 赞)

一、题目与背景

主流机器人操作策略采用马尔可夫假设:当前观测包含决策所需的全部信息,动作只依赖"现在"。但真实任务大量是非马尔可夫的——“把刚才桌上那个红色的杯子收起来"需要记住杯子在哪、“按完 A 再按 B"需要记住 A 做没做。当任务依赖几十秒前的视觉证据时,只看当前帧的策略必然失败。

现有记忆机制三类方案各有硬伤:语言摘要(把历史写成文字)紧凑但丢失细粒度视觉证据——物体颜色、位置、空间关系在文字化时被压掉;增长视觉窗口(保留全部历史帧)保真但推理成本随历史线性/平方增长,陷入"覆盖 vs 效率"权衡;两者混合则两头的缺点都沾。论文的关键洞察:这个权衡之所以存在,是因为所有方法都把记忆当作执行期的条件——执行器每一拍都要"背着"全部历史做决策。

二、研究定位

论文位于 VLA(Vision-Language-Action)策略与记忆建模的交叉带。前序脉络:π0.5(Physical Intelligence)、X-VLA 等通用 VLA 底座证明了大模型策略的泛化性,但记忆依赖任务上表现受限;Mem-0、WLA-0 等显式引入记忆模块,分别代表语言摘要与视觉窗口两条路线;DP(Diffusion Policy)类方法验证了扩散/流匹配动作生成在精细操作上的优势。MaP-WAM 的差异化定位:不发明新的记忆表示,而是改变记忆进入决策的位置——从执行期条件改为规划期证据。

三、问题定义

抽象问题:长时程任务中,历史信息 H、当前观测 O 与动作 A 之间的依赖结构如何组织,才能同时满足(1)记忆保真(H 中任务相关的细粒度视觉证据可被决策利用)与(2)执行效率(执行器计算量不随任务时长增长)?

形式化:给定多模态情景上下文(任务指令、已完成区段指令、稀疏视觉证据),求一个规划-执行分解:规划器 π_p 从情景记忆生成紧凑计划(语言计划 l_k + 视觉计划 G_k),执行器 π_e 只条件于计划与当前观测输出动作,使得执行器上下文长度与历史长度无关。

四、解法

MaP-WAM 的管线分三层:

1. 记忆表示——情景区段记录:记忆不是帧流也不是纯文字,而是"已完成的区段"序列:每个区段记录语言指令 + 8 帧稀疏视觉上下文(均匀重采样)。这天然可缓存:完成的区段成为静态前缀。

2. 记忆锚定规划(Memory-Grounded Planning):语言规划器从情景记忆预测下一个区段级的语言计划 l_k;**因果世界模型(CWM)**以 WAN-2.2-5B 为底座微调,条件于长期视觉上下文 G_<k、语言计划与全局指令,用流匹配目标生成视觉计划 G_k——“接下来这一段应该长什么样"的细粒度执行指引。CWM 采用块因果注意力掩码:已完成区段是可缓存静态前缀,未来不泄露。

3. 计划条件执行(World-Action-Progress 建模):执行器 WAP 把任务进度 p_t 作为一等模态与未来视觉动态、动作联合生成,并反馈为条件信号——不同于以往把进度当事后验证器或奖励的做法。计划-观测对齐模块检索视觉计划中靠近预测进度的帧、匹配当前观测、用最佳匹配状态校准进度,抑制长执行链上的误差累积。部署时固定计划前缀被缓存复用,直到预测进度触发下一次规划。

五、实验结果

项结果
RMBench 总成功率83.3%(SOTA),超 DP/π0.5/X-VLA/Mem-0/WLA-0
真机任务(50 试次/任务)78.0%
Swap T 与 Press Button(强记忆依赖)均达 96%,超所有基线
执行器推理延迟随任务历史增长近似恒定
消融去视觉记忆的当前观测条件世界模型生成计划时丢失物体身份/颜色/位置

实验设计的证明力:RMBench 按记忆复杂度分层(M(1) 需一次历史观测 / M(n) 需多次),Swap T 要求精确记住初始物体位置、Press Button 要求区分视觉相似但语义不同的状态——这两类任务直接检验"细粒度视觉证据是否被保留”,83.3% 与 96% 的分层结果把"记忆保真"从口号变成可测属性;延迟恒定则验证了架构层面的解耦主张。

六、知识反推

作者必须掌握:(1)VLA 策景与流匹配动作生成(WAN-2.2 视频底座的微调与块因果掩码设计);(2)记忆系统谱系的语言/视觉两路线及各自失效模式(否则提不出"位置改变"这一洞察);(3)视频世界模型的因果化改造(把生成式视频模型变成可缓存前缀的规划器);(4)进度建模的前序工作(作为事后验证器 vs 一等模态的差异)。

融合节点:把"世界模型生成未来"与"记忆提供过去"组合成同一个因果序列建模问题——视觉计划生成本质上是条件视频生成,记忆只是条件,这使得成熟视频底座可以直接迁移。

七、通用灵感

  1. 改变信息进入决策的位置比发明新的信息表示更根本(论文证据:同样的视觉记忆,作为执行期条件时引发覆盖-效率权衡,作为规划期证据后权衡消失)。推广:Agent 长上下文处理、代码评审系统的历史变更记忆、对话系统的会话记忆分层。
  2. 一等模态优于事后验证:进度从 verifier 升级为与动作联合生成的模态后解决了时间错位(论文证据:计划-执行自适应转换依赖进度反馈信号)。推广:任何"计划与执行状态漂移"的系统——多 Agent 编排、CI/CD 流水线、项目管理系统。
  3. 静态可缓存前缀是长时程系统的架构杠杆:块因果掩码让完成区段变成 KV 缓存友好的静态前缀(论文证据:执行延迟恒定)。推广:流式 Agent 的会话压缩、增量编译系统、检索系统的分层缓存。