论文链接:SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models 发表时间:2026年9月(arXiv:2609.05533;代码开源) 机构:华中科技大学 + 中关村学院 + 清华大学 + 面壁智能(Modelbest) + 北京大学 + 人大 Gaoling 学院 + BAAI(高校+企业合作) 领域标签:cs.RO / 具身智能 / VLA / 长时程记忆 / 部分可观性
一、论文背景
机器人离开桌面、进入长时程任务后,部分可观性(partial observability)成为绕不开的约束:下一步动作需要的信息可能只存在于几分钟前的观察里——被揭示后又被遮挡的物体、记忆中的计数、几分钟前看过的序列。而主流通用 VLA(π0、OpenVLA、GR00T 系)都只条件化在当前帧或亚秒级观察窗上——它们在架构上就不可能解这类任务,训练再好也没用。
为此出现的记忆机制分三大家族:检索库(从历史里检索相关帧)、学习型压缩(把历史压成 token/向量)、循环状态(RNN 式隐藏记忆)。三家的共同前提是一个假设:分钟级的历史太大,必须"先决定保留什么"。
这个假设在 2026 年已经失效——现代 VLM 主干原生支持数十万 token 的视频上下文,预训练里见过海量长视频。“记忆必须压缩"的前提塌了,但没人系统验证过拆掉记忆模块会怎样。本文就是这场系统性验证,结论是范式反转。
二、论文定位和关联工作
| 机制家族 | 代表 | 工作方式 | 根本缺陷 |
|---|---|---|---|
| 检索库 | 检索增强 VLA | 按相似度检索历史帧 | 检索发生在决策前——不知道未来要什么,按当前相似度检索可能漏掉真正需要的证据 |
| 学习压缩 | token 压缩/摘要器 | 学习把历史压成紧凑表示 | 压缩器的取舍在训练时固定,与部署时的任务需求错配 |
| 循环状态 | 记忆型 RNN 层 | 递归更新隐藏记忆 | 信息瓶颈 + 灾难性遗忘 |
| 原生视频上下文 | SimpleMemVLA | 不压缩、不检索,全量输入 | 依赖主干的长视频能力与预训练分布契合 |
定位结论:本文不是"又一个记忆模块”,而是对记忆模块必要性的否定证明——在 VLM 主干足够强的前提下,三大家族的全部优势都可以被"直接看完整历史"替代并大幅超越。
三、问题定义
具体问题:长时程操作的策略需要在"不知道未来决策需要什么"的约束下利用分钟级历史——专门的记忆机制是否必要?如果直接给 VLA 完整视频历史会怎样?
抽象化:给定具备原生长视频处理能力的 VLM 主干 π 与流匹配动作头,构造从完整历史 H → 当前决策的映射,使得记忆信息的提交时刻从"训练/压缩时"推迟到"决策时(注意力选择)"。
形式化要点:
- 历史 H = 带时间戳的帧序列,以主干预训练时的原生视频格式输入(零接口改造);
- 历史到动作头的唯一通道:生成子任务时主干的隐藏状态;
- 时延控制:连续决策共享历史前缀,动作执行期间预填充(prefill)共享部分。
四、问题解法
4.1 原生视频格式直通
不做任何自造的记忆接口——历史帧加明文时间戳,按主干预训练时习惯的视频格式组织输入。设计哲学:接口与预训练分布的契合本身就是性能来源——主干在预训练里学过"如何看长视频",自造接口反而制造分布偏移。
4.2 隐藏状态作为唯一记忆通道
子任务生成过程中,主干各层的隐藏状态被送入流匹配动作头。没有单独的"记忆读取器"——记忆利用完全发生在主干的注意力内部,动作头只是消费决策时刻已经整合好的表示。
4.3 流式预填充控制时延
分钟级历史意味着长前缀,朴素实现每步决策都重算全部前缀会慢到不可用。关键观察:相邻决策共享绝大部分历史——把共享前缀的 prefill 调度到上一步动作执行期间(机器人执行动作的几秒钟里 GPU 正好算下一个决策的前缀),推理时延接近单帧 VLA,且输出与全量重算严格一致。
4.4 因果干预验证"策略真的在读历史"
方法学上的亮点:证明记忆被真实利用,而非碰巧的成绩——
- 遮蔽任务相关证据(把决定性信息出现的早期帧抹掉/篡改)→ 输出显著改变;
- 遮蔽无关片段 → 输出不变;
- 反事实替换历史(编辑早期帧内容)→ 策略无参数更新地适应新历史——视觉上下文学习(visual ICL)的直接证据。
五、评估指标与实验证据
记忆基准(四个,全部 SOTA):
| 基准 | SimpleMemVLA | 最强先前记忆 VLA | 说明 |
|---|---|---|---|
| RoboMME(16 任务) | 88.3% | 43.4% 量级 | 双臂记忆任务 |
| MIKASA-Robo(5 任务) | 74.0% | 44.4%(+29.6pt) | 遮挡/部分可观 |
| RMBench(9 任务跨法平均) | SOTA | — | 双臂 M(1)/M(n) |
| RoboMemArena(26 任务,>1000 步) | SOTA(TSR/CSR) | — | 超长时程 |
决定性的同栈对照(RoboMME):
| 变体 | 成功率 |
|---|---|
| 原生视频上下文(SimpleMemVLA) | 88.3% |
| 检索(同栈重建) | 31.5% |
| token 压缩(同栈重建) | 22.6% |
| 循环状态(同栈重建) | 20.6% |
| 真值感知上限(用 ground-truth 状态替代感知) | 84.1% |
最后一行是全文最锋利的数字:给三大家族完美的感知输入,它们仍到不了原生上下文的水平——瓶颈不在"感知准不准",在"信息提交时机":检索/压缩/循环必须在需求出现前就承诺保留什么,承诺错了就永远丢失。
通用控制无损:LIBERO 97.5%(与最强反应式 VLA 持平——带全量历史不伤无记忆需求的任务);LIBERO-Plus 零样本 10,030 个扰动任务 78.4%。
指标如何证明论点:四个基准的一致性排除单基准过拟合;同栈对照把"主干更强"的解释锁死(同一主干同一训练配方,差距 3–4 倍);真值感知上限一行直接把机制归因钉在"提交时机"上;因果干预补上"成绩来自记忆利用"的因果证据链。
六、效果优势的根源解释
三大家族为什么集体失败:它们共享同一个隐含假设——历史信息必须在决策前完成"保留什么"的承诺。这个承诺发生在两个都错误的时刻:检索相似度在决策前计算(不知道即将需要什么)、压缩器取舍在训练时固定(不知道部署会遇到什么)、循环状态随时间遗忘(长时程下早于需求的信息已经衰减)。真值感知 84.1% 证明:即使感知完美,只要"提交时机早于需求时刻",信息照样丢。
原生上下文的机制本质:把记忆决策完全推迟到注意力时刻——每步决策时,主干可以在全部历史里按当前需求自由分配注意力,“记什么"由每个具体决策即时决定,不存在提前承诺。加上接口与预训练分布零偏移(时间戳视频正是主干见过的格式),长视频理解能力被完整继承。
通用任务无损的原因:反应式 VLA 的强项(短视距反应速度)没有被牺牲——流式 prefill 让时延接近单帧;无记忆需求的任务上,长历史只是无害的额外上下文。
反事实:给三大家族更强的检索器/压缩器——天花板仍受"提前承诺"限制(真值感知 84.1% 是其信息论上界附近);把历史换成自造格式——分布偏移损失主干的长视频先验;去掉时间戳——时序结构丢失,顺序依赖任务(计数/序列)崩溃(消融证实)。
七、必要知识反推
领域知识层:
- VLA 的单帧条件化设定与部分可观性(POMDP)视角;
- 三类记忆机制(检索/压缩/循环)的谱系与代表性工作;
- RoboMME/MIKASA-Robo/RMBench/RoboMemArena 的记忆维度构型(计数/永久性/参照/模仿/遮挡/序列)。
方法论知识层:
- 同栈重建对照:把每个 baseline 机制在同一主干+同一训练配线下重建——排除"主干差异"的混淆变量,这是归因实验的金标准;
- 因果干预(遮蔽/反事实替换)作为"机制是否被真实使用"的检验协议;
- 上界对照(真值感知)定位瓶颈类型的技巧。
工程知识层:
- 流式推理的共享前缀 prefill 调度(决策间隔藏计算);
- 原生格式对齐(时间戳视频)的接口设计哲学;
- 长上下文 VLA 的训练配方(历史长度/帧序/时间戳消融)。
八、论文中可以提取的通用性灵感
“提前承诺"是一切信息丢弃系统的共同病根
- 核心思想:任何"先决定保留什么、后决定需要什么"的系统都有结构性信息损失;当载体容量足够时,推迟承诺到使用时刻是最优策略。
- 推广场景:Agent 上下文管理(用户核心方向:上下文工程)——与其学"压缩什么”,不如选能装下全部历史的容器;会话记忆库设计、评测 harness 的观测传递。
接口契合预训练分布 = 免费性能
- 核心思想:自造接口制造分布偏移;把新能力挂载在主干预训练时已有的原生格式上,长程先验被完整继承。
- 推广场景:多模态 Agent 的输入表示选择、技能库与基座模型的原生工具格式对齐、RAG 的检索结果呈现格式。
同栈重建是机制归因的黄金标准
- 核心思想:证明增益来自机制本身(而非更强的底座),必须在同一底座上重建全部对比机制。
- 推广场景:SkillOpt 类技能增益的归因实验、harness 工程的消融规范(与本轮 Multi-Harness RL 一脉相承)、评测系统的公平性设计。
“简单到不需要组件"是最强的消融
- 核心思想:拆掉一个公认必要的组件并全面超越,是对该组件存在理由的否定证明——这类工作往往重新定义子领域的议程。
- 推广场景:对领域内"必要模块"清单的定期审查(RAG 的重排序器、Agent 的规划模块、训练管线的过程奖励模型)。