论文链接:SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models 发表时间:2026年9月(arXiv:2609.05533;代码开源) 机构:华中科技大学 + 中关村学院 + 清华大学 + 面壁智能(Modelbest) + 北京大学 + 人大 Gaoling 学院 + BAAI(高校+企业合作) 领域标签:cs.RO / 具身智能 / VLA / 长时程记忆 / 部分可观性

一、论文背景

机器人离开桌面、进入长时程任务后,部分可观性(partial observability)成为绕不开的约束:下一步动作需要的信息可能只存在于几分钟前的观察里——被揭示后又被遮挡的物体、记忆中的计数、几分钟前看过的序列。而主流通用 VLA(π0、OpenVLA、GR00T 系)都只条件化在当前帧或亚秒级观察窗上——它们在架构上就不可能解这类任务,训练再好也没用。

为此出现的记忆机制分三大家族:检索库(从历史里检索相关帧)、学习型压缩(把历史压成 token/向量)、循环状态(RNN 式隐藏记忆)。三家的共同前提是一个假设:分钟级的历史太大,必须"先决定保留什么"。

这个假设在 2026 年已经失效——现代 VLM 主干原生支持数十万 token 的视频上下文,预训练里见过海量长视频。“记忆必须压缩"的前提塌了,但没人系统验证过拆掉记忆模块会怎样。本文就是这场系统性验证,结论是范式反转。

二、论文定位和关联工作

机制家族代表工作方式根本缺陷
检索库检索增强 VLA按相似度检索历史帧检索发生在决策前——不知道未来要什么,按当前相似度检索可能漏掉真正需要的证据
学习压缩token 压缩/摘要器学习把历史压成紧凑表示压缩器的取舍在训练时固定,与部署时的任务需求错配
循环状态记忆型 RNN 层递归更新隐藏记忆信息瓶颈 + 灾难性遗忘
原生视频上下文SimpleMemVLA不压缩、不检索,全量输入依赖主干的长视频能力与预训练分布契合

定位结论:本文不是"又一个记忆模块”,而是对记忆模块必要性的否定证明——在 VLM 主干足够强的前提下,三大家族的全部优势都可以被"直接看完整历史"替代并大幅超越。

三、问题定义

具体问题:长时程操作的策略需要在"不知道未来决策需要什么"的约束下利用分钟级历史——专门的记忆机制是否必要?如果直接给 VLA 完整视频历史会怎样?

抽象化:给定具备原生长视频处理能力的 VLM 主干 π 与流匹配动作头,构造从完整历史 H → 当前决策的映射,使得记忆信息的提交时刻从"训练/压缩时"推迟到"决策时(注意力选择)"。

形式化要点:

  • 历史 H = 带时间戳的帧序列,以主干预训练时的原生视频格式输入(零接口改造);
  • 历史到动作头的唯一通道:生成子任务时主干的隐藏状态;
  • 时延控制:连续决策共享历史前缀,动作执行期间预填充(prefill)共享部分。

四、问题解法

4.1 原生视频格式直通

不做任何自造的记忆接口——历史帧加明文时间戳,按主干预训练时习惯的视频格式组织输入。设计哲学:接口与预训练分布的契合本身就是性能来源——主干在预训练里学过"如何看长视频",自造接口反而制造分布偏移。

4.2 隐藏状态作为唯一记忆通道

子任务生成过程中,主干各层的隐藏状态被送入流匹配动作头。没有单独的"记忆读取器"——记忆利用完全发生在主干的注意力内部,动作头只是消费决策时刻已经整合好的表示。

4.3 流式预填充控制时延

分钟级历史意味着长前缀,朴素实现每步决策都重算全部前缀会慢到不可用。关键观察:相邻决策共享绝大部分历史——把共享前缀的 prefill 调度到上一步动作执行期间(机器人执行动作的几秒钟里 GPU 正好算下一个决策的前缀),推理时延接近单帧 VLA,且输出与全量重算严格一致。

4.4 因果干预验证"策略真的在读历史"

方法学上的亮点:证明记忆被真实利用,而非碰巧的成绩——

  • 遮蔽任务相关证据(把决定性信息出现的早期帧抹掉/篡改)→ 输出显著改变;
  • 遮蔽无关片段 → 输出不变;
  • 反事实替换历史(编辑早期帧内容)→ 策略无参数更新地适应新历史——视觉上下文学习(visual ICL)的直接证据。

五、评估指标与实验证据

记忆基准(四个,全部 SOTA):

基准SimpleMemVLA最强先前记忆 VLA说明
RoboMME(16 任务)88.3%43.4% 量级双臂记忆任务
MIKASA-Robo(5 任务)74.0%44.4%(+29.6pt)遮挡/部分可观
RMBench(9 任务跨法平均)SOTA—双臂 M(1)/M(n)
RoboMemArena(26 任务,>1000 步)SOTA(TSR/CSR)—超长时程

决定性的同栈对照(RoboMME):

变体成功率
原生视频上下文(SimpleMemVLA)88.3%
检索(同栈重建)31.5%
token 压缩(同栈重建)22.6%
循环状态(同栈重建)20.6%
真值感知上限(用 ground-truth 状态替代感知)84.1%

最后一行是全文最锋利的数字:给三大家族完美的感知输入,它们仍到不了原生上下文的水平——瓶颈不在"感知准不准",在"信息提交时机":检索/压缩/循环必须在需求出现前就承诺保留什么,承诺错了就永远丢失。

通用控制无损:LIBERO 97.5%(与最强反应式 VLA 持平——带全量历史不伤无记忆需求的任务);LIBERO-Plus 零样本 10,030 个扰动任务 78.4%。

指标如何证明论点:四个基准的一致性排除单基准过拟合;同栈对照把"主干更强"的解释锁死(同一主干同一训练配方,差距 3–4 倍);真值感知上限一行直接把机制归因钉在"提交时机"上;因果干预补上"成绩来自记忆利用"的因果证据链。

六、效果优势的根源解释

三大家族为什么集体失败:它们共享同一个隐含假设——历史信息必须在决策前完成"保留什么"的承诺。这个承诺发生在两个都错误的时刻:检索相似度在决策前计算(不知道即将需要什么)、压缩器取舍在训练时固定(不知道部署会遇到什么)、循环状态随时间遗忘(长时程下早于需求的信息已经衰减)。真值感知 84.1% 证明:即使感知完美,只要"提交时机早于需求时刻",信息照样丢。

原生上下文的机制本质:把记忆决策完全推迟到注意力时刻——每步决策时,主干可以在全部历史里按当前需求自由分配注意力,“记什么"由每个具体决策即时决定,不存在提前承诺。加上接口与预训练分布零偏移(时间戳视频正是主干见过的格式),长视频理解能力被完整继承。

通用任务无损的原因:反应式 VLA 的强项(短视距反应速度)没有被牺牲——流式 prefill 让时延接近单帧;无记忆需求的任务上,长历史只是无害的额外上下文。

反事实:给三大家族更强的检索器/压缩器——天花板仍受"提前承诺"限制(真值感知 84.1% 是其信息论上界附近);把历史换成自造格式——分布偏移损失主干的长视频先验;去掉时间戳——时序结构丢失,顺序依赖任务(计数/序列)崩溃(消融证实)。

七、必要知识反推

领域知识层:

  • VLA 的单帧条件化设定与部分可观性(POMDP)视角;
  • 三类记忆机制(检索/压缩/循环)的谱系与代表性工作;
  • RoboMME/MIKASA-Robo/RMBench/RoboMemArena 的记忆维度构型(计数/永久性/参照/模仿/遮挡/序列)。

方法论知识层:

  • 同栈重建对照:把每个 baseline 机制在同一主干+同一训练配线下重建——排除"主干差异"的混淆变量,这是归因实验的金标准;
  • 因果干预(遮蔽/反事实替换)作为"机制是否被真实使用"的检验协议;
  • 上界对照(真值感知)定位瓶颈类型的技巧。

工程知识层:

  • 流式推理的共享前缀 prefill 调度(决策间隔藏计算);
  • 原生格式对齐(时间戳视频)的接口设计哲学;
  • 长上下文 VLA 的训练配方(历史长度/帧序/时间戳消融)。

八、论文中可以提取的通用性灵感

  1. “提前承诺"是一切信息丢弃系统的共同病根

    • 核心思想:任何"先决定保留什么、后决定需要什么"的系统都有结构性信息损失;当载体容量足够时,推迟承诺到使用时刻是最优策略。
    • 推广场景:Agent 上下文管理(用户核心方向:上下文工程)——与其学"压缩什么”,不如选能装下全部历史的容器;会话记忆库设计、评测 harness 的观测传递。
  2. 接口契合预训练分布 = 免费性能

    • 核心思想:自造接口制造分布偏移;把新能力挂载在主干预训练时已有的原生格式上,长程先验被完整继承。
    • 推广场景:多模态 Agent 的输入表示选择、技能库与基座模型的原生工具格式对齐、RAG 的检索结果呈现格式。
  3. 同栈重建是机制归因的黄金标准

    • 核心思想:证明增益来自机制本身(而非更强的底座),必须在同一底座上重建全部对比机制。
    • 推广场景:SkillOpt 类技能增益的归因实验、harness 工程的消融规范(与本轮 Multi-Harness RL 一脉相承)、评测系统的公平性设计。
  4. “简单到不需要组件"是最强的消融

    • 核心思想:拆掉一个公认必要的组件并全面超越,是对该组件存在理由的否定证明——这类工作往往重新定义子领域的议程。
    • 推广场景:对领域内"必要模块"清单的定期审查(RAG 的重排序器、Agent 的规划模块、训练管线的过程奖励模型)。