论文链接:Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 发表时间:2026年9月(arXiv:2609.04131) 机构:南京理工大学 × 蚂蚁集团 × 新加坡国立大学 × 香港中文大学——产学研合作:高校(南理工/NUS/CUHK)负责机制设计与实验,蚂蚁集团提供工业场景与算力支持 领域标签:cs.CV / 流式视频理解 / 多模态大模型 / 记忆机制

一、论文背景

流式视频理解是什么:多模态大模型(MLLM)像看直播一样连续接收视频帧,必须在任意时刻回答用户提问,且有两个硬约束——严格因果性(不能偷看未来帧)与有界内存(历史不能无限囤积)。典型应用:持续监控、视频客服、具身智能体的实时感知。

为什么难:一小时视频按每秒一帧就是 3600 张图。模型不可能全部留在上下文里,历史必须被整理。

主流范式:store-and-retrieve(存取式):把历史压缩进外部记忆库(memory bank),问题来了再检索相关片段,作为额外视觉上下文塞回去。近年 FluxMem(CVPR 2026)、QueryStream(ICLR 2026)、OASIS 等都是这条路,且都搭在 Qwen2.5-VL 底座上。

存取式的天花板:检索到的历史证据永远只是外挂的临时上下文——

  1. 每次回答都要重新检索、重新携带(推理成本随问题数累积);
  2. 证据用完即弃,不会被沉淀为模型的"经验"——看过一百小时的模型,对这段历史的"理解"与刚看时无异;
  3. 上下文长度被检索结果的体积反复冲击,长程推理仍受制于窗口。

类比:开卷考试的学生,每次都翻书抄一遍相关段落——抄得再快,也从不把书读进脑子。LatentStream 要做的是让学生把书读进去:随问题到来,把相关证据内化成自己的理解(固定长度的潜记忆),越学越强而书包不变大。

二、论文定位和关联工作

谱系一:流式视频 MLLM 记忆机制

  • FluxMem(CVPR 2026):流式记忆的分层整理,但仍是"检索后作为上下文使用"。
  • QueryStream(ICLR 2026):查询引导的流式证据检索。
  • OASIS(CVPR 2026):流式记忆库组织。
  • 共同点:记忆在模型外,证据在上下文里。

谱系二:LLM 的潜在记忆

  • ICAE、AutoCompressor 等:把上下文压缩成 soft tokens。但面向离线文档,无流式因果约束、无持续演化机制。
  • 与同期 LatentPress(本文同日 HF 榜单)呼应:“内化式记忆"正在从文档域扩展到视频域,两个独立团队同周出现,说明该方向已到临界点。

谱系三:分层记忆的组织学启发

  • 人类记忆的短/中/长分层与巩固(consolidation)理论:本文的三级记忆库与 Jenks 自适应合并是其工程对应物。

定位对比表:

维度FluxMem / QueryStream / OASISLatentStream
记忆位置模型外记忆库模型内的 latent tokens
证据的最终去向作为上下文临时携带内化进固定长度潜记忆
范式store-and-retrieveretrieve-and-internalize
查询到来时检索→拼接上下文→推理检索→测试时优化内化→丢弃检索结果→推理
推理时上下文原始+检索证据(可变长)有界外部记忆+查询+潜记忆(固定长)

定位结论:本文不是又一个更好的记忆库,而是改变了证据的存在形态——从"上下文中的过客"变成"潜记忆中的居民”。

三、问题定义

具体问题:流式 MLLM 如何在因果+内存约束下,让历史证据持续指导当前推理?

核心洞察——“记住"与"带着"的区别:

存取式(带着)内化式(记住)
证据=上下文中的 token 序列证据=潜空间中的紧凑表示
每次推理重新携带一次内化,持续生效
上下文长度波动潜记忆长度固定
理解不随时间积累理解随每次查询渐进深化

形式化:给定连续视频流、固定 token 预算、任意时刻到来的查询 q_t:

  • 构造查询无关的三级分层记忆 ℳ = {ℳ^s, ℳ^m, ℳ^l}(短/中/长期);
  • 学习潜记忆 token(LMT)集合:每组 LMT 以逐组扩张的记忆感受野从 ℳ 对应层级检索证据并内化;
  • 优化目标:层级渐进置信奖励(基于组间预测熵)最大化;
  • 约束:Video-LLM 全程冻结;内化完成后检索到的视觉 token 从生成上下文移除——最终生成只依赖[有界外部记忆, 查询, 优化后的 LMT]。

抽象的精妙之处:把"记忆管理"从空间问题(怎么存得下)转化为时间问题(怎么随查询流持续精化)。潜记忆是活的——每个新查询都是一次"温故知新"的学习机会。

四、问题解法

4.1 Query-Agnostic 分层流记忆(先于查询建好)

类比:图书馆的三类书架——新书台(密集陈列)、常用区(按主题归并)、库存库(高密度压缩)。

  • 短期 ℳ^s:新帧密集保留(细节无损);
  • Jenks 自然断点引导的中期路由:溢出的短期证据按时间保持度分档迁入 ℳ^m——Jenks 算法(1971 年的统计方法)从时间/空间分数分布中找数据自身的断点,自适应决定"哪些片段值得保留时间结构”;
  • 长期 ℳ^l:更早的中期证据经更强的空间压缩归档。
  • 关键性质:这一切在查询到来前完成,是查询无关的历史基础——查询到来时不必从零整理。

4.2 分层潜记忆演化(核心创新)

类比:复习一门课——第一遍泛读全学期(大感受野),第二遍精读重点章(中感受野),第三遍只过错题(小感受野)——但顺序反过来:这里是由近及远逐层扩张。

  • LMT(Latent Memory Tokens)分组,各组绑定逐级扩张的记忆感受野;
  • 查询到来时,各组从各自感受野范围选择性检索历史证据(latent 引导的检索与注入,注入冻结的 Video-LLM);
  • 迭代进行:检索到的证据被 LMT 吸收内化,而非拼接在上下文里;
  • 结果:紧凑、固定长度、查询条件化的潜记忆。

4.3 渐进置信引导优化(怎么算"内化好了")

类比:检验是否真学会——看做题的犹豫程度。对答案越确定(熵越低),说明知识越扎实。

  • 估计各组 LMT 关联的预测不确定性(预测熵);
  • 构造层级渐进奖励:感受野越大的组(读了更多历史),应当表现出越高的置信度——“读书越多,越有底气"的单调性作为训练信号;
  • 测试时优化:在推理阶段联合精化 LMT 嵌入与检索到的视觉 token 嵌入(不动 Video-LLM 参数);
  • 优化完成后丢弃检索到的视觉 token,最终答案只从[有界外部记忆, 查询, 优化后 LMT]生成——上下文回到有界状态。

五、评估指标与实验证据

基准与指标

基准性质考察能力
OVO-Bench流式实时视觉感知、历史回溯检索、主动响应
StreamingBench流式实时视觉/全源/上下文理解
Video-MLE / VideoMME离线长短视频问答(短/中/长分档)
MLVU离线长视频多任务理解
LongVideoBench离线长视频上下文推理

核心结果

基准Qwen2.5-VL-7B 基线+ LatentStream提升
OVO-Bench—64.2%SOTA
StreamingBench—76.9%+3.0
VideoMME63.3%66.6%+3.3
MLVU67.9%74.0%+6.1
LongVideoBench60.7%62.1%+1.4
流式总评(3B)52.2%59.0%+6.8

对比方法覆盖 FluxMem、QueryStream、OASIS 等 2026 年最新流式记忆方法——训练无关与训练型全部超越,且 backbone(Qwen2.5-VL)完全冻结。

实验设计为什么能证明论点:论点是"内化优于外挂”。证明力:(1) 同一底座上与最新存取式方法正面对比且全面领先——排除"底座更强"的解释;(2) 流式+离线双设定一致提升——证明收益来自记忆机制而非某基准的分布特化;(3) 冻结 backbone——把改进完全归因于记忆模块,这正是"内化"主张的可控实验形态;(4) 3B 模型 +6.8 大于 7B 的增益幅度,说明小模型(容量受限、更依赖记忆效率)从内化中获益更多——与机制预测一致。

六、效果优势的根源解释

存取式为什么曾经有效:在"历史证据相对独立于当前问题"的场景下,检索-拼接的管道式处理简单可靠,且实现与 RAG 生态完全兼容。

根本局限的机制定位:存取式把证据当作一次性消耗品——

  1. 上下文经济学:每次查询重新支付"携带成本",且检索结果体积直接挤压推理空间;
  2. 无积累效应:证据不改变模型状态,第 N 次问同一历史与第 1 次成本相同——记忆没有复利;
  3. 注意力稀释:拼接的视觉证据与当前帧争夺注意力,证据越多稀释越重。

内化式的根本性改变——把"查询"变成"学习事件":

  1. 方法差异:检索结果不再进入生成上下文,而是成为测试时优化的训练信号——LMT 在每次查询中被梯度更新(Video-LLM 冻结,只有 LMT 嵌入变化)。
  2. 机制变化:(a) 信息从"上下文空间"(每 token 都占注意力)迁移到"参数空间"(固定数量的潜 token)——上下文回到有界稳态;(b) 渐进置信奖励强制"读过更多历史的组更自信",把记忆广度与推理可靠性耦合成单调训练目标;(c) 分层感受野让内化过程本身具有课程结构(由近及远)。
  3. 指标提升的因果链:测试时内化 → 查询相关证据固化进 LMT → 生成时上下文短而信息密度高 → 注意力不被长证据列表稀释 → 流式与离线基准全面上升(MLVU +6.1 为最大,因其多任务长程结构最吃"记住而非带着")。

反事实锁定:存取式对照(同检索、证据直接拼接)正是 FluxMem/QueryStream 系列——它们的分数(如 MLVU 67-69% vs 本文 74%)就是"同样的历史、不同的存在形态"的对照实验,反证内化机制本身的贡献。

七、必要知识反推

领域知识层:

  • 流式视频的因果性与内存约束(为什么不能离线全量处理);
  • 分层记忆与巩固理论(短中长期的信息保留梯度);
  • soft token / 潜空间表示的机制(LMT 如何被解码器"读作"记忆)。

方法论知识层:

  • 测试时优化(test-time optimization / TTT 谱系):把推理阶段当作学习机会——本文把这一思想第一次系统用于流式记忆;
  • 熵作为不确定性度量与置信奖励构造(RL/信息论的交叉);
  • Jenks 自然断点(1971 年的统计制图方法)在 2026 年被用作记忆路由——旧工具在新约束下的再发现。

工程知识层:

  • 流式推理基础设施(帧到达调度、预算控制);
  • 冻结 backbone 下的模块化训练(仅 LMT + 检索 token 可导);
  • 多基准评测协议(流式因果性保证、离线-流式双轨对比)。

知识融合的关键节点:核心融合是**“测试时训练”ד记忆巩固理论”**——作者意识到"用户查询"与"学习信号"可以是同一个东西:每次提问既是检索请求,也是一次让记忆巩固的机会。这一视角翻转直接生成了三个设计:检索→内化管道、渐进置信奖励(巩固深度的度量)、内化后丢弃检索证据(巩固完成的标志)。

八、论文中可以提取的通用性灵感

  1. “把交互当作学习事件”

    • 核心思想:系统与环境的每次交互(查询、反馈)都应留下内部状态的持久改变,而非仅产出一次性输出。
    • 论文证据:测试时 LMT 优化使流式总评 +6.8,且成本不随问题数累积。
    • 推广场景:代码评审系统(每次评审沉淀组织经验);客服机器人(每次对话微调记忆);个人知识管理(每次检索后笔记自动精化)。
  2. “内化优于外挂”

    • 核心思想:外部证据的成本随使用次数线性增长,内化后的知识成本固定——长期运行的系统应持续把外部信息转化为内部表示。
    • 论文证据:同一检索机制下,内化版全面超越拼接版(FluxMem/QueryStream 对照)。
    • 推广场景:RAG 系统的高频问答缓存策略;组织 SOP 从文档沉淀进培训;模型上下文管理。
  3. “置信度应与信息广度耦合”

    • 核心思想:读过更多证据的模块应当表现出更高确定性——把这种单调性做成训练信号,可防止"看得多但仍乱猜"。
    • 论文证据:层级渐进置信奖励(感受野扩张 ↔ 预测熵下降)。
    • 推广场景:多源事实核查系统;评审 Agent 的多轮取证;医疗诊断辅助的证据-置信一致性约束。
  4. “旧工具的新约束再发现”

    • 核心思想:经典方法(1971 年的 Jenks 断点)在新系统约束下(流式记忆路由)可能恰好是正确的简单解。
    • 论文证据:Jenks 引导的自适应合并优于固定阈值路由。
    • 推广场景:评测与数据分析中的经典统计工具复用;系统设计时先查"老问题字典"再发明新算法。
  5. “小模型从机制创新中获益更多”

    • 核心思想:容量受限的模型更依赖外部机制(记忆、检索、压缩)的效率,机制创新的收益与模型规模负相关。
    • 论文证据:3B 流式总评 +6.8 > 7B 的提升幅度。
    • 推广场景:端侧/低成本部署的优化优先级(机制>规模);模型选型时"小模型+好机制"路线的可行性论证。