论文链接:Alaya-EVOKE: From Linear-Scaling Supervision to Endless World 代码仓库:SII-YuanyangYin/Evoke 发表时间:2026年8月 机构:中国科学技术大学(USTC)、上海创新研究院、Alaya Lab 领域标签:cs.CV / 交互式世界模型 / 视频生成

一、论文背景

想象你在玩一款开放世界游戏:你可以随时回头看清刚才走过的路,按一个按键立刻有响应,而且这个游戏可以无限玩下去不用重开。把这套体验交给 AI 来"脑内模拟"——也就是交互式世界模型(interactive world model)——正是这篇论文的战场。世界模型接收你的操作(比如相机轨迹、文字指令),逐段生成后续画面,相当于一个"用视频思考的模拟器"。

要支撑这种体验,模型必须同时满足三个条件,而坏消息是它们互相打架:

  1. 持久记忆:你离开一个房间再回来,房间应该还是原样。传统做法是把历史帧塞进模型的上下文(context)或 KV cache 里。可历史越长,每一步生成的计算开销就越大——就像开会时每个人都把之前所有会议记录念一遍再说新内容,会越开越长。于是只能"窗口化",把老帧丢掉,等于用遗忘换速度。
  2. 低延迟交互:你按下按键,画面要立刻响应。这要求模型每段视频只跑极少的推理步数(few-step generation),而少步模型通常是从一个慢但强的"教师"蒸馏出来的——学生的天花板就是教师。
  3. 开放式长时生成:会话可以无限延续。但 rollout 可能超出训练时见过的位置范围,上下文无限膨胀,误差还会逐段累积。

更隐蔽的敌人是内容漂移(content drift):场景身份、物体外观、空间布局在几十秒的尺度上缓慢走样,而每一段单独看都很正常——只有把相距很远的两个时刻摆在一起对比才能发现。这和"越跑越糊"的退化漂移不同,后者在短窗口内就能检测到。对付内容漂移,靠强化局部稳定性是没用的,因为问题根本不出在局部。

论文的核心判断是:这是一个系统级问题,光堆模型规模解决不了。于是有了 Evoke。

二、论文定位和关联工作

论文把前人工作梳理成三条线,Evoke 站在后两条的交汇点上:

线一:历史留在去噪器内部。 Diffusion Forcing、Hunyuan-GameCraft 等把上下文帧或扩张 KV cache 当记忆;Self-Forcing++、Rolling Forcing、Relic 等用窗口化、缓存淘汰或检索来控制成本;Genie 3、Matrix-Game 2.0、LongLive、SkyReels-V2 等显著延长了生成视野。共同局限:记忆驻留在模型内部,成本随会话时长增长,“记得多"与"跑得久"仍是权衡关系。

线二:几何外部化。 Warp-as-History、Gen3C、Lyra 2.0 等把已生成的观测提升为场景几何表示(NeRF、3D Gaussian Splatting 或单目深度),需要时渲染到目标视角作为像素条件送回生成器。底层依赖 Depth Anything 3、VGGT 等前馈几何估计。与本论文的关系:Evoke 继承了 warp 条件生成的思路,但把几何放进一个有有界读/写/淘汰的显式外部库,成为完整的记忆系统而非一次性技巧。

线三:少步蒸馏。 Progressive Distillation、LCM、Consistency Models 压缩采样步数;DMD/DMD2 用分布匹配目标做蒸馏;Self-Forcing、Causal Forcing 研究双向教师与因果学生的错配。共同盲点:教师被当成固定的"高质量答案来源”,没人问"教师的视野够不够长"。Evoke 恰恰把教师本身当作设计变量。

维度之前的路线Evoke 的突破
持久记忆存在去噪器上下文/KV cache,成本随时长增长外部化为相机位姿索引的世界状态库,上下文有界
教师角色固定的高质量生成器显式重设计的长视野监督者(监督视野是设计变量)
学生能力上限被教师的时域视野卡死30 秒长视野蒸馏,学生继承抗漂移能力

三、问题定义

论文把"开放式世界生成"抽象为一个有界循环过程。每个循环步 k 只做三件事:

  • r_k = Read(M_k, P_k):按当前相机位姿 P_k 从世界状态库 M_k 里读出视图相关的信息;
  • x_k ~ p_θ(·|r_k, h_k, c_k):在读取结果、有界局部历史 h_k、可变文本条件 c_k 下生成一个 chunk;
  • M_{k+1} = Write(M_k, x_k, P_k):把新 chunk 的几何写回状态库。

关键洞察在于:持久状态通过相机位姿(空间)而非时间位置(时间轴)访问。每个 chunk 固定含 9 个 latent 帧(36 像素帧、24fps 下 1.5 秒),每次调用复用相同的局部位置布局——会话变长只是循环次数变多,任何单次调用的上下文和位置范围都不变。这就把"无限时长"转化为"有限步骤的无限循环",从问题结构上消解了三大需求的冲突。

同时论文区分了两种失败模式并分别派兵:空间重访不一致交给世界状态库(几何问题用几何解),时间内容漂移交给长视野教师监督(时间问题用监督视野解)——二者不可互相替代。

四、问题解法

Evoke 的解法由三个机制组成,环环相扣。

4.1 机制一:外部世界状态库——记忆不放在脑子里

类比:你逛博物馆不需要把每个展厅都背下来,只需要拍照片并记下拍摄位置;旧地重游时翻出那個位置的照片对照即可。

写入:单目深度模型 Depth Anything 3 为每个生成 chunk 的 12 帧估计深度,结合已知相机内外参把深度图反投影(unproject)成 3D 点,追加到状态库。不同 chunk 的几何独立插入,避免跨长序列深度融合带来的尺度漂移。

读取:当前相机位姿直接决定哪些已存几何相关——已存源视图按与目标视图的共视性(co-visibility)排序,选出最多 8 个足够不同的源视图,用批量投影加 z-buffering 渲染出视图对齐的 warp 观测和逐像素可见性掩码。注意这是由相机几何直接决定的检索,不靠学习,天然适合空间重访。

注入与预算:可见性低于 0.5 的像素赋纯噪声 σ=1(完全不贡献信息),受支持区域用轻噪声;学生去噪器只保留最近 19 个 latent 帧(约 3.2 秒)作局部历史,分长/中/短三层(16/2/1 帧)。小时级配置下状态库保留 2160 像素帧(90 秒几何),活跃源池至多 720 帧——保证的是保留范围内的持久回忆,而非永久记忆一切。

4.2 机制二:长视野交互教师——把教师当设计变量

基座是 14B 的 Wan2.2 A14B 扩散 Transformer。要让教师能对 30 秒的序列联合打分,标准注意力的二次复杂度扛不住,于是设计了 chunk 级稀疏注意力(序列按 9 个 latent 帧分 chunk),每个查询 chunk 只访问:首帧全局 sink、带一帧重叠的局部上下文、空间压缩的邻近帧、少量选定的远距帧、以及经线性注意力累积的全局状态。这样内存和计算随序列长度近似线性增长,对完整长窗口打分变得可行。

教师还支持逐 chunk 条件:训练字幕按 12 秒间隔切分并映射到对应 chunk,单条序列内可表达提示词切换——既对齐学生的部署行为,也缓解了双向教师与因果学生的错配。教师与 DMD 的 critic 共享同一主干(LoRA adapter 切换),保证分数在同一专家内可比。

4.3 机制三:30 秒 DMD 蒸馏——把长视野能力搬进三步学生

学生基于 Helios,采用 DMD 分布匹配蒸馏。最巧的设计是 rollout 构造:1 个真值前缀 chunk + 自强化(self-forced)rollout 的 20 个生成 chunk,共 189 个 latent 帧(753 像素帧 ≈ 31.4 秒);教师+critic 对全部 189 帧联合打分,监督视野覆盖完整 rollout。学生每 chunk 3 次前向,构造一条 rollout 需 60 次学生前向。

两个关键细节:

  • 监督视野 ≠ 梯度视野:相邻 rollout chunk 间历史 detach,反向传播只在单 chunk 内进行——长监督信号不必付出全轨迹反传的内存代价;
  • 掩码排除真值前缀和第一个生成 chunk:教师把首 chunk 当"图像首帧"处理而学生做的是"视频续接",直接匹配会引入边界闪烁。

推理时学生走三步、无 CFG 的粗到细 latent 金字塔(12×20、24×40、48×80 各一次求值),几何条件只注入最粗阶段(先定大结构),可见性剪枝移除不受支持的几何 token。由此还解锁了"召唤(Evocation)“能力:中途用文字引入火球、热气球、烟花,之后再撤回,而城堡、丛林、龙始终保持一致。

五、评估指标与实验证据

主战场:WBench 导航拆分(n=158)。WBench 评测"世界是否像世界”:Video Quality 组看美学/成像/闪烁/动态等;Setting 组看场景与主体的指令遵循;Physical 组看因果保真度(Causal Fidelity)与视觉合理性;Consistency 组看重访、视角等一致性。Evoke 在 Quality(82.79)、Setting(83.76)、Physical(72.06)三组均值全部第一,Consistency(86.87)与最强者持平。对比对象包括 Yume 1.5、Matrix-Game 2.0、Genie 3、LingBot-World v2 fast 等——最大的增益恰恰出现在 Scene 74.68 与 Causal Fidelity 82.44 这类"持久场景状态 + 长程生成"指标上,与论文主张精确对应。Navigation(78.63)与 Perspective(69.74)偏弱,作者坦承是当前相机控制路径的局限。

公共排行榜:VBench-2.0 总分 66.77,排名 1/10,超过 Veo 3 的 66.72;VBench-Long 85.11 排 7/10。值得注意的是 Evoke 只用 3 步无 CFG,对手都是各自多步采样器——非步数对等的比较,少步还能登榜本身就是蒸馏有效性的证据。论文还诚实列出协议偏离(每提示 1 样本、5.875s 片段等)并估计了偏向。

长会话稳定性:8 个 65.5 分钟连续 rollout(每个 2,619 循环步、94,281 帧),光度统计稳定,场景身份描述子余弦 0.523——恰等于真实素材相隔 60 秒自评的水平。

效率:单张 H200、384×640 下,每个 1.5 秒 chunk 扩散墙钟 2.11 秒(未用 KV cache/编译/量化等加速)——接近实时、单步成本有界。

消融一(教师视野):两个学生用完全相同的蒸馏配方、仅教师时域视野不同——短视野学生亮度最终稳定在开场值的 74%(越来越暗),长视野学生 101%;8 个 clip 中 7 个改善(Wilcoxon p=0.016)。锐度则完全不区分——论文严谨地把收益限定为"曝光稳定性"而非全面画质。

消融二(几何召回):重访 PSNR 实验中,保留窗 ≥ 离开时长时比较短保留窗高 2.3–3.2 dB,21 次对照中 20 次遵循预测转变;仅保留 1.5 秒几何在返回时覆盖率损失 0.173 且对新视图毫无收益。平台值 15.4–17.8 dB,说明是"可辨认"而非"像素级忠实"的重建——如实界定了当前记忆的能力边界。

消融三(定时文本控制):48 个调度实验显示,未锚定子句(在自由空间请求新内容)实现率 67%(天花板 83%),锚定子句(要覆写已被几何支持的内容)仅 4%(地板 17%)——揭示了"文本管演化中的内容、持久几何抵抗覆写已锚定观测"的分工。

六、效果优势的根源解释(因果链)

Evoke 的成绩不是组件堆砌的巧合,每条优势都能追溯到问题结构层面的改变。

因果链一:为什么能开放式生成(对手不能)? Baseline 把记忆放在去噪器上下文/KV cache → 计算成本随会话时长二次或线性增长 → 只能窗口化丢弃历史 → 会话长度与记忆量成为零和权衡,且 rollout 越长误差累积越多。Evoke 把几何外部化到相机索引的状态库 → 每次调用的读取量由共视性检索(≤8 源视图)决定、写入量固定(12 帧深度)→ 去噪器上下文与会话时长彻底解耦 → 单步成本恒定(2.11 秒/chunk),65 分钟 rollout 依然稳定。反事实验证:消融二显示保留窗短于离开时长时,回忆退化到远位姿地板水平——没有外部记忆,开放式重访一致性在结构上就不可能。

因果链二:为什么 Physical/Causal Fidelity 领先(LingBot v2 约 +3 分、大幅领先其他对手)? 不是"生成了更漂亮的画面",而是长视野监督改变了训练信号的覆盖范围:短视野教师只能在局部窗口内判断合理性 → 内容漂移在局部窗口内"看起来没问题",教师根本看不见 → 学生继承了这个盲区。30 秒联合打分的教师 → 相距很远的帧进入同一个打分范围 → 漂移第一次暴露在梯度里 → 学生学到跨长时程的分布约束。消融一的 74% vs 101%(p=0.016)就是这条链的直接验证。而 WBench 中增益最大的恰是 Scene 与 Causal Fidelity 这类长程指标——因果链闭环。

因果链三:为什么少步学生不输多步大模型(VBench-2.0 超 Veo 3)? 传统蒸馏中教师是黑盒答案源 → 学生的条件控制与长程一致性都被教师视野隐性封顶。Evoke 把教师当设计变量:监督视野(30 秒)+ 条件调度(逐 chunk 文本)两个轴显式重设计 → 逐 chunk 条件对齐学生部署时的因果推理方式,减少双向-因果错配 → 蒸馏传递的不只是画质,还有"抗漂移 + 中途改指令"的能力。三步无 CFG 仍能登榜,说明上限确实被抬高了。

诚实的边界:论文自己证明了教师可检测性在窗口超过 2 chunks 后无一致尖锐阈值、长/短教师在中途实现率上不显著区分——即长视野收益应归因于完整训练后的监督过程整体,而非某个魔法窗口值。这种克制反而增强了其余结论的可信度。

七、必要知识反推

假设一个零基础的人要复现这项工作,最少需要哪些知识?

领域知识层: diffusion 视频生成与去噪原理(不懂就无法理解"上下文有界"在省什么);多视图几何——相机内外参、深度反投影、共视性、z-buffering(世界状态库的读写全部建立在其上);交互式世界模型的三重需求及其冲突(问题定义本身)。

方法论知识层:三条研究谱系的现状——内部上下文记忆、几何外部化(Warp-as-History/Gen3C)、少步蒸馏(DMD 系列);稀疏注意力与线性注意力的复杂度特性(设计教师的前提);自强化 rollout 与分布匹配蒸馏的机理;双向-因果错配(Causal Forcing)问题。

工程知识层:大规模分布式训练(DeepSpeed Ulysses 序列并行、激活重计算、chunk 级独立反向图);WBench/VBench 评测协议及其偏离的度量;单目深度估计(Depth Anything 3)的可用性与局限。

知识融合的关键节点:真正创造性的一步是"监督视野是设计变量“这个视角转换——它要求同时看穿蒸馏谱系(教师=答案源的隐含假设)和漂移的检测理论(内容漂移只在长程比较中显现),两者相乘才得出"必须让教师看见 30 秒"的结论。第二个融合节点是”空间与时间分治":意识到重访不一致(几何问题)与内容漂移(时序问题)本质不同,才能放心地把它们交给两套互不干扰的机制。

八、论文中可以提取的通用性灵感

  1. 记忆放外部,按查询键索引,而非在模型内部无限累积。 状态库按相机位姿索引、读取量由查询相关性决定,使成本与历史长度解耦。可推广:长对话 LLM 的外部记忆库按语义索引、Agent 任务记忆按目标状态索引、数据库系统的缓冲池管理——凡是"上下文越长越贵"的系统都适用。

  2. 教师(监督者)本身是设计变量,不只是答案来源。 蒸馏界默认"教师越强学生越好",本文证明教师的视野结构决定了学生能否学到长程能力——看不见漂移的教师永远教不出抗漂移的学生。可推广:RL 中的 reward model 设计应关注时间视野、代码评审中评审者的上下文范围、组织管理中考核周期的设定。

  3. 监督视野与梯度视野可以分离。 chunk 间 detach + 全窗口打分,让 30 秒的监督信号只需单 chunk 的反传内存。可推广:任何"想要长程信号但付不起长程反传"的场景——多阶段流水线训练、长轨迹强化学习、大系统的端到端评估。

  4. 区分"局部不可见的失败"与"局部可见的失败",用不同机制分别处理。 退化漂移短窗可检、内容漂移只有长程比较才显形;前者可局部治理,后者必须改变监督结构。可推广:软件系统中的慢性性能衰减 vs 急性故障、金融市场的长期漂移 vs 短期波动、模型评测中的能力退化监测。

  5. 诚实声明协议偏离与效应边界,反而强化主张。 论文主动列出 VBench 协议偏离、把教师收益严格限定为"曝光稳定性"、把几何召回限定为"可辨认而非忠实"——每条主张都有边界,每条边界都有实验支撑。可推广:任何需要可信度的技术报告与 benchmark 工作。

附录:一图总结

组件输入输出作用
世界状态库相机位姿 P_k≤8 个源视图的 warp 观测 + 可见性掩码空间重访一致性,上下文有界
长视野教师(Wan2.2 A14B)189 latent 帧 rollout全窗口分布打分暴露内容漂移,提供 30 秒监督
三步学生(基于 Helios)warp 条件 + 19 帧局部历史 + 逐 chunk 文本1.5 秒/chunk 视频,2.11 秒生成开放式低延迟交互生成

一句话:把"记忆"搬出模型、把"教师"重新设计,让学生用三步画出一个不会走样的世界。