题目信息

论文:GameWAM: A World Action Model for Video Games 项目页:https://yunncheng.github.io/GameWAM/ (承诺公开代码/数据/权重) 时间:2026 年 8 月 25 日提交 arXiv 机构:复旦大学、腾讯光子 LIGHTSPEED 工作室、清华大学深圳国际研究生院(企业+高校合作),另含独立研究者

一、论文背景

现代视频游戏对 AI 智能体提出了极其苛刻的要求:第一人称视角下的快速视觉变化、需要持续记住的世界状态(比如背包里有什么、刚才去过哪里)、以及最底层的原生键鼠控制——玩家要同时按住多个键移动、连续转动相机瞄准、还要在背包界面里精确拖动物品。这和网页 Agent 点点点、或者机器人抓取物体都很不一样。

在此之前,研究社区有两条独立的技术路线。一条是游戏 Agent(game agent):从早期的 VPT、STEVE-1 到近年的 JARVIS-VLA、OpenHA、Game-TARS,它们把视觉和任务上下文直接映射为动作,学会了"怎么操作",但完全不建模动作执行之后世界会怎么变。另一条是交互式游戏世界模型(world model):如 Genie、GameGen-X、MineWorld,它们学会了"给定动作,画面会怎么演化",但自己不会主动选择动作去完成任务,动作必须由外部玩家提供。

一条路线会做不会想,另一条会想不会做。World-Action Model(WAM,世界-动作模型)试图把两者统一:同时生成未来视觉观测和可执行动作轨迹,让视觉预测为控制提供动力学感知的监督信号。此前 WAM 主要在桌面物体抓取等受限场景验证过(DreamZero、Fast-WAM),在电子游戏这种快变、开放、长时程的原生键鼠场景下还完全空白。GameWAM 就是第一个吃螃蟹的工作。

二、论文定位和关联工作

按论文 Related Work 的脉络,这项工作处在三条线的交汇点:

游戏 Agent 路线。从 MineRL/MineDojo 的环境与数据基础、VPT 的大规模行为预训练、STEVE-1 的生成式策略,到 JARVIS 系列的记忆增强多模态 Agent、Game-TARS 的跨游戏大规模持续预训练、Lumine 的实时键鼠统一控制,以及 OpenHA 对动作抽象的系统研究。这些工作把"能不能完成任务"推得很高,但动作与视觉后果之间始终隔着一层。

游戏世界模型路线。Genie 的潜动作生成、Diffusion for world modeling 的扩散世界建模、GameGen-X/GameNGen 的实时神经游戏仿真、WHAM 把游戏视频与手柄动作联合建模。它们证明了动作条件下的视觉预测可行,但预测出来的画面无法反过来驱动任务。

WAM 与具身控制。世界模型从 Dreamer 系列的潜空间想象、MuZero 的规划,到 TD-MPC2 的可扩展连续控制;生成式控制从 ACT 的动作分块、Diffusion Policy 的扩散动作,到 RT 系列的大规模 VLA。最近 DreamZero 提出联合预测未来视频与动作做闭环控制,Fast-WAM 保留视频协同训练但推理时去掉未来视频生成,FFDC-WAM 用预测未来校验执行。GameWAM 把这一范式推进到原生键鼠、gameplay+GUI 混合的游戏控制——这是前人没碰过的硬骨头。

三、问题定义

论文要解决的核心问题可以拆成三层:

1. 统一建模问题。给定历史观测、语言指令、本体感觉状态,模型要同时生成(a)未来若干步的视觉观测(世界模型职责)和(b)未来若干步可执行的原生键鼠动作轨迹(策略职责),并且动作要在真实环境中闭环执行、根据反馈不断重规划。

2. 动作异质性问题。同一套键鼠物理通道,在 gameplay 模式下是"相机转动+移动键",在 GUI 模式下是"光标移动+点击"。相同动作维度在不同模式下语义、数值范围、条件分布完全不同。比如鼠标横向位移在 gameplay 里是转视角(可以很大),在 GUI 里是挪光标(必须精细)。把它们当成同一个分布建模,会把互不兼容的相机统计和光标统计混在一起。

3. 时间尺度问题。游戏里视觉变化快,但视觉 token 昂贵——采样密了,同样预算覆盖的交互时间就短,前瞻变短、历史变短;采样稀了,又会错过快速自运动和瞬时目标。在块式自回归 WAM 里,预测、执行、KV 缓存都挤在一条有限链上,延长链条会推迟观测反馈。

用数学写出来:在周期 c 的块 k,条件上下文 Γ = (周期内干净观测上下文 C、语言指令 ℓ、跨周期持久历史 H、本体状态 s),要建模块因果联合分布 p(B_{k:k+R-1} | Γ),其中每个世界-动作块 B = (视频潜变量 V, 原生动作 A),动作又分连续坐标(相机/光标)和离散坐标(按键)。

四、问题解法

GameWAM 的架构是一个并行双 DiT + 块因果 + 联合流匹配的设计,配上四个关键机制。

1. 并行 Video-DiT 与 Action-DiT。视频分支直接从 Wan2.2-TI2V-5B 视频生成模型初始化(5B 参数),动作分支复用同样的 30 层 24 头布局但把隐藏宽度降到 1024(约 1B),同样从 Wan2.2 权重适配初始化以保留视频 Transformer 先验。两个分支各自做流匹配去噪,通过"模态解耦掩码"交互:两者的噪声变量互不作为对方的条件,但共享同一份干净视觉前缀的 K/V 状态——Video-DiT 把已实现的观测编码成层级 K/V,供两个分支共同注意。这个设计有个精妙之处:视频预测的梯度会流经共享的上下文路径,从而塑造动作分支所用的世界表示;但推理时可以完全省掉未来视频去噪,只保留动作生成,在线频率从 8.12Hz 提到 12.51Hz。

2. 每步动作路由器。Action-DiT 内部有 gameplay 和 GUI 两个预测头,外加一个逐步路由器。训练时真实模式标签选择被监督的头并作为路由目标;推理时预测的路由逐时间步选择用哪个头的预测生成完整原生动作向量。连续坐标按模式分别归一化(相机和光标的统计不同),离散坐标共享归一化。这样一条轨迹内可以在两种模式间自由切换,不用换模型。

3. 块周期控制:预测长、执行短。每个规划单元预测 P=16 步动作,但只执行前 E=8 步(E < P),拿到新观测后丢弃未执行的后缀、重叠重规划。这解耦了"看得远"和"反馈快":长前瞻提供规划视野,短执行保持闭环频率。训练时从同一轨迹每隔 E 步锚定一个 P 步预测目标,teacher-forcing 并行监督,不用真的自回归滚动。

4. 分层历史。周期内用完整 KV 缓存保存细粒度上下文,周期边界丢弃缓存、改由两级视觉记忆承接:近期历史用 Conv3D 压缩最近两个周期段(每段 16 token,保持空间可寻址);长期历史用多时间尺度注意力池化写入固定记忆槽(两个尺度、各 4 token、半衰期分别为 2 和 4 个周期)。总历史不超过 40 个 token,一个辅助损失约束压缩后的历史仍能预测当前干净视觉特征,防信息流失。

数据与训练。训练数据三条流:常规 VPT 轨迹(自然交互覆盖)、事件锚定 VPT 数据(离线检测挖掘/击杀/合成等事件,锚定窗口 [t-87, t+8] 双层去冗余 + 最大最小公平分配,预算 20 万条)、MineStudio 脚本 GUI 轨迹。混合比例 80% 事件锚定 + 5% 常规 + 15% 脚本 GUI。训练片段采样也事件锚定:事件邻域步长 2 密采样、远处步长 16 疏采样。视觉每 2 个动作采样 1 帧,224×224 分辨率。损失 = 视频流损失 + 分组归一的动作流损失(连续/离散分开归约防某一方主导)+ 路由 BCE + 历史预测损失。训练量极轻:2 epoch、21,900 步、共 2.79B token,8×H200 约 22 小时。

五、评估指标与实验证据

主实验在两个闭环基准上:Minecraft Universe(MCU,800+ 任务,测成功率与执行步数)和 ViZDoom 四图(测平均奖励)。

MCU 主结果(ASR = 平均成功率,步数为成功 episode 的平均原生交互步数):

模型Embodied 步数↓Mini ASR↑GUI Mini ASR↑Combat Mini ASR↑总 Mini ASR↑总 All ASR↑
VPT37710.10.73.64.83.5
STEVE-13848.40.04.94.45.0
ROCKET-139219.20.029.816.315.6
JARVIS-VLA30531.025.318.324.924.5
GroundingHA29039.73.728.223.923.4
OpenHA28737.033.340.036.8(次优)31.5
Game-TARS373————42.5
GameWAM13870.043.039.050.746.6

要点:Mini ASR 比次优 OpenHA 高 13.9 个百分点,All ASR 超 Game-TARS 4.1 点;更重要的是效率——Embodied 任务执行步数 138 步,约为 OpenHA(287)的一半、VPT(377)的三分之一,所有类别步数全面最少。

ViZDoom:四张图上对 Game-TARS 一致领先,与 o4-mini、GPT-5、Gemini-2.5-Pro、Claude-4-Sonnet 等多模态大模型相比持平或领先(每图 50 episode 平均奖励)。

零样本迁移 VoxeLibre(Minecraft 训练的 checkpoint 直接部署,只做确定性键鼠接口映射):6 个简单任务 120 episode 微平均成功率 59.2%,其中 Chop Tree 85%、Place Block 80%、Mine Stone 70%——说明学到的视觉-动作控制能力可部分跨游戏迁移。

消融实验(MCU Mini 平均 ASR):

变体ASR相对完整版损失
完整 GameWAM50.7—
去掉未来视频监督35.7-15.0
更粗时间采样36.7-14.0
去事件锚定采样38.0-12.7
统一动作分布(不分 gameplay/GUI)38.3-12.4
预测=执行视界(P=E)41.3-9.4
去跨周期历史46.7-4.0

训练规模对比:GameWAM 总消耗 2.79B token(视频 2.27B + 动作 0.37B + 文本 0.15B),OpenHA 为 3.62B(1.30 倍),而 Game-TARS 报告配方高达 566B(超过 200 倍)。

六、效果优势的根源解释

为什么 GameWAM 能用 1/200 的训练量拿到更高成功率、更少步数?关键是建立"方法差异 → 机制变化 → 指标提升"的因果链。

差异 1:联合世界-动作建模 vs 纯策略学习。VLA 式策略只看当前状态出动作,不建模动作的视觉后果。GameWAM 的未来视频监督通过共享的干净前缀 K/V 路径反向塑造动作分支的世界表示——动作预测器被迫理解"我这样按下去,世界会变成什么样"。机制变化:动作分支的条件表示里编码了动力学信息,长链任务(挖黑曜石要持续按、追马要预判走位)不再靠死记硬背模式。证据:消融中去掉视频监督 ASR 从 50.7 跌到 35.7,是所有消融里最大的单项损失——这是世界模型监督贡献的最直接证据。

差异 2:模态解耦 vs 块内联合去噪。直觉上让动作和视频的噪声变量在块内直接互相注意应该更好,实验却相反。机制变化:直接耦合让动作目标更快拟合,但削弱了视觉预测分支的优化(验证集视频预测更模糊),在视觉动态强烈的战斗场景退化最狠(Combat All 19.6 vs 32.2);解耦设计保留了"视频塑造表示"的梯度通路,又允许推理时省掉未来视频去噪。证据:解耦版 Mini ASR +4.4、All ASR +7.0,在线频率 12.51Hz vs 8.12Hz(1.54 倍)。

差异 3:每步路由 + 分别归一化 vs 统一动作分布。gameplay 相机位移和 GUI 光标位移的数值分布天差地别。机制变化:分开归一化让流匹配在各自尺度上工作,路由器逐时间步切换避免了"平均化"的混合分布。证据:统一动作分布消融掉 12.4 点,GUI 任务受损最重。

差异 4:预测长执行短 vs 预测=执行。P=E 时每次规划只看 8 步,前瞻不足。机制变化:P=16/E=8 让每个决策点带 16 步预测监督,但反馈频率不变。证据:P=E 掉 9.4 点。

差异 5:事件锚定采样 vs 均匀采样。长轨迹里大量片段是无信息量的赶路和闲逛。机制变化:训练容量集中在事件邻域的行为相关转变上。证据:去掉后掉 12.7 点。

执行步数减半的根源:世界模型监督 + 长前瞻让动作更有目的性,减少来回试探;这又与模态解耦带来的更高在线频率互相配合——重规划更快意味着更少的浪费动作。这些因素叠加,解释了"更高成功率 + 更少步数 + 极低训练量"的三重优势。

七、必要知识反推

读透这篇论文,初学者需要(或可以顺带学到)以下知识点:

  1. 流匹配(Flow Matching):Lipman 等人提出的生成建模方法,学习从噪声分布到数据分布的向量场。比扩散公式更简洁:X_σ = (1-σ)X_0 + σε,模型预测 U = ε - X_0。GameWAM 的视频与动作两个分支都用它。
  2. 扩散 Transformer(DiT):Peebles & Xie 提出的用 Transformer 替代 U-Net 的扩散主干,Wan2.2 等现代视频生成模型的基础。理解 DiT 才能理解 Video-DiT/Action-DiT 的层级 K/V 共享。
  3. 块因果注意力(block-causal attention):把序列切成块,块内可互相注意、块间只有过去块可见未来块——自回归视频生成的标准做法,GameWAM 把它扩展到视频+动作双模态。
  4. 任务算术与模型合并基础:虽然这篇没用合并,但"任务向量"的参数视角(微调 = 基座 + 任务向量)是理解现代后训练的通用语言。
  5. VPT 数据与 MineRL 生态:Minecraft AI 研究的标准数据源,理解事件检测、轨迹对齐等数据工程细节的前提。
  6. KV 缓存机制:Transformer 推理加速的基本手段,理解"周期内缓存 + 跨周期分层历史"设计的必要知识。
  7. DCT(离散余弦变换):信号处理基础,把时序信号分解为频率分量,LASI 分析用它把动作轨迹拆成低频(模 0-2)和高频(模 3-7)。
  8. MCP/MCU 基准协议:Minecraft Universe 的 800+ 任务评测框架,理解 ASR/步数指标的含义。

八、通用性灵感

超出游戏 AI 本身,这篇论文有几个可迁移的思想:

1. “会做"与"会想"可以且应该统一。任何决策系统如果只学输入→输出映射而不建模干预后果,天花板都有限。GameWAM 证明监督信号(哪怕训练时才用)比推理结构更重要——视频预测只在训练时提供监督、推理时完全省掉,收益却保留了大半。这对其他领域是重要启示:可以用"昂贵但只参与训练"的世界模型监督来增强轻量部署策略。

2. 解耦预测与承诺是长时程交互的通用范式。“预测 P 步、只执行 E 步、滚动重规划"本质上是 MPC(模型预测控制)思想在生成式策略上的重生。任何需要"看得远但反馈快"的场景——机器人操作、对话系统、代码 Agent——都可以借鉴这种块周期结构。

3. 同一接口下的多模式分布要用路由而非混合。键鼠在 gameplay 和 GUI 下语义不同,这在软件工程里到处都是:同一个 API 在不同上下文有不同契约,同一个用户行为在不同意图下含义迥异。逐步路由 + 分别归一化是个干净的解法。

4. 训练数据的质量密度比数量更重要。2.79B token 打 566B token,靠的是事件锚定采样把容量灌进行为相关片段。“在哪里采样"和"采多少"同等重要,这对数据昂贵的领域(医疗、法律、科学)尤其有价值。

5. 生成式控制的随机源是新的攻击面/失效面。LASI 的发现超出了这篇论文本身:扩散/流策略的初始噪声不是中性的——它的低频结构会被模型系统性放大为持久控制偏置,闭环复用时灾难性积累。这对所有用生成模型做控制的系统(机器人、自动驾驶、游戏 NPC)都是必读的警示,而"每步重采样"只是部署级缓解,机制级修复仍是开放问题。诊断方法论(固定条件 + 频域干预 + 因果验证)也值得所有做生成模型的人学习。

6. 模态耦合有代价,共享表示是更便宜的合作方式。让两个模态的中间变量直接交互(联合去噪)看似更强,实则引入优化干扰;让它们只共享一份干净的上下文表示,既保住了互相塑造的通路,又保留了各自独立伸缩的自由度。这个"表示共享、计算分离"的原则在多任务、多模态系统设计中普适。

总的来说,GameWAM 是世界模型与策略学习合流趋势下的一个扎实里程碑:它没有发明全新的理论,而是把流匹配、DiT、块因果、分层记忆这些成熟组件在"游戏原生闭环控制"这个最难的场景下做出了一个精心调校的系统,并通过消融和 LASI 分析告诉社区哪些设计真正起作用、哪些直觉是错的。对想进入世界模型或游戏 AI 领域的读者,这篇论文的正文加附录几乎是一门完整的工程实践课。