论文链接:Programmable World Model 代码仓库:github.com/AlayaLab/pwm;项目页 alaya-lab.github.io/pwm 发表时间:2026年9月10日(HF Daily Papers 当日第三 81 赞) 机构:蚂蚁集团 Alaya Lab(台湾大学系背景作者群) 领域标签:cs.CV / World Model / Video Generation / Agents
一、论文背景
交互式视频世界模型(interactive video world models)近年进展迅猛:用户给指令、模型生成相应的视觉世界演化。但这类模型有一个共性缺陷——没有可靠的世界状态。实体的数量、位置、属性变化全部隐式埋在视频帧的潜变量里,长程交互中状态必然漂移:角色走出画面再回来物体会变样、战斗中敌人数量数不对、规则(谁的血量扣多少)无法强制执行。更根本的是"可编程性"缺失——用户无法直接定义规则并期望模型严格遵守。
与此同时,游戏引擎/物理引擎天生维护精确状态,但渲染真实感与开放性远逊生成模型。两条技术路线各自卡在对方的强项上。
二、论文定位和关联工作
| 系统 | 状态维护 | 规则强制 | 视觉质量 | 可编程 |
|---|---|---|---|---|
| Genie / YUME 等潜在动作模型 | 隐式(潜变量) | 无 | 好 | 无 |
| LingBot-World 系交互视频 WM | 部分显式 | 弱 | 好 | 部分 |
| 游戏引擎 | 完全显式 | 完全 | 程序化 | 完全 |
| PWM | 显式引擎 | 完全 | 生成渲染器 | 完全 |
定位结论:PWM 是"显式状态世界建模"与"生成渲染"两条脉络的系统性融合——不是让视频模型学会状态,而是把状态从视频模型中剥离出去交给引擎,视频模型退化为可插拔的"渲染后端"。
三、问题定义
具体问题:如何在保持生成式视觉质量与开放性的同时,让世界模型拥有持久、精确、可编程的世界状态?
核心张力:状态精确性要求离散符号推理(计数、规则、屏外实体),视觉逼真要求连续生成——单一模型同时优化两个目标互相干扰。本文的答案是架构级解耦+确定性中间表示桥接。
形式化:世界状态 S(实体集合+属性+关系),转移规则程序 P: S×A→S,渲染器 R: (S, camera) → video。目标:Count/State 精度(S 的正确性)与视频质量(R 的逼真度)同时最大化,且 A 可由用户以自然语言编程。
四、问题解法
1. Agent 编排的世界编程(4.2 节):用户自然语言指令 → agent 编写可执行程序定义实体初始状态与状态转移规则(如"敌人被击中扣血、归零消失")→ 轻量引擎执行程序,维护显式持久全局状态。屏外实体与非视觉属性(血量、冷却)在引擎中不丢失。
2. 控制编译(4.3 节):世界状态+目标相机轨迹 → 确定性编译为像素对齐的时空条件信号。核心是状态增广 3D 有向包围盒(OBB):每个实体在 3D 空间的位置/朝向/尺寸被投影到画面平面,为渲染器提供结构化几何引导。
3. 生成渲染器(4.4 节):预训练视频模型以条件信号(OBB 投影图+相机参数)驱动,负责外观的一切(纹理、光照、风格);分块自回归渲染支持长时程,时间历史+几何对齐空间记忆保证跨块一致性。
4. 自动训练数据管线(4.5 节):从游戏视频自动估计相机参数、发现语义类别、实例分割跟踪、恢复物体轨迹、生成条件图——把"状态-渲染对"数据的构造全自动化。
五、评估指标与实验证据
- CombatStateBench(自建,战斗场景状态密集):Count Accuracy 94.00(LingBot-World-V2 +53.25 分、YUME +62.00 分);State Accuracy 98.00(LingBot-World-V2 +90.00 分、YUME +40.00 分);背景一致性 96.98(+5.09/+3.35 分)。
- 长时程:分块自回归+空间记忆支撑连贯长时程生成,而基线模型在多轮交互后状态与外观双漂移。
- VLM 评测:用 VLM 评估生成视频的状态正确性,交叉验证人工指标。
六、效果优势的根源解释
94%/98% 的状态精度不是"更好的视频模型"带来的,而是架构分工带来的:
- LingBot-World/YUME 试图让视频模型隐式记住状态,计数与规则是概率现象——每个 token 都有机会出错,误差随时长累积;
- PWM 把规则执行移入符号引擎:计数是引擎的内存读、规则是确定性代码,不依赖任何概率推断的正确性;屏外实体在 S 中持续存在,回到画面时状态无损;
- OBB 中间表示是关键桥梁:它把引擎的 3D 状态投影为渲染器可消费的 2D 结构信号,让"状态精确"与"外观逼真"两条信息流像素级对齐——引擎不知道怎么渲染、渲染器不知道怎么计数,但 OBB 让它们各司其职互不越界。
因果链:状态/规则符号化 → 精度由引擎保证 → 渲染器专注外观 → 双指标同时大幅超越端到端基线。
七、必要知识反推
- 交互式视频世界模型:Genie(潜在动作)、YUME、LingBot-World 等按用户输入生成可交互视频的模型,本文直接对照。
- OBB(Oriented Bounding Box):带朝向的 3D 包围盒,比轴对齐盒更贴合实体姿态,是状态→渲染的几何桥。
- 神经渲染 vs 程序渲染:前者逼真但不可控,后者精确但僵化——PWM 属于"程序状态+神经渲染"混合路线。
- World model 作为 evaluator:论文明确讨论世界模型充当评估器的用法,与同期 Verified Code World Models 呼应。
八、论文中可以提取的通用性灵感
- 精确性外包给符号层:任何生成系统里"必须百分百正确"的约束(计数、规则、账目)都不该让概率模型负责——把硬约束放进确定性引擎、让生成模型只做软性外观,是可靠生成的通用架构。
- 中间表示是异构系统的协议:引擎与渲染器能协作不是因为谁迁就谁,而是因为共享 OBB 这一"状态投影语言"——跨范式系统集成时先设计中间表示,比直接对接高效得多。
- 屏外状态是开放世界的试金石:评估任何世界模型/agent 环境时,“看不见的东西还在不在"是最廉价的压力测试。
- 数据管线自动化先于模型创新:本文视觉质量的底座是全自动的"视频→状态-渲染对"管线——当任务需要成对监督时,先投资自动配对工具。