论文链接:PhiZero: A World Model Built Around Physical Language 项目主页:phi-zero.github.io 发表时间:2026年7月 机构:中科院自动化研究所(CASIA)NLPR实验室 领域标签:cs.CV / 世界模型 / 物理推理
一、论文背景
1.1 什么是物理世界模型?
世界模型(World Model)是AI系统理解和预测物理世界如何随时间变化的核心组件。就像人类看到球从桌上滚落时,能预判它会掉到地上、弹跳几下然后停住——世界模型就是让AI拥有类似的"物理直觉"。
在具身智能(Embodied AI)中,世界模型尤其关键:机器人需要在"执行动作前"就预测世界会如何改变,才能做出合理决策。自动驾驶系统需要预测行人、车辆的未来轨迹;机械臂需要预测抓取物体后的运动状态。
1.2 当前方法的根本困境
当前物理世界模型的主流做法是直接在像素空间预测未来视频。具体来说,给定当前画面和一个动作指令,模型直接生成未来若干帧的像素——把世界动态隐式地编码在高维视觉预测器的参数中。
这种做法的根本问题是:物理规律被"淹没"在像素中了。模型学会了"画"出看起来合理的视频,但它并不真正"理解"为什么球会弹跳、为什么水会流动。这导致:
- 物理不一致:球穿过桌面、物体凭空消失、碰撞后不反弹——这些在训练数据中罕见的物理交互无法被正确生成
- 无法显式推理:因为物理动态是隐式编码的,无法在生成前进行逻辑推理(如"球会撞到墙,所以应该反弹")
- 难以控制:用户无法精确控制物理过程,只能通过文本提示间接影响
1.3 PhiZero的灵感来源:人类如何做物理推理?
论文的核心灵感来自一个深刻的观察:人类从视觉经验中抽象出预测性结构,并用自然语言组织起来进行显式推理。
比如,你看到保龄球撞击球瓶,你不会记住每一帧每个像素的颜色变化,而是抽象出"球沿直线滚动→撞击→球瓶四散"这样的因果链,用语言组织记忆。当遇到新场景时,你可以基于这个抽象因果链推理:“如果换成更重的球,球瓶会飞得更远。”
问题在于:自然语言对复杂物理转移来说太粗糙了。“球滚过来撞到鸭子"这句话无法编码速度、角度、材质、力度等连续物理量。PhiZero的解决方案是:从数据中自动学习一种比自然语言更精细的"物理语言”。
二、论文定位和关联工作
2.1 像素空间世界模型
| 工作 | 核心思想 | 关键局限 |
|---|---|---|
| Wan2.2 / Sora 2 | 扩散模型直接在像素/VAE空间预测未来帧 | 物理动态隐式编码,无法显式推理 |
| Cosmos系列 | 大规模视频预训练的世界模型 | 物理一致性有限(Physics-IQ仅29-39分) |
| Hunyuan-Video | 开源视频生成大模型 | 同样在像素空间操作,物理直觉弱 |
2.2 中间表示的已有探索
| 方向 | 代表工作 | 与PhiZero的区别 |
|---|---|---|
| 文本计划 | LLM先生成文本动作计划再渲染 | 文本太稀疏,无法编码连续物理量 |
| 稀疏关键帧 | 预测中间关键帧再插值 | 时间稀疏,无法控制完整时空过程 |
| 密集VAE token | Wan2.2 VAE编码(44800连续token/4秒) | 维度过高,无法作为推理语言 |
2.3 PhiZero的定位突破
PhiZero开辟了一条新路径:学习一种紧凑离散的"物理语言",既有自然语言的离散可推理性,又有足够的精度编码连续物理量。它不是在像素空间直接预测,也不是用粗糙的文本计划,而是在中间表示层面实现"先推理后渲染"。
| 维度 | 像素空间模型 | 文本计划方法 | PhiZero |
|---|---|---|---|
| 中间表示 | 无(直接像素) | 文本动作序列 | 物理语言离散序列 |
| 可推理性 | ✗ | ✓(但粗糙) | ✓(精细) |
| 物理精度 | 低 | 低 | 高 |
| 压缩率 | 1×(44800 token) | 极高(但信息损失大) | 175×(256 token) |
三、问题定义
3.1 从具体场景到抽象问题
具体场景:给定当前画面 + 动作意图,生成物理一致的未来视频。
核心洞察:问题的本质不在于"如何生成更好的视频",而在于**“用什么中间表示来推理世界演化”**。
3.2 形式化定义
PhiZero将世界模型分解为两个子问题:
物理语言学习:从无标注野外视频中自监督学习一个映射函数 $f: \text{视频状态转移} \to \text{离散物理语言序列}$,使得该序列能被解码器重建为视频,且序列足够紧凑以支持推理。
先推理后渲染:给定第一帧 $I_0$ 和动作意图 $a$,自回归模型预测物理语言序列 $L = (l_1, l_2, ..., l_n)$,然后解码器 $g(L, I_0) \to V$ 渲染未来视频。
约束:
- 物理语言必须紧凑(远少于VAE token数)
- 物理语言必须足够表达(能重建高质量视频)
- 物理语言必须可推理(自回归模型能从意图推理出正确序列)
3.3 抽象的精妙之处
这个定义的精妙在于将"生成"与"推理"分离——先生成的是世界演化的抽象描述(物理语言),再将其渲染为具体像素。就像建筑师先画设计图纸(抽象推理),再施工建造(具体实现)——图纸是可检查、可修改的中间产品。
四、问题解法
PhiZero由三个核心组件构成,形成"编码→推理→渲染"的完整管线。
4.1 组件一:物理语言分词器(Physical Language Tokenizer)
目标:学习将视频状态转移编码为紧凑离散序列的能力。
机制:
| 步骤 | 做法 | 类比 |
|---|---|---|
| 特征提取 | Transition-level Q-Former从相邻潜在视频状态中提取有序特征 | 像BPE分词把文本分成有意义单元 |
| 离散化 | FSQ(Finite Scalar Quantization)将连续特征离散化为25K原子符号 | 像把连续颜色量化为256级灰度 |
| 重建 | 扩散先验解码器从离散序列+干净第一帧重建视频 | 像从图纸+地基重建建筑 |
训练数据:50K小时野外真实世界视频→渐进过滤至10K小时用于分词器预训练;真实+模拟视频产生5M个4秒片段用于分词器SFT。
关键设计:
- 使用Wan2.2 VAE编码器(但仅用于初始编码,不作为最终表示)
- 使用Wan2.2-5B扩散解码器(从物理语言重建视频)
- 每个相邻状态转移32个query
- 第一帧条件化 + 纯噪声预热(保证生成质量)
结果:4秒33帧视频被编码为256个离散物理语言符号,对比Wan2.2 VAE的44,800连续token,压缩175倍,同时保持强重建质量。
4.2 组件二:物理语言推理器(Physical Language Reasoner)
目标:给定第一帧和动作意图,推理出正确的物理语言序列。
机制:
| 要素 | 设计 |
|---|---|
| 初始化 | Qwen3-VL-4B(多模态视觉语言模型) |
| 词表扩展 | 新增25K个物理语言原子符号 |
| 训练流程 | 先继续预训练(广泛视觉经验),再运动丰富的SFT |
输入:第一帧图像 + 文本动作意图(如"网球从黑色管道滚出,撞击小黄鸭")
输出:物理语言序列 $(l_1, l_2, ..., l_{256})$
推理过程:自回归地逐个预测物理语言符号——就像GPT逐个预测下一个token,但这里预测的是描述物理状态转移的符号。
4.3 组件三:渲染器
目标:将物理语言序列渲染为高保真视频。
训练好的扩散解码器接收物理语言序列 + 干净第一帧,渲染出未来视频。这一步将"抽象图纸"转化为"具体建筑"。
4.4 全景流程总结
输入:第一帧 I₀ + 动作意图 a
↓
[推理器:Qwen3-VL-4B] → 物理语言序列 L = (l₁, ..., l₂₅₆)
↓
[渲染器:Wan2.2-5B扩散解码器] → 未来视频 V
关键特性:物理语言编码"世界如何变化"而非"看起来如何",因此同一转移可换外观/物体/机器人本体重新渲染——实现零样本跨本体运动迁移(人手→灵巧手、人形机器人→G1机器人、仿真→现实)。
五、评估指标与实验证据
5.1 评估基准体系
PhiZero在四个互补基准上验证物理一致性:
| 基准 | 衡量什么 | 为什么选它 |
|---|---|---|
| Physics-IQ Verified | 视频生成的物理智能(经人工验证) | 衡量生成视频的物理合理性 |
| PhyGround | 物理过程理解与控制 | 衡量对物理过程的细粒度控制 |
| WorldModelBench | 世界模型的物理遵循度 | 衡量世界状态转移的准确性 |
| IntPhys2 | 直觉物理理解能力 | 衡量对物理规律的理解(不涉及生成) |
5.2 核心实验结果
Physics-IQ Verified(物理智能分数,越高越好):
| 模型 | IQ-Score |
|---|---|
| Wan2.2-5B | 21.2 |
| Sora 2 | 26.5 |
| Cosmos3-Nano | 29.1 |
| Wan2.2-14B | 32.2 |
| Hunyuan-Video | 33.4 |
| Grok-Video | 34.8 |
| Cosmos3-Super | 39.5 |
| PhiZero(本文) | 41.2 |
PhyGround(物理分数,越高越好):
| 模型 | Physics Score |
|---|---|
| LTX-Video-19B | 2.54 |
| Wan2.2-5B | 2.65 |
| OmniWeaving | 2.78 |
| Veo3.1 | 2.85 |
| Wan2.2-14B | 2.90 |
| PhiZero(本文) | 3.01 |
WorldModelBench(物理遵循度,越高越好):
| 模型 | Physics Adherence |
|---|---|
| Pandora | 4.05 |
| Mochi | 4.14 |
| Wan2.2-5B | 4.51 |
| Runway | 4.27 |
| PhiZero(本文) | 4.88 |
IntPhys2(直觉物理,越高越好):
| 模型 | Overall |
|---|---|
| Cosmos-4B | 49.41 |
| GPT-4o | 53.75 |
| Gemini-2.5 Flash | 55.63 |
| PhiZero(本文) | 56.34 |
5.3 压缩效率验证
4秒33帧视频的表示对比:
- Wan2.2 VAE:44,800连续token
- PhiZero物理语言:256离散符号(175倍压缩)
重建质量在高度压缩的tokenizer中保持强水平——这证明了物理语言确实是一种高效的紧凑表示。
5.4 实验如何证明核心主张
- Physics-IQ和WorldModelBench超越所有生成模型:证明"先推理后渲染"范式生成的视频物理一致性最强
- IntPhys2超越GPT-4o:证明物理语言不仅改善生成,还增强了对物理规律的理解能力
- 175倍压缩:证明物理语言是一种真正紧凑高效的中间表示,而非简单降维
- 零样本跨本体迁移:证明物理语言编码的是"变化本身"而非"外观",具有强泛化性
六、效果优势的根源解释
6.1 baseline的根本局限
像素空间世界模型(Wan2.2、Sora 2等)的根本局限在于:物理动态被隐式编码在高维连续参数空间中,无法被显式访问和推理。
这导致三个不可逾越的障碍:
- 推理不可能:模型无法在生成前进行"球会撞到墙所以应该反弹"的逻辑推理
- 错误不可追溯:物理不一致的根源无法定位——是推理错了还是渲染错了?
- 迁移不可能:因为物理动态和外观纠缠在一起,无法将"倒水"的动作迁移到不同容器和液体
6.2 PhiZero的根本性改变
方法差异:像素直接预测 → 物理语言先推理后渲染
机制变化链:
- 物理动态从隐式编码变为显式离散序列 → 模型可以先推理"球从管道滚出→撞击鸭子→鸭子被弹飞"这样的因果链,再渲染为视频
- 推理与渲染解耦 → 推理器可以专注于物理逻辑(不受像素质量干扰),渲染器可以专注于视觉保真度(不受物理逻辑干扰)
- 物理语言编码"变化"而非"外观" → 同一变化序列可搭配不同第一帧(不同物体/场景/本体),实现零样本迁移
因果验证:
- Physics-IQ从21.2(Wan2.2-5B)提升至41.2 → 因为物理因果链被显式推理而非隐式猜测
- PhyGround从2.65提升至3.01 → 因为物理过程被精细控制而非模糊影响
- 跨本体迁移成功 → 因为物理语言与外观解耦
6.3 反事实推理
如果去掉"先推理后渲染"范式,直接用扩散模型从第一帧+文本生成视频(即退化为Wan2.2),物理一致性将退化至21.2分——这反证了物理语言推理阶段的必要性。
如果物理语言不够紧凑(如使用44,800 token而非256 token),自回归推理将变得不可行——这反证了紧凑离散表示的必要性。
七、必要知识反推
7.1 领域知识层
- 世界模型的基本运作机制:理解世界模型如何从当前状态预测未来状态,以及"先验推理"与"后验渲染"的区别——不理解这点无法定义"先推理后渲染"范式
- 物理一致性的本质:理解什么是"物理一致"(物体不穿模、碰撞有反弹、重力方向一致等)——不理解这点无法设计评估指标
7.2 方法论知识层
- Q-Former架构:理解Query-based特征提取如何从视觉特征中选择相关信息——这是物理语言分词器的基础
- FSQ离散化:理解有限标量量化如何将连续特征映射到离散符号——这是物理语言离散化的关键
- 扩散模型解码:理解扩散模型如何从条件生成图像/视频——这是渲染器的基础
- 自回归语言模型:理解GPT式逐token预测——这是物理语言推理器的基础
7.3 工程知识层
- 视频数据渐进过滤:从50K小时到10K小时的多级过滤策略——确保训练数据的质量和多样性
- 第一帧条件化 + 纯噪声预热:保证扩散解码器生成质量的工程技巧
7.4 知识融合的关键节点
创造性洞察:“物理语言"概念的提出——将人类用自然语言组织物理推理的认知能力与Q-Former+FSQ的离散化技术融合,产生了一种新的中间表示。这不是简单的技术组合,而是对"什么表示适合推理世界演化"这个根本问题的重新思考。
八、论文中可以提取的通用性灵感
灵感一:中间表示决定推理能力上限
核心思想:系统的推理能力不取决于最终输出的质量,而取决于中间表示的可推理性。一个在像素空间直接预测的模型永远无法做显式物理推理,因为它缺乏可推理的中间语言。
论文证据:PhiZero的物理语言序列使物理一致性从21.2提升至41.2,而Wan2.2-14B(更大模型、仍在像素空间)仅32.2——证明瓶颈不是模型规模而是中间表示。
推广场景:
- 代码生成:与其直接生成代码,不如先生成抽象设计表示(如UML/架构图)再翻译为代码
- 对话系统:与其直接生成回复,不如先推理用户意图的抽象表示再生成自然语言
- 科学发现:与其直接预测实验结果,不如先推理描述现象的方程式再代入计算
灵感二:变化与外观的解耦实现零样本迁移
核心思想:当表示编码"如何变化"而非"看起来如何"时,同一变化可适配不同外观,实现零样本跨域迁移。
论文证据:PhiZero的物理语言可从人手动作迁移到灵巧手、从仿真迁移到现实——因为变化序列与第一帧外观解耦。
推广场景:
- 机器人技能迁移:学习人类操作的"变化模式”,迁移到不同机器人本体
- UI设计:学习交互的"变化模式",迁移到不同平台和主题
- 音乐创作:学习旋律的"变化模式",迁移到不同乐器和风格
灵感三:175倍压缩证明存在远超连续表示的紧凑离散语言
核心思想:对于结构化数据(如物理演化),存在比连续向量表示紧凑数百倍的离散符号表示,且不损失关键信息。
论文证据:256离散符号 vs 44,800连续token,压缩175倍且重建质量保持。
推广场景:
- 长上下文压缩:为Agent记忆系统设计紧凑离散表示,而非存储原始连续特征
- 知识图谱:用离散符号编码实体关系,远比向量嵌入紧凑
- 通信协议:AI间通信可使用紧凑离散语言替代自然语言