论文链接:Training Object Permanence in World Models (arXiv:2609.28654) 发表时间:2026年9月(v1 于 2026-09-23 提交) 机构:16 所高校联合——USC、CMU、密歇根大学、约翰霍普金斯、UCSD、UCLA、哥伦比亚大学、多伦多大学、布里斯托大学、UC Berkeley、滑铁卢大学、FAU 埃尔朗根-纽伦堡、牛津大学、NYU、斯坦福大学、哈佛大学;算力由 AWS Trainium for Research 计划支持。纯学术多机构合作,无企业研究团队参与。 领域标签:cs.AI / 视频生成 × 认知科学(核心知识)× 世界模型
一、论文背景
视频生成模型凭什么叫「世界模型」
先从「视频生成模型」说起。这类模型(如 Sora、Veo、Kling、Wan)接收文字或图像输入,逐帧生成以假乱真的视频——技术上多基于扩散模型:把一段视频当成加满噪声的信号,训练一个神经网络学会「去噪」,去噪的过程就是生成视频的过程。因为生成得足够逼真、时间上连贯,学界开始把它们称作「世界模型」(world model):理论上,一个真正理解物理世界的模型应该能「模拟」世界如何演化——球会落地、遮挡物后面的东西不会消失。LeCun 在 2022 年的那篇著名路线图中就把这类「通过预测未来观测来学习世界规律」的模型视为通向自主机器智能的路径。
但「生成得像」不等于「懂物理」。一个被广泛观察到的失败模式是:物体被遮挡后就凭空消失,或者在不可能的位置重新出现;物体还会穿过固体障碍物,仿佛障碍只是画上去的背景。论文开篇就点出:这类失败触及人类物理智能的地基——客体永久性(Object Permanence, OP)与客体固体性(Object Solidity, OS)。
什么是客体永久性与固体性:从婴儿说起
客体永久性是发展心理学的经典概念:物体离开视野后依然持续存在。皮亚杰(Piaget, 1954)认为婴儿要到八九个月大、经过大量与物体互动后才能习得它。但 Baillargeon 在 1986 年用「违背预期」(violation-of-expectation, VoE)范式改写了这一时间线:让婴儿观看小车驶过挡板后方的场景——若婴儿在挡板后看到一个「不可能事件」(如小车穿过本应挡住它的箱子),他们会盯着看得更久。注视时长的差异说明,仅 3.5 个月大的婴儿已经在心里维护着「看不见的物体仍然存在」的表征。固体性的发现更早:出生后半年内,婴儿就能对「两个固体互相穿透」这类违背固体性的事件表现出惊讶。
这两条证据链汇入 Spelke 与 Kinzler 提出的「核心知识」(core knowledge)理论:人类拥有一套领域特化的、在发育极早期就投入运行的表征系统——物体持续性、固体性、连续性等——它们是后续一切物理推理的脚手架。类比来说,核心知识之于人类物理智能,就像操作系统内核之于上层软件:上层应用(因果推理、场景理解)都建立在这些最底层约束之上。
为什么要对视频模型「考幼童的题」
论文的动机论证有一个精巧的结构性理由:OP 与 OS 的失败是「结构性上游」的。一个允许物体互相穿透的模型,不可能生成物理上正确的碰撞或支撑移除事件;而任何上层场景构建或因果推理都会继承这些底层错误。就像一栋大楼的地基歪了,上面每层楼都会跟着歪。所以与其测试模型的高阶推理(解迷宫、跟随抽象规则),不如先测它有没有把人类婴儿几个月大就掌握的「地基」打牢。
现有研究还有三个空缺(论文 Related Work 逐一指出):已有探查多限于二维环境;评估多限于图生视频,缺少视频续写(video-to-video, V2V)设定;且普遍依赖 VLM 自动评分——而多模态语言模型自身就被证明存在核心知识缺陷(Li et al., 2025 等),让「自身不懂物理的裁判」去判物理题,可靠性存疑。这三个空缺共同构成了这篇论文的切入位置。
二、论文定位和关联工作
本论文处于「视频模型作为世界模型」与「认知科学核心知识」两条研究脉络的交汇处。按谱系梳理:
谱系一:视频生成模型的物理能力评测
- Physics-IQ(INSAIT + Google DeepMind, arXiv:2501.09038, ICCV/WACV 2026):用 396 个真实拍摄视频(流体、固体力学、光学、热力学、磁学五类)测试 Sora、Runway 等模型的物理理解,结论是「视觉真实不等于物理理解」。与本文区别:Physics-IQ 用真实视频、只评不训;WROP 用参数化合成数据、既评又训,且聚焦 OP/OS 两类核心先验而非泛物理常识。
- WorldBench(world-bench.github.io):425 个配置直接评测世界模型预测物理场景演化的能力(含客体永久性、支撑关系),用 SAM2 分割掩码对照仿真真值,发现 Cosmos 等模型全面缺乏物理一致性。与本文区别:评估走自动分割路线而非人评;不含训练语料。
- WRBench / MemoBench(2026):诊断「世界状态持续性」——物体不被观察时世界是否仍在演化。WRBench 发现 23 个模型普遍把「回来查看」的世界恢复成离开时的状态;MemoBench(哈佛/MIT 等,ECCV 2026)测「消失-重现」一致性,10 个模型的重现得分无一超过 0.6。这两项与本文的 OP 任务族共享精神内核,但都不提供 150 万级训练语料与微调模型。
谱系二:认知科学启发的 AI 数据/训练
- Baillargeon 系列 VoE 实验(1985/1986/2001)与 Spelke 的核心知识理论(2007):本文六任务族中 OP-1 与 OS-1 直接以 Baillargeon 的实验示意图为蓝本,论文连任务命名都用「Baillargeonian」致敬。
- Li et al. 的 Core Knowledge Deficits 系列(ICML 2025)与 Luo et al. 的「像孩子一样培养 AI」(arXiv:2502.10742):同一作者圈(多位本文共同作者参与)此前已系统证明多模态模型存在核心知识缺陷。本文相当于该议程从「诊断」迈向「治疗」的第一步。
谱系三:世界基础模型平台
- NVIDIA Cosmos(arXiv:2501.03575):开源的物理 AI 世界基础模型平台,「先预训练、后领域微调」范式的代表。本文的 PWM-WROP 正是从 Cosmos3-Nano(16B)微调而来——Cosmos 提供通用底座,WROP 提供认知科学定向的微调数据,二者构成「通用底座 + 认知定向数据」的组合。
定位小结
| 维度 | 之前的路线 | 本论文的突破 |
|---|---|---|
| 评测对象 | 泛物理常识(Physics-IQ)或二维推理 | 仅 OP/OS 两类核心先验,六任务族三维场景 |
| 数据形态 | 真实视频小规模评测 / 无训练集 | 150 个参数化生成器 × 1 万样本 = 150 万训练语料 + 300 题固定考试 |
| 评测方式 | VLM 自动评分为主 | 20 人盲测成对比较 + Bradley–Terry/Elo(明确规避 VLM 裁判缺陷) |
| 是否训练 | 只评不训 | 从 Cosmos3-Nano 微调出 PWM-WROP 并开源 |
| 工程配套 | 无 | AWS Trainium2 原生 PyTorch 训练栈 PWM 全开源 |
一句话定位:它是第一个「认知科学范式操作化 → 大规模可控合成数据 → 微调开源模型 → 人评 Elo 排行榜」全链条打通的 OP/OS 训练与评测基础设施。
三、问题定义
从具体场景到抽象问题
具体场景:视频模型看到「球滚进隧道」的前 60 帧,要生成后 60 帧。失败表现为球消失、多出球、或从错误位置冒出来。
论文的抽象洞察在于:这类失败可以归结为模型是否内化了两条最小物理约束——(1) 表征持续性:物体在视野外时其内部表征(是什么、在哪里、多少个)不灭失;(2) 固体约束:物体不能互相穿透,接触会产生力学后果。这两条约束恰好对应发展心理学中最早出现、最不需要学习的核心知识。于是问题可以被形式化为:
给定:前 60 帧条件视频 + 自然语言提示;求:物理上有效的后 60 帧续写;约束:续写中每个物体的身份、数量、轨迹需与遮挡/接触前的状态保持核心知识一致性(不无中生有、不凭空消失、不穿透固体、支撑移除后下落)。
抽象的精妙之处
三点值得玩味。第一,把「懂物理」压缩成两条可操作判据,避开了「物理理解」这个定义模糊的大词,评估时人评员只需回答「物体有没有消失/穿墙/变多」。第二,把测试点放在时间切分边界上:每段视频恰好在关键物理事件(进入遮挡、支撑移除、碰撞发生)处对半切开,模型接收前半段、生成后半段——考题正好压在「表征必须跨越感知缺口」的瞬间。第三,与婴儿 VoE 范式做了一次镜像转换:婴儿实验是「呈现不可能事件、测量注视时长」,模型实验则是「要求模型直接生产物理上合理的续写」——生成端暴露的正是婴儿注视行为所探测的同一套表征约束。
一个类比:这就像考驾照时不问交规理论,直接把考生放在「前车突然变道」的场景里踩油门——所有的知识缺陷都会在「接着会发生什么」的瞬间暴露。
四、问题解法
论文的解法是一个三层递进的工程:数据基础设施(WROP)→ 微调模型(PWM-WROP)→ 评测体系(人评 Elo + 自动指标)。外加一个训练基建副产品(PWM 训练栈)。
4.1 WROP 数据基础设施:认知科学范式的操作化
类比:如果说普通视频数据集是「街上随手拍的素材库」,WROP 则是「按考纲命题的题库工厂」——150 个出题老师(生成器),每人负责一种题型(认知任务),每题能变出一万个表面不同、内核一致的变体。
150 个手工设计的 Blender 参数化生成器分六个任务族(对应两类核心先验):
| 族 | 名称 | 生成器数 | 考什么 | 认知科学出处 |
|---|---|---|---|---|
| OP-1 | Baillargeon 遮挡 | 26 | 物体绕过遮挡物后原样重现(身份/大小/方向不变) | Baillargeon 1986 |
| OP-2 | 静态遮挡 | 29 | 遮挡板移开后物体数量/排列不变 | Stahl & Feigenson 2015 |
| OP-3 | 容器永久性 | 35 | 物体随容器移动到新位置而非留在原地 | Hespos & Baillargeon 2001 |
| OS-1 | Baillargeon 阻挡 | 20 | 物体能否通过取决于尺寸与孔径关系 | Baillargeon et al. 1985 |
| OS-2 | 支撑移除坠落 | 21 | 支撑撤走物体立即下落,不能悬空 | Hespos & VanMarle 2012 |
| OS-3 | 碰撞 | 19 | 碰后动量传递、轨迹分离、数量守恒 | Sanford 1967 |
每个生成器内部,参数被切成两半,承担完全不同的角色:
- 结构参数(物体数量、几何、轨迹、遮挡配置、接触时机):定义物理与认知难点,系统化变化以控制难度,使模型无法靠背答案过关;
- 表面参数(颜色、材质、光照、相机视角):独立随机化以最大化视觉多样性,但不改变底层物理问题——防止模型把「光照暗」与「球会穿墙」这类虚假关联当作规律。
一个关键工程决策:不用物理引擎。所有轨迹都是手工关键帧动画(解析式编写),遮挡、接触、重现都发生在受控帧上。「物理正确性」由场景作者保证而非模拟器保证——这避免了「用有缺陷的物理引擎教模型错误的物理」的风险,代价是每生成器需要精细的人工设计。
规模上:每生成器 1 万样本 → 150 万训练语料;每生成器抽 2 题 → 300 题固定考试。每个样本是 120 帧、1280×720、24fps 的动画,在关键物理事件处对半切成 60 帧输入 + 60 帧目标,并附带自然语言提示、逐帧物体位姿轨迹、场景元数据(生成器 ID、随机种子、渲染配置,保证可追溯)。质检自动化:五元组齐全、帧率一致、恰在第 60 帧无缝相接、轨迹字段完整,不合格样本拒收重生成。
4.2 PWM-WROP:在「考纲协议」上微调
类比:Cosmos3-Nano 是一个受过通识教育的大学新生,PWM-WROP 是让它按照 WROP 的考纲(V2V 契约)做了一年专项训练——大脑结构(架构与 tokenizer)完全不动,只换「教材与作业」(训练信号)。
具体做法刻意保持最小化:从 Cosmos3-Nano(16B)微调,只改训练信号;以样本的输入半段为条件、目标半段为预测对象,即直接在 WROP 的 V2V 评测协议上训练——「训练数据契约与推理协议一致」,不存在考训错位。不用任何任务标签或族名,仅用样本自带的自然语言提示做文本条件。训练 1 个 epoch,几何配置为 117 帧打包片段(57 条件帧 + 60 预测帧)、320×192 分辨率——这也是评测时的原生分辨率。
4.3 评测体系:把「接口类」当显式因素
14 个模型分三类接口,这是全文最具新意的实验设计变量之一:
- 真续写(4 个):把输入片段当作前缀,从最后一帧接着往后合成——PWM-WROP、MAGI-1 24B、LTX-2.3 Extend、Grok Imagine (video extend);
- 参考生成(3 个):把输入当视觉参考,按自己的时间线把整个事件重新生成一遍——Seedance 2.5、Wan 3.0 Prime、MiniMax H3;
- 编辑/迁移(7 个):逐帧重绘输入跨度——Wan-VACE、LTX-2.3 Dev、Cosmos3 Super、Kling O3 Pro、Gemini Omni Flash、Runway Aleph 2 等。
统一推理协议:所有模型经由同一推理框架,只传输入视频与提示词原文(禁止提示工程、禁用服务端提示扩展),目标视频全程不可见。开源模型本地按上游推荐设置跑,闭源模型走托管 API。
主指标:盲测人评 Elo。20 名众包评分员(资格线 8/10,中位 9/10)看到输入视频+提示词后,对两个匿名排序的续写(A/B)三选一(A/B/差不多),评判标准三条合一:文字一致性、运动自然与物理合理性、客体永久性(不消失、不无中生有、不穿墙、遮挡后颜色形状数量不变)。质量控制严谨:注意力检查正确率 90.0%、重复条目自一致性 93.5%(Cohen’s κ = 0.891)、无位置偏置(左置胜率 51.4%,p=0.615)。120 个模型对 × 4 题 = 476 次判断(361 次落在不同模型间,每模型 50–52 局),用 Bradley–Terry 模型拟合出 Elo(全局均值 1500),置信区间来自 1000 次按评分员聚类的自举重采样。
辅助指标:全参考自动指标。LPIPS、MS-SSIM、SSIM、PSNR、MSE、CLIP、FID 等,全部统一到 320×192(评测池最低原生分辨率)以拉平空间尺度。作者对它们的定位非常克制:这些指标衡量「与参考视频的接近度」而非「物理推理正确性」——一个忠实重绘遮挡前静态场景的编辑模型可以在 SSIM 上拿高分却从未生成过「物体重新出现」这个事件。因此自动指标只作视觉/几何一致性的诊断用。
4.4 PWM 训练栈:Trainium2 上的工程记录
配套发布的 PWM 是 Cosmos3-Nano 在 AWS Trainium2 上的原生 PyTorch 训练实现(不经 XLA 图追踪):16 块 Trainium2 芯片(64 逻辑 NeuronCore)上以张量并行 4 × FSDP2 16 分片 36 层模型,静态形状逐块编译。优化三步走:首跑 15.1 s/step → 重写 reduce-scatter copy-in 为行拼接(2.25× 加速)→ 多张量 AdamW 单次同步(1324ms → 126ms),最终 5.7 s/step,且三步优化均验证损失轨迹逐 step 一致。正确性验证包括与上游参考的位级前向一致性、64 rank 位精确续训、小样本过拟合检验(续写半段余弦 0.993–0.999 vs 底座 0.85–0.995)。
五、评估指标与实验证据
指标体系一览
| 层级 | 指标 | 定义 | 方向 | 衡量的本质能力 |
|---|---|---|---|---|
| 主指标 | 人评 Elo(BT 拟合) | 361 次盲测成对判断拟合的 Bradley–Terry 强度,均值 1500 | 越高越好 | 人类眼中续写的物理合理性与永久性一致性 |
| 主指标 | 自举 Top-1 概率 | 1000 次评分员聚类自举中排第一的频率 | 越高越好 | 排名稳健性(区分统计上可分/不可分的名次) |
| 辅助 | LPIPS | 深度特征感知距离 | 越低越好 | 感知保真度 |
| 辅助 | MS-SSIM | 多尺度结构相似性 | 越高越好 | 时空结构保真度 |
| 辅助 | MSE/CLIP/FID 等 | 像素误差/语义相似/分布距离 | 低/高/低 | 与参考的综合接近度 |
| 诊断 | 族内 Elo 排名 | 六任务族分别拟合 BT | — | OP 与 OS 能力的分化画像 |
核心实验证据
实验一:总榜——真续写类登顶。 300 题考试、14 模型、20 人盲测:
| 排名 | 模型 | 接口类 | Elo | 95% CI |
|---|---|---|---|---|
| 1 | Wan 3.0 Prime | 参考生成 | 1723.6 | [1629, 1865] |
| 2 | MiniMax H3 | 参考生成 | 1723.6 | [1645, 1838] |
| 3 | PWM-WROP(本文) | 真续写 | 1679.5 | [1604, 1782] |
| 4 | Seedance 2.5 | 参考生成 | 1649.6 | [1554, 1752] |
| 5–8 | Runway Aleph 2 / Wan-VACE / Gemini Omni Flash / Kling O3 Pro | 编辑迁移 | 1518/1507/1493/1471 | — |
| 9 | Grok Imagine (extend) | 真续写 | 1457.0 | [1363, 1555] |
| 10 | LTX-2.3 Extend | 真续写 | 1453.4 | — |
| 14 | MAGI-1 24B | 真续写 | 1248.0 | [1137, 1316] |
三个读数:PWM-WROP 在真续写类内第一,超次优 Grok Imagine 222.5 Elo;总榜第三,仅低于两个统计上并列的参考生成模型(自举 Top-1 概率 Wan 46.8%、MiniMax 36.4%、PWM 12.3%,其余模型为零);而且这个成绩是在 320×192 原生分辨率下对阵对手的 720p/1080p。
实验二:族内画像——OP 强 OS 弱。 PWM-WROP 在 OP-2 静态遮挡族第 1(Elo 1785)、OP-1 第 3、OP-3 第 3、OS-2 坠落第 2,但 OS-1 阻挡第 5、OS-3 碰撞仅第 8(1394)。对照参考生成双雄:MiniMax H3 在 OS-2 与 OS-3 都拿第一且胜率 100%。论文的解读:OP 考「遮挡期间维持表征」,OS 考「接触动力学的后果生成」,两者可能需要不同的内部表征;当前微调对遮挡跟踪更有效、对接触动力学较弱。附录 C 同时坦承 OS 族的置信区间很宽(每族仅 36–44 局),族内排名只代表趋势。
实验三:自动指标——匹配分辨率下保真度最优。 统一 320×192 尺度上,PWM-WROP 的 LPIPS 0.081(次优 0.105)、MS-SSIM 0.921(次优 0.877)、MSE 2.97×10⁻³ 全场最优,CLIP 0.956 第二。FID 20.4 偏低是因为 720p 比较时需 4 倍上采样。这组数字的作用是排除一种质疑:PWM-WROP 的 Elo 优势是不是靠「画面糊但物理对」?不是——匹配分辨率下它的像素与感知保真度同样最优。
实验四:定性分析——两类失败模式。 六个代表案例(每族一个)归纳出跨模型的两种失败:表征脱落(representation dropout)——场景看着正常但丢了物体的追踪记录,如 Gemini Omni Flash 在隧道题中多生成第 4 个球、球不按原车道出来;因果脱钩(causal decoupling)——单帧事件各自合理但物理关系断裂,如 Seedance 2.5 在支撑移除后让球悬空数帧才缓慢下落、碰撞后球凭空消失。PWM-WROP 在六个案例中全部生成物理正确结果。
实验设计如何支撑论点
论文的核心主张是「核心知识可以通过认知定向数据训练进视频模型」。支撑链:接口类变量控制(同为真续写类内比较,PWM-WROP vs Grok 差 222.5 Elo)+ 训练协议一致(考什么就训什么)+ 保真度对照(排除「靠糊取胜」)+ 定性案例(失败模式恰好落在 OP/OS 约束上)。作者也诚实标注了归因边界:14 个模型架构各不相同,性能差距不能全部归因于训练数据——这是对「指标真的证明了主张」的必要限定。
六、效果优势的根源解释
6.1 根源机制与证据链
对比对象与它的局限。 基线是真续写类的通用模型(Grok Imagine、LTX-2.3 Extend、MAGI-1)。它们并非弱者——在海量通用视频上预训练,视觉保真与时间连贯性都极强。其结构性局限在监督信号分布上:通用视频语料中,「物体完整穿过遮挡期并重现」「碰撞后全部物体数量守恒地散开」这类事件帧段极少被系统性标注与采样,模型学到的分布把「看不见≈可以不存在」合理化了。这不是「它没做过 OP 题」的表面差异,而是「其训练分布使得维持遮挡期物体表征从未成为损失函数的主要压力方向」的机制性瓶颈。
因果链拆解。
- 认知科学范式操作化 → 150 个生成器精确覆盖两类核心先验的六种变体,且结构参数系统化控制难度(论文设计已支持);
- 表面参数随机化 → 切断「感知捷径」的信息通路:模型无法用光照/材质/视角等低级线索预测物理结果,只能依赖对物体状态的真实表征(论文设计已支持;标注为机制推理而非直接实验证据的部分:论文未单独做「去掉表面随机化」的消融);
- V2V 切分点对齐 → 训练时每个样本的预测目标恰好包含关键物理事件及其后果,「遮挡期间维持表征」「固体约束后果」直接进入损失(论文实验间接支持:PWM-WROP 与基线的差距集中在 OP/OS 相关失败模式上);
- 训练契约 = 推理协议 → 微调分布与考试分布一致,无考训错位(论文实验支持:接口类内比较);
- 上述四步 → 真续写类 Elo 从 1457 提升到 1679.5(+222.5),同时匹配分辨率下 LPIPS/MS-SSIM 最优(论文实验直接支持)。
接口类变量为何比规模更能解释排行榜(论文观察 + 阅读者推理):编辑/迁移模型因逐帧重绘而结构上无法生成「输入结束之后」的事件,因此无论强弱都挤在中游(5–8 名仅差 109 Elo 且区间重叠);参考生成模型可自由重造场景,在 OS 类(碰撞、坠落等可从头布局的事件)优势明显;真续写模型被「必须从最后一帧接着演」的约束束缚,恰是 WROP 协议最难为的一类——而 PWM-WROP 在这个最难类内登顶。这说明「接口类匹配 + 领域定向训练」的耦合,而非单纯模型规模,是排名的第一解释变量(此为论文自述的观察归纳,标注为部分推测)。
OP 强 OS 弱的反证价值:如果提升只是「数据多」的规模效应,六个族应同幅度受益;实际 OS-3 碰撞族仅第 8,反证「数据契约内容」而非「数据量」决定哪类能力被加强——接触动力学可能需要不同表征(论文引 Falck et al. 2020 支持 OP/OS 认知分离,此连接为作者解释 + 阅读者推测标注)。
6.2 相关工作检索与对照
围绕因果链的关键环节做外部检索,结果汇总如下(检索时间 2026-09-26):
| 研究(可核验链接) | 相似尝试 | 相关结论 | 与本文的差异与适用边界 | 对根源解释的影响 |
|---|---|---|---|---|
| Physics-IQ(INSAIT+DeepMind,physics-iq.github.io / arXiv:2501.09038) | 用真实视频基准测生成模型的物理理解 | 「视觉真实≠物理理解」;流体好于固体力学;后续榜上 v2v 多帧输入普遍强于 i2v | 真实拍摄、只评不训、泛物理五类;其 v2v>i2v 的发现与本文「接口类决定表现」互证 | 支持:物理缺陷是跨模型的结构性问题;补充:多帧条件本身有利 |
| WorldBench(world-bench.github.io) | 视频预测式评测(含客体永久性、支撑),SAM2 掩码对照仿真真值 | Cosmos 各版本物理一致性全面不足;VLM 仅略高于随机 | 自动评估路线、425 配置、无训练语料 | 支持:世界模型的 OP/OS 缺陷可被独立基准复现 |
| WRBench(arXiv 2606.20545) | 诊断世界状态持续性:把相机移开再回来,事件是否仍在演化 | 23 个模型跨范式一致失败:把世界恢复成离开时状态;规模增长不解决 | 干预对象是可观测性而非遮挡本身;只诊断不训练 | 支持:「看不见时的状态维持」是现有模型的共性短板,且非规模可解——侧面加强「需要定向数据」的论证 |
| MemoBench(哈佛/MIT/IBM 等,ECCV 2026,memobench-team.github.io) | 「消失-重现」动态环境基准,360 段真值视频 | 10 个模型物体重现得分无一超过 0.6/1.0 | 真实场景、VQA 自动评估、不含训练干预 | 支持:OP 一致性缺陷在真实域同样存在 |
| NVIDIA Cosmos(arXiv:2501.03575) | 「预训练世界底座 + 领域后训练」范式的提出者 | 领域微调可在小数据下显著特化 WFM | 本文即其范式的一次认知科学定向实践 | 支持:微调路线本身有平台级先例 |
| Baillargeon VoE 方法论批评(Schöner & Thelen 2004;Rivera et al. 1999;Bogartz et al. 2000,见心理学教材综述) | 对婴儿 VoE 范式的混淆变量批评(不可能事件可能只是新颖性偏好) | 提醒:核心知识解释本身在心理学界有争议 | 任务蓝本层面而非方法层面;本文要求模型生成而非测量注视 | 限定:六任务族所引的心理学结论并非无争议,但用于 AI 数据设计时该争议不影响数据本身的物理正确性 |
未检索到直接以「合成认知任务数据微调视频模型以提升 OP/OS」为题的同期独立工作——WROP 之外,本次检索范围内未发现把「认知科学范式操作化 + 百万级训练语料 + 开源微调模型」三件事同时做掉的先例(WorldBench/WRBench/MemoBench 均止步于评测)。
6.3 综合判断与未决问题
多研究共同支持的机制:(1) 视频世界模型的 OP/OS 缺陷是跨模型、跨范式、跨评估方式的稳定现象(Physics-IQ、WorldBench、WRBench、MemoBench 四项独立基准一致复现);(2) 该缺陷不能靠规模或画质自然解决(WRBench 明确观察规模增长无效);(3) 接口类/条件方式系统性影响物理推理表现(Physics-IQ 的 v2v>i2v 与本文的接口类分析互证)。
仍属推测的机制:表面参数随机化对「防感知捷径」的具体贡献量(论文未做去随机化消融);OP/OS 表征分离假说(族内排名的宽置信区间只能给出趋势);「训练契约与推理协议一致」相对于纯数据量的贡献拆分(无同规模通用数据对照微调)。
优势成立的条件:任务与训练分布同构(考纲内提升显著);接口类为真续写(跨类比较时参考生成模型仍占优);匹配分辨率下比较(原生高分辨率的商业化模型在 720p 指标上仍有优势)。
可能失效的条件:分布外场景(真实拍摄视频、非 Blender 渲染域);需要精确接触动力学的任务(OS-3 已暴露);若未来参考生成模型学会严格保持输入物体身份,其 OS 类优势可能进一步扩大。作者自己标注的最大限定:跨架构比较不能把差距全归因于训练数据。
七、必要知识反推
假设一个零背景的人要复现这项工作,最少需要掌握什么?
领域知识层
- 认知科学谱系:从 Piaget 的建构论到 Baillargeon 的 VoE 范式再到 Spelke 的核心知识理论——不理解这条线,就无法解释「为什么是这六个任务族」以及 OP-1/OS-1 的命名由来。没有它,任务设计就退化为随手摆场景。
- 发展心理学实验的操作化能力:知道「违背预期」如何转译成「要求模型生成合理续写」,知道遮挡时长、容器交换次数这类实验变量如何映射为结构参数。
方法论知识层
- 视频扩散模型与 V2V 微调:Cosmos3 的 tokenizer、扩散目标、条件机制——PWM-WROP 只改训练信号的前提是理解哪里能改、哪里不能碰。
- 基准设计方法论:结构参数与表面参数的分离、固定考题与训练语料的隔离、防记忆化与防捷径的设计原则——这些是数据基础设施可信的根基。
- 评测统计学:Bradley–Terry 模型、Elo 标度、按评分员聚类的自举置信区间、位置偏置与注意力检查——人评不是「找 20 个人打分」那么粗糙,它本身就是一门测量学。
工程知识层
- Blender 参数化生成与渲染管线(4.4.3、EEVEE Next、随机种子控制、并行生成与自动校验);
- 分布式训练工程:FSDP2 + 张量并行混合分片、reduce-scatter 优化、多张量优化器、数值一致性验证——附录 B 的工程记录本身就是一份 Trainium2 移植手册。
知识融合的关键节点
三个化学反应点。节点一:认知范式 → 数据规格——把 Baillargeon 的实验示意图翻译成 Blender 生成器的结构参数集,这是心理学与图形学的接口。节点二:切分点对齐 → 训练目标——意识到「在关键事件处切半」既是评估协议也可以直接成为训练契约,评估设计与训练设计在此合一。节点三:接口分类 → 排行榜解释——把 14 个异构模型按「与条件片段的关系」重新归类,使 Elo 差异从噪声变成结构信号。没有这三次融合,论文只是「用 Blender 造数据然后微调」的普通工程;有了它们,才成为「认知科学驱动的可训练基础设施」。
八、论文中可以提取的通用性灵感
灵感一:把「考幼童的题」变成大模型的专项训练数据。 核心思想:一个领域最古老、最基础的先验知识(通常因为「太基础」而被高级基准忽视),可以被操作化为大规模合成训练数据,系统性注入模型。 论文证据:六任务族直接移植 Baillargeon 实验范式,150 万样本微调带来真续写类 +222.5 Elo。 推广场景:因果时序推理(先 A 后 B 才合理)的合成数据训练 LLM;机器人学的「物体永久性」先验注入视觉策略网络;具身 agent 的空间参照系更新训练;甚至代码模型的「变量作用域持续性」类比训练。
灵感二:结构参数与表面参数分离,是合成数据的防作弊设计。 核心思想:生成训练数据时,把「决定任务本质难点的变量」与「纯表象变量」显式解耦,后者彻底随机化——模型就无法用捷径绕过你真正想教的能力。 论文证据:每个生成器的光照/材质/相机随机化但物理内核不变,附录 A 的 150 个生成器均按此双轨设计。 推广场景:数学题生成器中随机化数字与语境但保持题型结构不变;安全测试中随机化措辞但保持攻击意图不变,防止对齐微调只学到表面模式;任何「防数据污染」的评测集构造。
灵感三:评估「接口/协议」与能力同等重要——先分类再比较。 核心思想:当比较异构系统时,系统与任务的「接入方式」(接口类)往往是比规模更强的解释变量,不控制它得出的排行榜是误导性的。 论文证据:14 模型按三接口类分层后,编辑/迁移模型因协议性天花板挤在中游,PWM-WROP 的类内登顶才有了正确解读。 推广场景:LLM 排行榜按「上下文接入方式」(检索增强 vs 长上下文 vs 微调注入)分层;Agent 评测按「工具接入协议」分类;RAG 系统比较时区分「检索可见」与「闭卷」设定。
灵感四:裁判可能带有被测能力的同款缺陷——用盲测人评对冲自动指标。 核心思想:当自动评估器(VLM 评分)自身缺乏被测能力(核心知识)时,其评分系统性不可信;应回归受控的人评(盲测、成对、统计拟合)并辅以质检。 论文证据:论文以三篇文献论证 VLM 的核心知识缺陷,主指标采用 20 人盲测 BT-Elo,注意力检查与自举 CI 齐备。 推广场景:对齐评估中人审对 LLM-as-judge 的校准;生成代码的安全审计不能只靠模型自评;长尾知识问答的评测设计。
灵感五:训练契约与推理契约对齐,是领域微调的隐形杠杆。 核心思想:微调数据「怎么切、怎么给条件」与部署时「怎么用」完全一致时,同样数据量能兑现更大提升——错位的微调则存在隐性折扣。 论文证据:PWM-WROP 直接以 V2V 契约训练(57 条件帧+60 预测帧),训练几何即评测几何。 推广场景:Agent 微调数据按推理时的多轮工具调用格式打包;代码模型的填空训练与 IDE 补全场景对齐;语音模型训练切片与流式推理窗口对齐。
附录:关键数字速查
- WROP:150 生成器 / 六任务族(OP-1 至 OS-3)= 90 OP + 60 OS;1.5M 训练样本(每生成器 1 万);300 题固定考试(每生成器 2 题)
- PWM-WROP:Cosmos3-Nano 16B 微调,1 epoch,117 帧(57+60)320×192;Trainium2 48XL,tp4×FSDP2 over 64 NeuronCores,step 15.1s → 5.7s
- 总榜:PWM-WROP Elo 1679.5(第 3/14,真续写第 1);Wan 3.0 Prime 与 MiniMax H3 并列 1723.6;Grok Imagine 1457.0(+222.5 差距);自举 Top-1 概率 12.3%
- 自动指标(320×192):LPIPS 0.081 / MS-SSIM 0.921 / MSE 2.97×10⁻³ 最优;CLIP 0.956 第二;FID 20.4(720p 上 4 倍上采样所致偏低)
- 族内:OP-2 第 1(1785)、OS-3 第 8(1394)——OP 强 OS 弱