论文链接:PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives 代码仓库:github.com/kxding/PlayWorld(数据集与排行榜见 HuggingFace jocelynd/playworld-bench) 发表时间:2026年8月 机构:快手可灵团队、香港中文大学、香港大学、浙江大学(Hengshuang Zhao 为通讯作者)——典型的企业+高校合作:快手提供世界模型与场景资源,高校团队主导评测范式设计 领域标签:cs.CV / 世界模型评测 / Agent 交互

一、论文背景:世界模型很火,但没人能"公平地"给它们打分

先解释几个基础概念。

**世界模型(World Model)**是一种 AI 系统:给定当前画面和用户的动作输入,它预测并生成"下一刻的世界长什么样"。你可以把它理解成一个"AI 游戏引擎"——不用程序员手写物理规则,模型直接从数据里学会了"按前进键画面会向前移动"“撞到墙应该停下来”。DeepMind 把世界模型视为通往 AGI 的重要阶梯:它既能模拟环境演化,也能预测自身行动的后果,还能为其他 AI 智能体提供无限量的训练环境。

可交互视频世界模型是 2025 年以来最热的方向。2025 年 8 月 DeepMind 发布的 Genie 3 首次实现实时交互:输入一句话,就能以 720p、24 帧每秒生成可供自由探索的 3D 世界,并能维持数分钟的一致性。随后各家模型(快手的 LingBot 系列、腾讯的 HY 系列、开源的 Matrix-Game 等)密集涌现。

问题来了:模型多了,怎么比较谁更好? 现状是每个模型在自家私有基准上自测——YUME 有 yume-Bench,Matrix-Game 有 GameWorld Score,HY-GameCraft-2 有 InterBench——场景、轨迹、指标全不一样,跨模型比较几乎不可能。

更隐蔽的坑是:即使大家用同一套固定动作序列去测(前序工作 WorldMark 就这么做),也不公平。因为每个模型的动作粒度和控制映射完全不同:同样三条"→“命令,在 A 模型里角色已经转了 360°,在 B 模型里才转了一半。论文举了个具体例子:围绕金沙酒店做 360° 环绕时,有的 rollout 里酒店转完一圈会"重新出现”(几何一致),有的模型根本没转满一圈,酒店自然不会重现——这时你给两个模型打几何一致性分数,比的根本不是同一件事。

其实人类玩家早就会评测世界模型了:转一圈看环境有没有变、走进水里看有没有涟漪。这种评测的本质是"带着长时程目标去交互",动作序列只是达成目标的手段。PlayWorld 的出发点就是把这种人类直觉自动化、标准化。

二、论文定位和关联工作

这个方向的前序工作可以分三条谱系:

谱系一:视频质量评测。VBench/VBench++ 把文生视频/图生视频拆成十几个维度打分,EvalCrafter 用 17 个客观指标校准用户偏好。它们指标很成熟,但完全没有"动作控制"概念——只能评测"画面好不好看",测不了"世界听不听话"。

谱系二:物理与一致性评测。PhyGenBench 覆盖 27 条物理法则,WorldScore 用 SLAM 重建检查 3D 一致性,4DWorldBench 检查 4D 时空一致。WorldScore 的无人机巡览视角是被动相机路径,与人类"按键驱动"的交互方式相去甚远。

谱系三:交互式评测(最接近的竞品)。WorldMark 提供统一场景 + 固定 WASD 动作序列 + 动作映射层,实现了"相同输入下的跨模型比较";WBench 做多轮交互评测;World-in-World 搭建闭环平台;Omni-WorldBench、MemoBench 各有覆盖。但它们共同的软肋是:没有闭环自适应——固定动作序列无法保证每个模型都真正"完成"了目标。

对比项WorldMark / WBench 等PlayWorld
输入图像 + 固定动作序列图像 + 目标(Objective)
闭环自适应✗✓(Agent 在线决策 Keep/Stop/Extend/Correct/End)
长时程重访部分✓(360° 环绕、离开再回来)
状态演化部分覆盖✓(视野外演化 + 洞察演化双维度)
跨模型公平性统一动作,但轨迹不可比每个模型以其最适动作完成同一目标

定位结论:PlayWorld 是首个**“以目标为共享变量、以动作为自由变量”**的可交互世界模型评测基准——它把前序工作"统一输入"的公平观升级为"统一目标、各展所长"的公平观。

三、问题定义

论文的核心洞察是一个视角反转:可比的对象不是"动作序列",而是"目标"。

  • 具体问题:不同模型控制接口异构、动作粒度不同,固定动作序列无法公平评测。
  • 抽象问题:只要每个模型都被允许用自己的方式完成同一个可视觉验证的目标,评测的就是世界模型本身的能力,而非动作接口的兼容性。
  • 形式化:给定初始世界 $w_0$、长时程目标 $g$(附可视觉验证的完成条件)、交互预算 $T=40$ 步,求策略 $\pi_M$(依附于被测模型 $M$ 的动作空间)使 rollout 轨迹达成 $g$;随后由评分函数 $S: \text{rollout} \to [1,5]^4$ 在四个维度打分。
类比深度学习PlayWorld
待评对象模型架构世界模型
训练自由度超参数可各选动作序列可各选
固定的东西训练目标/损失长时程目标 + 评分标准
评的是泛化能力世界模拟能力

这个抽象的精妙之处在于:它不再纠结"怎么统一动作",而是问"什么才是跨模型不变量"——答案是目标。就像考试应该统一考题而不是统一解法。

四、问题解法

整套系统分三层:场景与目标构建 → Agent Player 闭环交互 → 四维度 VQA 打分。

4.1 场景与目标:171 个"考题"

每个 case = 初始世界(一张图)+ 场景锚定目标 + 基础动作序列。图像从 Pexels/Google Images 收集,覆盖自然、城市、奇幻环境与六类主体;Gemini 3.1 Pro 生成环境描述后由人工校验,标注者再定义目标、完成条件和样本级 VQA 评分细则。共 171 个人工标注案例、50 种动作模式(单一动作到 5 动作组合),rollout 时长 10–60 秒,最终产出 1417 个交互视频、820 多个 VQA 问题。

四类典型场景对应四个维度:几何一致性用"可重访的视觉锚点"(文字招牌、形状独特的建筑);交互保真度用"走入水/火/悬崖/草地";视野外演化用"消失–重现期间持续变化的过程"(削苹果、画画);洞察演化用"无明确动作轨迹的长时间可见过程"(顾客排队、厨师摆盘)。

4.2 Agent Player:会看画面、会改主意的"考生"

Agent Player 是一个可替换的多模态智能体(正式实验用 Claude Haiku 4.5,选它是因为决策延迟最低——3.83 秒/次)。它的动作空间是通用的 WASD/方向键/WAIT,由接口层翻译成各模型的原生控制格式;对 Genie 3、HappyOyster 这类只能网页访问的闭源模型,通过浏览器自动化派发控制并截帧。

每个案例提供人工标注的基础动作序列作为共享初始参考(类比"考前发的参考解法"),Agent 在执行中每步观测画面、已执行动作、场景描述与目标,做出五种在线决策:

决策作用
Keep按计划继续
Stop观测到预期视觉状态,提前结束当前动作
Extend移动不够,延长动作时长
Correct画面与参考不符,修正或跳过下一步
End确认目标及其所需观测已全部完成

两个细节值得注意:其一,涉及障碍物的案例中到达障碍物不触发 End,Agent 会继续前冲,以暴露模型是真实碰撞还是穿墙;其二,消融显示 Genie 3 案例上 Agent 仅修改 12–15% 的动作——适应是有针对性的微调而非推倒重来,“Preset + Agent"组合的轨迹分和人类偏好都优于纯 Preset 或纯 Agent。

4.3 四维度 VQA 评分:怎么给 rollout 打分

评分由 Gemini 3.1 Pro 作为 VQA 评分员,对每个 rollout 回答样本特定的 Yes/No 问题;普通问题权重 1、定义性核心问题权重 2、不适用记 0,$S_d = 1 + 4R_d$ 换算成 1–5 分。四个维度各有前置验证(轨迹有效性/主体可达性),不通过则直接判低分:

维度测什么典型问题
几何一致性Scene Identity(物体身份/数量/纹理/颜色)+ Spatial Consistency(相对位置与布局)360° 转回来,壁画颜色形状还在吗?绿车右边的红车左右顺序对吗?
交互保真度Contact/Collision、Motion/Causality、Visual Response撞墙还是穿墙?入水有没有涟漪、水花、水深变化?
视野外演化重现一致性 + 隐藏状态演化 + 物理因果画画时走开再回来,画布上多了新内容吗?扶梯上的人一直在向上吗?
洞察演化静止长观察下的身份/状态推进、物理合理、时序一致吃掉三个包子中的一个,剩的两个数量外观对吗?

另有视频质量与可控性的基础能力分(Basic Ability Score)作为辅助指标,对应"自动指标只能测基础能力"的发现。

五、评估指标与实验证据

5.1 主结果:9 个世界模型的成绩单(1–5 分制)

模型几何交互洞察演化视野外演化Overall
Genie 3(Google,闭源)2.742.401.511.812.12
HappyOyster(阿里巴巴,闭源)2.542.151.471.541.92
LingBot-World(快手)2.112.231.331.431.78
LingBot-World2(快手)2.042.131.951.161.82
HY-World2(腾讯)2.142.061.131.091.61
SANA-WM1.721.891.131.161.48
Hunyuan-GameCraft-2(腾讯)1.621.521.211.311.42
HY-WorldPlay(腾讯)1.121.631.011.081.21
Matrix-Game-3.01.301.251.001.001.14

关键读数:Overall 最高的 Genie 3 也只有 2.12/5;LingBot-World2 在洞察演化上以 1.95 领跑全场;所有 9 个模型在"洞察演化"“视野外演化"两个维度普遍不超过 2 分——这是论文最重要的实证发现。

5.2 指标可信度:与人类偏好 Spearman ρ = 0.933

自动打分靠谱吗?作者做了人类偏好校准实验:5 名评测者对 120 对匿名视频做四维度两两比较(共 600 个判断),模型身份用匿名代码隐藏。结果 VQA 排名与人类偏好排名的 Spearman 相关系数:Overall 0.933,几何一致性高达 0.983,交互保真度 0.933,视野外演化 0.812,洞察演化 0.745(均 p<0.05);评分者多数一致率 95.8%。这说明自动指标在排名层面高度贴近人类判断——尤其"看得见"的维度最可靠,“演化"类维度相关性偏低也与该维度本身更主观一致。

5.3 消融与辅助指标

  • 控制策略消融:Preset + Agent > Preset Only ≈ Agent Only,证明"共享参考 + 在线适应"的混合设计必要。
  • 轨迹验证通过率:Genie 3 为 87.1%,SANA-WM 高达 80.4% 但 rubric 得分平平;HY-WorldPlay 只有 41.6%。
  • 基础能力分:HappyOyster 最高(76.4)却不是长时程最强的模型。

这三组辅助数据共同支撑了两个论点:分数差异确实来自世界模拟能力而非轨迹执行差异;同时"轨迹控制能力"与"世界模型能力"可以脱钩。

六、效果优势的根源解释(因果链)

要解释的不是"PlayWorld 分数高”,而是为什么这套评测范式能揭示出别的基准测不出的结论,以及为什么被测模型呈现上述格局。

对比对象:固定动作序列评测(WorldMark 类)。它曾经有效,是因为在动作粒度相近的模型间统一输入确实消除了场景差异;它的根本局限在机制层面:把"手段"当成了"变量”,把"目标"当成了背景。动作序列在不同控制映射下语义漂移,导致评测信号中混杂了大量"接口兼容性噪声”——你测到的一部分差异其实是"这个模型转 360° 需要几条命令",而不是"这个世界转完一圈后是否还一致"。

PlayWorld 的根本性改变:把约束从"统一动作"换成"统一目标 + 各自动作"。因果链如下:

  1. 目标驱动 + 在线决策(Keep/Stop/Extend/Correct/End) → 每个模型都能以其原生控制方式真正完成 360° 环绕、入水等目标 → 消除了动作粒度混杂,几何一致性分数重新可比(金沙酒店是否重现,现在比较的是模型的世界记忆而非接口);
  2. End 决策与完成条件绑定 → 只有目标所需观测全部采集到才终止 → 保证打分对象是"完整的任务执行"而非"半途的片段";
  3. 四维度样本级 VQA rubric → 每个案例的问题针对其场景锚点定制 → 避免"通用 VQA 问题与该案例真正要考察的能力错位",这是 Overall 与人类偏好 ρ=0.933 的机制来源;
  4. 障碍物案例禁用提前 End → 主动探测碰撞而非等待失败出现 → 使"穿墙"这类交互保真度缺陷可被系统性暴露。

反事实推理:如果去掉 Agent 在线适应(Preset Only),固定序列在异构模型上必然走不完目标轨迹,重访类测试退化为抽签——消融表中 Preset Only 的轨迹分与人类偏好均低于混合策略,直接验证了该设计的必要性。反过来,若只有 Agent 没有 Preset(Agent Only),Agent 需从零摸索动作语义,效果同样下降——说明共享参考提供的是"动作语义先验",Agent 提供的是"模型特异性校准",两者缺一不可。

对实测格局的解释(为什么演化维度全面≤2):当前视频世界模型的训练目标是逐帧条件生成——每一步只以"近期历史 + 当前动作"为条件预测下一帧,机制上没有任何模块维护跨视野、跨分钟级的全局状态记忆。可见结构(几何一致性 2.74)可以靠局部历史帧维持;而物体离开视野后,生成器对"它此刻应该处于什么状态"无任何持久表征可查,只能重新采样——于是出现"原地不变重现"“错位重现"“被替换"的失败模式。这不是训练不够久的问题,而是架构里根本没有承载长时程状态演化的地方。LingBot-World2 在洞察演化上突出(1.95)而视野外演化垫底(1.16),恰好说明"可见范围内的持续演化"与"不可见时的状态保持"是两种可分离的能力,后者更接近记忆问题而非生成问题。

七、必要知识反推

假设一个零知识的人要完成这项工作,最少需要掌握:

领域知识层:世界模型的运作机制(条件生成 + 动作控制)、各家的异构控制接口(手柄式/WASD/姿态命令)、闭源模型只能网页访问的现实约束——不了解这些就无法理解"为什么固定动作序列不可比”。

方法论知识层:评测学的基本原理(可比性要求控制变量,但该固定的变量是目标而非手段);多模态 Agent 的在线决策循环(观测–决策–执行);VQA rubric 设计与加权计分;人类偏好校准的方法(成对比较、Spearman 相关、Fleiss’ κ)。

工程知识层:浏览器自动化(对 Genie 3/HappyOyster 派发控制并截帧)、动作映射接口层、闭环评测引擎(40 步预算管理、视频与执行记录留存)。

知识融合的关键节点:最大的化学反应在"人类玩家的评测直觉"与"Agent 的在线决策能力"的对接上——作者意识到多模态 Agent 恰好能自动化"带着目标玩游戏"这个本来只有人能做的过程,而"目标"又恰好是跨模型不变量。三个领域知识(评测学、Agent 能力、世界模型生态)在一个洞察点上会聚:让 Agent 替人类当玩家。

八、论文中可以提取的通用性灵感

灵感一:统一"目标"而非统一"手段”,才能公平比较异构系统。 论文证据:固定动作序列导致金沙酒店重现与否不可比;目标驱动交互后几何一致性恢复区分力。推广场景:LLM Agent 评测(统一任务目标而非统一提示词模板)、机器人评测(统一任务而非统一控制序列)、代码生成评测(统一测试用例而非统一生成过程)、多模态模型评测(统一能力目标而非统一输入格式)。

灵感二:让评测系统具备"闭环自适应",静态基准测不出动态系统的真实能力。 论文证据:Preset+Agent 消融全面占优;Agent 仅修改 12–15% 动作即显著提升。推广场景:对话系统评测(评测者根据回答追问而非固定问题序列)、自动驾驶仿真测试(根据被测系统行为生成对抗场景)、教育评估(自适应考试)、红队测试(根据模型反应调整攻击策略)。

灵感三:人类直觉是评测设计的富矿——把"人类会怎么玩"形式化。 论文证据:转 360°、入水看涟漪直接来自人类玩家的自然行为。推广场景:AI 编程助手评测(模仿开发者真实使用流程)、推荐系统评测(模拟用户多轮反馈)、游戏 AI 评测(用真实玩家行为分布出题)。

灵感四:区分"能做动作"与"能维持状态"是评估长时程系统的关键分野。 论文证据:SANA-WM 轨迹通过率 80.4% 但 rubric 得分低;所有模型演化维度≤2 分。推广场景:对话系统(跟随指令 vs 维护对话状态)、具身智能(执行动作 vs 维护环境信念)、操作系统 Agent(单步操作 vs 跨步骤文件状态一致性)。

灵感五:自动指标的价值需用人类偏好校准,且不同维度可靠性不同。 论文证据:ρ 从几何的 0.983 到洞察演化的 0.745 不等。推广场景:任何用 LLM-as-Judge 的评测(先校准再大规模使用)、文本生成评测、代码质量评估。