Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning —— 精读
论文链接:https://arxiv.org/abs/2608.27549
代码:https://github.com/mirros-lab/code-as-world
项目页:https://mirros-lab.github.io/code-as-world | 博客:https://mirros.ai/blog/representing-physical-world
发表时间:2026 年 8 月 27 日(arXiv:2608.27549v1),MirroS Technical Report
发表机构:MirroS(企业)、清华大学、北京大学、南洋理工大学(企业+高校合作,项目负责人为 Jialong Wu)
备注:论文开篇引用《白鲸记》“一切可见之物,皆如纸糊的面具”——恰是全文主旨:现象是面具,机制才是脸。
一、论文背景
1.1 VLM 会"描述"物理,但不会"解释"物理
现代视觉语言模型(VLM)在海量图文/视频数据上训练,能认出物体、叙述运动、用自然语言解释五花八门的物理现象。但论文指出一个关键裂缝:描述一个现象不等于恢复产生该现象的机制。真正的物理智能要求模型越过"看到了什么",把握系统的结构——物体状态、物理参数、支配动力学、以及对干预的响应。
这就是论文提出的现象-机制二分法:
- 现象描述"发生了什么";
- 机制解释"为什么发生",并预测"换个条件会发生什么"。
一个只会预测下一帧像素的模型,不需要区分场景变化是相机移动还是物体移动、物体是被遮挡还是消失了——多种互相矛盾的内部解释都能产生"看起来合理"的未来,只要像素预测够准。视觉上合理的未来,不一定是物理上正确的未来。
1.2 三种现有世界表示各有致命短板
论文第二章系统梳理了三类主流物理世界表示(这一梳理本身就很有教学价值):
像素:视频生成模型通过预测未来观测学习时间动态,生成越来越逼真。但观测预测不要求显式表示视觉变化的底层原因——持久物体身份、状态转移、交互、视角变化这些因素没有被解耦,矛盾解释可以共存。
3D 重建:NeRF、高斯泼溅、DUSt3R 这类方法恢复几何、视角与外观,信息保持能力强。但"可重建"不等于"可解释"——一个能忠实重现观测的隐式表示,可能把持久结构、动态变量、外观因素纠缠在一起。恢复一个物体的 3D 几何,并不能解释它为什么在支撑物撤走后会掉落。重建保留了信息,却没有自动 uncover 支配世界演化的因果因素。
自然语言:“一个人拿起杯子"这样的描述紧凑、可组合、可迁移。但语言天生难以表达物理状态的连续与定量侧面——精确几何、轨迹、接触关系、物理参数,很难用少量离散 token 编码准确。语言是好的语义接口,不是完整的物理状态表示。
三者互补:像素保细节、3D 保结构、语言保语义。但物理智能需要的是三者的合体——像语言一样语义化、像重建一样结构化、像生成模型一样能模拟时间演化。
1.3 一个具体而棘手的应用:定量物理推理
论文选了一个能暴露上述短板的任务做试金石:定量物理推理(QuantiPhy 基准)——给 VLM 一段单目视频和一个物理先验(如"台球直径 57.2mm”),要求它推断物体的真实尺寸、位移、速度、加速度等带单位的世界空间数值。这与"语义物理问答"(答个大概、靠常识凑)截然不同:模型必须把视觉证据与底层世界的度量状态连接起来。而真实视频几乎不带有这类物理量标注——监督信号从哪来,是这个任务的根本瓶颈。
二、论文定位和关联工作
(以下梳理自论文 Related Work 章节。)
物理理解与推理。 该领域从空间推理(恢复几何结构与物体关系)发展到物理问答(理解属性、交互与可测物理量),再到直觉物理(物体恒存性、动力学合理性期望),以及交互式物理环境中的任务求解。论文的判断是:现有工作主要通过任务特定的输出评测物理理解,而物理实体、状态与机制的底层表示仍是隐式的——Code-as-World 正面补这一块。
代码作为世界表示。 在虚拟环境方向,代码世界模型让程序充当可生成、可修改、可评估的环境引擎(如 WorldCoder 用写代码+环境交互建世界模型、面向游戏通玩的 Code World Models、面向 ARC-AGI 的可执行世界模型)。在物理内容创建方向,对象级有 3D 资产与程序化生成基准,场景级有可编辑室内场景的程序化表示;更近的工作把代码驱动表示扩展到物理动力学与可执行仿真。论文指出这些工作的共同局限:聚焦静态场景结构,没有解决"从真实观测抽象物理机制为可执行表示"这一更根本的逆问题。
Agentic 优化与发现。 编码 agent 已能通过进化搜索+自动评估发现更优算法;类似思路扩展到自动化学术实验、机器人技能发现、视觉环境可执行表示生成。Code-as-World 呼应这一趋势:把"可执行世界假设"当作待发现的工件,通过对语言/视觉证据的仿真与验证迭代精化。
定位一句话:前人要么用代码表示虚拟世界或静态场景,要么研究怎么从观测生成代码资产;本文做的是把"从真实多模态观测逆推物理机制"本身agent化、可验证化,再让产物反哺 VLM 训练。
三、问题定义
论文实际上解决了两个嵌套的问题:
问题一(表示逆问题):给定不完整的多模态观测 ξ(一段自然语言描述,或一段真实视频),如何恢复一个既与观测一致、又显式编码物理机制的紧凑世界表示 p?这是典型的逆问题——从果(观测)反推因(机制)。
问题二(监督生成问题):定量物理推理需要"视频+精确物理量标签"的训练对,但真实视频没有物理量标注。如何规模化地生产可靠监督?
论文的答案是让问题一的输出成为问题二的解:一个验证过的可执行世界在运行时会吐出带精确世界坐标的完整状态轨迹——尺寸、位置、速度、加速度都可以直接从轨迹里读出来,标签免费且任意可采。
形式化地,一个可执行世界表示(EWR)p = (C, E, A) ∈ P_exec:
- C(物理组成):世界里有什么——场景中的物体、几何、度量尺寸、质量/摩擦/重力等物理属性;地板、桌子、墙等环境结构也作为静态实体参与支撑、接触、碰撞;
- E(动态演化):世界如何随时间展开——初始状态、时间变化、关键事件、仿真时长;给定 E 可把 C 展开为完整状态轨迹,产生接触、碰撞、速度变化、终止条件等事件;
- A(视觉外观):世界如何被观察——相机参数、背景、材质、光照、帧率、分辨率、渲染配置;A 不改变物理过程,只决定轨迹如何被视觉呈现。
三个组件可独立检查、修改、执行——改一个物体的质量或相机角度,其余结构不变。这种可分解、可干预、可执行的性质,正是"机制表示"区别于"现象记录"的地方。
四、问题解法
4.1 溯因式的 Agent 发现环
从部分观测恢复 EWR 被建模为溯因推理——像从日心说到牛顿定律的科学发现那样:在满足简约原则的前提下,搜索最能解释证据的假设。具体实现为一个五步循环(预算 K=5 轮):
I. Propose(提出/修订假设):agent 基于证据 η、当前假设 p 和上一轮的结构化反馈 Δ,提出或更新 EWR。
II. Instantiate(实例化):把 EWR 编译成符合仿真器接口的参数 θ。
III. Execute(执行):在 MuJoCo 中运行,产生完整状态轨迹 τ——显式记录物体状态、接触、碰撞与事件结果,让世界假设的时间与因果后果直接可查。
IV. Render(渲染):把 τ 渲染成预测观测;视频输入时还额外投影出深度图、实例掩码、图像平面轨迹。
V. Verify(验证):在关键帧上比对预测与输入证据。文本输入比语义与物理约束;视频输入联合比对 RGB、深度、掩码、轨迹。帧级差异聚合成 Δ,指导下一轮局部修订相关组件。解释充分且简约则接受,否则继续,预算耗尽则拒绝。
4.2 两种模态的证据适配器
文本驱动建世界:从文本抽取实体、空间关系、物理事件、预期结果组成结构化语义证据。文本很少能完全确定几何与物理参数,agent 用物理先验+合理默认值初始化,再经仿真与语义验证渐进修正。下游应用中还会用视频生成模型做 sim-to-real 转换:在保持物理轨迹与世界状态对齐的前提下,丰富物体、材质、背景、光照。
视频驱动抽象世界:从真实视频抽取深度图(约束空间结构与相对距离)、实例掩码(物体边界与几何范围)、目标跟踪轨迹(时间对应与图像平面运动)作为视觉证据;对每个分割出的物体用 SAM3D 生成 mesh,结合深度与跟踪证据恢复物体的空间位置、尺度与动态状态,构建可执行 3D 场景。候选 EWR 的 rollout 投影回输入视角,与观测几何/深度/掩码/轨迹迭代比对修正。工具链:SAM3(掩码/跟踪)、VGGT-Omega(深度与相机几何)、SAM3D(物体几何)。
值得注意的是引擎可互换:MuJoCo 平台上实现了动画引擎(用随时间变化的位姿运动学描述运动)与物理引擎(用刚体、力、接触、约束导出运动)两种可插拔执行后端,发现环在两种引擎下都有效(附录 C.2 用物理引擎复验了全部五项指标)。
4.3 应用侧:两阶段课程训练 Code-as-World-VL
阶段一:图像空间测量接地(SFT)。定量推理的前提是会"量"。把 RefCOCO 系列(含 RefCOCO+/g/RefCLEF)的边界框和 GOT-10K 的密集跟踪轨迹转成像素级问答对(物体的宽/高/对角线像素数、某时刻的位移/速度/加速度,中心差分公式计算),共 73,335 个样本做监督微调——先教会模型定位、测量、跟踪。
阶段二:世界空间物理校准(GRPO)。用验证过的 EWR 生成世界空间 VQA:从 EWR 记录中采样目标物体、时间戳、物理量、单位(可提供已知世界值的参考量做尺度先验),答案直接从场景几何与状态轨迹读出——精确到不需要人工标注。文本驱动(1,585 条)与视频驱动(988 条)合成统一世界级训练集,用 GRPO 优化,奖励为尺度归一数值精度加单位/格式辅助奖励:r = exp(−|ŷ−y|/(|y|+ε)) + λ_u·r_unit + λ_f·r_fmt。
两种监督互补:文本世界提供完全可观测的精确状态,视频世界更贴近真实观测的外观与运动分布——联合训练兼得"物理精确"与"视觉泛化"。
五、评估指标与实验证据
5.1 发现环本身:迭代修正优于独立采样
视频驱动世界重建质量(K=5 轮,与同预算 Best-of-5 独立采样对比):五项指标全部随轮数单调改善,第 5 轮时 Visual Alignment、Object IoU、Traj-ADE、Accuracy@2%D 均超过 Best-of-5——迭代反馈比同样计算预算下的多次独立尝试更高效。
5.2 sim-to-real:视觉变真实且运动保持忠实
文本驱动世界的仿真渲染 vs 视频生成模型重渲染:
| 视频类型 | JEDi ↓ | TRAJAN MMD ↓ | Traj-ADE ↓ | Velocity-ADE ↓ | Accuracy@2%D ↑ |
|---|---|---|---|---|---|
| 仿真渲染 | 3.000 | 406.9 | 0.404 | 78.81(此列越低越好) | 1.682 |
| sim-to-real 视频 | 1.484 | 185.3 | 0.472 | 77.49 | 1.677 |
JEDi/TRAJAN 衡量与真实视频分布的接近度(重渲染后分布距离大约减半),Traj-ADE/Velocity-ADE 衡量与仿真器真值轨迹的一致性(基本不变)。重渲染让视频看起来真实,却没有实质改变 EWR 规定的物理演化——这正是"标签依然可靠"的实证。
5.3 主战场:QuantiPhy 定量物理推理
QuantiPhy-validation(159 题)按先验类型×空间设定分四个子集(2S/2D/3S/3D:2/3 为平面/含深度设定,S/D 为静态先验如尺寸/动态先验如速度),指标为 MRA(Mean Relative Accuracy,在十个从 10% 到 95% 逐渐严格的相对误差阈值上累积计分):
| 模型 | 规模 | 2S | 2D | 3S | 3D | 平均 |
|---|---|---|---|---|---|---|
| Gemini-3.1 Flash | – | 49.4 | 47.5 | 61.4 | 61.1 | 54.8 |
| ChatGPT-5.1 | – | 56.9 | 34.6 | 45.6 | 56.4 | 48.4 |
| Gemini-2.5 Pro | – | 45.9 | 38.6 | 40.7 | 60.2 | 46.4 |
| Grok 4.1 (Fast) | – | 23.4 | 30.5 | 46.3 | 46.8 | 36.8 |
| Qwen3-VL-32B-Instruct | 32B | 38.1 | 39.7 | 39.8 | 43.0 | 40.2 |
| InternVL-3.5-30B | 30B | 33.1 | 33.0 | 31.4 | 44.7 | 35.5 |
| Qwen3-VL-8B-Instruct | 8B | 17.2 | 27.6 | 36.0 | 48.3 | 32.3 |
| Code-as-World-VL-4B | 4B | 45.4 | 55.4 | 45.8 | 56.0 | 50.6 |
| Code-as-World-VL-9B | 9B | 55.0 | 52.9 | 55.6 | 58.1 | 55.4 |
| Code-as-World-VL-27B (Reasoning) | 27B | 48.7 | 62.4 | 60.5 | 62.8 | 58.6 |
关键读数:
- 9B(55.4)超过最强专有模型 Gemini-3.1 Flash(54.8)与 ChatGPT-5.1(48.4),比同量级最佳开源 Qwen3-VL-8B(32.3)高 23.1 分;
- 4B(50.6)超过 32B 的 Qwen3-VL(40.2)——8 倍参数规模的优势被数据配方抵消;
- 27B 推理变体 58.6 超全部基线。作者诚实地注明:规模与响应协议同时变化,27B 结果应读作"框架可扩展到更大推理模型"的证据而非推理本身的受控效应。
图像空间测量(第一阶段能力的直接检验,9B):RefCOCO 68.3、RefCLEF 61.9、GOT-10K 26.6,全部超过 Qwen3-VL-32B(49.1/32.5/15.8)等更大的模型;且完整模型在全部五个图像空间基准上高于自己第一阶段(Image-Space 变体)的成绩——世界空间训练反哺了图像空间测量,两阶段互相强化。
5.4 数据源消融:两种世界监督互补
| 训练变体(9B) | 2S | 2D | 3S | 3D | 平均 |
|---|---|---|---|---|---|
| 仅图像空间 | 44.3 | 51.9 | 51.4 | 60.0 | 50.9 |
| + 文本驱动世界 | 47.2 | 48.1 | 53.5 | 61.1 | 52.5 |
| + 视频驱动世界 | 43.1 | 50.5 | 57.4 | 61.5 | 53.1 |
| 全量(文本+视频) | 55.0 | 52.9 | 55.6 | 58.1 | 55.4 |
单一世界源各加约 1.6~2.2 分,两者合并再涨至 55.4。精确仿真监督与真实分布对齐提供的是不同信号。
5.5 推理过程展示:模型学会了"测量-校准"链
27B 推理变体在 QuantiPhy 上的自由形式思考链展示了可解释的解题结构。自行车例:先由两个时刻的车-相机距离算出径向速度 0.33 m/s,再由图像平面横向轨迹(约 210 像素/秒)结合平均深度约 23.4m 校准出横向速度约 5.5–6.8 m/s,最后合成总速约 6 m/s(真值 5.33,MRA 0.8)。注意训练只用了结果奖励——“图像空间测量→深度/透视→世界空间校准"的策略是模型自己涌现的,没有被过程监督强制。
六、效果优势的根源解释
把"方法差异→机制变化→指标提升"的因果链完整建立起来:
方法差异一:显式机制表示取代现象级表示。 像素预测/3D 重建/语言描述都不显式编码"支配世界演化的机制”(现象-机制二分);EWR 把组成、演化、外观分开编码为可执行程序。 → 机制变化:执行 EWR 产生带精确世界坐标的完整状态轨迹,物理量(尺寸/速度/加速度)可直接从轨迹读出,不再需要人工标注或不可靠的估计;表示本身可干预(改初速、改相机),反事实世界免费生成。 → 指标提升:1,585 文本驱动 + 988 视频驱动的世界空间 VQA 以近乎零标注成本生产出来,GRPO 直接优化"测量-校准"链路——9B 在 QuantiPhy 上 55.4,超 Gemini-3.1 Flash;消融显示世界监督贡献 55.4−50.9=4.5 分(9B 全量 vs 仅图像空间)。
方法差异二:发现是迭代验证的闭环,而非一次性预测。 世界表示的恢复是逆问题,一次前向生成极易错。 → 机制变化:propose–instantiate–execute–render–verify 环让每个假设的时序与因果后果可检查,差异 Δ 定位到具体组件做局部修订——错误被逐轮修正而非一次性掷骰子。 → 指标提升:第 5 轮在 Visual Alignment/Object IoU/Traj-ADE/Accuracy@2%D 上全面超过同预算 Best-of-5;换物理引擎复验趋势不变(附录 C.2),说明增益来自"反馈修订"这一机制而非特定引擎的运气。
方法差异三:物理过程与视觉呈现解耦。 世界演化由仿真器保证,真实感交给视频生成模型(sim-to-real)。 → 机制变化:重渲染只改变外观分布,不改物理轨迹——“好看"与"标签准"不再互相牵制。 → 指标提升:JEDi 3.000→1.484、TRAJAN 406.9→185.3(分布更真实),同时 Traj-ADE 仅 0.404→0.472、Velocity-ADE 甚至 78.81→77.49(运动忠实度保持)——训练视频既贴近真实分布又保留精确标签。
方法差异四:两阶段课程 + 双源监督。 先 SFT 学图像空间测量(地基),再 GRPO 学世界空间校准;文本世界给精确性、视频世界给真实性。 → 机制变化:测量能力是校准的前提(不会量像素就谈不上换算米);双源互补让模型同时学到精确物理信号与真实视觉分布。 → 指标提升:仅图像空间 50.9 → +文本世界 52.5 → +视频世界 53.1 → 全量 55.4(9B);且完整模型在全部图像空间基准上反超第一阶段自己——两阶段互相强化而非此消彼长。
七、必要知识反推
读透这篇论文需要(或能顺带建立)以下知识:
- 现象与机制的哲学区分:论文引用 Machamer 等的"Thinking about mechanisms”——机制是产生现象的实体与活动组织。理解这一区分是理解一切"世界模型 vs 视频生成"争论的钥匙。
- 溯因推理:与演绎(从一般到特殊)、归纳(从特殊到一般)并列的第三种推理——从果反推最佳解释。科学发现(日心说、牛顿定律)的经典模式。发现环的每一轮就是一次小型溯因。
- 逆问题:观测是果、机制是因,从果求因通常病态(多解)。迭代假设-验证-修正是标准的应对策略,与贝叶斯科学发现的计算模型同构。
- 物理仿真器与 MuJoCo:刚体动力学引擎,输入物体几何/质量/摩擦/初始状态,输出完整状态轨迹。动画引擎与物理引擎的区别:前者描述运动学(什么在动、怎么动),后者从力学导出运动。
- MRA 指标:在 10%、20%…90%、95% 十档相对误差阈值上累积给分的平均相对精度,比单一阈值更全面地刻画数值预测质量。
- GRPO:组相对策略优化,DeepSeekMath/R1 系列使用的 RL 算法,对同一提示的多个 rollout 做组内归一化算优势,无需独立 critic。
- sim-to-real 与域随机化传统:机器人学的经典难题(仿真训练→真实部署的分布差距)。本文的变体:仿真保物理、生成模型保真实感,是一种"分工式"sim-to-real。
- 轨迹评估指标族:Traj-ADE(平均位移误差)、Accuracy@2%D(误差在 2% 帧对角线内的比例)、JEDi/TRAJAN(基于视频/运动特征的分布距离 MMD)——衡量"重建准"与"生成真"的两套标尺。
八、通用性灵感
- “代码作为世界表示"是一层可组合的中间抽象。 像素太细、语言太粗、3D 缺动力学,代码恰好卡在中间:有语义(可读)、有结构(可分解)、有动力学(可执行)。这个设计原则可以迁移到任何需要"既可解释又可仿真"的领域表示——金融系统、生物通路、软件系统本身。
- 逆问题 agent 化:把"预测"变成"假设-验证-修订"的循环。 凡是输出需要满足可检验约束的任务(生成配置文件、写 SQL、建因果模型),都可以套用 propose–execute–verify–refine 环:让每个候选假设的后果可执行、可观测、可与证据比对,反馈 Δ 定位修订。论文证明这个环比同预算的多次独立采样(Best-of-5)更划算——验证信号比采样数量更值钱。
- 标签稀缺时,造一个"会自动出题的世界”。 监督学习的瓶颈常在标注;EWR 的思路是构建一个生成器,让答案作为执行的副产品免费产出。这与"可验证奖励"(RLVR)一脉相承但更进一步:不只奖励可验证,连题目本身都可合成、可任意采样密度。
- 把"忠实"与"逼真"分给不同的组件。 物理由仿真器保证、外观由生成模型负责——两个正交维度解耦后各自做到最好。视频生成、世界建模、数字孪生领域都能借用这种"结构-外观分离"架构。
- 两阶段课程(先测量后校准)是教"定量推理"的通用脚手架。 模型先学会在图像空间"量",再学换算到世界空间"算"。任何需要感知-符号换路的任务(UI 元素定位→操作语义、音符识别→乐理分析)都可以设计类似的"底层技能先行"课程。
- 论文自陈的边界同样有启发:模型学到的是世界表示的产物,发现环本身仍是外挂的 agent 能力——“内化发现过程"是明确的下一步。这提示了一个研究方向:把 propose-verify 循环蒸馏进模型自身,让 System-2 式的假设检验成为模型的内生能力。
一句话总结:Code as Worlds 给出了一个优雅的三段式答案——用可执行代码统一物理世界的"有什么、怎么演化、长什么样”;用溯因式 agent 发现环把"理解世界"变成可迭代验证的搜索问题;再让验证过的世界自动量产精确物理监督,最终用 9B 模型在定量物理推理上越过了最强的闭源巨头。现象是纸糊的面具,代码写下的机制才是脸。