论文链接:Code World Model: Coding Agent as World Brain 项目主页:https://buaacyw.github.io/cwm/ 发表时间:2026年8月 机构:西湖大学 AGI Lab(Yiwen Chen、Chi Zhang)+ 南洋理工大学(Guosheng Lin)——高校合作 领域标签:cs.CV / 生成式世界模型 / 具身智能 / 编码 Agent

一、论文背景

要看懂这篇论文,先要理解三个概念:世界模型、视频世界模型、编码 Agent。

世界模型是什么? 世界模型的目标是表示一个世界的状态,以及这个状态如何随动作和事件演化——就像在计算机里装一个「平行世界的沙盘」。自动驾驶要预测周围车辆下一步怎么走、机器人要预测推倒积木后桌面会变成什么样、游戏要预测玩家刺杀城主后整座城市如何震荡,都依赖世界模型。它的形式化表达很经典:给定当前状态 $S_t$ 和动作 $A_t$,预测下一状态 $S_{t+1} \sim p(S_{t+1}|S_t, A_t)$,再由状态产生观测 $O_{t+1} \sim p(O_{t+1}|S_{t+1})$。

视频世界模型是什么? 近年最有影响力的世界模型路线是直接学「动作条件的视频生成」:给模型一段历史画面和一个动作(键盘输入、相机转向、语言指令),让它生成下一帧画面。代表工作包括 Genie 系列、GameGAN、Oasis、Matrix-Game 等。这条路线的好处是「所见即所得」——模型从大规模视觉数据中学到丰富的外观、运动和交互先验,不需要手工搭建 3D 资产。

但它有一个从数据形态上就无法绕过的缺陷:视频记录的只是世界动力学的可见结果,而产生这些结果的知识、常识规则、实体间关系、长程规划——这些「机制」本身在画面里是看不见的。论文用了一个很精准的说法:游戏视频的每一帧都是执行固定游戏代码渲染出来的,但产生每一帧的可执行逻辑在渲染后被丢弃了,只能通过稀疏的视觉后果间接观察。更麻烦的是,许多重要的状态变化发生在镜头之外,或者超出模型不到一分钟的训练上下文窗口。于是「玩家离开城市三天,城里发生了什么」这类跨时空的因果传播,对纯视频模型来说几乎不可学。堆数据没用——更多的视频只是更多的「结果」,模型仍要从可见效果反推机制。

编码 Agent 是什么? 它是近年来迅速成熟的一类智能体:能把高层意图翻译成可执行、可复用、可持续修改的代码(如 SWE-bench 上的长程编码系统)。论文的核心洞察是:语言模型从文本和代码中学到的世界知识与推理能力,恰好补上了视频模型缺的那块「机制」——它擅长的正是理解抽象概念、建模复杂关系、推断事件的长程后果。

于是问题变成:如何把「懂规则但不会画画」的语言/编码模型和「会画画但不真正懂规则」的视频模型组织成一个世界模型?这篇论文给出的答案就是 Code World Model。

二、论文定位和关联工作

论文把自己放在三条研究脉络的交汇处。

谱系一:交互式视频世界模型。从 GameGAN(2020)学习动作条件的视觉动力学,到 Genie/DIAMOND 证明生成模型可作为可玩的神经模拟器,再到近期的语言引导模拟、实时可导航世界(Oasis、Matrix-Game 系列、WorldPlay、LingBot-World 2.0 等)。这一系不断强化控制粒度、记忆与 Agent 交互,但建模对象始终是「生成的观测序列」本身——场景状态和交互结果主要由视觉历史、隐上下文或视觉记忆携带。

谱系二:生成式 3D 世界。把生成图像扩展为可导航的网格、高斯泼溅等显式 3D 场景。这条路线空间控制强,但生成质量的天花板被资产与渲染管线锁死,难以走向开放世界。

谱系三:程序即世界模型。WorldCoder 让 LLM 写 Python 程序来建模环境;后续工作用概率程序估计 POMDP、用 MCTS 引导生成转移模型、把状态转移编码为规划器可消费的程序函数。这条线证明世界规则可以外化为可检查、可测试、可修改的代码,但产物是符号系统,没有视觉实现。同期还有编码 Agent 造游戏的系统,但重点是「交付游戏工件」而非「用持久代码作为视觉世界模型的运行介质」。

维度视频世界模型生成式 3D程序化世界模型Code World Model
世界规则载体隐式(视觉先验)资产+模拟器显式代码显式代码(Agent 维护)
视觉实现强受资产限制无视频模型渲染
离屏状态延续难(上下文<1分钟)可但不开放可可(持久可执行状态)
空间控制粒度粗(动作/相机级)强无帧级(proxy)
开放性受训练分布限制受资产覆盖限制高但无画面高(代码可改+视觉先验)

定位结论:本论文不是视频世界模型的增量改进,而是范式级重构——把「谁掌管世界演化」从视频模型手里拿走,交给编码 Agent 与其代码;视频模型降级为「渲染器」。它同时是第一个把「程序即世界模型」谱系与「视频世界模型」谱系用可学习接口连接起来的工作。

三、问题定义

具体问题:如何构建一个能持续、连贯、开放式演化的交互世界——事件的后果(哪怕发生在镜头外、跨越很长时间)必须持续影响后续演化,同时画面要保真、可控、可开放生成。

核心洞察(结构相似性):运行一个复杂世界需要两种频率截然不同的计算——「稀疏而复杂的语义推理」(解读新事件、连接世界知识、规划长程后果)和「密集而重复的确定性执行」(更新位置、属性、碰撞、冷却时间、数值规则)。这两种计算恰好对应两类现成的 AI 系统:前者是语言/编码 Agent 的强项,后者是代码执行的强项。运行世界 ≈ 编译器分层:大脑做慢思考,代码做快执行。

形式化:论文将世界状态分解为两部分:

$$S_t = (S_t^{exe}, S_t^{vis})$$
  • $S_t^{exe}$(可执行状态):世界程序、实体属性、规则、关系、事件历史——可被直接操作;
  • $S_t^{vis}$(视觉状态):外观、运动等由视频模型产生且需跨帧一致的信息。

更新过程解耦为两个耦合方程:

$$S_{t+1}^{exe} = T_{AC}(S_t^{exe}, A_t), \qquad S_{t+1}^{vis} \sim G_\theta(S_t^{vis}, S_{t+1}^{exe})$$

其中 $T_{AC}$ 是「Agent-代码联合转移」(代码高频执行确定性更新,Agent 低频调用/组合/修改机制),$G_\theta$ 是视频模型。

这个抽象的精妙之处在于它把「世界怎么运转」(机制)和「世界长什么样」(实现)在状态层面就分开了——传统公式里 $S_{t+1} \sim p(S_{t+1}|S_t, A_t)$ 是一个黑箱分布,而这里转移函数本身被外化为可检查、可修改的代码。持久性不再依赖记忆检索,而是状态本身就在那里。

四、问题解法

方法分三个组件,每个组件解决一个明确的接口问题。

4.1 编码 Agent 作为世界大脑:Agent-代码循环

类比:像一家公司的 CEO 与制度体系。CEO(编码 Agent)不亲自跑每一笔交易,而是在关键节点做决策——「城市进入紧急状态」——并把决策固化为制度(可执行代码:巡逻机制、继承规则、消息传播);此后制度自动高频运转,直到出现新情况或需要修法时 CEO 才再次介入。

具体运行方式是一个持续循环:交互/事件改变当前局面 → Agent 读取维护中的世界状态,选择调用现有代码或局部修改世界程序 → 代码执行可复用机制、推进大量状态变量(距离、碰撞、攻击范围、冷却、伤害、连锁触发)→ 执行结果、测试与世界反馈作为证据回流给 Agent。关键设计:代码执行频率与 Agent 推理频率、视频生成帧率三者解耦——大规模战斗中代码可以每秒处理上千次实体更新,Agent 只在目标变化、异常、需要新机制时被调用。代码因此「既不是永久冻结的游戏逻辑,也不是独立于 Agent 的控制器,而是 Agent 持续维护的、可执行的、可修改的延伸」。

4.2 Proxy:连接可执行状态与视觉生成的可学习接口

这是全文最核心的技术设计。Agent-代码循环解决了「世界怎么运转」,但留下一个问题:如何把不断变化的世界状态变成视频模型能可靠理解的条件?

先排除两条路:(1) 结构化文本——实验发现即便配专用相机条件通路,现有视频模型仍无法从密集文本中精确控制相机轨迹和实体运动(理论上语言可以描述每一像素,但 token 效率极低且模型跟不住);(2) 完整显式 3D——空间控制强,但构建生产级几何/资产/动画/材质成本高,且过早锁死视觉实现。

Proxy 的设计:一种粗粒度可编程世界表示,编码实体位置、姿态、轨迹、空间关系和相机运动。一个轻量确定性编译器把它光栅化为「proxy 视频」——一段与目标视频帧对齐的低分辨率序列,只表达观测必须遵守的时空结构,不表达纹理、材质、光照等应交给视频模型自由发挥的部分。可以把它理解为视频模型版的「视觉提示词」:文本 prompt 说语义(「水手月在庭院里跳舞」),proxy 视频说时空骨架(角色在哪、怎么移动、相机怎么转)。

**条件带宽(condition bandwidth)**是 proxy 设计的核心权衡:太丰富(如关节级骨架)→ 编码 Agent 在推理时也得控制关节轨迹,当前能力跟不上;太稀疏 → 约束不足。原则是「当前观测必须遵守的最小充分状态」。实现上 proxy 分辨率取目标视频的 1/4(每维),只增加 1/16 的视觉 token,推理开销可忽略。复杂对象可退化为边界框+文本描述身份属性,避免要求 Agent 重建复杂几何。

条件通道传达内容来源
结构化文本身份、外观、动作语义、目标Agent 书写的身份记录+意图
Proxy 视频帧级实体位置/轨迹/布局/相机世界状态确定性编译

4.3 数据管线:对齐的 proxy–观测对

游戏数据:游戏是天然数据源——同一次执行同步产出目标视频和运行时状态。录制时只保留 proxy 所需变量(相机状态、实体位置朝向、近似尺度、场景布局、交互关键状态),不保留完整 3D 模型/纹理。运行时还提供逐像素实例真值图,把文本中每个身份的描述绑定到 proxy 对应区域。同一份录制可重编译出不同覆盖粒度的 proxy,无需重采视频。

真实世界数据:在 KITTI-360 上做了几何辅助的概念验证——用标定相机位姿、累积语义 3D 重建和 3D 物体标注离线编译出对齐 proxy(胶囊骨架表示行人、线框表示车辆、低多边形表示植被),共享深度缓冲光栅化以保证相机运动、空间对齐与遮挡关系。关键优势:不需要动作标签、不需要相机标注——因为动作和相机的效果已经直接表达在 proxy 视频里。

4.4 实现配置(原型)

  • 视频底座:MiniMax-H3 Ref2VA,全 50 个 transformer 块加 rank-128 LoRA(约 5.96 亿可训练参数);
  • 数据:157 段 GTA V 游戏录制,约 5.6 小时源视频,采样 9,420 个 5 秒片段;
  • 目标视频 124 帧 1344×768@24fps,proxy 为 124 帧 336×192(深度+语义 ID 图),多模态编码器读 11 帧稀疏采样 proxy;
  • 训练:8×H800,AdamW,3 epoch / 3,534 步,warmup 100 步 + 余弦退火;
  • 推理:编码 Agent 用 GPT-5.6 Sol,基于现有 AAA 游戏场景模板组合/扩展/改写构建可玩世界;GPT Image 2 生成首帧外观锚点;长视频用 124 帧滑窗、34 帧重叠拼接。

五、评估指标与实验证据

必须诚实地说明:这是一篇 position + prototype 性质的工作,作者明确声明受算力限制,没有定量对比表格,证据以定性为主。

证据一:proxy 跟随能力(定性主实验)。微调后的视频模型在编码 Agent 搭建的简单交互世界中,能跟随 proxy 指定的角色位置、动作轨迹、场景布局与相机运动,同时保留高保真外观与细粒度动力学。展示案例覆盖多种风格(橡皮管动画学院、霓虹雨市集、水墨天空、赛璐璐春日草原、山地修道院),证明仅用 5 小时 GTA V 数据微调即有跨角色/风格的泛化。

证据二:与动作/相机条件世界模型的定性对比。项目页视频对比显示,proxy 条件对角色运动、动作与相机移动的控制比 LingBot-World 2.0、WorldPlay、Matrix-Game 3.0 等动作/相机条件系统更精确、更即时——因为 proxy 直接以帧级粒度指定姿态与轨迹,控制粒度对标现代 3D 游戏。

证据三:数据管线的可行性。游戏侧展示自动构建的逐像素对齐 proxy–RGB 对;真实侧展示 KITTI-360 上无需动作标签编译出的对齐条件(图 3)。

为什么这个实验设计(尽管初步)能支撑论点? 论文要证明的核心主张有两个:(1) 编码 Agent 能通过写/改代码改变世界的状态与运行机制——用「Agent 构建可玩世界 + 录制 proxy」的直接演示来验证;(2) 微调后的视频模型能把 proxy 表达的状态渲染成对应观测——用「跟随 proxy 的生成结果 + 训练分布外的泛化案例」验证。这两个演示恰好覆盖框架的两个关键组件。反过来说,未被证明的同样要指出:无定量指标(如 proxy 跟随误差)、未实现实时生成、复杂机制仍依赖模板代码——作者在局限一节中逐条自陈。

六、效果优势的根源解释

这篇论文的优势不是「指标更高」,而是结构上必然地解决了视频世界模型的三个不可逾越的障碍。用因果链拆解:

障碍一:机制不可见。 纯视频模型只能从视觉结果隐式推断规则——数据里根本没有规则本身。→ Code World Model 的改变:文本/代码知识 + 代码执行把「世界怎么运转」外化为可检查、可修改的持久状态。规则不再需要被「学出来」,它就在世界程序里。信息流的本质变化:从「结果反推机制」变为「机制生成结果」。

障碍二:上下文 < 1 分钟 vs 因果过程跨天/年。 视频模型训练上下文通常短于一分钟,而许多需要推理的因果过程按世界时间展开数天甚至数年。→ 可执行状态 $S^{exe}$ 不受上下文窗口限制:玩家离城期间,代码照常推进继承、贸易、派系关系;回来时世界状态直接可读。持久性从「记忆检索问题」变成了「状态管理问题」。

障碍三:文本条件无法精确控制空间。 语言可以表达世界状态,但现有视频模型跟不住逐帧位置约束。→ Proxy 把约束翻译成与输出同模态(视频)的时空骨架,视频模型读的是「时空组织已经建立好」的控制信息,接地(grounding)难度大幅降低。这解释了为什么 proxy 能提供帧级控制而文本+相机通路不行。

代价与反事实:代价是每次新观测都要生成式推理(边际算力和延迟高于传统渲染)——作者认为为开放性与保真度值得,且视频推理效率在持续改善。反事实推理:若去掉 proxy 只用文本,论文自己的实验已证明控制精度崩溃;若去掉编码 Agent 只留模板代码,世界就无法开放式演化(回到预设轨迹);若要求完整 3D 实现,资产成本与视觉天花板会重新锁死开放性。三个组件各自补一块短板,缺一不可。

七、必要知识反推

假设一个完全没有背景的人要做这个工作,最少需要知道什么?

领域知识层:

  • 世界模型的经典形式化(Ha & Schmidhuber 起)——不知道 $p(S_{t+1}|S_t,A_t)$ 就无法定位「状态可分解」这一创新点;
  • 视频世界模型的现状与数据形态——必须理解「视频只有结果没有机制」「上下文窗口 <1 分钟」这两个结构性事实,否则动机不成立;
  • 游戏引擎的运行时结构(运行时状态 vs 渲染输出)——游戏数据的同步录制方案直接依赖这一点。

方法论知识层:

  • 编码 Agent 的能力边界——「高频调用 LLM 不经济、代码可高频确定性执行」的分层设计,要求对 Agent 与程序两种计算体制的成本模型有清醒认识;
  • 条件生成的接口设计思想——文本条件的失效分析(token 效率、跟随可靠性)与「同模态条件更易接地」的洞察,来自对可控视频生成(ControlNet 类思想)的迁移;
  • LoRA 参数高效微调——在 5.6 小时数据上适配大型视频底座的工程前提。

工程知识层:

  • 游戏运行时状态提取与逐像素实例标注管线;
  • 3D 重建/标定/深度缓冲光栅化(KITTI-360 真实数据侧);
  • 大规模视频模型训练栈(FlashAttention-3、梯度检查点、BF16、滑窗长视频推理)。

知识融合的关键节点:真正的化学反应不在任何单点知识,而在两个洞察上:(1) 「稀疏复杂推理 vs 密集重复执行」的频率分解——把 Agent 与代码按计算体制而非功能划分;(2) 「proxy 是文本提示词的视觉对应物」——把可控生成领域的条件设计经验翻译成世界模型的状态接口。前者需要同时深入 LLM Agent 与系统编程两个文化,后者需要同时理解视频生成与游戏渲染两个文化。

八、论文中可以提取的通用性灵感

灵感一:按计算体制分层,而非按功能分层。 核心思想:把「慢而复杂的决策」与「快而重复的执行」分给不同的计算 substrate(Agent 推理 vs 代码执行),两者用「决策固化为可复用制度」的单向接口连接。 论文证据:Agent-代码循环中代码执行频率与 Agent 推理频率解耦;大规模战斗场景中代码连续处理多实体碰撞/冷却/连锁触发而 Agent 只处理意图与异常。 推广场景:(1) 自动化运维——Agent 制定策略编译为监控规则;(2) 科学计算——Agent 推导算法骨架、循环内核交给编译器优化;(3) 法律合规——Agent 修订政策条款、执行交给规则引擎;(4) 多智能体系统——「宪法层 + 执行层」的频率解耦。

灵感二:把「机制」外化为可检查的一等公民,而不是让模型去猜。 核心思想:当数据只包含行为结果时,与其让模型从结果反推机制,不如把机制本身显式表示为可检查、可测试、可修改的对象。 论文证据:视频模型学不到游戏代码中的规则(机制在渲染后被丢弃);Code World Model 让规则以代码形式持久存在,因果传播不再依赖上下文窗口。 推广场景:(1) 教育——显式提供解题策略而非仅给答案;(2) 流程挖掘——从日志恢复显式流程模型而非端到端预测;(3) 因果推断——结构因果模型 vs 纯 observational 预测;(4) Agent 记忆系统——规则库与情节记忆分离。

灵感三:接口用「同模态粗骨架」比「跨模态精确描述」更有效。 核心思想:当控制目标本身是某种模态(视频)时,用同模态的粗粒度骨架(proxy 视频)做条件,比用异质模态(文本)做精确描述更易被模型接地。 论文证据:文本条件即便配专用相机通路也无法精确控制轨迹;proxy 以 1/16 token 开销实现帧级控制;文本与 proxy 分工——语义归文本、时空归骨架。 推广场景:(1) 语音合成——韵律骨架条件 + 文本语义条件;(2) 机器人模仿学习——关键帧轨迹条件 + 语言目标;(3) UI 生成——线框图条件 + 文案描述;(4) 音乐生成——和声进行骨架 + 风格文本。

灵感四:「最小充分状态」是接口设计的黄金带宽。 核心思想:条件接口的信息量应在「构造方可维护」与「接收方可接地」之间取最小充分集——过多约束会把负担转嫁给生产端,过少则失去控制。 论文证据:关节级 proxy 因编码 Agent 无法可靠维护而被排除;复杂对象退化为边界框+文本;论文明确将 proxy 设计形式化为 constructability 与 grounding strength 的权衡。 推广场景:(1) API 设计——最小暴露字段原则;(2) 多智能体通信协议——消息带宽预算;(3) 人机交互——渐进披露;(4) 数据库视图设计——按消费者需要裁剪。

灵感五:范式转换时,「降级」强者反而释放系统潜力。 核心思想:当引入新的掌舵者(编码 Agent)时,把原强者(视频模型)从「全能掌舵」降级为「专职渲染」,系统整体能力反而上升——因为每个组件回到自己数据禀赋最强的位置。 论文证据:视频模型从「必须内化整个演化过程」变为「只负责生成外观与动力学」,其视觉先验禀赋被完整利用;与生成式 3D(渲染天花板锁死)和程序化世界模型(无视觉)对比可见三者各让渡一部分才拼出完整能力。 推广场景:(1) 检索增强生成——LLM 从「记忆全部知识」降级为「推理+表达」;(2) 编译器——前端/后端分离各自进化;(3) 组织设计——专家型管理者退位给体系型管理者;(4) 神经符号系统——感知归网络、约束归求解器。