先说结论:云栖2026「世界模型:从构建数字世界到物理世界」分论坛(9月23日,国博二期6F-605,八场演讲加一场圆桌)给出的核心判断是——世界模型的技术路线仍高度非共识,但产业化的第一步不是更大的模型,而是一把公认的尺子:阿里ATH事业群Token Foundry Happy Oyster团队联合北京通用人工智能研究院、北京大学、南京大学与Reactor等发布的W1-W6能力分级、超1600个测试用例的Benchmark与超10万次对战的人类偏好Arena。真正的矛盾在数据侧:所有人都期望在像素空间产生智能,可用的长时连续视频与真机自主经验数据却极其稀缺,于是「改预测目标」与「自进化造数据」成了两条替代路径。同一时间,GPT-6级别的通用模型正在吞噬具身智能的上层能力,团队的护城河被迫向底层技能库与物理闭环下移。对从业者最实用的一句话来自圆桌的收敛判断:模型会趋同,分叉在上下文与数据。
W1到W6:先给「世界」定一把尺
「世界模型」在2026年仍是个名实混乱的词。主持人、阿里ATH事业群Token Foundry Happy Oyster团队的文嘉豪把论坛分成定义、前沿方向、生态与未来三篇,而第一篇的第一个动作就是拆分歧。Happy Oyster技术负责人苏文博开场把非共识摆上台面:agent关心长程推理与规划,3D/4D模型关心时空一致性,视频模型关心下一帧画面如何演进,具身模型则要把感知、行动、反馈跑成高效闭环——他引用李飞飞World Labs的划分,把世界模型拆成planner、simulator、renderer三个能力位。他随后发布Happy Oyster 2.0预览版,口号仍是「The world is your oyster, open it」,升级方向包括更智能的实时交互、更低延迟的响应、更强的记忆与更准的物理规律,以及更长程的视频推理。
但论坛的第一件产物不是模型,而是尺子。北京通用人工智能研究院研究员陈以新发布的「世界模型Arena与Benchmark」,由阿里Happy Oyster团队联合通院、北大、南大及Reactor等产业方共同推出。他先梳理概念史:从internal surrogates(人用内部模型近似外部世界做推演),到predictive state(对预测未来有用的特征才值得保留),再到数据驱动的动力学学习——正因为概念互相交叉,今天的世界模型才会互相重叠又互不相同:以Genie 3为代表的视频世界模型关心「给定动作后下一帧看到什么」,以World Labs Marble为代表的空间世界模型输出可探索可编辑的空间资产,具身方向则关心如何辅助机器人学习。落到工程路线上,业内在走两条道:一条是real to sim加传统仿真,先生成资产再由仿真器给出下一状态;另一条是纯神经仿真,把仿真整体内化进模型——但无论哪条,模型给出的下一步输入都必须可用。他把共同核心收敛为三个词:Representation、Prediction、Interaction,并给出全场被引用最多的一句定义——世界模型的可用性,取决于它能否持续给出可靠的行动后果。
Benchmark据此把「世界」分成六级:感知世界、交互世界、稳定世界、可编辑世界、可扩展世界、通用世界,配套超1600个测试用例,覆盖机器人、室内、室外、交通、游戏与工业场景;空间赛道为每个参评模型重建了300个场景;匿名双模型对比的Arena已积累超10万次人类偏好比较并汇总成Elo评分。几个值得记住的发现:其一,W1层各模型差异不大,真正的分水岭在W2到W4——高阶世界表现好的模型低阶都不差;其二,Genie 3在长程一致性上给出了标杆案例,一分钟画面持续保持一致、回访后状态仍在,而对照组模型在长时交互中出现了明显漂移;W4层还出现了一个标志性样例——同一段体验里混用文字指令与鼠标键盘控制视角和人物,Happy Oyster都能精确响应,这种自由开放的混合交互被评委会视为下一代模型的标配;其三,空间赛道出现了有趣的错位——多数模型W1/W2不错但高阶不行,GPT-6 Ultra(讲者称呼)恰好相反,渲染质量有差距,却对特定物体编辑、全局场景编辑这类高阶指令有非常原生的支持;其四,具身赛道整体评分差异不大、都缺高阶能力,也没有全能冠军。陈以新同时坦承了未覆盖项:像素预测与特征预测之争没有涉及,预测能力如何反哺policy与planning、接入后的真实收益如何衡量,都还没有设计。
这条「先定尺、再比武」的链条值得展开:一个新领域流派林立,往往不是因为技术不成熟,而是因为缺少让不同流派可比的公共坐标;有了W1-W6和Elo,研发预算与注意力会向差异层集中,具身场景甚至可以给世界模型定出「真机性能提升5%-20%」这样可核查的验收价。判断一个新兴赛道是否接近产业化,先看它有没有一把大家认账的尺子——尺子出现的那一年,往往就是叙事从论文转向订单的起点。
每分钟一千八百次误差:视频世界模型的两本账
如果说分级解决「比什么」,南京大学副教授范琦解决的则是「差在哪」:视频世界模型的两大软肋,长时稳定与记忆。他对世界模型的终极期望很直白——在计算机里一比一复刻真实世界,宏观上做具身、游戏与世界交互,微观上连分子、细胞的演化都能推演;而横在面前的问题是条件不足:可用数据太少。流派因此分野:视频派动态好(水流、树晃都能建模),空间派基于三维重建、长时稳定性好,联合嵌入派关注给下游预测提供什么表征,具身派则要把感知行动反馈闭环——终极目标是把这些流派融合成统一世界模型,但用范琦的话说,先得把每个流派各自做好。他先算了一笔误差账:主流方案借鉴语言模型的自回归逐帧预测,30fps下一分钟就是1800帧、1800次误差累积,累积速度远快于语言模型;而且自回归是串行预测,吃不到GPU并行的红利。他团队的解法朴素得近乎反直觉:先规划再生成——先预测关键帧,再在关键帧之间插帧。每隔100帧设一个关键帧,误差累积从1800次降到18次;中间帧无论离初始帧多远,误差都被锁在一个小范围内。副产品是并行化:关键帧生成后,各段中间帧只依赖相邻关键帧,互不依赖,不用任何attention加速算子就能在4 GPU上拿到接近3倍的加速。更实际的是数据账:长时连续视频极其稀缺,电影和短视频大多是剪辑拼接,与「长时连续」根本不是一回事;这套方法只用5到10秒的短视频训练,就能生成分钟级的长视频。
记忆问题他给出了第三条路。显式三维重建得到的点云世界确定但静态,且重建误差会传染给后续生成;隐式检索把历史画面存起来、需要时取回相似视角做参考,一旦选错就越来越错。他的做法是把历史帧的记忆直接编码进生成器——压缩成固定隐变量,强制与任意视角的几何状态对齐,推理时几乎零额外开销,既没有重建误差的传染,又比检索路线的几何一致性高得多。
真正锋利的是他与阿里高德合作评测的视角:首次从动作、视觉、记忆、物理四个维度同时测视频世界模型。物理遵循度的测法非常直观——让角色一直往前走,遇到墙继续走,会穿墙生成新场景的模型,物理遵循度就是零。范琦的判词是:没有物理遵循度,它就不是世界模型,只是像素渲染器。评测结论同样没有全能冠军,物理与长期记忆是共同瓶颈。他给出的方向是「骨骼与血肉分别建模」:世界规律的演化是骨骼,像素是血肉,已经有团队用coding agent生成白膜骨架、再交给视频生成模型做像素;而他认定的下一个里程碑,是视频世界模型全面超越游戏引擎的生成效果——目前差距仍然很大。这条链的启发在于:自回归的精度损失与速度损失同源,改预测粒度可以同时解开两个结;在数据稀缺的领域,改目标函数往往比硬攒数据更划算。
GPT-6之后:护城河下移,要scale的是经验
具身方向的两位上海交大讲者,恰好构成「护城河」与「数据」两本账。副教授王韫博给演讲起了个焦虑的副标题——「后Astra时代」,指GPT-6级模型出现后的世界。他的判断是:通用模型已经吞噬了具身上层的相当一部分能力。其一是inverse graphics,调Blender写Python代码就能把场景和物体重建得很好,但铰链结构是否穿模、物理是否合法,仍然缺少仿真引擎做闭环校验;其二是code as policy——任务编排、轨迹规划、调用工具(包括逆运动学算法甚至现成的VLA模型)这些当年VLA路线追求的能力,很多已被coding agent自身的迭代覆盖。他还转述了一个社区实验:从杯子里抽出一只杯子、保持底下那只紫色杯子直立,抓取起初错位,agent不停演化自己的算法最终完成,全程没借助任何VLA模型。但他同样引用Robodog的官方评测(讲者转述):在部分复杂接触任务上,VLA系模型(如GR00T、小米等)仍显著优于GPT-6——GPT-6擅长空间理解、指令编排与长程泛化,不擅长复杂物理过程。因此主流趋势是分层:顶层通用大模型做大脑(现在慢,但变快是迟早的事),底层轻量模型解具体接触问题,他提到Chelsea Finn最新的文章也在主张这个hierarchical架构。这个判断对团队战略是直接的:护城河从「自研大模型」下移到「底层技能库」——通用抓取需要极其鲁棒的抓取技能,locomotion与环境交互同理,它们等着被顶层大模型调用。
要练技能库就要数据。王韫博梳理了三条路线:隐空间世界模型(他引用2018年Ha与Schmidhuber的NeurIPS论文,以及杨立昆大力推动的latent space world model——在推演空间做策略优化,样本效率高,这是很重的视频生成世界模型给不了的);真机数据(两个月前轰动的小米VLA用了约十万小时真机素材,天然适配特定本体,但换本体、换任务是否够用存疑——这些数据是不是护城河,本身就值得掂量);以及他认为优势最大的sim to real。他的实验室把这条路做成「code as scene / code as physics / code as policy」三件套:机器人到新场景拍照、人给一段演示视频,大模型直接生成交互物体的代码、转成URDF/USD仿真文件,重建一个场景约3分钟,比GPT-6快很多——关键在闭环里有Isaac引擎做物理后校验,不过关就重新改代码;仿真器本身则在代码空间里重做,模型预测的不是下一帧像素,而是资产文件的哪一行被动作改变,为此给URDF/USDA场景文件做了专属分词器,用英伟达Newton与Isaac Sim的数据预训练、自采真机数据微调——在柔性线缆仿真上比Newton引擎更稳定、更符合直觉;端到端的效果是机器人看一段人拉抽屉放方块的视频,一分钟内重建仿真场景,GPT-6与底层强化学习技能配合后,开环部署到真机依然稳定——开环意味着执行中不再停下来观察和重新规划,这背后是场景重建精度与轨迹规划置信度。
助理教授穆尧的账本从数据规模说起:2026年是具身数据规模化元年,采集已到百万小时量级,但预期中的「具身ChatGPT时刻」没有到来,边际效应明显递减。他的诊断是:这些数据本质上都是人类演示数据,而具身智能的定义是智能体通过与物理世界自主交互学到知识——缺的是experience(自主经验),就像人的一生在不断积累经验。他的RoboEvolve系统围绕三件事:生成式仿真环境(文字提示直接生成带物理参数的逼真世界,发布RoboTune 100K级资产集,柔性体、流体、螺纹精密连接都已支持——他的原话是,GPT-6出现之后「make仿真great again」);把进展评判从「对照参考视频打分」换成主动推理——模型自己拆解长程任务的子目标,再对照执行视频与本体信号生成思维链,天然适配强化学习;以及用离散扩散统一语言、视频、动作生成的MM-ACT基础模型——token的logits可直接导出、适配PPO/GRPO,在多个榜单上成功率到99%以上。两块拼图补齐触觉与分层:触觉方向至今缺乏好的编码器(视觉有CLIP,触觉什么都没有),其仿真训练的触觉编码器迁移真机后成功率提升20%以上且零额外调整;High VLA用千问32B做目标锁定,底层策略拿到目标提示后成功率90%以上;再往上,与智源合作的Robo Cloud用全生命周期agent调度数据生成、训练、迭代、部署与失败恢复,把这套自进化闭环包成一个系统。落到现场:具身机器人For Sense做有机化学合成的「过柱子」实验,端到端连续工作四到五个小时;目标是24小时轮班、自主纠错、持续数据回流——那才是商业价值兑现的时刻。
这两本账拼起来是一条完整的传导链:通用模型每吞噬一层能力,价值就向它还做不了的那一层移动——精细接触、物理校验、触觉;于是「大脑用通用模型、小脑自建技能库」成为分工,技能库的原料从人类演示转向自主经验。对从业者的启发是:别把护城河修在会被下一次模型发布冲垮的高地上;判断一项数据资产的价值,看它是否随部署自我增殖。
从sticky session到蜂窝网络:实时世界的基建账
模型跑起来之后,账记到了基础设施头上。阿里控股百炼AIGC工程负责人张志成讲的「世界模型基础设施服务指引」,核心变化只有一句话:从「一次请求一次服务」变成「长程会话」。传统LLM或AIGC服务,流式也罢异步也罢,一次请求就结束;世界模型必须保住一个持续存在的session——用户说过「前进」之后哪怕一分钟不说话,世界也要继续演绎。百炼的解法是sticky session调度,保证每个回合落到上一次的推理集群——张志成强调,KV cache不命中只是成本问题,session亲和做不好,商业链路根本无法闭环。弹性和延迟各有硬指标:一分钟内拉起并预热一台GPU,缩容要等会话完全排空;Adventure模式下指令到推理完成压在一秒内;推理结束经阿里主干网到用户侧的RTC链路控制在约100毫秒,自研的AI Over QUIC媒体网关做带宽感知、音频冗余与关键帧重传,全球节点单元化部署。两个内部核心指标也讲得很实:真到达延迟(从负八秒劣化到正数意味着用户可感的延迟,负得太多则说明GPU在空等)与TTFP(指令到首帧推流的耗时,越低越好)。
Reactor联合创始人兼CTO Bryce Schmidtchen的视角几乎互为镜像。这家约一年前创立的公司由前Vision Pro团队成员创办,做世界模型的开发者平台,Happy Oyster是其发布伙伴。他把基础设施的差别概括为「连续流与会话」对「任务与批处理」交付,并给出一个漂亮的类比:世界模型平台要更像蜂窝网络,而不是传统推理平台——多区域、区域间极低延迟、随「太阳移动」做容量调度、为黑客松式的尖峰保持warm容量。他判断AI的未来主要是视觉的理解与生成,理由是「光子是带宽最高的通信形式」;应用清单里除了机器人部署与评测、游戏互动媒体、数字人,还有一个新词generative software——软件不由LLM写代码生成,而是直接生成像素。开源复刻DeepMind Dreamer 4的Open Dreamer发布后,数千人把自己的agent跑在上面。这条链的启发:交互式AI的基建竞争点,正从吞吐率转向「保温容量×区域密度×会话亲和」——谁先把会话当一等公民,谁就拿到世界模型的托管权。
一切正在发生:消费即创作,与产业化的四个赌注
最后一场演讲把镜头拉回「为谁创造价值」。珀乐互动CTO徐京徽用电子电路作比:早期用世界模型做场景生成、剧情演绎是「二极管」;监测人物状态、走到触发节点切换模式与世界,就成了「门控电路」;有了门,就能构建更大的世界观,「去构建电脑」。他的产业叙事是内容生产史的延伸:PGC到UGC之后,AIGC把内容生产成本骤降,但短漫剧这个最大头部(讲者称市场估值已达千亿美元)撞上了瓶颈——相似题材与叙事结构重复,内容方差极大、高质量极其稀缺。下一阶段要解的是用户参与。他造了个词:IGC(互动生成内容),消费的内容由AIGC基于互动数据实时生成,「一切都是在正在发生的」。
产品形态叫「世界泡泡」,载体是他们正在打造的跨模态互动娱乐平台Calis:无数个小世界作为入口,读取用户的身份、IP设定、人物关系与当前冲突,根据对话与决策推演剧情,一切互动沉淀为人物与世界的记忆,进入下一次循环——他举的例子是「伪装成使者进入一座城池」:外部harness层会检测你的身份、持有物、与守卫的关系、时间窗口和目标,据此推演出不同的结果与分支剧情;旧漫剧的剧本、人物、场景资产可以直接丢给世界模型复用——对结局不满意,可以挥拳改写,或者走另一条分支,文旅场景里的遗迹文物、大熊猫、夜游也能以同样方式「再活一次」。商业上他反对token差价模式(一块钱进的token一块一卖出去):真正销售的是关系、经历与沉淀,是「模型怎么迭代都不会轻易搬走」的记忆资产。愿景一句话:让故事成为入口,让世界持续生长。
圆桌把全天的分歧与共识收拢。定义上四人四说——苏文博要「更多模态与维度定义智能」;陈以新给出最朴素的版本「有当前状态、能根据action输出下一状态就是世界模型」;Bryce认为争论从来在表征,视频世界模型的表征就是像素;徐京徽最看重「一切待定」。技术路线上苏文博判断会收敛到coding作为中介模态,把各模态统进一个模型——code to physics、code to embodied是共同趋势;陈以新补充真正的分叉在数据侧与action粒度(具身细、游戏粗),模型趋同、数据不通用。产业化指标四人各押了一个可验证的赌注:苏文博看用户愿意花的时间与任务复杂度;陈以新说明年若某世界模型真把机器人能力提升5%、10%甚至20%且成本可接受,就是标志性事件;Bryce押一年内数百万人每天与基于世界模型的体验交互、以及数千台机器人在长周期生产部署中用世界模型行动;徐京徽则说明年应能看到「看见即消费、参与即生产」的新生产关系初步跑通。
把八场演讲放回「从构建数字世界到物理世界」这个标题,它真正的含义此刻才清晰:数字世界一侧的门槛,是稳定、记忆、物理遵循这三门「像素世界」的功课;物理世界一侧的门槛,是自主经验、技能库与触觉这类「接触世界」的功课;连接两侧的,是会话式基础设施和一把公认的能力尺。论坛没有回答的问题同样值得记下:像素预测与特征预测孰优、预测能力如何反哺决策、各领域数据能否共享——以及主持人结尾留下的那个悬念:希望明年此时,回来验证今天的判断。