基于《晚点聊LateTalk》播客「世界模型这半年:路线争议、数据来源与商业落地」的完整转写整理。本期为 WAIC(世界人工智能大会)期间录制,嘉宾为 XLR Labs(拓元智慧)首席科学家王广润、研发总监蒲涛、总裁钟若。XLR Labs 是一家聚焦"世界动作模型"的具身智能公司,2022 年成立之初即瞄准世界模型赛道,目前已完成数亿元 Pre-A 和 A 轮融资。


背景速览:世界模型为什么突然火了?

过去半年,具身智能领域逐渐形成了一个新共识:机器人的瓶颈不在于身体,而在于大脑。机器人不仅要动起来,更需要理解并预测它所处的物理世界——这就是"世界模型"。

作为连接数字智能与物理世界的关键底座,世界模型的投融资进展火热。在欧美,李飞飞创办的 World Labs 和杨立昆联合创办的 AI Labs 今年上半年分别完成了约十亿美元左右的融资。在国内,世界模型同样成为具身智能赛道中最热的技术概念。

然而热潮背后,业内对世界模型的定义依然众说纷纭——基于视频的、基于隐空间生成的、基于几何的、基于物理状态的,各家路线各异。XLR Labs 是其中一家从 2022 年起就坚持"原生世界动作模型"路线的公司,三位核心成员做客《晚点聊》分享了他们的判断。


一、VLA 的上限与"原生性"为何重要

新的变化

今年具身智能的概念风口已经晃过好几轮:上一个被热捧的是 VLA(Vision-Language-Action),这半年更多讲的是世界模型。这种概念更替背后,是行业对前一条路线天花花的逐步认知。

嘉宾观点与解释

VLA 最大的上限是泛化性。 XLR Labs 首席科学家王广润指出,VLA 是基于视觉语言大模型加上动作头来训练的,在很多场景训练之后,去到新场景、新任务或跨问题时,泛化上有很大困难,“没办法做到一个很好的泛化”。这正是 VLA 不再被高度重视的原因。

XLR Labs 用一个关键词来概括自己与其他路线的差异——原生性(原生性)。所谓原生,是指在模型框架设计和预训练阶段就已经预测物理几何和动作,而不是在别的模型上改出来的。王广润以大语言模型的 scaling law 类比:GPT-3.5 的智能涌现,依赖于预训练(大量语言数据训练)和后训练(语言推理预测)的高度一致;而现有物理 AI 模型的预训练和后训练是"非常不一致"的——预训练做语言模型或视频生成,后训练却要做动作生成,两者之间存在巨大 gap,无法保证"见过的事更多"就能对动作有很大帮助。

原生世界动作模型正是要解决这个一致性问题:预训练阶段就能很好地预测物理几何和动作,因此"预训练数据够大、模型够大,在后训练阶段只需要少样本迁移,就能做到很好的涌现"。


二、4D 数据:千万小时的真实交互护城河

新的变化

具身智能的数据来源经历了一种趋势收敛:去年大家聊的是真机数据,后来变成无本体采集数据(夹爪、传感器),今年更多聊的是第一人称视频数据(“鹰眼”)。而 XLR Labs 走的是一条完全不同的路——4D 数据(3D 点云 + 1D 时序)。

嘉宾观点与解释

XLR Labs 自称是"首家引入 4D 数据的公司"。 王广润解释,4D 数据指的是整个场景的三维数据加上时间轴,可以很好地刻画物理空间的知识。要做 4D 预训练,意味着对场景里所有点都做 4D 预测,包含几何空间关系和机器人关键部位的估计——这是一种带有物理学的 4D 表征,对下游后训练完全一致。

这些数据来自真实的智慧零售场景。XLR Labs 从 2022 年进入智能零售,开始采集 4D 数据,到今天已积累千万个小时的数据体量。这个体量有多大?王广润给了一个直观换算:“如果真的去采集这些数据,要花十亿以上,因为每小时大概就有两百多块钱的成本。“而且现在每天还有两万小时的 4D 数据回流到模型预训练中。

数据质量上,XLR 强调三个维度:数据量、多样性、真实性。多样性方面,他们的数据是不同人在不同场景下采集的(已被证明比"同一个人在同一场景重复采集"更有效);真实性方面,是真实场景下真实采集的,而非"排练某种任务"的标注数据。总裁钟若补充,智慧零售场景的数据天然覆盖了人日常七八成以上的行为动作,且主要是手部交互,数据偏向真实、多样性丰富。

关于当前模型用量:最新版本模型已用到十万级的(标注/训练)数据,而积累的视频流总量是千万小时级(每次开关货柜的交互时长从几十秒到几分钟不等)。按 scaling law 理论估算,训练 50B 参数的模型需要约三百万小时甚至更多的数据——这正是 XLR 的数据规划。


三、显式 vs 隐式:物理到底学到没学到?

新的变化

最近"显示(显式)与隐式(隐式)世界模型"的讨论变得热络。核心争论是:模型到底有没有真正学到物理?学到的物理是否可信?

嘉宾观点与解释

XLR 对隐空间路线持保留意见。 王广润以某些隐空间模型(如部分 Yale 相关工作)为例分析:它们认为可以在隐空间学到很好的物理和几何,但这些表征是通过自监督方法学的,“很黑盒,我们不知道它有没有学到物理,也不知道有没有学到几何”,这"是一个比较危险的事情”。大家也想往模型里加入更多物理和几何,但很难做到。

XLR 选择的是在一定程度上显式地把几何物力学出来。他们依托强大的 4D 数据基础、逆动力学和逆物理学基础来训练模型。一个成功案例是近期在 CVPR 发表的关于空间物理解耦的论文——解耦之后,在某些场景上只需要一条数据就能做到很好的增广效果,“这是过往很多模型做不到的”。


四、端侧落地:不是算力越大越好

新的变化

世界模型要真正进入零售、工业、物流场景,必须在端侧部署。但这里有一个反直觉的判断。

嘉宾观点与解释

端侧落地层面,并不是模型算力越大越好。 研发总监蒲涛解释,大算力芯片会带来功耗问题,拖累机器人在真实场景部署中的工况时间。因此 XLR 与芯片厂商(如清城科技/新晨科技)联合研发端侧芯片,把约 15B 的模型高效压缩到1B 模型在端侧部署,出于真实落地层面的功耗考量。

这一点也呼应了 XLR 反复强调的"以终为始”——不是表演 demo,而是真正给客户创造价值。


五、商业化路径:从智慧零售到工业物流,“模型定义本体”

新的变化

具身智能融资赛道中,资本明显更偏好三类公司:有高质量物理世界数据入口的、具备全栈技术能力的、已有明确商业化路径的。XLR Labs 在这三点上都有自己的布局。

嘉宾观点与解释

XLR 不做本体,只做模型——但未来是"模型定义本体"。 钟若阐述商业逻辑:XLR 是一家大模型公司,要做"皇冠上的明珠"。物理 AGI 的末端形态丰富多样,所以 XLR 定位为"生态赋能者":把模型搭载到模组上赋能下游硬件厂商(如与新晨科技合作端侧世界模型模组),同时跟本体公司(如瑞尔曼)构建生态,把"大脑"放到本体上开拓场景。针对部分垂直场景,XLR 也会定义自己的本体。

商业模式上,XLR 一开始就是 Model as a Service,按结果收费、与客户分润。在智慧零售场景,XLR 已做到针对物体理解识别的行业算法第一名。钟若将下半场进入开放场景定义为"两步走":第一阶段与垂直场景建立联系,端到端打造解决方案;第二阶段构建生态、强化赋能能力。

具体落地能力上,蒲涛分享了 WAIC 现场演示的两个案例——柔性包装和穿鞋带。穿鞋带包含三个难点:柔性物体(鞋带娇柔、夹错会弹飞)、精准空间定位、以及 XLR 与其他家最大的不同——长程纠错能力。当鞋带被人工干扰弄到不同地方,模型能快速发现当前状态与目标不一致,主动纠错恢复任务执行。蒲涛强调,这是与市面上很多"排演性质 demo"最大的区别。

从零售扩展到工业物流,同样是纸箱抓取的场景迁移:零售货架的动销补货、物流场景的扫码分拣翻箱,都是垂直子集的扩展。XLR 认为当前模型已能很好覆盖这些场景。


六、关于竞争、对标与行业温度

嘉宾观点与解释

面对今年大量新成立、融资迅速的视觉动作模型公司,钟若表示"非常有信心":XLR 不是今年才成立的公司,一直在坚守用 CB(可能是某种特定方法/认知建图)方式构建视觉动作模型,“更有底蕴、更有积累”,且真实场景的 4D 数据回流是新公司不具备的差异点。她认为赛道已从"适度火热"进入"相对克制"阶段,这对真正在做模型预训练的公司反而是好事——“真正的去辨别,在这个浪潮下,谁在真正的在做模型的预训练”。

在可对标的公司上,王广润提到了两家:Nervous 和另一家 AI 公司(转写中名称不清晰),认为它们"非常不错",正在做很通用的任务。


七、物理 AGI 的下半场:人机协同与生产力升级

嘉宾观点与解释

物理 AI 代表的是下半场更好的人机协同。 钟若这样定义 XLR 眼中物理 AI 的未来:上半场数字 AI 解放了白领工人,下半场物理 AI 则是更好的蓝领工人与 AI 协同。很多工种是重复性劳动——超市收银、工厂流水线工人——随着物理 AGI 的到来,物理大模型可以与人类更好协作,这也定义了国家当前智能制造的生产力升级方向。

“我们其实是非常憧憬在物理 AGI 下的人类和这种智能的一个共存。”


结语

这期对话最有信息量的部分,不是融资数字或 demo 表演,而是 XLR Labs 对"原生性"的坚持和 4D 数据护城河的论证。当行业还在争论世界模型的定义、还在用视频生成或隐空间做预训练时,XLR 给出了一套自洽的逻辑:预训练与后训练的一致性决定了 scaling law 能否成立,而这种一致性只能靠原生世界动作模型来实现。至于千万小时 4D 真实数据是不是真的能支撑 50B 模型的涌现——这大概是未来一年最值得观察的验证点。

值得注意的还有本期的一个结构性特征:嘉宾全部来自同一家公司,讨论天然带有立场。关于"隐式 vs 显式"“VLA 上限"等争议,行业中存在不同甚至对立的观点,本文记录的是 XLR Labs 一方的论证链条,读者可据此建立判断框架,但不必将其视为定论。