基于《晚点LatePost》播客「世界模型是具身的永动机?」的完整转写整理。本期于 2026 世界机器人大会(WRC)期间录制,嘉宾为北京人形机器人创新中心多模态大模型负责人戴勇、多模态大一统模型研发负责人张怡(Joy),以及前华为 AI 首席专家唐都钰(经核对:微软亚洲研究院自然语言计算组出身,曾任华为小艺业务部大模型负责人,近期离职创业)。节目开场引用了北京人形大模型负责人鞠笑竹在 WRC 上的演讲。文中观点归属均以说话者标注,转写存疑处以括号说明。
先说结论
这期节目表面在聊"VLA 和世界模型哪条路线对",实际给出了三个更耐用的判断。第一,VLA 的泛化问题不是玄学,北京人形把它定位成一条可以逐层检查的"特征漏斗":底层编码漏模态、中间传递有断层、末端生成丢信息——修好这条链路,VLA"还没有死"。第二,世界模型被戴勇称为"AI 时代的永动机":行业指望它建模整个世界、再反哺具身智能源源不断的数据,但它自己就缺世界数据,鸡生蛋蛋生鸡,“至少到现在为止,它是个童话”。第三,三位嘉宾一致认为具身智能刚跨过自己的"BERT 时代"、正走向"ChatGPT 时刻",而通往那个时刻的路,北京人形押注在生成与理解大一统的强耦合模型 Pelican-Unify 上,年底的 2.0 版本要交出具身领域第一条像样的 scaling law 曲线。对从业者来说,这期节目真正值钱的不是结论,而是三家背景各异的研究者如何用同一套"范式一致性"框架,去诊断 VLA、世界模型、Agent 甚至自己下一步的创业方向。
一、“续命"论文:VLA 的病根在表征断裂和范式不一致
节目最尖锐的一句评价来自场外:有人认为北京人形前段时间发布的那篇 VLA 表征分析论文,“某种程度上是在给 VLA 的技术叙事续命”。戴勇没有回避这个词,他介绍了论文的三个结论:VLA 模型从特征的底层开始,要么只编码了图像特征、要么只编码了文本特征,不同模型漏掉的信息不同;往上传递时不同模型的信息存在断层;就算编码好了、传递好了,到最后生成动作的那一步,模型也没有用好自己的文本或视觉信息。三层漏斗,层层漏光。
但论文同样发现了修复的线索:当整个模型的注意力能够发生迁移时,泛化能力会得到极大提升。戴勇的判断是,如果能解决"从特征到注意力整条链路的特征保持”,VLA 的泛化问题可以解决一部分。这解释了为什么北京人形不认为 VLA 已死——它不是路线错误,而是链路没修通。
张怡从训练端给出互补的证据:她们看到 VLA 的 VL(视觉语言)部分和 Action 部分没有完全打通,导致现在的动作生成"更多是在模仿、去记忆训练集中看到的轨迹"。她的措辞很克制——“训练上可能有一些走偏”,但"还不能给 VLA 下死刑",因为一些很小的改进就能在一定程度上缓解这个问题。
真正把诊断拉到范式层面的,是经历过完整大模型周期的唐都钰。他先梳理了语言模型的四个时刻:GPT-3 完成范式统一(结构都是 Transformer、训练都是 next token prediction,few-shot 泛化出现);ChatGPT 把后训练接上;GPT-4 学会长链推理、从能问答到能做事;再到此时此刻的 Claude Code——左手模型右手 Agent,规划、反馈、反思、再规划的闭环。他的核心类比是:语言模型预训练学 next token prediction,后训练也用 next token prediction 激活,“前后压的知识一样”,所以有泛化性。而 VLA 呢?VLM 部分是预测下一个词,动作部分却接了一个 diffusion 头、用加噪去噪的方式训练——用他节目里的比喻,一个足球天才去干 coding 的活干不好,因为预训练学的"特征和范式"与后训练要激发的东西对不上,“必然抽不出来你想要的知识”。
唐都钰由此提出他的解法方向:“世界语言”——把各种模态用统一的语义空间表示,甚至干脆"把动作定义成 language":当机器人本体足够稳定后,“你去拿水杯"这样的指令和语言模型调一个 function 在本质上是同一件事。节目中他也承认另一条路:让 diffusion 和 next token prediction 两种"方言"在同一个特征空间里耦合。顺带一提,转写中反复出现的"方言"意象(diffusion 是一种方言、NTP 也是一种方言)是理解这期节目的钥匙——统一语言的野心,正是后面 Unify 路线的思想源头。
与表征问题相伴的是数据问题。节目里提出了一组高密度/低密度数据的对照(转写未能确认该划分的提出者):低密度数据只有头和尾——一句"去拿杯水"的指令加一段拿回水的视频,中间的物理感知和推理过程全部缺失。张怡和戴勇顺着展开:人会天然捕获材质、会不会倒、水烫不烫这些信息,训练数据里没有,知识就没灌进模型,最后只能学出 shortcut。北京人形正在做的高知识密度数据,方向是加触觉、加深度、加抓取知识——“抓杯子需要多大摩擦力,抓一块很湿的肥皂需要多大摩擦力”。这组对照把"数据贵"翻译成了更精确的问题:贵的不是数据量,是数据里没把过程写下来。
二、永动机之辩:世界模型的短期是童话,长期看信仰
节目标题的"永动机"来自戴勇的一句重话:“我觉得世界模型可能是 AI 时代的永动机。“他的论证链是:我们希望世界模型建模整个世界,那就要喂给它海量世界数据;有了世界模型之后,我们又指望它反过来给具身智能源源不断地生产数据、提供仿真反馈——可是具身智能现在恰恰缺这些海量数据。“到哪里去找这么多真实世界的数据?鸡生蛋蛋生鸡。“主持人追问:永动机是一个童话,所以世界模型也是个童话吗?戴勇的回答是:“至少到现在为止,它是个童话。”
世界模型当下的问题清单在节目里被摆得很具体。张怡指出两个结构性矛盾:一是部署慢——世界模型"先想、再去逼近最终结果"的建模方式天然比 VLA 慢,部署到真实世界就是"一个非常非常缓慢的模型”,而慢就意味着用不起来;二是大与小的两难——想要强泛化就得做大,大了就不适合真实世界执行;做小了就退化成类 VLA 结构、丢掉泛化。戴勇补充了第三点:世界模型的文本理解层多是 T5、BERT 级别的早期结构,对复杂语义和 CoT(思维链,转写作 CUT)的理解很弱,“视觉智能"天生与人类的语言交互不友好。他自己还加了第四刀:现在的世界模型都是单步建模——给当前图像和指令,直接生成下一时刻——世界明明在时序上不断演化,模型却没建模这些,“感觉也不是真正的世界模型”。
出路在哪里?节目里出现了两种态度。戴勇的短期预期收敛而务实:在现有比较擅长的子赛道,世界模型能提供两类功能——数据生产(虚拟数据补充)和仿真反馈(simulator),仅此而已。他也承认定义需要收缩:如果把世界模型定义成刻画世界中的一切、包括一片树叶的摇晃和光影变化,那确实很难;如果定义成刻画机器人移动操作的规律、甚至理解人类情感做交互,“应该还是有一些可行性的”。唐都钰则给出了典型的"信仰式"回答:“我们一般容易高估短期所能达到的水平,但有时候会低估长期所能达到的高度。“他顺手做了一个概念手术:说 VLA 时,说的其实不是当下这套 VLA 技术,而是"通过理解 vision-language 去实现 action"这个目标;同理,世界模型的愿景可以实现,但技术范式可能完全不同——也许要建模光子、电子这种更基础的东西,“可能不是我们这代人的使命”。他提到类比 DeepSeek 从 V3 到 R1 的过渡:也许是等基座模型强到某个点,世界模型才"真真正正 work”;也许要等落地之后才有数据循环。
把"永动机之辩"翻译成投资语言:世界模型当前的确定性收益在数据合成与仿真反馈这两个环节,而"建模整个物理世界"的叙事在数据获取上存在自指困难。这个判断对评估世界模型赛道公司的估值口径很有用——卖 simulator 的生意和卖"物理世界基座"的叙事,不应该用同一套倍数。
三、BERT 时代往哪走:从各训各的,到"所见即可操作”
节目用了一个贯穿始终的历史坐标:如果拿语言模型的发展做横向类比,具身智能现在"刚走过 BERT 时代”,正走向 ChatGPT 时代。张怡描述的 BERT 时代特征是:先有一个预训练模型,然后各任务、各场景分别微调,模型结构、训练范式、数据都没有统一;十个场景做商业交付就要训十个模型。而 ChatGPT 时刻的不同在于任务统一——一个模型做检索、问答、信息抽取、OCR 都行,没见过的场景也能做到八成准确率。
北京人形给这个时刻起了个更具体的名字:“所见即可操作”——把一个机器人任意扔进家庭场景、工业场景,跟它说话、交互,它就能完成大部分任务。主持人接了一个外部参照:这不就是王兴兴(宇树科技创始人,转写作王兴平)定义的临界点吗——把机器人扔进没见过的领域、给新任务,做到百分之八十准确率,产业就迎来爆发。三到五年的时间表,与宇树创始人公开的判断同频。
有意思的是嘉宾们对"身处 BERT 时代"的态度。唐都钰回忆,当年在 GPT 上做 understanding 任务就是不如 BERT——BERT 是双向编码,GPT 只能看到前文——所以那时拿 BERT 调业务确实涨点、确实创造了价值,但"放眼长远,整个技术走的路不在未来那条康庄大道上”。他马上补了转折:那些积累并非没有意义,数据、行业理解会"以另一种方式合到康庄大道里去”。这段话对今天选 VLA 还是世界模型路线的团队是个直接安慰:范式会换,积累会平移。他进而判断,对研究者和创业者来说,未收敛的时代恰恰是好时代——“当技术范式趋于统一的时候,你比的就是算力和资源、工程化的体系化能力,机会反而不如技术没有收敛的时候多”。张怡补了一个更冷静的注脚:现在往模型里堆数据,性能确实会涨,但天花板在哪,“大家心里没有数”。
四、Unify 大一统与慧思开物:国家队的强耦合豪赌
理解了前面的诊断,北京人形的技术选择就顺理成章。张怡介绍,Pelican-Unify 的最初设想就是看到两种范式各有病灶——VLA 是模仿和记忆、难以推出 Code Agent 式的泛化;世界模型阵营现在做的 WAM(World Action Model,用世界模型能力指导动作生成)文本理解又太弱——于是把 VLM 的理解能力和世界模型的生成能力"全部耦合在一起,做一个生成理解大一统的模型”。节目描述的机制是双向滋养:加入的 VLM 语义信息既有利于动作生成和长任务生成,又有利于世界模型的"想象”,反过来世界模型的生成又滋养动作与理解,“相互促进”。
这条路线不是一蹴而就的。张怡披露,从去年开始做第一代 VLA 模型(XR-1,转写音译存疑)时,就用小部分人力尝试过 Unify,第一次失败了——“步子迈得太过超前”、资源投入不够、团队积累不够。大半年之后,人才和数据都积累到位,才在今年发布了 Unify 1.0。发布后的市场反应成了意外验证:“开始我们还不太笃定是不是一定是对的,但是马上整个 Unify 的范式就火了”——发布半个月左右,英伟达 Cosmos 的新版本(转写未能确认版本号)理念一致,李飞飞也公开表示 Unify 是未来。
与 Cosmos 的架构分歧是这期节目技术含量最高的段落。张怡解释:Cosmos 这类架构里,生成视频和生成动作是弱耦合关系——可能是"视频里我去拿苹果,实际上动作去拿了杯子",两者对不齐,这是其架构克服不了的问题;而 Unify 选择把视频生成和动作生成强耦合、完全对齐——“视频生成的是拿苹果,动作一定是去拿苹果”。代价是对齐本身更难,收益是"视频怎么走、动作就怎么做"的因果一致性,在她看来是"当前最可靠、最鲁棒的方式"。节目明确说了"没有哪个一定对",这是少见的把两家头部机构架构分歧讲到机制层面的对比。
接下来的时间表被反复确认:Unify 1.0 证明这条路基本通;2.0 预计年底发布,要看到模型和数据两个方向 scaling up 带来的"明显的 scaling 曲线"——用戴勇的话说,希望在年底拿出"具身领域比较好的 scaling law 范式";3.0 再做更多模态探索(触觉等)。张怡坦承卡点:从数据收集到统一表征、统一结构、统一输出,再到评测,“每一环都是卡点”,其中还包括为统一任务建立成套的评估体系——她们正在大面积铺开评测框架的工作,方向是从"桌面单任务"走向长程、复杂场景、带交互意图的操作(比如帮老人拿水时要判断他需要的是热水)。
平台侧的故事由"慧思开物"承载。这是北京人形的具身智能平台,既包含可商业化落地的"Agent+大小脑"架构,也包含大一统模型,被嘉宾称为"让我们能够看到具身智能 GPT 时刻曙光的平台"。商业化路径是"落地一代、研发一到两代":今年的商用场景包括导览、导购、工业分拣。关于大小脑与大一统的关系,戴勇用 thinking/非 thinking 模式的演化做了类比——最初是两个模型分别做两遍后训练,后来合成一个模型、靠 prompt 自动选择路径——“模型能力生产十倍、再十倍,乘起来一百倍,未来小模型可能全能做,但此时此刻大小脑有它的道理”。
合规是这个故事里独特的一环。节目介绍,北京人形两个模型完成了国家生成式人工智能服务备案:天鹕(Pelican-VL,转写作"天湖"),具身大脑模型,负责理解复杂场景、规划、判断任务成败与是否重试——全国首个完成备案的具身大脑模型;我悟(WoW,转写作"我物"),世界模型,在具身场景中生成尽可能真实的操作视频——全国首个备案的具身世界模型。张怡解释了备案的分量:不备案无法向公众提供服务,备案涉及严苛的安全防护和性能测试。她把双备案的战略意义概括为两个词:赋能(把 API 能力开放给全行业,小开发者也能接入)和闭环(让数据回流、模型变强,“打开走向公众的门,进入真实使用场景的数据回环”)。“国家队"的完整逻辑由此闭环:做数据采集标准、开源数据和模型——尽管"数据很贵、模型训练昂贵耗时”——让学校、二次开发用户和小公司都能参与进来,更多人参与、更多数据回流、行业整体向前。戴勇谈及公司气质时的说法是"正直":创始人都是在具身领域做了很久的人,“我们不是做世界模型为了融资,而是被真实问题激发去做世界模型”。与英伟达的对比也坦率:英伟达从用卡需求出发、新架构验证快;北京人形卡少,但靠平台化的体系打法"更端到端",反而能和互联网大厂在同一时间做出反应。
五、自进化的两条路:Claude Code 的十次限制,与 Sutton 的机器人幼儿园
节目后半段从模型聊到 Agent 与自进化,唐都钰贡献了两个来自 Claude Code 一线的观察。其一是今年四五月份出现的 Agentic Team 功能:传统 Agent 范式是主 Agent 掌握所有决策、把子任务分给 Sub Agent;Agentic Team 之后,任意一个足够强的 Agent 都可以充当 Orchestrator 自主分配任务。为什么现在才实现?“因为模型到达了这个能力,它才能做。你的 Agent 可以设计得很超前,但模型能力顶不上的时候,效果不好。“反过来说,当模型足够强时,Agent 反而可能束缚它——Agent 里沉淀的是人类的经验思维方式,而模型的思维方式可能更简洁、路径更短。他举的例子是:早期 Claude Code 里,如果 Sub Agent 连续十次没有回调主 Agent 的 To Do List function,就会被提示"你走太久了、回头想想思路是不是错了”;后面的版本把这个限制去掉了——简单任务五回合不回来就该回头,难任务十次恰恰是对的,“凭什么就是十次?“这个细节是"Agent 设计要与模型能力动态匹配"的绝佳注脚。
其二是训练范式的演化方向。现在的强化学习是:一道题采样出十六条路径,与标准答案比对后优化。唐都钰指出两个不可持续:一是难题人会出不出来——现在 Claude Code 写代码对顶尖人类的胜率已经是百分之六十,“人没有办法告诉模型他没掌握的东西”;二是解答过程可能长达一千万个 token,只在最后给一个 yes/no 的监督信号已经无法指导训练,需要给中间过程打分(节目称 OPD)。那谁来出题、谁来打分?“可能就是模型自己,再配上多个 Agent 来博弈”——model as agent harness、model as evaluator,自动化在他看来是自进化"最重要的解决方案”。
具身的自进化路径不同。张怡的刻画是:模型已经做到七十分、会拿苹果了,但"人把苹果抢走了、我再抢回来"这种 corner case 学不会,所以要丢到真实环境里与更多东西交互,再把经验回归到模型本身。节目转述了北京人形团队前几天与图灵奖得主 Sutton(转写作 sutton)的交流:Sutton 认为机器人在仿真里学会了走跑跳蹲,仍不足以覆盖真实环境,应该办"机器人幼儿园”——三五台机器人配一位"老师”(一套 agent 框架加人类:模型失败时大小脑给出反馈,人在旁提供正确决策),在安全环境里随便探索、摔倒有人扶,把基础功能学会就算毕业,然后再办"机器人小学"。这段与 SFT→RL 的类比严丝合缝:先用人标数据学 SFT,corner case 无非两种解法——要么世界模型的仿真足够强、把碰撞全仿真出来,要么"甩到人群中去用、上社会大学",learning from experience。张怡对具身进化的总结是:一个从人力大量参与到逐渐很少参与的过程——“从小时候三五个人看一个机器人,到一个人看两三个机器人”——而是否真能完全去人化,是个未知数。
六、唐都钰的下一站:主动式物理因果模型与 always on 的贾维斯
节目的收尾留给了唐都钰的创业首秀。他即将成立公司的方向是"通过做好主动式物理因果模型,去追求智能的上限"。出发点是一个交互范式的判断:未来每个人都会被通用型和专用型智能设备环绕,当它们具备了基础的完成任务能力之后,最关键的问题变成"你怎么和它交互"——不是现在的你问他答,而是实时、主动、“一直存在、一直常伴你"的 always on 状态:感知你的情绪、语气、微表情,理解你与家庭成员和新来者的关系,自己判断什么时候该说话、什么时候该响应。他给出的产品图腾是贾维斯:在家里是这个脑子,开车时还是同一个脑子,记忆不割裂。技术难点按他的排序:实时感知是最基础的,其次是环境理解(表情、人与人之间的关系),第三是记忆——而这三者是"技术和产品结合优化"的事情,缺一不可。
支撑这个选择的商业直觉也很有画面感:“我现在脑子里在想,到底英伟达后续能赚多少钱?一个人未来每天都要消耗海量的 token,去支持机器人的运动、支持机器人和人的交互。“他援引的成功模板是 Claude Code:Anthropic 左手有应用、右手有 Sonnet 模型、还有用户高频数据反馈——“这个交互链路的生态循环是可以被重现的”。至于时间表,他的回答干脆:“三到六个月跑通这个范式,到时候会有新的产品发出来。”
把整期节目串起来看,一条暗线浮出水面:三位嘉宾用同一把尺子丈量了所有技术对象——预训练与后训练是否一致、表征是否统一、数据密度是否够、范式是否收敛。VLA 输在范式不一致,世界模型卡在数据自指,Unify 押注强耦合统一,Claude Code 的 Agent 演化展示了"模型能力与框架的动态再平衡”,机器人幼儿园则是具身版的经验学习闭环。具身智能的技术路线远未收敛,而这期节目示范了在收敛之前,一线研究者如何靠机制层面的诊断而不是叙事层面的站队来下注。对观察者来说,接下来最值得盯的三个时间点都很明确:年底的 Unify 2.0 能否交出具身领域的第一条 scaling law 曲线;三到六个月后唐都钰的主动式因果模型拿出什么产品;以及机器人幼儿园这种"半开放环境+人机混合监督"的自进化设施,会不会成为下一个被争相复制的基建。