基于晚点聊 LateTalk 播客「AI 季报 26Q2」中对话蚂蚁灵波首席科学家沈宇军的完整转写整理。蚂蚁灵波是蚂蚁集团孵化的具身智能公司,专注于机器人"大脑"(通用具身基础模型),不做本体。


背景速览:沈宇军是谁?

沈宇军现任蚂蚁灵波科技首席科学家。学术履历上,他本科在清华、博士在港中文(汤晓鸥老师组),从 2014 年起就在商汤实习,经历了 GAN(对抗生成网络)兴起的全过程——从图像编辑、生成模型,一路做到表征学习。之后在字节跳动做抖音特效(人脸变换、年龄预测等),2022 年加入蚂蚁技术研究院,2024 年底随蚂蚁灵波成立转入这家子公司。

他的技术路径有一条清晰的主线:从数字世界的视觉,迁移到物理世界的机器人。这个转变,是理解他所有后续技术主张的关键。


一、为什么做子公司、为什么不做本体

新的变化

2024 年底蚂蚁成立灵波科技,这是蚂蚁从数字世界的生活服务(金融、医疗、出行等)向物理世界延伸的关键一步。选择以子公司而非研究院的形式运作,沈宇军给出了一个很直接的理由:研究院认为的先进技术跟行业需要的先进技术会有 gap,如果当成研究性质做,“做一做就脱离了行业”。

至于为什么只做大脑不做本体,核心判断是:当前一个本体很难通用,而灵波的初心是做跨本体、跨场景、跨任务的通用大脑。如果做硬件,就必须为特定场景做取舍——强化某些能力、减配另一些,这与"通用"目标矛盾。更现实的原因是,本体有自己的量产门槛和场景选择难题,当前还没有谁能确定哪个场景最先大规模落地。

嘉宾观点与解释

“大脑是落后于本体的,这是今年的主要矛盾。” 沈宇军认为,去年的行业讨论焦点还在本体(轮式还是足式、哪家能量产),但今年大家明显更看重大脑了。原因很简单:现在机器人还干不好活。“干活"能力不足是核心卡点,本体再先进,没有好用的模型也白搭。

大脑和本体的关系是交替上升的。 现在大脑落后,做大脑的人多了之后智能层会加速,某一天超过本体,届时会催生一批"由智能重新定义的本体公司”。再往后,更强的本体又会暴露新的智能短板。这是一个螺旋过程。


二、“具身原生”:最核心的技术主张

这是整场访谈中最重要的概念,也是沈宇军反复强调的"赌注"。具身原生(Embodied Native) 的核心含义是:不再把数字世界的模型(如 DINO、Wan 等)拿来改改用在机器人上,而是从物理世界的需求出发,从头训练一套完全为机器人设计的模型。

灵波的技术主张可以概括为三条线:

嘉宾观点与解释

主张一:从传感器出发,而不是从语义出发。

沈宇军用一个非常形象的例子解释了数字世界语义理解与物理世界空间感知的本质区别。传统视觉预训练(如 DINO V2)擅长语义理解——“这是一盆花”、“那是一只狗”。但机器人需要的是几何层面的空间感知——距离有多远、前面有没有障碍物。

他举了一个"玻璃门后的猫"的例子:DEPS(深度估计模型)在玻璃门关着时是看不到猫的,因为前面有玻璃挡着,机器人会先撞到玻璃。门拉开后猫才逐渐出现。但从语义理解的角度,猫一直在那里。“能看到,但你摸不到。能看到是语义理解,摸不到是空间感知。” 这句话精准点出了两条路线的差异。

基于这个判断,灵波完全放弃了 DINO V2 作为基模,自己从头做了一个视觉基座模型 V-Ren——从边缘、几何出发做预训练,而非语义。

主张二:从视频中学习时序,而不是把视频抽帧当图像看。

2025 年 3 月,灵波就决定机器人必须从视频里学习真正的时序信息(当时还没有 World Action Model 的概念)。这催生了视觉动作模型(VRA/WAM)。到 2026 年初,灵波成为行业最早开源世界动作模型的公司之一。

主张三:完全为物理世界重做视觉,不沿用数字世界模型。

这是 2026 年最大的决定。沈宇军发现,数字世界视频生成模型的开发动机(高画质、双向建模、高压缩率)与物理世界需求(实时推理、单向时序、可以牺牲画质)存在根本冲突。语言模型(LLM)可以继续用——数字世界和物理世界在语言层面区别不大;但视觉上,不管是理解还是生成,必须从头来。


三、第二代大脑六件套:技术拼图的全貌

灵波第二代大脑发布了六个模型,沈宇军把它们的逻辑关系讲得非常清楚:

嘉宾观点与解释

第一天:解决"看得更清楚"——V-Ren + DEPS。

V-Ren 是视觉基座模型(从几何角度预训练),DEPS 是基于 V-Ren 的深度估计下游任务。相比上一代用 DINO V2 做基座,新版 DEPS 有质的提升:能清晰看到水龙头的反光水流(机器人接水必须看到水流位置),能正确感知玻璃门后的空间关系。

第二天:解决"干得更利索"——VLA 升级。

VLA(Vision-Language-Action)模型的升级主要来自落地反馈。第一代只支持 9 种构型、仅双臂+夹爪、桌面操作。第二代升级到 20+ 构型,支持头、腰、底盘、甚至双足行走。这个变化直接来自真实场景:机器人从架子上拿东西需要抬头,从下面拿东西需要弯腰,这些自由度在实验室 demo 中完全被忽略了。

第三天:解决"想得更明白"——Video + Word + VRA 2.0。

这三个是核心技术突破的集中体现:

  • Video(MoE 原生架构):灵波从头训练了一个 MoE(混合专家)架构的视频模型。关键难点不是"想用 MoE"——而是怎么让每个专家被等概率激活,否则跟 dense 模型没区别。灵波花了两个月、失败了几十次才解决这个问题。“训好 MoE 是一个能力问题,不是态度问题。”
  • Word(单向注意力):物理世界时间不能倒流,历史看不到未来。但数字世界的视频生成模型用双向注意力(因为可以从已知开头和结尾生成完整视频)。强行把双向变单向会导致预训练知识严重遗忘(100 句话只有 20-30 句能正确转译)。灵波的方案是从一开始就设计为单向训练,放弃了"先双向再转单向"的捷径。
  • VRA 2.0:把 MoE 架构 + 单向注意力 + 改进的编码器三个技术全部融合,加上真机数据,从头训练了一个"完全为机器人设计的原生基模"。这是"具身原生"概念的最终落地。

四、V-Ren 不需要 LLM:大小脑的分工

嘉宾观点与解释

灵波的模型解决的是"意图的实现",不解决"意图的来源"。 沈宇军用一个非常清晰的框架界定了灵波的定位:

  • 机器人收到"帮我拿把伞"的指令——灵波的模型负责执行这个动作。
  • 但"一起床看到外面下雨,主动决定去拿伞"——这需要更高层的智能(意图生成),灵波现在不做这一层。

V-Ren 和 DEPS 是纯视觉模型,不需要任何语言——“看得更清楚"这个任务本身不需要语言参与。VLA 会用到 LLM 做指令理解,但灵波的核心模型栈(V-Ren→DEPS、Video→Word→VRA)是完全从视觉原生的。

短期内,灵波会把 LLM 当一个好的入口,但坚信具身智能会成长出自己的模型。语言模型解决需求泛化的问题,而具身模型要解决的核心是"怎么把一件事干明白”。


五、数据是最大瓶颈,GPT 时刻还没到

新的变化

沈宇军明确表示,具身智能还没有到 GPT 1 的时刻。核心原因:没有找到好的数据 scale up 方式。灵波第二代用了 6 万小时数据(第一代 2 万小时),但跟上一代比还没有数量级提升,而且这远远不够。

互联网数据在预训练中仍然远超机器人真机数据(差约两个数量级)。虽然模型架构已经做到"具身原生",但数据还没有。沈宇军心目中的 GPT 时刻:当具身数据能 scale up 到至少跟互联网数据相同量级的时候。他的理想数据量是百万小时起步,在此之前会先有一个十万小时规模(完全用于具身原生的预训练)。

嘉宾观点与解释

为什么不用仿真数据做训练? 灵波把仿真更多用在评测上。核心原因是分布问题:仿真数据可以瞬间生成大量数据,但分布会相对同质化(类似任务重复)。对于柔性任务(如撕开塑料袋),物理引擎还需要迭代。而真机数据成本在过去两年至少降了 3 倍以上——量产必然降本。

真机数据的两个核心难题: 一是怎么下发任务让数据覆盖所有自由度(避免头部数据占比 90%、腰部只有 10% 导致模型偏科);二是数据清洗管线——因为做跨本体模型,每家本体配置不同(相机位置、关节连接方式),数据处理方式必须与本体强相关。

中国在数据采集上有结构性优势。 沈宇军认为,具身数据可能是互联网红利之后的一个"空窗期"——中美在这个领域站在同一起跑线,而中国在真机数据采集上"一定比美国跑得快"。灵波也在积极构建数据联盟,与合作伙伴一起标准化数据采集流程。


六、泛化性:突破与不足

嘉宾观点与解释

位置泛化已经解决得比较好。 最有意思的例子是"和人打撞球(桌式足球)":机器人只依赖自己的相机(不像传统方案在场地周围布一圈追踪相机),对面打过来的球位置完全随机,但机器人能实时预判并打回去——这个任务只需要采了 20 条数据就能做到(以前可能采多少条都不行)。

另一个例子是"随机撒物品到筐里"的收纳任务:可以先撒满、中途拿出来、甚至和机器人一起收拾,模型都能应对。

任务泛化还没做好。 直接给一个从没见过的任务,模型还不能做到 zero-shot。原因是数据还不够多——“你没办法通过见过的任务排列组合变成一个没见过的任务。”

学习成本在下降。 第一代每个任务需要单独训一个模型(100 个任务训 100 个模型),第二代可以把 10 个任务训到一起用一个模型解决。预训练需要的数据从 100 条左右降到了 20 条左右。


七、行业判断:今年的变化与格局

新的变化

硬件在加速: 灵巧手公司层出不穷(已从夹爪时代进入灵巧手时代),触觉传感器越来越多(为精细化操作服务)。宇树、智源等本体公司已经跑通量产,供应链在成熟。

落地在加速: 去年 WAIC 时大家还在 demo(倒咖啡、叠衣服),今年明显转向真实场景落地(工厂干活、物流分拣),而且越来越多用模型驱动而非传统控制方式。

嘉宾观点与解释

最终格局会像大语言模型:大厂一两家 + 创业公司两三家。 每家会有自己的生态(数据+本体+场景),模型特性会分化——有的擅长精巧操作,有的擅长长程任务——但最终都会走向通用、走向进家庭。

不及预期的是数据。 在具身原生模型出来之前,行业虽然都在喊数据,但没有真正的推动力要求大规模数据。“没有训基模,就没有数据量需求。“灵波的具身原生实践某种程度上正是要催生这种需求。


八、创业的感悟:要敢赌

嘉宾观点与解释

创业要学会赌。 “没有人知道哪条路一定成功,资源又有限,路径不确定,就是要赌。如果一条路大家知道一定成功,大厂一定成功,为什么是你?”

灵波的两大豪赌:

  1. 不做本体(把全部资源压在大脑上)
  2. 做具身原生(完全放弃数字世界模型的延长线,从物理世界从头训练)

后者尤其冒险——“训了半天训了一年,花了好多资源,结果模型就是不收敛"有很多可能:思路错了、技术不成熟、资源不够。“但我觉得一旦做成,成就感是比较高的。”

最好的预期: 机器人真的进家庭,跑的是灵波的模型。 最坏的预期: 没做出来。某一次赌错了。

沈宇军推荐的人生之书是金庸的《笑傲江湖》——他特别喜欢令狐冲那种豁达的状态,“什么都不太在乎”。但如果机器人有性格,他希望它是"一个真人”——“核心还是要实用,在情绪价值和干活之间,我会果断选择干活。”


结语

这场访谈最值得记住的一个判断是:具身智能的核心矛盾是"大脑落后于本体”,而大脑落后的核心矛盾是"数据不够”。 灵波的实践给出了一个完整的解题思路——从传感器、视频时序、单向 MoE 架构出发构建"具身原生"模型栈,但这只是迈出了一步。真正的 GPT 时刻,要等具身数据能 scale up 到与互联网数据相当量级时才会到来。

而沈宇军对中国的一个判断也值得留意:在数据采集这件事上,中国一定比美国跑得快。 如果这个判断成立,那具身智能的竞争,可能不会像大语言模型那样由算力决定一切——数据的获取能力和规模化效率,可能成为更关键的分水岭。