先说结论

九月初 OpenAI 发布 GPT-6 Astra,通用模型直接驱动机械臂完成抓取、画图的操作视频在社交媒体刷屏,“基模降维打击具身智能"的说法迅速流传——第三方评测机构 Robocurve 的实机测试显示,Astra 在双臂"抓取方块放入碗中"任务上取得 95% 成功率,明显高于 Claude Fable 5.1 的 40%(据白鲸实验室 2026 年 9 月报道)。就在这个节点,十字路口播客请来了深朴智能(Simple AI,转写误作"声谱/深谱”)首席科学家王家伟:24 岁,中科大少年班出身,中科大与微软亚洲研究院联培博士,先后在 DeepSeek 多模态组(参与 V3 预训练数据工作)和字节 Seed 早期 Agent 组实习,毕业时选择离开大模型最热的中心。

这场对话最有价值的不是履历,而是两件事。其一,一位刚从大模型内部走出来的年轻人,如何论证"GPT-6 吃不掉具身":大脑(理解与规划)已经收敛到 GPT 范式,但小脑——实时、可控、能快速纠错的动作模型——以及围绕真实场景的数据闭环,仍是基模公司短期够不着的自留地。其二,在具身行业的数据军备竞赛里(真机遥操作 30 秒数据约 15 元、20 万小时要花 2 亿元以上,据 2026 年行业报道),他为什么押注高精度自采的 UMI 路线,并把"零后训练的 zero-shot 泛化"当作核心信号。对不从事具身行业的读者,这期播客也提供了一个普遍的决策样本:当平台型能力快速上移时,后来者的机会不在追赶平台,而在平台够不着的那一层。

从最热的地方离开:一条反直觉的路径

王家伟的成长路径近乎"别人家的孩子"模板:小县城读完小学初中,高中进合肥一中,高二参加高考进入中科大少年班。他还原了少年班的选拔细节:十五周岁以内参加高考,分数线达到科大录取线(可下浮约二十分)后进入面试——当天连续上一节数学课、一节物理课,随即考试,考验的是现学现卖的知识吸收与转化速度;之后还有院长一对一的开放面谈。那一届少年班三十多人,从约一百名面试者中选出。他对这段经历的总结是"没有被高三荼毒":大一上通识课,大一下自选专业,他选了计算机,本科就跟老师做分子马达的计算机模拟这类交叉研究,还做了很长时间的少年班班长——“很 ENTJ”。

多年后他对"聪明"的定义做了修正:思维敏捷的人很多,但那可能不是最重要的;最重要的是会提好问题,其次是知道自己的不足并愿意直面它。这不是客套——他随即举例自己的短板是硬件(焊板子、搭电路一直提不起兴趣),而做机器人"不得不去面对",只能频繁向硬件团队请教。主持人追问他为什么放着多模态大模型的软经验不用、偏要扎进自己经验缺失的领域,他的回答是角色判断而非技术判断:在语言模型这个已经高度收敛的领域,new grad 更多是在执行既定计划;而在具身这个"整个行业都没收敛"的地方,他有机会做"能自己定义事情的角色"。用他的话说,“风浪越大鱼越贵”。他承认最大的风险是时间——方向踏错,探索几年发现全错,对个人打击很大;但导师的态度(“年轻人就该闯一闯,失败了从头再来”)抬高了她的风险承受意愿。

从外部信息看,这步跳板的另一端并非无名之辈。据清科等投融资信息,深朴智能成立于 2024 年底,一年内完成四轮融资:2025 年 10 月种子轮(顺为、百度风投等)、11 月种子+轮 2 亿元,2026 年 4 月天使轮数亿元(线性资本、普华资本领投),6 月 Pre-A 轮数亿元由滴滴领投;创始人李晓飞是清华博士、L4 自动驾驶全栈背景。公司通稿称王家伟放弃了华为"天才少年"、字节 Top Seed、阿里"星"、腾讯"青云计划"等顶尖人才项目全职加盟。据 embodiedglobal 等报道,深朴已与中国旅游集团酒店合作,在北京丽都维景酒店落地了 Simbot 机器人酒店 POC,以"类家庭"商业场景为进入家庭的跳板。

GPT-6 Astra 冲击波:大脑与小脑之辨

播客录制于 Astra 发布后"前两天"。王家伟坦承第一反应是震撼:一个通用语言模型在抓积木这类任务上成功率非常高,把过去依附于小模型的感知、定位、空间理解能力全部融合进了自身。他描述了那段刷屏的机械臂画金门大桥视频:模型画了四遍——第一遍在尝试怎么用笔,第二遍逐渐有轮廓,第四遍才成为最终看到的样子,每画完一遍换新纸,但上下文一直保留,模型据此持续修正末端控制。“非常强的试错、总结经验的能力。”

但与行业内"具身公司要被清盘"的悲观声音不同,他的结论是分层的。具身系统跟人一样,除了大脑还需要控制肌肉的小脑:GPT-6 一次推理时间很久,展示视频"可能都是十六倍速或三十二倍速";静态环境里可用,但真实动态环境里——他举了拿咖啡杯的例子——第一次没拿好杯子倾斜,模型没有实时控制能力,很难快速调整回来,倒了就难以恢复。所以他认为大脑一侧已经收敛到 GPT 范式(从头另起炉灶既不必要也不现实,正确做法是把第一人称、第三人称视频转成可训练任务补充进去),而下面必须配上好的 action policy 提供"肌肉反应"。至于 System 2 会不会最终吃掉 System 1,“上面把下面吃掉是有可能的,但时间节点很难判断”——他由此给出一个我很喜欢的判断句:**即使我们能看到终局,也不能放弃中间阶段必须做的事情。**深朴可以瞄着终局做一个统一的 10T 具身模型,但他选择把 action 能力做扎实,等上面的大脑足够好、自己的小脑足够稳,用 harness 把两者结合就能落地。这也是深朴发布 agentic OS 的逻辑:围绕上层大脑做 harness 设计(语音交互、任务分解、工具调用、细致的上下文管理、大脑与小脑的交互协议),System 2 暂时直接用字节 Seed 的模型——创业公司算力珍贵,优先级放在 action 预训练上,这与他"大脑还在快速演进、看不到头"的判断自洽。若问国内谁最可能做出类 Astra 的具身语言模型能力,他押两个:Seed 的多模态,和千问。

这个分层判断在行业噪音中并不主流。白鲸实验室的报道里,亚马逊 Alexa 首席科学家 Zeeshan Zia 断言"机器人领域的 OpenAI 可能就是 OpenAI 本身";前地瓜机器人具身负责人何泳澔甚至认为 VLA、世界模型方案"可能已没有太大投入价值"。王家伟的观点代表另一极:通用智能外溢是真实的(“System 1 和 System 2 的边界会越来越模糊”),但实时控制这块拼图需要 action 能力反哺进去,融合方式与时间都未知。两种判断的分歧点,本质是对"推理延迟曲线"和"数据反馈闭环"谁先收敛的赌注。

数据的性价比账:为什么自研采集、为什么只开源两千小时

深朴的自我定位是终端公司:不是数据公司也不是模型公司,具身链路从数据、模型、部署到真机极长,“最终产生价值的是把这些放进产品里”,所以不得不全栈——“不是为了做全栈而做全栈”。链路第一环是数据,而数据的起点是一段折腾史:团队测了市面上多款数采设备,精度和时间同步都达不到要求,于是自研了 HiFi-UMI(播客原话作"High Five Million",即 HiFi-UMI)高保真采集系统。几个关键设计:六路相机(头部双目做 SLAM 定位、双腕各配上下两台防遮挡);抛弃传统基站定位,仅靠相机做到毫米级轨迹恢复;时间同步做到微秒级——他特别强调很多后来者的 UMI 工作在想办法弥补时间戳不同步,而深朴的数据"从源头上就是准的";轨迹在仿真中回放到自家本体的可执行率超过 95%,这是敢于规模化采集的底气。

UMI(Universal Manipulation Interface)源自斯坦福宋舒然(Shuran Song,转写作"宋书元")团队的通用操作接口思路:数采员戴夹爪手套执行任务并记录轨迹作为训练语料。在这条线上,深朴开源了 HiFi-UMI-2K 数据集的两千小时真机操作数据(内部积累已达数万小时,嘉宾称),节目称其在 Hugging Face 与 ModelScope 累计下载量五十多万,外部报道(robotico.market)称其在 Hugging Face 单月下载超十六万——量级可相互印证。开源的动机一半是研究者的自豪感,一半是收集反馈:已有多家海内外公司发邮件求购数据,收到的具体批评包括手部定位 marker 太大影响视觉、手套在真机上发热严重。数据标注环节则有个时代感很强的细节:他们用 GPT-6 Astra 批量辅助标注清洗,发现做得比人好、能 24 小时运转、成本与人工相当,但推理效率低(充值 Codex 额度做,有限制),于是用 Astra 标的数据自训小批量标注模型持续迭代——用最强大脑给数据流水线打工,再蒸馏出自己的标注员。

真正值得展开的是他对数据路线的性价比框架。行业背景是:真机遥操作 30 秒数据约 15 元、1 小时约千元,凑 20 万小时要花 2 亿元以上(据 2026 年行业报道);而第一人称 ego 人类视频看似便宜(嘉宾称约 30 元/小时能买到不错的数据),但他算的是全生命周期账:ego 后续的标注与训练投入"非常非常贵",效果与代价的斜率未经充分验证;更关键的是引入 ego 会给尚在验证期的 scaling 实验增加新变量。相比之下自采 UMI 成本可控、可用率高(“不会采十万小时只能用一万小时”)、数据量适中到"可以非常充分地验证不同参数、不同配比下模型的表现"。这个判断与行业大流相反——2026 年人类数据路线高歌猛进:英伟达 EgoScale 用约两万小时第一人称视频训练并声称发现首个机器人灵巧性 scaling law(1000 到 20000 小时使平均任务完成率翻倍以上),Generalist 的 GEN-0 用约二十几万小时人类数据首次声称在机器人领域观察到 scaling law,GEN-1 扩到五十万小时,国内智在无界的 Being-H0.7 也到了二十万小时。王家伟的回应是承认看到了 scaling 趋势,但拒绝使用"scaling law"这个词——那需要严格的实验证明数据量、模型规模与算力之间的配比关系使训练可预测,他们只敢说观察到了 power law 现象。

在这条路线上,深朴声称的信号是 zero-shot:模型在几千个任务上直接预训练后,不做任何后训练就能执行任务——包括训练集中数据占比仅 0.5% 的小任务,以及从未见过的组合任务(数据集里有"零食放垃圾桶",没有"零食放盘子",指令一下模型直接把零食放到蓝色盘子上)。他特意与 Generalist 对比:GEN-1 声称每个任务只需约一小时真机后训练数据就能达到很高成功率(官方博客可证),但"他们没有说过 UMI 类数据直接预训练完就有 zero-shot 能力"——这是深朴认为自己数据质量路径成立的核心证据。需要标注的是:这是嘉宾自述、其基座模型计划年底发布,zero-shot 声称届时才能被外部检验。

评估真空里的噪音与信号

被问到具身智能为什么显得浮躁时,王家伟给的解释是评估基础设施的缺失。语言模型有 API、结果可复现、有开源技术报告(他举 DeepSeek 为例),技术壁垒因此没那么高,学生也能跟上前沿;具身则既没有公允 benchmark——仿真类如 LIBERO 靠纯后训练就能刷到高分、没有参考价值,仿真与真实世界有 gap,真机评测又无法复现(别家模型没在你的本体上训过,拿过来大概率不可用,你也无从知道对方用了什么数据)——也存在结构性利益冲突:曾有具身公司自己做真机 benchmark,“既当裁判又当运动员”,其他人不服,不了了之。他的应对是把评估做扎实并保持真实:zero-shot 实验就明说是 zero-shot,用了多少数据就写多少,按自己定义的能力维度(适应/OOD 泛化、steerable 可控性、上下文理解)从简单到困难呈现成功率;至于行业层面,“看产品说话,看用户买不买账”。

节目里最有技术品味的一段,是他区分"in-context learning 的真假"。他最 respect 的是 Generalist 的 GEN-1.5:原生支持 30 秒上下文(官方可证),参考视频只有 3-12 秒且能力是预训练中自然涌现、没有单独训练过——尤其震撼的是第三人称视角参考:人站在相机前把一个杯子叠到另一个杯子上,机械臂能直接模仿,这不是一一配对的对应关系。而近期另一些工作(他点名美国 Scale 等机构的结果,明确说了是专门训练了 pair 数据)在他看来"只是暂时的妥协":in-context learning 对应两样东西——对上下文的深刻理解和 steerable 的可控性,缺了这两样强行训上去再做 demo,“我觉得不是很本质”。这类辨析正是当前具身行业最稀缺的能力:同样的 demo 视频,背后可能是涌现能力,也可能只是数据工程。

他对 context 的执念来自语言模型的训练——“agent 里 context 是最重要的点”,而具身领域大量工作假设"根据当前 observation 就能把事做了"。他把 context 分三层:短时上下文蕴含丰富因果(第一次夹水杯没夹紧、滑了、下次夹紧——一秒内的观察-动作-反馈链);中等长度对应记忆迁移(拿过第一个杯子就知道宽度,拿第二个不用重复试错);长期对应跨时段任务(东西放进抽屉后,人让机器人去找,没有记忆就每次都要重新学)。落到工程上,context 带来 token 膨胀、推理延迟下降的诅咒,对延迟敏感的机器人系统是硬约束——所以"从数据和模型两侧都要做事",这是他们模型 special 设计的落点。

读者启发与一个三年之赌

把这场对话压缩成几条可迁移的链条:

平台能力上移时的卡位。 通用基模外溢到具身(Astra 事件,外部可证)→ 纯"大脑"型具身公司价值被质疑(行业恐慌声音)→ 但实时控制与场景数据闭环仍是缺口(嘉宾论证)→ 深朴的应对是把有限算力押在 action 预训练 + harness,大脑暂用 Seed 模型,等对方进化自己落地(嘉宾策略)→ 对任何行业的启发:平台快速上移时,别追平台,押注平台够不着的那一层(执行层、数据回路、场景理解),并保持"能看到终局但不跳过中间阶段"的纪律。

数据决策算总账不算单价。 真机遥操作成本堵死 scaling(外部数据)→ 人类数据路线分化:采购 ego vs 高精度自采 UMI(行业格局)→ 深朴选后者的依据是采集成本×可用率×验证充分性的综合性价比,而非绝对量(嘉宾框架)→ zero-shot 泛化是这条路线的早期回报信号(嘉宾声称,年底模型发布可验)→ 启发:数据军备竞赛里,“便宜但脏"与"贵但准"之间的选择标准不是单价,是它能否支撑你在主变量上做干净实验。

无标准赛道里的锚。 公允 benchmark 缺失 + 裁判运动员不分(嘉宾观察,LIBERO 刷分等外部可证现象)→ 行业噪音放大(world model 炒作、pair 数据版 in-context learning,嘉宾批评)→ 深朴的锚是从第一性原理定义"具身的智能是什么”(三能力框架),自建扎实评估,最终交给产品与用户 → 启发:没有外部标准的领域,唯一的防噪手段是显式定义自己的能力标准与验证方式,并对每个 demo 追问"这是涌现还是数据工程"。

个人层面也有几个耐咀嚼的判断:聪明最重要的是会提好问题(主持人在结尾坦承每次录播客都怕自己 prompt 不够好、浪费了有料的嘉宾——这个自我指涉恰好是论点的注脚);工作强度不是产出的必备条件(他在 DeepSeek 的观察:“工作强度确实不大,但仍能做出很好的工作”;深朴规定工时九点半到六点半,AI 工具额度无限制,主要用 Codex,“每个人更多需要的是管理好你的 agent”);以及不收敛领域对 new grad 的特殊馈赠——没有必须跟随的奠基性工作时,你有机会自己定义问题。

播客的结尾是一个具体的赌注。王家伟说,导师曾抱怨家里有洗碗机但每次仍要花约二十分钟把盘子清理干净再塞进去;如果三年后机器人能在家庭里完成"帮忙收餐桌、塞洗碗机"级别的任务,就足够令他兴奋。主持人追问概率,他给出"三年实现的话百分之八十"。主持人则用那句行业老话收束:我们经常高估两年内的变化,而低估十年后的变化——三年恰好是高估与低估开始接受检验的时间点。届时检验的标尺不是 demo 视频,而是产品:模型的 zero-shot 声称能否复现、酒店与家庭场景的闭环数据能否转起来,以及那只属于深朴自己的"小脑",能不能稳稳地端起一杯不许洒的咖啡。