先说结论

这期「十字路口」的核心不是又一场"具身智能有没有 Scaling Law"的站队,而是清华大学交叉信息研究院助理教授徐梦迪把这个问题拆成了两层:第一层,预训练数据规模与 held-out loss 之间的 scaling 信号已经出现——她点名了机器人公司 Dyna 的 Dyna-2,用百万小时第一人称人类视频做预训练,数据从 1 万小时加到 100 万小时,held-out MSE 明显下降(该结论出自 Dyna 官方技术报告,属公司自述,下文详述);第二层,也是她认为真正有意义的那层——loss 低不等于任务成功,因为机器人操作存在时序上的误差不均衡:拿杯子二十步里前十七步不接触物体、拟合再好,第十八步接触瞬间的误差一大任务就失败。她真正想见到的,是"数据变多、模型变大,未见任务上的成功率持续上升"的 scaling law,而这种信号目前还不够强。

顺着这条主轴,她给出了几个值得记住的判断:主流 VLA 的"预训练+针对目标域微调"范式约等于语言模型的 GPT-1 时刻,她期待的是 GPT-3 时刻——不微调、通过 prompting/上下文学习(in-context learning)让终端用户定义机器人的能力;她本人是"世界模型派"——理由是任务不可穷举而世界运行规律是任务无关的 foundation 能力,但同时强调模型能力(理解、ICL)未收敛前,“数据需求由模型能力反推"这个机制决定了数据战争不会终结;对回国一年看到的中国具身创业,她的评价是"实际进步与泡沫并存,就像控制系统的超调”。

信号与噪声:Dyna-2 的曲线,和 loss 不等于成功率的陷阱

徐梦迪对 scaling 信号的谨慎不是空穴来风。她看到的证据主要来自公司发布的结果:预训练数据从十万小时 scale 到百万小时量级后,在未见过的 held-out 测试集上 loss 有明显下降。这个描述与 Dyna Robotics 2026 年 8 月发布的技术报告高度吻合——据 Dyna 官方页面及多家科技媒体报道,Dyna-2 是一个用超过 100 万小时第一人称人类视频预训练的 world-action model(世界-动作模型),团队在 1 千/1 万/10 万/100 万小时四档嵌套数据上训练,held-out MSE 沿幂律单调下降(R²=0.919),并在从未见过的机器人平台数据上首次展示了"人到机器人迁移 scaling law"(zero-shot action MSE 沿幂律下降,R²=0.884)。需要标注证据层级:这些数字全部来自公司自报的 benchmark,Dyna-2 不开源、无 API,尚无独立复现。

但徐梦迪立刻泼了冷水:loss 和成功率不是直接挂钩的。她的解释是机器人操作存在时序不平衡——一个 20 步的拿杯子任务,前 17 步是自由空间运动,跟杯子没有接触,拟合得再好也不决定成败;第 18 步接触瞬间误差大,任务就失败。所以现阶段基于 loss 的 scaling 曲线"看起来很美",但离"未见任务成功率随规模上升"这个她想要的 wide scaling law 还有距离。

这个判断在外部资料中能找到印证。Dyna-2 报告自己也承认离线误差不等于闭环成功,其真机后训练实验显示平均归一化得分从 20% 一路爬到 53%(100 万小时档),锁盒钥匙任务在 10 万小时以下成功率为 0、100 万小时时达 90%——真机曲线确实在涨,但起点低、任务面窄(14 个任务中 11 个用同类双臂平台)。换句话说,徐梦迪的怀疑与 Dyna 自己的数据共同指向一个结论:scaling 的方向大概率是对的,但"成功率级"的 scaling law 还没有被干净地证明。

GPT-1 时刻与 GPT-3 时刻:她真正想等到的是什么

对"机器人有没有 GPT moment"这个经久不衰的问题,徐梦迪的答案是"会有,我非常相信 scaling"。但她的类比有精确的刻度:

  • 现在 ≈ GPT-1:主流具身模型是"预训练 + 针对目标域 fine-tuning",就像 GPT-1 时代需要针对性后训练才能解决具体任务;
  • 她想要的 ≈ GPT-3:通过 in-context learning,用 prompt(演示、偏好描述、修正指示)告诉模型要做什么,不微调参数,模型自己适应。微调比重降下来,机器人才能低成本地进入海量场景。

她用一个具体场景解释 ICL 的含义:所有人看到的叠衣服 demo 都是叠成方块,但真实用户各有各的叠法——她自己是胶囊衣橱、衣服卷起来放,有人按颜色摆,有人根本不叠直接挂起来。in-context learning 想解决的,就是让机器人具备"被终端用户定义"的能力:用户用自己的演示和偏好改变模型行为,而不是等厂商为每种偏好重新采数据。更进一步,她相信 incremental learning(增量学习)是模型最终 scale up 的方式——机器人学第一个新任务要半小时,学第一千个任务可能只要十分钟,学习能力本身在复利。

这条技术判断与她的学术履历一脉相承。她在 CMU 的博士论文《Building Adaptable Generalist Robots》(获 CMU 机械工程系 2024 年最佳博士论文奖,据清华叉院官网及量子位报道)的核心主张就是:构建通用机器人不能只靠 scalability,必须补上 adaptation——真实世界任务空间近乎无限,不可能把所有情况塞进训练集,必须让机器人到现场后根据少量信息快速适应。她在节目里回顾,这条思路的起点是 2021 年受 GPT-3 上下文学习启发做的 Prompt Decision Transformer(ICML 2022),后来又有续作 Hyper Decision Transformer——先学一个 hyper network,再生成只占整体参数 0.5% 的 adapter,在"改参数会遗忘预训练知识"和"不改参数无法适应"之间取折中。她明确说,如今数据量上来之后,她自己更看好纯 ICL 路线。

外部信息还能补一块拼图:她 2026 年 2 月参与的 CoVer-VLA 工作(斯坦福团队,测试时验证路线)已经展示了具身版 test-time scaling——联合扩展指令改写数和动作候选数能高效恢复正确动作,相比同等数据下继续 scaling 策略预训练,SIMPLER 基准分布内提升 22%、真机实验提升 45%。这可以视为"把算力从训练时挪到部署时"的另一种 GPT-3 式思路。她回国后还在 6 月的上海期智研究院报告里提过,机器人持续适应需要对开放的人类偏好对齐。可以看到,“快速适应"这条主线从博士论文贯穿到她现在清华团队正在做的桌面任务人机修正闭环(双臂+灵巧手平台上,人给修正指示,机器人改变行为)。

世界模型派的自洽:任务不可穷举,所以世界规律才是 foundation

节目里徐梦迪明确表态"我自己本身也是比较相信世界模型的路线”。她的理由值得展开,因为它解释了 2026 年行业焦点在"数据→世界模型→数据"之间摆动的深层逻辑:

任务(task)是一种不可 scalable 的组织方式——任务实在太多,无法穷举。如果你能通过世界模型让模型学到世界变化的规律,那是比"记住一万个任务怎么做"更 foundation 的能力。世界模型相对 VLA 的差异在于关注 representation(表征)和对世界的理解,而 VLA 是任务相关的路线。这个立场与她自己"预训练不是全部、适应才是分水岭"的主张自洽:世界规律可以在预训练中学到,但具体任务、具体用户偏好,必须到现场用 ICL 补齐。

这个表态也解释了她对"数据 vs 模型"之争的看法:数据与模型不是两条路线,而是看两个层面——数据决定模型能看到什么,世界模型决定模型怎么理解看到的。她把过去一年行业焦点的来回摆动描述成"大家在不断思考什么才是真正重要的问题",而不是非此即彼的路线清洗。

外部背景可以帮读者校准这个判断的分量。2026 年世界模型确实成了主战场:英伟达在 GTC 2026 预告了基于 DreamZero 研究的 GR00T N2(世界动作模型架构,官方称新环境新任务成功率达主流 VLA 两倍以上,2026 年底上市);Physical Intelligence 的 π0.7(2026 年 4 月发布,5B 参数)在 VLA 架构内嵌世界模型组件并首次实证了组合泛化;李飞飞 World Labs、Yann LeCun 的 AMI Labs 都押注世界模型。但注意一个反例信号:RoboArena 排行榜上英伟达 Cosmos3-Nano-Policy 只领先约两天就被 Spirit AI 的 Spirit v1.6 反超——世界模型路线的领先性在真机基准上仍是拉锯状态,并非定局。徐梦迪在节目里没有直接评价这些公司产品的强弱,她的立场是路线层面的:世界模型提供任务无关的 foundation 能力,但最终机器人系统会是"unified base model + 系统层辅助模块(embodied harness、外挂 VLM、视频生成辅助长程规划)“的螺旋上升结构——base model 越来越强,辅助模块也在增加,两者共同决定系统能力。

数据的悖论:模型能力定义数据需求,而不是反过来

节目后半段最有行业机制价值的部分,是徐梦迪对"数据到底难在哪"的回答。她的答案出人意料:难在需求的定义。数据是喂给模型的,但数据定义不是凭空定的,是由模型能力反推的——如果希望模型动作平滑,就要采平滑数据;如果希望模型有 failure recovery(从失败中恢复)的能力,就要专门采集包含失败与修正的轨迹。而现在大家对"模型应该有什么能力”(分割、追踪、深度重建、ICL……)本身就还没收敛,所以数据需求必然是模糊的、随模型认知演进而变的。这意味着数据战争不会有一次性的赢家——每一次模型能力定义的更新,都会重新洗牌数据采集的规格。

在这个框架下她自述是"融合派",给四种数据源各自安排了位置:

数据类型特点适合阶段
遥操作(teleoperation)最接近机器人本体训练后期:fine-tuning / post-training
仿真易造位置/纹理/颜色泛化,干净训练前端:预训练、mid-training、对齐
UAM(穿戴设备采集)介于人机之间,成本低中间层补充
人类视频成本最低,可大规模铺场景场景鲁棒性、任务相关信息

她对人类数据的辩护尤其有力:人是一个"非常成熟的、齐全的本体",human data 本身就是一种 modality——从人身上学的应该是场景变化规律和任务相关信息(物体怎么变、任务怎么推进),这些恰恰与 morphology(身体形态)不那么相关。这与 Dyna-2 的实验发现形成有趣互证:固定动作标注数据、只加无标注视频,机器人域的误差持续下降而人类域误差不降——视频预训练带来的收益特异性地体现在跨身体泛化上。一个学者和一个公司从不同角度收敛到同一个判断:视频是新的 scaling 轴。

中国具身创业:超调的系统,和跑不跑得通的数据闭环

回国一年,徐梦迪对中国具身创业的评价克制而具体。好的部分:从材料、传感器、本体到数据、模型,机器人系统的每一层都能看到国内公司在攻关,资源在持续投入,实际进步在发生。泡沫的部分:行业还没收敛,大家沿着不同的 bet 前进,焦点不断变化(去年聊数据、上半年世界模型、最近又回到数据),“泡沫一定存在,就像控制系统里的超调——PID 参数没调好,系统就会震荡”。她特意强调进步与泡沫不互斥。

比宏观判断更有操作价值的是她指出的最难关口:稳定的数据闭环。ICL 路线的愿景要成立,机器人必须进入真实场景,有合适的 mentor 教它做事,且用户教半小时后要有显而易见的进展,用户才愿意继续用,数据闭环才转得起来。但这有个鸡生蛋问题:base 模型不够好,学习速度就不够快,用户就留不住;可 base 模型的能力又需要场景数据来激发。她的团队目前跑通的是最简单的一环:桌面任务上,人给修正指示和演示,机器人改变行为(双臂 setup + 灵巧手,真机)。

这条"数据闭环"逻辑链串起了整期节目最核心的行业判断:GPT-3 时刻(ICL)不是纯模型问题,它是模型能力 × 场景进入权 × 用户耐心的乘积。任何一环断裂,scaling 的故事就停在 loss 曲线上。

几条可以带走的判断

1. 信号 → 机制 → 启发链条一:loss scaling ≠ 成功率 scaling。 变化:百万小时级视频预训练的 loss 曲线已现(Dyna-2 等公司自报);机制:机器人操作的时序误差不均衡使离线指标失真;影响:以 loss 为卖点的模型宣发需要打折,真机成功率曲线(如 Dyna-2 真机得分 20%→53%)才是硬通货;启发:评估具身模型进展时,先问指标是离线 loss 还是闭环成功率,再看任务面宽窄——这比追 demo 视频可靠得多。(Dyna-2 数字为官方自报,未见独立复现,置信度中等)

2. 链条二:模型能力定义数据需求。 变化:数据焦点在数据/世界模型间摆动;机制:数据规格由"想让模型有什么能力"反推,而能力定义未收敛;影响:数据生意没有终局形态,每次模型范式更新都重洗数据规格;启发:判断一家数据公司的持久性,看它绑定的是特定模型范式还是跨范式的采集/清洗基础设施。这条逻辑同样适用于研究者:先想清楚模型要什么能力,再设计数据,比"先采了再说"高效。

3. 链条三:GPT-3 时刻的门槛是数据闭环而非模型本身。 变化:ICL/test-time scaling 等部署时适应技术兴起(Prompt-DT 一脉、CoVer-VLA 的测试时验证);机制:用户教半小时必须看到进展,否则闭环断裂,而 base 模型能力决定学习速度;影响:具身公司的护城河将从"采了多少数据"转向"能否持续转动场景数据飞轮";启发:观察一家具身公司,别只看模型榜单,看它的机器人是否真的在用户身边越学越快——这是徐梦迪团队自己选择先啃的硬骨头,也是她给行业画出的分水岭。

最后回到她个人的部分。从衡水中学的物理竞赛班,到清华车辆工程、研究蜜蜂翅膀超弹性恢复(节目原话,指导教师为机械系阎绍泽——据清华机械系官网,其研究方向含昆虫仿生),到 CMU 读机械工程博士却一路追着 GPT-3 的上下文学习做机器人 adaptation,再到斯坦福博士后(吴佳俊、李飞飞组)一年半做了三个工作后回国——她描述自己的关键词不是"一帆风顺"而是"幸运",而幸运的方法论是选能放大自己能力的环境,像游戏通关一样让能力翻倍。李飞飞教她从十年视角定义真正重要的指标(“真正重要的只有 success rate,其他都是 development 视角的指标”——爱因斯坦:把事情变得简单,而不是更简单),吴佳俊教她 hands-on 和建立 research brand(研究一个问题超过三五年,它自然成为你的 brand)。被问"为什么觉得五年后自己能成为顶尖 researcher"时,她复盘自己当年"我一定可以"的回答并不好,更好的答案是:找到那个感兴趣的问题,沿着正确的道路研究五年,就不会差。这大概也是她对具身领域整个行业的隐喻——马拉松 42 公里,她判断现在跑到了第 10 公里。