先说结论

这是 2026 年 9 月 10 日外滩大会主论坛"物理智能——分歧与抉择"圆桌的现场实录(播客《十字路口》主持人为 Koji/杨远骋),四位嘉宾分别是苏度科技联合创始人兼 CEO 韩铮、蚂蚁灵波科技首席科学家沈宇军、自变量机器人创始人兼 CEO 王潜、破壳机器人创始人、清华交叉信息研究院助理教授许华哲。整场讨论最值得记住的不是谁对谁错,而是四家公司在同一个问题上给出了结构完全不同、且都没有收敛的答案:数据从哪来(仿真还是真机)、智能住在哪里(通用大模型能不能"降维打击"具身公司)、跨过泡沫靠什么(成功率、持续付费、还是阶跃式泛化)。四位嘉宾真正达成共识的只有一点:具身智能不会简单复刻语言大模型的发展路径——它同样需要预训练、数据和评测,但一进入物理世界,智能面对的是传感器噪声、接触物理、硬件可靠性和商业成本,“理解指令"从来不是最难的部分。

数据之争:分歧的真身不是"仿真 vs 真机”,而是 Sim2Real 还是 Real2Sim

韩铮(苏度)把公司的路线讲得最直白:苏度坚信仿真,但同时坚信真实数据有用,二者不是二选一。他的依据来自十年积累——2015、2016 年就开始做机器人仿真器与合成数据,经历过科研开源版和商业化版两轮迭代。他判断仿真是绕不过去的,核心理由是真实世界数据收集效率慢、质量受限;而市面上现有的仿真器——包括他们自己之前开源的(转写为"Cabinet Skill",经外部核验苏度此前开源的仿真器名为 CP-M、Skid,此处保留存疑)和英伟达 Isaac——在大规模预训练上都有局限,所以苏度在 2024 年之后做了完全重构的闭源数据管线。成果是去年底训练、今年四月放出的结果:在物体、环境、光线几乎无限制的组合条件下,抓取、放置乃至组装类技能"几乎能达到 100% 的成功率"。他补充了一个行业信号:美国同行最近也在加强仿真器能力,苏度创始人苏昊的一名尚未毕业的学生最近加入了美国某公司担任仿真器核心负责人。

沈宇军(蚂蚁灵波)的回应是全场最有信息量的反转:他说灵波内部从来不认为哪种数据一定要选或一定不选——预训练阶段互联网数据和真实物理数据作用更大,而针对具体任务(尤其类比自动驾驶)仿真仍有价值,“我们没有说仿真坚决不行”。他真正想指出的盲区是:行业谈 Sim2Real 的 gap 谈得太多,但真正卡住的是 Real2Sim 的规模化——传感器噪声这类底层物理不完美,能不能被规模化地搬进仿真器?他以触觉为例:灵波测过很多真实触觉传感器的信号,与仿真出来的"基本上千差万别"——频率、幅值、传感器之间的一致性都难以完美复刻。他的第一性原理是:机器人未来在现实世界干活,所有观测只能来自身上带误差的传感器——你不可能给机器人插一个键盘。物理世界的这种不完美是真实数据不可替代的根本原因。

许华哲没有在这轮直接发言(他在后续"高估/低估"环节补上了数据观点),但结合外部报道可以补齐拼图:他认为行业对"一百万小时"“几百万小时"数据量的追求被严重高估,已看到超大体量数据训出的模型并不比几万小时的更好,数据的质量、分布和训练方式才是决定性因素。

智能之争:Astra 测出来的是"物理泛化仍属具身公司”

GPT-6 Astra 发布后社交媒体上"具身智能要被语言大模型降维打击"的说法,被王潜和许华哲用第一手测试数据拆解得相当干净。

王潜的回应分两层。第一层是事实判断:这个版本的模型里训进了大量机器人数据——OpenAI、Anthropic 从去年初开始大量采购机器人数据、自建小规模数据工厂、招机器人人才,“本来就是一个非常好的多模态模型,再加机器人数据能做这些事,不是特别奇怪”。第二层是理论框架,他称之为"暴论"但坚持是"正论":智能的本体存在于数据里,模型只是训练阶段的蒸馏器和部署阶段的容器。如今语言模型每一版提升,更大动力来自越来越好的数据而非模型架构——大家大部分时间花在造数据、挑数据、验证数据、标注数据上,Coding 之所以先被解决,正因为代码是最容易制造也最容易验证的数据,其次是数学,然后是 3D 和视频生成。由此推论:如果 OpenAI/Anthropic 做具身仍需依赖同样的数据基础设施、验证基础设施、仿真器和硬件,“它只是另外一个具身智能公司而已”,这些难度不会因其基础模型优势而降低。至于大家真正担心的"通用智能泛化到具身",他认为可能性很小:语言模型历史上从未发生过——Coding 的成功没有让数学自然变好(最近 Navier–Stokes 方程被解靠的不是这个),训练中 Coding 和数学能力甚至会"打架",需要分别训 expert 再用 OPD 等方式合并;同理,视频生成做得再好也没有直接转化为机器人控制的优势。但 Astra 带来一个确定启示:预训练是 work 的,通用数据至少是 bonus 而非有害,行业应坚定走预训练+数据/验证 Infra 这条路。最终格局可能是:OpenAI 把这套 Infra 融进通用语言模型,自变量做行业专用模型,而通用大模型无法在机器人上以合理速度推理部署,专用具身模型才是更高效率的做法——两种做法的上限和速度不会有明显区别。

许华哲贡献了全场最具体的一手测试。破壳在 Astra 可用当天就做了测试,他把具身任务拆成语义泛化、空间泛化、物理泛化三个维度:Astra 语义和空间很强——prompt 给它,桌面上无论真假什么类别全认识,会往对的地方走;过去 VLM 走到目标附近就开始乱动,Astra 能抓起非常难抓的东西(桌面上的一根筷子),甚至能立起来插进杯子,三维空间效果都很好。但一到带物理接触的复杂任务就不行了:用筷子挑东西、叠盒子、叠衣服、以及最复杂的麻婆豆腐,Astra 都做不了;它勉强能完成的最难动作是筷子插杯和 hand-over(一只手递到另一只手),后者"测了很多次,有一两次成功"。他的结论:复杂物理交互(Contact-rich)是具身公司最后的阵地。外部可交叉验证:第三方机构 Robocurve 测得 Astra 积木入碗 19/20(95%),但拼图入槽仅 2/20(10%),简单抓放平均每轮还需约 2.5 分钟。许华哲的展望是把具身模型接到 Codex/Harness 环境里形成完整系统,他用抓水果的例子说明为什么需要大模型做语义判断:训练常用泡沫玩具水果,但泡沫可以靠加大力抠着揪起来,真菠萝无论如何不能那么抓、得揪叶子——抓完识别真假再换策略的能力,大多数具身模型没有,而这正是 Astra 类模型能补的环节。

韩铮在这一轮补充分层观点:上层抽象理解与底层技能会分层,但底层技能的泛化性与高成功率必须同等水平——只有泛化性而成功率不高,上下衔接时是致命的。他重申多年观点:Physical Intelligence(转写误作"Facebook Intelligence")最大的对手是 OpenAI,最近还有 Anthropic(DeepMind 一位 Robotics 研究员刚加入);苏度去年底的演示就是千问模型做语言交互、拆解抽象指令,靠底层极稳定的操作完成动作 chaining。

沈宇军则给出了反向视角,比许华哲"差不太多"但"稍微更激进":具身可能反过来影响云端大模型的发展路径。机器人模型的工作方式与轮次式对话根本不同——传感器输入源源不断、不可打断,推理中要随时根据新输入改变决策,7×24(他开玩笑说"30×24")全年无休。因此具身模型最终会成为高阶模型使用的"工具",且需要自己专属的训练范式。反向看,具身还会给大模型喂新语料:人与人对话本身就是多模态的——聊天时外面下雨、对方脸色不好,都会改变你说什么——这些来自物理世界的实时信息是现在躲在屏幕后面的云端模型完全没有的,机器人真正走入生活后,这些数据可能让大模型"不再是一个冷冰冰的躲在后面的智能体"。

场景之争:跨过泡沫的三个不同指标

主持人把外界的现实质疑抛给三位具身公司 CEO:demo 很多、融资火热,但真正规模复制且让客户持续付费的场景在哪里?

韩铮的指标是高成功率+泛化。他把科研与商业化的要求对齐到工业机器人时代:绝大多数任务可商用的前提是高成功率——100 个任务里也许只有 1-5 个能接受 80% 成功率和二次纠错,其余九十多个几乎要求接近 100%。在此前提上,与传统自动化的区别是还必须对物体和环境有泛化性,且不能靠大量后训练成本弥补,否则每来一个场景就要过拟合一次。商业化最大的考验首先在算法层:高成功率下同时保有泛化性;之后还有设备可靠性、运维服务绕不过去。

王潜的指标最直接:客户能可持续地付钱,并且付得越来越多。他提醒现在很多商业化其实是用上一个历史阶段(传统自动化/传统机器人)的付费方式在运转,虽然"可持续"但天花板明确。本代机器人真正该证明的是比上代强在哪、能提供什么上代给不了的真实价值——他以自变量的物流场景为例:已经做到传统机器人做不到的事情,并且超过了人类 ROI 水平(外部可核验:自变量 8 月在顺丰仓库直播实测分拣 1816 件/小时、成功率超 98%)。他还给出商业与研发的飞轮逻辑:公司一定要赚钱,有钱才能做更大的模型;语言模型公司也经历了从完全不赚钱到商业化与前沿推进互相促进的过程,“某种意义上过早的商业化是有害的,但也许我们已经过了那个时间段”。

许华哲把具身商业化拆成两类。第一类是后训练类:跟某个品牌、某个工厂在闭环里落地(他举例:在我家门口小吃摊搞一个关东煮机器人),核心指标是花多少小时能稳定部署、能开多少家小吃摊——逻辑与上一代机器人相同,看效率和 ROI,短期能看到现金流。第二类才是这一波真正的悬念:具身智能的大模型化——他解释了为什么公众体感差:GPT 以 50% 成功率输出答案,对话几轮大概率能得到好结果,大家觉得真有用;机器人以 50% 成功率干活,有一半概率把杯子打碎,大家觉得真没用。但这个 50% 是"面对所有任务、面对全世界任何事情的 50%",等它从 50% 涨到 60%、70% 直到 99.9%,“那个商业化才是这一波具身智能真正意义上的商业化”——基础模型一瞬间达到某个阶段、开始吃掉物理世界的很多东西。这是阶跃式的,不是线性的。

五年后回看:被高估的供应链、训练技巧与数据量,被低估的系统工程、具身重要性

最后一轮"高估/低估"是全场观点密度最高的部分,四人给出了几乎不重叠的答案,恰好构成一张行业认知地图。

**韩铮:最被高估的是中国供应链的先进程度。**选择多,但满足具身迭代所需成熟度的供应链还有距离:一是数量支撑不够,二是传感器等关键组件散落在汽车、工业机器人等成熟行业里,尚未服务具身场景,距大工业制造水平有差距——但他相信在中国肯定能解决(外部背景:苏度 R1 已实现 98% 首次抓取成功率,但韩铮称拿到的基础元器件还没有一家经过上万小时连续运行检验)。被低估的方面,他回应许华哲的 99.9% 目标:中间能否用非后训练过拟合的方法值得探讨,一到两年内会看到某一大类任务在各行业被快速处理,但 99.9% 的任务都能做确实需要很长时间。

**沈宇军:被低估的是具身作为复杂系统工程,被高估的是训练模型的技术。**现在大家把落地、解题成本统统跟模型性能挂钩,但商家最终看的是成本——是否一定要用完整人形机器人?是否只用双臂就可以?模型只是其中一环,系统鲁棒性和完整商业逻辑几乎没人谈。高估的一面:行业里"要么被数字世界模型降维打击、要么复刻他们的路攒一波物理数据按旧方式训出具身模型"两种声音他都不认可——具身会走与数字世界相同的模式,但一定不会走相同的技术路线,因为应用场景决定模型形态:数字世界是对话式的,具身必须一边工作一边推理,你不能要求机器人在干活时屏蔽外界输入。具身会有自己的新训练范式,支持对物理世界信息的持续处理。

王潜:被低估的是具身智能的重要性和潜力。数据之所以重要,是因为它包含其他方式无法获得的智能能力——复杂物理交互、物理过程、传感器噪声、物理世界本质的不可控,都无法通过视频、3D、代码获得。他用自己的物理研究背景做类比:人类创新大量来自"物理直觉",与数学式逻辑推理是两种无法互相弥补的思维方式,构建真正的 AGI 无法回避前者。更激进的应用判断:当前对 RSI(递归自我改进)的狂热与恐惧都早了——以目前语言模型能力不足以实现完整 RSI,缺的最重要环节是物质上的再制造:语言模型可以修改训练流程,但 scaling 需要的更多算力、芯片、电力它无法自我创造;美国数据中心建设已成实质阻碍,还得靠人做钢筋混凝土、调半导体工厂参数。五年后大家会意识到具身智能正是能干这件事的载体——那时真正的 RSI 才到来。他给出现实的锚点:今天一个人开一堆 Agent 几小时能做出五年前需要大团队一年的 app;五年后,造一架飞机也许能像今天做 app 一样简单,生产全流程闭环,“硅基脱离碳基”。他还留了一个政策注脚:具身智能公司也应把数据放进语言模型,也许中国要走自己的 AI 发展之路,具身是重要起点,“也许之后每家公司都会训一个自己的语言模型”。

**许华哲:被高估的是对数据量的追求,被低估的是具身智能模型的进展速度。**市面上"一百万小时"“几百万小时"“谁买了多少数据你不买就落后"的叙事,与实际训出的模型表现不符。而被低估的进展是:三年内具身智能就可以在很多地方开始服务,而且是通用服务,不是在某地后训练好的专用服务——比行业惯常的"五年十年"预期激进一倍。

怎么读这场讨论:机制、影响与观察指标

把四人的发言叠起来看,这场圆桌真正的价值在于暴露了具身行业当前的三个深层结构,而不只是四家公司的立场:

**第一,数据之争的实质是"预训练通用性 vs 部署现实性"的分层。**韩铮押注仿真能把预训练规模做起来(效率逻辑),沈宇军押注真实传感器的不可仿性决定了最终落地模型的底色(第一性原理逻辑),两者其实可以在同一张技术栈里共存——预训练用仿真扩规模、后训练/部署用真机对齐物理,这正是双方都承认"不是二选一"的原因。对读者的可迁移判断:评估一家具身公司,别问"仿真还是真机”,要问它的数据管线能否同时支撑规模化预训练和物理保真,以及 Real2Sim 这一步是否可规模化。观察指标:仿真器自研投入、真机数据占比、以及未见物体成功率与已见物体成功率的差距(外部参考:许华哲此前披露内部模型已见物体 98.1%、未见约 80%)。

**第二,Astra 冲击的实质是"智能住在模型里还是数据里”。**王潜的"数据本体论"是全场最可迁移的思维框架:如果一个领域能力忽然跃升,先去找它的数据基础设施变化(Coding 之先被解决),而不是归因于模型架构。Astra 的机器人能力大概率来自 OpenAI 从去年初开始的机器人数据采购与数据工厂(招聘信息显示其机器人数据岗位要求 EB 级数据基础设施),这既解释了它为什么强(语义+空间),也解释了它为什么弱(物理接触数据仍稀缺)。对具身公司而言,护城河不在模型层而在数据与验证 Infra;对通用模型公司而言,进入物理世界没有捷径,“只是另外一个具身智能公司”。观察指标:OpenAI/Anthropic 的机器人数据采购规模、具身公司数据管线的定制化程度(外部参考:蚂蚁灵波 CEO 朱兴称已从购买成品数据转向模型定义需求的定制化采集,数据漏斗可用率从 15% 拉到 90% 以上)。

**第三,商业化之争的实质是"这一波的价值是替代还是增量"。**王潜的"付得越来越多"与许华哲的"50%→99.9% 阶跃"看似一个务实一个理想,实则指向同一件事:本代具身智能的定价权来自上代自动化做不到的事(增量),而不是把旧任务做得便宜一点(替代)。韩铮的成功率红线则划出了商业化的物理下限。对投资者和从业者,这意味着两条完全不同的估值曲线:后训练类项目看传统自动化指标(部署小时数、ROI 回本周期),基础模型类看泛化成功率曲线的斜率。观察指标:客户复购与付费扩张(而非一次性试点订单)、同一模型跨场景的任务成功率分布、以及物流/药房这类"环境受控、任务不长程"场景的规模化复制速度(外部参考:蚂蚁灵波在国大药房的夜班分拣、自变量在顺丰的 1816 件/小时分拣,均已越过试点阶段)。

一个值得留意的空白:四位嘉宾都没有正面回答"人形机器人形态是否必要"——沈宇军提到商家会问"是否只用双臂就可以",但形态之争在这场圆桌里被刻意绕开了。这可能是下一场分歧的种子。

(本文基于播客转写稿整理,全部观点归属原嘉宾;转写中的音误已按上下文校正——韩征→韩铮、王谦/王前→王潜、华泽/华瑞→许华哲、巨声/巨深→具身、 stra→Astra、Facebook Intelligence→Physical Intelligence、凌博→灵波、千问模型→通义千问。外部核验来源:腾讯新闻《具身智能,如何证明自己不是泡沫?》2026-09-14、中国网财经外滩大会报道 2026-09-10、观物 Talk Astra 测试报道、华夏时报蚂蚁灵波 CEO 专访 2026-09-12、机器人时代对苏度科技的报道等。)