先说结论

刘洺堉(英伟达研究副总裁、Cosmos Lab负责人)是一位在英伟达内部走了十年的研究者——从早期用GAN做图像生成的先驱,到如今掌管二三百人团队、日均消耗数百万美元算力的世界模型掌舵人。这次4小时的访谈覆盖了三条值得关注的线索:

第一,Cosmos 3的世界模型策略:它不是"又一个视频生成模型",而是面向Physical AI(具身智能)的"世界基础模型"(World Foundation Model)。英伟达把它当作基础设施来建——就像CUDA之于计算——开源模型、开源训练框架、公开论文细节,目的是让整个机器人/自动驾驶生态不必从零开始造轮子。刘洺堉的核心判断是:“模型竞争不应该是一场零和游戏,世界上有太多需要被解的问题。”

第二,模型终将收敛的产业判断:他认为AI历史上从未出现"一家公司永远领先所有人"的局面,模型能力最终会趋同,真正决定胜负的是与生态系统的整合——产品、数据反馈、分发渠道,而非模型本身。这直接解释了英伟达为什么不做Coding Agent去和OpenAI竞争,而是专注做Physical AI的基础模型。

第三,从"击败对手"到"帮助所有人"的研究者蜕变:刘洺堉把这种心态称为"Low Ego"——不是自信或自卑的问题,而是"我有能力做出Number One的模型,但我选择做出对世界贡献最大的事情"。这种心态的转变,部分来自他从纯研究者到大型组织管理者的成长,部分来自黄仁勋二十年来的言传身教。

从GAN先驱到世界模型掌舵人:一条被"算力"牵引的轨迹

要理解Cosmos为什么长成今天的样子,需要回到刘洺堉在英伟达的起点。

2016年,他在三菱电机研究院(MERL)工作时,因为做GAN(生成对抗网络)研究急需GPU,每次都要跟经理争经费买卡。同事买NVIDIA股票,他最终决定直接加入生产GPU的公司——“我这么缺GPU,这么想要GPU,那为什么不去一个生产GPU的公司?“他的父亲当时不理解,因为英伟达那时远不如苹果、谷歌有名。但这个决策的逻辑很简单:GPU是最重要的工具,去工具最多的地方。

加入英伟达后,他做了一件在当时并不主流的事:推动用深度学习取代传统计算机图形管线来做影像生成。在他的job talk里,他描绘了一个愿景——“有一天可以把小说放进深度学习模型,直接产出电影”。他自嘲当时的野心不够大、决心不够足:OpenAI发布DALL·E后,他才意识到"在算力最多的地方"这件事的条件其实早已成熟,只是他没有勇敢地迈出那一步。

他的早期标志性工作GauGAN(以法国画家高更命名,也被称做"马良神笔”)是一个语义分割图转风景画的工具——用户涂几个颜色,每个颜色代表一种语义,就能生成逼真山水画。这项工作让英伟达在AI生成领域的形象从"只做GPU的公司"转变为"也能做出优秀AI模型的公司”。GauGAN在2019年GTC大会上虽然没有进入黄仁勋的正式演讲(因为产品太多排不下),却成了当年最受媒体关注的工作。

此后他带领团队经历了从GAN到Diffusion的关键转向。当余佳辉(后在Meta)和Jeremy Bernstein(Muon优化器的发明者)等实习生在他团队中尝试让GAN scale up但反复失败后,团队得出了一个明确结论:“GAN不scalable”,于是全面转向Diffusion。这一判断被后来的行业走势完全验证。

Cosmos的立项发生在2024年Sora发布之后。刘洺堉描述了内部的过程:一群做生成式媒体的资深研究者联名给黄仁勋写信,认为"必须投入更多资源做物理世界模型"。黄仁勋看到Sora后立即认同了这个方向,召集会议确定分工,并亲自将项目命名为"Cosmos"。黄仁勋让刘洺堉和Sanja Fidler共同带领这个effort。

Cosmos 3:不是"又一个视频生成模型",而是Physical AI的基础设施

关于Cosmos的定位,访谈中最关键的一段澄清是:Cosmos不把自己叫"世界模型",而是"世界基础模型"(World Foundation Model)。区别在于,英伟达不打算做终端应用——不做机器人解决方案,不做自动驾驶解决方案——而是提供底座,让整个生态的开发者都能在此基础上构建自己的世界模型。

为什么要做Physical AI而不是Coding Agent?

刘洺堉给出了三个理由。首先,他的背景是计算机视觉(CV),不是大语言模型;英伟达已有强大的NeMo团队做语言模型,他没有太多增量贡献。其次,Physical AI是刚需——人口老龄化带来的自动驾驶需求、劳动力短缺带来的机器人需求、家庭琐事带来的服务机器人需求。第三,黄仁勋的要求是"build big influential business"(做大而有影响力的生意)——“你不能满足于每年赚一亿,那对英伟达来说只是一个分心(distraction)。”

从22个模型到1个模型:Cosmos 3的架构进化

Cosmos 1到2的阶段,团队逐步理解了客户需求——有的需要预测未来(prediction),有的需要理解因果关系(reasoning),有的需要仿真环境(transfer),有的需要解析物理变化(parsing)。最初刘洺堉在内部会议上跟黄仁勋汇报说预计需要22个不同模型。黄仁勋的回应影响了他:用LV(路易威登)做类比——当LV减少货架上的商品种类后,销量反而提升了,因为消费者不再被选择困难困扰。

这个类比加上工程现实——每个模型都要持续维护和支持,“兵多则力寡”(资源分散导致每个都做不好)——促使团队在Cosmos 3中做出根本性改变:将所有功能统一进单一模型。

背后的逻辑有两层。第一,所有功能描述的都是同一个物理世界——prediction、reasoning、transfer、parsing都在建模同一种现实,只是观察角度不同。第二,基础模型(Foundation Model)的核心价值就是"纳百川"——吸收多种数据类型后,模型上限更高。

Cosmos 3因此成为业内首个将**语言、视频、音频和动作(Action)**同时统一进单一模型的工作。采用双塔架构(Mixture Transformer):一塔处理离散信号(语言理解),一塔处理连续信号(视频生成)。刘洺堉解释,物理世界的AI会"take action"来改变世界状态,因此Action必须是"一等公民"(first-class citizen),就像语言模型把语言当作一等公民一样。

关于多模态是否会"互相污染"——主持人提到杨植麟的观点变化:从"担心视觉影响语言智商"变为"担心语言对视觉的污染"——刘洺堉的回应很务实:他追求的不是AGI,而是服务Physical AI的基础模型。语言让人能跟机器人沟通,视频让它理解世界如何运作,动作让它能改变世界。不同模态各有用途,通过实验设计和数据比例调整,它们可以互补而非互斥。实验已证实:预测视频能帮助动作模型的收敛,声音信息能帮助判断接触时间点,文字的详尽描述能帮助视频生成质量。

开源的决心:从DeepSeek学到的教训

刘洺堉多次提到DeepSeek对整个AI行业的影响——“它把Meta和xAI这些做开源的公司逼到了极致”。Cosmos 3选择了一条彻底透明的路线:开源模型、开源训练框架、公开论文中的关键细节。他说:“这几年我们看到Foundation Model很多都走向闭源,即使写paper也不愿意讲出关键环节。我们决定走不一样的道路。”

他不担心别人复现一模一样的东西。英伟达的目标不是"比别人好",而是"帮助整个Physical AI生态成功"。如果你基于他们的开源工作做出了更好的开源模型,“那也是帮助了整个生态,是一件好事。”

黄仁勋的"Cosmos 97"

做完Cosmos 1后,刘洺堉问黄仁勋是否继续做下去。黄仁勋的回答是:“你就做到Cosmos 97。“刘洺堉说数字可能是随口说的,但决心是真的——它传达了一个明确的信号:这是一个需要长期投入的马拉松项目,不是做完一代就收手。

目前Cosmos的算力投入已在"万级GPU"规模,团队约200-300人(论文署名近290人),每日运算成本达数百万美元。

“模型终将收敛”:一个反共识的产业判断

访谈中最具争议性的观点,是刘洺堉对模型竞争终局的判断。

他认为模型能力终将趋同,竞争将转向生态整合。 理由是:“一家公司掌握所有科技、其他公司完全追不上的情况,在具体的历史例子上从来没有发生过。我不觉得AI会是例外。“人员会流动,知识会扩散,人才在A公司得不到肯定就会跳到B公司。

这个判断直接影响了英伟达的策略选择:既然模型本身终将同质化,那么纯粹靠模型能力建立壁垒是不可靠的。更可靠的方式是与自己的生态系统深度整合——这也是为什么英伟达不跟OpenAI、Anthropic在Coding Agent领域正面竞争。黄仁勋的逻辑是"造市场"而非"存量竞争”:Physical AI如果成功,家家户户都有机器人,每个机器人都需要算力,整个世界的算力需求会大幅增长——这对NVIDIA天然有利。

刘洺堉用黄仁勋常说的"Zero Billion Business"概念解释这个逻辑:现在不是一门生意(Zero),但未来成功后会变成十亿级别的市场。如果现在已经有人在做了,就不值得做。这与《创新者的窘境》中的逻辑一致——大公司无法justify去解那些"看起来不够大"的问题,恰恰是创业公司的机会窗口。

不过他也承认,当前的"同质化竞争”(各家都在做Coding Agent)让从业者很辛苦。但他认为这只是阶段性现象——“你最终还是要差异化。没有差异化,就没法做出差别性的产品。”

“你不需要击败你的对手”:Low Ego背后的组织哲学

刘洺堉反复强调自己"没有竞争对手”。当主持人追问这到底是Low Ego还是一种隐藏策略时,他说这是一种自信(confidence)——不是要击败谁,而是要做出好东西来帮助整个生态。

这种心态并非与生俱来。他坦言,作为一个研究员,毕业的方式就是让论文在顶级会议上被接受、在benchmark上击败所有竞争者。“研究员都是high ego的,文人相轻自古皆然。“但成为大型组织的管理者后,他的重心从"我比你强"转向"我做出了什么可以帮助大家的东西”。

这个转变的来源之一是管理二三百人团队的现实。他面临的核心矛盾是:既要让所有人目标一致,又要让每个人都能自主做决定。如果只有少数决策者能做决定,进展会很缓慢;如果大家都能做决定但目标不一致,就会产生赛马和内耗。他的解法是:不断把愿景讲清楚(“就像篮球运动员罚球前想象球空心入网”),让信息透明化,提供容错空间——“当一个人害怕决定错误的时候,他是不会做决定的。”

来源之二是黄仁勋的影响。他转述了黄仁勋令他印象深刻的一句话。有一次他在会上解释说竞品使用了"不公平的setting"导致他们表现不如预期,黄仁勋的回应是:“Nothing is fair."(没有什么是公平的)——你在写论文时可以讲setting不一样所以不能比较,但你的目标如果是解决一个问题,就不存在公平不公平,只有做得到做不到。“这句话让我更加严格要求自己——找理由是没有用的。”

黄仁勋的管理原则:从近距离观察者的视角

刘洺堉在英伟达十年,近距离观察黄仁勋的运作方式,他总结了几条关键的管理原则:

第一性原理(First Principles)决策。 黄仁勋不懂计算机图形学时就敢做GPU,不懂深度学习时就敢押注AI。他的决策不依赖外部信号,而是从事情的本质出发判断什么最合理。刘洺堉说,认识黄仁勋之前,他自己的决策都偏短期;看到黄仁勋如何做长期决策并坚持,“影响是惊人的”。

信息透明化与Top 5法则。 黄仁勋要求每个员工定期讲自己最重要的五件事。这个机制让公司的大小信号都能被看见——两个团队在做一模一样的事情,一讲就暴露了。刘洺堉说英伟达是一个"相对透明的组织”,与苹果形成对比。

Mission is the boss。 英伟达的组织像有机体而非固定框架。当公司决定走向某个方向时,不同团队会自动align。不是你的直属上司是你的boss,而是Mission是你的boss。任何人都可以来支持任何团队的工作。

不裁员、不末位淘汰。 刘洺堉在英伟达十年,“没有听到任何裁员的消息”。疫情期间,公司选择削减差旅和工具开支(取消Slack、取消冗余云服务),而不是裁员。他认为这种文化让员工敢讲真话、愿意合作——在一个有末位淘汰恐惧的地方,人们不会把最好的一面展现出来。缺点是当技术转型时,员工重新学习需要时间,比"layoff再hire新人"慢。

“Trust you to greatness”。 黄仁勋不给赛马式的内部竞争——“你去take这个mission,我们就相信你,但给你很高的标准,让你不断接受pain and suffering。“刘洺堉认为这不是惩罚,而是"花精力去督促别人进步,自己心里要承受很大负担”。

“三十天现金流"的危机意识。 黄仁勋至今仍每天说"公司只剩三十天的现金流”。这不是吓唬人,而是强迫自己持续做出对公司最正确的决定。

研究者的成长:从追求数学之美到追求工程落地

访谈的后半段回到了刘洺堉个人的研究历程,其中三个"关键时刻"值得记录。

第一个时刻:从追求数学之美到追求问题本质。 博士早期,他喜欢漂亮的数学——在传统计算机视觉"什么都不work"的年代,优化理论是核心工具。但为了数学的干净而做假设,会让自己离现实越来越远。他后来意识到:“AI本身就是应用,智力就是拿来被应用的。”

第二个时刻:从"做出来就行"到"让所有人理解它的重要性”。 他自评早期做研究是"做一百分,但解释只有四十分,所以别人看到只有四十分”。管理大型团队后,他理解到"人跟人的沟通是一个高复杂度的问题”——N个人的点对点沟通是O(n²)复杂度,不scalable。做出东西后,让大家都能理解为什么它重要,跟做出东西本身一样关键。

第三个时刻:学会在公司中获取资源。 他从三菱电机研究院的兴衰中学到了一课:Blue sky research(纯好奇心驱动的研究)和公司兴趣之间的对齐至关重要。当公司进入收缩期时,不理解公司战略的研究者最先被淘汰。“Deep learning非常花钱,你更加要能解释为什么这对公司是重要的投资。”

这段经历也解释了为什么他后来坚持"研究直接变产品"——GauGAN从论文变成了在线工具让用户试用,Maxine(AI增强视频会议)变成了产品。他认为"AI单独存在并没办法改变一切"——当模型能力趋同时,与生态系统的整合(Google的Doc+Search+Mail整套平台)才是真正的壁垒。

关于中国AI的观察与对未来的预测

刘洺堉每年回中国两三次,关注Physical AI的发展。他观察到的趋势是:越来越多的中国公司在灵巧手等关键技术上做出突破,速度非常快。

关于中国的模型公司,他评价为"very impressive",特别提到了DeepSeek、通义千问(Qwen)、豆包、MiniMax、阶跃星辰、智谱等。他认为中国公司的一个独特价值是"承担了很多suffering"——在硅谷Foundation Lab越来越走向闭源和"know-how不外传"时,中国的开源生态在帮助知识的扩散(knowledge diffusion)。

关于Physical AI的ChatGPT时刻,他认为可能在"今年或明年"到来,但很难精确预测。他定义的ChatGPT时刻是"大家看到一个以AI为主的Physical应用,清楚看到它真的有用"。他个人最期待看到的突破是:“给机器人示范一两次操作,它就能快速学会”——也就是泛化能力的突破。

关于人形机器人,他认为人形机器人有优势(可以利用大量人类数据),但复杂度高。最终全人形可能是最优解(因为人类环境就是为全人形设计的),但关键变量是运算成本。中国做机器人本体的公司远多于美国(美国只有Tesla和Figure等少数),中国强大的制造业让硬件迭代和软硬件整合具有结构性优势。

写在最后:二十年研究者的一句话

访谈结尾,主持人问刘洺堉希望在AI历史上被如何记录。他选择不谈自己,而是谈Cosmos:“希望Cosmos可能是一个重要的推手,帮助这些重要的Physical AI达到那个ChatGPT moment。”

这句回答本身就是他整个"Low Ego"哲学的注脚。不是要成为最聪明的人、不是要拿最多的论文、不是要击败最多的对手——而是做出一个东西,让整个行业因为它走得更快。

黄仁勋对刘洺堉的评价是"GSD"(Getting Shit Done)。在四个小时的对话中,你看到的不只是一个会做模型的研究者,而是一个在"算力最多的地方"待了十年、学会了如何让二三百人朝同一个方向走、并真心相信"不需要击败所有对手"的工程领导者。


注:本文基于播客转写稿撰写。转写稿中部分人名、术语存在ASR识别误差,已根据上下文尽可能校正:刘明玉→刘洺堉、娟婶/捐赠/卷成→黄仁勋(Jensen)、英文fellow→Ian Goodfellow、三零电机→三菱电机(MERL)、Tim Books→Tim Brooks、Tero Kavas→Tero Karras、Bill Dale→Bill Dally、尼摩创→NeMo、飞机狗AI/Fisher AI→Physical AI、贝塔data→better data等。部分推断以"他认为/节目引用"标注归属,未经独立查证。