基于5期「硅谷101」播客/视频的转写整理,涵盖Google Gemini、DeepSeek V4、机器人数据采集、AI Agent社交、Token经济学五大主题。


一、“谷歌太慢了”——与Andrew Dai聊Gemini翻身之战与视觉理解模型

Andrew Dai(戴靖橙),谷歌大脑(Google Brain)十四年老兵,主导了谷歌大模型从预训练、数据优化到Gemini系列的关键研发,是谷歌大模型奠基人之一。2025年他从谷歌离职创业,成立Essing AI,专注多模态视觉推理模型,获得5500万美元融资,投资方包括英伟达、OpenAI创始人等。以下是他基于亲身经历分享的核心观点。

1. 新的变化

谷歌大脑内部创新为何没能先于OpenAI引爆市场?

Andrew在2017年前后就完成了"预训练+微调"这一关键范式的研究(论文早于Transformer发布),但当时谷歌内部没有人将这一方法与刚出的Transformer架构结合,也没有集中资源推进大语言模型方向。OpenAI看到这篇论文后迅速整合,诞生了GPT系列。Andrew直言:“我们的论文出来第二天,我就告诉同事这个方向很重要,但他在忙别的项目,没时间。后来OpenAI做了。“这揭示了大公司内部创新被组织惯性拖慢的典型困境——技术已经存在,但没有人推动整合。

Gemini发布被ChatGPT"截胡"的内幕

2023年初,谷歌其实已经完成了对标GPT的模型研发(PaLM),但受制于内部审批流程和大公司决策链条,发布时间被推迟。而OpenAI在得知谷歌即将发布后,抢先推出了ChatGPT。“谷歌太大,没有秘密。OpenAI知道我们要出模型,就赶在我们前面发了。“Andrew感慨,如果早一点发布,谷歌可以说自己是世界上最好的模型。

DeepMind与Google Brain合并:磨合至今仍在继续

2022年底ChatGPT引爆市场后,谷歌紧急将DeepMind与Google Brain合并。合并机制是"每个部门两个负责人,一边出一个”,导致大量内部协调成本。Andrew形容:“两边本来就互相看不上,突然放在一起,肯定有摩擦。“合并后初期发布的Gemini 1.0被评价为"有点乱出来”,因为团队之前没有合作过,又在赶圣诞节的Deadline。很多创新(如MoE混合专家架构)因为速度压力没来得及用,只能先做单线模型追赶。

“研究品味”(Research Taste)是顶级研究员的核心竞争力

Andrew特别强调,在大公司做研究,最宝贵的资源不是算力而是时间。一个错误方向浪费的几个月不会回来。研究品味决定了"什么时候坚持一个方向,什么时候放弃”。他的研究哲学是:AI的发展应该遵循大脑的认知机制——大脑通过数据学习,模型也应如此;如果某个新方向与神经科学的认知相悖,他就不追。

2. 作者观点+解释

观点:纯语言模型无法通向AGI,纯视觉模型也不行,语言+视觉推理才是路径。

Andrew做了一个精妙的比喻:视觉理解模型目前的水平,大致相当于五年前GPT-2对语言的理解水平。模型可以"生成"看起来不错的图像或视频,但"理解"和"推理"能力远远不够——就像模型写的文章乍一看通顺,专业人士一看就发现逻辑错误。

他用"老鹰抓兔子"来解释视觉推理的本质:老鹰要在空中计算角度、速度、预测猎物的运动轨迹,这种对物理世界的深度理解和推理,远超当前的视觉模型能力。但光靠视觉也不够——数学、物理、化学这些人类抽象概念,是视觉无法直接捕捉的。因此必须是语言推理+视觉推理的结合,才能让模型真正理解世界。

观点:大公司做不了他们正在做的事,因为大公司追求"通用”,而他们追求"专注”。

Andrew用Cursor(专注编程的AI)做类比:Cursor可能不是最强的通用模型,但因为在编程领域极度专注,所以通用模型超不过它。Essing AI的策略类似——专注于多模态视觉推理,过滤掉对视觉推理无用的数据,把更多资源留给多模态相关的数据。这种"特种模型”(Specialist Model)思路,在特定领域可以超越通用大模型。

观点:数据才是大模型最大的差异化竞争点,而非架构或算力。

Andrew在Gemini 2.0上的核心贡献就是数据优化。他认为大家用的数据来源基本相同(互联网数据),关键在于怎么筛选、怎么优化数据质量。合成数据尤其如此——用得好(如ChatGPT)可以让模型变得很强,用得不好模型就会学到错误的东西。这是他离开谷歌的核心原因:他觉得在几千人参与的大项目中,数据策略太保守,他想用更激进的方法优化数据。

观点:当前是"New Lab"(新型AI实验室)的窗口期,大约还有两年。

Andrew认为,VC需要在大语言模型之外寻找对冲——万一纯语言模型走不到AGI怎么办?这催生了对新型AI实验室的投资热潮。但这个窗口期有限,大概两年左右,等这一波New Lab发展起来后,下一代创业者就更难进入了。在AI时代,创意(creativity)的价值被放大了,因为有了Claude等工具,执行变得容易,好的研究想法变得更稀缺。


二、硅谷看DeepSeek V4:模型效率、算力突围与AGI必经之路

本期聚焦DeepSeek引发的大模型效率革命,以及国产芯片替代的真实进度与挑战。

1. 新的变化

Token效率革命:从"越大越好"到"越高效越好"

DeepSeek的崛起代表了一个重要趋势转变——大模型竞争的核心正在从"参数规模"转向"Token效率"。MoE(混合专家架构)、MLA(多头潜在注意力机制)、模型蒸馏等技术几乎同时成熟,使得同等能力下模型推理成本大幅降低。节目指出:没有效率的AI只是demo,有了效率的AI才能成为真正的产品和技术。

国产芯片替代:推理快、训练慢

嘉宾详细拆解了国产芯片替代NVIDIA的六大挑战:

  1. 算子适配:需要大量工程工作来优化国产芯片上的AI算子
  2. 通信优化:大规模训练中,通信瓶颈会拖垮算力——芯片算力再高,通信做不好也白搭
  3. 设备稳定性:跑通模型≠高可用率,不同芯片间适配工作量大
  4. 训练精度与容错:大规模长时间训练对芯片和系统的容错能力要求极高
  5. 开发生态:从底层算子到通信库到Profiling工具链,整个生态都需要成熟
  6. 实时任务适配:上层实时任务调度需要深度算法优化

核心判断:**推理端国产芯片替代会进展较快(1-2年),训练端会慢很多。**因为AI模型迭代速度极快,很难花大量时间做芯片适配,大部分情况下还是用NVIDIA训练。

2. 作者观点+解释

观点:谷歌TPU模式是芯片突围的可行路径,但难以复制。

谷歌拥有从模型、框架、数据中心到芯片的全栈能力,可以做到软硬件协同优化。这种一体化模式对单一芯片公司来说几乎无法复制——即使芯片白送,也很难比得上NVIDIA的生态积累。但谷歌的成功证明了:AI推理从GPU转向专用ASIC是确定性的趋势。

观点:DeepSeek的最大贡献不在技术突破,而在工程效率的极致化。

DeepSeek并不是第一个做MoE或模型蒸馏的,但它将这些技术的工程完成度做到了极致。其开源策略也加速了整个行业的效率提升。嘉宾认为,短期内NVIDIA不会被替代,但推理市场的格局会因为ASIC和专用芯片的改变而松动。


三、揭秘数采工厂:稀缺的机器人数据,到底难在哪儿?

本期走进上海机器人数据采集工厂,深入剖析机器人数据的核心困境与解决路径。

1. 新的变化

机器人数据的本质困境:数据天然不存在于互联网上

与大语言模型可以"收割"互联网上万亿Token不同,机器人需要的数据必须在真实物理世界中从零采集。每条高质量数据都需要:多维度传感器信号(视觉、听觉、关节位置、电机控制量)精确同步、时间对齐,构成一条完整的操作轨迹。这些数据过去从未被记录过,也无法从任何现有来源获取。

数据缺口的量级触目惊心

用数字感受这个缺口:谷歌RT系列调动13台机器人,在办公室厨房持续采集17个月,得到约13万条操作轨迹、覆盖700多项技能。Open X-Embodiment项目(全球最大跨机构真机数据集)整合了全球34所研究机构、22种机器人的数据,凑出超过100万条操作轨迹。但即便如此,在已知技能和现实世界需求之间依然差了好几个数量级。

“遥操作"数据采集的核心难题:操作员感受不到机器人的手

这是整个行业数据困境的根源。操作员通过遥控系统控制机器人,但无法获得触觉反馈——你无法"感受"机器人抓取物体的力度和状态。好的数据采集员需要极强的空间感和协调性,顶尖采集员与普通采集员的效率差距可达3倍。

四条并行路线构成"数据金字塔”

行业已摸索出四条路线,质量由低到高:

  1. 纯仿真数据(底层):成本最低,但存在Sim-to-Real Gap(仿真到现实的差异)
  2. 互联网视频数据:量大但缺乏动作标注和传感器信息
  3. 人类操作视频+动捕:比纯视频好,但人体结构与机器人差异大
  4. 遥操作真机数据(顶层):质量最高,信息最完整,但成本也最高

2. 作者观点+解释

观点:机器人数据的Sim-to-Real Gap是根本性难题,需要科学方法上的创新。

目前从仿真环境到真实物理世界的差异仍然很难对齐。嘉宾认为,这不仅是工程问题,更是需要科学方法创新的根本挑战——物理世界的复杂性远超仿真能模拟的范围。

观点:机器人数据的稀缺性决定了具身智能的落地速度将远慢于大语言模型。

大语言模型用了不到3年就达到全民可用,但机器人因为数据瓶颈,每一个新技能都需要大量真实采集。这不是靠算力或算法就能弥补的——数据从哪来、怎么采、成本多高,直接决定了具身智能的商业化时间表。


四、智能体社交革命:AI Agent是怎么来到你我身边的?

本期探讨AI Agent如何从工具演变为"社交参与者",以及Agent社交网络的形态与未来。

1. 新的变化

从"人-人社交"到"人-AI-人社交"的结构性转变

在现有社交网络中(微信、Facebook、Twitter),社交的基本单位是人。但在AI Agent社交网络中,社交的基本单位变成了"人+AI"。你的AI可以帮你分析信息、参与讨论,甚至在你离线时24小时存在于网络中。网络另一头,可能是对方的AI在与你的AI互动。这意味着在人际关系之上叠加了一层AI之间的网络,社交正在从"人与人直接连接"演变为"AI在中间处理、筛选、沟通"。

ChatGPT的真正意义:让普通人意识到AI可以主动行动

ChatGPT的爆火不仅仅是工具层面的成功,更关键的是认知层面的突破——让大众第一次意识到AI不再是被动工具,而是可以学习、主动行动、甚至参与世界的存在。这是一个分水岭时刻。

AI Agent的技术架构正走向三层成熟

AI Agent的能力建立在三层技术演进之上:

  1. 模型层:大语言模型作为"大脑",提供推理和生成能力
  2. 记忆层:让Agent拥有持久记忆,能记住历史对话和上下文
  3. 工具层:让Agent能够调用外部工具(搜索、API、执行代码等),真正介入真实世界

这三层的成熟才让Agent真正具备了24小时长时陪伴、主动参与和自动化执行的能力。

2. 作者观点+解释

观点:人类将从亲自参与社交变成在AI之上进行监督和决策。

节目用了一个形象的比喻:就像两个领导开会,秘书和助理先把流程文件对齐,领导见面时直接处理最重要的决策部分。未来,双方AI会先进行大量信息处理和初步沟通,人类只需要做最终决策。这本质上是将人类从执行层提升到监督层。

观点:AI社交网络的创业窗口已经打开。

节目采访了一家叫TeamAI的初创企业,其CEO透露,他们在一年多前就布局AI Agent社交赛道,但当时投资人普遍觉得"太超前"。ChatGPT爆火后,投资人迅速意识到AI可以更深度参与日常生活,TeamAI等公司因此获得了大量关注和投资。这说明AI社交是一个"需求被验证后才被认可"的赛道,而非"先有供给再创造需求"。

观点:AI Agent的最终形态是"个人数字分身",代表你在数字世界中持续存在。

当Agent拥有你的数据、了解你的偏好、能模拟你的沟通风格时,它就不再只是工具,而是你的数字代理。这引出了一个深层的身份认同问题——当你的AI在替你说话、替你社交时,“你"在哪里?


五、Token经济学:AI时代的新货币战争

本期深入剖析Token作为AI时代核心资源的定价逻辑、商业模式和产业博弈。

1. 新的变化

“Token排行榜”:大公司内部的AI军备竞赛

节目揭示了阿里等互联网巨头内部的真实状况:淘宝内部有一个AI Token消耗排行榜,汇集了超过8.5万名AI用户,排名前550名的Token消耗量惊人——其中排名第一的员工烧掉的Token价值达数百万美元。这种排行榜反映了一个趋势:大公司正在用Token消耗量来衡量员工对AI的拥抱程度,这正在成为公司内部KPI的隐性指标。

“Token没死"vs"疯狂烧Token”:两种截然相反的战略观点

拥抱派认为:公司必须全力拥抱AI,不跟进就会被淘汰。目前阿里后台已有10%的新代码由AI完成。

反对派认为:纯粹的Token消耗量是错误的指标。用最多的Token不代表产出最好的结果,不同能力的模型最终都会被更好的方案超越,今天的排行榜不会永远不变。

Token计费的新商业模式正在崛起

节目中介绍了一家专门做AI Token计费的公司(类似AI领域的通信运营商计费系统),其核心创新是:

  • 第一层:记录用户与AI交互的每个事件(调用什么模型、做了什么操作)
  • 第二层:为不同事件定价(命中知识库多少钱、闲聊多少钱)
  • 第三层:生成面向客户的计费方案(包月、按量、阶梯价等)

这种将"事件流"与"计费"彻底分离的思路,解决了当前Token计费混乱的问题。该公司累计融资达1.28亿美元,被解读为"Token经济中算钱变得越来越重要"的信号。

Token套利:不同模型混用的商业机会

现在很多应用会将不同模型混用——复杂任务用GPT-4等昂贵模型,简单任务用性价比更高的国产模型(如DeepSeek)。这催生了一种新的商业模式:Token套利——在用户需求和模型成本之间寻找最优分配,从中获取差价。

2. 作者观点+解释

观点:Token正在成为AI时代的"新货币”,但定价体系极度混乱。

目前的Token定价就像早期电信行业的"按字数收费"——不同模型的价格差异巨大,每个客户的合同条款、周期和费用阶梯都不同。更复杂的是,不同任务的Token成本完全不同(闲聊vs复杂推理),峰值和低谷的资源需求也不同。这种混乱恰恰是商业机会所在——谁能把Token的定价和计费做好,谁就能在AI产业链中占据关键位置。

观点:对创业公司和个人来说,Token成本是真正的生死问题,而非大公司的烦恼。

大公司可以"不计成本地烧Token"来推动AI转型,但对于创业公司和个人开发者,Token成本直接决定了产品能否存活。这就解释了为什么国产性价比模型(如DeepSeek)的崛起如此重要——它让AI应用的成本门槛大幅降低,使得更多创业项目成为可能。

观点:Token经济学背后是一个更深层的问题——下一个时代,中国出口的会是什么?

节目提出了一个宏大的历史类比:如果上一个时代中国出口的是衬衫,这个时代是电动车,那么下一个时代会是Token吗?如果AI成为全球基础设施,那么提供高性价比AI能力的国家,是否会在新一轮全球分工中占据优势?这个问题将Token经济学从商业模式层面提升到了国家战略层面。


跨期交叉观察

将五期内容放在一起看,可以发现几个贯穿性的主题:

  1. 效率革命是AI从"技术演示"到"真实产品"的关键转折点。 DeepSeek代表的Token效率优化、Token经济学中的成本博弈、机器人数据的采集成本——都在指向同一个问题:AI的落地不是技术问题,而是成本效率问题。

  2. 大公司的创新困境催生了"New Lab"创业潮。 Andrew离开谷歌的核心原因就是在几千人的项目中无法采用激进的数据策略。同样的逻辑也在芯片领域上演——谷歌的全栈模式难以复制,但证明了大公司之外存在巨大的创新空间。

  3. 数据仍然是AI最核心的瓶颈和差异化竞争点。 大语言模型的数据已经被互联网"榨干",机器人数据天然稀缺,合成数据的质量控制是关键。谁能更好地获取和优化数据,谁就能在AI竞争中领先。

  4. AI正在从"工具"进化为"参与者"。 从Agent社交到Token经济学,AI不再是人使用的工具,而是开始介入社交、商业、生产等人类活动的核心环节。这带来的不仅是效率提升,更是社会结构的深层变革。


本文基于「硅谷101」播客/视频转写整理,整理日期:2025年5月28日。