来源:《硅谷101》视频播客 · 「谷歌太慢了」 嘉宾:Andrew Dai,前谷歌Brain研究员(十四年),Gemma预训练负责人,大规模预训练+微调范式发现者,MoE架构早期研究者。2025年离开谷歌创立视觉推理AI公司,获5500万美元融资,投资方包括OpenAI创始人、英伟达等。
本文整理自「硅谷101」播客。以下内容按主题组织,涵盖「新的变化」和「嘉宾观点与解释」两个维度,力求让没有看过原视频的读者快速建立完整认知。
一、大模型核心范式的发现:从谷歌Brain到OpenAI的GPT之路
新的变化
大规模预训练+微调(Pre-training + Fine-tuning)这一大模型的核心范式,最初是由Andrew在谷歌Brain团队发现的。
2017年前后,Andrew在谷歌Brain做一个统计分类任务时,尝试了多种方法,屡次失败。某次实验中,他意外从一个已有的语言模型项目初始化参数,再进行微调,发现效果远超所有已有方法。起初他以为是bug——结果不可能这么好。反复排查后确认:先进行大规模语言模型预训练,再针对下游任务微调,可以显著提升模型性能。
关键在于:在此之前,预训练和微调在学术界是完全独立的两个领域,没有人尝试将二者结合。Andrew的论文是首个将两者统一的工作。
为什么这一变化重要? 这一发现虽然使用了前Transformer时代的模型架构(Transformer当年尚未发表),但验证了一个根本性的洞见:语言模型学到的通用表示,可以被迁移到下游任务上。这正是后来GPT系列的核心方法论——OpenAI的GPT-1/2/3论文均引用了Andrew的这篇工作。
嘉宾观点+解释
“第二天我就给Jeff(Jeff Dean)说了这个预训练的成果。”
Andrew发现这一成果后立即引起了关注。OpenAI方面很快找到谷歌,表示已经复现了这个方法且效果很好。Andrew当时意识到"以后应该会有很多人用这个方法",但完全没有预料到,四年后这个方法结合Transformer,会被放大到拥有千亿参数的大模型,并成为商业产品。
Andrew还提到一个被错过的机会:他在论文发表后曾建议团队将预训练与刚问世的Transformer结合,但当时Transformer论文的第一作者们忙于图像处理等其他方向,没有时间推进。这个空档最终被OpenAI抓住——GPT系列正是"Transformer架构+预训练+微调"三者结合的产物。
二、谷歌为什么"太慢了":从GPT-3到ChatGPT的内幕
新的变化
谷歌坐拥大模型时代最核心的两项基础技术——预训练范式和Transformer架构——却被OpenAI抢先推出了ChatGPT。
2021年GPT-3发布后,谷歌内部终于意识到这个方向的战略意义,开始调动资源追赶。Andrew被从医疗AI项目调回,帮助解决了当时谷歌内部模型达不到GPT-3水平的问题——核心瓶颈在数据层面。最终谷歌做出了超越GPT-3的模型。
2023年初,Andrew主导了Gemma模型的预训练。整个预训练过程从头到尾一次都没有重启,不到一年就完成了——这在当时的行业实践中极为罕见,得益于之前积累的架构经验和小规模预实验验证。Gemma模型出来后,团队是满意的。
但ChatGPT抢了首发。 Andrew团队完成模型的时间比OpenAI更早(2023年初就做完了),但谷歌内部流程太慢——“谷歌太大了,内部没有秘密”,OpenAI得知谷歌即将发布后抢先推出了ChatGPT。Andrew坦言:“如果早一点发表,我们可以说自己是世界上最好的模型。有点可惜。”
嘉宾观点+解释
“大公司就很难保持秘密。特别是大模型和大公司,肯定会有信息流向OpenAI。”
Andrew指出,谷歌虽然是这些基础技术的发源地,但在将它们组合成产品的速度上被OpenAI超越。原因不是技术差距,而是组织规模带来的信息泄露和决策迟缓。Gemma模型虽然在技术上已经就绪,但谷歌内部的政治和流程导致发布被推迟,最终被ChatGPT截胡。
不过Andrew也承认,虽然首发被抢,Gemma的发布仍然至关重要——它向市场证明了谷歌有能力做出顶级模型。如果没有Gemma,谷歌就没有Bard(后来的Gemini对话产品),而当时谷歌最大的产品搜索就会被ChatGPT直接威胁。
三、DeepMind与Google Brain的合并:一场仍在磨合的组织整合
新的变化
2022年底ChatGPT发布后,谷歌做出了一个重大组织决策:将DeepMind和Google Brain这两个长期各自为政的AI团队合并。
合并前,DeepMind和Google Brain是两个完全独立的组织:DeepMind在被谷歌收购时通过Green协议保持了高度独立性——自己的代码库、自己的研究方向、自己的决策流程。Google Brain的目标则是做研究、服务产品。两边之间合作极少,甚至存在项目归属的争议——“这个项目是谁的?“是常见的摩擦。
合并机制是"双头领导”:每个部门由一名DeepMind的人和一名Brain的人共同领导。Andrew代表Brain的数据团队,与DeepMind的对应负责人共同管理。
嘉宾观点+解释
“到现在还在磨合。真的,现在还在磨合。”
Andrew认为合并确实造成了速度减慢。两个从未合作过的团队,突然被整合在一起,加上之前的历史积怨,产生了大量协调成本。每个部门都要重新划分职责边界——哪些由Brain团队做、哪些由DeepMind团队做——这个过程"浪费了很多时间”。
合并的直接后果之一是大量人才流失,两边都有人离职。Gemini 1.0就是在这样的背景下被"赶着"做出来的。团队拼命赶圣诞节的发布期限,加上之前没有合作经验,导致一些方面做得不好——比如小语种表现不佳,被媒体大肆报道。更关键的是,Gemini 1.0只能做Dense(单线)模型,来不及使用MoE(混合专家)架构——而Andrew早在2021年就在研发的MoE技术,因为时间压力被搁置了。
Andrew对此的解释是:“那时候有个OpenAI的赛跑,差一点就必须追上,来不及做MoE了。”
四、MoE架构与数据优化:大模型竞争的真正壁垒
新的变化
MoE(Mixture of Experts,混合专家)架构正在成为大模型的标配,但谷歌在2021年就已经在内部研发。
2021年GPT-3出来后,谷歌内部启动了"超越GPT-3"的项目。Andrew和团队将已有的预训练+微调方法与MoE结合——此前MoE已有研究论文,但没有人把MoE和预训练、微调这三者统一在一起。这个组合最终产生了超越GPT-3的模型。
但在2023年发布Gemini 1.0时,MoE反而没有被采用。 原因是整合后的团队在赶进度,MoE需要额外的工程工作(路由、负载均衡等),时间上不允许。直到GPT-4被证实是MoE模型后,谷歌才在后续版本中全面采用MoE。
嘉宾观点+解释
“最大的差异就是数据。但数据不是说数据来源的问题——大家反正都把互联网数据穷尽了——而是怎么优化、怎么挑选。”
Andrew在Gemini 2.0上的主要贡献是数据层面的创新。他认为当模型架构(Transformer+MoE)、算力、训练方法都趋于同质化时,数据优化成为了真正的差异化壁垒。
他打了一个生动的比方:就像人一样,如果一个人每天只读广告,他也能学到东西,但学不到真正有价值的内容。训练数据的质量和筛选方式直接决定了模型能力的天花板。
关于合成数据(Synthetic Data),Andrew持审慎态度:合成数据用得好(如ChatGPT)可以让模型变得很强,但用得不好——比如合成数据中混入了其他模型的错误输出——模型就会学到错误的东西。合成数据需要极高质量的控制。
五、Andrew的出走:为什么选择在巅峰时刻离开谷歌
新的变化
Andrew在Gemini 2.0 Flash发布、谷歌重回行业领先地位之后选择离职创业。 2025年4月,他创立了一家专注于多模态视觉推理的公司,获得5500万美元融资,投资方包括OpenAI创始人、英伟达等。
选择离开的原因不是对谷歌不满,而是看到了一条在大公司内部无法推进的技术路线。
嘉宾观点+解释
“在谷歌,几千个人在一个项目上,很多想法,但预训练的保守性意味着他们不能用很激进的新方法。对谷歌来说,大量改变数据是有风险的。”
Andrew在Gemini 2.0的工作中已经感觉到,他想要尝试的数据优化方法在大公司框架下过于激进。大公司的预训练项目涉及数千人、数亿美元投入,容错率极低,只能用已被验证的保守方法。而Andrew认为,数据层面还有巨大的激进优化空间。
他选择创业的另一个动力是方向选择的自由。在谷歌,研究方向受团队目标约束;独立创业后,他可以专注于自己最看好的技术路线——多模态视觉推理。
Andrew将创业与在谷歌的差异总结为几点:
- 算力少了,但稳定性高了——在谷歌,GPU分配可能每周变动;在创业公司,拿到的卡不会被别人拿走
- 需要学习大量新技能——从开源工具到IT基础设施,谷歌内部几乎不用开源,出来后一切从零学起
- 招聘更难——大公司有品牌背书和安全感,创业公司只能靠愿景吸引人
- 研究失败的代价更高——在谷歌,研究不成功可以换项目;在创业公司,资源消耗了就不会回来
六、视觉推理模型:为什么语言模型无法抵达AGI
新的变化
一个全新的AI研究方向正在兴起——多模态视觉推理模型(Visual Reasoning Model)。 这不是当前主流的图像/视频生成模型(如Sora、Midjourney),也不是纯视觉理解模型(如视觉问答),而是将语言推理能力与视觉理解能力深度融合的新范式。
Andrew对当前AI路线之争的梳理如下:
| 路线 | 代表 | 核心信念 | 局限 |
|---|---|---|---|
| 大语言模型派 | OpenAI GPT、Anthropic Claude | 通过扩大语言模型规模、加长思维链,最终可以达到AGI | 无法真正理解视觉世界——面对图片/视频中的物理关系、空间推理经常出错 |
| 纯视觉模型派 | 世界模型、视觉基础模型 | 视觉理解是智能的核心,如同生物进化中视觉先于语言 | 无法理解人类创造的抽象概念(数学、物理、化学公式等) |
| 语言+视觉推理派 | Andrew的公司 | 必须将语言推理和视觉推理融合,才能达到真正的AI | 新路线,需要验证 |
嘉宾观点+解释
“现在的视觉理解能力,可能跟五年前GPT-2对语言理解的差不多。”
Andrew用"老鹰抓兔子"的比喻来解释视觉推理的本质:老鹰在捕猎时需要完成极其复杂的计算——预测猎物的逃跑方向、计算翅膀需要什么角度、以什么速度才能在正确位置拦截。这些能力远超当前AI的视觉理解水平。
但老鹰也有做不到的事——数学、物理、化学这些人类创造的概念,需要语言和抽象推理能力,视觉系统无法处理。
Andrew的结论是:纯语言模型和纯视觉模型都不足以抵达AGI,真正的突破必须将二者结合。 他的公司专注于多模态推理,在数据筛选、架构设计、推理方法等所有环节都围绕视觉理解来优化——类似于DeepSeek专注于编程领域的方式。
Andrew还指出一个有趣的竞争格局:DeepSeek是他的潜在最大竞争对手——DeepSeek此前发布的视觉推理论文(后来被删除)与Andrew的思路有相似之处。但DeepSeek面临巨大的编程模型市场压力,可能无法在视觉推理方向上持续投入。Andrew认为这正好给了他时间窗口。
七、研究品味(Research Taste):AI研究员最稀缺的能力
嘉宾观点+解释
“最重要的资源不是算力,是时间。跑了一个错了方向或错了方法,时间就回不来了。研究品味就是知道哪个方向要继续投入、什么时候该放弃。”
Andrew提出"研究品味"是研究员最核心的能力。在谷歌十四年间,他形成了一套基于神经科学的研究哲学:
- 以大脑为锚点:如果某个新方向与人类神经系统的运作方式存在根本性差异,他不会追这个方向。理由是——大脑的视觉处理方式、学习机制已经被进化验证了数十亿年,是已知的通用智能实现路径。
- 数据驱动:正如大脑从出生时的"白板"通过数据学习一切,AI模型也应当从数据中学习。
- 知道何时坚持、何时放弃:在大模型预训练的漫长过程中,判断一个方向值得持续投入还是应该及时止损,这种判断力直接决定了研究效率。
Andrew特别提到,在AI编程工具(如Claude Code)普及后,代码执行的门槛大幅降低,新想法(creative ideas)的价值反而上升了。以前编程困难时,执行力是稀缺资源;现在AI可以快速实现想法,创意和研究品味变得更加珍贵。
八、NLA(新型AI实验室)的窗口期
新的变化
硅谷正在涌现一批新型AI实验室(NLA,New AI Labs)——小型独立研究团队,获得VC的大量资金支持,聚焦于大公司不愿或不能做的前沿方向。Andrew的公司就是其中之一。
为什么VC愿意投这些小实验室? 因为大量资金已经重仓了OpenAI等大模型公司,VC需要"对冲"——万一纯语言模型路线无法最终到达AGI,NLA探索的替代路线就成为了关键押注。
嘉宾观点+解释
“我觉得这个窗口大概两年。过了这段时间,我们这一代NLA就发展成熟了,再想创业就更难了。”
Andrew认为当前是NLA的黄金窗口期:开源模型降低了技术门槛、融资相对容易、大公司的组织惯性给了小团队速度优势。但这个窗口不会永远开着——一旦当前的NLA群体成熟,下一代创业者的进入门槛会高得多。
关于Ilya Sutskever(前OpenAI首席科学家)所说的"我们正在重新回到研究时代",Andrew的看法是:当前AI研究的创造力仍然远超模型自身的创造力。虽然像OpenResearch这样的系统可以自动化部分研究流程,但它们产出的想法"太average了,没有creativity"。真正有创造力的研究者仍然是不可替代的。
九、Andrew的谷歌十四年:关键人物与影响
嘉宾观点+解释
Andrew提到了几位对他影响深远的人物:
Jeff Dean(谷歌AI掌门人):Andrew刚加入Brain团队时,Jeff Dean被称为"什么数据问题都能解决的人"。他不仅看代码,还直接看底层机器代码,当场定位并修复问题。Andrew评价他是"一个什么都学的人,包括自己学深度学习,他的想法造就了谷歌Brain"。
Noam Shazeer(Transformer论文作者之一):Andrew回忆与Noam讨论架构时的经历——Andrew提议在模型中添加一个连接,Noam不需要跑实验就能直接判断这样做的效果,因为他能"看那个架构就知道训练后会是什么样的结果"。Andrew称他为"一看就知道这是好模型还是不好模型的人"。
整个谷歌Brain团队:Andrew认为自己极其幸运,能在世界顶级的研究室见证AI这十年的巨变。他特别提到谷歌Brain带来的最大价值不是某项具体技术,而是聚集了一大批聪明人——“谷歌Brain的厉害太多了”。
十、创业公司的日常:从研究到搬箱子
嘉宾观点+解释
采访发生在Andrew公司刚搬入新办公室的那天。公司目前约15人(其中2人还在签证过程中),办公室的沙发还没到。
Andrew描述了创业公司创始人的生活:
- 白天:绝大部分时间在做运营(operations)——面试招聘、搭建IT基础设施、配置AWS
- 周末和晚上:才有时间做研究。“很多idea都是洗澡时想出来的”
- idea的实现:有了新想法后,用Claude等AI工具快速验证
Andrew正在招聘的人才画像:
- 视觉领域的一流研究员
- 有大模型预训练经验的研究员
- 优秀的工程师和管理人才
他用一句话招募:“我们的团队拥有在其他任何地方都找不到的密集经验——数据、语言、多模态、架构——我们的方向是将语言推理和视觉推理结合,打造下一代的推理模型。”
总结:Andrew Dai的十四年谷歌生涯,浓缩了大模型从萌芽到爆发的完整历程。从发现预训练+微调范式,到推动MoE架构落地,到主导Gemma和Gemini的预训练——他站在了大模型技术演进的核心位置。而他的出走,则预示着AI竞争进入新阶段:不再是"谁的模型更大",而是"谁的路线更对"。在语言模型的Scaling Law边际效益递减的当下,视觉推理能否成为下一个突破口,Andrew的创业将是重要风向标。