先说结论
这期播客录制的时机几乎是为话题量身定做的:就在录制前一天,Jeff Dean 宣布离开效力 27 年的谷歌,与 Sanjay Ghemawat、Quoc Le、Oriol Vinyals 三位老搭档共同创立 AI for Science 公司 Discovery Loop。主持人陈倩问得很直接——“一个时代结束了,一个时代开启了,可以这样理解吗?“嘉宾曹原的回应构成了整期节目的第一层信息:谷歌人才流失有其组织逻辑(Gemini 项目"集中力量办大事"带来的优先级挤压),但"谷歌做不好 AI for Science"是言过其实的,因为它仍是唯一拥有从芯片到分发全栈要素的公司;真正重要的信号是,当模型的代码与数学能力在过去两年基本到位之后,把智能释放到科学发现上,成了 AI 发展顺理成章的下一站。
曹原自己的身份是这段叙事的注脚:前 Google DeepMind 资深研究科学家,做模型迭代与后训练出身,如今是 Unreasonable Labs 的联合创始人——一家做"AI 知识创造"的初创公司(节目自称方向与 Discovery Loop 一致)。这场对话最有价值的不是新闻复述,而是他作为从业者给出的三个结构性判断:AI for Science 的瓶颈已经从模型能力转移到验证环节;LLM 在原理上无法产生训练数据之外的新概念,概念抽象可能是 AGI 的最后一公里、甚至不是图灵可计算的;以及科学不应该是 AI 的应用,而应该是驱动 AI 进化的催化剂——“AI and Science"而非"AI for Science”。
为什么是现在:代码和数学到位之后,科学是下一个智能出口
曹原把 AI for Science 的爆发归因于一条清晰的能力递进链:前两年最能体现推理能力的是代码和数学,这两个问题基本解决之后,加上 agent harness(帮 AI 分步完成工作流的外围体系)成熟,AI 才有条件去做更复杂的科学问题。他拆了一个生物实验的闭环:模型先要根据已有观测推理出下一个该跑什么实验(推理能力);实验出结果后要写代码分析数据是否与预期吻合(代码能力);发现异常后要回溯假设哪里出了问题并自我迭代(反思与记忆管理)。科学问题比 coding 和 math 更宽、更复杂,所以这些能力必须全部到位——用他的话说,“天时地利人和”。
概念澄清部分也值得记下。曹原区分了三个高频词:AI for Science 和 AI for AI 都是把模型当研究员,区别只是研究对象(科学问题 vs 模型自身,比如让 AI 在限定 GPU 预算下把模型训到最好,自动提proposal、写代码、进沙盒跑实验、拿反馈迭代);而 RSI(递归自我改进)不是任务而是方法,可以套在前面两者上。这个区分在当下投资人人都喊 RSI 的语境里相当有用。
至于哪些领域先爆发,他给出的分析框架是市场潜力×流程标准化程度×验证难度。生物制药排第一:市场本来就大、流程相对结构化、数据丰富,而且新药开发周期长达数年、成本数亿美元,药厂有最强的付费动力。材料学市场同样巨大但"太碎”——金属材料、稀土、半导体用途各异,价值点分散,很难用标准化方法捕捉。芯片设计、量子计算则还在探索阶段。
一个更根本的判断藏在"信息/物质/能量"的框架里:AI for Math 和 Coding 都停留在信息层面,而科学最终必须走到物质层面做物理实验。“这一步是逃不掉的。“目前迭代最快的只是 in silico(计算模拟)环节,湿实验的自动化(AutoLab、机器人操作员、云端实验室 API)是另一条必须补的腿——节目引用了 GPT-5 与 Ginkgo Bioworks 机器人实验室闭环生成蛋白质配方的案例,以及谷歌与劳伦斯伯克利国家实验室合作的 A-Lab(17 天 353 次实验、41 个目标材料中合成出约 20 个,据称该实验室仍在运行)。
验证是瓶颈,概念抽象是天花板
被问到闭环里最难的是哪一步时,曹原没有犹豫:“verification。它一旦这个瓶颈被打破了,你就可以很快地迭代。“他的极端表述是:如果一分钟能拿到一次物理实验验证,你就能生成无限数据、像训代码一样训科学模型,问题直接解决。现实中的两条出路,一是自动化实验室(标准流程交给机器人,非标准流程等具身智能——“比较久远”),二是提高模型智能本身,把达标所需的实验次数从十次压到一两次。
但比验证更深的天花板是"发现”。他引用了诺贝尔奖得主 Jennifer Doudna 的采访:用 AI 辅助科研时,AI 给出的 proposal 里"没有一个是我们之前不知道的”。当前的 AI for Science 能在既有表征空间里做排列组合式的搜索——AlphaGo 的第 37 手确实是发现,但那是"把现有内在表征重新排列组合”,不是创造新概念。曹原把人类的知识发现拆成三步:感官输入→形成概念(把"推车走"抽象为"力"并符号化为 F)→凝结成公式(F=ma)。其中第二步——概念抽象——是他认为 AI 目前做不到、甚至永远做不到的:“我认为可能是 AGI 的最后的 last mile……甚至都不一定是图灵可计算的。“他的人脑论证是:一个从未在数学上训练过的系统,看到三只鹅、四只鸟、五棵树,能否抽象出"数"这个概念?他很难想象有程序能做到。顺带一提,这也是他怀疑"人脑在最底层并不一定是图灵机"的原因。
这正是 Unreasonable Labs 的创业切入点:LLM 的宇宙由训练数据决定,而按定义,科学发现要找的东西不在现有知识里、不会在训练数据中高频出现。他们的方案是在 LLM 外面加一层符号主义机制——用本体知识图谱把跨领域论文中的概念与推理关系串起来,让模型能采到训练分布之外的小概率组合。他对此的清醒表述是"不能说解决问题,只能缓解弊端”,并判断未来大概是"98% 连接主义 + 2% 符号主义"的混合——事实上现在的 AI for Math 已经是神经-符号结构:LLM 生成证明(连接主义),Lean 形式化验证(纯符号)。主要瓶颈在于平衡创新性与可行性——“让模型创新很容易,随便采样就行,难的是创新且合理”。
AI for Math:从证明稀缺到证明过剩,以及 Lean 的必要性之争
数学部分的信息密度很高。曹原坚持:做"数学家级别"的数学必须走 Lean 形式化路线,自然语言证明在 IMO 竞赛层面够用(知识不深、几页纸能写完、可快速验证),但面对上百页的职业级证明,自然语言无法保证正确性。他讲了 Peter Scholze(转写误作"Peter Shor”;2018 年菲尔兹奖得主)的 Liquid Tensor Experiment:连顶级数学家都无法确信自己的证明对不对,最后靠与合作者把相关定理人工形式化进 Lean、编译通过才确认——“你只能相信逻辑和计算机。“代价是形式化极慢:Scholze 的例子花了大约一两年,谷歌参赛 IMO 时仅转换就超过比赛时限。所以现在并行的两条路线是:把模型训强到复杂问题不再需要形式化,或者加速自然语言↔Lean 的翻译(Axiom、Harmonic 两家数学初创的主战场)。
最有冲击力的是"证明过剩"一段(观点来自陶哲轩的近期演讲,由主持人引入):数学网站上的悬赏难题下面堆满了几十份 AI 生成的解答,却没有任何人类专家愿意接盘验证。“不是结果正确就一定正确。你需要去理解,然后去评判。“曹原的钢琴比喻很妙:机器人演奏力度时长完美无缺,但你不想听,因为你想听的是钢琴家自发的东西。四色定理是工具性意义与数学价值分离的老例子——结论可用,过程无洞见。
对"人类不能理解的发现是否有意义”,他的答案是"只能有部分意义”。黑盒接受的代价他举了 coding 的例子:AI 写的代码连工程师自己都看不懂,维护成本反升,而 LLM 是随机机器、两次生成不同代码,debug 一轮迭代又把代码搞乱——如果 AI 替代 80% 的经济活动、每件都需要人来验证,“那还不如不让 AI 做”。可解释性与人类介入在现阶段不可省略。
另一段判断与主流叙事相逆:AI 目前做得最好的是演绎推理,但牛顿式发现依赖溯因推理(abductive reasoning)——从苹果落地这个随机事件中想象出一个能泛化的原因。“在任何抽象层面上的智力活动,都是 AGI 的最后一公里。”
三巨头格局与创业窗口:优先级挤压下的机会
对三家的比较,曹原的排序很明确:谷歌布局最早最广最深(Alpha 系列、Co-Scientist),Anthropic 后来居上但仍在探索(Claude Science 平台本质是接了生物化学数据库的工作台,vibe physics、挖角 John Jumper——转写音译为"张昌鹏”——指向生物医疗押注),OpenAI 最激进也最混乱:GPT-Rosalind(转写误作"GPT Rosalyn”,生命科学定制模型)、2027 年全自动 AI Scientist 的公开目标、GPT-5+Ginkgo 的闭环实验,但 AI for Science 负责人 Kevin Weil(转写误作"Kevin Bayel”)今年四五月份离职后,相关努力已并入 Codex,加上 Sora、硬件、企业版多线作战,“优先级有些混乱”。共同点是:三家当前的最高优先级都是 coding 和商业化,AI for Science 是"没人敢落后的战略方向"但短期让位。
这就给新实验室留出了结构性的窗口:大公司的创新者窘境在于一旦挖出明确的商业化路径就不愿换方向。Discovery Loop 之外,今年冒出的一批 knowledge discovery / AI for Science / self-improvement 初创都在赌这个窗口。曹原对商业化时点的判断是分层的:药物开发中间产物(靶点、分子结构)现在就能卖;但"AI 拿诺贝尔奖"级别的成果"至少得二三十年”——因为还得先补齐因果推理、长期记忆、持续学习这些 AI 本身的缺口。他借此重申核心主张:science 不只是 AI 的应用,而是促使 AI 发展的刺激与催化剂;一个能在极难科学问题上做好的模型,在写代码、推理等其他方面也必然更强。AI 是元技术,AI for Science 的终极外溢是"代理 CEO"式的全经济效率提升。
哲学收尾:AI 从业者该多读点哲学、多想大问题
节目的最后一段从技术滑向哲学,而且是全片最连贯的一段思想史映射:经验派(洛克、培根——认知完全来自感官经验)对应 LLM 的预训练范式(随机初始化+万亿 token 经验输入);唯理派(笛卡尔的先天结构)对应符号主义的先验规则;康德的综合(经验提供材料、先验结构使其有意义)预言了神经-符号混合;黑格尔的辩证自我否定对应持续学习——模型不该是一个参数刻死的 checkpoint。他的结论:“哲学和 AI 讨论的是同一个问题——人怎么认识世界、知识怎么产生——只是不同的镜子照同一个事物。“对从业者的建议是少一点自下而上的工程叙事(transformer 有用、scaling law 没失效、harness 要搞好),多一点自上而下的第一性原理思考:智能是什么、AI 还做不到什么、以及即便 AI 接近人类水平之后,计算还能自动什么。在当下的狂热里,“会产生很多浮躁和肤浅的见解”。
三条可带走的判断链
验证速度决定迭代速度。 模型能力到位后,AI for Science 的边际约束变成"多快能拿到物理世界的反馈”→ 自动化实验室(Ginkgo、A-Lab)与模拟精度的军备竞赛 → 观察指标:AutoLab 成本曲线、具身智能进实验室的进度、以及模型达标所需实验次数的压缩率。对创业者:验证环节的基础设施可能比又一个 hypothesis 生成模型更值钱。
概念抽象是发现的上限,也是创业的切口。 LLM 在原理上采不到训练分布之外的高价值新知 → 外挂符号结构(知识图谱、本体、Lean)成为生成"合理小概率组合"的杠杆 → Unreasonable Labs、Axiom、Harmonic 都在这个"神经+符号"的接口上创业 → 观察指标:AI 生成的假设中"人类不知道的新颖占比”、跨领域论文组合的可验证率。曹原自己也承认此路线不解决问题、只缓解弊端——这是一个坦率的限制条件。
优先级挤压创造窗口。 大厂被 coding 商业化锁死短期优先级 → AI for Science 人才(Jumper、Jeff Dean 系、曹原本人)外溢到初创 → 科学难题反过来成为练出更强模型的道场 → 观察指标:这批新实验室能否先在自家技术栈上自用成功(Discovery Loop 的第一客户是自己的 ML 研发),再外溢到生物、材料。风险提示来自曹原的二三十年时间表:这是一条需要长期资本耐心的赛道。
尾注:转写校正说明
本文章基于本地 ASR 转写撰写,以下专名已结合公开信息校正:曹原(Yuan Cao,前 Google DeepMind 资深研究科学家,注意与麻省理工/伯克利的石墨烯物理学家曹原非同一人)、Unreasonable Labs(转写误作"Unrealism Labs AI",与 MIT Markus J. Buehler 联合创立,1350 万美元种子轮由 Playground Global 领投)、Kevin Weil(转写误作"Kevin Bayel")、GPT-Rosalind(转写误作"GPT Rosalyn")、Axiom(转写疑似"XN AI/XM AI",另一家为 Harmonic)、Peter Scholze(转写误作"Peter Shor",2018 年菲尔兹奖得主)、王虹(转写误作"王宏/汪峰",2026 年菲尔兹奖得主,与邓煜同届,转写"瓜苦猜想"应为挂谷猜想)、Discovery Loop 创始团队(Jeff Dean、Sanjay Ghemawat、Quoc Le、Oriol Vinyals)。A-Lab 的"41 个目标中 20 个"数字与公开报道的 58 选 41 存在出入,文章采用转写原文并标注节目口径。OpenAI Astra(片头新闻导语中转写为"Extra")解决十道数学难题、Claude 科研版推进黎曼猜想零点下界(41.6%→67.2%)等新闻均出自节目开场导语,为节目转述,未做独立核实。