来源:小军访谈 ·「对姚顺宇的4小时访谈:请允许我小疯一下!在Anthropic和Gemini训模型、技术预测、英雄主义已过去」 主持:小军 嘉宾:姚顺宇(Shunyu Yao),Google DeepMind研究员。本科清华物理系(凝聚态理论),斯坦福理论高能物理博士(量子信息与黑洞方向),伯克利短暂博后后加入Anthropic,参与Claude 3.7大规模强化学习与coding训练,去年九月底加入Google DeepMind,参与Gemini 3 Deep Think、Gemini 3.1 Pro等模型。注意:硅谷另有一位同名姚舜宇(前OpenAI、现腾讯首席AI科学家),两人履历有overlap但方向不同——另一位一直是计算机背景,本篇嘉宾是从理论物理半道转入AI。

本文整理自小军对姚顺宇的4小时访谈。他从宁夏小城到上海、清华、斯坦福,从量子物理到高能理论,再到Anthropic和Google DeepMind训练模型,完整讲述了一线研究员视角下AI的真实节奏。以下按主题组织,每个主题包含「新的变化」和「姚顺宇观点与解释」两个维度,力求让未观看视频的读者快速理解核心内容与得出观点的原因。


一、AI进入"下半场":从"能不能做到"到"该做什么"

新的变化

一年前(2025年初),业界最焦虑的是"OpenAI的reasoning这么强,我们能不能追上"。姚顺宇观察到,到2026年初,OpenAI、Anthropic、Google三家已经没有谁真正担心自己追不上——焦虑的对象从"能力差距"转向了"想明白要做什么"。这是一个根本性的心态转变:模型能力被拉平、同质化、商品化,纸面benchmark上各家都在80%附近徘徊,高低一两个百分点主要是噪声而非信号。

姚顺宇观点与解释

姚顺宇:他并不太认同"上半场/下半场"这种划分,但承认现在确实进入了一个新阶段——大家不再担心"AI能不能做到",而是担心"这件事是不是被良好地定义了"。

从用户体验上,三家模型仍能感受到区别:通用工具使用类agent表现最好;纯coding方面CodeX(他口误为"CoilX")最近追上来缩小了gap;Anthropic在纯reasoning和日常使用上仍较好,coding和agent上则处于接近状态。这种分化过去主要源于"意愿"——各家选择优先发展哪个方向(Anthropic重coding,OpenAI曾重reasoning),但现在意愿和能力两方面都有,因为当纸面都差不多、内部测试也差别不大时,更难的是"如何定义你想要的行为"。

他举了一个"想象不到"的例子:退回一两三年前,从网上取预训练数据训模型,模型写代码会写得很好,当时大家不知道为什么。后来发现原因是网上自然的code数据质量本身就比普通网页高——这种"意外因素"在今天模型差异中仍大量存在,只是很难当场解释清楚。

背景:SWE-bench是衡量模型解决真实软件工程问题的benchmark;AIME是美国数学邀请赛,常被用来测数学推理;AGI benchmark(如ARC-AGI)测抽象推理。姚顺宇认为这些公众benchmark"都打码了"——SWE-bench大家都到80多,幸亏没人超过83(OpenAI后来说超过83的题有不良含义),AIME、ARC-AGI也被DeepSeek等打到了80多,单纯刷这些"第一名"已经没太大意义。


二、OpenCloud与Manus:模型能力的自然溢出

新的变化

2025年初火的是Manus(后被Meta收购),2026年初火的是OpenCloud(后被OpenAI收购)。姚顺宇认为从Manus到OpenCloud的"质变"他自己其实没看明白——他不理解"为什么Manus做不了OpenCloud能做的事",可能只是Manus没做。这类产品形态的技术能力并非今年才准备充足,去年OpenAI发布4.5时(其工具使用能力比o1和Gemini都强)就已经可以展示。

姚顺宇观点与解释

姚顺宇:OpenCloud"技术上并不能说明什么",它依赖的模型能力去年就具备了。它的真正意义不是技术突破,而是"让大家意识到这件事可以做"——你可以控制多个不同的模型做很长很复杂的工作。它发布后并没有立即火,过一段时间才火起来,说明这是一个"共识的建立"而非能力的跨越。

关于为什么Manus和OpenCloud都"卖了"(卖给大厂):他认为长久生存需要考虑壁垒,目前壁垒主要在模型侧。至于Google为什么"谁也不收"——他纠正说Google其实买了Windsurf。他个人不太理解Meta买Manus的意义,猜测最大用处是获得了一批在亚洲(新加坡)的产品团队锚点,因为中国AI人才储备丰富,“本质上人才比美国更好”。

一个反直觉的观察:Manus和OpenCloud都诞生于大厂之外的团队,而不是硅谷的研究员。姚顺宇的解释是——大公司一旦变大,负担也变大。个人可以随便发开源项目(“代码垃圾又如何,你帮我一起写”),但大公司不行:产品不能一上线就让用户冒电脑被搞崩的风险,要确认法律风险、不损坏品牌、还要投入固定资源去serve。大公司的流程包袱让小团队反而能在新产品形态上领先。


三、预训练远未到头:撞墙多半是有bug

新的变化

过去几个月,关于"预训练scaling已经到头"的讨论一度盛行。姚顺宇给出了截然相反的一线判断:预训练在过去几个月"还是越来越强了",且未来四个月也看不到到头迹象。这与他入职Anthropic初期曾抱有的"预训练party over"想法形成对照——随着了解深入,他发现"还有很大做的空间"。

姚顺宇观点与解释

姚顺宇:他认为一个人觉得一个规律"到头",无非三种情况:一是觉得规律适用范围到头了(scaling本质无法无穷延展);二是觉得某个条件不能满足了(比如数据撞墙);三是工作里有bug没发现。他的观感是"绝大多数撞到墙的人是因为第三种——有bug"。

bug有很多种:可能是scaling时科学假设没做对(比如每个大小的模型选什么token horizon、期待的训练数据量、数据从哪选);也可能是纯粹的工程bug——“修好一个bug带来的进展远大于一些很神奇的技巧”。

遇到bug时是"信念问题":你觉得不能解决就说"到头了",觉得肯定能解决就"还没到头"。但更重要的是"做事系统"——当一个尺度上的行为和预期不一样时,能否系统性排除各种可能性。他强调这是Anthropic团队做得好的地方:能设计合理的ablation实验,测出想象中的因素是不是真因素。

驱动力方面:数据和算力是强关联的(算力上去需要更多数据,数据上去需要更多算力),在"比较清晰的框架"里是主要驱动力。算法的作用是"相变"式的——在完全没搞清楚怎么做时算法最关键(如Transformer的发现),之后算法提升变成平滑的效率改进。多模态生成属于"算法上没太想清楚"的科学问题,还没到能scale up的点。

预训练和后训练作为两个范式都没有达到平台期。但他指出一个更微妙的现象:现在到达的"平台期"不是技术本身到了(模型还学得会),而是"你想干的事儿到平台期了"——已知chatbot可以教、coding可以教,但"不知道下一个该教什么"。模型像一个非常聪明的小孩,人类作为老师还不知道下一个该教什么,或该怎么用现有范式去教。

背景:scaling law(他口误为"斯金诺/Scalenet")描述模型随大小和数据在指标上如何变好。他将其类比为热力学定律——当年也是经验规律,后来才理解微观机制变成科学规律。


四、Claude 3.7:后训练如何scale up的分水岭

新的变化

姚顺宇入职Anthropic时(2024年九月底),公司约七八百人,他所在的Horizon大组只有十来人,主要做大规模强化学习。他赶上了Claude 3.7——一个他称为"后训练分水岭"的模型。在3.7之前,后训练处于小规模、修补状态;3.7之后,后训练开始能scale up。他澄清了Anthropic混乱的版本命名:外界Claude 3.5其实有两个版本(六月和十月),后来外界把后一个叫3.6,Anthropic跟随这个习惯,再新的就叫3.7——“曹伟(Anthropic)曾经没啥产品能力,居然管两个模型叫一个名字”。

姚顺宇观点与解释

姚顺宇:3.7是怎么做出来的?关键不是某个神奇算法,而是"找到合适的环境"——这个环境的回归(reward)信号足够清晰、本身是强数据源,在上面做训练非常稳定,就能做成。这一点OpenAI、Anthropic、DeepSeek都意识到了,大方向一致(找回归信号清楚、客观、数据干净、可学习的环境做稳定RL),但具体算法和数据使用方式差别很大——事实证明每家方向不一样,但都能做成。

他特别强调"把简单事儿做的比谁都干净"比花里胡哨的技巧重要。强化学习有很多算法(最简单的GRPO只是抛了一个点子),还有复杂搜索算法,但复杂性是否必须?它可能带来效率提升,却带来infrastructure困难,如何trade-off才是研究要理解的。很多能耗都在处理这些细节。

coding为什么重要?他给出两个原因:一是Anthropic一直讲的——coding本身是做语言模型研究的一部分,做好coding能让研究效率翻倍,形成研究飞轮;二是coding是"模型使用工具和环境交互"的很好抽象——回归信号清晰、数据充分,很难在别的场景同时找到这两个特质。在coding上做的研究,对更通用的工具使用和环境交互能力有借鉴意义。

关于技术tips:他认为"大家很愿意听、公司又不让说、但实际没啥用"。因为现代AI算法设计强依赖infrastructure——比如强化学习时产生token的机器(sampler)和实际训练改变权重的机器(trainer)可能不一样(数值差异或异步架构),不同公司这个差异程度不同,算法设计就不同。“现代AI训练是一个大系统,要了解方方面面才能有全局认识——什么事是因为什么而变得有用了,而不是这个事本身有用。”

背景:当时OpenAI的保密项目代号"草莓(Strawberry)",大家只知道会带来后训练强化学习的新范式。姚顺宇说,OpenAI当时的目标不是coding,而是"预训练作为第一范式金矿快挖完了,开启第二个金矿(后训练RL)让scaling继续"。他在3.7时代也曾认同"预训练party over",后来改变看法。


五、离开Anthropic:反华、文化冲击与想学新东西

新的变化

姚顺宇在Anthropic待了一年,离开时公司已接近两千人(翻倍多)。他选择离开去Google,是一个"反行动"——多数研究员嫌Google给的scope不够而想跳去Anthropic/OpenAI这样的小组织,他却反向而行。原因有三:不认同Dario(Anthropic CEO)把某个观点推到极端的情绪化表现(约占40%,非主因);公司变大后文化受冲击;以及想学Anthropic不做的事(多模态生成、底层工程基础设施)。

姚顺宇观点与解释

姚顺宇:离职酝酿了一个多月。关于Anthropic的文化变化——他进去时是"小作坊",大家都是朋友、都知道对方在干嘛、没人做个人宣传、紧迫感强;后来人多了,外面来的人和原有文化冲突,出现一些"在Slack上花很多时间讲大道理"的人。他不喜欢这类人,因为"idea cheap(想法是便宜的),难的是怎么实现、怎么变成可执行的步骤"。

离开Anthropic时他对公司其实"挺悲观"——主要收入靠卖token的API是"差生意"(只有对Google是好生意,因为最终要打价格战,没有完整链条没优势)。但后来证明他"过度悲观了":Anthropic在产品上有很多巧思,Claude Code越来越好用,各种工作效率相关的事汇聚起来。他原本觉得Anthropic会比OpenAI先"变得没那么重要",结果OpenAI先被Google揍了一拳,Anthropic自己上道了。

为什么去Google而不是OpenAI或xAI?他当时也有OpenAI选项,但转折点是对OpenAI文化的担心——“做事的人没有Google多”。Google吸引他的是研究自由、探索自由、能从更广泛的人那里学习。他强调:很多人离职后不开心是因为"没想明白自己想要什么"——如果想要明确的scope和产品impact,Google是差地方;如果想要研究自由和横向学习,Google可能是世界上最强的地方。

背景:他提到的"大润反华"指Anthropic CEO Dario Amodei的某种立场表达。“曹伟"是他对Anthropic的戏称。


六、Google的翻身:组织变清晰、OpenAI救了Google一命

新的变化

姚顺宇加入Google DeepMind后参与了Gemini 3 Deep Think、Gemini 3.1 Pro。从内部视角,他指出Google翻身的关键是两件事连着发生:NotebookLM(他口误为"纳豆保纳/Gulana”)把量打起来,Gemini 3紧接着把人留住。如果只有Gemini 3而没有NotebookLM打流量,市占率不到10%时模型好坏传播太慢。他估计Gemini现在可能占约20%市场。

姚顺宇观点与解释

姚顺宇:Google翻身的技术原因是组织变清晰了——尤其预训练变得"非常非常清楚",谁负责什么、每个节点谁是负责人都很清楚(以前更混乱)。加上Google一直有的强技术背景和系统做事方式,预训练在Google是"非常可控的事"——你能知道下一代不会差,甚至知道会有多好。

一个反直觉的判断:“OpenAI救了Google一命”。如果OpenAI不仅做了ChatGPT还一路高歌猛进把搜索彻底吃掉,Google会很难受;但OpenAI先做了聊天机器人让Google意识到重要性,又没做到极致(没完全干掉搜索),给了Google追赶的时间。现在聊天机器人没完全吃掉搜索,是因为有些场景(比如"买大米")用搜索比问ChatGPT转圈圈再给链接更直接。

Google的文化是"更bottom up"(比以前更自上而下,但仍比Anthropic更自下而上),擅长的是"找到一个极简单的产品形态,疯狂卷技术"——搜索引擎就是典型。Google在产品上有点慢,但"通过技术能力溢出产品能力"。他预测"现在谁的位置都不稳固",AI形态还有很长的路要走,没到"中局之战"。

关于Google的技术一号位:他说"英雄背后都有一个人——Koray"(DeepMind CTO,现也任Google CTO),很多大决定最终由Koray拍板;Dimitri(Hassabis)更多管偏science的事(如Isomorphic Labs药物)。TPU方面,他认为大规模商用时GPU和TPU没有绝对优劣,但设计理念不同:GPU(如Hopper)是8卡两两高速互联、卡间无瓶颈;TPU抛弃卡间两两互联,用三维torus把尽量多的卡连成大集群,逻辑写得好可获得更大等效存储、减少通信瓶颈。

背景:NotebookLM是Google的AI笔记产品,曾因"音频播报"功能爆火。Koray Kavukcuoglu是Google DeepMind CTO。Dimitri Hassabis是DeepMind CEO。


七、AI本质简单、不可阻挡:六到十二个月内AI自己做实验

新的变化

姚顺宇抛出一个尖锐判断:“AI这个事儿本来也不太需要脑子”,最重要的特质是"靠谱、做事细、对自己做的事负责任"。他认为"AI本质是简单"的——不是因为结论,而是因为它能做实验,不像物理那样没有实验数据就理解不了理论。更激进的预测是:未来六到十二个月,AI就会开始自己做实验——从头到尾完成一项AI研究(写代码、跑实验、看结果、分析、提出新假设、设计新代码)。

姚顺宇观点与解释

姚顺宇:AI本质简单的点在于"它能做实验"。物理在某个能标下没有实验数据就理解不了理论,但AI不被此束缚——理解不了没关系,也可以往前发展,而且现在能做任何能想到的实验,只是需要时间把算力或基础设施准备好,“没有什么本质上的困难”。所以AI没有给人"碰壁"的感觉:首先什么都能试,其次不是没想法可试了,而是"有太多想法得一个个试"。

AI不可阻挡——“任何一个组织想要停止AI进展是做不到的”。Anthropic很担心AI安全,但它没有能力阻止AI发展(你停止别人会发展,你的话语权还会变小)。“现在是世界在推着我们前进,而不是我们在推着世界前进。”

他对Anthropic"做最好的模型才有话语权推进安全政策"的逻辑评价为"非常幼稚"——更可能发生的是大家都有很好的前沿模型,没有任何一家能阻止事情发生。他类比核武器:核武器最终受控靠的是multi-party control(多国互相毁灭能力的制衡),AI可能也需要类似机制,而不是指望一家公司制定法律。

Anthropic的可解释性团队进展:在一些比较简单、稀疏的网络里能做有趣研究(看输入的内在表示、反转后输出什么),但实际使用的语言模型远没到"神经科学手术刀"级别的理解。

背景:Anthropic创立时的重要动因是AI安全,但现在"做AI安全的公司为什么做前沿模型"成了自然问题。


八、个人英雄主义已过去:每个个体都是冲浪的人

新的变化

姚顺宇反复强调"个人英雄主义时代已经过去了",甚至觉得"旧时代英雄有点蠢"。这与当下AI研究员被炒到"跟球星转会一样"的高价形成反差。他认为AI是集体主义的事——“每个个体都是冲浪的人,本质上是浪,而不是冲浪的人。浪是AI,它会往前走,不管你冲不冲,都会拍到岸上。”

姚顺宇观点与解释

姚顺宇:英雄主义时代对应的是"技术还没到scale up那个点之前"——那时找到关键技术的人或小团队是英雄(如Transformer、GPT范式被发现)。但进入可用大模型阶段后,从模型侧看更多是集体主义——“这个集体能不能一起工作、为一个目标一起花时间精力,才是最重要的,而不是每个个体提供了什么”。

他认为AI方向"本质上是简单"的,除了跳变时有深刻洞见,之后的很多想法"非常愚蠢,谁都能想谁都能干,只是运气好抓住了机会"。包括coding能力的发现也有随机性,“没有Anthropic做coding也会有别人做,是必然的事”。

关于研究员高价:他个人受益于此,但不确定是不是好事。一方面确实稀缺(训练一个人需要环境,过去撞到机会的人不多);另一方面"对人的炒作有点过分,非常喜欢神话个体"。

他的面试题设计也反映这一理念:给候选人24小时从零到一完成一个强化学习项目(选模型、数据、算法,训出来),结束后一小时讨论。AI时代这不再难(AI能帮你全操作),但有两个考察点:一是能否有效利用AI(不再考代码写得好不好);二是陷阱——如果全权扔给AI却不深度理解,一小时讨论会露馅。24小时设计也是为了看"这个人有多看重这个机会"(能不能熬夜撑住)。

对年轻人入行的建议:纯做语言模型"已经不是蓝海,末班车已经发车了"(他自己入行就是末班车)。但AI很大,多模态生成、机器人、用AI解决科学问题(如量子调控)都是更蓝海的方向。“做现在最热火的事并不是正确选择,做现在没人做到的事可能更好。”


九、Anthropic的执行力:技术leader有公信力才能make bet

新的变化

姚顺宇对比了Anthropic、OpenAI、Google的组织差异。Anthropic能实行"top down"机制、快速make bet,他认为这在其他公司很难(OpenAI搞不了,Google是另一套打法)。关键不是CEO有公信力,而是"技术leader有公信力"——且CEO没有成为阻力,这需要co-founding team有足够互相信任。

姚顺宇观点与解释

姚顺宇:Anthropic能top down的原因是技术决策人(如Jared Kaplan、Sam等)同时也是公司co-founder(公司口方),技术上能服众、又能为公司决定负责。Darrell(Dario)作为CEO起到什么作用他说不清,但"技术leader有决定权"是关键。

Anthropic的co-founding team没有一个人离开公司——“那是一群真正一起打过仗的人”,源自OpenAI,在关键论文(Scaling law、GPT-3)上都是合著者。“互相之间的信任是关键,很多公司干着干着连小集体都团结不住了,怎么能指望大公司团结住?"(暗指OpenAI)。

Startup和大公司打法不同:Startup重要的是make bet(能快速决策、强力推进),Anthropic的top down在这方面比OpenAI有优势。大公司(Google)则是另一套——尽量减少赌的成分,方方面面都有储备,任何事成了都能跟上,自己做成还能领先。Google是传统bottom up组织,公司有良好框架引导你做公司需要的事,但本质还是自己决定做什么。

什么组织能激发创新?过去观点是bottom up是创新的必要条件(自由才能创新),但完全bottom up也不行(乱)。需要一个人或小集体融合两者,而"组织运行好不好看起来是组织问题,归根结底是技术leader的问题”——最好的状态往往是最不稳定的,容易往不好方向塌缩,需要leader控制。好的leader需要两个特质:有救火能力(真遇困难能下场带人解决,而非只嘴上说);能理解别人(哪怕不是自己做的事,能理解为什么重要、容得下别人)。

背景:Jared Kaplan是Scaling law论文的关键作者,Anthropic co-founder。GPT-3论文作者包括Tom Brown、Ben、Brian、Jared Kaplan、Sam等。Anthropic创始团队多来自OpenAI。


十、Long Horizon与Agent Coding:Google接下来的两个方向

新的变化

在Google DeepMind,姚顺宇主要做两件事:Agent Coding和Long Horizon。前者是让AI完整地自己做AI研究(写代码、跑实验、分析、提假设、设计新实验的完整链条);后者是用有限context训练、但使用时能做非常长甚至接近无限context的事。他认为这两件事"未来几个月内能看到曙光",对Google特别有价值(Google是AI算力大户且全栈,从硬件到模型)。

姚顺宇观点与解释

姚顺宇:Long Horizon的核心哲学是"用短context训练,但能做长context的事"——类比人:人的context很短(昨晚吃什么可能想不起来),但能选择性遗忘、再retrieve跟当前场景相关的信息。他更花时间在后训练方案上(而非预训练的sparse attention),因为后训练方案更符合"用短的训练长的"哲学——预训练方案本质上还是需要长context训练数据。

两种方案都有人在研究:预训练角度有sparse attention(如DeepSeek的一些工作);后训练角度有context management(如Cursor让模型选择扔掉不重要片段、把重要的存文件再取回)。他用短context训练长context"一定可以,但不清楚哪个方案最有效"。

Gemini长文本做得好,他透露"有一些让我很惊讶的技巧",预训练那边的技巧尤其让他惊讶(但他不能多说)。Agent Coding和Long Horizon是互补的——像T字形,Agent Coding是横向新场景(从coding补全延展到完整AI研究),Long Horizon是纵向尺度变长。

Continual Learning和Long Horizon他认为没有本质区别——Context里的KV cache也是一种权重,两者都是为了做更长时间跨度的事。世界模型则"一万个世界模型,定义不清晰,每个人说的都不一样"——他和Google做的世界模型更多是end-to-end训练,不仅生成视频还能生成可交互的场景(给定动作,下一状态是当前状态加动作的函数)。

背景:sparse attention是减少注意力计算量的技术;KV cache是注意力机制中缓存的键值对;Continual Learning指模型持续学习更新权重的能力。


十一、从物理到AI:理论物理的教训是"要做有客观评价标准的事"

新的变化

姚顺宇的成长轨迹是一条不断"挑战自己不会的事"的线:宁夏小城出生,上海长大,主动放弃上海四校普通班选了格致中学竞赛班(“underdog,光脚的不怕穿鞋的”);清华物理系做凝聚态理论(非厄米系统,范式级工作),博士却换到几乎不相关的高能理论(量子信息、黑洞),博士期间"从结果说比较落寞";然后又从理论物理跳到AI。

姚顺宇观点与解释

姚顺宇:他本科做非厄米系统(开放量子系统)时,发现周期边界条件和开放边界条件结果对不上,进而发现描述厄米系统的布洛赫波范式在非厄米系统里是错的——能量本征态会聚集到体系一边。他系统建立了一套描述方法,这是范式级的工作。但他"很难抓住一次范式的变化"——做完最重要的工作后就换方向,“总爱挑战自己不会的事”,“爱折磨自己”。

博士选高能理论"于这个世界来说没有产生什么贡献"。高能理论发展到实验完全追不上的阶段,进步依赖数学自洽性,“当没有实验、没有客观标准时,谁做得好坏依赖于领域内老登的主观判断”。他花了五年学到一个大教训:“要做实验,要做有客观评价标准的事,要做对这个世界能产生影响的事。“这直接导向了他后来转AI——AI能做实验、有客观评价标准。

物理对AI的"硬实力帮助几乎没有”(工具性技能转化很少),但性格上有影响——做物理人更想刨根问底、做事系统。他不觉得这是物理人独特的,计算机人、化学人、生物人也有。AI像"18世纪的热力学”——那时理论和实验不分家,不理解热的微观理论但不妨碍有经验定律和发展。Anthropic招很多物理人,主要原因不是"物理人擅长AI",而是"connection"——创始团队有物理出身的人,一直延续下来,但"在我之后几乎没再招完全没有AI背景的人了,是一个时代的产物"。

关于"智能涌现":“这话不太科学,智能涌现更多是主观感觉而非客观现象。“他认为是"技术上的涌现"而非"行为上的涌现”——通过研究发现怎么做大规模训练,能水平提升所有能力,这才是本质。

背景:非厄米系统研究开放量子系统(与外界有交换)的行为;布洛赫波是固体物理中描述本征态的基本范式;高能理论研究弦论、量子引力等,实验难以验证。


十二、厌蠢症与别信老登:一个没有AI导师包袱的直言者

新的变化

姚顺宇说话异常直接,自陈"我在这个行业没有什么导师,没有什么旧友,我喷谁就喷谁”——这是不做AI出身的好处,没有哪个老的是亲属,觉得他傻就可以直接说。他区分了两种年老状态:“德高望重”(少指手画脚、花力气培养年轻人)和"老登"(自己不懂还指手画脚),“人老了不一定会变成老登”。

姚顺宇观点与解释

姚顺宇:他做学生时还比较收敛,后来发现"收敛没用,对自己没好处对别人也没好处,直接表达想法最关键——短期一定有人恨,但长期大家会欣赏"。做AI后更直接,一是没有束缚,二是这个领域足够客观——“只要你的观点自洽,有一套自己的理解,大家会尊重,因为最终在这个领域做得怎么样有客观评价标准”。

他对某些模糊的AI预测者很不屑(暗指某位常被提及的人物):用泡利的话说是"not even wrong(脑体分弱)"——没有良好定义,“一个事儿模糊就是没有意义的”。如果范式一种状态他能说一样的话,那就是模糊。“如果他有正确定义我可以解释,但他没有正确定义,我没法解释为什么没有——因为他真的没有。”

推荐书方面,他自认"文化水平比较低",没什么人生之书。最近读的是汤川秀树的自传——能看到一个后来很成功的科学家年轻时的挣扎感,很真实。闲书推荐日本小说《来自新世界》。影响AI进程的论文:Seq2Seq(语言模型安静时代的高峰)、Scaling law(把体系化研究方式引进领域的第一篇)。关键benchmark:“Language,Language”——他听了"语言及世界"工作室的名字觉得"有点正常得太平庸了",但十年前意识到语言是承载智能的重要载体是不一样的事。

最高优先级是把Agent Coding和Long Horizon推进到稳定状态;AI做物理"已经有很多人在做,多一个不多少一个不少,不如让别人先干"。未来"应该不会在Google很久,还会尝试挑战自己、折磨自己,但要找到值得折磨自己的事"。不会再跳去另一个大公司。

背景:泡利(Pauli)是著名物理学家,“not even wrong"是他批评理论缺乏可证伪性的名言。汤川秀树是日本首位诺贝尔物理学奖得主。《来自新世界》是贵志祐介的科幻小说。


结语:这场4小时访谈最珍贵的,不是某个具体的技术预测,而是一位身处AI最前线、又带着物理学家式审视的年轻人,对整个行业冷静的祛魅。模型能力被拉平后,焦虑从"追不上"变成了"不知道做什么”;预训练和后训练都没有到头,但到头的可能是"人类作为老师不知道下一个该教什么";AI本质简单却不可阻挡,个人英雄主义已经过去,“每个人都是冲浪的人,本质上是浪而不是冲浪的人”。对于想入行的年轻人,他的建议朴素而清醒:纯语言模型的末班车已发车,去做现在没人做到的事。而对所有把AI神话化的叙事,他给出的最直接回应是——“别相信老登”。