来源:WhynotTV Podcast #4 嘉宾:翁家翌(2022年加入OpenAI,post training RL infra核心贡献者,从ChatGPT、GPT-4o到GPT-5的每次模型跃迁背后都有其身影;此前在清华开源作业资料、开源强化学习框架天授、做免费签证查询系统tuixue)

本文整理自WhynotTV Podcast对翁家翌的深度访谈。翁家翌是OpenAI一系列模型背后的核心贡献者,其贡献可总结为三个关键词:强化学习、post training、infra。以下按主题组织,每个主题包含「新的变化」和「嘉宾观点与解释」两个维度,力求让未观看视频的读者快速理解核心内容与得出观点的原因。


一、Open之争与闭源逻辑:对普通人的Open,而非对大公司的Open

新的变化

OpenAI自创立起便以"让通用AI平等造福全人类"为使命,名字里的"Open"曾被视为开源精神的象征。但随着ChatGPT引爆全球,OpenAI逐步走向闭源,这与早期承诺之间产生了张力。一个外部可见的新变化是:DeepSeek以OpenWeights的姿态崛起后,OpenAI内部重新评估了开源策略,但最终仍维持闭源路线——这不是理念退让,而是生存博弈。

嘉宾观点与解释

翁家翌:OpenAI的使命应拆成两部分看——“实现AGI"和"造福全人类”。实现AGI靠对预训练、算力、RL的scale up;造福全人类目前的落地方式是做产品、以尽可能便宜的价格(比如免费ChatGPT用户、免费语音模式)让普通人接触到技术,而不是直接丢一个裸的模型权重给大众。

他明确区分了两类"Open":OpenAI的Open不是对其他大模型公司的Open,而是对普通人的Open。 一个普通人拿到裸权重也不知道怎么用,所以把体验做好、价格压低比开源权重更接近"造福全人类"。

为什么不得不闭源?他给出了一个博弈论式的解释:理论上存在"开源+接受社区反馈+更快实现AI"的路径,但执行上有现实困难——一旦你开源,其他人立刻能追上并闭源再训,会导致OpenAI在当前环境下融不到资、没人持续输血。“哪怕我想为了AGI造福全人类,但可能有人不这么想,有人就是想挣钱。为了防止这样的情况发生,OpenAI不得不闭源。”

值得玩味的是,翁家翌本人"当然会很开心"把两三年的R&D开源出来——他透露张书满(注:其面试并招他进OpenAI的leader)甚至问过他要不要开源,他当时觉得"为了公司考量不太好"。DeepSeek的OpenWeights确实让OpenAI重新做了一轮内部评估。这表明OpenAI内部并非没有开源的冲动,而是被竞争现实压制。


二、大模型生死线不是算法,而是infra的迭代速度

新的变化

一个被外界严重低估的事实是:大模型公司的真正生死线不是某个榜单分数、不是某篇论文的算法创新,而是单位时间内infra的迭代次数与成功率。翁家翌透露,OpenAI很长时间以来都没有刻意为刷LMSYS等榜单做事,真正引起内部警觉的不是哪个模型在榜上超过GPT多少分,而是DeepSeek声称迭代速度非常快。

嘉宾观点与解释

翁家翌:他引用一句同事(前阿里PhD,做过知名framework)的话——“教一个researcher如何做好engineering,要远比教一个engineer如何做好research来的难。“这句话点破了当下AI lab的人才需求逻辑。

他的核心判断是:当前的问题在于infra,你能不能scale up、单位时间内能迭代多少次,直接决定了生产效率。idea是非常便宜的,找有research直觉的人(比如从GPT-1开始就在做的Alec)讨论一下就有了,真正的瓶颈是把infra打对、快速验证。“每家infra都有不同程度的bug,谁修bug,谁修的bug越多,那谁的模型训得就越好。“他甚至猜测Llama训不过GPT,maybe就是因为bug太多。

为什么是infra而非算法成为瓶颈?背景是:toy task(玩具任务)的瓶颈在环境,模型很简单,训练和采样都很便宜;但大模型的RL infra正好相反——环境非常简单(就是一个prompt,几微秒),但模型采样和训练要几百到几千秒。所以高性能、scale(如何用更多GPU、更高效吞吐)才是关键,且会深入到inference优化的实现细节。

一个关键的数据点:当被问及OpenAI在"单位时间迭代速度和成功率"这个指标上是否世界第一时,翁家翌直接回答"不是,肯定不是”,并说这跟组织架构有关——抽一个团队去做startup,迭代速度斜率会远高于OpenAI,因为代码库小、沟通成本少、use case集中;而OpenAI要同时考虑很多use case和各种trade off。这是组织规模化的必然问题。

更值得关注的是他对未来的预判:OpenAI当前那代infra已用了三年多,堆积的问题很多,团队正在推倒重来做下一代infra,目标是清理残留依赖、给research更好的iteration speed。


三、读PhD还是进工业界:现代学术界应被重构

新的变化

在AI时代,“读PhD再进AI lab"的传统路径正受到挑战。翁家翌作为硕士进OpenAI、却成为核心贡献者的人,给出一个与主流建议相反的判断——尽早进工业界比读PhD更好,因为PhD培养的能力与AI lab当下真正需要的能力之间存在错位。

嘉宾观点与解释

翁家翌:“如果你想进工业界,那么读PhD就是浪费生命。“这是他在接触工业界后形成的判断。理由是:你可以以Master为跳板,在本科或硕士时攒够材料、做出与众不同(如开源infra)的项目,让自己能与同期PhD同台竞技,让对方挑选Master的你而不是另一个PhD。差异化是关键。

为什么PhD在当下AI lab不再占优?他给出了深层逻辑:现在的AI lab拼的是infra的正确性和单位时间迭代次数。idea很便宜,有research直觉的人(在领域深耕多年的资深者)动脑比普通PhD动脑更有用,你找他们讨论就行;你要做的是在单位时间内验证多少有效idea、且是正确infra、正确结果、快速迭代。

而PhD的培养体系重点是"如何有好的学术方向、把故事讲圆、图画漂亮、实验报告做好”,这恰好不是公司当下的核心需求。“现在的时代,工程能力是第一位的。“学术RL还有一个被诟病的问题:对着toy benchmark(玩具基准)overfit,比谁在100k时分数高,而工业界完全不care这个——工业界用RL解决真实问题。翁家翌正是2022年8月意识到这一点后,逐步停止了天授的开发,把精力转向OpenAI的RL infra。

他甚至判断:“现代学术界应该要被重构。“但他也补充,这个判断有时间性——放在他入职的那个时间点还不好说,是后来才变得明显。


四、RLHF先在GPT-4上调通,再回到3.5

新的变化

外界往往以为RLHF(基于人类反馈的强化学习)是随着ChatGPT(GPT-3.5)同步成熟的。但翁家翌透露了一个反直觉的时序:RLHF其实先在GPT-4上调work,才回到3.5上成立。当时3.5用的是旧的那套infra,而新infra是2024年8月才ready,他先在新infra上用4跑通了第一版PPO(2022年9月)。也就是说,3.5发布时,更强的4早就内部存在了。

嘉宾观点与解释

翁家翌:他刚进OpenAI(2022年7月)时,还没有"post training"这个概念区分,当时只有John Schulman下面的RL team,在做WebGPT之后的版本(用3.5做Browsing,但效果不好,因为browsing需要Turbo级别模型)。于是退而求其次先把用户交互体验做好,用RLHF解决Chat/instruction following。

他还原了关键挑战:RLHF的难点在于"你不知道性能应该长什么样”——训练出一堆checkpoint,却不知道哪个真的更好。RLHF reward可能先上去再慢慢往下掉,单一指标会saturate成直线,无法判断。当时的解决办法很朴素:建一堆sampling-based的eval看每个batch size的情况,但batch size只是个数、过了某个数就好,方差很大、噪音很多。最终只能"真的拉起来看一看、交互几次,多找几个人来投票”——也就是说,eval RLHF还是用人类来做eval,因为当时的技术没有别的办法。

他强调,这是他第一次在工业级level上打RL infra。toy task的RL infra和大模型RL infra区别巨大:toy的bottleneck在环境(模型简单、采样训练便宜),大模型的bottleneck在模型本身(环境是prompt几微秒,但inference/training几百到几千秒)。这决定了大模型RL infra要同时懂RL、懂MLSys、懂两个模型怎么inference——“不在那个位置,学校的学生学不了这种东西。”


五、ChatGPT的爆红并非计划,而是"自来水"效应

新的变化

ChatGPT的爆款成功常被外界解读为某种深谋远虑的战略。但翁家翌还原的内部图景完全是另一回事:发布时只期待一两万用户、五天后可能就关了;团队当时也没意识到它是game changing;它真正的引爆是靠用户自发宣传(“自来水”),服务器被打包好几次。

嘉宾观点与解释

翁家翌:发布ChatGPT的初衷只是"看看能不能收集一些真实世界的用户数据”,收完可能五天就关,预期最初有一两万、然后跌回没了。结果是指数级增长。他本人第一次内测时只觉得"这是个会说话的模型,也就这样”,用几次能帮解决一点代码问题,但解决有限,没觉得突然。真正让他意识到引爆的是——他当时在开NeurIPS(ChatGPT 1月3日发布,12月),过几天后身边所有人都在讨论、觉得有用,并把OpenAI服务器打包好几次。“就跟tuixue一样,tuixue的服务器也被打包好几次。“这种自需求、自宣发的"自来水"效应,才是值得投入精力的信号。

值得补充的背景:ChatGPT发布时并非全公司all in,只有他们RL组在做。OpenAI blog的contributor名单里,John Schulman排第一,到赵胜佳为止就是他们组所有人。翁家翌直言,ChatGPT的成功"不是谁计划出来的,是半偶然半必然的化学反应”。

公司给他的初印象也并非想象中那么有方法论,而是"一个大号实验室”,有很多research直觉很强的人指明方向,然后做就好。真正的转变发生在Barrett、Luke、BM从谷歌过来加入张书满的RL team后——“引进谷歌的先进生产力来迭代”。他透露了一个核心方法论:单位时间的迭代次数与成功率成正比,迭代越多成功率线性往上走。这本身就是RL的本质(不断trial and error),也是一种哲学理念——先别想天才算法,把infra打好,从一周迭代30次提升到一周迭代300次。


六、Sam奥特曼为何是AI最难替代的人

新的变化

2023年11月Sam Altman被董事会开除又复职的事件,外界充满"伊利亚到底看到了什么"的玄幻解读。翁家翌给出内部视角:本质是不信任——伊利亚和其他董事会成员不信任Sam这个人(与官方调查报告一致),把底下干活的人吓了一跳,因为董事会对底层缺乏透明度。但结局却是伊利亚离开、Sam留下,且翁家翌认为Sam反而是AI最难替代的那个人。

嘉宾观点与解释

翁家翌:内部视角很直接——“不信任他这个人”,没什么玄幻的,外界的"伊利亚看到了什么"是捕风捉影的造谣。底下干活的人非常surprise、震惊,因为决策过程对底层不透明。

为什么最后是Sam留下、伊利亚走?很多员工觉得,如果由一个纯技术出身的人领导,可能没有那么多"原件”(远见)。AI的实现不只是技术,还掺杂大量商业因素——融资、算力、说服别人投钱。“如果你只有一个很好的研究经验,那可能还不是不支持你走这么长的路。长远来看还是需要Sam这样的人。”

由此他得出一个重要判断:Sam可能是AI最难替代的那个人。因为Sam可以被抽象成一个personality、一个identity,这个identity如果短时间内用AI替代,别人对这个identity的认同感就会缺失,所以不可替代。这背后是一个更深的组织命题——一个健康的组织里所有人都是可替代的(只要能持续培养新人、有造血能力,像干细胞一样),OpenAI现在没有谁是不可替代的。但Sam的身份认同属性构成了例外。

这也顺带回答了"OpenAI做的东西外面能否复刻"的问题——翁家翌说"你可以这么认为,把自己东西做好就好,没有什么黑魔法”。这与OpenAI神秘光环的外部认知形成对照。


七、组织臃肿的解药:无限context的agent当CEO

新的变化

随着OpenAI从翁家翌入职时的280人膨胀到3000多人(三年十倍),“小而美团队做硬核创新"的风格能否保持成为核心问题。翁家翌提出一个颇具未来感的解法:人类组织臃肿的根因是人脑context有限、无法同时存下所有context,而AI可以——未来每个公司可能有一个拥有无限context的agent来当CEO,负责所有的信息共享和决策。

嘉宾观点与解释

翁家翌:他赞同Sam Altman"人才密度极高的小团队不容忍平庸"的说法——人才密度高会自发涌现意想不到的东西;环境平庸则个人自扫门前雪、拖延。但他坦言OpenAI保持小而美风格的概率在下降(“没有下降那么厉害”),可以通过划分小团队专门做研究、简化组织架构、取消不合理会议来缓解,组织架构比其他都重要。

什么是利于硬核创新的组织架构?信息流通通畅——上面的决策能无损传达到下面,下面的进展能无损传到上面,否则决策者与执行者向两个方向使力。OpenAI靠一把手二把手的技术敏感性做到这一点:Sam有研究助理帮他了解内部最新研究进展,Greg"整个OpenAI几乎都是他参与过的”,他们愿意钻进细节了解每个毛细血管。翁家翌有个精妙的类比:“管公司跟管代码库很像,靠system。不一致的话就像一个拼砖的人身子动了脚没动,很奇怪。”

组织变大的真正代价不是人才密度下降,而是难以保持context sharing的一致性——这会导致infra不一致、infra臃肿、组织结构臃肿。人脑context有限是根因。所以他设想:理论上应该有一个拥有无限context的agent来替代人类做context sharing,“可能未来每个公司有一个这样无限context的agent来当CEO,负责所有的sharing和decision。可能没有比这样的agent更适合的decision maker了。”


八、开源、信息平权与impact:把代码当慈善

新的变化

在加入OpenAI之前,翁家翌就已经用开源和代码影响过无数人——在清华开源作业与资料打破信息差、开源强化学习框架天授、做免费签证查询系统tuixue。他把代码和工具视作一种"慈善”(non-profit),这与当下"开源为商业服务"的主流叙事形成鲜明对比,也构成了他个人评价体系的底层逻辑。

嘉宾观点与解释

翁家翌:清华时期他把所有收集到的上古作业和材料(除有版权的)全部在GitHub开源,理由是打破信息差——“信息差在清华生存很有用,但我觉得每个人都应该平等地拥有这个信息。“他甚至半开玩笑说,这比捐系楼有用:“你认不认识捐新系楼的人?不认识。你认不认识加一?应该认识,因为大家都看我的作业活。"(弹幕飘过"加一”)

这个逻辑延续到天授和tuixue。天授(强化学习框架)的诞生,源于他发现现有RL框架(如rlib/ray)几十万行代码、抽象太多、无法改,于是从零手撸,两周写出第一版,一个算法不到20行。它做对了的事是"抓住用户需求”——科研干活的人都需要好改、好用的RL框架。一致性是关键:一个项目从头到尾一个人包办就consistent,多人贡献会因为assumption无法及时传递而复制粘贴、膨胀、腐化。他后期把维护权转给社区,坦言五年后天授"有一点腐化”,因为继任者的context跟他不一样会重写代码,但长远可接受。

tuixue(签证查询系统)则源于他自己的需求——疫情/科委期间签证临时管一管,需要实时知道是否有slot。他写了爬虫免费给大家用,总点击量早已过千万。这两个项目都是纯non-profit,“做这种慈善项目让我感觉非常满足”。

支撑这一切的是他独特的内生评价体系。高三某天他脑子里蹦出一个idea(他半开玩笑说"可能是未来的我往过去的我发送信息”):人生的结算分数是"记得你名字的人的数量”。这意味着你需要被更多人认识、做对大家有益的事让更多人记得你。他明确区分这与fame(名望)不同——有些名望在别人看来收益是负面的,他要的是"对身边的人好、做有益的事"得到的发自内心的认同。

这正好解释了他为何能挣脱GPA、PhD等外部评价体系:他采纳了导师给的"非官方评价体系"——论文、比赛、GitHub三位数以上star。GPA他会"最低限度投入,够用就行",87分B+就很满足,多一分都不愿花。但他也强调,这个impact标准只对自己要求、不对别人要求,而且"你不是这个标准的奴隶"——如果发现被自己所困的标准推着走,可以改。“OpenAI的model某种程度上可以这么认为"是他当前impact的载体。


九、创业、迷茫与确定性世界观:投资未来与忘掉剧本

新的变化

访谈末尾,翁家翌展现出一个处于"迷茫期"的状态——曾经想通想要什么,现在又想不通了。这与他笃信的"确定性世界观"形成张力:他相信世界是一个确定性的马尔可夫过程,人没有自由意志,连下一句话说什么都是宇宙大爆炸那一刻定好的。在这种世界观下,“投资未来"看似悖论,但他仍坚持投资,因为"投资一下还是会更好的嘛”。

嘉宾观点与解释

翁家翌:关于创业,他说"可能有(种子),但现在还没看到很好的idea”,且觉得OpenAI还是个不错的地方待着。他更偏好product方向——像天授、tuixue那样有用户、能根据反馈持续迭代的东西,“技术什么样不重要,重要的是抓住需求”。即便tuixue第一版只是白天晚上各手动更新一次时间,也有很多需求。

关于未来想做的事,他希望"十年后的翁家翌做自己那个时候想做的事,有足够的资源、足够的能力做自己想做的事",并且不去干预那时候想什么——因为想法会变。除了技术上的投资,他现在的另一个"投资未来"是提前退休、攒够资本做自己想做的事。但他坦言目前手头的事(RL、infra、做impact的事)在很长一段时间都是他想做的,“只是随着时间推移、逐渐稳定或发生一些事情后,每个人的重心会变。我曾经想通想要什么,现在又想不通了”——处于人生的某个迷茫期,因为"已经看到头了,剩下都是很确定性的事情,AI是板上钉钉的事了"。

这与他的确定性世界观一脉相承。他从六七岁起就在想"你怎么知道我说的这句话不是早就确定性的"。他多次尝试证伪"世界是宿命论"却证伪不了,“我非常想让它证伪”。在这种世界观下,如果真有一个能预测未来的AI model,对个人是灾难、会导致所有价值体系崩塌,“对人类社会来说最好的选择可能是毁掉这样的AI model让它永远不要出来”——但有些人就是愿意去开发它。他找到的迄今合理自洽的解释是:时间线可能不是线性单向的,在四维里时间可以任意跳跃,“未来的我帮助过去的我完成某些决策"是一种可能性(无法证伪)。而他应对这一切的方式很朴素——“忘掉这一切,假装不知道,去体验当前的经历”,并笑称"幸福的傻瓜是幸福的”。


结语

这场访谈最大的价值,在于让外界第一次从一个"卖铲子最顶端的人"的视角看清了OpenAI这台机器真正运转的齿轮。翁家翌的叙事反复指向几个被低估的真相:

第一,大模型之争的胜负手是infra而非算法。每家infra都有bug,谁修得多谁就赢;OpenAI并不刻意刷榜,真正警觉的是DeepSeek的迭代速度;而OpenAI在这个生死线指标上"肯定不是第一",这是组织规模化的必然代价。

第二,AI lab当下最需要的不是PhD而是工程能力。idea很便宜,把infra打对、快速迭代才是稀缺能力;“教researcher做好engineering比教engineer做好research难得多”。这对年轻人的选择是直接信号。

第三,OpenAI的Open是对普通人的Open,闭源是博弈论下的生存选择。内部并非没有开源冲动,是被竞争现实压制;DeepSeek的OpenWeights确实触发了内部重新评估。

第四,Sam奥特曼是AI最难替代的人,不是因为他懂技术,而是因为他是一个被认同的identity——AI能替代决策,但替代不了身份认同。而组织臃肿的终极解法,可能是一个拥有无限context的agent来当CEO。

翁家翌自己或许最能代表这代AI核心建设者的状态:笃信确定性,却仍在投资未来;曾想通想要什么,如今又陷迷茫;把代码当慈善,却在闭源公司里搭最核心的infra。他用一句话作结——“这个问题值得一生去思考。”