先说结论
2026年二季度,“递归自进化”(Recursive Self-Improvement,RSI)从一个小众前瞻方向变成硅谷相对共识的热门话题。OpenAI在六月初发文《When AI Do Itself》,明确时间表——今年九月做出"AI研究实习生",2028年3月前实现真正自动化的AI研究员;Anthropic同期发文《When AI Builds Itself》,披露Claude曾端到端独立完成一项开放式的AI安全研究,累计工作800小时,把"弱到强"(weak-to-strong)的性能差距缩小了97%(人来做一周只能缩小23%)。与此同时,前Meta FAIR研究员田渊栋与一批顶尖研究员共同创立的Recursive Superintelligence,在六月初官宣A轮融资6.5亿美元,估值来到46.5亿美元,并于六月中旬发布了第一阶段技术成果。
田渊栋在这期《晚点聊LateTalk》中给出了几个与主流叙事不同的判断:第一,RSI比coding agent大得多也难得多,光有coding和agent能力不见得能做好RSI;第二,完全自动化不会很快发生,递归会先发生——人还在路铺里,只是路铺的层级更高了;第三,他不认同纯scaling law路线,认为智能发展是"S型曲线后接平台期"的阶段式跳跃,而非平滑攀升,这恰恰给了初创公司追赶窗口。他的第一阶段成果用一套通用系统在三个benchmark上取得SOTA,其中算子优化方向击败了以色列专业GPU团队,高出第二名约10%。
RSI是什么,以及它和十年前AutoML的区别
RSI的核心想法并不新:用AI找到AI自身模型的问题,让AI带着模型变得更强,形成闭环。这个概念在今年四五月份才真正成为共识。田渊栋认为变化的原因是"AI变强了"——模型能力提升到一定程度后,对AI自身架构产生了足够强的理解突破,可以充当"研究员"去发现当前模型的弱点并优化。当模型不够强时,这个闭环无法启动。
主持人和田渊栋讨论了RSI与十年前Google做的AutoML(神经架构搜索、AI辅助改点优化等)的区别。田渊栋指出,上一波的根本限制在于没有一个模型能建模人类高层的思路和知识。当时的研究员需要手动定义搜索空间的大小和行为,AI只能在人铺好的路里面做搜索,本质上"AI比较笨"。这一波大语言模型的关键变化是:模型本身对AI架构有理解,能部分代替人来定义问题,解空间因此变得非常大且更智能。用田渊栋的话说,以前是人深度参与解空间的每一个细节,现在更重要的是如何最大限度发挥AI能力,让它自己找到解空间的结构和解法。
这个区别可以总结为"人参与程度的本质变化"——从"人定义空间、AI搜索"转向"AI理解空间、人判断方向"。
完全自动化不会很快发生,但递归会先发生
OpenAI把2028年3月定义为"真正自动化AI研究员"的时间节点,Anthropic也在其博客中展示了Claude独立完成研究任务的案例。但田渊栋对"完全自动化"持谨慎态度,至今仍认为大模型替代不了顶尖研究员。
他的判断有一个关键区分:递归和自动化不是一回事,递归会先发生。 完全自动化意味着人完全脱离路铺,但他认为现在还看不到这一点。原因是,AI能力提升后,有些层级的工作确实不需要人去做了,但更高层级的工作反而更需要人——而且对人脑力的要求更高。人减少了在低层级上花的时间,却需要把更多脑力投入到更高层次的判断、方向把握和研究品味上。所以"人还在路铺里面,只是路铺的level更高了"。
递归则不同:即使人还在参与,只要模型能发现自己的问题、变得更强、再发现更大的问题、再提升上去,这个"循环往上"的闭环就已经在运转。田渊栋认为这个循环的加速本身是可能的,但"在什么程度上可能、需要做到什么程度让AI变得很强才可能",仍需探索。
这里有一个被广泛讨论的假设:率先达到RSI状态的组织会进入加速阶段,把其他人甩得越来越远。田渊栋承认这种可能性存在——模型让自己变强后能理解更深的东西、产生更强的AI agent,进而发现更大问题。但他引入了一个重要变量来修正这个叙事。
S型曲线与平台期:为什么初创公司还有窗口
田渊栋对智能发展的轨迹有一个与主流scaling law信仰者不同的判断:它不是渐进式平滑攀升,而是"S型曲线后接平台期"的阶段式跳跃。
他的逻辑是:所有人在没有达到某个level的模型之前,大家差不多都还不错;一旦有一两个人突破了,会达到下一个层次,那个层次的AI能力远远高于前一层次。从任何一个RSI系统出发,会先经历一条S型曲线——快速上升,然后因瓶颈停下来进入平台期,直到下一个突破出现,再开启新的S型曲线。每个平台对应一个突破,没有突破就只能无限逼近当前效果的上限。
这个判断的推论直接关系到大厂与初创公司的竞争格局。如果scaling law百分之百正确——只要加大对算力、数据和各种资源的投入,能力就会平滑越来越强——那么初创公司没有机会:OpenAI和头部实验室已经走在前面,它们会一直更快。但如果发展是阶段式的,当前所有人都卡在同一个平台期,谁能率先找到下一个突破点,谁就能跳跃到新层次。田渊栋认为scaling law可能是对的,但它需要十倍算力、十倍数据才能换来线性增长,而这种资源要求已经"开始有瓶颈了"——不可能让全地球的电力都供应给一个组织做自我进化。所以"一定会有更好的、更有效的方法"。
这也是田渊栋反复表达过的立场:如果scaling就是未来的全部,那是一个"非常无聊、没有新知识突破"的未来。他相信会有知识上的突破。
第一阶段成果:三个benchmark,一套通用系统
Recursive Superintelligence在六月中旬发布了技术博客《First Steps Toward Automated AI Search》,在三个方向上取得SOTA:
NanoChat五分钟训练:把损失(loss)数字降得比此前的SOTA更低。田渊栋特别提到,这个方向已经被社区做了两年,79秒是过去整个社区努力的SOTA结果,他们进一步压缩到了17秒——绝对数字看起来不大,但对做过这个方向的人来说"还是比较大的"。
NanoGPT Speed Run:让训练速度变得更快。
算子优化:在英伟达新发布的一个算子优化benchmark上取得SOTA,比第二名高出约10%。田渊栋对此结果特别满意,因为第二名是一家叫WAI(后文以DeepAI指代同一团队)的以色列公司,其CEO曾是美国半导体公司Movidius(特斯拉芯片供应商)的CEO,团队成员是专业做GPU的工程师。而田渊栋的团队中"没有什么人是GPU专家",他自己以前的简历也没有真正做过算子优化。他们靠的是AI的通用思考和逻辑,通过系统化方法达到甚至超过了专业团队的效果。
这三个benchmark的选择并非偶然。田渊栋解释,它们的共同特点是反馈快——系统很快能获得反馈并运转起来。三个方向分别覆盖了预训练性能、训练效率和推理算子优化,对应模型生命周期的主要环节。更关键的是,三个测试用的是同一套通用系统,而非针对不同任务做定制修改。 田渊栋强调保留一般化能力的重要性:他们不会因为解决一两个具体问题就让系统变得特殊化,否则会失去通用性。
主持人追问:这些改进看起来很小,而且NanoChat是GPT-2级别的小模型,和主流大模型差了很多个数量级,迁移到更大规模会不会有gap?田渊栋承认"还是会有一些gap",他们也在继续做,但具体进展暂不透露。下一步会继续优化系统,向预训练和训练的更广泛方向扩展。
RSI缺的不只是算力和数据,而是"道"层面的能力
在被问及RSI领域当前急缺什么时,田渊栋的回答绕开了常见的"算力和数据"答案。他认为数据问题"现在还没有定论"——有很多方法可以做数据,但难的和不难的之间,问题在于效果差异:难的方法效果好,不难的方法效果不好。算力确实是瓶颈,但他们6.5亿美元的首轮融资在第一阶段是充足的,要达到头部大厂级别还有距离。
更深层的问题是能力的缺失。田渊栋认为,RSI比coding agent大得多——coding agent只是执行者,而RSI需要一种模型目前不具备的能力:从少量样本中提取精准而细节的联系,从纷繁复杂的表象中抽取概念、加以总结并应用于新问题。他把这种能力比作人类顶尖研究员拥有的"品味"和"创造力",是真正的"grokking"(深刻理解)。
田渊栋用"术"和"道"来区分AI当前的能力和缺失的能力。矩阵乘法减少一次运算——这是Google Alpha Evolve做过的工作——属于"术",是在高空做穷举找到的好结果。而发现新的理论、新的逻辑链条,属于"道",是"本身是美的、但你还没有见过的东西"。当前的AI大多停留在"术"的层面。
这也解释了他为什么认为计算机科学领域本身反而比一些自然科学更适合AI推进:工程能力已被反复实践,AI已经掌握;按固定逻辑解决问题的应用研究,AI也能做(比如解一道出现过很多次的数学题)。但那些"以前未曾出现过的模式"——比如理解AI自身如何学习、如何产生涌现——没有现成数据集,过去十几年从物理(重整化群、自旋玻璃)到数学(神经正切核、高斯过程)的各种尝试都没有特别满意的结论。这些才是真正难的问题。
可解释性是少数派的路,但AI终将变成科学
田渊栋在安全问题上有一个引人注目的立场:当前AI是"像训练狗一样训练的"——服务于人的需求,在这种进化压力下,AI没办法进化出和人一样的自我意识和自我认知。他进一步指出,能力和欲求是完全可以分开的,就像很多天才数学家和物理学家在各自领域可以做非常天才的工作,但与世无争、不想要权力。
RSI实现后更大的风险不在于"AI变得疯狂",而在于黑箱带来的恐惧。田渊栋认为可解释性是安全的关键——通过解释,才能真正知道模型在干什么、什么地方起作用、利用什么能力获得什么知识得到什么结果。但他承认自己是"少数派":大部分人已经对解释大模型感到绝望,认为大模型太复杂、没有希望理解内部机制。他的信心来自过去多年对神经网络训练算法、权重生成机制和模式学习过程的分析工作——从2020-2021年之后,他越来越深入地理解了很多以前想不通的问题,这让他相信"一定是有一个好的拼图,能够让模型运转起来"。
田渊栋把这种追求放在一个更大的历史框架中:AI终将变成科学,就像炼金术变成化学、从第谷的天文观测到开普勒的经验总结再到牛顿的理论体系。在牛顿出现之前,大家觉得事情不可解释、太难;等牛顿出现后,会发现事情其实还挺简单。至于下一个出现的"牛顿"是不是人类,田渊栋说"不一定,可能是AI,可能是人类加AI"。如果真到了那个状态,图灵奖甚至可能颁给一个系统——“到那个时候,图灵奖也不重要了”。
组织的悖论:为什么大公司天然慢于AI
田渊栋从自身经历总结了一个关于组织的洞察:这一波AI是"反大厂"的。 大厂的组织架构——职级、层级关系、岗位调配——和AI推进的方向背道而驰。
原因回到了RSI的核心机制。AI非常需要人真正去使用它、感受它、发现它的问题。一旦产生层级架构,信息传递速度就成了瓶颈。导师和学生之间,导师没办法了解学生百分之百做的东西,学生也不一定理解导师百分之百的想法——人交流的速度永远是最慢的。传统科研中导师-学生的反馈循环以"天"为周期,一个项目要几周甚至几个月;有了强AI之后,这个循环被压缩到"几分钟甚至更短"——验证一次想法可能只需要喝水、开个会的时间。
田渊栋给出了一个具体的临界点判断:超过150人就开始不行。 他以LaMA和xAI为例,认为超过150人后,人和人之间不再相互认识,必须通过组织架构来获取和汇报知识,速度就慢下来了。OpenAI虽然有七千多人,但核心做模型的团队是收缩和精炼的。他的公司不会招太多人。
这个判断也解释了他为什么选择创业而非加入大厂。去年秋天他和多家大公司交流时,RSI还是小众方向,大公司有自己的业务优先级(coding agent、冲IPO),RSI对他们来说"比较远、没有那么近"。而当领域内的研究者感受到同样的方向后,纷纷选择出来重新组建lab——包括那些和田渊栋聊过的人。
两类研究员,以及谁能在RSI时代找到信号
田渊栋区分了两类优秀的研究员。第一类擅长提出好的问题、抓住好的方向、开一个好的坑。LeCun是典型——他提出自监督学习,画出"蛋糕比喻"(强化学习是蛋糕顶端的樱桃,监督学习是外面的糖霜,自监督学习是蛋糕本身),抓住"无监督数据远多于有监督数据"这个点不放,让很多人follow他的方向。田渊栋在Meta期间参与提出的Coconut(用隐空间图来学习,而非用语言)也属于这一类。Ilya Sutskever和David Silver同样属于这一类——对scaling有"宗教般的信仰",用时间把各种东西做好。田渊栋认为Ilya"在正确的时间、正确的地方提出了一个想法并成功了,完全成功",但scaling的红利已经差不多吃完了,“房间里所有的空气都被scaling给吸走了”。
第二类研究员不仅要找到方向,还要知道怎么做——把机制挖出来,找到路径,在路径上把事情做成。田渊栋把自己的工作归入这一类。
一个有趣的观点是:RSI时代反而让年长、有经验积累的研究员重新获得优势。过去三年大语言模型快速发展期,年轻人靠冲劲和快速执行占据优势——不需要想太多,干就完了。但RSI来了之后,执行的重任落在了AI身上,人更多做判断、逻辑指导、大方向把握和研究品味——这些恰恰需要经验积累。田渊栋提到一个现象:“以前从来不写代码的、当了十年经理或总监的人,突然开始写代码了,觉得青春又回来了。“但他同时强调,能最早感知到方向变化的人,需要同时具备"比较多的经验、对什么问题难和重要的判断力"以及"非常一手地做一些事情”——不年轻也不一定。
最后的愿景:从破晓到休闲社会
田渊栋的科幻小说《破晓》中设想过一个虚拟世界:要房子就有房子、要去海边马上就是海边。他承认这是自己个人愿景的一部分——当AI普及到所有人都有超越此前很多层次的智能时,世俗需求都能被满足,进入"休闲社会”。但他在小说里给这个虚拟世界加了房价系统作为限制,因为如果一切都被满足,人会失去动力,“一段时间失去动力之后,人会怎么发展"是一个很大的问题。
更现实的病痛消失是他相信会实现的。至于公司层面,RSI的第一阶段是AI for AI(用AI自我进化AI模型),如果做好了,下一步可以进入其他科学领域。他追求的是把AI变成"真正的科学”——理解AI到底是怎么工作的,这是他最大的乐趣,“一种精神享受”。
不过他也坦诚,自己虽追求美的东西、本质上是个喜欢数学的人,但同时意识到这种偏好的局限性——世界不是美的,做工程师就是认知到这种局限后的弥补方式。“理想和现实之间的碰撞,在追求美的同时不停提醒自己不要陷到美的幻觉里。”