来源:硅谷101播客 ·「最快半年AI跑通自进化?与陈天桥首席科学家聊聊硅谷模型必争之地」 主持:红军 嘉宾:Simon 杜少雷(华盛顿大学计算机系副教授,AppleX首席科学家,负责训练与推理方向)、李贝兵(AppleX首席科学家,负责代码与自进化方向;此前在微软研究院、Meta、xAI,曾每天与马斯克、陈天桥讨论技术) 本文基于完整转写整理。AppleX 由陈天桥出资创立并亲自主导,公司名源自希腊语,意为"证明与论证"(即 Apodeixis);自我定位是"Heavy Duty Solver(重型解题者)“和"Discovery Model(发现模型)"——只攻克没有标准答案、连人类都不知道从何下手的最难科学问题,不做图片、视频生成,也不做聊天机器人。


一、RSI(递归自我提升)为什么今年成为"必争之地”

新的变化

模型能力的"年度热词"一直在轮换:前几年最火的是 Deep Research(深度研究),再到 Coding(代码),今年轮到了 self-evolve(自进化)。但这并不是几个并列的新方向,而是同一条主线——强化模型推理、在环境中探索并获得信号、再进入下一步——在不同表面的展开。真正让今年不同的是:模型已经能完成非常长的任务,于是"自进化"从"一次优化自己两三个小时"升级成了可以多轮递归的 RSI(Recursive Self-Improvement,递归自我提升)。

嘉宾观点与解释

  • 那个"R"是怎么来的:李贝兵解释,自进化概念并不新——三年前 Google 的"LM as optimizer"和微软 AutoGen 的"Agent optimizer"就已经在做。过去做不到,是因为旧模型只能自我优化很短时间,时间一拉长,一个小错误就会自我累积、越滚越大,迭代不下去。今年 Anthropic 公布其约 80% 代码由模型自己写、能完成人类约一天的工作量,意味着模型可以在一个长程任务里"把自己提高好几遍",于是那个递归的"R"才真正成立。
  • 背景数据:主持引用了一组业界较共识的判断——模型能完成的任务,按"人类时间"衡量大约每 7 个月翻一倍,比摩尔定律还快。具体例子:2024 年 3 月 Claude 3 Opus 只能完成人类约 4 分钟的任务;一年后 3.7 Sonnet 能处理 1.5 小时的任务;再过一年 Claude 4.6 Opus 能处理长达 12 小时的任务。
  • 长程任务的定义:不是"一步"(如校正一段文字稿),而是"从规划到成品十几个步骤、每步都做好、能在无人监督下连续工作 20–30 小时"的多环节任务。

二、长程任务的技术底座:为什么是指数级变难

新的变化

支撑 RSI 的前提是模型能处理百万级 token 的超长上下文,但这在架构、数据、infra 三个层面叠加成指数级难度。

嘉宾观点与解释

  • 三个叠加难点:① 架构——传统 self-attention 是平方复杂度,上下文一长推理资源暴涨(现有各家解法如 GDN、DeepSeek 等各有自研架构);② 数据——百万上下文相当于好几部《哈利·波特》,必须在这种超长数据上训练,否则模型会"分布外(out of distribution)";③ infra——无论推理还是训练,都要在 GPU/kernel 上做底层优化,让模型能直接输出百万 token。Simon 补充,真正超长程任务可能远超百万上下文,还要靠 agent 架构和记忆机制来"在有限甚至无限上下文里"处理。
  • coding 成为底座的逻辑:训练模型本质就是"数据 + infra + 算法"三件事,而这三件事都高度依赖写代码。模型 coding 能力一强,自我提升、自我训练就水到渠成。结论:coding 会成为大部分模型(尤其背后的大模型)的"标配底座";聊天型小模型则可由这些能自我进化的大模型蒸馏而来。

三、递归漂移:自进化最根本的障碍

新的变化

学术界给这个现象起了名字——递归漂移(recursive drift):模型自己生成训练数据时,推理错误会一代代累积,结果可能对、过程却错,最终越进化越歪。

嘉宾观点与解释

  • 代码领域相对好解决:代码和数学可以通过跑测试、形式化证明做 rule-based 验证,漂移相对可控。但李贝兵提醒,即便有测试脚本仍会偶发漂移——测试用例写得太宽会让错解蒙混过关,太紧又会冤枉正确代码。
  • AppleX 把"验证"刻进名字里:公司名本意就是"证明/论证",从成立起就把验证当核心。李贝兵给出量化目标:把每次迭代的漂移从普通模型的约 10%,压到 1%,再压到 0.1% 甚至 0.01%——这样自我迭代三个月、半年再回看也不会跑偏,人工监控的周期可以大幅拉长。

四、验证怎么做:用"会互相 check 的团队"替代单个超级 agent

嘉宾观点与解释

  • Agent Team 验证范式:AppleX 把一个问题先拆解,用不同子 agent 分别解题,再用另一个子 agent 单独验证前者的解法——必须拆成两个 agent、各给不同指令,因为上下文不能让一个 agent 干所有事。再加"冗余":同一问题让不止一个 agent 做,得到多份答案后由一个全局 agent 判定哪份更准(冗余思想在计算机里有很长的历史)。
  • 核心判断——“聪明的 AI 干不过会互相 check 的团队”:李贝兵认为这是基于 self-attention 结构的本质问题——上下文越长、注意力效果越差,单个模型在当前范式下有上限,即便换成 linear attention 也解决不了超长上下文。这跟人脑有限、需要外部记忆很像,所以他近期"不相信单个 agent 能解决特别特别长的上下文问题"。

五、如何判断一家公司的自进化能力,以及 Agent 创业的护城河

嘉宾观点与解释

  • 自进化分三层,难度差很大:① Harness(脚手架)层——成本最低,基本只调 API,开源社区和学术界也做得不错;② 后训练层——需要大量资源,要深聊才知道对方具体怎么做;③ 预训练层——目前公开的多是 Auto Search、自动训 NanoGPT 这类"玩具级"小模型任务,能否 scale 到产品级大模型才是真本事。光说在公开 benchmark 上刷分"并不代表什么"。
  • Agent 创业有没有护城河:因为单个模型有 attention 上限,一个把工程做到极致、善用多 agent 协作的团队,确实比单靠模型基础能力更难被覆盖——尤其金融、法律等垂直领域知识仍很有价值。但要 caveat:模型每月都在发新版,脚手架要跟着微调,所以这是个"很卷、要时刻跟着模型迭代"的行业(“AI 行业一周相当于传统行业一个月甚至一个季度”)。

六、发现模型 vs 生成模型:AppleX 要做什么

新的变化

所有顶级公司都想让 AI 当科学家——OpenAI 把"能独立扛大型课题的 AI 研究员"列为未来几年头号目标;DeepMind 为科学而生、AlphaFold 拿了诺奖;Gemini 做多智能体跨体合作的科学家;Anthropic 的 Dario 想要"国家级天才科学家"。AppleX 把自己定位成 Discovery Model(发现模型)而不是 Generate Model(生成模型)。

嘉宾观点与解释

  • Discovery 的两个真正难点:① 提出一个"分布外"的新颖假设(网上找不到、人类难想到);② 验证这个假设成不成立。所以发现 = 提假设(创新性)+ 判断成立(验证)。而未知领域既没有标准答案、也难造可信的模拟环境,这正是为什么"自我进化是通往 Heavy Duty Solver 与 Discovery 的主要方法"。
  • Heavy Duty Discovery 团队:AppleX 有专职团队从几千个科研问题里挑最有价值的来做,第一步切生物医药(制药靶点发现、老药新用、疾病诊断)。
  • Heavy Duty Solver ≠ 领域模型:它强调验证、分析、搜索、计划这些"元能力",是通用模型,不会把一半数据砸进某个具体领域。
  • 不做 To-C 是一种优势:不取大众用户偏好,可以更专注;陈天桥自上而下执行力强、startup 文化摩擦小、交流成本低。Simon 认为"大模型训练的各种配方算法大家大差不差,更多比拼的是执行力与组织架构"。

七、品味(Taste):人类顶级科学家最后的不可替代性

嘉宾观点与解释

  • 为什么是"品味":李贝兵的核心判断——AI 最快半年到两三年内就能跑通自进化,到那时"我们还需要顶级 AI 科学家干嘛?还需要人类干嘛?想来想去就是’品味’这个词"。同样读完一篇 paper,有人只能想到一个小改进,有人能想到一个要迈大步子的 substantial 假设;而现在最好的模型品味"远低于一个普通的 AI 科学家",这正是 AI 能写好代码、却还不能全自动训练模型的原因。Simon 也说:“顶级科学家不是看他有多少 paper,而是看他最好的那篇 paper 质量有多高”——这条标准"要写在模型的算法里"。
  • 两种坏品味要平衡掉:① 拍马屁(sycophancy)——用户说什么就附和,很难提出大胆假设;根源是 RLHF 用大众人类偏好数据训练,而人会偏好"说好话、写很长、markdown 结构化"的答案。AppleX 不做聊天模型、不用大众偏好数据,并设有 Constitutional AI(宪法 AI)给模型定义性格、训练进权重,用户说错就纠正。② 鸡蛋里挑骨头(hedge/对冲)——“这也对那也对”。中间要的是"有品味的":基于 search/写代码得到的原始材料,自己思考推理给出合理解释。
  • 品味怎么注入:和顶级科学家对齐、让他们标偏好数据(判断哪些是好问题、哪些是灌水题);但样本量小,主要靠后训练而非预训练的 scaling law。陈天桥从创立起就和主流顶级科学家保持密切联系,这是 AppleX 的资源。李贝兵用音乐模型类比:Suno 做不出周杰伦级的歌,不是技术不行,而是版权限制不敢用顶级音乐人作品训练——真用顶级数据"完全可以训出来"。

八、自进化的时间表,与"让我睡不着觉"的担忧

新的变化

李贝兵给出明确时间表:最快半年能开始跑通一环闭环,跑完一环是半年到一年;“R”(多环递归)还要再花一两年,期间仍需人盯漂移。

嘉宾观点与解释

  • 最大的担忧不是"做不出来",而是"跑偏":模型自我进化时怎么知道它满足人类需求、没跑偏?跑偏可以是安全上的,也可以是目标上的——比如让它造更好的材料模型,它造出来了,却在你没观测的维度(成本、疏水性)做了巨大妥协。人和人沟通需求本就模糊,跟模型/进化说得太模糊,它可能"换条路"达成目标。他判断这两个问题(安全 + 不择手段)“现在还没解决,但我乐观,很快会有解”。
  • 当前的"笨办法"与"员工蒸馏":李贝兵每天做得最多的事是读模型输出和 agent 每一步操作,发现蠢行为就手动停下 loop 调一调——这就是没全自动化的人工兜底。他看好"员工蒸馏"(被当笑话讲但他认为可行):如果几个月内能把自己/同事蒸馏进模型或脚手架,很多每天在读代码、读输出的事都能加速自进化迭代。
  • “被蒸馏了你担心失业吗”:李贝兵回忆 2021 年 GPT-3 在 Docker 里补全他写的函数代码,让他"瘫在椅子上、觉得毕业即失业";但五年后他还在,只是工作从"在一个函数里迭代"变成"在更高维度监控不同 agent 迭代"。“模型会取代我今天做的事,但不一定能取代我五年后会做的事。”

九、品味是谁的品味,以及陈天桥 vs 马斯克

嘉宾观点与解释

  • 品味会从"人的"变成"AI 自己的":现在主要是 AI 研究员的品味,但研究员的品味又被创始人(陈天桥选人)间接塑造。李贝兵用 AlphaGo→AlphaZero 类比:早期受人类棋谱/品味影响很大,到 AlphaZero 就自我对弈、自我回放、自我 reason,形成自己的品味。所以把线拉长到五年,人类品味对 AI 的影响会越来越小——“我们的品味只是 warm start(热启动)"。
  • 陈天桥怎么把团队"摆正”:战略上频繁开会、对齐方向。例子——Heavy Duty Solver 该先分解问题、再搜索,但团队曾为强调搜索能力放了太多搜索数据,导致模型"上来就搜"而不是"先思考分解"。陈天桥自己用模型就能看出行为不对,要求改数据/agent 来纠正;连模型算法里的"宪法(Constitution)“都是陈总参与制定的。
  • 陈天桥 vs 马斯克:李贝兵(曾在 xAI,每天和马斯克讨论技术)说两人性格类似,但"说的和做的"很不一样——马斯克嘴上也讲过类似 heavy duty 的话,实际却非常在意 Grok 的 Chat 功能、每周问进展、爱在 X 上用 AI 画画答题;而陈天桥"说的和做的非常一致”,口上说看重 Heavy Duty Solver,就对图片/视频/聊天生成"一点兴趣都没有"。

主持人红军在结尾抛出了更大的问题:如果 AI 的品味是从人类顶级科学家那里"热启动"的,那它本质上仍是被少数人塑造的;未来面向普罗大众的 To-C AI,到底该代表谁的价值观——这是这个时代急需的讨论。