来源:机器之心 × 广大联查苏 联合主办 ·「Recursive Self-Improvement:当AI开始进化AI」主题线上沙龙 支持:元番奖 分享嘉宾(按出场顺序):

  • 张尚杭,北京大学计算机学院研究员
  • 温颖,上海交通大学人工智能学院长聘教轨副教授
  • 王立元(王立源),清华大学心理与认知科学系助理教授
  • 诸葛明成,Recursive创始成员,导师为Eugene Hubener(即Schmidhuber的中文译名相关)

本文基于完整音频转写文本撰写,未做删减式处理。每个主题包含"新的变化"和"嘉宾观点与解释"两个维度,力求让未观看视频的读者快速理解核心逻辑。


一、具身智能的物理世界GPT时刻:从离身到具身的跨维度挑战

新的变化

数字世界已经实现了大语言模型的"GPT时刻",但物理世界的具身智能GPT时刻仍面临巨大挑战。宇树机器人展现出极强的运动能力(复杂武术动作等),但真正执行"大炒饭"等日常操作时却频频"翻车"。这揭示了一个核心矛盾:AI可以打败人类围棋和国际象棋冠军,却无法完成简单的日常操作。

北京大学张尚杭团队提出了一条从一体化到自进化的技术路线:将大脑(慢系统:深思熟虑、全局规划、空间理解)、小脑(快系统:快速响应、精准执行、运动控制)和世界模型融合为统一基座模型,并在物理世界中实现持续进化。

嘉宾观点与解释

四大跨维度挑战:张尚杭指出,从离身智能(如GPT)到具身智能面临四个维度的跨越——任务从开环走向闭环、赋能基础更加多样化、标准化更加困难、安全容错性更加严格。已有的具身大模型面临"不好用、不用、不易用、不通用"四大难题。

RoboPilot 2.5的两项关键创新:

  • 3D空间推理:支持绝对数值的3D轨迹预测。例如可按字母C形状规划轨迹,距离每朵花保持1-5厘米高度进行浇花动作——这是现有2D模型无法做到的。
  • 稠密奖励预测:类似于人类多巴胺系统,对准确行为给予高奖励、不准确行为给予低奖励,使未来小脑强化学习只需少量数据即可高效学习。一条演示数据+30分钟探索即可将成功率提升至95%以上。

训练数据规模:超过3400小时任务视频、100K+训练轨迹、200+任务覆盖。模型在摩尔线程国产算力上训练达到了Nvidia算力的性能,这是一个重要的自主可控信号。

对π公司0.7架构的批评:π公司(Physical Intelligence)提出的VLA+VLM+世界模型三体外挂式设计,张尚杭认为存在根本缺陷——它将高维复杂物理预测强制压缩到2D像素图片,不仅成为信息传递瓶颈,还丢失了世界模型的动态信息。团队主张设计一个融合大脑、小脑、世界模型能力的统一基座模型(LAST-0架构,基于MoE实现推理专家和动作专家),在RLBench上某些情况达到95%以上成功率。


二、五维世界模型:从"知易行难"到"知行合一"的范式转变

新的变化

已有VLA模型的设计思路是"from cognition to action"(从认知到行动),即从大语言模型的认知能力出发,试图映射到物理动作。张尚杭团队认为这一思路可能存在根本性的方向性错误,提出了颠覆性的设计:from action to cognition(从行动到认知)。

嘉宾观点与解释

为什么现有思路错了:张尚杭从儿童认知发展的角度论证——孩子学习世界的方式是先触碰、操作、探索物体,然后才学会如何玩玩具。这是"行动先行、认知后生"的过程,而现有VLA模型正好相反。

五维世界模型的设计:

  • 第1-3维:空间(3D空间理解)
  • 第4维:时间(动态变化)
  • 第5维:因果可能性(不同action导致不同结果,如同平行宇宙)

这一模型有两种运行模式:作为World Agent(根据输入action解码生成一系列未来3D状态),或作为World Policy(根据任务先想象未来状态,再输出达到该状态的action序列)。一个模型、两种模式,本质上是统一的。

自监督记忆系统:为实现多因果预测,团队设计了长程记忆维护机制,实现95%的memory recall准确率和6.5倍压缩率。模型可学习物理规律(如胶带摩擦力大、滑落慢,笔摩擦力小、滑落快),理解因果交互(开灯变亮、关灯变暗),甚至理解柔性物体变形和流体操作。

核心洞察:五维世界模型可以生成"并行虚拟世界",替代传统数字孪生来扩大探索空间。这是国内外第一个原生的5D基础模型设计,具备自监督4D记忆系统、物理动态/静态表征、以及双向自进化环路。


三、自博弈的局限:从AlphaGo到大语言环境的自我改进

新的变化

温颖(上海交通大学)从多智能体强化学习视角,系统分析了自进化(self-play/self-improvement)在不同时代的技术特征与瓶颈,指出当前大模型自进化的核心瓶颈已经从"生成方案"转移到了"验证"问题。

嘉宾观点与解释

AlphaGo自博弈成功的两个前提条件:

  1. 传递性指标(transitive metric):存在一个单调可衡量的性能指标,指标提升即代表真实能力提升。
  2. 增量算子(increment operator):存在局部提升手段(梯度下降、强化学习算法、进化算法等),每轮迭代都能比上一轮更强。

非传递性困境(non-transitive/secular problem):在大多数现实零和博弈中,存在"石头剪刀布"式的循环克制关系——你学会一个策略,永远存在一个克制它的策略。这意味着局部的自博弈胜利不能保证全局能力提升。从青铜到黄金容易打,但钻石段位充满多样策略,存在大量相互克制,直到更高段位策略收敛后才好转。

AlphaStar(星际争霸AI)通过**种群级目标(population-level objective)**解决此问题:不追求打败单一对手,而是扩大种群多样性、覆盖更多策略空间,将非传递性目标转化为传递性目标。

大模型时代自进化的本质变化:

  • 核心步骤仍为:选择问题 → 生成候选 → 评估 → 保留/改写(memory/skill/参数/框架)→ 验证迁移
  • 与NAS、AutoML、Meta-Learning等历史研究的区别:大模型生成能力强、通用性高,可以一次完成方案生成+代码编写+测试验证
  • 当前核心卡点变为"验证":当任务验证信号清晰时(coding、math、reasoning),自进化闭环可以跑通;当验证不清晰时(如开放式创意任务),闭环容易断裂

温颖的核心观点:自我提升的智能不仅要会解题,还要能发现和提出有意义的、新的问题或目标。局部benchmark的提升不等于全局通用能力的提升——这可能存在类似零和博弈中的cycle问题,局部优化反而可能陷入局部最优。


四、大语言环境下的强化学习:比想象中复杂得多的新范式

新的变化

传统强化学习假设状态、动作、奖励都是定义清晰的固定结构。但在大语言环境下,这些假设全部失效,温颖认为需要重新设计强化学习算法体系。

嘉宾观点与解释

大语言环境的四个层面复杂性:

  1. 表示层面:观测和动作空间是超级大的语言/token空间,存在极强歧义性——相同状态可能有多种表示方式。
  2. 交互层面:大模型智能体不直接接触外部原始环境,而是经过内部思考规划后才行动,反馈也可能不仅是标量奖励,还包括执行日志等丰富信息。
  3. 学习层面:同一个大模型同时扮演policy、world model和value estimator三个角色,不能简单用PPO/GAPP0解决。
  4. 更新层面:每轮强化学习更新到哪里?参数?上下文?memory?skill?还是hardness框架?这是一个全新的设计空间。

Big World假说:Sutton提出的Big World Hypothesis同样适用于大语言环境——对于有限容量的机器来说,外部世界是无限大的状态空间,永远无法精确感知全局状态、估计最优策略或完整建模外部世界。

温颖的展望:真正实现大模型通用递归自我改进,需要让智能体学会自主构建学习接口、自动化发现有意义的学习环境和目标,同时保证整体通用能力单调提升。他还提出了一个counter观点:也许中期确实存在大量cycle问题,但只要持续scaling环境和算力,越过中部区域到达上部,也能持续提升——但这尚未得到充分验证。


五、灾难性遗忘:制约AI持续学习的根本障碍

新的变化

王立元(清华大学心理与认知科学系)从脑科学角度切入,系统阐述了当前AI"一次性学习"模式与生物"持续学习"模式的本质差异,并提出了解决灾难性遗忘的类脑方案。

嘉宾观点与解释

词典与婴儿的区别:当前AI像一本词典——可以把世界上最高质量语料浓缩在一本书里,但词典本身没有智能,需要人类去查询使用。婴儿刚出生时什么都不懂,但他会在持续发展中不断感知世界、积累知识、形成人格、发明创造。智能的本质不在于已知信息的多少,而在于持续学习适应的能力。

灾难性遗忘的机制:神经网络学习第一个任务时,参数收敛到第一个任务的最优解区域;学习第二个任务时,参数迁移到第二个任务的最优解区域,此时对第一个任务的性能可能从80%暴跌到10%。仅学一个增量任务,旧任务性能就断崖式下降。

三大流派均源于脑科学启发:

  1. 权重正则化:借鉴生物突触可塑性保护机制,有选择地保护执行旧任务的重要权重,让其更新更慢。
  2. 动态结构:借鉴大脑模块化构造,为每个任务分配专属子网络,避免参数空间冲突。
  3. 记忆回放:借鉴睡眠中做梦的神经机制——大脑在睡眠中重放当日经历的过去事件,对记忆巩固至关重要。

数字果蝇的启示:基于果蝇全脑连接组计划(2024年12月以9篇Nature连续发表),使用静态固定网络权重就能控制果蝇身体完成各种粗细粒度操作。这暗示了生物大脑的网络架构和连接权重中可能蕴含着实现通用智能的关键——而不需要持续的参数更新。

果蝇学习系统启发的核心创新:王立元团队借鉴果蝇多模块并行网络架构,引入可调节的主动遗忘率——生物不是"学多少忘多少"的被动遗忘,而是可以主动遗忘冗余信息、腾出空间给新任务学习。这颠覆了"遗忘是缺陷"的传统认知。在小模型时代的视觉监督和强化决策任务上,该方法相比主流持续学习方法有显著性能提升。

向大模型基座的延伸:团队将感觉信息处理(结构化低维表征 → 随机稀疏升维 → 时空多样性模块化分化)整套机制嫁接到预训练大模型基座之上,使大模型能够进行非常通用的持续学习——所有信息one pass处理,信息高度动态不确定。


六、结构化空间记忆:让具身智能体拥有"鸟瞰认知"

新的变化

大模型智能体在真实物理环境中暴露出严重的记忆缺陷——不是灾难性遗忘,而是瞬时遗忘(totally forgetting):信息处理完即被完全丢弃,无法保留过去经验支撑未来推理。王立元团队提出了基于脑科学的三层结构化空间记忆方案。

嘉宾观点与解释

人类大脑的三种空间记忆(认知科学经典理论):

  1. 地标知识(Landmark):环境中显著的显眼物体——空间中的"点"
  2. 路径知识(Route Knowledge):沿特定路径探索时收集的第一人称视角信息——空间中的"线"
  3. 鸟瞰知识(Survey Knowledge):点线成面后形成的第三人称视角全局认知地图——空间中的"面/体"

技术实现:

  • 地标知识:开放世界检测器检测显著物体,存位置和属性
  • 路径知识:逐帧输入视频到视觉foundation model提取特征
  • 鸟瞰知识:学习2D到3D的映射,生成旁观式地图
  • 最优能最小化原则:根据环境熟悉程度决定是否需要探索——匹配上已有记忆则熟悉不需要探索,匹配不上则主动探索新环境

断崖式领先的场景:当目标是明确物体(如"找到sofa")时,各种方法差异不大。但当目标"说不清道明"(需要文本推理理解)时,或者多个目标连成一段话需要探索多个房间时,只有结构化空间记忆方法能完成任务——没有好记忆的智能体"刚出第一个房间就不知道自己是谁、在哪、要干什么"。

实际部署演示:团队将系统部署到轮式+夹爪的具身本体上,在真实办公室环境中测试。只需一句话指令(如"帮我看看卧室门开没开"“把饼干从这儿移到厨房"“帮我冲麦片”),智能体即可完全自主完成导航+操作+再导航+再操作的多步骤任务。


七、AI自进化的记忆架构:Working Memory + Long-term Memory的闭环

新的变化

持续学习领域国际研究者在Dagstuhl会议闭门讨论后,提出了Memory as a Key to Long-Term Agents框架(被ICML接收为Spotlight论文),为大模型智能体的自进化提供了系统性记忆架构蓝图。

嘉宾观点与解释

三层记忆架构:

  1. 核心模型(Core Model):常规大模型智能体,与环境实时交互,持续感知信息、捕捉patterns和context、执行skill、进行推理。

  2. 工作记忆(Working Memory):短期记忆模块,结合当前指令和context运作。从环境捕捉短期感知输入,从核心模型获取处理后的输入,同时从长期记忆中提取与当前任务相关的经验,辅助核心模型进行推理和执行。

  3. 长期记忆(Long-term Memory):高度压缩、高度浓缩的环境信息沉淀。持续写入的同时进行自我优化和主动遗忘——抹除冗余不必要信息。一方面为工作记忆提供具体支持,另一方面通过技能蒸馏将优秀技能赋予核心模型。

关键设计原则:整个系统是模块化的、双向闭环式的——从实时处理到短期工作记忆再到长期记忆,模块之间双向交互,与外部环境也形成闭环。脑启发的模块化构造、主动遗忘、结构化记忆在这个框架中都有体现。


八、RSI的学术脉络:从Schmidhuber 1987年博士论文到今天

新的变化

诸葛明成(Recursive创始成员,导师为Eugene Hubener/Schmidhuber)从学术史和产业前沿双重视角,系统梳理了Recursive Self-Improvement(RSI)的发展脉络和当前工业实践。

嘉宾观点与解释

Schmidhuber的长期耕耘:大众熟知Schmidhuber的LSTM(长短期记忆)和World Models论文,但他从15岁起的核心人生目标就是"创造一个能自我改进的AI,比他更聪明,然后他就可以退休了”。他在Meta Learning和RSI上的贡献包括:

  • 1987年博士论文:就是关于Recursive Self-Improvement的
  • 2003年Gödel Machine:提出了最早的、定义清晰的、可实现的RSI形式——一个可以与自己对话、自我重写的Agent Learning Program,当数学证明下一个版本比上一个版本好时才执行自我迭代

从数学证明到经验验证的范式转变:Gödel Machine时代要求严格的数学证明来确认版本改进,但在机器学习时代很难用数学证明当前版本一定更好。因此当前的RSI更多依赖benchmark上的经验评估——通过搜索找到最优的下一版本迭代并替代。

行业巨头的公开表态(2025年起):

  • Sam Altman(OpenAI):内部实验室已经看到了"第一个能自我改进的AI",RSI循环已经不再是不可行的,但需要非常小心
  • Dario Amodei(Anthropic):RSI需要非常小心,当智能真正开始循环迭代后,智力可能指数级增长,“这真的会吓到我”
  • Demis Hassabis(Google DeepMind):RSI在原理上已经可行,唯一重要的问题是如何以安全、对人类有益的形式实现
  • Elon Musk:如果AI能提升自己或解决人类管理,那就是"game over"

九、Anthropic的内部数据:代码生成已突破人类水平

新的变化

诸葛明成引用了Anthropic最新发布的博客"Why AI by itself"中的关键数据,展示了代码智能体能力的突破性进展。

嘉宾观点与解释

核心数据:

  • 从2025年下半年开始,Anthropic内部80%的代码由Claude生成并直接merge
  • 2025年Q2相比2024年同期,生产力提升了8倍
  • 在固定实验场景下,某些任务实现了52倍速度提升
  • 从2025年9-10月开始,超过50%的情况下Claude写的代码比人类更好

诸葛明成的个人判断:

  • 当AI带来生产力提升2倍时,会引发大规模裁员(2025年Q3已开始验证)
  • 当生产力提升达到100倍时,ASI(人工超级智能)将完全成立——因为训练一个foundation model从infra到data到model设计,大约100人就够了
  • 100倍生产力可能出现在2028年,大家可以拭目以待

Cloud Code Expert数据:具备高度expertise的人使用Claude Code产生的收益是普通人的数倍。诸葛明成推论:当Claude Code本身已经比人类expertise更强之后,RSI的闭环就可以开始运转了。


十、RSI的三大支柱:治理、Harness、Evolve

新的变化

诸葛明成提出了当前RSI最重要的三个维度,并展示了其研究组在形式化Agent结构(AgentTrek/AGT)和长周期任务反馈(AGS Journal)方面的早期工作。

嘉宾观点与解释

三大支柱:

  1. 治理(Governance):RSI必须得到保障,否则无法谈自我改进。这是第一优先级。

  2. Harness与评估(Evaluation):将Agent形式化为图结构——每个operation(工具调用、模型调用)都是节点,Agent就是一定拓扑结构编排的graph。多个Agent也是通过graph组合。自我改进就是改graph上的节点和边。这是被公认为RSI领域最早的探索之一(AGT, 2023年)。

  3. 进化与精炼(Evolve/Refine):在长周期(Long Horizon)任务上如何提供有效反馈?这一问题在2023年还很少有人讨论,但现在Verify Fire、Jar等验证工具在Claude Code和ClaudeX中已经非常普遍。

完备神经计算机(Completely Neural Computer)的愿景:诸葛明成的终极梦想是RSI能帮助构建从头到尾、从模型架构到数据到应用的颠覆性改写的完备神经计算机。他预测:

  • 今年(2026年):最大突破将是RSI递归迭代的首次实现
  • 2-3年后:有望达成完备神经计算机

十一、全球RSI公司版图:谁在真正做Recursive Self-Improvement

新的变化

诸葛明成梳理了全球范围内以RSI为核心使命的公司版图,并提出了判断一家公司是否"真正在做RSI"的五象限标准。

嘉宾观点与解释

核心RSI公司:

  1. Anthropic:代码生成已达80%自动化,被公认为RSI前沿
  2. OpenAI:Sam Altman公开确认看到自我改进循环
  3. Recursive(诸葛明成所在公司):创始团队包括前DeepMind世界模型lead Tim Rocktäschel,在多个auto research和speed of light execution benchmark上取得社区最优成绩
  4. Sakana AI:2025年6月开始构建RSI导向的self-improving Lab,创始人是David Ha(与Schmidhuber合作World Models论文)
  5. Recursion Intelligence:用RSI技术提升芯片设计
  6. Inferobot:David Silver独立创业,与RSI中的learning from experience和recursive reinforcement相辅相成
  7. Google DeepMind:AlphaZero被视为最早的成体系self-improving agent

RSI的五象限定义标准(Jason Weston论文):

  1. **参数(Parameter)**需要可被迭代
  2. **训练数据(Training Data)**需要被迭代
  3. **目标(Objective)**可能需要实时跟进调整
  4. **架构(Architecture)**需要被改进
  5. **整体代码(Overall Code)**需要被改进

满足全部五个象限,才能被认作是真正的RSI。当前还没有任何一家公司完全打通整套循环,可能还需1-2年周期。

术语收敛提醒:国内有很多不同说法(self-improving、self-evolving等),但在国际工业界已经收敛到RSI(Recursive Self-Improvement)一个术语——无论Anthropic、OpenAI还是Recursive公司都使用这个词。


十二、TnRL:数字孪生驱动的真机强化学习加速

新的变化

张尚杭团队提出了TnRL(Twin-RL VLA)框架,通过数字孪生作为"探索放大器和引导器",解决真机强化学习样本效率低的问题。

嘉宾观点与解释

两大瓶颈:真机VLA强化学习受SFT阶段诱导的轨迹分布空间知识严格约束——一是限制了策略能可靠探索的状态集合,二是即便引入人类干预也显著降低学习效率。

TnRL的三阶段框架:

  1. 探索空间扩展(SFT阶段拓宽轨迹分布知识)
  2. 数字孪生并行探索
  3. Sim-to-Real引导的真实世界探索

实验结果:在4个真实操作任务上,TnRL在在线RL初始阶段就表现出显著更高的成功率。约20分钟即可在分布内和分布外区域达到100%成功率,相比基线方法实现至少30%的加速。在分布外(OOD)区域优势更显著——仅依赖真实示范初始化的策略往往在OOD区域陷入探索困境,而TnRL实现接近100%成功率并保持稳定收敛。


总结:AI自进化的技术路线全貌

本次沙龙呈现了AI自进化的四条互补技术路线:

维度代表人物核心思路关键突破
具身智能张尚杭(北大)从一体化到自进化的五维世界模型5D因果预测+自监督记忆+TnRL真机加速
语言环境RL温颖(上交)大语言环境下的持续强化学习问题的问题:自主构建学习目标+传递性保证
脑启发持续学习王立元(清华)类脑记忆机制实现持续自适应主动遗忘+结构化空间记忆+三层记忆架构
RSI产业前沿诸葛明成(Recursive)形式化Agent+验证闭环+完备神经计算机AgentTrek图结构+五象限RSI标准

四条路线的共同指向:AI正在从"被动训练"走向"主动迭代、自主进化"。2026年可能成为RSI递归迭代首次实现的元年,而真正的通用ASI可能在生产力达到100倍时(约2028年)确立。但核心挑战依然清晰——治理、验证、持续学习的单调提升保证,这三者缺一不可。