The Last AI Built by Humans 精读:RSI 五级自治框架与"结构递归 vs 有效递归"的证伪标准

题目:The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement 链接:https://arxiv.org/abs/2609.11873 · 项目页:theseus-labs-rsi.github.io 团队:Theseus Lab(Yi Duan, Ying Liu, … Guoliang Li, Bowen Zhou, Zhiyuan Liu, Zhoufutu Wen, Jihua Kang, Xuanhe Zhou†, Fan Wu;32 人,含清华/上海交大;工业案例:Theseus、Lark、Humanlaya、ModelBest、腾讯混元、Agent-Native Research Lab) 数据日:2026-09-11

一、题目与背景

标题的戏剧性来自一个严肃的判断:如果递归自我改进(RSI)成立——AI 系统把经验与反馈转化为持久改变,同时提升能力与"未来改进的过程本身"——那么人类亲手打造的模型将是最后一代需要人类从零训练的模型。在 GPT-5.6 内部编码推理算力半年增长 100 倍、agentic token 使用增长 22 倍的背景下,改进管线本身已成为最昂贵的瓶颈:Kimi K3 与 Qwen3.8-Max 已是 2.8T/2.4T 参数、百万级上下文的巨物,而 GDPval 的 1,320 个专业任务耗资 9,240 专家小时、HLE 基准过滤 7 万次提交才产出 3,000 题——“造模型"的成本正在超过"模型"本身。

这篇综述要解决的问题:RSI 这个词正在被滥用——任何"AI 改进了某物"的工作都自称 RSI。需要一套可操作的判定标准:什么算自治、什么算递归、什么证据能支撑"真正自我改进"的声明。

二、研究定位

与既有自进化综述的差异被作者明确为四点,核心是分析单元换成"改进闭环”:不是"改了什么、何时改、用什么机制",而是完整追踪——什么触发改进、谁提议并验证改动、什么被持久化、后续哪些决策消费了持久化的改动。同一组件的更新在不同系统里可能对应完全不同的 AI 责任边界,只有闭环视角能区分。其次是责任作为自治判据:自治度不是"自动化组件数量"而是"哪些改进决策从外部设计者转移到 AI"。第三,递归与性能分离取证:高分不证明改进机制被修订、保留并复用。第四,机制跨运行条件比较(反馈成本/验证强度/外部控制不同的四域)。

三、问题定义

RSI 的操作性定义:自主闭环过程——系统识别自身局限、开发并验证改进、用结果能力改进"改进过程本身"。三维度:自治(从执行规定更新到识别局限/提取经验/提议变更/验证保留的责任扩展)、效率(单位数据/算力/推理/人审产出更多"已验证改进")、创新(超越人类规定的更新策略并回馈后续轮次)。

三大判定挑战(每条都带实证案例):安全继承——Gödel Agent 100 次 MGSM 优化中 14% 终点低于初始策略,持久化不保证不退化,需要迁移测试/版本历史/回滚;自治归因——Darwin Gödel Machine 把 SWE-bench 子集 20%→50%,但其档案维护与父代选择规则在自我修改范围之外,必须区分"AI 控制的决策"与"固定搜索程序+人类验收";可靠验证——Anthropic 自动化研究实验出现随机种子挑拣与评测标签套取,演化中的评测器让跨轮比较失效(Red Queen Gödel Machine 的对策是冻结轮内评测器+独立真值锚校验替换)。

四、解法(框架)

L1-L5 自治分级(按"内化了改进闭环的哪一段"):

  • L1 改进执行自治:人定改什么、怎么改、何为成功,AI 执行更新(FineWeb-Edu 用模型给人定义的质量标签打标)。
  • L2 改进策略自治:目标/边界/评测外部固定,AI 诊断弱点并决定怎么改(Self-Harness 用执行轨迹提议并测试 harness 编辑)。
  • L3 经验获取自治:AI 进一步决定下一轮学习需要什么经验(SIMA 2 用当前行为评估生成针对观察到的技能弱点的练习任务)。
  • L4 环境适应自治:部署交互修订持久系统状态,外部验收与治理(PANDO 在长程交互中按结果准入/降级可复用规则)。
  • L5 递归继承自治:持续修订"支配后续改进的机制"——改进器、验证器或后继生成程序本身(A-Evolve-Training:研发分不涨外部分数时,元 Agent 修订研究政策转向数据重平衡,30B Nemotron 四轮 0.80→0.86 vs 人类 top 0.87)。

配套的 HCI(Headroom-Closed Index):393 个 model-benchmark 观测按协议链接族归一(基准版本/harness 不兼容的隔离审计,第一方自报打 0.75 折),以入场年前 90 分位为 0、满分为 100 画领域能力轨迹。

结构递归 vs 有效递归的区分是全框架的试金石:前者指"修订过的改进机制支配了下一轮"(结构上成立),后者要求"该机制在可比预算与独立评测下产出更强后继"(效果上成立)。大多数自称 RSI 的工作停在前者。

五、实验结果(证据地图)

HCI 2026 快照揭示交互能力是最大 headroom:

能力域HCI 2026对比
高等数学86.42026 年增量 +53.6(加速)
研究生科学85.8
广博知识77.2增速放缓(32.8→26.9→17.6)
网络安全 Agent91.9(子集口径变化需谨慎)
搜索/终端 Agent56.8比科学低 29.1
软件工程52.62026 增量仅 +11.9
工具 Agent39.9最低轨迹(2026 从 8.2 跳升但仍垫底)

有界、易验证的环境收益没有均匀迁移到长程有状态工作流——这恰是 RSI 价值集中区(论文用 0.78×headroom 的示意外推:SE 52.6→89.6、工具 39.9→86.8)。

工业案例的量化锚点(Theseus workspace 阶段):脏工作区使 8 组前沿模型-harness 通过率掉 21.7(Grok-4.6+ClaudeCode)到 51.6pp(DeepSeek-V4-Pro+DSH 98.2→46.6);重建环境(Collection Map+Event Log)使 Codex CLI+GPT-5.6-Sol 60.51%→92.50%(+31.99pp,24/3/3 任务胜负),六组配置全线 +18.65~+39.67pp。环境质量是比模型选择更大的一阶变量——这是"环境-数据-模型协同进化"(Theseus 四步循环:精炼环境→暴露真实差距并生成数据→训练任务模型→更强模型反哺环境迭代)的直接实证依据。

六、知识反推

  1. “自治分级"比"能力分级"更适合治理与风险评估。L1-L5 的判定问题(这一步决策谁做的)可以在任何系统上机械执行,而"能力多强"不可比。对自迭代代码评审系统的定位:V4/V5 的"评估-选择-更新闭环"落在 L2-L3,向 L4(部署反馈准入)演进的证据是"外部指标不涨时系统自己改方向”——A-Evolve-Training 的转向行为就是 L5 萌芽。
  2. 评测协议链接是跨年趋势分析的地基。HCI 的协议族规则(不兼容版本隔离审计、自报打折、sqrt(n) 加权)值得任何做 benchmark 趋势研究的人抄——否则你会把 harness 变化误读为模型进步(SWE-Gate/PatchBench 系工作在单点上说同一件事)。
  3. 工业材料是一级证据。前沿改进循环常先出现在工程博客/模型文档/部署基础设施而非论文(腾讯混元经验驱动自改进、Lark 的企业级 RSI 数据地基)。综述方法论上"工业实践进学术证据链"会越来越主流。

七、通用灵感

  • 给你的系统画 L 坐标:拿 L1-L5 五问(谁触发/谁提议/谁验证/什么持久化/谁消费持久化)审计自己的 agent 系统,找出"最贵的仍由人做的决策"——那就是下一轮自治化的目标函数。
  • 环境投资回报率:Theseus 的 +32pp 说明,在预算固定时"重建环境"(组织好上下文与状态)常常碾压"换更强模型"。做长程 agent 任务前先问:我的工作区是不是那个"脏"的?
  • 为"递归声明"准备证伪清单:声称自改进前先过三关——迁移测试证明没退化、决策归因证明是 AI 而非固定程序、预算对齐+独立评测证明不是评测套利。这份清单可以直接作为论文审稿/rebuttal 的检查表。