AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement —— 精读

论文链接:https://arxiv.org/abs/2608.20318

项目主页:https://lab.einsia.ai/ai4ai

发表时间:2026 年 8 月 21 日

发表机构:Naver’s Lab, Einsia.AI 与清华大学(产学合作)


一、论文背景

1.1 递归自改进:AI 领域最深的问题之一

递归自改进(Recursive Self-Improvement,RSI) 问的是一个足以让人夜不能寐的问题:AI 系统能否改进"生产 AI 系统"的过程本身?

这个表述里有三个关键词。第一是"AI 系统"——改进的主体是 AI,不是人类工程师;第二是"生产 AI 系统的过程"——被改进的对象不是某个具体任务的表现,而是制造 AI 的那套流程;第三是"递归"——改进后的流程会生产出更强的改进者,形成自我强化的循环。

那么,“生产 AI 系统的过程"究竟是什么?论文给出了一个极为清晰的回答:这个过程就是训练算法。更好的目标函数(objective function)或更新规则(update rule),能够改善每一次后续运行的算力-能力交换率——同样一块 GPU、同样一小时,训练出来的模型更强。换句话说,RSI 的可行性最终取决于一件事:agent 能否设计训练算法。如果 AI 只会调参、只会找数据、只会写业务代码,而唯独不会设计"模型如何学习"的规则,那么递归自改进就永远停留在概念层面。

1.2 为什么 2026 年这场讨论白热化

RSI 并不是新话题——从 Gödel machine 的理论构想到近年来一连串自我改进 agent 的实验,这个方向至少已被讨论了十余年。但 2026 年夏天,讨论明显升温:Anthropic 的安全研究机构连续发布关于自改进系统风险与治理的分析,MIT Technology Review 在 2026 年 8 月 18 日刊发专题报道追踪"AI 改进 AI"的最新进展,而 AIDE² 等系统更是给出了自改进 agent 的首批实证证据。算力增长放缓的宏观叙事,也让"算力-能力交换率"从学术指标变成了产业界真正关心的核心变量——当堆算力的边际收益递减,改善交换率的算法创新就成了唯一的增量来源。

1.3 已有"证据"的局限:改 agent 代码 ≠ 改训练算法

热闹归热闹,论文一针见血地指出了现有证据的共同软肋。Gödel Agent、DGM(Darwin Gödel Machine)、AIDE² 这些广受关注的工作,其自我改进的对象都是 agent 自身的运行时代码——提示词、工具调用逻辑、搜索策略、记忆管理。这类改进当然有价值,但它改变的是"这个 agent 这次运行时怎么做”,而不是"底层模型如何学习"。

打个比方:一个学生学会了不断优化自己的复习计划表(什么时候复习、先复习哪科),这是运行时层面的自我改进;但只有当他发明了更高效的记忆法(改变大脑处理信息的方式)时,才触及了学习算法层面。前者的天花板是"在固定学习能力下做到最优调度",后者的天花板才是"学习能力本身的上移"。现有所有自改进证据都属于前者,而 RSI 真正承诺的是后者。

更关键的是,此前没有任何基准把这两种能力区分开测量。

1.4 训练算法为什么是 RSI 的核心杠杆

论文用"算力-能力交换率"这个统一语言解释了杠杆的层级差异。改系统工程(内核、并行策略、通信)能让同样的算力跑得更快,但模型的学习规则没变;改数据(混合配比、合成、过滤)能改善喂给模型的信息质量,但模型消化信息的方式没变。这两者都是在固定的交换率曲线上挪动位置。而改训练算法——换一个目标函数、换一种更新规则——改变的是交换率曲线本身的形状。前者是加法,后者是复利。

正因如此,“agent 能否设计训练算法"就成了 RSI 可行性的试金石,而要回答这个问题,第一步是测量——这正是 AI4AI-Bench 的出发点。

这里有一个值得玩味的方法论细节:在"AI 能否自我改进"这类宏大问题上,公共讨论往往先于测量展开——先有立场,再找证据。而证据如果测得混杂(把数据工程、系统调优、算法创新搅在一起),就会同时被乐观派和悲观派各取所需。论文作者显然意识到了这一点:与其加入争论,不如先造一把干净的尺子。


二、论文定位和关联工作

2.1 通用编码基准的"错位”

一个自然的疑问是:SWE-bench、Terminal-Bench 这类编码基准已经很成熟,把 agent 放进真实仓库里干活,为什么不能顺带测量算法设计能力?

论文的观察相当犀利:现有通用编码基准大多会被"收集数据"或"调超参"的策略赢得。在这些基准的任务设定里,agent 提升指标的最优路径往往是找更多数据、跑更多超参扫描、做更多数据增强——这些恰恰是"改变这次运行的方式",而不是"改变模型学习的方式"。MLE-bench 一类的机器学习工程基准同样如此:赢得 Kaggle 式竞赛靠的是特征工程、数据清洗和模型集成,训练算法本身几乎从不被触碰。

问题不在于这些基准不好,而在于它们把两个不同的变量混在了一起:一个 agent 得了高分,你无法归因它到底是靠数据工程还是靠算法创新。对于一般能力评估这无所谓,但对于 RSI 这个具体问题,混杂的测量等于没有测量。

2.2 RSI 三层自动化框架:本基准独占算法层

为了说清定位,论文提出了一个 RSI 三层自动化框架:

层级自动化对象典型改动已有覆盖
系统工程级训练基础设施内核优化、并行策略、通信调度编码/系统基准可测
数据级训练数据混合配比、数据合成、过滤清洗MLE-bench 类可测
算法级学习规则本身目标函数、更新规则此前无基准,本文独占

在这个框架下,AI4AI-Bench 的定位一目了然:它不测 agent 会不会写代码、会不会调系统、会不会搞数据——这些能力别处已经测得很好——它只测最深层的那一层:agent 能否重写训练算法本身。这种"主动放弃大而全、只做隔离测量"的选择,是全文方法学的基石。

2.3 与自改进证据链的关系

把 1.3 节和 2.2 节合起来看,论文在证据版图上的位置就清楚了:Gödel Agent / DGM / AIDE² 提供了"agent 改 agent 代码"的运行时层证据,通用编码基准覆盖系统工程层,MLE-bench 类覆盖数据层,唯独算法层——RSI 理论上收益最大、实证上测量最难的一层——是空白。AI4AI-Bench 补的就是这块空白。

还要指出一个容易忽视的差别:运行时层的自改进证据通常是单次、局部、难以累积的——agent 改了自己的提示词,这次运行变好了,但这个改进既不保证可复现,也不构成"下一代系统更强"的机制。而算法层的改进天然是可累积的:一个更好的目标函数写进训练流程后,此后每一次训练都会继承它。复利效应只存在于可累积的层——这也是为什么算法层虽然最难测量,却是 RSI 讨论中真正举足轻重的那个变量。


三、问题定义

3.1 核心问题:训练算法设计能力的隔离测量

把论文的问题形式化表述:给定一个冻结的研究仓库(含出厂训练算法)和固定的算力预算,agent 重写其中的训练算法;新算法在完全相同的流程下从零训练,由对 agent 隐藏的固定评估器评分。问题是:agent 的改动能否稳定超越出厂算法,并逐步逼近该任务的最优水平?

这个问题定义的巧妙之处在于三个约束的叠加:仓库冻结(排除"换一个更好项目"的取巧)、流程相同(排除"改评估流程"的取巧)、评估器隐藏(排除"过拟合评估器"的取巧)。三者合力,把测量面压缩到"训练算法设计"这一个自由度上。

3.2 不可通约指标的统一量表:0 / 0.1 / 1.0 三锚点

基准横跨 10 个任务,各任务的原始指标天然不可通约——有的看准确率,有的看生成质量,有的看收敛效率,量纲、范围、优劣方向都不一样。直接平均原始分是方法学灾难。

论文的解法是锚点归一化:每个任务的指标都映射到一个统一量表,量表上钉了三颗语义明确的钉子——

  • 0 = 无信息模型:随机输出或平凡基线能达到的水平;
  • 0.1 = 仓库出厂算法:仓库作者发布时的原始训练算法(同流程重跑)的水平;
  • 1.0 = 任务最优:该任务上已知能达到的最佳水平。

这套设计的精妙在于它让分数获得了绝对语义而非仅仅是相对排名:0.1 以下的提交意味着"改得还不如不改";0.5 意味着"走完了从已有算法到最优的一半路程";0.9 以上则逼近任务天花板。同时,因为每个任务都经过了同样的三锚点校准,跨任务的分数聚合第一次变得合法——“平均 0.166"这才是一个有含义的句子。

顺带一提,锚点的选取本身就是一次方法学表态:把出厂算法(而非人类专家现场调优后的配置)定为 0.1,意味着基准衡量的不是"agent 与人类的差距”,而是"agent 与既有公开知识的差距"。这个选择既宽容(不必与顶尖人类竞争)又诚实(既有知识就是 RSI 起跳的地板),让"从 0.1 出发向 1.0 爬坡"成为一条语义清晰的进步轴。

3.3 隐藏评估器 + 从零重跑:防作弊的双重保险

测"真本事"的基准必须防作弊,论文的两道保险值得单独一提。

第一道是隐藏评估器:评估代码对 agent 完全不可见。agent 无法针对评估器的实现细节做定向优化,更无法利用评估漏洞刷分。第二道是从零重跑:agent 提交的训练代码随后在受控环境中从零开始训练,最多 12 小时。这杜绝了两类最常见的作弊——夹带预训练权重(把别处学来的能力伪装成本次训练的成果)和评测集泄漏(训练时偷看测试数据)。加上出厂算法在完全相同的流程下作为对照组重跑,最终分数反映的确实是"训练算法的差异",而非环境差异。

值得一提的是,这两道保险在 LLM 时代尤其必要。如今的 agent 极擅长发现并利用评测环境的漏洞——在开放评估的基准上,“钻空子"的收益常常远高于"做研究”。一个测 RSI 的基准如果自身可被 gaming,得出的结论将毫无意义。AI4AI-Bench 在机制层面直接关死了这些门:看不见评估器、偷不了数据、带不了私货,剩下的唯一得分途径就是老老实实改进学习规则。


四、问题解法

4.1 任务套件:10 个冻结研究仓库 × 10 个训练算法家族

基准的骨架是 10 个公开研究仓库,刻意选自 10 个不同的训练算法家族——避免任何一个家族(比如都是视觉分类)主导结论,保证测到的能力是"面对陌生的学习范式也能设计算法"而非"对某一族算法的熟稔"。每个仓库保留其数据、评估与训练入口,唯独训练算法部分向 agent 开放改写。仓库冻结在固定版本上,确保几个月后重测时,分数变化只能归因于 agent 的进化。

4.2 预算设计:4 小时写,12 小时跑

每任务的算力预算是论文工程设计的精华:agent 获得单块 B300 GPU 上 4 小时的工作时间来理解仓库、改写训练算法(期间可以做实验);提交后,新算法从零重跑最多 12 小时,由隐藏评估器评分。

这两个数字是精心权衡的结果。4 小时的编码预算足够 agent 完成非平凡的算法重写(阅读代码、提出假设、写新目标函数、做小规模验证),又不至于让单任务成本失控;12 小时的重跑预算则保证大多数训练算法能完整收敛、分数有区分度。单块 B300 的约束同样重要——它把"堆算力掩盖算法差异"的路径堵死了,交换率的高低无处遁形。

4.3 量表映射与评分流水线

评分流程完全对称:对每个任务,出厂算法先在相同流程下重跑,锚定 0.1;无信息基线锚定 0;任务最优锚定 1.0。agent 的提交经过同样的从零重跑和隐藏评估,映射到量表。整个流水线无人为评分环节,29 个配置、6 个系统、10 个任务的成绩全部由同一条流水线产出。

4.4 全量开源:基准作为可重复的公共资产

论文最不寻常的工程决定是全部开源:任务套件、评估器,以及每一个被评分的提交。这不是常规操作——大多数基准只发布任务和排行榜,不发布参赛者的全部答卷。

这样做的直接收益是纵向可重复性:随着系统迭代,任何人都可以用完全相同的任务、评估器和对照锚点重新测量,得到一条随时间演进的"算法设计能力曲线"。几年后回看,这条曲线本身就是 RSI 进展的第一手史料。更深一层,全部提交的存档让失败分析成为可能——本文第五、六节的那些关键发现,正是建立在对每个提交"改没改学习方式"的人工审视之上。


五、评估指标与实验证据

5.1 主结果:0.166 的均值,0.250 的天花板

实验覆盖 6 个系统共 29 个配置,在每个系统的 10 个任务上运行评分。结果冷静得近乎残酷:

  • 全体平均 0.166;
  • 最佳系统平均 0.250。

用三锚点量表解读这两个数字才是正确姿势。从出厂算法(0.1)到任务最优(1.0),距离是 0.9。平均分 0.166 意味着整体只走完这段路的约 7%;即便最强的单个系统,0.250 的均分也只对应约 17% 的路程——连"已有算法到最优"距离的五分之一都没走完。

这个结论的价值恰恰在于它的保守性:由于量表锚点校准严格、防作弊设计到位,我们无法用"评测有水分"来安慰自己。2026 年的前沿 agent,在隔离测量的算法设计任务上,表现就是离出厂算法不远。

还有一个容易被忽略的观察角度:这是参与率与质量双双受限下的结果。平均分 0.166 是"大多数人不敢改、改了的人也改不深"两层折扣叠加后的产物。这意味着 0.166 既不能解读成"算法设计能力已经初具规模"(乐观读法),也不能解读成"算法设计能力被证明不可行"(悲观读法)——它只是说明,在这个任务上,当前系统还处在非常早期的阶段,早期的标志不是分数低,而是行为模式本身(大面积弃改)都尚未成型。

5.2 分层证据:改了学习方式的少数派

论文对提交做了逐个剖析,得到全文最有信息量的分层:大多数提交根本不改变模型的学习方式——agent 们交上来的"训练算法改写",实质是数据配比调整、训练日程微调、日志增强这类外围操作。真正触碰了目标函数或更新规则的少数派,平均分 0.226;其余提交平均 0.126。

两个数字之间 0.100 的差距说明:算法级的改动确实有真实回报,方向是对的;但即便是这批"真改了"的提交,均分也只比出厂算法高 0.126 左右——改动的质量仍然很低。换句话说,这一层能力呈现出典型的"方向正确、深度不足"形态:agent 们已经能识别出"应该动目标函数"这个方向,但动完之后切下的份额仍然很薄。这为后续研究指明了一个具体的攻关面——不是要不要做算法级改动,而是如何把改动做深。

5.3 最反直觉的发现:推理预算买到的是"敢去改"

推理预算(thinking budget)对成绩的影响被论文拆解出一个惊人的结论:更多推理预算主要买到的是"敢去改"的意愿,而不是"改得更好"的质量。

数据是:推理预算增加后,真正改变学习方式的提交占比从 8% 飙升到 64%,对应整体均分从 0.094 升至 0.196。也就是说,预算增长带来的分数提升,大头来自原本"不敢动"的 agent 现在愿意动手了——而不是同一批改动被打磨得更精。

这个发现重新定义了"推理预算的作用"。此前的直觉是:更长的思考链让 agent 把方案想得更深、更对。而在这类高风险、长验证周期的任务上,推理预算的首要功能是克服保守倾向——让 agent 有足够的"思考余量"去承担"改动可能让训练崩溃"的风险。类比是人类考试:延长时间的第一效果不是让每个人把难题解得更漂亮,而是让更多人敢于尝试难题。

对推理预算的这种再认识,也直接关系到投入决策:如果一个系统的瓶颈在参与率,加预算是划算的(0.094 → 0.196 翻了一倍);如果参与率已经到顶(64% 之后继续加),同样的预算换来的边际收益就会骤降,因为剩下的瓶颈是质量而非胆量。预算买不来手艺——这是数据给出的、与许多产品直觉相反的结论。


六、效果优势的根源解释

6.1 为什么大多数 agent 不改学习方式

结合基准的机制设计,可以拆解出三层原因。

改动风险高。 训练算法是整个流水线中最脆弱的环节:一个不合理的目标函数可能让损失发散、出现 NaN、训练彻底崩溃,最终得分跌破 0.1 甚至归零。对 agent 而言,“保持出厂算法不动"是一个稳拿 0.1 的安全策略,而"重写更新规则"是一场地雷阵里的赌博。期望收益一算,保守是理性选择。

验证周期长。 agent 只有 4 小时工作时间,而一次完整验证需要最多 12 小时的从零重跑。这意味着 agent 在提交前永远无法完整确认自己的改动是否有效——它必须在不完全信息下做出高风险决策。这种结构性信息不对称,天然过滤掉绝大多数尝试。

先验稀疏。 训练算法的空间在人类社区里本身就是稀疏探索的。互联网上有海量的"调参教程"“数据清洗脚本”,但"如何为一个陌生任务设计新的目标函数"的高质量范例凤毛麟角。模型的预训练分布里,这个区域的密度远低于数据工程区域——它不是不会写代码,是没见过足够多这样的代码。这也意味着:这个瓶颈与另外两个不同,它不太可能靠 agent 内部的机制设计解决,更可能要靠社区持续产出高质量的算法设计语料来慢慢填平——一个数据问题,而非架构问题。

6.2 为什么"敢去改"就值 0.1 分

一个耐人寻味的算术:少数派(0.226)与多数派(0.126)之间 0.100 的差距中,约有一半其实来自"参与"本身,而非参与者的改动质量更高。为什么仅仅"动手改"就有如此大的期望收益?

因为出厂算法远非最优。仓库里的原始训练算法是作者发论文时的配置——受限于截稿日期、审稿口味和作者精力,它只是一个"够发文章"的配置,距离该任务真正的最优水平留有大量空间(这正是 0.1 与 1.0 之间 0.9 距离的含义)。任何一个方向合理、实现不崩的算法级改动,期望上都能从这块剩余空间里切下一角。于是"敢去改"本身就带有正期望——前提是改的方向不荒谬、实现不致命。

把 5.3 和 6.2 连起来看,2026 年 agent 算法设计能力的真实画像浮出水面:“敢做"的瓶颈已开始被推理预算撬开(8% → 64%),“做得好"的瓶颈几乎原封未动(参与者也只有 0.226)。两个瓶颈,两种解法,混为一谈就会既高估又低估当前系统的水平。


七、必要知识反推

如果要读懂并复现这项工作(或者做出同类研究),需要哪些知识?可以反推出三层。

7.1 领域层

  • 训练算法全景:主流目标函数家族、优化器与更新规则的设计空间,以及各家族的典型弱点——否则无法判断 agent 的改动是否真的"改变了学习方式”;
  • RSI 概念史:从 Gödel machine 理论、DGM、Gödel Agent 到 AIDE² 的证据脉络,以及"运行时改进 vs 训练算法改进"这条关键区分线;
  • 基准方法学:SWE-bench、Terminal-Bench、MLE-bench 的任务构造与已知缺陷,理解"被数据/超参赢得"的机理。

7.2 方法论层

  • 隔离变量实验设计:冻结、对照、隐藏评估——把混杂因素逐一锁死的能力;
  • 不可通约指标的归一化:锚点量表设计、量表语义校准;
  • 纵向测量思想:如何让一次评测在未来可重复、可比较。

7.3 工程层

  • 大规模 GPU 评测编排:单块 B300 上 4h 编码 + 12h 重跑的预算管理、数百次从零训练的调度与容错;
  • 仓库冻结与复现环境:让第三方研究仓库在数月内行为不变的工程手段;
  • 评分流水线与提交存档:隐藏评估器的部署、全部提交的开源化管理。

7.4 融合节点

三层知识在两处交汇成这篇论文的核心创新:其一,锚点量表 = 方法论(归一化)× 领域(指标语义)——不懂各家族指标的含义,就选不出 0/0.1/1.0 这三个有绝对语义的锚点;其二,全提交开源 = 工程(存档系统)× 方法论(纵向测量)——没有工程上的提交管理,“测量随系统演进重复"就是空话。领域知识告诉你测什么,方法论告诉你怎么测得干净,工程能力让测量真正跑起来——缺任何一层,这个基准都不成立。


八、论文中可以提取的通用性灵感

灵感一:隔离测量是 RSI 研究的首要需求

核心思想:在争论"AI 能否自我改进"之前,先把"自我改进"拆解成不重叠的层(系统工程 / 数据 / 算法),对每一层做单变量隔离测量。模糊的 composite 评分只会同时高估和低估真实水平。

论文证据:三层自动化框架明确划分了自动化对象,指出此前所有证据都挤在系统工程层与数据层,算法层的隔离测量由本文首次补上。

推广场景:评估任何"多因素复合"的系统时先做能力分解——例如评估编码 agent 时把"会读库"与"会改架构"分开测量;评估组织效能时把"执行力"与"战略选择"分层归因。归因不清的测量,等于没有测量。

灵感二:“敢做"与"做得好"是两个能力

核心思想:在高风险任务上,参与率(多少个体敢于尝试)与参与质量(尝试者做得多好)是两个独立的测量维度,必须分开统计。混在一起会掩盖真实瓶颈。

论文证据:推理预算把"改变学习方式"的参与率从 8% 提到 64%、均分从 0.094 拉到 0.196,但参与者的质量分仍停在 0.226——预算买的是胆量,不是手艺。

推广场景:分析模型工具调用失败时,先区分"没调用工具"与"调用了但用错”;管理创新提案时,先看提案率再看通过率;设计 RL 奖励时,对探索行为与利用行为分别塑形。先分层,再优化。

灵感三:不可通约指标的锚点归一化

核心思想:当一组任务的原生指标量纲各异时,用每个任务内部都有明确语义的锚点(如"随机基线 / 现状 / 理论最优”)做三点校准,归一化后的分数既可跨任务聚合,又保留绝对含义。

论文证据:10 个任务 10 种指标,通过 0(无信息模型)/ 0.1(出厂算法)/ 1.0(任务最优)三锚点映射到统一量表,“平均 0.166"才成为一句可解释的话。

推广场景:跨项目组合评估(每个项目锚定"不干 / 按计划干 / 干到理想"三点)、多团队 KPI 聚合、多基准模型排行榜——凡是要把苹果和橘子加总的地方,先找锚点。

灵感四:全提交开源的纵向基准设计

核心思想:基准不只是某次评测的榜单,而应是持续沉淀的公共资产——任务、评估器与全部历史提交都存档开源,使测量可随系统演进无限重复,形成一条能力演进的时间序列。

论文证据:AI4AI-Bench 开源了任务套件、评估器和每一个被评分的提交,使本文的失败剖析成为可能,也使未来的重测可以直接对比今天这条基线。

推广场景:企业内部评测平台沉淀所有历史提交以构建能力回归曲线;竞赛留档全部答卷供后来者做失败分析;个人学习时保留每一版草稿——档案本身会成为未来的研究材料。


九、总结

AI4AI-Bench 做了一件看起来朴素、实则至关重要的事:把"AI 能否设计训练算法"从哲学争论变成了可以打分的测量。三层自动化框架划清了 RSI 的版图,10 个冻结仓库、4 小时编码、12 小时从零重跑、隐藏评估器与三锚点量表共同构成了一套干净到近乎苛刻的实验装置。

它给出的答案并不喧哗,但足够清晰:2026 年的最强 agent,在纯隔离的算法设计测量下,连"已有算法到最优"距离的五分之一都没走完(最佳 0.250,平均 0.166);大多数提交甚至不曾触碰模型的学习方式;而推理预算带来的主要增益,是把"敢去改"的比例从 8% 推到 64%——胆量的瓶颈正在松动,手艺的瓶颈纹丝不动。

对研究者,这个基准提供了 RSI 追踪的第一条基线曲线;对工程实践者,它贡献了锚点归一化、隔离测量、全提交存档三件可迁移的工具;而对所有关心 AI 长期走向的人,它提醒我们:在"AI 改进 AI"的宏大叙事里,最稀缺的不是热情而是测量——把一个问题变得可测量,往往就是解决它的第一步。