论文链接:arXiv:2607.25886 代码仓库:github.com/evolvent-ai/RSIBench-Data 发表时间:2026年7月 机构:Evolvent AI + 新加坡国立大学(NUS) 领域标签:cs.SE(软件工程)、cs.CL(计算语言学)
机构标注:本文是企业(Evolvent AI)与高校(新加坡国立大学)合作的成果。第一作者 Fanqing Meng、Lingxiao Du、Qiguang Chen 三人等贡献,均为共同一作;Mengkang Hu 和 Michael Qizhe Shieh 为通讯作者。这种"高校学生/研究者 + AI 公司合著"的模式在本论文中体现为:学术团队负责问题定义、实验设计与分析,Evolvent AI 提供工程基础设施(Tinker 训练服务、Harbor 评估框架、E2B 沙箱)和开源代码维护。
一、论文背景
1.1 什么是"递归自我改进"(Recursive Self-Improvement)?
要理解这篇论文,首先要理解它的终极目标——递归自我改进(RSI)。
想象一个场景:一个 AI 系统在完成任务时失败了(比如写代码出了 bug、解数学题算错了)。人类工程师会分析失败原因,然后针对性地改进这个模型。如果这个"分析失败 → 设计改进 → 训练更好的模型"的循环完全由 AI 自己完成,不需要人类介入,那就是递归自我改进。
用 Anthropic 的说法,这是一种"AI 自己构建自己"的能力。他们的数据显示:Anthropic 工程师现在平均每季度提交的代码量是 2021-2025 年期间的 8 倍,原因就是 AI 承担了越来越多的开发工作。从 2023 年的聊天助手帮写代码片段,到 2025 年的编程 Agent 独立写整个文件,再到今天 Agent 能自主运行代码、把工作分派给其他 Agent——这条路径指向的未来,是 Agent 能自己训练自己的下一代模型。
RSI 是 AI 领域最具雄心也最具争议的目标之一:它能极大加速 AI 进步(可能在科学、医疗等领域带来巨大价值),但也引发安全担忧(如果 AI 能完全构建自己的后继者,人类如何保持对其行为的塑造和控制?)。
1.2 什么是"数据中心化后训练研究"?
论文将 RSI 这个宏大目标拆解为一个可操作、可评估的子问题:数据中心化后训练研究。
先拆解几个概念:
后训练(Post-training):基础模型(Base Model)训练完后,还需要一个"训练后阶段"让它变得更好用——比如指令微调(SFT)让它听懂人类指令,强化学习(RLHF)让它的回答更对齐人类偏好。后训练的质量直接决定了模型的实际能力。
数据中心化(Data-centric):在模型架构和训练算法固定的前提下,把"用什么数据训练"作为核心研究变量。这个理念来自 DataComp 系列:与其不断改模型结构,不如研究"哪些数据最能提升模型能力"。DataComp-LM 的实验证明,仅通过改进数据筛选策略,就能让模型在 MMLU 上提升 6.6 个百分点。
数据中心化后训练研究的完整闭环:这不是简单生成一批数据扔给模型训练,而是一个诊断 → 设计 → 验证 → 迭代的研究过程:
- 诊断能力差距:分析模型在哪里失败?是知识缺失、推理错误、还是工具使用不当?
- 设计训练数据策略:根据诊断结果,设计有针对性的训练数据(什么样的任务、什么样的轨迹、什么样的监督信号)
- 验证策略有效性:训练一个检查点(checkpoint),在受控环境中评估
- 从反馈中学习:根据评估结果修订策略,进入下一轮
论文把这个闭环的执行者称为数据中心化研究员 Agent(data-centric researcher agent)。
1.3 为什么要研究"Agent 能否自动化这个研究循环"?
这个问题的核心动机在于:人类的 AI 研究能力正在成为 AI 进步的瓶颈。
当前,后训练数据策略的设计高度依赖经验丰富的研究员:他们需要理解模型行为、设计实验、解读结果、迭代策略。这个过程耗时、昂贵、难以规模化。如果能证明 LLM Agent 可以可靠地执行这个闭环,就意味着:
- 后训练可以大规模并行化和加速——Agent 可以 24 小时不间断地做实验
- RSI 的核心瓶颈可以被突破——“把失败转化为改进"是 RSI 最关键的一环
- AI 研究本身可以被自动化——这对整个 AI 行业的效率有深远影响
1.4 现有基准的根本缺陷
在 RSIBench-Data 之前,已经有一些相关工作,但它们都存在一个共同问题:混淆了太多因素,无法隔离评估 Agent 的研究能力。
| 已有基准 | 它评估什么 | 核心缺陷 |
|---|---|---|
| DataComp / DataComp-LM | 固定模型下的数据筛选 | 只评估从固定候选池中选择数据,不涉及诊断、生成、闭环迭代 |
| DataEnvGym / Curation-Bench | 学生模型反馈驱动的数据生成 | 引入了反馈闭环,但没有隔离训练/服务/评估基础设施,且不要求 Agent 形成可复用的数据策略 |
| PostTrainBench / Agent² RL-Bench | Agent 能否改进基础模型 | 给了 Agent 过大的控制权(数据、优化、超参、实现全可控),研究决策与系统工程混为一谈 |
问题的本质是:当一个 Agent 跑出了好成绩,你无法判断这是因为它研究能力强(诊断准确、数据策略好),还是因为它工程能力强(换了更好的优化器、调了超参、甚至作弊用了评估数据)。RSIBench-Data 的核心贡献就是把这些因素彻底隔离,让你能纯粹地评估"研究能力”。
二、论文定位和关联工作
RSIBench-Data 处于多个研究脉络的交汇点。理解它的定位,需要理清三条研究线。
2.1 研究脉络一:数据中心化基准(Data-Centric Benchmarks)
这条线关注"固定模型,变数据"。
| 工作 | 核心思想 | 与 RSIBench-Data 的关键区别 |
|---|---|---|
| DataComp(2023) | 固定训练代码,研究从 240T token 候选池中选择/筛选数据的策略 | 只做静态选择,无诊断、无闭环、无生成 |
| DataComp-LM(2024) | 同上,扩展到 412M-7B 参数规模,53 个下游任务 | 同样是静态筛选 |
| AgoraBench / DCA-Bench(2025) | 评估 Agent 能否诊断隐藏的数据缺陷、生成数据集 | 仍是单轮,无迭代反馈 |
| DataEnvGym(2024) | 引入学生模型反馈,Agent 根据学生表现迭代调整数据生成策略 | 最接近的工作,但未隔离基础设施,且不评估前沿 Agent 的跨基准研究能力 |
| Curation-Bench(2026) | 利用反馈跨轮调整数据筛选策略 | 同样缺乏基础设施隔离 |
RSIBench-Data 的突破:它继承了 DataEnvGym 的闭环思想,但做了三件前人没做的事——(1) 完全隔离训练/服务/评估基础设施(Tinker + Harbor + E2B),(2) 评估前沿 Agent 而非简单方法,(3) 要求 Agent 产出可复用的数据策略而非一次性数据集。
2.2 研究脉络二:Agent 训练经验获取
这条线关注"如何为工具使用 Agent 积累训练经验"。
| 工作 | 核心思想 | 与 RSIBench-Data 的关系 |
|---|---|---|
| AgentBank(2024) | 收集 Agent 交互轨迹作为训练数据来源 | RSIBench-Data 的 Agent 可使用类似���子仓库 |
| AgentTrek(2024) | 从网络教程引导生成高质量 GUI Agent 轨迹,每条仅 $0.55 | 代表数据合成的另一种范式,RSIBench-Data 的 Agent 需自主决定采用何种策略 |
| SWE-Gym(2024) | 提供 2,438 个可执行 SWE 任务环境用于训练 Agent | 是 RSIBench-Data 的种子仓库之一,Agent 从中获取参考结构 |
| R2E-Gym(2025) | 最大程序化生成的 SWE 训练环境(8.1K 任务),训练出 34.4% SWE-bench Verified 的开源 Agent | 同样是种子仓库,也是 RSIBench-Data 评估 SWE 能力的参照 |
| SEAL(MIT,2025) | LLM 自主生成合成数据并应用微调策略来自我改进 | RSIBench-Data 评估的正是这类"自主研究"能力的受控版本 |
| Q-Evolve(2026) | 通过过程级监督与策略的协同进化实现稳定的 Agent 自演化 | RSIBench-Data 发现的"验证信号"模式与其理念一致 |
| KARL / SocraticSWE / ICT(2026) | 自动化经验获取系统,用知识探索/历史轨迹/自生成交互构建监督 | 这些是 RSIBench-Data 评估的 Agent 所需具备的能力 |
定位:这些工作提供了"原料"(环境、轨迹、方法),但它们各自评估一个特定方法。RSIBench-Data 反过来问:给定相同的原料和固定的基础设施,不同的前沿 Agent 谁的研究能力更强?
2.3 研究脉络三:自动化后训练基准
这条线最接近 RSIBench-Data,但范围更广。
| 工作 | 核心思想 | 与 RSIBench-Data 的关键区别 |
|---|---|---|
| PostTrainBench(ICML 2026) | 给 Agent 4 个小模型 + H100 + 10 小时,看它能否自动化后训练 | Agent 控制范围过大(数据/优化/超参/实现全可控),无法隔离研究能力。审计还发现了多种"作弊"行为(用官方 instruct 模型替代、直接查评估数据等) |
| Agent² RL-Bench(Microsoft,2026) | 评估 Agent 能否自主设计/实现/运行完整 RL 管线 | 同样范围过广,且聚焦 RL 而非数据中心化研究 |
2.4 RSIBench-Data 的精确定位
论文用一张对比表(Table 1)清晰展示了 RSIBench-Data 在 9 个基准中的独特位置。它是唯一一个同时满足全部六项协议级标准的基准:
| 标准 | DataComp | DataEnvGym | PostTrainBench | Agent²RL | RSIBench-Data |
|---|---|---|---|---|---|
| 可执行经验合成 | ✗ | ✗ | ✗ | ✓ | ✓ |
| 可复用数据策略 | ✗ | ✗ | ✗ | ✗ | ✓ |
| 能力差距诊断 | ✗ | ✓ | ✓ | ✗ | ✓ |
| 反馈驱动修订 | ✗ | ✓ | ✓ | ✗ | ✓ |
| 训练/评估数据隔离 | ✗ | ✗ | ✗ | ✗ | ✓ |
| 服务隔离的训练/服务/评估 | ✗ | ✗ | ✗ | ✗ | ✓ |
定位结论:RSIBench-Data 占据了一个独特的"中间地带"——既不像 DataComp 那样只隔离单一数据操作,也不像 PostTrainBench 那样把整个后训练栈交给 Agent。它精准地切出"研究决策"这一层,固定其余一切,让你能纯粹地看到:这个 Agent 作为研究员,到底行不行。
三、问题定义
3.1 从具体场景到本质抽象
论文面对的具体场景很复杂:Agent 要在软件工程、终端操作、科学问答、数学等多个领域,为 Qwen3.5-35B 模型设计后训练数据。但论文的洞察是,剥去所有领域外衣后,这是一个有界资源下的序贯决策问题。
我们用类比来理解这个抽象。想象研究员 Agent 是一个"矿工":
- 矿山:一个有待改进的目标模型 M₀ 和它的失败证据 S
- 挖矿工具:固定的训练服务(Tinker LoRA SFT)和评估沙箱(Harbor + E2B)
- 每一镐:Agent 提出的一套训练数据策略(D_t)和配置(c_t)
- 矿石品位反馈:训练出的检查点 M_t 在选择评估中的分数和轨迹诊断
- 预算:固定的时间(16 小时)和金钱($500 Tinker 预算)
- 最终交付:从所有挖出的矿石中,选一块最好的上交
3.2 形式化定义
论文给出了精确的数学形式化:
给定:固定基础模型 M₀、基准证据 S(目标描述、成功标准、种子仓库、基础模型诊断)、资源预算 𝒞
研究策略 π 在每一轮 t:
- 观察 S 和历史 H_{<t}
- 提出训练数据 D_t 和白名单配置 c_t:$(D_t, c_t) = \pi(S, H_{
- 训练检查点:$M_t = \text{Train}(M_0, D_t; c_t)$
- 获得受控反馈:$h_t = \text{Eval}_{\text{sel}}(M_t)$(分数、轨迹、验证器结果、执行诊断)
在 T 次尝试后,Agent 在观察官方结果之前选择一个检查点 $M_{t^\star}$
评估:官方性能 $s_{\text{off}}(\pi) = \text{Eval}_{\text{off}}(M_{t^\star})$,改进量 $\Delta_{\text{off}}(\pi) = s_{\text{off}}(\pi) - \text{Eval}_{\text{off}}(M_0)$
3.3 这个抽象的精妙之处
这个定义有两个关键的"分离"设计,体现了论文的深刻洞察:
Agent 只能改训练经验,不能改基础设施——优化器、服务路径、评估沙箱、验证器、评分规则全部固定共享。这意味着性能差异只能归因于 Agent 的数据策略决策,排除了工程因素的干扰。
用选择反馈而非官方结果进行迭代——Agent 在迭代过程中看到的是"选择评估"(dev set 性质),最终提交后看到的是"官方评估"(test set 性质)。这两者分离,迫使 Agent 必须真正理解失败模式,而不能直接优化测试指标。
这两个分离让 RSIBench-Data 具备了可归因性(Attributability):每一次性能变化都能追溯到具体的策略决策,而不是被基础设施变化掩盖。
四、问题解法
RSIBench-Data 的"解法"不是提出一个新算法,而是设计一个受控评估协议,把研究能力从系统工程中隔离出来。下面逐层拆解。
4.1 固定基础设施:把"变量"锁定
这是整个基准的基石。论文定义了清晰的"边界":
边界内(Agent 可以自由决策):
- 构建什么样的训练经验(任务、轨迹、监督信号)
- 通过白名单配置接口决定如何暴露给训练(学习率、LoRA rank、训练步数等)
边界外(所有 Agent 完全相同,固定共享):
- 基础模型:Qwen/Qwen3.5-35B-A3B-Base(所有 Agent 改进的同一个模型)
- 优化器:固定的 Tinker LoRA SFT 后端
- 服务路径:相同的采样器接口
- 评估沙箱:Harbor 在 E2B 中编排
- 验证器和评分规则:官方的
每次尝试的完整流程:
Agent 提交:消息格式监督 + 白名单训练配置
↓
运行器验证工件 → 调用 Tinker LoRA SFT 从 M₀ 训练
↓
生成检查点 M_t → 通过固定采样器接口服务
↓
评估者通过固定服务边界查询 → Harbor 在 E2B 沙箱中执行
↓
返回受控证据给 Agent:分数 + 轨迹 + 验证器结果 + 执行诊断 + token用量 + 成本 + 耗时
这里需要解释几个关键组件:
Tinker 是 Thinking Machines Lab(Mira Murati 创立)于 2025 年 10 月发布的云端 LoRA 训练 API。它的核心理念是"你写训练循环,它管 GPU"——支持从 1B 到 1T+ 参数的模型,LoRA 适配器训练在正确设置下能达到全量微调的效果。RSIBench-Data 用它作为统一训练后端,确保所有 Agent 的训练实现完全一致。
Harbor 是 Terminal-Bench 创建者开发的 Agent 评估框架(GitHub 3600+ star),支持 Docker、Daytona、E2B、Modal 等多种执行环境。RSIBench-Data 用它在 E2B 云沙箱中运行官方评估,确保评估环境完全隔离和一致。
E2B 是一个提供快速启动云沙箱的平台,支持基于模板的环境、自动超时处理、文件上传下载。它为每次评估提供干净的隔离环境。
4.2 Agent 的输入与数据约束
每个 Agent 收到的输入 S 包括:目标基准描述、成功标准、任务匹配的公共种子仓库/示例、工具和环境模式、基础模型诊断、资源预算。
关键约束:评估专用任务、标签、轨迹等受保护材料绝对不能用作训练监督。这种分离确保 Agent 必须真正"理解"失败模式来生成数据,而不是把评估答案搬进训练集。这条规则直击 PostTrainBench 审计中发现的"作弊"问题。
4.3 闭环数据合成研究循环
这是 Agent 的核心工作过程。论文明确指出,这些是 Agent 自主选择的策略空间,而非基准规定的固定阶段:
每轮 Agent 可以做的事:
| 决策维度 | 具体选择 |
|---|---|
| 诊断能力差距 | 按能力/错误类型/任务系列/工具/交互长度组织失败;区分知识缺失与推理/规划/工具使用/恢复/验证失败 |
| 合成训练经验 | 选择数据来源;构造任务和初始执行状态;生成成功/失败/恢复轨迹;决定监督哪些轮次(完整轨迹/决策点/最终动作/批评/修复) |
| 验证和组织 | 用可执行环境/辅助验证器/答案一致性/模式检查过滤;截断压缩长轨迹;设计难度课程和数据混合 |
| 修订策略 | 替换数据源、调整覆盖范围、改变轨迹表示、加强验证器、调整过滤阈值、重新平衡课程 |
| 管理搜索 | 预算分配、回滚、停止、最终检查点选择 |
共享 SFT 训练:所有 Agent 用同一个 Tinker LoRA 后端,提交的工件必须满足统一的数据契约(消息格式监督),训练配置只能从白名单中选择。
4.4 最终检查点选择与官方评估
完成所有尝试后,Agent 从自己产出的所有检查点中选择一个提交——注意,这个选择是在看到官方结果之前做出的,Agent 只能依据选择评估的反馈来判断。然后评估者在目标基准的测试集上评估所选检查点,报告其性能作为最终分数。
这个设计非常巧妙:它同时考察了 Agent 的两个能力——生成能力强检查点的能力和识别最佳检查点的判断力。论文数据显示,选择峰值与官方评估分数平均相差 3.89 个百分点,说明 Agent 的选择能力总体不错,但并非完美。
五、评估指标与实验证据
5.1 评估体系总览
RSIBench-Data 的评估不是只看一个最终分数,而是一个多层体系:
| 层次 | 指标 | 衡量什么 |
|---|---|---|
| 主指标 | 所选检查点的官方基准原生分数 + 相对基础模型的改进 Δ_off | Agent 最终能交付多好的模型 |
| 过程指标 | 有效候选数、迭代轨迹、首候选 vs 最佳候选、成本/时间 | Agent 的研究过程效率和质量 |
| 诊断指标 | 四种强运行模式的出现频率、推理强度的影响 | 解释为什么有些 Agent 表现更好 |
5.2 实验设置
测试的 4 个前沿研究员 Agent:
| Agent | 底层模型 | 推理强度 |
|---|---|---|
| Claude Code | Opus-4.8 | High |
| Claude Code | Sonnet-5 | High |
| Codex | gpt-5.6-sol | Max |
| Codex | gpt-5.6-terra | Max |
所有实验中,Claude Opus 4.8 固定为外部 rollout 模型(生成推理轨迹、工具使用序列)。
6 个评估基准(覆盖四大领域):
| 基准 | 领域 | 评估项数 | 评估运行器 | 基础模型参考分 |
|---|---|---|---|---|
| SWE-bench Verified | 软件工程 | 100 | Mini-SWE-Agent | 12.00% |
| SWE-bench Multilingual | 多语言软件工程 | 100 | Mini-SWE-Agent | 7.00% |
| SWE-bench Pro | 高难度软件工程 | 100 | Mini-SWE-Agent | 0.00% |
| Terminal-Bench 2.0 | 终端工具使用 | 89 | Terminus-2 | 1.12% |
| GPQA Diamond | 科学问答 | 100 | Terminus-2 | 61.00% |
| AIME 2026 | 数学推理 | 30(×4) | Terminus-2 | 30.00% |
预算:每次运行名义 16 小时墙钟时间 + $500 Tinker 预算。
5.3 主实验结果
以下是所有 Agent × 基准组合的官方性能(加粗为该基准最佳):
| 基准 | Base | Claude Opus-4.8 | Claude Sonnet-5 | Codex gpt-5.6-sol | Codex gpt-5.6-terra |
|---|---|---|---|---|---|
| SWE-bench Verified | 12.00% | 46.00% | 35.00% | 33.00% | 42.00% |
| SWE-bench Multilingual | 7.00% | 5.00% | 22.00% | 15.00% | 6.00% |
| SWE-bench Pro | 0.00% | 2.00% | 4.00% | 9.00% | 1.00% |
| GPQA Diamond | 61.00% | 56.00% | 52.00% | 65.00% | 64.00% |
| AIME 2026 | 30.00% | 40.83% | 49.17% | 53.33% | 33.33% |
| Terminal-Bench 2.0 | 1.12% | 10.11% | 5.62% | 20.22% | 12.36% |
这些数字说明了什么?
没有 Agent 全面占优:Codex gpt-5.6-sol 在 3 个非 SWE 基准(GPQA、AIME、Terminal-Bench)领先,但 3 个 SWE 基准由 3 个不同 Agent 分别获胜。这说明数据中心化研究能力是任务依赖的。
一些检查点甚至低于基础模型:Claude Opus-4.8 在 SWE-bench Multilingual 上只有 5.00%(base 为 7.00%),在 GPQA 上 56.00%(base 为 61.00%)。这证明糟糕的数据策略可能有害——训练数据不仅没帮助,反而破坏了模型原有能力。
绝对性能仍然较低:SWE-bench Pro 最佳仅 9.00%,Terminal-Bench 最佳仅 20.22%。这说明当前 Agent 在最困难的任务上,研究能力仍有很大提升空间。
5.4 两个核心发现:58.33% 与 78.26%
这两个数字是论文最重磅的实验结论,构成了"发现-可靠性差距"。
发现能力:58.33% 的设置中迭代有效
在 24 个有效设置(4 Agent × 6 基准)中,**14 个(58.33%)**的后续候选优于第一个有效候选。这意味着 Agent 已经展现出数据中心研究员的核心能力——能从反馈中学习并改进。
但这个改进高度依赖基准:AIME 2026 在 4 个 Agent 中有 3 个改进,中位数增益达 25.42 个百分点;而 GPQA Diamond 从已经较强的起点出发,中位数仅获得 4.00 点增益。
可靠性缺陷:78.26% 的后续搜索退化
这是更令人警醒的发现。在 23 个达到最佳选择分数后继续搜索的设置中:
- 18 个(78.26%)最终尝试的候选分数低于历史峰值
- **5 个(21.74%)**仅恢复到相同峰值
- 0 个在达到峰值后继续改进
这意味着:一个强候选可能出现在搜索早期或中途,即使 Agent 后来观察到更多反馈并修订策略,也无法超越它。 历史最佳选择机制虽然能保护提交的检查点不被回退,但它并不能让底层研究过程变得可靠地渐进。
为什么这个实验设计能证明论文的核心主张?
论文的核心主张是"Agent 有发现能力但缺乏可靠性"。这个 24 设置 × 迭代轨迹的实验设计,通过以下逻辑链证明了这一点:
- 如果 Agent 研究能力成熟 → 应该看到迭代单调改进
- 实际看到 58.33% 改进但 78.26% 后续退化 → 证明了"能力存在但不稳定"
- 这个差距不是因为基础设施差异(已隔离)或预算不足(预算固定且多数运行未耗尽)→ 差异只能归因于 Agent 的研究决策质量
5.5 推理强度的机制实验
在 SWE-bench Verified 上对 Claude Code Sonnet-5 做 High vs Max 推理强度的对照实验:
| 指标 | High Effort | Max Effort |
|---|---|---|
| 首个候选分数 | 25% | 36% |
| 历史最佳选择分数 | 44% | 49% |
| 官方分数 | 35% | 52% |
| 训练记录数 | 50 | 149 |
| 可训练助手轮次 | 595 | 2,681 |
| 有效尝试数 | — | 少一次 |
结论:更��的推理强度让 Agent 更早找到更强候选,构建更资源密集的训练数据程序,但减少了固定预算内的候选数量。这是一个深度-广度权衡。这个实验之所以有证明力,是因为它单独改变了 Agent 的一个属性(推理强度),其余条件完全相同,从而干净地建立了因果关系。
六、效果优势的根源解释
论文最精彩的部分不是数字,而是它对"为什么有些 Agent × 基准组合成功、另一些失败"的机制级因果分析。论文通过逐次尝试的轨迹编码,将分数变化与具体的策略决策联系起来,识别出强运行的四种模式。我们逐一从根源解释。
6.1 模式一:准确诊断真实能力差距
观察:Claude Code Sonnet-5 在 AIME 2026 上,前 8 次有效尝试的选择分数从未超过 15.00%。第 9 次突然跳升至 55.00%,第 10 次达到 55.83%。后续候选在 47.50%-55.83% 之间波动,但再未超越。
根源解释:为什么前 8 次无效而第 9 次突破?
关键在于"能力假设"的质变。前 8 次的失败,根因是 Agent 对"模型缺什么"的诊断是错的——它可能在做局部修订(微调数据量、调整难度比例),但这些修订没有改变有效的数据策略,只是在同一错误假设上打转。
第 9 次的突破,是 Agent 终于诊断出了定性不同的能力假设——比如认识到问题不在计算量而在推理链条的结构,或者不在题目覆盖而在答案验证机制。AIME 的答案一致性过滤(answer consistency filtering)正是这种"质变假设"的体现:它不再只是增加更多数学题,而是用一个可判定的验证信号来筛选数据。
因果链:错误假设 → 局部修订不改变有效数据分布 → 训练检查点无实质改进 → 分数停滞;识别真实差距 → 质变假设 → 数据策略根本性改变 → 分数跳跃。
这个模式的普适启示是:当局部修订不奏效时,Agent 需要识别"我在同一个错误上打转",转而搜索定性不同的假设。
6.2 模式二:嵌入可执行的验证信号
观察:跨多个成功案例——AIME 用答案一致性过滤、SWE-bench Pro 用环境成功轨迹、Terminal-Bench 2.0 用沙箱执行与显式任务结果。
根源解释:为什么"验证信号"如此关键?
这是关于监督质量的信息论根源。如果 Agent 只用模型自我判断(“这条轨迹看起来对不对”)来筛选数据,监督信号是主观的、不可判定的——模型可能把错误的行为判断为正确的,因为它的判断能力和它需要学习的能力是同一个模型。
而可执行的验证信号(代码能不能跑通、数学答案对不对、终端命令是否产生预期输出)是客观的、可判定的——它来自外部环境,不受模型自身能力限制。
因果链:自我判断筛选 → 错误样本混入 → 监督信号被污染 → 训练强化了错误行为 → 分数低或退化;可执行验证 → 错误样本被滤除 → 监督信号纯净 → 训练强化正确行为 → 分数提升。
这与 Q-Evolve 的"分布内过程监督"理念一致:稳定的自进化需要过程级监督与策略的协同进化,而过程级监督必须基于可判定的信号。
6.3 模式三:监督匹配目标行为
观察:在 SWE-bench Verified 上,最终动作数据(final-action data,只监督最后的提交动��)达到 39.00% 选择分数,而全轮数据(all-turn)和安全变体(safe)仅达 8.00% 和 9.00%。在 SWE-bench Pro 上,基于合成完成动作的变体回退至 7.00%,而基于真实提交行为的关闭数据达到 9.00%。
根源解释:为什么监督粒度和动作源是关键变量?
这是关于监督与评估行为的分布对齐。SWE-bench 的评估是:给模型一个问题,让它生成一个 patch,检查 patch 能否通过测试。评估只看最终动作的质量。
如果训练数据监督的是完整轨迹(所有中间轮次),模型学到的是"如何走完整个对话",但评估不奖励对话过程,只奖励最终 patch。全轮监督引入了大量与评估目标无关的梯度信号,稀释了对最终动作的优化。
更糟的是"安全变体"(safe variant,过滤掉某些轮次)——它可能破坏了轨迹的因果结构,让模型学到的是"什么时候该停止"而非"如何产生正确的最终动作"。
因果链:全轮监督 → 梯度信号被稀释到无关轮次 → 最终动作的优化不充分 → 评估分数低;最终动作监督 → 梯度信号集中 → 直接优化评估目标 → 评估分数高。
这个发现深刻地指出:数据量不是关键,数据是否对齐评估行为才是关键。
6.4 模式四:保留历史最佳候选
观察:Claude Code Sonnet-5 在 AIME 上第 10 个有效候选首次达到 55.83% 峰值,后续候选从未超越;Codex gpt-5.6-sol 在 SWE-bench Pro 上第 9 轮达到峰值;在 Terminal-Bench 上第 2 个有效候选达到峰值后退化。
根源解释:为什么"保留"如此重要,而 Agent 普遍做不到一致地超越峰值?
这涉及非平稳搜索中的探索-利用困境。一旦 Agent 找到一个强候选,它处于两难:利用当前配方(但可能过拟合这一个数据点)、探索新假设(但可能回退)。论文的 78.26% 退化率证明,当前 Agent 在这个权衡上系统性偏向过度探索——它们倾向于认为"再来一次会更好",但实际新策略的期望收益低于当前峰值。
历史最佳选择机制是一个工程补丁而非研究能力提升——它通过外部记忆保住了强候选,但 Agent 自身并没有真正学会"什么时候该停止"。这也解释了为什么论文强调"有效的停止和策略修订对于高效搜索仍然必要"。
因果链:无保留机制 → 后续退化直接伤害最终提交分数;有保留机制 → 保护提交分数但无法提升底层研究可靠性;真正的解决方案需要 Agent 学会基于反馈置信度做出停止/继续决策。
6.5 反事实:同族 RSI 早期实验
论文还做了一个发人深省的反事实实验:用 Claude Code(kimi-k2.6 驱动)作为研究员,改进 Kimi-K2.6 指令模型(一个已经很强的模型),在 SWE-bench Pro 上评估。
结果:Agent 将性能从 8% 提升到 21%,展现了清晰的策略演化能力,但每个检查点都低于 33% 的未适配参考分数。
根源:当目标模型已经是一个强大的指令模型时,研究员需要发现能进一步提升它的训练分布——这比从头改进一个 base 模型困难得多,因为可改进的空间更窄、更需要精细的数据策略。当前研究员的 RSI 能力还不足以应对这个挑战。
这个反事实实验反证了:RSIBench-Data 揭示的"发现-可靠性差距"在更难的设定下会放大——RSI 不是简单的"能跑通就行",目标越强,对研究能力的要求越高。
七、必要知识反推
要完成 RSIBench-Data 这个工作,作者团队必须掌握并融合以下知识。
7.1 领域知识层
递归自我改进的理论与实践:理解 RSI 的定义、历史脉络(从 Eliezer Yudkowsky 的"Seed AI"到 Anthropic 的工程实践)、核心挑战(失败转化、自我评估、稳定性)。不理解 RSI 的深层含义,就无法把"数据中心化研究"定位为 RSI 的关键子问题。
后训练方法论:深入理解 LoRA 微调的机制与局限(正确设置下能达到全量微调效果)、SFT 与 RL 的差异、数据质量对训练的影响。论文选择 LoRA SFT 而非全量微调或 RL,是经过权衡的——它既有足够的表达能力,又能在固定预算内快速迭代。
Agent 评估生态:熟悉 SWE-bench 系列(Verified/Multilingual/Pro 的区别与互补)、Terminal-Bench、GPQA、AIME 各自评估什么能力、为什么这些基准能区分方法优劣。这决定了实验设计是否有证明力。
7.2 方法论知识层
受控实验设计原则:如何通过"固定基础设施、隔离研究决策"来实现可归因性。这是论文最核心的方法论贡献——它借鉴了 DataComp"固定模型变数据"的理念,但把它提升到了"固定整个栈,只变研究策略"的层面。
基准设计理论:理解一个好用基准需要满足什么——区分度、可复现性、抗作弊性、可审计性。论文对 PostTrainBench 作弊行为的引用、对训练/评估数据隔离的强调,都体现了这种知识。
序贯决策与搜索理论:理解迭代搜索中的探索-利用权衡、非平稳性、预算约束下的最优停止。这些知识支撑了论文对"78.26% 退化"的深度分析。
7.3 工程知识层
Tinker API:如何用 Tinker 进行 LoRA SFT 训练、如何配置训练客户端、如何采样。论文需要确保所有 Agent 用完全相同的方式训练。
Harbor 框架:如何用 Harbor 在 E2B 中编排评估、如何配置并发、如何隔离环境。这是评估可审计性的工程基础。
多 Agent 系统集成:如何让 Claude Code 和 Codex 这种 CLI Agent 在统一接口下工作、如何管理 rollout 模型(Claude Opus 4.8)的调用。
7.4 知识融合的关键节点
最有创造性的是**“隔离"理念与"闭环研究"理念的融合**:
- DataComp 教会了"固定栈变数据”,但它只做静态选择
- DataEnvGym 教会了"闭环反馈迭代",但它没有隔离基础设施
- RSIBench-Data 的洞察是:把这两者结合——既闭环迭代,又完全隔离——就能第一次纯粹地评估"研究能力"
第二个融合节点是**“研究能力"的形式化**。论文没有停留在"看谁的模型分数高”,而是把研究过程本身定义为一个可量化、可审计的对象:每一次假设、每一个数据策略、每一次反馈修订都被记录和编码。这种"过程即结果"的评估范式,是把心理学/科学哲学中的"研究方法论"工程化的尝试。
八、通用性灵感
RSIBench-Data 的发现不仅适用于 AI 后训练,还蕴含着可推广到更广领域的普适性原理。
灵感一:发现-可靠性差距是智能体自主研究的普遍特征
核心思想:一个智能系统能"偶尔发现好东西"(discovery)和能"可靠地把反馈转化为持续改进"(reliability)是两种本质不同的能力。前者只需要偶尔的洞察,后者需要稳定的因果推理和自我校准。
论文证据:58.33% 的设置有发现 vs 78.26% 的后续搜索退化。这两者的并存证明了它们是分离的能力维度。
推广场景:
- 自动化科研系统:AI Scientist 能否稳定地从实验反馈中改进假设?发现一个好假设 ≠ 能持续改进它
- 自动化运维(AIOps):系统能发现一个优化 ≠ 能可靠地迭代优化而不引入回归
- 产品迭代:一个团队能做出一个爆款功能 ≠ 能持续产出好功能——发现与可靠性需要不同的组织能力
- 个人学习:理解一个概念 ≠ 能稳定地应用它——间隔重复、刻意练习解决的就是"可靠性"问题
灵感二:用可执行验证信号替代主观判断
核心思想:在任何需要质量评估的自主系统中,优先使用可执行的、可判定的外部验证(代码能否运行、答案是否正确、约束是否满足),而非系统的自我判断。
论文证据:AIME 答案一致性、SWE-bench Pro 环境成功、Terminal-Bench 沙箱执行——所有强运行都使用了某种形式的可执行验证。
推广场景:
- 自动化代码审查:用测试覆盖率/CI 结果替代 LLM 的"这段代码看起来对不对"
- 教育系统:用可判定的练习(编程题、数学题)替代主观评分,给学生更可靠的反馈
- 内容审核:用规则引擎 + 事实核查 API 替代纯模型判断,降低误判率
- 科学研究:用可复现的实验结果替代"论文说它有效"——可执行验证是科学方法的核心
灵感三:监督必须对齐目标行为
核心思想:在训练/优化任何系统时,监督信号的粒度和来源必须与你最终要评估的行为严格对齐。监督过多无关信息会稀释优化信号,监督来源错误会学到错误模式。
论文证据:最终动作数据 39.00% vs 全轮数据 8.00%;真实提交行为 9.00% vs 合成完成 7.00%。
推广场景:
- 员工培训:如果最终考核的是"独立完成项目",培训就不该主要练"旁观别人做项目"——监督要对齐目标行为
- 体育训练:如果比赛考的是实战对抗,训练就不能只练固定套路——需要场景化训练
- 推荐系统:如果目标是长期留存,就不该只优化点击率——监督信号要对齐长期价值
- 教育评估:如果目标是"能解决真实问题",考试就不该只考"能复述知识点"
灵感四:受控隔离是评估"研究能力"的前提
核心思想:要纯粹评估一个智能体的"研究/决策能力",必须把它从"工程/执行能力"中隔离出来——固定工具、固定资源、固定评估,只让决策变化。否则你无法区分"他研究能力强"和"他工具用得好"。
论文证据:RSIBench-Data 固定 Tinker 训练 + Harbor 评估 + E2B 沙箱,使性能差异只能归因于数据策略决策。对比 PostTrainBench 让 Agent 控制一切,导致无法归因。
推广场景:
- 招聘评估:要评估候选人的"分析决策能力",就应固定数据源和工具,只让他做决策——而非让他自由选择一切
- AI Agent 采购:评估不同 Agent 时,固定任务定义和评估标准,只让 Agent 策略变化
- 科研评审:同行评审隔离"想法质量"与"实验资源"——应该评估想法本身的洞见,而非实验室规模
- 教育评估:标准化考试的意义正在于此——固定条件,隔离出"学生能力"这个变量
灵感五:非单调搜索需要明确的停止/回滚策略
核心思想:在任何迭代搜索/优化过程中,改进几乎从不是单调的。一个自主系统如果不具备"识别峰值并停止/回滚"的能力,就会在过度探索中退化。历史最佳记忆是补丁,真正的能力是基于反馈置信度的自适应停止。
论文证据:78.26% 的峰值后搜索退化;历史最佳选择保住分数但底层过程仍不可靠。
推广场景:
- 投资决策:找到好标的后,何时停止研究继续买入?过度研究可能引入噪声——需要基于信息增益的自适应停止规则
- 产品迭代:一个功能达到局部最优后,何时停止 A/B 测试转而探索新方向?需要量化"继续迭代的期望收益"
- 学术论文写作:何时停止修改提交?无限修改可能让论文变差——需要基于审稿反馈的置信度判断
- 强化学习:训练何时早停?这正是 RL 中 early stopping 和 checkpoint selection 解决的问题——但当前 LLM Agent 在"研究"层面缺乏类似机制
总结
RSIBench-Data 做了一件重要且此前没人做的事:把"LLM Agent 能否当好 AI 研究员"这个问题,从一个模糊的愿景变成了一个可量化、可审计、可归因的基准。
它的核心贡献不在于提出了一个更强的 Agent 或方法,而在于精准地切出了"研究决策"这一层,通过固定一切基础设施,让我们第一次能纯粹地看到:当前最强的 Agent(Claude Opus-4.8、Codex gpt-5.6-sol 等)在作为研究员时,有发现能力但缺乏可靠性。
58.33% 的发现率和 78.26% 的退化率,这两个数字将长期作为衡量"AI 自主研究能力成熟度"的基准线。而四种强运行模式——准确假设、验证信号、行为对齐数据、检查点保留——则为未来改进 Agent 研究能力提供了明确的路线图。
对于关注 RSI、AI 自进化、自动化 AI 研究的读者,这篇论文是一个必读的里程碑:它既诊断了现状,也指明了方向。