论文链接:arXiv:2607.25886 代码仓库:github.com/evolvent-ai/RSIBench-Data 发表时间:2026年7月 机构:Evolvent AI + 新加坡国立大学(NUS) 领域标签:cs.SE(软件工程)、cs.CL(计算语言学)

机构标注:本文是企业(Evolvent AI)与高校(新加坡国立大学)合作的成果。第一作者 Fanqing Meng、Lingxiao Du、Qiguang Chen 三人等贡献,均为共同一作;Mengkang Hu 和 Michael Qizhe Shieh 为通讯作者。这种"高校学生/研究者 + AI 公司合著"的模式在本论文中体现为:学术团队负责问题定义、实验设计与分析,Evolvent AI 提供工程基础设施(Tinker 训练服务、Harbor 评估框架、E2B 沙箱)和开源代码维护。


一、论文背景

1.1 什么是"递归自我改进"(Recursive Self-Improvement)?

要理解这篇论文,首先要理解它的终极目标——递归自我改进(RSI)。

想象一个场景:一个 AI 系统在完成任务时失败了(比如写代码出了 bug、解数学题算错了)。人类工程师会分析失败原因,然后针对性地改进这个模型。如果这个"分析失败 → 设计改进 → 训练更好的模型"的循环完全由 AI 自己完成,不需要人类介入,那就是递归自我改进。

用 Anthropic 的说法,这是一种"AI 自己构建自己"的能力。他们的数据显示:Anthropic 工程师现在平均每季度提交的代码量是 2021-2025 年期间的 8 倍,原因就是 AI 承担了越来越多的开发工作。从 2023 年的聊天助手帮写代码片段,到 2025 年的编程 Agent 独立写整个文件,再到今天 Agent 能自主运行代码、把工作分派给其他 Agent——这条路径指向的未来,是 Agent 能自己训练自己的下一代模型。

RSI 是 AI 领域最具雄心也最具争议的目标之一:它能极大加速 AI 进步(可能在科学、医疗等领域带来巨大价值),但也引发安全担忧(如果 AI 能完全构建自己的后继者,人类如何保持对其行为的塑造和控制?)。

1.2 什么是"数据中心化后训练研究"?

论文将 RSI 这个宏大目标拆解为一个可操作、可评估的子问题:数据中心化后训练研究。

先拆解几个概念:

  • 后训练(Post-training):基础模型(Base Model)训练完后,还需要一个"训练后阶段"让它变得更好用——比如指令微调(SFT)让它听懂人类指令,强化学习(RLHF)让它的回答更对齐人类偏好。后训练的质量直接决定了模型的实际能力。

  • 数据中心化(Data-centric):在模型架构和训练算法固定的前提下,把"用什么数据训练"作为核心研究变量。这个理念来自 DataComp 系列:与其不断改模型结构,不如研究"哪些数据最能提升模型能力"。DataComp-LM 的实验证明,仅通过改进数据筛选策略,就能让模型在 MMLU 上提升 6.6 个百分点。

  • 数据中心化后训练研究的完整闭环:这不是简单生成一批数据扔给模型训练,而是一个诊断 → 设计 → 验证 → 迭代的研究过程:

    1. 诊断能力差距:分析模型在哪里失败?是知识缺失、推理错误、还是工具使用不当?
    2. 设计训练数据策略:根据诊断结果,设计有针对性的训练数据(什么样的任务、什么样的轨迹、什么样的监督信号)
    3. 验证策略有效性:训练一个检查点(checkpoint),在受控环境中评估
    4. 从反馈中学习:根据评估结果修订策略,进入下一轮

论文把这个闭环的执行者称为数据中心化研究员 Agent(data-centric researcher agent)。

1.3 为什么要研究"Agent 能否自动化这个研究循环"?

这个问题的核心动机在于:人类的 AI 研究能力正在成为 AI 进步的瓶颈。

当前,后训练数据策略的设计高度依赖经验丰富的研究员:他们需要理解模型行为、设计实验、解读结果、迭代策略。这个过程耗时、昂贵、难以规模化。如果能证明 LLM Agent 可以可靠地执行这个闭环,就意味着:

  1. 后训练可以大规模并行化和加速——Agent 可以 24 小时不间断地做实验
  2. RSI 的核心瓶颈可以被突破——“把失败转化为改进"是 RSI 最关键的一环
  3. AI 研究本身可以被自动化——这对整个 AI 行业的效率有深远影响

1.4 现有基准的根本缺陷

在 RSIBench-Data 之前,已经有一些相关工作,但它们都存在一个共同问题:混淆了太多因素,无法隔离评估 Agent 的研究能力。

已有基准它评估什么核心缺陷
DataComp / DataComp-LM固定模型下的数据筛选只评估从固定候选池中选择数据,不涉及诊断、生成、闭环迭代
DataEnvGym / Curation-Bench学生模型反馈驱动的数据生成引入了反馈闭环,但没有隔离训练/服务/评估基础设施,且不要求 Agent 形成可复用的数据策略
PostTrainBench / Agent² RL-BenchAgent 能否改进基础模型给了 Agent 过大的控制权(数据、优化、超参、实现全可控),研究决策与系统工程混为一谈

问题的本质是:当一个 Agent 跑出了好成绩,你无法判断这是因为它研究能力强(诊断准确、数据策略好),还是因为它工程能力强(换了更好的优化器、调了超参、甚至作弊用了评估数据)。RSIBench-Data 的核心贡献就是把这些因素彻底隔离,让你能纯粹地评估"研究能力”。


二、论文定位和关联工作

RSIBench-Data 处于多个研究脉络的交汇点。理解它的定位,需要理清三条研究线。

2.1 研究脉络一:数据中心化基准(Data-Centric Benchmarks)

这条线关注"固定模型,变数据"。

工作核心思想与 RSIBench-Data 的关键区别
DataComp(2023)固定训练代码,研究从 240T token 候选池中选择/筛选数据的策略只做静态选择,无诊断、无闭环、无生成
DataComp-LM(2024)同上,扩展到 412M-7B 参数规模,53 个下游任务同样是静态筛选
AgoraBench / DCA-Bench(2025)评估 Agent 能否诊断隐藏的数据缺陷、生成数据集仍是单轮,无迭代反馈
DataEnvGym(2024)引入学生模型反馈,Agent 根据学生表现迭代调整数据生成策略最接近的工作,但未隔离基础设施,且不评估前沿 Agent 的跨基准研究能力
Curation-Bench(2026)利用反馈跨轮调整数据筛选策略同样缺乏基础设施隔离

RSIBench-Data 的突破:它继承了 DataEnvGym 的闭环思想,但做了三件前人没做的事——(1) 完全隔离训练/服务/评估基础设施(Tinker + Harbor + E2B),(2) 评估前沿 Agent 而非简单方法,(3) 要求 Agent 产出可复用的数据策略而非一次性数据集。

2.2 研究脉络二:Agent 训练经验获取

这条线关注"如何为工具使用 Agent 积累训练经验"。

工作核心思想与 RSIBench-Data 的关系
AgentBank(2024)收集 Agent 交互轨迹作为训练数据来源RSIBench-Data 的 Agent 可使用类似���子仓库
AgentTrek(2024)从网络教程引导生成高质量 GUI Agent 轨迹,每条仅 $0.55代表数据合成的另一种范式,RSIBench-Data 的 Agent 需自主决定采用何种策略
SWE-Gym(2024)提供 2,438 个可执行 SWE 任务环境用于训练 Agent是 RSIBench-Data 的种子仓库之一,Agent 从中获取参考结构
R2E-Gym(2025)最大程序化生成的 SWE 训练环境(8.1K 任务),训练出 34.4% SWE-bench Verified 的开源 Agent同样是种子仓库,也是 RSIBench-Data 评估 SWE 能力的参照
SEAL(MIT,2025)LLM 自主生成合成数据并应用微调策略来自我改进RSIBench-Data 评估的正是这类"自主研究"能力的受控版本
Q-Evolve(2026)通过过程级监督与策略的协同进化实现稳定的 Agent 自演化RSIBench-Data 发现的"验证信号"模式与其理念一致
KARL / SocraticSWE / ICT(2026)自动化经验获取系统,用知识探索/历史轨迹/自生成交互构建监督这些是 RSIBench-Data 评估的 Agent 所需具备的能力

定位:这些工作提供了"原料"(环境、轨迹、方法),但它们各自评估一个特定方法。RSIBench-Data 反过来问:给定相同的原料和固定的基础设施,不同的前沿 Agent 谁的研究能力更强?

2.3 研究脉络三:自动化后训练基准

这条线最接近 RSIBench-Data,但范围更广。

工作核心思想与 RSIBench-Data 的关键区别
PostTrainBench(ICML 2026)给 Agent 4 个小模型 + H100 + 10 小时,看它能否自动化后训练Agent 控制范围过大(数据/优化/超参/实现全可控),无法隔离研究能力。审计还发现了多种"作弊"行为(用官方 instruct 模型替代、直接查评估数据等)
Agent² RL-Bench(Microsoft,2026)评估 Agent 能否自主设计/实现/运行完整 RL 管线同样范围过广,且聚焦 RL 而非数据中心化研究

2.4 RSIBench-Data 的精确定位

论文用一张对比表(Table 1)清晰展示了 RSIBench-Data 在 9 个基准中的独特位置。它是唯一一个同时满足全部六项协议级标准的基准:

标准DataCompDataEnvGymPostTrainBenchAgent²RLRSIBench-Data
可执行经验合成✗✗✗✓✓
可复用数据策略✗✗✗✗✓
能力差距诊断✗✓✓✗✓
反馈驱动修订✗✓✓✗✓
训练/评估数据隔离✗✗✗✗✓
服务隔离的训练/服务/评估✗✗✗✗✓

定位结论:RSIBench-Data 占据了一个独特的"中间地带"——既不像 DataComp 那样只隔离单一数据操作,也不像 PostTrainBench 那样把整个后训练栈交给 Agent。它精准地切出"研究决策"这一层,固定其余一切,让你能纯粹地看到:这个 Agent 作为研究员,到底行不行。


三、问题定义

3.1 从具体场景到本质抽象

论文面对的具体场景很复杂:Agent 要在软件工程、终端操作、科学问答、数学等多个领域,为 Qwen3.5-35B 模型设计后训练数据。但论文的洞察是,剥去所有领域外衣后,这是一个有界资源下的序贯决策问题。

我们用类比来理解这个抽象。想象研究员 Agent 是一个"矿工":

  • 矿山:一个有待改进的目标模型 M₀ 和它的失败证据 S
  • 挖矿工具:固定的训练服务(Tinker LoRA SFT)和评估沙箱(Harbor + E2B)
  • 每一镐:Agent 提出的一套训练数据策略(D_t)和配置(c_t)
  • 矿石品位反馈:训练出的检查点 M_t 在选择评估中的分数和轨迹诊断
  • 预算:固定的时间(16 小时)和金钱($500 Tinker 预算)
  • 最终交付:从所有挖出的矿石中,选一块最好的上交

3.2 形式化定义

论文给出了精确的数学形式化:

给定:固定基础模型 M₀、基准证据 S(目标描述、成功标准、种子仓库、基础模型诊断)、资源预算 𝒞

研究策略 π 在每一轮 t:

  • 观察 S 和历史 H_{<t}
  • 提出训练数据 D_t 和白名单配置 c_t:$(D_t, c_t) = \pi(S, H_{
  • 训练检查点:$M_t = \text{Train}(M_0, D_t; c_t)$
  • 获得受控反馈:$h_t = \text{Eval}_{\text{sel}}(M_t)$(分数、轨迹、验证器结果、执行诊断)

在 T 次尝试后,Agent 在观察官方结果之前选择一个检查点 $M_{t^\star}$

评估:官方性能 $s_{\text{off}}(\pi) = \text{Eval}_{\text{off}}(M_{t^\star})$,改进量 $\Delta_{\text{off}}(\pi) = s_{\text{off}}(\pi) - \text{Eval}_{\text{off}}(M_0)$

3.3 这个抽象的精妙之处

这个定义有两个关键的"分离"设计,体现了论文的深刻洞察:

  1. Agent 只能改训练经验,不能改基础设施——优化器、服务路径、评估沙箱、验证器、评分规则全部固定共享。这意味着性能差异只能归因于 Agent 的数据策略决策,排除了工程因素的干扰。

  2. 用选择反馈而非官方结果进行迭代——Agent 在迭代过程中看到的是"选择评估"(dev set 性质),最终提交后看到的是"官方评估"(test set 性质)。这两者分离,迫使 Agent 必须真正理解失败模式,而不能直接优化测试指标。

这两个分离让 RSIBench-Data 具备了可归因性(Attributability):每一次性能变化都能追溯到具体的策略决策,而不是被基础设施变化掩盖。


四、问题解法

RSIBench-Data 的"解法"不是提出一个新算法,而是设计一个受控评估协议,把研究能力从系统工程中隔离出来。下面逐层拆解。

4.1 固定基础设施:把"变量"锁定

这是整个基准的基石。论文定义了清晰的"边界":

边界内(Agent 可以自由决策):

  • 构建什么样的训练经验(任务、轨迹、监督信号)
  • 通过白名单配置接口决定如何暴露给训练(学习率、LoRA rank、训练步数等)

边界外(所有 Agent 完全相同,固定共享):

  • 基础模型:Qwen/Qwen3.5-35B-A3B-Base(所有 Agent 改进的同一个模型)
  • 优化器:固定的 Tinker LoRA SFT 后端
  • 服务路径:相同的采样器接口
  • 评估沙箱:Harbor 在 E2B 中编排
  • 验证器和评分规则:官方的

每次尝试的完整流程:

Agent 提交:消息格式监督 + 白名单训练配置
    ↓
运行器验证工件 → 调用 Tinker LoRA SFT 从 M₀ 训练
    ↓
生成检查点 M_t → 通过固定采样器接口服务
    ↓
评估者通过固定服务边界查询 → Harbor 在 E2B 沙箱中执行
    ↓
返回受控证据给 Agent:分数 + 轨迹 + 验证器结果 + 执行诊断 + token用量 + 成本 + 耗时

这里需要解释几个关键组件:

Tinker 是 Thinking Machines Lab(Mira Murati 创立)于 2025 年 10 月发布的云端 LoRA 训练 API。它的核心理念是"你写训练循环,它管 GPU"——支持从 1B 到 1T+ 参数的模型,LoRA 适配器训练在正确设置下能达到全量微调的效果。RSIBench-Data 用它作为统一训练后端,确保所有 Agent 的训练实现完全一致。

Harbor 是 Terminal-Bench 创建者开发的 Agent 评估框架(GitHub 3600+ star),支持 Docker、Daytona、E2B、Modal 等多种执行环境。RSIBench-Data 用它在 E2B 云沙箱中运行官方评估,确保评估环境完全隔离和一致。

E2B 是一个提供快速启动云沙箱的平台,支持基于模板的环境、自动超时处理、文件上传下载。它为每次评估提供干净的隔离环境。

4.2 Agent 的输入与数据约束

每个 Agent 收到的输入 S 包括:目标基准描述、成功标准、任务匹配的公共种子仓库/示例、工具和环境模式、基础模型诊断、资源预算。

关键约束:评估专用任务、标签、轨迹等受保护材料绝对不能用作训练监督。这种分离确保 Agent 必须真正"理解"失败模式来生成数据,而不是把评估答案搬进训练集。这条规则直击 PostTrainBench 审计中发现的"作弊"问题。

4.3 闭环数据合成研究循环

这是 Agent 的核心工作过程。论文明确指出,这些是 Agent 自主选择的策略空间,而非基准规定的固定阶段:

每轮 Agent 可以做的事:

决策维度具体选择
诊断能力差距按能力/错误类型/任务系列/工具/交互长度组织失败;区分知识缺失与推理/规划/工具使用/恢复/验证失败
合成训练经验选择数据来源;构造任务和初始执行状态;生成成功/失败/恢复轨迹;决定监督哪些轮次(完整轨迹/决策点/最终动作/批评/修复)
验证和组织用可执行环境/辅助验证器/答案一致性/模式检查过滤;截断压缩长轨迹;设计难度课程和数据混合
修订策略替换数据源、调整覆盖范围、改变轨迹表示、加强验证器、调整过滤阈值、重新平衡课程
管理搜索预算分配、回滚、停止、最终检查点选择

共享 SFT 训练:所有 Agent 用同一个 Tinker LoRA 后端,提交的工件必须满足统一的数据契约(消息格式监督),训练配置只能从白名单中选择。

4.4 最终检查点选择与官方评估

完成所有尝试后,Agent 从自己产出的所有检查点中选择一个提交——注意,这个选择是在看到官方结果之前做出的,Agent 只能依据选择评估的反馈来判断。然后评估者在目标基准的测试集上评估所选检查点,报告其性能作为最终分数。

这个设计非常巧妙:它同时考察了 Agent 的两个能力——生成能力强检查点的能力和识别最佳检查点的判断力。论文数据显示,选择峰值与官方评估分数平均相差 3.89 个百分点,说明 Agent 的选择能力总体不错,但并非完美。


五、评估指标与实验证据

5.1 评估体系总览

RSIBench-Data 的评估不是只看一个最终分数,而是一个多层体系:

层次指标衡量什么
主指标所选检查点的官方基准原生分数 + 相对基础模型的改进 Δ_offAgent 最终能交付多好的模型
过程指标有效候选数、迭代轨迹、首候选 vs 最佳候选、成本/时间Agent 的研究过程效率和质量
诊断指标四种强运行模式的出现频率、推理强度的影响解释为什么有些 Agent 表现更好

5.2 实验设置

测试的 4 个前沿研究员 Agent:

Agent底层模型推理强度
Claude CodeOpus-4.8High
Claude CodeSonnet-5High
Codexgpt-5.6-solMax
Codexgpt-5.6-terraMax

所有实验中,Claude Opus 4.8 固定为外部 rollout 模型(生成推理轨迹、工具使用序列)。

6 个评估基准(覆盖四大领域):

基准领域评估项数评估运行器基础模型参考分
SWE-bench Verified软件工程100Mini-SWE-Agent12.00%
SWE-bench Multilingual多语言软件工程100Mini-SWE-Agent7.00%
SWE-bench Pro高难度软件工程100Mini-SWE-Agent0.00%
Terminal-Bench 2.0终端工具使用89Terminus-21.12%
GPQA Diamond科学问答100Terminus-261.00%
AIME 2026数学推理30(×4)Terminus-230.00%

预算:每次运行名义 16 小时墙钟时间 + $500 Tinker 预算。

5.3 主实验结果

以下是所有 Agent × 基准组合的官方性能(加粗为该基准最佳):

基准BaseClaude Opus-4.8Claude Sonnet-5Codex gpt-5.6-solCodex gpt-5.6-terra
SWE-bench Verified12.00%46.00%35.00%33.00%42.00%
SWE-bench Multilingual7.00%5.00%22.00%15.00%6.00%
SWE-bench Pro0.00%2.00%4.00%9.00%1.00%
GPQA Diamond61.00%56.00%52.00%65.00%64.00%
AIME 202630.00%40.83%49.17%53.33%33.33%
Terminal-Bench 2.01.12%10.11%5.62%20.22%12.36%

这些数字说明了什么?

  1. 没有 Agent 全面占优:Codex gpt-5.6-sol 在 3 个非 SWE 基准(GPQA、AIME、Terminal-Bench)领先,但 3 个 SWE 基准由 3 个不同 Agent 分别获胜。这说明数据中心化研究能力是任务依赖的。

  2. 一些检查点甚至低于基础模型:Claude Opus-4.8 在 SWE-bench Multilingual 上只有 5.00%(base 为 7.00%),在 GPQA 上 56.00%(base 为 61.00%)。这证明糟糕的数据策略可能有害——训练数据不仅没帮助,反而破坏了模型原有能力。

  3. 绝对性能仍然较低:SWE-bench Pro 最佳仅 9.00%,Terminal-Bench 最佳仅 20.22%。这说明当前 Agent 在最困难的任务上,研究能力仍有很大提升空间。

5.4 两个核心发现:58.33% 与 78.26%

这两个数字是论文最重磅的实验结论,构成了"发现-可靠性差距"。

发现能力:58.33% 的设置中迭代有效

在 24 个有效设置(4 Agent × 6 基准)中,**14 个(58.33%)**的后续候选优于第一个有效候选。这意味着 Agent 已经展现出数据中心研究员的核心能力——能从反馈中学习并改进。

但这个改进高度依赖基准:AIME 2026 在 4 个 Agent 中有 3 个改进,中位数增益达 25.42 个百分点;而 GPQA Diamond 从已经较强的起点出发,中位数仅获得 4.00 点增益。

可靠性缺陷:78.26% 的后续搜索退化

这是更令人警醒的发现。在 23 个达到最佳选择分数后继续搜索的设置中:

  • 18 个(78.26%)最终尝试的候选分数低于历史峰值
  • **5 个(21.74%)**仅恢复到相同峰值
  • 0 个在达到峰值后继续改进

这意味着:一个强候选可能出现在搜索早期或中途,即使 Agent 后来观察到更多反馈并修订策略,也无法超越它。 历史最佳选择机制虽然能保护提交的检查点不被回退,但它并不能让底层研究过程变得可靠地渐进。

为什么这个实验设计能证明论文的核心主张?

论文的核心主张是"Agent 有发现能力但缺乏可靠性"。这个 24 设置 × 迭代轨迹的实验设计,通过以下逻辑链证明了这一点:

  • 如果 Agent 研究能力成熟 → 应该看到迭代单调改进
  • 实际看到 58.33% 改进但 78.26% 后续退化 → 证明了"能力存在但不稳定"
  • 这个差距不是因为基础设施差异(已隔离)或预算不足(预算固定且多数运行未耗尽)→ 差异只能归因于 Agent 的研究决策质量

5.5 推理强度的机制实验

在 SWE-bench Verified 上对 Claude Code Sonnet-5 做 High vs Max 推理强度的对照实验:

指标High EffortMax Effort
首个候选分数25%36%
历史最佳选择分数44%49%
官方分数35%52%
训练记录数50149
可训练助手轮次5952,681
有效尝试数—少一次

结论:更��的推理强度让 Agent 更早找到更强候选,构建更资源密集的训练数据程序,但减少了固定预算内的候选数量。这是一个深度-广度权衡。这个实验之所以有证明力,是因为它单独改变了 Agent 的一个属性(推理强度),其余条件完全相同,从而干净地建立了因果关系。


六、效果优势的根源解释

论文最精彩的部分不是数字,而是它对"为什么有些 Agent × 基准组合成功、另一些失败"的机制级因果分析。论文通过逐次尝试的轨迹编码,将分数变化与具体的策略决策联系起来,识别出强运行的四种模式。我们逐一从根源解释。

6.1 模式一:准确诊断真实能力差距

观察:Claude Code Sonnet-5 在 AIME 2026 上,前 8 次有效尝试的选择分数从未超过 15.00%。第 9 次突然跳升至 55.00%,第 10 次达到 55.83%。后续候选在 47.50%-55.83% 之间波动,但再未超越。

根源解释:为什么前 8 次无效而第 9 次突破?

关键在于"能力假设"的质变。前 8 次的失败,根因是 Agent 对"模型缺什么"的诊断是错的——它可能在做局部修订(微调数据量、调整难度比例),但这些修订没有改变有效的数据策略,只是在同一错误假设上打转。

第 9 次的突破,是 Agent 终于诊断出了定性不同的能力假设——比如认识到问题不在计算量而在推理链条的结构,或者不在题目覆盖而在答案验证机制。AIME 的答案一致性过滤(answer consistency filtering)正是这种"质变假设"的体现:它不再只是增加更多数学题,而是用一个可判定的验证信号来筛选数据。

因果链:错误假设 → 局部修订不改变有效数据分布 → 训练检查点无实质改进 → 分数停滞;识别真实差距 → 质变假设 → 数据策略根本性改变 → 分数跳跃。

这个模式的普适启示是:当局部修订不奏效时,Agent 需要识别"我在同一个错误上打转",转而搜索定性不同的假设。

6.2 模式二:嵌入可执行的验证信号

观察:跨多个成功案例——AIME 用答案一致性过滤、SWE-bench Pro 用环境成功轨迹、Terminal-Bench 2.0 用沙箱执行与显式任务结果。

根源解释:为什么"验证信号"如此关键?

这是关于监督质量的信息论根源。如果 Agent 只用模型自我判断(“这条轨迹看起来对不对”)来筛选数据,监督信号是主观的、不可判定的——模型可能把错误的行为判断为正确的,因为它的判断能力和它需要学习的能力是同一个模型。

而可执行的验证信号(代码能不能跑通、数学答案对不对、终端命令是否产生预期输出)是客观的、可判定的——它来自外部环境,不受模型自身能力限制。

因果链:自我判断筛选 → 错误样本混入 → 监督信号被污染 → 训练强化了错误行为 → 分数低或退化;可执行验证 → 错误样本被滤除 → 监督信号纯净 → 训练强化正确行为 → 分数提升。

这与 Q-Evolve 的"分布内过程监督"理念一致:稳定的自进化需要过程级监督与策略的协同进化,而过程级监督必须基于可判定的信号。

6.3 模式三:监督匹配目标行为

观察:在 SWE-bench Verified 上,最终动作数据(final-action data,只监督最后的提交动��)达到 39.00% 选择分数,而全轮数据(all-turn)和安全变体(safe)仅达 8.00% 和 9.00%。在 SWE-bench Pro 上,基于合成完成动作的变体回退至 7.00%,而基于真实提交行为的关闭数据达到 9.00%。

根源解释:为什么监督粒度和动作源是关键变量?

这是关于监督与评估行为的分布对齐。SWE-bench 的评估是:给模型一个问题,让它生成一个 patch,检查 patch 能否通过测试。评估只看最终动作的质量。

如果训练数据监督的是完整轨迹(所有中间轮次),模型学到的是"如何走完整个对话",但评估不奖励对话过程,只奖励最终 patch。全轮监督引入了大量与评估目标无关的梯度信号,稀释了对最终动作的优化。

更糟的是"安全变体"(safe variant,过滤掉某些轮次)——它可能破坏了轨迹的因果结构,让模型学到的是"什么时候该停止"而非"如何产生正确的最终动作"。

因果链:全轮监督 → 梯度信号被稀释到无关轮次 → 最终动作的优化不充分 → 评估分数低;最终动作监督 → 梯度信号集中 → 直接优化评估目标 → 评估分数高。

这个发现深刻地指出:数据量不是关键,数据是否对齐评估行为才是关键。

6.4 模式四:保留历史最佳候选

观察:Claude Code Sonnet-5 在 AIME 上第 10 个有效候选首次达到 55.83% 峰值,后续候选从未超越;Codex gpt-5.6-sol 在 SWE-bench Pro 上第 9 轮达到峰值;在 Terminal-Bench 上第 2 个有效候选达到峰值后退化。

根源解释:为什么"保留"如此重要,而 Agent 普遍做不到一致地超越峰值?

这涉及非平稳搜索中的探索-利用困境。一旦 Agent 找到一个强候选,它处于两难:利用当前配方(但可能过拟合这一个数据点)、探索新假设(但可能回退)。论文的 78.26% 退化率证明,当前 Agent 在这个权衡上系统性偏向过度探索——它们倾向于认为"再来一次会更好",但实际新策略的期望收益低于当前峰值。

历史最佳选择机制是一个工程补丁而非研究能力提升——它通过外部记忆保住了强候选,但 Agent 自身并没有真正学会"什么时候该停止"。这也解释了为什么论文强调"有效的停止和策略修订对于高效搜索仍然必要"。

因果链:无保留机制 → 后续退化直接伤害最终提交分数;有保留机制 → 保护提交分数但无法提升底层研究可靠性;真正的解决方案需要 Agent 学会基于反馈置信度做出停止/继续决策。

6.5 反事实:同族 RSI 早期实验

论文还做了一个发人深省的反事实实验:用 Claude Code(kimi-k2.6 驱动)作为研究员,改进 Kimi-K2.6 指令模型(一个已经很强的模型),在 SWE-bench Pro 上评估。

结果:Agent 将性能从 8% 提升到 21%,展现了清晰的策略演化能力,但每个检查点都低于 33% 的未适配参考分数。

根源:当目标模型已经是一个强大的指令模型时,研究员需要发现能进一步提升它的训练分布——这比从头改进一个 base 模型困难得多,因为可改进的空间更窄、更需要精细的数据策略。当前研究员的 RSI 能力还不足以应对这个挑战。

这个反事实实验反证了:RSIBench-Data 揭示的"发现-可靠性差距"在更难的设定下会放大——RSI 不是简单的"能跑通就行",目标越强,对研究能力的要求越高。


七、必要知识反推

要完成 RSIBench-Data 这个工作,作者团队必须掌握并融合以下知识。

7.1 领域知识层

  • 递归自我改进的理论与实践:理解 RSI 的定义、历史脉络(从 Eliezer Yudkowsky 的"Seed AI"到 Anthropic 的工程实践)、核心挑战(失败转化、自我评估、稳定性)。不理解 RSI 的深层含义,就无法把"数据中心化研究"定位为 RSI 的关键子问题。

  • 后训练方法论:深入理解 LoRA 微调的机制与局限(正确设置下能达到全量微调效果)、SFT 与 RL 的差异、数据质量对训练的影响。论文选择 LoRA SFT 而非全量微调或 RL,是经过权衡的——它既有足够的表达能力,又能在固定预算内快速迭代。

  • Agent 评估生态:熟悉 SWE-bench 系列(Verified/Multilingual/Pro 的区别与互补)、Terminal-Bench、GPQA、AIME 各自评估什么能力、为什么这些基准能区分方法优劣。这决定了实验设计是否有证明力。

7.2 方法论知识层

  • 受控实验设计原则:如何通过"固定基础设施、隔离研究决策"来实现可归因性。这是论文最核心的方法论贡献——它借鉴了 DataComp"固定模型变数据"的理念,但把它提升到了"固定整个栈,只变研究策略"的层面。

  • 基准设计理论:理解一个好用基准需要满足什么——区分度、可复现性、抗作弊性、可审计性。论文对 PostTrainBench 作弊行为的引用、对训练/评估数据隔离的强调,都体现了这种知识。

  • 序贯决策与搜索理论:理解迭代搜索中的探索-利用权衡、非平稳性、预算约束下的最优停止。这些知识支撑了论文对"78.26% 退化"的深度分析。

7.3 工程知识层

  • Tinker API:如何用 Tinker 进行 LoRA SFT 训练、如何配置训练客户端、如何采样。论文需要确保所有 Agent 用完全相同的方式训练。

  • Harbor 框架:如何用 Harbor 在 E2B 中编排评估、如何配置并发、如何隔离环境。这是评估可审计性的工程基础。

  • 多 Agent 系统集成:如何让 Claude Code 和 Codex 这种 CLI Agent 在统一接口下工作、如何管理 rollout 模型(Claude Opus 4.8)的调用。

7.4 知识融合的关键节点

最有创造性的是**“隔离"理念与"闭环研究"理念的融合**:

  • DataComp 教会了"固定栈变数据”,但它只做静态选择
  • DataEnvGym 教会了"闭环反馈迭代",但它没有隔离基础设施
  • RSIBench-Data 的洞察是:把这两者结合——既闭环迭代,又完全隔离——就能第一次纯粹地评估"研究能力"

第二个融合节点是**“研究能力"的形式化**。论文没有停留在"看谁的模型分数高”,而是把研究过程本身定义为一个可量化、可审计的对象:每一次假设、每一个数据策略、每一次反馈修订都被记录和编码。这种"过程即结果"的评估范式,是把心理学/科学哲学中的"研究方法论"工程化的尝试。


八、通用性灵感

RSIBench-Data 的发现不仅适用于 AI 后训练,还蕴含着可推广到更广领域的普适性原理。

灵感一:发现-可靠性差距是智能体自主研究的普遍特征

核心思想:一个智能系统能"偶尔发现好东西"(discovery)和能"可靠地把反馈转化为持续改进"(reliability)是两种本质不同的能力。前者只需要偶尔的洞察,后者需要稳定的因果推理和自我校准。

论文证据:58.33% 的设置有发现 vs 78.26% 的后续搜索退化。这两者的并存证明了它们是分离的能力维度。

推广场景:

  1. 自动化科研系统:AI Scientist 能否稳定地从实验反馈中改进假设?发现一个好假设 ≠ 能持续改进它
  2. 自动化运维(AIOps):系统能发现一个优化 ≠ 能可靠地迭代优化而不引入回归
  3. 产品迭代:一个团队能做出一个爆款功能 ≠ 能持续产出好功能——发现与可靠性需要不同的组织能力
  4. 个人学习:理解一个概念 ≠ 能稳定地应用它——间隔重复、刻意练习解决的就是"可靠性"问题

灵感二:用可执行验证信号替代主观判断

核心思想:在任何需要质量评估的自主系统中,优先使用可执行的、可判定的外部验证(代码能否运行、答案是否正确、约束是否满足),而非系统的自我判断。

论文证据:AIME 答案一致性、SWE-bench Pro 环境成功、Terminal-Bench 沙箱执行——所有强运行都使用了某种形式的可执行验证。

推广场景:

  1. 自动化代码审查:用测试覆盖率/CI 结果替代 LLM 的"这段代码看起来对不对"
  2. 教育系统:用可判定的练习(编程题、数学题)替代主观评分,给学生更可靠的反馈
  3. 内容审核:用规则引擎 + 事实核查 API 替代纯模型判断,降低误判率
  4. 科学研究:用可复现的实验结果替代"论文说它有效"——可执行验证是科学方法的核心

灵感三:监督必须对齐目标行为

核心思想:在训练/优化任何系统时,监督信号的粒度和来源必须与你最终要评估的行为严格对齐。监督过多无关信息会稀释优化信号,监督来源错误会学到错误模式。

论文证据:最终动作数据 39.00% vs 全轮数据 8.00%;真实提交行为 9.00% vs 合成完成 7.00%。

推广场景:

  1. 员工培训:如果最终考核的是"独立完成项目",培训就不该主要练"旁观别人做项目"——监督要对齐目标行为
  2. 体育训练:如果比赛考的是实战对抗,训练就不能只练固定套路——需要场景化训练
  3. 推荐系统:如果目标是长期留存,就不该只优化点击率——监督信号要对齐长期价值
  4. 教育评估:如果目标是"能解决真实问题",考试就不该只考"能复述知识点"

灵感四:受控隔离是评估"研究能力"的前提

核心思想:要纯粹评估一个智能体的"研究/决策能力",必须把它从"工程/执行能力"中隔离出来——固定工具、固定资源、固定评估,只让决策变化。否则你无法区分"他研究能力强"和"他工具用得好"。

论文证据:RSIBench-Data 固定 Tinker 训练 + Harbor 评估 + E2B 沙箱,使性能差异只能归因于数据策略决策。对比 PostTrainBench 让 Agent 控制一切,导致无法归因。

推广场景:

  1. 招聘评估:要评估候选人的"分析决策能力",就应固定数据源和工具,只让他做决策——而非让他自由选择一切
  2. AI Agent 采购:评估不同 Agent 时,固定任务定义和评估标准,只让 Agent 策略变化
  3. 科研评审:同行评审隔离"想法质量"与"实验资源"——应该评估想法本身的洞见,而非实验室规模
  4. 教育评估:标准化考试的意义正在于此——固定条件,隔离出"学生能力"这个变量

灵感五:非单调搜索需要明确的停止/回滚策略

核心思想:在任何迭代搜索/优化过程中,改进几乎从不是单调的。一个自主系统如果不具备"识别峰值并停止/回滚"的能力,就会在过度探索中退化。历史最佳记忆是补丁,真正的能力是基于反馈置信度的自适应停止。

论文证据:78.26% 的峰值后搜索退化;历史最佳选择保住分数但底层过程仍不可靠。

推广场景:

  1. 投资决策:找到好标的后,何时停止研究继续买入?过度研究可能引入噪声——需要基于信息增益的自适应停止规则
  2. 产品迭代:一个功能达到局部最优后,何时停止 A/B 测试转而探索新方向?需要量化"继续迭代的期望收益"
  3. 学术论文写作:何时停止修改提交?无限修改可能让论文变差——需要基于审稿反馈的置信度判断
  4. 强化学习:训练何时早停?这正是 RL 中 early stopping 和 checkpoint selection 解决的问题——但当前 LLM Agent 在"研究"层面缺乏类似机制

总结

RSIBench-Data 做了一件重要且此前没人做的事:把"LLM Agent 能否当好 AI 研究员"这个问题,从一个模糊的愿景变成了一个可量化、可审计、可归因的基准。

它的核心贡献不在于提出了一个更强的 Agent 或方法,而在于精准地切出了"研究决策"这一层,通过固定一切基础设施,让我们第一次能纯粹地看到:当前最强的 Agent(Claude Opus-4.8、Codex gpt-5.6-sol 等)在作为研究员时,有发现能力但缺乏可靠性。

58.33% 的发现率和 78.26% 的退化率,这两个数字将长期作为衡量"AI 自主研究能力成熟度"的基准线。而四种强运行模式——准确假设、验证信号、行为对齐数据、检查点保留——则为未来改进 Agent 研究能力提供了明确的路线图。

对于关注 RSI、AI 自进化、自动化 AI 研究的读者,这篇论文是一个必读的里程碑:它既诊断了现状,也指明了方向。