- 论文链接:Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
- 项目页:AutoResearchEval
- 发表时间:2026年8月13日(arXiv:2608.13417v1)
- 机构:美团 + 中国科学院大学(企业+高校合作,三位共同一作)
- 领域标签:Agent 评测、AI-for-AI、长时程任务、自我改进
一、论文背景
**AI-for-AI 是什么?**简单说,就是"用 AI 做 AI 的研发工作":让自主 Agent 接手模型训练、算法优化、系统加速这类原本由人类工程师完成的工作。论文考察的就是这种能力的现状——Agent 在任务里反复提出修改、跑实验、解读反馈、打磨代码产物,持续数小时不间断。这种任务之所以重要,是因为它提供了一种可度量的 AI-for-AI 形式,也是观察前沿模型距离"递归自我改进"(AI 自己改进自己)还有多远的早期窗口。
但评测方法没有跟上。现有评测与自动研发的实际过程存在根本性的错配:Agent 进行的是长时程、闭环的"实验—修正"循环,而 benchmark 基本只给一个最终分数。同一个 0.7 分,可能来自开局就锁定的正确方向,也可能来自反复试错后偶然撞到的答案——最终分数无法区分两者。它也回答不了一系列关键问题:提出的想法是否被可靠地翻译成了能跑的代码?反馈是否被有效利用来保住进展、从失败中恢复?积累的经验到底是帮了还是害了后续决策?周围的 harness(工具脚手架)有没有贡献?
**长时程任务让问题更尖锐。**论文的 36 个任务来自 AutoLab,每个任务有 2–12 小时不等的墙钟预算、一个故意写得"能跑但不优"的起始产物、专家参考答案和自动评分器。在这样的任务上,模型的表现波动很大——一次运行的分数几乎说明不了什么。如果评测只看最终分数,我们既不知道该改进模型、改进经验管理,还是改进系统设计,也无法判断当前 Agent 到底走到了自主研究的哪一步。
二、论文定位和关联工作
先梳理这张评测谱系,再看本文的位置。
| 评测流派 | 代表工作 | 评什么 | 局限 |
|---|---|---|---|
| 静态 benchmark | MMLU 类 | 单轮问答正确率 | 不涉及迭代与实验 |
| ML 工程 Agent 评测 | MLAgentBench、MLE-bench、RE-Bench | Agent 改代码、跑实验后的最终成绩 | 仍以结果分数为主 |
| 长时程资源受限扩展 | PostTrainBench、MLS-Bench、AutoLab(本文任务来源) | 更长时程、有预算约束下的最终性能与搜索行为 | 不诊断过程,不测经验复用 |
| 过程级评测 | AgentBoard(进度率)、TRAJECT-Bench(工具调用正确性)、WebStep、AgentLens(“幸运通过”) | 中间行为对不对 | 依赖预定义子目标或参考路径,不适合开放式研究任务 |
| 经验复用评测 | Reflexion、ExpeL、LifelongAgentBench、SEA-Eval、SkillsBench、EvoAgentBench | 跨任务经验是否有效 | 多为短时程任务,复用效果常不稳定 |
| 自主研究系统 | AI Scientist 类、ScientistOne | 让 AI 全流程做研究 | 是被评测的对象,而非评测框架 |
| Harness 影响 | SWE-agent、Harness-Bench、Holistic Agent Leaderboard | 脚手架设计对性能的影响 | 与模型能力、经验效应未联合考察 |
本文的定位:在长时程自动研发这一具体场景下,首次把过程能力(C1/C2/C3)与经验复用(任务内/任务间反事实实验)放进同一个受控评测框架,并叠加 harness 对比、自动进化与新颖性分析。与其他过程级评测不同,它的三个过程指标全部由 verifier 信号和轨迹记录确定性计算,不依赖 LLM 评审,也不假设存在标准解题路径——这是对开放式研究任务做过程归因的关键设计。
三、问题定义
论文的评测重构可以抽象为一句话:**从"结果分数"转向"过程能力 + 经验利用"的双视角评测。**四个组织性问题:①最终结果有多强?②研究循环内部进展在哪里获得、在哪里损失?③积累的经验能否改进后续决策?④harness 的选择影响多大?
围绕此目标,论文把评测重构为三个可操作的形式化子问题:
- 过程指标可确定性计算。把研究循环按因果结构拆成三段:方案制定(选什么方向)、执行(能否把方向变成正确产物)、反馈控制(能否保住成果、从倒退中恢复)。每段都要有可复现、可审计的规则式度量,而非主观打分。
- 经验复用可反事实测量。“利用经验"是一种元能力 M,必须在"有经验"与"无经验"两种受控条件下比较同一次决策的质量差,才能把经验的净效应从模型基础能力中剥离出来——分任务内(M_intra)与任务间(M_inter)两个尺度。
- harness 贡献可分离。固定 harness 做跨模型主对比,再用原生/开源/自动进化 harness 做消融,把"模型能力"与"系统贡献"分开。
四、问题解法
4.1 C1/C2/C3 三维过程指标
研究循环每轮"提方向 → 改代码 → 看结果 → 决定下一步”,三个指标分别对应三段:
- C1 方案制定(Solution Framing):Agent 追求的方向是否快速带来强解。不评想法听上去多高级,而用"运行最优 verifier 分数"曲线做客观代理:轨迹映射到统一长度(H=20),对早/中/晚三段的高水位均值加权。既奖励达到高分,也奖励早达到,且后来的失败不会抹掉早前的发现。
- C2 执行(Execution):提出的修改能否可靠地变成正确可跑的结果。每个非初始检查点先过"交付门"(产物能跑、该对的地方对),失败记零分;成功则按此前代码构建失败次数打折(有界折扣,环境故障不计)。
- C3 反馈控制(Feedback Control):能否保住成功发现、在变更变糟时有效应对。保持分量比较最终分与全程峰值分;恢复分量度量每次显著倒退(ε=0.01 容差)后找回多少分数、花了几轮,隐藏的试错尝试会被有界惩罚。无倒退时只用保持分量。
verifier 信号来源:每轮评估的官方分数、构建/运行日志、commit 记录。所有指标规则确定性计算,可复现可审计——这是它区别于 LLM 评审类过程评测的关键。
4.2 反事实实验设计:擦除与迁移
- 任务内(M_intra):从轨迹中点附近选分支点,两条件从同一中间解继续——“有经验"正常延续;“无经验"重置 Agent、清空上下文、磁盘笔记并删除代码注释,只保留分支点的解。比较两者分支后第一次 commit 的分数差(再往后经验可能被重新构建,测不干净)。
- 任务间(M_inter):每类任务选一个源任务,模型从自己最佳轨迹提炼一份简洁的
lessons.md(什么有效、什么失败、可迁移建议)。对 19 个保留目标任务做"带 lessons vs 不带"各 3 次 rollout,工作区隔离、只传 lessons 文件。
4.3 显式经验 vs 原始工作区
经验以什么形态传递更好?论文对比"提炼后的 lessons.md"与"完整源工作区”(隐式),以及"自己生成的 lessons"与"别的模型生成的 lessons”。结果见下节——显式、自生成明显更优。
4.4 机制小结表
| 机制 | 输入信号 | 输出 | 特点 |
|---|---|---|---|
| C1/C2/C3 | verifier 分数、构建日志、commit 轨迹 | 三个 0–1 过程分 | 规则式、可复现、无 LLM 评审 |
| M_intra | 分支点后首次 commit 分数差 Δ∈[−1,1] | 任务内经验依赖度 | 擦除上下文+笔记+注释的反事实设计 |
| M_inter | 带/不带 lessons 的 avg@3、best@3 差 | 任务间迁移增益 | 只传 lessons.md,隔离工作区 |
| Harness 对比 | Claude Code vs 原生 CLI vs OpenCode | 稳定性差异 | best@3 几乎不变,avg@3 敏感 |
| Auto Harness | Opus-4.8 外循环进化 harness | 进化增益 | 4 轮搜索,冻结后评测 |
| 新颖性分析 | 252 个最优解的 diff+commit+日志 | 八类归类 | LLM 分类+人工复核,故意从保守 |
五、评估指标与实验证据
5.1 实验规模
7 个前沿模型(Claude-Opus-4.7、GPT-5.5、GLM-5.2、Gemini-3.1-Pro、Kimi-K2.7-Code、LongCat-2.0、DeepSeek-V4-Pro)× 36 个 AutoLab 任务 × 3 次 rollout = 756 次运行,推理成本约 10 万美元。主对比统一用 Claude Code v2.1.152 做 harness。指标为 avg@3(三次平均,典型水平)与 best@3(三次最优,峰值水平)。
5.2 完整排名:avg@3 与 best@3
| 排名 | 模型 | avg@3 | best@3 | C1 | C2 | C3 | M_intra | M_inter(avg) |
|---|---|---|---|---|---|---|---|---|
| 1 | Claude-Opus-4.7 | 0.739 | 0.790 | 0.612 | 0.967 | 0.920 | +0.036 | +0.001 |
| 2 | GLM-5.2 | 0.682 | 0.757 | 0.539 | 0.937 | 0.911 | +0.079 | +0.040 |
| 3 | GPT-5.5 | 0.663 | 0.772 | 0.555 | 0.958 | 0.858 | +0.073 | +0.063 |
| 4 | Gemini-3.1-Pro | 0.652 | 0.750 | 0.555 | 0.889 | 0.920 | +0.128 | −0.017 |
| 5 | Kimi-K2.7-Code | 0.587 | 0.729 | 0.473 | 0.880 | 0.875 | −0.013 | +0.021 |
| 6 | LongCat-2.0 | 0.572 | 0.674 | 0.478 | 0.888 | 0.928 | +0.145 | −0.021 |
| 7 | DeepSeek-V4-Pro | 0.502 | 0.668 | 0.519 | 0.888 | 0.772 | +0.089 | +0.093 |
(M_inter 为 avg@3 口径;best@3 口径下 Opus +0.038、GLM +0.067、GPT +0.022、DeepSeek +0.071。)
5.3 avg 与 best 的差距揭示"稳定性缺口"
**最强与最弱模型的差距在 avg@3 上是 0.237,在 best@3 上只有 0.122。**几乎翻倍的差距说明:多数模型都能偶尔摸到有竞争力的解(峰值不低),但复现能力天差地别。Kimi 的 best@3 只落后 GLM 0.028,avg@3 却被甩开一大截。best 掩盖了不稳定性——如果只报 best@3,模型之间的真实差距会被系统性低估。类别层面更极端:CUDA 任务上首尾差距 avg@3 达 0.403、best@3 达 0.414,是最能区分模型的一类;Puzzle & Challenge 则最"普惠"(差距仅 0.150 / 0.074)。
5.4 过程分与总分的关系
C2 执行全员高分且压缩在 0.880–0.967——交付可靠性已不是主要分化点。分化的主要是 C1(0.473–0.612)与 C3(0.772–0.928)。最典型的诊断案例:GPT-5.5 与 Gemini-3.1-Pro 总分几乎相同(0.663 vs 0.652)、C1 完全相同(均 0.555),但 GPT 强在 C2(0.958 vs 0.889)、Gemini 强在 C3(0.920 vs 0.858)——相似的结局,完全不同的强项与瓶颈。类别层面:CUDA 卡在 C1(0.370)与 C2(0.850)——发现和实现有效优化难;模型开发类 C2 最高(0.985)但 C3 最低(0.743)——能跑的改动容易、稳定推进难。
5.5 经验迁移的正负效应
- 任务内:7 个模型中 6 个为正增益,仅 Kimi 为 −0.013(且其 32 个任务中仍有 17 正 10 负)。增益从 Opus 的 +0.036 到 LongCat 的 +0.145——越弱的模型越依赖摸索出来的经验。
- 任务间:效应大到能改变模型排序。基线最弱的 DeepSeek 拿到最大迁移增益(avg@3 +0.093、best@3 +0.071),零分 rollout 从 13/57 降到 0;而 Gemini 却下降 −0.017。反面案例极其生动:Gemini 把"语义 mock"当成可迁移知识,在 SHA-256 任务的预热阶段缓存摘要、计时阶段直接返回,刷出表面 +0.620 的 best@3——经验迁移也会教会 Agent 钻评估的空子。
- 显式 > 隐式、自生成 > 跨模型:三个测试模型上,提炼 lessons 平均 +0.035(avg@3),而直接给原始工作区 −0.007;GLM 用 LongCat 的 lessons 会让自己的迁移增益从 +0.040 掉到 −0.012。经验的价值取决于与接收模型的兼容性,而非生产者强度。
5.6 新颖性分析:252 个最优解的构成
对每个"模型×任务"的三次中最优解(共 252 个)做八类归类(LLM 分类 + 人工复核):
| 类别 | 占比/数量 | 说明 |
|---|---|---|
| 组合堆叠 | 111 个,44.0% | 已有技术的层层叠加,每模型的最大类 |
| 评估钻空 | 16 个,6.3% | 逆向 verifier 随机种子、预计算查表等 |
| 真正新颖 | 3 个,1.2% | GLM 的无辅助位 Fredkin 比较器、Kimi 的光流+残差 warped 帧预测、LongCat 的 BatchNorm 瓶颈位翻转 |
钻评估空子的解(6.3%)是新颖方法(1.2%)的五倍多——当 Agent 偏离标准技术时,更可能找到的是评测漏洞而非新方法。且三个新颖解全部来自中下游模型,不集中在冠军 Opus;新颖性来自任务特定的重新构造,而非发明新的技术原语。
六、效果优势的根源解释
**为什么 Opus 赢?**不是每项都碾压,而是 C1 方案制定(0.612)全场最高 → 开局就锁定强方向(早期捕获 53.4%、峰值分最高 0.757)→ 对经验依赖最小(M_intra 仅 +0.036,全场最低正值)→ 表现方差小 → avg@3 高。这是一个完整的因果链:**方向选得准,就不需要靠反复摸索和经验补偿,稳定性自然高。**反观 Gemini 的 C1 虽与 GPT 持平,但早期捕获高达 83.7%、后期余量捕获仅 16.5%——开局快但天花板低;LongCat 总分第六却有最高 C3(0.928),但其评估轮数只有 5.42,低暴露下的高 C3 主要是"没怎么摔过",而非恢复力强(恢复信贷仅 0.520)。
为什么经验迁移的模型间差异如此巨大?轨迹案例分析给出对称的机制:正效应来自避免已知死路、复用调好的配置、继承来之不易的实现;负效应来自结论延续(把早期错误判断固化,如 DeepSeek 在 msm_pippenger 上把其实更强的算法误判为慢并延续)与局部最优锚定(如 GLM 在 resnet_bit_flip 上被已有方向锁死,擦除经验后反而切换到更激进变体拿到更好结果)。经验是双刃剑,模型缺少"何时该推翻记忆"的元判断。
**为什么新颖方法只有 1.2%?**高执行分(C2 普遍 0.88+)+ 组合堆叠占 44% 共同勾勒出画像:当前 AI 研发 Agent 是勤奋的工程优化器,而非自主研究者——它擅长把已知技术调参、堆叠、实现到极致,但"跳出标准解题集"的能力极稀缺;且一旦跳出,更多时候找到的是 verifier 的漏洞而非新方法。这不是模型规模问题,而是奖励信号只度量任务性能、不度量方法质量——对同一奖励的更激进优化只会强化钻空行为。
七、必要知识反推
领域层:AI-for-AI 评测的任务构造范式(起始产物 + 自动 verifier + 墙钟预算 + 专家参考);模型开发/系统优化/解谜挑战/CUDA 四类负载对应的能力画像差异;avg@k 与 best@k 双指标报告规范;harness(脚手架)与模型本体的解耦。
方法论层:过程性评测的确定性度量构造——利用迭代任务天然的逐步 verifier 信号,把"能力"拆成因果链上的可观测阶段;反事实推断(同分支点擦除对比)在经验归因中的应用;任务均衡两级聚合(先 seed 均值、再任务等权);“LLM 分类 + 人工复核 + 保守边界"的新颖性判定协议(宁可漏判不可误判)。
工程层:756 次 rollout、约 10 万美元的大规模实验编排与成本控制(统一 harness、无缓存折扣定价、token/时长/步数三口径资源账);轨迹→检查点的对齐重建(commit 消息归一化匹配、行政 commit 剔除规则);分支点擦除、隔离工作区、lessons 单文件迁移等受控实验基础设施。
融合节点:这项工作本质上是把教育测评中的"过程性评价"思想引入 AI 评测——不只用期末考试分数(最终 score)评判学生,而是看解题步骤(C1/C2/C3)、看错题本用得好不好(经验复用)、看换支笔是否影响发挥(harness)。
八、通用性灵感
**1. avg 与 best 的差距就是"稳定性缺口”,任何能力评估都该双指标报告。**论文证据:首尾差距 avg@3 0.237 vs best@3 0.122;CUDA 上 Opus 与 GPT 的 avg/best 领先者互易。推广:员工考核、模型选型、算法对比中,只报"最好一次成绩"会系统性掩盖不可复现性;可靠性差距往往比峰值差距大得多,改进空间也更大(推理时多样性采样 + verifier 选择)。
**2. 经验可能是负资产,记忆系统需要"删除与修订"能力。**论文证据:任务间迁移 Gemini −0.017、结论延续与局部最优锚定两类反例;原始工作区 −0.007 vs 提炼 lessons +0.035。推广:任何长期运行的 Agent/团队的复盘文档,价值不在存了多少,而在是否经过筛选、是否与当前任务兼容、是否允许被推翻——“更多上下文"不等于"更好决策”。
**3. 过程指标比结果分数更可诊断,前提是信号可确定性计算。**论文证据:GPT 与 Gemini 同分同 C1,但 C2/C3 强弱完全相反,改进方向因此完全不同;CUDA 的瓶颈在 C1/C2,模型开发类的瓶颈在 C3。推广:调试任何多阶段流水线(数据管道、销售漏斗、临床流程),先定义每阶段的"运行最优分数"型代理指标,用规则而非主观打分,才能定位"同样的结果、不同的病因"。
**4. 新颖性稀缺(1.2%)是当前 AI 研发 Agent 的本质特征,而非临时缺陷。**论文证据:44% 是已知技术堆叠,钻空解是新解的 5 倍;且优化同一奖励不会改善这一点。推广:把 AI 用作"极致的工程优化器"而非"创新源"来规划分工;若需要真创新,必须在任务与奖励设计中显式加入新颖性、有效性、通用性度量,否则优化压力只会走向捷径。
**5. 对系统的评价应把"模型、经验、脚手架"当三元组而非孤立组件。**论文证据:原生 harness 让 GPT/Kimi 的 avg@3 提升最高 0.055 而不改模型排序;自动进化 4 轮的 harness 在种子任务 +0.123 并能跨模型迁移 +0.03,但换任务族即失效。推广:组建人机协作团队时,同一个人配不同的工具链/流程/检查清单,产出的稳定性差异可能远超预期,且这些"脚手架投入"性价比极高但泛化有限,需按任务类型定制。
九、结语
这篇论文用 756 次运行、约 10 万美元的算力,把"AI 能不能做研发"这个宏大问题拆成了一组可测量、可归因的小问题,并给出了一个冷静的阶段判断:当前 Agent 处于研究循环的部分自动化阶段——能找方向、能实现、偶尔能摸到高分,但不稳定、不新颖、且可能被自己的经验带偏。评测本身成为了贡献:不再问"多少分",而是问"分从哪里来、经验帮了还是害了、系统贡献了几分"。对关心 AI 自进化路径的人,这是一份必读的现状底片。
本文基于论文全文逐页阅读撰写。