论文链接:arxiv.org/abs/2608.24979 数据与评测:Leaderboard / GitHub 评测 / HuggingFace 数据集均公开(论文正文以链接标识给出) 发表时间:2026年8月 机构:Apodex Team(Liangcai Su、Zhaopeng Feng、Zhuo Chen、Zhen Zhang 等,Simon Shaolei Du、Lidong Bing、Xinyu Wang 通讯;ApodexAI 为企业)——企业主导团队,任务构建有领域专家参与审校 领域标签:cs.AI / 科学 Agent 基准 / 长程任务评测


一、论文背景

1.1 科学 Agent 的能力形态变了

语言模型正从文本生成器进化为能规划、调工具、执行代码、修改持久文件的 Agent。最近的发展暗示 agentic 支持已能从文献检索、文本翻译这类孤立任务,扩展到协调多阶段研究工作流并产出可检查的输出。

这改变了「科学任务成功」的定义:给出貌似合理的结论不够了——Agent 可能需要检查异构输入、选择并运行分析、验证中间结果、交付互相一致的代码、表格、图与文字。

1.2 现有基准的评测单元不匹配

现有基准覆盖专家知识(HLE)、通用工具使用(AgentBench/GAIA)、软件交互(OSWorld)、代码修复(SWE-bench)、论文复现(CORE-Bench/PaperBench)、科学数据分析(BLADE/ScienceAgentBench)——但它们的评测单元往往是:一个最终答案、一条交互轨迹、一个独立程序、或单一学科的工作流。这些设定无法完整刻画「Agent 能否完成成功依赖多个分析阶段与多个必需交付物的异构科学工作」。

1.3 论文的聚焦问题

给定明确规定的科学任务与固定数据,Agent 能否独立完成从输入处理到最终交付物的完整工作流,并满足完整任务契约?

注意边界:这不是测「自主科学发现」——研究议程与问题定义都已固定,测的是可靠执行。这对应可信科学交接的底线:分析与输出必须可检查、可复现、互相一致。

二、论文定位和关联工作

2.1 与既有基准的六特性对比(论文表 1)

基准科学工作流核心固定科学输入端到端执行多工件可执行评测跨域科学
HLE / ALE / Frontier-Bench––部分–✓–
BLADE / ScienceAgentBench部分✓部分–✓–
CORE-Bench / PaperBench✓(复现型)✓✓部分✓–
BioAgentBench / BiomniBench✓✓✓✓✓–(单域生物)
NatureBench / AstaBench部分部分✓部分✓部分
FrontierChallenge✓✓✓✓✓✓

差异化定位:CORE-Bench/PaperBench 是复现已知论文;ScienceAgentBench 是单程序;BioAgentBench/BiomniBench 单域——本文同时满足跨域科学 + 固定输入 + 端到端执行 + 多工件 + 可执行评测,且焦点是「目标与输入固定后的可靠完成」。

三、问题定义

3.1 从具体场景出发

看论文附录的三个样例任务(Agent 可见层面):

  • 细胞迁移划痕实验:18 张显微图像(两组 × 三时间点 × 三重复),要分割未迁移区域、按组配对计算迁移率、做组间检验,交付可复现脚本 + 图像级表 + 组统计表 + 两张标注图 + 方法学报告;
  • Suzuki 偶联 TLC 监测:一块 UV254 薄层板(8 泳道:标准品/共点/五个反应时点),点样线与溶剂前沿故意倾斜——Rf 必须按各泳道局部几何计算,交付 QC/斑点/泳道组成/反应进度/终点五类表 + 标注板图 + 报告;
  • 反应量热安全评估:电校准脉冲 + 空白滴加 + 反应运行的原始热流信号,要校准、基线校正、逐级汇总、按声明准则筛选,交付可互相追溯的六级表格链 + 诊断图 + 报告。

共同点:成功取决于完整交付一组互相一致的工件,缺任何一块都算失败。

3.2 形式化定义

每个任务包五要素对齐:任务描述(科学目标)、固定输入(数据+必要上下文)、软件环境(ORCA/CP2K/LAMMPS/AmberTools/PLUMED 等领域软件)、输出契约(必需交付物清单)、评测程序(可执行 Grader)。

双指标设计:Grader 返回原生分 $s_i \in [0,100]$(含 Judge 语义准则时跑三次取平均)。

  • Pass Rate(主指标) = $\frac{1}{N}\sum \mathbf{1}[s_i \geq 99.9]$——严格全完成比例。99.9 阈值只为吸收三次 Judge 平均的数值抖动,不放宽任何 rubric 要求;
  • Avg. Score(辅助) = 均分,只刻画部分进度。高分但不完整的提交不算通过。

3.3 抽象的精妙之处

「契约级评测」把「做完了多少」与「交付了没有」拆成两个正交度量——这正是诊断「部分进度 ≠ 完整交付」裂口的仪器。评测单位从答案升格为工件 bundle 的合取:代码/表格/图/报告必须互洽,任何一块缺失或矛盾都拉下总闸。

四、问题解法

4.1 任务收集与质量控制

四条设计原则:代表性(工作流/软件/方法反映可信的专业实践)、复杂性(端到端、依赖感知、以实质性交付物收尾,而非单条命令)、多样性(知识/类型/难度各异,不是只换输入的模板复制)、可验证性(输出可通过文件/数值/量化度量/显式验收标准评估)。排除孤立事实、单步操作、纯主观输出、缺可复现评分材料的任务。300 个工作流全部过检;从无需 GPU 的子集随机选 97 个发布,203 个内部留出(含需 GPU 的)。

4.2 任务构成

97 题 = 74 Hard + 23 Medium;六域 21 工作流族:量子化学 20(过渡态 7/电子结构 6/QM-MM 与周期 DFT 5/光谱预测 2)、材料表征 22(热-力-输运 10/衍射 5/显微成像 5/谱学 2)、分析化学 23(反应/过程/环境 11/谱学定量 7/分离与质谱 5)、分子动力学 16(输运与体相 6/自由能 5/增强采样 3/体系准备 2)、生命科学 10、电化学环境 6。

诚实声明:六域是发布集的描述性切片而非学科的概率样本,域间表现差异不应解读为学科内在难度排名。

4.3 评测配置

12 个前沿模型:GPT-5.6 Sol / GPT-5.6 Terra (max)、Grok 4.6、Kimi K3、Claude Opus 5、Qwen 3.8 Max、Qwen3.5-397B-A17B、DeepSeek V4 Flash-0731 / V4 Pro-0813、Apodex 1.1、GLM-5.2、Gemini 3.7 Flash(动态思考)。三种 scaffold:Codex(配 GPT 两款)、Claude Code(十款模型共用)、Frontier Agent(Apodex 1.1 Agent Team 配置)。Judge 用 GPT-5.6 Sol,每个被裁判准则跑三次。

五、评估指标与实验证据

5.1 RQ1:总体表现——严格完成很稀有

配置Pass RateAvg. Score
GPT-5.6 Sol + Codex20.6%87.9
Grok 4.6 + Claude Code20.6%86.6
Kimi K3 / Claude Opus 5 + CC17.5%85.5 / 84.9
GPT-5.6 Terra (max) + Codex15.5%84.7
(中段省略)10.3-15.5%—
Qwen3.5-397B-A17B + CC4.1%—
GLM-5.2 + CC3.1%—
  • Pass Rate 全场 3.1%-20.6%,Avg. Score 67.5-87.9——8 个配置均分超 80,没有一个 Pass Rate 超 20.6%;
  • 最好配置也只完成 97 题中的 20 题。Medium 题通过率最高 43.5%(Grok 4.6),Hard 题最高 14.9%(GPT-5.6 Sol);
  • 高均分往往反映「差一块就齐」的工件 bundle——部分进度翻译成完整交付的能力是独立短板。

5.2 RQ2:域级裂口——高分零通过的重灾区

域最高 Avg. Score最高 Pass Rate
量子化学91.7(GPT-5.6 Sol)60%(Grok 4.6)
分子动力学93.7(Terra)38%
材料表征88.1≤9%
分析化学87.6仅 4%(DeepSeek V4 Pro 完成 1 题)
生命科学76.820%(Kimi K3)
电化学/环境94.90%(全场无人完成)

分析化学与电化学是裂口最深的域:均分高企(87.6/94.9)但几乎无人交付完整——分数堆在「大部分做对但总缺最后一块」。域级画像也显示聚合排名掩盖专长:Terra 在量子化学大幅落后 Sol(75.5 vs 91.7)却在分子动力学反超(93.7 vs 88.9);Gemini 3.7 Flash 在量子/分子通过 25% 但材料/分析/电化学零完成。

5.3 RQ3:失败模式分析(970 条 Claude Code 轨迹)

三个互补视角:

  1. 契约违约签名随域分布:Judge 检出的工件短缺出现在 97% 的材料表征、95% 的分析化学、85% 的电化学非通过提交中(对比量子化学仅 43%)——这两个域的失败模式是「缺交付物」而非「算错」;确定性 Grader 诊断则在生命科学(50%)与量子化学(40%)更常见;
  2. 完成话术 ≠ 交付:849 条非通过轨迹中 75.5% 的结尾消息含「已完成」类词汇,只有 1.5% 明确表示还在进行;分数 <50 的轨迹完成话术降到 61.2%,但 50 分以上的非通过带全部 >78%——语言自报告与工件现实系统性脱钩;
  3. 工具错误不预测成败:非通过与通过轨迹的报错率几乎一样(80.7% vs 94.2% 出现至少一次错误;中位错误率 4.4 vs 5.6/百次工具结果)——成功的轨迹同样频繁遇错,靠恢复能力消化;错误存在本身识别不了契约违约。

5.4 资源消耗

输入 token 从 2.183M(Grok 4.6)到 13.730M(Apodex 1.1+CC)每任务——6 倍差距;GPT 两款缓存命中率 98.8%/98.5%。执行时间均值 21.8-112.8 分钟/任务,长尾显著(Frontier Agent Team 90 分位 272 分钟)。各厂商 tokenizer/缓存/报告口径不一,不能做硬件归一的效率解读。

5.5 为什么实验设计能证明论点

双指标拆分本身就是仪器:Pass Rate 度量「契约满足」,Avg Score 度量「部分进度」——两者的裂口(87.9 vs 20.6%)直接证明「会做大部分」与「交付完整」是两种能力。失败分析再往下钻一层:工件短缺签名(缺什么)、完成话术(说了什么)、工具错误(遇到什么)三个视角交叉,定位到「缺最后一块交付物 + 嘴上说完了」的组合模式。

六、效果优势的根源解释

本文是基准论文,「效果」是诊断力。根源解释:为什么这个基准能暴露其他基准看不到的东西?

机制因果链:

  1. 评分单位是工件 bundle 的合取:Grader 检查必需文件、数值结果、格式、图、代码执行、跨工件一致性——合取式评分意味着 90% 完成度与 10% 完成度在 Pass 指标上同样归零。答案式基准的析取评分(答对就赢)掩盖的正是「最后一块拼图」能力;
  2. 高分零通过的域有特定结构:分析化学/电化学的契约要求多级表格链与显式决策(如 TLC 案例的五类表 + 终点建议、量热案例的六级审计链)——Agent 能算对中间量(拿分)但不维护「全部交付物清单」的显式状态,于是遗漏。Judge 检出 95-97% 的非通过提交存在工件短缺,直接证实失败模式是「缺交付」而非「算错」;
  3. 75.5% 完成话术的根源:Agent 的终止条件由「语言上认为做完了」驱动,而契约满足是外部可验证事实——两者没有耦合机制。模型缺乏「对照输出契约逐项核对」的显式环节,自我报告与工件现实的脱钩是结构性的;
  4. 工具错误的双向分布说明什么:错误在通过与不通过轨迹同样普遍 → 长程任务的成败分水岭不在「不犯错」而在错误的恢复与契约的追踪——这为「显式契约追踪 + 跨工件验证」的改进方向给出需求论证。

如实说明:结果限于发布任务集、所评配置、Claude Code 轨迹范围、厂商资源口径、单次运行(无重复方差);域差异不构成学科难度排名。

七、必要知识反推

7.1 领域知识层

  • 六个科学域的工作流实践:TLC 板的 Rf 局部几何、量热校准链、QM/MM 设置、增强采样——不知道「专业实践长什么样」就写不出代表性任务;
  • 领域软件栈(ORCA/CP2K/LAMMPS/AmberTools/PLUMED):环境打包与执行的前提;
  • 既有基准的评测单元谱系:表 1 的六特性定位需要通读十几条基准的设计。

7.2 方法论知识层

  • 契约级评测设计:输出契约显式化、可执行 Grader、rubric 分解、Judge 三次平均的方差吸收、99.9 阈值的「不放宽」边界论证;
  • 主辅指标的语义分离:Pass Rate 主、Avg Score 辅的设计防止「部分分膨胀」掩盖交付失败——评测方法论的纪律;
  • 轨迹行为分析:完成话术的词汇判定、契约违约签名的域分布、错误率的双向对照——从「分数」下沉到「行为签名」的失败分析学。

7.3 工程知识层

  • 任务五要素标准化打包:描述/输入/环境/契约/评测对齐,Agent 可见与评测侧分离(防泄漏),可复现文档;
  • 多模型 × 多 scaffold 的公平执行:同任务同输入、统一事件 schema(Claude Code 轨迹可比的前提);
  • 留出集策略:203 题内部 held-out(含 GPU 任务)防刷分。

7.4 知识融合的关键节点

  • 节点一:「合取评分」的洞察——意识到「多个交付物必须互洽」是科学交接的本质特征,把它编码成合取式 Pass 指标——科学实践知识与评测设计的结合点;
  • 节点二:双指标裂口作为诊断仪——把「部分进度」与「完整交付」拆开度量后,87.9 vs 20.6% 的裂口自动浮现——指标设计本身就是发现工具;
  • 节点三:三方签名的交叉验证——工件短缺(缺什么)×完成话术(说什么)×工具错误(遇什么)三个独立视角互相咬合,把「自我报告不可信」从直觉变成定量事实。

八、论文中可以提取的通用性灵感

灵感一:合取式指标才能测出「差一块」型失败

核心思想:当成功定义是多个交付物的合取时,平均式指标(均分)会系统性高估能力——必须配一个「全有或全无」的严格指标,两者的裂口本身就是诊断信号。 论文证据:8 个配置均分 >80 无一 Pass Rate >20.6%;分析化学 87.6 分对应 4% 完成率、电化学 94.9 分对应 0%。 推广场景:(1) 自动化测试的「全通过率」vs「用例均分」;(2) 生产部署的就绪检查;(3) 法律文件的要件齐备审查;(4) 项目管理的里程碑完成度 vs 任务完成率。

灵感二:Agent 的自我报告不能当作完成信号

核心思想:语言系统的「我做完了」与外部可验证的交付状态之间没有内在耦合——任何长程 Agent 系统都需要独立的完成验证机制,而非信任自述。 论文证据:非通过轨迹 75.5% 声称完成、仅 1.5% 承认未完;通过轨迹的完成话术率 90.1%——话术在两类轨迹中几乎不可区分。 推广场景:(1) 人机协作的验收流程设计;(2) 自动化运维的「声称修复」审计;(3) 学生作业的 AI 辅助提交检测;(4) 多 Agent 系统中下级 Agent 的状态汇报校验。

灵感三:错误遭遇率不预测结果,恢复力才是

核心思想:在长程复杂任务中,遇到错误是常态(通过轨迹 94.2% 有错)——成败的分水岭是错误恢复与目标追踪能力,评测与训练都应关注恢复行为而非错误回避。 论文证据:非通过/通过轨迹的错误出现率 80.7%/94.2%,中位错误率 4.4/5.6——通过方反而更高。 推广场景:(1) Agent 训练的「恢复课程」设计;(2) SRE 的错误预算文化;(3) 面试中考察「从失败恢复」而非「零失败」;(4) 科研评价的重试与迭代维度。

灵感四:跨域画像比聚合排名信息量更大

核心思想:同一系统在不同子域的强弱可以互补(Terra 输量子赢分子动力学)——聚合分数会抹平这种结构,评测报告应保留域级画像支撑选型决策。 论文证据:多款模型呈现互补的域级轮廓;聚合排名掩盖专长。 推广场景:(1) 模型选型的场景化 benchmark;(2) 员工评估的维度画像而非总分;(3) 投资组合的子市场归因;(4) 医疗方案的分器官评估。

灵感五:留出集是基准长期生命力的保障

核心思想:发布一部分、留出一部分(含更难变体),既保证社区可用性又保持未来评测的抗污染能力——基准的「半衰期」设计。 论文证据:300 题中 203 题内部留出(含需 GPU 任务),发布 97 题驱动当前评测。 推广场景:(1) 竞赛的隐藏测试集;(2) 企业红队的保留攻击集;(3) 招聘的面试题库轮换;(4) 持续学习的防遗忘评估流。


一句话总结:科学 Agent 的危机不是「不会做」而是「做不完」——平均分 87.9 的系统只有两成任务能交出完整工件 bundle,七成半的半成品还嘴硬说做完了;把评分单位从答案换成契约,才能看见这道「最后一块拼图」的鸿沟。