ASI-Bench: At the Dawn of Artificial Superintelligence 精读

论文链接:ASI-Bench: At the Dawn of Artificial Superintelligence 发表时间:2026年8月 机构:清华大学(核心)+ MIT + 哈佛 + CMU + 密歇根大学 + UIUC + 波士顿大学 + 昆士兰大学 + 中科大 + Flatiron Institute + 微软研究院 + AG2 AI 领域标签:cs.AI / 自主科研评测

机构合作说明:13 机构 40 余人共建,清华为第一单位(Zhen Sun、Binyu Li 等 14 位核心作者中 11 位来自清华),MIT/Harvard/CMU 深度参与,微软研究院与 AG2 提供工程支持。基准建设型工作的人力密集特性(31000+ 工时、60 个项目级任务全部经专家评审+沙箱执行+评分器验证)决定了这种大联盟形态。


一、论文背景

从 AGI 到 ASI 的能力分水岭在哪里? 论文开宗明义:现有 AI 系统的能力本质上建立在"学习、压缩、应用人类已有知识"之上,而人工超智能(ASI)要求 AI 能够探索未知、创造新知识、把新想法变成可验证的结果。这划出了一条清晰的界线:会用已知方法解题 vs 自己发明方法。

现有基准测不到这件事。 HLE 测研究生级知识问答、SWE-bench 测真实 issue 修复、Terminal-Bench 测终端任务执行——它们要么答案已知,要么方法被人类大程度指定。即便 Sakana AI Scientist 这类自主科研系统,其评测也以"给出研究目标后能否产出论文"为主,无法区分"执行了人类设计的流程"与"独立开展了研究"。

自主性是分程度而非有无的。 一个关键观察:方法学指导可以拆成多层——完整步骤流程(怎么做的每一步)、方法名(用什么做)、只有目标(做什么)。如果 AI 在撤掉某层时能力断崖,那层的缺失就是自主性瓶颈的精确定位。这类似于教育学中的"脚手架撤除"实验:逐步撤走支持,看学生哪一步真正独立了。


二、论文定位和关联工作

谱系代表工作核心思想与本文关键区别
知识/能力基准HLE、SWE-bench、Terminal-Bench已知答案或人类指定方法的任务无法测"独立选择并执行方法"
AI 科学家系统Sakana AI Scientist、Agent Laboratory 等端到端产出论文/实验是被测对象而非评测设计
科研 agent 基准AstaBench(Ai2)、ResearchClawBench 等分面评测科研 agent 能力指导层级固定,无渐进撤除设计
元认知评测AutoResearchEval、Beyond Final Scores 等过程级诊断(失败模式、过程指标)不区分方法选择与方法操作化

定位结论:ASI-Bench 的独特贡献是在同一研究项目内做指导层级的受控撤除——把"自主性"从二值标签变成可测的连续变量,并借此把瓶颈定位到"方法操作化"(method operationalization)这一此前未被命中的环节。


三、问题定义

具体场景:评估 AI 系统能否在没有人类方法学指导时独立完成项目级科研。

核心洞察:自主性 = 对指导缺失的耐受度,且不同层级的指导缺失测试不同的能力。B1(完整方法+步骤)测"按图施工";B2(只有方法名)测"把方法名翻译成完整流程";B3(只有目标)测"连方法都要自己定";B4(B3+干扰信息)测"抗无关上下文"。这个阶梯设计让"自主科研"变成可分解的诊断问题。

形式化:给定任务集 T(每个含科学目标、任务数据、可执行环境、可验证研究制品),配置梯度 G∈{B1,B2,B3,B4},测量 Score(agent, T, G)。诊断量 Δ21 = S(B1)-S(B2) 度量方法操作化依赖,Δ32 = S(B2)-S(B3) 度量方法选择依赖,Δ43 度量抗干扰性。

精妙之处:保持研究问题与评估标准在四级间不变,只动指导信息——这是标准的受控变量设计,使得各级分数差可直接归因于被撤除的指导层级。


四、问题解法

4.1 任务构造:项目级而非习题级

60 个任务覆盖 11 个科学域,每个任务四要素:科学目标、任务数据、可执行环境(沙箱)、可验证研究制品(评分基于真实执行结果而非文本评审)。全部任务经过专家评审、AI 辅助审计、沙箱执行验证与评分器验证四道关。

4.2 四级指导梯度

B1 提供完整方法学指导(含步骤);B2 只说"用 X 方法";B3 只给研究目标与数据;B4 在 B3 基础上加入任务无关信息(测试抗干扰)。评测 18 个 Agent×Model 配置(Codex/Claude Code/OpenHands 等四种 harness × 9 个模型),每配置独立跑三次报均值±标准差。

4.3 诊断指标体系

除 B1-B4 分数外,定义三个差分:B2-B1(操作化缺口)、B3-B1(总自主缺口)、B4-B3(干扰敏感度),并统计 token 消耗与执行时间的成本画像(B1→B2 token 从 4.4M 涨到 6.9M,+59%——自主性更贵)。


五、评估指标与实验证据

主结果(瓶颈定位):全模型平均 B1=50.91、B2=29.10、B3=26.62、B4=26.99。两个关键读数:(1)Δ21=-21.82 远大于 Δ32=-2.48——撤掉详细流程掉 21.8 分,再撤掉方法名只掉 2.5 分。瓶颈不是"不知道该用什么方法",而是"知道方法名也变不出完整研究程序"。(2)Δ43≈0——干扰信息几乎无害,进一步确认瓶颈在程序构造而非注意力。

最强系统画像:Codex+GPT-5.6 Sol ultra 的 B3=51.60,是唯一超过 50 的配置;从 xhigh 提到 ultra 推理等级 B3 +10.74(40.86→51.60)——大量额外推理只买到中等自主性,反衬其难。Claude Opus 5 单次运行 B1=72.29 全场最高但 B3=40.70。

Harness 效应:MiMo V2.5 Pro 从 MiMo Code 的 16.17 换到 Claude Code 升至 23.25(+44%);Kimi K2.7 从 19.72 升至 27.34。但 Kimi K3 几乎不受影响(36.22 vs 37.09)——科研能力是模型×harness 的交互属性,不能只归因模型。

为什么实验设计有证明力:三级分数的不对称骤降(-21.82 vs -2.48 vs +0.36)构成了瓶颈定位的强证据——如果是笼统的"能力不足",三级应大致均匀下降;实际的断崖恰好落在"流程细节被撤除"处。三次独立运行+标准差报告排除了随机波动;任务与评测标准跨级不变排除了"题变难了"的混淆。


六、效果优势的根源解释

本文是评测论文,根源解释的对象是"为什么当前系统卡在方法操作化"。

B1→B2 断崖的机制:现有 agent 的训练分布里充满了"给定步骤的执行"(教程、代码示例、SFT 数据),稀缺"从方法名展开成可执行流程"。方法名到流程的展开需要隐含领域惯例的补全——实验步骤的合理粒度、失败分支的处理、验证节点的插入——这些恰是文本语料中低显性化的知识。B2→B3 只掉 2.5 分则说明:在 B2 已经把流程构造不出来这个瓶颈的"下游"(方法选择)尚未成为限制因素——系统还没走到那里。

Harness 换装涨分的机制:更好的 harness 提供了更强的工作区管理、工具编排与自我检查回路——这些"研究流程基建"部分替代了方法学指导的功能,与"操作化是瓶颈"的发现自洽:harness 越完善,需要的显式指导越少。

推理等级 +10.74 的机制:ultra 级的长思考给了模型更多"内部模拟实验流程"的机会——相当于在脑内草拟操作化方案,部分弥补训练分布的缺失,但天花板明显(仍只有 51.6)。


七、必要知识反推

领域知识层:11 个科学域的方法学惯例(每个任务的专家评审者必须懂该域);可验证研究制品的设计——什么样的输出能被沙箱执行结果客观评分。

方法论知识层:受控变量实验的阶梯设计(保持问题与评分不变、只动指导层级);测量理论中的"撤除敏感性"分析;既有基准(HLE/SWE-bench/Terminal-Bench)的覆盖盲区识别。

工程知识层:沙箱化任务执行环境(60 个任务的依赖与环境隔离);评分器验证流程(防评分器本身被 hack);多 harness(Codex/Claude Code/OpenHands/Kimi Code)的统一接入。

知识融合的关键节点:最有创造性的一步是把教育学脚手架理论迁移到 AI 评测——“渐进撤除支持"是测人类学习者自主性的经典范式,迁移到 agent 评测需要同时理解测量学与科研工作流的人。第二个节点是把"自主性"分解为可分别测量的层级(操作化/选择/抗干扰),让原本不可操作的哲学概念变成三行差分方程。


八、论文中可以提取的通用性灵感

1. 用"撤除梯度"定位依赖点 论文证据:四级指导的分数差分(-21.82/-2.48/+0.36)精确定位系统依赖"流程细节"而非"方法选择"或"抗干扰”。 推广场景:新人培养中逐步撤除带教支持,定位独立工作能力的缺口环节;软件系统降级测试(逐个关闭依赖服务);组织流程审计中逐层移除管理干预看哪层失效。

2. 执行"知道是什么"与"知道怎么做"是两种能力 论文证据:从 B2 到 B3 只掉 2.48 分说明模型基本"知道该用什么方法",但 B1 到 B2 掉 21.82 分暴露"知道方法名 ≠ 能展开成可执行流程"。 推广场景:管理培训中案例知识不等于落地能力(方法操作化是瓶颈);编程教育中"懂算法"与"能写工程实现"的差距;医疗中指南背诵与临床路径执行的差距。

3. 评测对象应是"配置"而非"模型" 论文证据:同模型换 harness 涨 44%(16.17→23.25),科研能力是模型×harness 交互属性。 推广场景:招聘应评"人+工具链"的组合而非裸能力;汽车评测应含轮胎/油品配置;云计算选型应测"应用+基础设施栈"的组合表现。

4. 自主性是有价格的 论文证据:B1→B2 token 成本 +59%(4.4M→6.9M)——自主决策消耗更多计算。 推广场景:自动驾驶 L4 比 L2 贵在感知冗余与决策计算;去中心化组织的协调成本;让学生自主探索的课堂需要更多教师注意力预算。

5. 用"可验证制品"锚定开放式任务的评分 论文证据:60 个任务的评分基于沙箱执行的研究制品(图表可复现、结论可复核),而非文本评审——让开放式科研有了客观刻度。 推广场景:创意工作的评估附可执行原型;科研基金评审要求可复现代码与数据;招聘设计岗要求可运行的作品而非作品集截图。