论文链接:ScientistTwo: Pioneering the Human Knowledge Frontier with Autonomous AI 项目网站:scientist-two.github.io 发表时间:2026年9月 机构:Google Cloud AI Research(企业)+ University of Waterloo(高校)——企业+高校合作,Google 主导系统设计 领域标签:cs.AI / AI for Science / 多智能体系统

一、论文背景

AI for Science 的终极愿景是什么? 不是"帮科学家查文献"或"补全代码",而是问题驱动的自主研究:人类专家提出一个根本性挑战,AI 独立完成——文献综览、SOTA 基线复现、假设生成、实验设计与执行、消融验证、论文撰写——全程无人工介入。

此前的台阶:AI Scientist(2024)首次端到端生成论文但成本高、质量参差;后续工作在代码执行、评审模拟上各有改进;昨天日报追踪的 ScienceIDE/ScienceBuddy 把"研究基础设施"自动化。共同短板:(1) 实验验证浅(多为单数据集);(2) 没有答辩循环(论文写完即止,不回应质疑);(3) 与人类真实成就的对照缺失(自说自话)。

ScientistTwo 的差异化主张:科学发现的定义是"识别现有知识边界并踏入未知"——因此系统必须以顶会已录用论文为标尺证明自己能扩展边界,而不是以"生成了论文"为终点。

二、论文定位和关联工作

谱系代表工作核心思想与本文差异
端到端 AI 科学家AI Scientist(Lu et al. 2024)、AI Scientist v2树搜索想法→实验→论文单薄验证、无答辩循环、与人类 SOTA 无严格对照
假设生成ResearchAgent、IdeaSynthesis 类文献驱动的 idea 生成只到假设层,不做实验
实验自动化MLAgentBench、AUTOEXP自动 ML 实验单元能力,非完整发现循环
评审模拟Stanford Agentic Reviewer、AgentReviewLLM 模拟同行评审作为独立工具,本文将其闭环化
同期ScienceBuddy、ScienceIDE(9/17 日报)研究基础设施/双递归 RSI基建视角;ScientistTwo 是发现视角

定位结论:ScientistTwo 是首个把"答辩循环"内化为发现流程必要环节、并以顶会录用论文为对照基准的全自主科研系统。

三、问题定义

具体问题:给定人类提出的研究挑战,AI 能否自主产出达到顶会录用标准的论文与可验证代码库,且方法性能超越论文原始的人类 SOTA?

抽象问题:设人类知识前沿为函数 $F$(已发表成果的包络)。系统 $S$ 接收问题 $q$($F$ 上某篇论文所解决的问题),输出解法 $\hat{s} = S(q)$。要求:(1) 性能约束:$\text{perf}(\hat{s}) \geq \text{perf}(s^*_{human})$(超越人类 SOTA);(2) 质量约束:$\text{review}(\text{paper}(\hat{s})) \geq \bar{\text{review}}(\text{accepted})$(论文过录用线)。这把"AI 能否做科研"从定性争论变成两个可测不等式。

精妙之处:以"已录用论文的问题"为输入避免了任务选择的樱桃采摘质疑——问题集合由人类社区的历史产出决定。

四、问题解法

4.1 端到端发现循环

输入研究问题后六个阶段:(1) 文献与基线——检索相关工作、复现论文报告的 SOTA 方法作为基线;(2) 假设生成——识别理论/实证瓶颈,提出新颖改进假设;(3) 智能体编排——协调专业化智能体(实验设计、代码实现、结果分析等角色)执行多数据集、多指标实验;(4) 自动消融——系统性消融验证每个组件贡献;(5) 论文与代码库——生成 publication-quality 论文与完全可验证、可执行代码库;(6) 闭环答辩——模拟同行评审提出质疑 → 系统答辩与修改 → 循环直至通过。

分工哲学:人类定义挑战,AI 编排发现——人是问题的源头与最终裁判,AI 是全流程的执行者。

4.2 答辩引擎(关键创新)

与"写完就交"的流水线不同,闭环模拟评审-答辩引擎让论文在被"接受"前必须经受多轮质疑-回应-修改。这是对真实科研质量保障机制的移植——答辩循环既是过滤器(挡住经不起质疑的工作)也是改进器(质疑驱动修改)。

五、评估指标与实验证据

基准构造:ICLR/ICML/NeurIPS 已录用论文(覆盖 LLM、机器人、神经科学、语音、鲁棒性、RL、博弈论、隐私、优化、时间序列等域)——以其研究问题为输入、以其人类 SOTA 为对照。

指标数值
改进人类 SOTA 的论文数86/107(80.4%)
平均相对提升25.2%
Stanford Agentic Reviewer 评分超过 ICLR 2026 / NeurIPS 2025 录用论文均分
产出物专家级论文 + 完全可验证可执行代码库

为什么设计有说服力:(1) 对照组是真实录用论文的人类方法——不是稻草人基线;(2) 107 篇的多域覆盖排除了单一领域特化;(3) AI 评审评分与人类评审的相关性虽未知,但"超过录用均分"至少证明在同一个评审器下 AI 论文不弱于人类论文。

必须诚实的局限:(1) 评审结论依赖 Stanford Agentic Reviewer——AI 评审器与人类评审的一致性是全文最大的悬置前提(同日新闻里 Epoch AI 专门披露了其 AI 分类统计的局限性,说明业界已开始警惕 AI-as-judge 的系统偏差);(2) “改进人类 SOTA"多发生在有明确指标的 ML 任务上,理论性贡献的改进难以如此度量;(3) 计算成本论文未详细披露,RSI 式的可扩展性存疑。

六、效果优势的根源解释

6.1 根源机制与证据链

因果链 1(基线锚定):先复现人类 SOTA 再改进 → 假设生成有真实的改进靶点(而非想象的问题)→ 25.2% 提升是相对真基线的提升。【论文流程描述支持】

因果链 2(消融内化):自动消融作为发现流程的一部分 → 方法各组件的贡献被强制验证 → 避免了"堆模块论文”(AI Scientist 早期常见病)→ 评审通过率高。【推测:论文未对照"无消融"条件,此为机制推断】

因果链 3(答辩循环):多轮质疑-修改 → 论文预演了评审攻击面 → Agentic Reviewer 评分高。【同样属机制推断:无"无答辩"消融】

6.2 相关工作检索与对照

研究相似尝试相关结论与本文差异影响
AI Scientist(Lu et al. 2024)端到端论文生成可行性首证无答辩循环、验证浅、成本 $15/篇 但质量低支持:端到端路线可行
Stanford Agentic ReviewerLLM 评审模拟AI 评审与人类评审有相关性独立工具支持:评审环节可自动化;同时引入一致性风险
AgentReview评审过程模拟评审行为可仿真研究评审社会学补充:答辩循环的现实合理性
Epoch AI AI-Use-in-Math 数据(同日)AI 参与研究的测量4 月 4%→8 月 25% 数学说 AI测量而非系统印证:AI 参与研究已是现实趋势
Anthropic RSI 指标(同日新闻)Claude 主导 26% 研发RSI 工业化进行中内部工具视角交叉印证:ScientistTwo 是该趋势的公开学术侧写

6.3 综合判断与未决问题

多研究共同支持:LLM 可产出通过(模拟)评审的论文(AI Scientist 谱系已多次验证);自动化实验执行有效(MLAgentBench 等)。仍属推测:答辩循环与消融内化的独立贡献(无消融数据);AI 评审分数向人类评审的迁移性。适用条件:有明确指标与可执行代码的 ML 类研究;理论数学、需要物理实验的学科不适用。可能失效条件:人类评审者系统性变更偏好、或评审器被论文的"AI 味"优化针对性攻破时,评分优势可能蒸发。

七、必要知识反推

领域知识层:目标会议的论文结构规范(顶会论文的构成要件);ML 研究的实验方法学(基线、消融、显著性);各域(RL/优化/时间序列等)的评价指标体系。

方法论知识层:多智能体编排(角色分工、消息传递、冲突消解);同行评审的运作机制(审稿意见的结构、rebuttal 策略)——不理解评审就无法构建答辩引擎;可验证代码库的工程标准。

工程知识层:大规模实验编排(多数据集×多指标×多智能体的调度);代码执行的沙箱与验证;论文自动排版。

知识融合的关键节点:把"科学的自我修正机制"(评审-答辩)作为一等公民编入系统——此前的 AI 科学家把科研简化为"写论文",ScientistTwo 认识到科研的本质循环包含"被质疑并存活",这个认知是全文的支点。次要融合点:用人类历史产出(已录用论文)作为无偏任务源。

八、论文中可以提取的通用性灵感

  1. 质量保障循环应内建于生成系统:答辩引擎=先设计好"会被如何攻击"再产出。推广:任何自动生成物(合同、报告、代码)都应内置"模拟评审-修改"循环而非一次成型。
  2. 以历史真实产出为基准,避免稻草人对照:107 篇录用论文做标尺杜绝了自选弱基线。推广:产品对标用竞品真实数据、学术对标用 SOTA 复现。
  3. 人定问题、AI 编排执行,是当下最优的人机分工界面:问题定义的价值密度高于执行。推广:管理系统中"目标设定"与"路径执行"的分层。
  4. AI-as-judge 的结论必须披露 judge 的局限:本文最大软肋恰是同日 Epoch AI 主动披露的那类问题。推广:任何自动化评估报告都应附"评估器的系统性偏差说明"。
  5. “改进率+提升幅度+评审分"三元组是能力评估的立体画像:单一指标(如只报论文数)必然误导。推广:评估任何生成系统时同时报成功率、效应量与专家评分。

精读依据:arXiv 2609.19644 全文 71 页主体逐节阅读(摘要/引言/系统设计/实验结果/评审验证各节,附录案例抽读),覆盖 107 篇基准构造、80.4%/25.2% 主结果与答辩引擎机制。外部交叉验证引用均为可核验公开来源。