论文链接:arXiv:2608.13558 代码仓库:Omni-Scientist/OmniScientist 项目主页:omni-scientist.github.io 发表时间:2026年8月 机构:新加坡国立大学、牛津大学(Hao Fei 为通讯作者) 领域标签:cs.AI / cs.CL

一、论文背景

过去两年,“AI 科学家”(AI Scientist)从概念变成了可运行的系统:给定一个研究方向,智能体能自己提假设、写代码跑实验、生成论文初稿甚至自我评审。但这些系统有一个共同的隐含前提——它们只处理"已经被序列化好的信息":文本描述、代码、数据标签、预计算的统计摘要。

这带来一个被长期忽视的问题。科学发现依赖的原始证据是异构的:天文学家看的是星系图像的旋臂形态,地震学家看的是三分量波形的偏振特征,病理学家看的是组织切片的纹理模式。这些空间关系、时序关系、跨通道关系、程序性关系很难被完整地"翻译"成文本或标量——一旦经过转写,决定性的信息就在接口处丢失了。论文给出了一个精辟的诊断:现有 AI 科学家系统越来越 workflow-complete(工作流完备),却依然是 evidence-incomplete(证据不完备)。关键问题不是"什么能被编码成 token",而是"哪些关系能穿越系统接口存活下来"。图片描述(caption)会丢失局部形态,无序的特征向量会抹除时序结构,少数几个标量会隐藏跨通道的不一致。

打个比方:这就像让一位科学家只通过实验员的口头汇报来做研究——实验员可以说"信号看起来比较平稳",但"平稳"这个词背后蕴含的瞬态能量爆发、跨分量重合结构,永远无法从这几个字里还原。要做出真正基于证据的科学发现,AI 科学家必须亲自看到原始数据,而且是在研究的每个阶段——选题时、做实验时、写论文时——都能看到。

这就引出了三个耦合的难题:第一,如何让一个系统统一处理从振动光谱到知识图谱、从胸片到引力波信号这般异构的原始证据?第二,让智能体自由接触原始数据后,如何防止它伪造数字、事后编故事(HARKing:结果已知后再造假设)?第三,如何评估"感知能力"本身对科学发现质量的贡献——现有基准只给最终产物打分,从不考察系统看到了什么。

二、论文定位和关联工作

自主科学发现智能体谱系

单域自动化阶段。Boiko et al. 2023、Szymanski et al. 2023 等工作率先在单一实验室场景(如化学合成流程、从衍射图谱选择合成路径)中实现了闭环科学自动化,证明了可行性,但覆盖面极窄。

全生命周期阶段。以 AI Scientist(Lu et al. 2026)、Agent Laboratory(Schmidgall 2025)、InternAgent 2025 为代表的系统在软件仓库上实现了"想法→代码→论文→自审"的全自动流程,以数值指标提升为成功度量。这是 OmniScientist 最直接的对照系——它们证明工作流可以全自动,但只关注人类已经转成文本/代码/数字的内容,忽视了原始证据本身。

跨学科真实数据阶段。Mitchener 2025、Villaescusa-Navarro 2025、Gottweis 2026 等让智能体在真实科学数据上工作,假设经过实际验证,但仍依赖预处理后的表征——感知发生在系统之外。

科学多模态感知谱系

通用多模态模型(CLIP、Flamingo、LLaVA)已具备很强的感知能力;科学基准(图表理解、显微图像分析、生物声学)也大量存在。但这条线的局限是:感知被当作独立的问答技能来考察——由人选择观测、提出问题、判断答案,感知与发现过程脱节。科学智能体系统中的感知多为孤立阶段:看看自己生成的图(Yamada 2025)、给图表打分(Gandhi)、读仪器界面(Sun 2026)。OmniScientist 的差异在于让感知在研究生命周期的每一阶段都活跃。

智能体编排谱系

从 ReAct、Reflexion、Toolformer 的单智能体推理+工具调用,到 Agent Laboratory 的多智能体分工、虚拟实验室的专家团队协作——这些系统的阶段转换与验证依赖模型生成的消息,而模型输出是易错的。OmniScientist 采用"pipeline of agents"(智能体管线):阶段内推理保持开放式,阶段间转换由确定性代码控制,输出不 grounded 就回溯。

维度之前的路线OmniScientist 的突破
证据输入文本/代码/标签/预计算摘要12 种模态的原始观测直接输入
感知时机孤立阶段或从不感知选题、实验、写作全程感知
质量控制依赖模型自我审查代码强制三重检查(新颖性/严谨性/主张)
流程控制prompt 驱动的消息传递确定性管线,不通过即回溯
学科覆盖单域或需领域定制代码36 案例 5 学科家族零改动复用

定位结论:OmniScientist 是第一个直接感知原始观测、覆盖 4 大证据家族的端到端 AI 科学家,并且首次用严格的配对消融量化了"感知本身"对科学发现质量的因果贡献。

三、问题定义

论文面对的具体场景是:给定一组异构原始科学数据(比如一批带噪标签的地震波形、一堆儿科胸片),让系统独立走完"提出研究问题→设计并执行实验→写出可编译论文"的全流程。

表面上看,这是三个独立的子任务。但论文的核心洞察是发现了一个深层结构相似性:这三个阶段的质量都取决于同一件事——原始观测中携带的关系是否全程可用。选题需要从数据中"看到"值得研究的现象;实验需要基于观测到的结构设计检测器;写作需要每个数字都能追溯到真实执行记录。如果感知只在某一阶段存在,其他阶段就会退化为"无据可依的猜测"。

因此问题可以被抽象为:

  • 给定:异构原始证据集合 E(图像、信号、音频、视频、3D、轨迹、表格、公式、图谱等)、一个规范文件(数据集 + 科学主题 + 目标属性)、一个推理骨干模型 M;
  • 求解:一个从 E 到可编译论文的自动化流程 F;
  • 约束:(1)F 必须允许观测塑造研究问题、实验决策与最终主张(全生命周期感知);(2)每个数字可溯源至真实执行输出、每个主张有实验支撑、统计有效(反伪造、反 HARKing);(3)跨学科零改动复用(学科无关)。

这个抽象的精妙之处在于把"AI 科学家"问题从工作流编排问题重构为信息流保真问题:不是"智能体能不能做完每一步",而是"决定性证据能否无损地流过每一步"。工作流完备而证据不完备的系统,本质上是在用不完整的信息做完整流程的决策——每一步都正确,每一步都建立在缺失之上。

四、问题解法

OmniScientist 的架构可以概括为"一个感知层 + 三个智能体 + 一条确定性管线 + 三重代码检查"。用类比来说:感知层像实验员的眼睛和仪器,三个智能体像研究生(出题、做实验、写论文),确定性管线像实验室的管理制度,三重检查像伦理与数据审查委员会——研究生可以自由探索,但每一步产出都要过审才能进入下一环节。

4.1 感知层:证据家族 → 模态 → 注册工具

感知层用三级层次结构组织对原始制品的观测:

  1. 证据家族(4 个):按"解释该证据需要什么推理范式"做学科无关的分类——感知型(图像、视频、音频、3D 结构)、符号型(公式、规则、知识图谱)、定量-统计型(表格、分布、回归结果)、程序/动态型(实验步骤、代码执行、仿真轨迹);
  2. 模态(12 种):家族内确定制品的确切表示——image、signal、spectrum、audio、video、3-D、trajectory、table、formula、sequence、field、graph;
  3. 注册工具:每种模态解锁一组预注册的分析工具,智能体通过调用工具检查制品。

感知策略遵循"数值优先、按需渲染、预算约束“三原则:智能体不急于把数据渲染成图给视觉模型看,而是优先做原生数值分析(如直接提取 FFT 峰值、趋势点);仅当空间/结构模式必不可少时才调用视觉渲染;视觉感知受预算限制(ideation 阶段为 min(24, max(8, 2g)) 次检查,g 为标签组数;实验阶段最多 8 次视觉检查),防止无的放矢的浪费。这一设计等价于人类科学家的习惯——先算统计量,确有必要才画图细看。

4.2 三个 ReAct 智能体

任务的唯一输入是一份规范文件(数据集 + 科学主题 + 目标属性),此外无任何人类提示,方法论完全由智能体自主决定。

Ideation(构思智能体):先通过感知层盘点材料、建立 grounding;再经 OpenAlex(Crossref 回退)做文献检索(至少 3 次聚焦检索);随后生成至少 5 个候选想法,逐一评估新颖性风险与可行性,选出最强候选。对应的 idea check(代码强制)要求:结构完整(研究问题、假设、实验草图、可证伪标准)、过程充分(5 个候选 + 3 次检索)、可代码执行且不需物理实验、无数据泄漏、样本量充足。特别值得一提的是"过度自信降温"机制:自动把"first”、“never explored"等绝对化表述改写为"基于本次检索似乎探索不足”——因为单次有界检索无法确立绝对优先权。

Experiment(实验智能体):把定稿想法转化为方法学设计与迭代代码生成,运行于受控 run_python 环境(管理子进程执行与图表捕获,单次 150 秒超时,最多 50 步);持续调试循环直至成功;全程可调用感知层检查原始数据或验证自生成图表中的结构。必须完成至少 4 项分析:主假设检验 + 基线/消融/机制探针/敏感性扫描等对照。对应的 rigour check(Algorithm 1)逐条审计执行记录:必须真实运行代码、每个报告数字必须能在 stdout 中找到、数据必须从磁盘加载、报告 ≥2 个 p 值时必须对所有测试(含被降级者)做多重比较校正、headline 主张必须来自 supported analyses(反 HARKing 与"事后补救"防线)。

Writeup(写作智能体):核心机制是"切片写作"(record-sliced writing)——每一节只能从其所需的结构化实验记录切片扩写:方法学细节进入方法节、决定性数字进入结果节,任何一节都不能引入它未被给予的细节;摘要最后基于同一记录写,保证数字与正文一致。对应的 claim check 将稿件中报告的每个数字 n₁…nₖ 与执行记录输出比对、每个主张 C₁…Cₘ 与记录分析 E₁…Eₘ 比对,最后经 meta-audit 对照实验记录核查全部主张。系统还内置 5 种期刊结构规范(ML 论文含 Related Work 与 Limitations,生物医学论文 Methods 置末等),实现引擎与领域的解耦。

4.3 确定性管线与崩溃回流

围绕开放式智能体的是一条薄确定性流水线,控制阶段转换:每个阶段的输出只有在通过代码检查后才被接纳进入下一阶段。当实验崩溃或产生零结果(null result)时,流程回流至 ideation 重新选题,最多回流 2 次后终止——既给了系统"发现此路不通就换方向"的自主性,又用硬性上限防止无限循环。

组件输入输出关键约束
感知层原始制品(12 模态)数值属性 / 视觉表征数值优先、视觉预算
Ideation规范文件 + 观测 + 文献定稿研究想法≥5 候选、idea check
Experiment想法 + 原始数据执行记录 + ≥4 项分析rigour check、150s 超时
Writeup执行记录切片可编译 PDFclaim check、meta-audit
管线各阶段输出阶段转换决策检查不过即回溯,≤2 次回流

五、评估指标与实验证据

5.1 评估体系

论文设计了一个 36 案例的演示套件,覆盖 5 个学科家族(物理科学 5、地球与空间 9、生命与医学 7、农业与生态 8、工程与信息 7)、4 个证据家族、12 种模态,数据规模从 12 条符号回归方程到 508 万条边的生物医学知识图谱。其中感知型证据占 28/36,其余 8 例来自符号/统计/程序型家族作为广度对照。

评分维度(7 维,0-10 分):5 项标准同行评审指标(Novelty、Soundness、Clarity、Significance、Reproducibility)+ 2 项任务专属指标(Multimodal grounding 多模态接地、Factual accuracy 事实准确性),综合分为 7 维均值。评审由双评审模型(deepseek-v4-flash + gemini-2.5-flash-lite)完成,刻意选自被测系统之外的模型家族以规避利益相关。为排除混淆,系统做了严格的角色分离:推理骨干(唯一被替换项)、感知模型(固定为 Claude Sonnet 5,从不跟随骨干变化)、评分评审三者独立——这样分数变化才能归因于推理能力本身。稳健性方面:分数与稿件长度相关性仅 ρ=0.16(无冗长偏置),各骨干间维度排序的中位成对 Spearman 相关达 0.82。

5.2 主结果

端到端完成率与质量:36/36 案例全部完成从原始数据到编译论文的完整路径。主骨干 Sonnet 5 的 Overall 得分为 6.3/10,其中 Factual accuracy 7.7 为最高维度(所有骨干上恒居第一,论文归因于共享的溯源约束),MM-grounding 5.1 为最低。

骨干对比(这是本论文一个非常扎实的实验设计——9 个骨干模型同台):

BackboneOverall完成率备注
GLM-5.26.517/18子集最优
Sonnet 56.336/36参考骨干,全套件
Kimi K2.76.26/9Factual 8.0 最高
GPT-5.65.69/10
Qwen3.5-9B4.018/36完成率腰斩

一个反直觉的发现:Factual accuracy 与 Soundness 对骨干强度最敏感(最强/最弱骨干差 2.9 分),而 MM-grounding 最不敏感(仅差 1.2 分)——强推理骨干并不能天然带来多模态任务所需的感知能力,感知质量主要取决于固定的感知模型与分析工具,而非推理骨干。

跨学科稳健性:按学科或模态分组,综合分中位数紧密分布于 6.1–7.1,跨域差异在案例级置换检验下均不显著——系统没有"主场学科"。

成本:单次完整三阶段运行 $0.03–$4.34(取决于骨干),实验阶段占大头。

5.3 关键实验:感知的因果贡献(配对盲测消融)

这是全文最有说服力的实验。作者构造了一个"盲测"(blind)变体:只接收预计算标量特征、从不接触原始观测——精确模拟传统纯文本 AI 科学家系统的接口。两组系统在 5 个案例上配对运行,评审以随机顺序做头对头评估:

  • 感知版胜率 85%;
  • 全部 7 个维度均占优,其中 MM-grounding +2.8(最大)、Significance +1.8;Factual accuracy 两者相同(因为都受相同的溯源检查约束——这恰好反证溯源机制独立起效);
  • MM-grounding / Significance / Novelty 的平局率趋近于零,说明感知版与盲测版产出的稿件始终可区分。

机制层面(对 5 对运行的追溯分析):感知版的研究问题锚定于只有原始记录才携带的信息——星系图像的形态学、三分量波形的偏振、病理切片的纹理、CAD 点云的主轴几何;盲测版则无一例外地局限于预给标量特征的框架内。最典型的是地震学案例:盲测系统仅凭文本特征名设计出需要数据中不存在字段的研究,被迫大量被动重规划;感知版从起步就形成可执行假设。

留一消融(地震学案例):移除先前技术检索跌幅最陡(6.9 → 5.7,容易提出已发表的想法);智能体循环退化为单次显著劣化;移除新颖性检查使 Novelty 评分整整降 1 分。

5.4 案例研究:系统如何"看到"问题

地震基准审计(STEAD):智能体在标签为 noise 的波形中视觉识别出清晰的"起始-衰减"包络——但噪声本应只有平稳背景。由此自主形成问题:噪声标签记录中携带相干瞬态能量的比例是多少?它自主工程化了复合检测器(STA/LTA 特征函数 + 振幅 + 线性度 + 平面度 + 跨通道重合项),结论是 21.7%(163/750) 的"噪声"记录携带相干瞬态爆发(95% CI [18.8, 24.9]%),并在 417 个台站的聚类 bootstrap 下稳定于 19–25%。更难得的是:预注册的仪器类型假设被数据驳回后,系统客观地以流行率发现为 headline——这是反 HARKing 机制在真实场景中生效的直接证据。

儿科胸片纹理签名:直接读片观察到肺炎肺野并非均匀变亮而是斑驳状,将其转化为可测量量——滑窗局部 Shannon 熵图的空间离散度。效应量 Cohen’s d = 1.25(held-out 集 1.29),仅"斑块度"一项 AUC 即达 0.847,远超 raw-pixel 基线的 0.634,且独立于整体熵水平(p = 1.7×10⁻⁵)——证明判别信号来自高级空间抽象而非像素强度。这个案例完美展示了"感知驱动选题":从"看到斑驳"到"量化斑块度"到"验证其独立判别力",整条链路由一个视觉观察启动。

六、效果优势的根源解释

论文的核心对比是:直接感知系统 vs 盲测变体(仅预计算标量特征)。盲测变体并非稻草人——传统 AI 科学家系统确实只接收这类输入,且它们已经能产出格式完整、数字可溯源的论文。为什么加上原始感知后能在 7 个维度全面占优、胜率 85%?答案的结构不是"多了个视觉模型所以更好",而是信息流被根本性地改变了。

盲测变体的根本局限:瓶颈不在模型能力,而在接口处的信息湮灭。预计算标量特征是特征工程者对数据的一次性"翻译",这个翻译在系统开始思考之前就已完成,且不可逆——星系图像被压缩成几个 morphology 特征后,任何"这个特征组合是否真的对应棒旋结构"的质疑都无法被验证,因为原始形态已不可访问。更致命的是,盲测系统不知道自己不知道什么:地震案例中它凭特征名设计出需要不存在字段的研究,说明标量接口不仅丢失信息,还制造了"数据里有什么"的错误心智模型。这解释了为什么盲测版无法产生 Significance 高的选题(+1.8 的差距)——重大问题往往藏在"数据与标签/预期不符"的异常处,而异常恰恰是标量摘要最先抹掉的东西。

因果链一:感知 → 问题锚定于真实结构 → Significance/Novelty 提升。全生命周期感知改变了选题的信息基础:ideation 阶段的感知让智能体直接观察未压缩的原始记录,于是研究问题锚定于只有原始数据才携带的关系(噪声波形的包络异常、胸片的斑驳纹理)。这些问题天然具有"数据支持的现象学"根基,因此 Significance +1.8;又因为这些问题不可能从标量特征推导出来,天然避开了"在已有特征上做排列组合"的低新颖性区域,Novelty 平局率趋近于零。

因果链二:感知 → 实验设计可执行 → 效率与 Soundness 提升。盲测版发现假设不可执行后只能被动重规划,浪费步数且引入脆弱性;感知版从 outset 即形成与数据实际字段对齐的假设,run_python 里的代码与亲眼所见的结构一致,实验一次通过率更高,统计设计也更有针对性(复合检测器的每一项都对应观测到的具体结构特征)。

因果链三:切片写作 + claim check → Factual accuracy 恒居首位。写作智能体每一节只能从结构化实验记录的指定切片扩写、任何一节不得引入未被给予的细节——这从机制上消灭了无据细节的产生通道,而不是事后检测幻觉。claim check 再把每个数字与 stdout 比对、每个主张与记录分析比对,数学上保证每条经验主张可溯源。这条链的效果在数据上非常干净:Factual accuracy 在所有 9 个骨干上恒居维度排名第一,且在盲测对比中与感知版打平(都受同一溯源约束)——两个事实交叉验证了"溯源机制独立于感知机制起效"。

反事实推理:如果去掉切片写作与 claim check,会发生什么?留一消融中"溯源强制"是代码级确定性约束,论文指出它"不直接改变被评文本但数学上保证可溯源"——而骨干对比提供了间接反证:Qwen3.5-9B 的 Overall 从 6.3 掉到 4.0,但即使是最弱骨干,Factual(4.8)依然是它的最高或接近最高维度之一——说明事实性主要由机制而非模型能力保底。反之,如果去掉感知但保留三重检查(即盲测变体),系统依然诚实(Factual 不降)但选题平庸(Significance -1.8)——诚实与洞察来自不同的机制,这是本文架构设计的深层智慧。

一句话总结根源:不是"本文用了多模态模型所以效果好",而是"本文让决定性证据穿越了全部接口,同时用确定性代码把’诚实’从模型品格问题变成了结构保证——洞察来自信息流,诚实来自约束流"。

七、必要知识反推

假设一个完全没有背景的人要做这个工作,最少需要掌握什么?

领域知识层:(1)科学实践的本质流程——选题要文献查新、实验要有对照组与多重比较校正、写作中数字必须可溯源、HARKing 是学术不端——不理解真实科学生产的规范,就无法把"质量控制"设计成三重检查而非一句 prompt 叮嘱;(2)科学证据的分类学——知道按"解释证据所需推理范式"(而非学科)划分家族,才能设计出学科无关的感知层,这需要对物理、地学、生命、工程多学科证据形态的横向观察。

方法论知识层:(1)ReAct 式智能体设计的成熟经验——推理与行动交替、工具调用、反思循环;(2)多模态感知的技术边界——知道视觉模型什么时候必要、数值分析什么时候更可靠,才能设计出"数值优先、按需渲染"的预算策略;(3)确定性系统与智能体的混合架构——理解"何处需要开放探索、何处需要可预测保证"的分工直觉,这来自对两种范式各自失败模式的深刻认识。

工程知识层:(1)受控代码执行环境(子进程管理、超时、stdout 捕获)——rigour check 的数字溯源完全依赖对执行记录的工程化捕获;(2)统计有效性工具链——多重比较校正、bootstrap、效应量、预注册,Algorithm 1 的每一条都是统计方法学知识的代码化;(3)评估实验设计——角色分离(骨干/感知模型/评审独立)、跨家族评审回避、随机顺序头对头、与稿件长度的相关性检验,这些防混淆设计决定了结论的可信度。

知识融合的关键节点:最有创造性的融合发生在两处。其一,“证据不完备"诊断把信息论视角(哪些关系能穿越接口存活)嫁接到科学发现流程上——这要求作者同时理解多模态接口的损失机制和真实科学生产的证据依赖方式。其二,“把学术诚信机制翻译成确定性代码”——新颖性筛查、反 HARKing、数字溯源本来是期刊审稿人的工作,作者识别出它们中可算法化的子集(数字 ∈ stdout、headline ∈ supported analyses、p 值校正分母完整性),这是领域知识向工程约束的精准映射,是整篇论文最不可替代的洞察。

八、论文中可以提取的通用性灵感

灵感一:接口保真度是系统级瓶颈,优先于组件能力。 核心思想:当流水线中每个组件都足够强时,性能瓶颈往往转移到组件间接口处的信息损失,提升接口保真度比替换更强的组件收益更大。论文证据:同一推理骨干下,仅把输入接口从标量特征换成原始感知,7 个维度全面占优、胜率 85%,增益超过更换骨干(GPT-5.6 vs GLM-5.2 差 0.9 分,而感知消融 MM-grounding +2.8)。推广场景:企业数据管道中"分析师只看 BI 看板摘要"与"分析师直查明细"的决策差异;多智能体系统中压缩消息传递 vs 传递完整上下文的权衡;LLM RAG 系统中"检索摘要"与"检索原文段落"的选择;自动化运维中告警聚合(有损)与原始日志(无损)的分层。

灵感二:把"软规范"编译成"硬检查”,用确定性代码环绕开放智能体。 核心思想:对智能体的输出要求(诚实、严谨、合规)若停留在 prompt 层就是概率性的,把可算法化的子集提取为代码强制检查,能把"品格"变成"结构保证"。论文证据:Factual accuracy 在全部 9 个骨干上恒居维度第一,即使 9B 小模型也保有 4.8 的事实性——机制保底能力强于模型能力差异;崩溃回流上限 2 次防止无限循环。推广场景:金融报告生成中"每个数字必须链接到账目明细"的强制校验;代码智能体的安全检查(危险操作白名单而非"请谨慎"提示);内容审核流水线中"主张-证据对齐检查";法务合同审查的条款溯源约束。

灵感三:过程性证据(做了什么)比结论性证据(做出了什么)更可靠的审计对象。 核心思想:审计智能体时,审它的执行记录(stdout、数据 I/O、全部测试清单包括失败尝试)远比审它的自述文本可靠——文本可以被美化,记录不能被伪造。论文证据:rigour check 与 claim check 审计的是同一份执行记录而非智能体撰写的文本;多重比较校正特意覆盖"被降级的尝试"以防人为缩小校正分母。推广场景:AI 编程助手的验收应基于测试执行日志而非代码注释;模型评测的防污染应基于训练数据清单而非模型承诺;科学复现应基于原始实验轨迹而非论文方法节。

灵感四:预算化感知优于无界感知。 核心思想:让智能体"什么都能看"不等于"应该一直看"——原生数值分析优先、视觉渲染按预算触发的分层策略,兼顾了深度与效率。论文证据:视觉预算公式 min(24, max(8, 2g)) 与实验阶段 8 次视觉检查的约束下,单次完整运行成本压到 $0.03–$4.34。推广场景:LLM 长上下文处理中"先摘要索引、按需展开原文";智能体工具调用中的成本分层(便宜工具先用);数据探索中"先看统计概览再抽样细看"的节奏控制。

灵感五:角色分离使归因成为可能。 核心思想:评估复杂系统时,把可变项(推理骨干)与固定项(感知模型、评审模型)严格分离,才能把分数差异归因到单一因素。论文证据:感知模型固定为 Claude Sonnet 5 从不跟随骨干变化、评审来自系统外模型家族、随机顺序头对头——由此才能得出"骨干强度影响 Soundness 但不影响 MM-grounding"这类精细结论。推广场景:A/B 测试中隔离单变量变化的实验纪律;多模型产品中"哪一层模型负责什么能力"的架构归因;自动化系统评估中人机因素的分离设计。

附录:运行参数速查

阶段关键限制
Ideation≤24 智能体步、≤8 次文献查询、视觉预算 min(24, max(8, 2g))
Experiment≤50 步、≤8 次视觉检查、run_python 单次 150s 超时
Writeup每次文本生成 ≤8,000 tokens、5 种期刊结构规范
回流≤2 次回退至 ideation
成本单次完整运行 $0.03–$4.34(实验阶段占大头)
输出物结构化 JSON 记录、Markdown 摘要、可回放执行轨迹、编译 PDF