IdeaAMBIG 精读:从论文想法到能跑的代码之间,隔着 660 个"没人写的细节"

题目:IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications 链接:https://arxiv.org/abs/2609.10539 团队:Yale University(Yilun Zhao 通讯, Arman Cohan)× TUM × 腾讯(Yiling Ma, Sihong Wu, Manasi Patwardhan 等) 数据日:2026-09-11

一、题目与背景

AI 科学家(AI Scientist 系)与自主研究 Agent 的愿景是"从想法到论文"全自动。但任何一个复现过论文的人都知道:论文本身不是可执行的规格。超参数、预处理选择、边界条件、失败处理……这些"实现关键决策"散落在论文没写的地方,复现者靠猜测、试错、邮件询问作者来填坑。可复现性危机的一半根源不是代码缺失,而是想法规格的结构性欠约束。

这对 AI4S 是直接的前置问题:如果 LLM 看不见这些缺口,“自动实现研究想法"就是在用幻觉填补空白——生成的代码看似合理,关键决策全是错的。

二、研究定位

需求工程把歧义/不完备/不一致当作实现前的威胁研究了三十年;LLM 侧的新工作研究指令不清下的对话澄清与工具使用。IdeaAMBIG 把两条线接到"科研想法规格"这个新对象上,并做了一件两者都没做的事:用可执行实现作为地面真值——每个实例的缺口都有” annotated defect + oracle resolution",可以直接测"补上这个信息后实现质量是否提升"。

三、问题定义

实现关键缺口(implementation-critical gap):想法规格中缺失的、但会实质影响实现正确性的决策点。评测三项能力:(1) 就绪度评估——这份规格够不够直接实现?(2) 缺陷定位——缺了什么(只给规格)?(3) 澄清动作生成——该问什么(给规格+标注缺陷)?

四、解法

基准构造(双源混合):

  • 真实缺口(163 例):从 MLRC 可复现性报告、ECIR/TMLR 论文、GitHub issue(1,000 个论文仓库爬 4,106 条已关闭 issue,预筛 800 条含"缺口-解决"信号,DeepSeek-V4-Pro 分类后人工确认)提取——每个缺口锚定到论文原文的具体位置。
  • 合成缺口(497 例):注入到"可编码就绪"参考中的受控缺失——保证缺陷类型分布均衡且 oracle 已知。
  • 标注协议:两名研究生独立标注全部真实实例+200 合成样本;Cohen’s κ 达 0.84-0.92(就绪度/一级/二级标签),目标缺陷一致性 87.7%——标注质量本身达到基准发表标准。
  • 可执行评测:让 GPT-5.6-Sol 在"有 oracle 解析 vs 有缺陷规格"两条件下实现同一实例,固定解码设置,比较可运行性与功能正确性——把"缺口是否实现关键"变成可测量的因果量。

五、实验结果

发现数字
基准规模660 实例(163 真实 + 497 合成)
最好模型 Macro Defect Recovery9.6%(13 个 LLM 测评)
澄清动作质量同样低——模型不知道该问什么
可执行验证补上 oracle 信息后实现成功率显著提升(缺口确实"实现关键")
标注信度κ 0.84-0.92

9.6% 是全文最重的一个数字:当前最强的 LLM 在"发现规格缺了什么"上接近失明。对照它们在代码生成、数学推理上的高分,这是一个能力版图上清晰的黑洞——模型被训练成"给定输入产出答案",而发现"输入本身不完整"是未被优化过的元能力。

六、知识反推

  1. “欠约束检测"是自主系统的独立能力轴。SWE-bench 类任务给了完整 issue(约束齐全),IdeaAMBIG 证明一旦约束有缺口模型就翻车——执行能力与问题充分性评估能力高度不相关。自主研究 Agent 的安全边界恰好卡在这里:看不见缺口的系统会把"猜一个"当成"没有缺口”。
  2. 真实缺口与合成缺口的分布差异本身是发现。合成注入的缺口(漏掉超参、漏掉边界)模型尚能部分发现,真实缺口更多是"论文里隐含假设未声明"型——真实世界的欠约束比我们构造的更隐性,基准必须双源才能测出这个梯度。
  3. 可执行地面真值让"元认知评测"变硬。问"模型知道自己缺什么信息吗"传统上靠自我报告;IdeaAMBIG 用"补信息→实现变好"的因果链给出客观锚——这个评测构造模式可推广到一切元认知声明。

七、通用灵感

  • 给你的 Agent 加"就绪度门":接到模糊任务先跑一次"这个规格能直接实现吗"的自评(可用 IdeaAMBIG 式就绪度分类器微调一个),不就绪就生成澄清问题清单——9.6% 的现状意味着这个门现在全靠漏过的人肉兜底。
  • 复现论文前先生成"缺口清单":让 LLM 对照论文+代码仓库产出"实现关键决策点清单"再动手——即使模型发现不了缺口,清单模板(超参/预处理/边界/失败处理四栏)也强制人想过一遍。
  • 评测元认知用因果对照:测"某信息是否关键"时,别问模型"这重要吗"——做 A/B(有/无该信息)看下游产出差异。这个模式适用于 prompt 工程的归因、RAG 的证据价值评估。