- 论文链接:Large Discovery Models: Empirically-Grounded Model-Based Open-Ended Search
- 代码仓库:github.com/yzailab/Large-Discovery-Models
- 发表时间:2026年8月16日(arXiv:2608.15669v1,LDM v0.1 初始发布)
- 机构:UCL(Jun Wang组,通讯)+ 港科大广州 + 中科院自动化所 + 吉林大学 + 天津大学 + 长三角AI Lab——六机构学术合作,三名共同一作+三名共同二作
- 领域标签:AI for Science、贝叶斯优化、开放式搜索、cs.LG
一、论文背景
**LLM 推理时扩展的成功前提是什么?**2024-2026 年推理范式的跃迁(生成→推理)依赖一个隐含条件:验证廉价且可重复——数学推导可用过程/结果验证器评估、程序可跑单元测试、博弈有精确规则与模拟器。AlphaZero 式方法把"生成-评估-搜索"闭环做到极致,AlphaEvolve 在规模上验证了"LLM提案+自动评估器"的威力。
**科学发现为什么是更难的一档?**候选空间庞大、结构化、只有部分被规格化(分子、蛋白序列、程序);反馈依赖昂贵模拟、加速器实验、物理实验——评估不能自由重复、反馈延迟且带噪声。此时 LLM 的两个固有缺陷变成致命伤:似然不是目标的好代理(新颖候选在训练分布外,LLM 自评失去校准)、自评估无认知不确定性(不知道自己不知道什么)。纯 LLM 反思(reflection)与纯统计搜索(贝叶斯优化 BO)各有盲区:前者无接地信号、后者受限于先验假设与高维离散空间。
论文的谱系定位:LLM 生成(2020-2024,“能说”)→ LLM 推理(2024-2026,“能想”)→ LLM 发现(2026-,“能设计”)——用经验接地的信号把搜索引导到开放式科学域。
二、论文定位和关联工作
| 研究谱系 | 代表工作 | 核心思想 | 与本文的关键区别 |
|---|---|---|---|
| 推理时搜索 | Best-of-N、树搜索、OpenR | 廉价验证器筛选解 | 验证须可自由重复;本文面向昂贵单次评估 |
| LLM+评估器进化 | AlphaEvolve | LLM提案+自动评估器闭环 | 依赖可编程评估器;本文用统计代理替代 |
| LLM 自反思 | Reflection/Self-refine 系 | 模型自我批评改进 | 无外部接地、无不确定性;本文实证其局限 |
| 贝叶斯优化 | AntBO(抗体专用BO)、经典GP-BO | 代理模型+采集函数 | 高维离散空间先验失配、无生成先验;本文LLM定义可达边界 |
| 定向进化/学习优化 | LEAP、POPulation方法 | 显式种群进化 | 无语言先验;本文以LLM为提案分布 |
定位结论:LDM 的独特位置是"LLM 生成先验 × 非参贝叶斯代理 × 循环更新"的三合一——生成器决定哪些候选可达,代理决定哪里值得评估,两者随实验观测共同进化。
三、问题定义
具体场景:在昂贵黑盒目标上做开放式设计搜索——神经网络训练程序(300 秒预算内最小化验证 BPB)、抗体 CDRH3 序列(20^11 空间、Absolut! 模拟器单次评估)、分子多目标优化。
核心洞察:区分预测不确定性(代理对其建模支撑内候选的无知,可通过采样减少)与搜索感知(哪些候选族能被提案过程触及)——两者给出三种搜索模式:利用(可达+高预测)、探索(支撑内+高不确定)、发现(改变支撑本身,暴露此前不可表示的候选族)。
形式化:维护发现记忆 D_t 与代理模型 f_t;每轮:LLM 依据 (D_t, 上下文) 生成/精修候选集 → f_t 预测奖励并给出不确定性 → 采集函数(不确定性感知价值)选择下一个评估点 → 实验观测 y 加入 D_{t+1} → 更新 f_{t+1}。求:给定评估预算 B 下最大化最终最优候选的奖励。
抽象的精妙之处:把"发现"定义为支撑集的变化而非简单的最优化——新颖性有了可操作的定义(此前提案分布不可达、现在可达),这解释了为何 LLM 生成器是必要的(它重塑搜索前沿)而非仅仅好用。
四、问题解法
1. 双组件循环架构。生成侧:LLM 既可 token 级直接生成(Direct,配 m=5 小样本池),也可输出结构化搜索参数间接参数化采样策略(Policy,隐式诱导更大的候选池基础测度);代理侧:贝叶斯非参奖励代理持续更新,预测性能+量化认知不确定性。
2. 不确定性感知采集。Max(取最高采集分候选,确定性)与 Softmax(按指数化采集分采样,近似完整倾斜分布)两种推理时搜索规则——采集函数不仅是后置过滤器,而是分配计算与实验资源的价值信号。
3. 三域实验设计。AutoResearch(Karpathy 2026):固定 300 秒训练预算的语言模型训练程序搜索,H100 同硬件对照;抗体:五个 PDB 靶点、每靶 200 次评估、多随机种子;分子:多目标 Pareto 前沿超体积。
4. 发现的物理学解读。AutoResearch 保留的改变以"物理接地的发现"呈现(如 n-gram 哈希记忆 ΔBPB -0.0275、QK-norm -0.0137、窗口注意力+softcap -0.0108、Muon 优化器 -0.0048)——每项在固定时间预算下的帮助机制被显式解释。
五、评估指标与实验证据
| 域 | 指标 | LLM-only | BO-only | LDM | 提升 |
|---|---|---|---|---|---|
| AutoResearch | val BPB 降幅 | 0.0301(达0.9767/255实验) | — | 0.0727(达0.9342/615实验) | 2.4× |
| 抗体(1NSN_S) | 最终最优结合能 | -91.1±3.2 (n=5) | -99.5±4.8 (n=10) | -104.7±1.0 (n=5) | 较LLM-only低18.2%、方差降为1/3 |
| 分子多目标 | Pareto超体积 | 基线 | 基线 | — | 较LLM-only +62.4%、较经典BO +63.1% |
抗体域附加发现:仅用弱语言模型先验,LDM 已与专用 BO 方法 AntBO 竞争力相当——通用框架逼近专用方法。
实验设计为何有证明力:(1) 三域横跨"程序/序列/分子"三种设计模态与"模拟器/物理评估"两种反馈类型——排除域特异有效性;(2) 同硬件同预算对照(AutoResearch H100 固定 300 秒)——排除算力混淆;(3) 多随机种子+方差报告(抗体 ±1.0 vs ±3.2/±4.8)——稳定性有统计支撑;(4) LLM-only 与 BO-only 双基线——分别击中两者盲区证明互补必要性。
六、效果优势的根源解释
LLM-only 的根本局限:似然与自评在分布外候选上失去校准——它"觉得"好的设计没有经验依据,且无法表达"对这个预测我没把握";反思循环在没有接地信号时是自洽的幻觉。
BO-only 的根本局限:高斯先验假设在高维离散空间(20^11)失配;更重要的是它没有生成先验——探索被限制在核函数的归纳偏置内,“发现新结构族"无从谈起。
LDM 的机制因果链:LLM 生成先验定义可达边界 → 代理模型提供接地预测+不确定性 → 采集函数把评估预算导向"高价值且高信息量"的候选 → 观测回流同时更新代理(减不确定性)与生成上下文(重塑支撑)→ 三种模式(利用/探索/发现)统一在价值函数下 → 体现在:BPB 降幅 2.4 倍(搜索方向接地)、结合能方差 1/3(不确定性引导避开高噪区)、超体积 +62%(支撑扩展触及新 Pareto 区域)。
反事实:去掉代理(纯LLM)——0.0301 BPB,方向漂移;去掉生成器(纯BO)——先验失配+支撑受限;去掉循环更新(静态代理)——不确定性估计过期、采集失准。
七、必要知识反推
领域知识层:三个目标域的评估语义(BPB 与训练时间预算的物理关系、结合能与亲和力、Pareto 超体积)——不掌握无法设计可比实验;科学发现的反馈特性(昂贵/噪声/稀疏)——问题动机的来源。
方法论知识层:贝叶斯非参建模与认知不确定性量化;采集函数理论(探索-利用权衡的形式化);LLM 作为提案分布的两种参数化(Direct/Policy);AlphaZero/AlphaEvolve 谱系的"生成-评估-搜索"闭环理解。
工程知识层:AutoResearch 基准的硬件级公平对照执行;Absolut! 模拟器的黑盒调用预算管理;大规模候选池的采样成本控制。
知识融合的关键节点:“预测不确定性 vs 搜索感知"的概念区分——它把"为什么需要 LLM”(重塑支撑)与"为什么需要代理”(接地+不确定性)在同一个价值函数里统一起来。这个区分要求同时深入统计学习与生成模型两个社区的核心关切。
八、论文中可以提取的通用性灵感
1. 生成器定边界、评估器定方向:任何搜索系统都应显式分离这两种角色。推广场景:人才招聘(sourcing 定义候选人池、评估定义录用决策);科研选题(文献综述定可行域、实验定推进方向);产品创新(发散工具定创意空间、用户测试定迭代优先级)。
2. 不确定性是资源分配信号,不只是风险度量。采集函数用不确定性决定"评估什么"。推广场景:主动学习(标注最不确定样本);医疗(对高不确定性病例优先会诊);投资(高不确定性标的的小仓位试探)。
3. 把"新颖"定义为支撑集变化,使创造性可操作化。推广场景:创新管理(新能力维度而非新组合);模型评测(新解法类别计数);设计学(设计空间的可表示性扩展)。
4. 昂贵反馈下,记忆与模型必须共进化。发现记忆与代理同步更新。推广场景:实验科学的电子实验记录本与假设模型联动;运维中的故障案例库与根因模型共演进;教育中的错题本与知识掌握模型同步。
5. 用"物理接地的发现"报告搜索成果,拒绝黑账。AutoResearch 的每个保留改动都附机制解释。推广场景:AutoML 结果须附超参-性能因果解释;政策试点须附作用机制评估;算法推荐须附可解释特征。