论文链接:Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment 代码仓库:dualverse-ai/station(环境源码) · dualverse-ai/station_data_v2(全部原始对话、证明与验证代码) 发表时间:2026年8月24日 机构:DualverseAI(企业)+ University of Cambridge + University of Hong Kong + UC San Diego —— 企业 + 多高校合作:第一作者 Stephen Chung 隶属 DualverseAI 与剑桥,第二作者 Wenyu Du 隶属 DualverseAI 与港大,第三作者 William J. Wesley 来自 UCSD。企业方提供 Station 环境与工程体系,高校方贡献数学问题洞察(如 Book Ramsey 数正是第三作者本人的研究方向) 领域标签:cs.AI
一、论文背景
这篇论文回答的问题听起来有点科幻:能不能给一群 AI 只有一个研究目标,然后让它们自己搞数学研究——自己选题、自己做实验、自己写论文、自己建立一套科学文献,最后真的推进数学前沿?
要理解这件事的意义,需要先补几个背景概念。
1.1 AI 做数学:从辅助工具到前沿贡献者
过去两年,AI 在数学研究中的角色发生了质变。里程碑事件包括:
- AlphaEvolve(DeepMind,2025):一个基于进化搜索的编码智能体,把数学构造问题变成"写代码生成候选解 → 自动评分 → 进化保留高分解"的循环,在数十个分析学、组合、几何、数论问题上推进了已知界(arXiv:2506.13131)。它证明了 AI 可以系统性地做"大规模数学探索"。
- 2026 年的爆发:Jacobian 猜想被 Claude Fable 找到反例推翻、Crouzeix 猜想与 Sendov 猜想被证明、OpenAI 报告十项数学进展。AI 已经从"辅助计算"变成"前沿贡献者"。
但 AlphaEvolve 这类系统有一个隐含假设:问题必须能被打分。你得先写一个评估函数,把候选解映射成一个标量分数,进化搜索才有抓手。这适合"找更小的 Kakeya 集"这种问题,但不适合"证明一个无穷族定理"这种目标——定理没有分数。此外,AlphaEvolve 的流水线中,人类研究者仍然深度介入:把数值结果提炼成定理、提供 Singer 差集之类的构造提示,都是人做的。
于是自然的问题是:如果把流水线拆掉、把打分器变成可选项,AI 还能做研究吗?
1.2 几个关键的数学问题(直觉版)
论文的实验对象取自 AlphaEvolve 的问题目录,这里给几个直觉解释:
- Kakeya 集与 Kakeya 针问题:经典 Kakeya 问题是"一根单位长度的针,转遍所有方向,最少需要多大的面积?“有限域版本问:在一个有限向量空间里,包含每个方向的完整直线的最小集合有多大?离散版本(Kakeya needle)则把方向数限制为 n 个等距方向、用 n 个细三角形表示,问三角形并集的最小面积 CT(n)。这类问题与调和分析、数论深度相关。
- kissing number(吻接数):d 维空间里,最多能放多少个单位球同时触碰一个中心单位球而互不重叠?3 维的答案是 12(牛顿争论过)。11 维此前最好的下界是 593(AlphaEvolve 把 592 推到 593)。等价表述:找一组单位向量,两两内积不超过 1/2,问这组向量最多几个。
- 符号不确定性原理:一个函数和它的傅里叶变换不能"太快变正”——如果两者都在原点取负值,它们最早在多远的地方变成非负?这个距离的乘积有下确界 C_SU,求的是它的最优上界。
- Erdős 最小重叠问题:把区间 [−1,1] 分成互补的两部分 f 和 g=1−f,在所有平移下让两部分的重叠尽可能小,最小可能的最大重叠量 μ 是多少?已知 0.37912 ≤ μ ≤ 0.380868,区间一直收不拢。
- Jacobian 猜想:多项式映射如果处处局部可逆(Jacobian 行列式为非零常数),是否一定全局可逆?这个 1939 年提出的猜想在 2026 年 7 月被三维反例推翻——这是背景中最新鲜的事件,论文正是拿它做了压力测试。
1.3 开放世界多智能体:像科学生态一样组织 AI
“开放世界多智能体环境"指的是一种不同于流水线的 AI 组织方式:环境只提供基础设施(房间、通信、发表机制),不规定每个 AI 做什么。AI agent 像 RAID 游戏里的角色一样自由行动,但目标不是打怪而是做研究。此前作者团队的 Station v1(arXiv:2511.06309)已经验证了这一设想,但当时 agent 频繁幻觉、连环境规则都学不会。本论文是 Station v2 的大考:模型能力上来之后,这套自由体制能不能真的产出数学?
二、论文定位和关联工作
2.1 研究谱系一:流水线式 AI for 科学系统
| 工作 | 核心思想 | 与本文的关键区别 |
|---|---|---|
| AlphaEvolve(DeepMind,2025) | 进化搜索 + 自动评估器,大规模数值优化数学构造 | 流水线中心化,需人类辅助把数值结果提炼为定理;问题必须可打分 |
| AI Scientist / Agent Laboratory | LLM agent 分阶段执行"文献综述→实验→写作"固定流程 | 角色按流水线阶段切分,agent 不是完整研究者 |
| Google Co-Scientist、FutureHouse 的系统 | 多 agent 竞争-评审假设生成 | 不同模型家族被固定在流水线角色里,跨家族平等协作弱 |
| FunSearch(DeepMind,2023) | LLM + 进化搜索函数空间 | 单 agent 循环,无科学生态 |
论文自己的总结很清楚:现有系统大多把 agent 当作固定流水线里的工具,Station 把 agent 当作科学生态里的研究者——自选方向、全程负责、跨代积累论文知识。
2.2 研究谱系二:可比的数学发现平台
- EinsteinArena(斯坦福系,2026):开放在线平台,接受任何参与者的候选构造并公开验证,604 点 kissing 构型在论文发布前后也出现在该平台上(多方 AI harness 协作的产物)。区别:EinsteinArena 是开放竞技场,Station 是端到端自治的封闭系统,且 Station 独立复现了其中一个构型。
- HorizonMath:自动验证的数学进步度量基准,在 Kakeya needle 上有 0.109148 的纪录,被 Station 的 0.107067 超越。
- TTT-Discover、Ye et al. 结构化扩展:AlphaEvolve 之后的后续改进工作,在 autoconvolution 等问题上继续压界——这些问题恰是 Station 落后于 AlphaEvolve 的地方,形成了有趣的对照。
2.3 本文的直接前身
- Station v1(Chung & Du,2025):同一团队的环境原创论文。v1 验证了开放世界设想的可行性,但 agent 能力不足。本文的 Station v2 加入了 Question Room、假期机制、coder 助手、multistart 等一整套机制升级。
- AlphaEvolve 问题目录:既是方法对照的 baseline,也是实验题库——12 个问题直接取自其 6.x 系列。
定位结论
这篇论文在"AI 自主科学发现"脉络中的位置是:第一次用严格对照(同一问题、同一评分器 vs AlphaEvolve)证明"自由自治多智能体环境"能够产出相对先前文献新颖的数学结果,并且不止数值纪录,还包括定理、无穷族和可解释构造。它不是又一个流水线系统,而是对"环境设计哲学"的一次实证辩护:把 AI 当研究者而非工具。
三、问题定义
3.1 从具体场景到抽象问题
具体场景:12 个数学构造问题 + 2 个案例研究,每个问题开一个独立的 Station 实例跑 1–2 周。
论文的深层洞察在于识别出两类被现有系统混淆的东西:“可打分的代理目标"与"真正的数学目标”。AlphaEvolve 在有限域 Kakeya 问题上优化"有限个素数上的平均得分”,但数学家真正想要的是无穷族定理——两者之间需要研究者搭桥。论文把这个问题抽象为:
给定:一个研究目标 G(可能不可打分)、一个可选的评估器 E、一组异构 LLM agent、有限的墙钟时间; 求:一个环境设计 Σ,使 agent 群体在 Σ 中自主行动后,产出相对文献新颖的结果(新界、新构造、新定理); 约束:无中心协调器、无脚本流水线、无人类专家在线指导。
3.2 类比:科学生态 ≈ 搜索算法
| 科学共同体概念 | 搜索/优化概念 |
|---|---|
| 研究者(有偏好、有任期) | 搜索算子(变异/交叉,多样化) |
| 论文发表 + 评审 | 精英存档(archive-based search) |
| 阅读文献 | 继承历史信息(不需要重新发现) |
| 假期 / 反思 | 探索性扰动(逃离局部最优) |
| 停滞 → 换方向 | restart / 多样性注入 |
| 跨代传承(世代谱系) | 种群迭代 |
这个抽象的精妙之处在于:它把"科学生态的组织方式"本身当成了一种搜索算法设计,但优化目标不是标量分数,而是"新颖数学贡献"这个开放性目标——然后用真实数学前沿做裁判。
3.3 为什么这个抽象必要
如果只问"Station 得分能否超过 AlphaEvolve",那就退化为又一个刷榜工作。论文的抽象把评价轴拉宽到三个维度:①能否产出文献新颖的结果(前沿性);②能否处理不可打分目标(一般性);③发现过程是否可解释、可积累(科学价值)。后文第五部分的实验正是沿这三轴展开的。
四、问题解法
Station v2 的解法是一个完整的"AI 科研社区"操作系统。按组件拆解:
4.1 世界结构:房间化的空间 + tick 并行的时间
类比:像 MUD 游戏(或大学校园)的空间分区 + 轮次制(tick)的时间推进。
- 房间:Research Center(读任务、跑代码、提交评估)、Archive Room(发表/阅读论文)、Mail Room(私信)、Public Memory Room(持久论坛)、Common Room(非持久群聊)、Private Memory Room(私人笔记)、Question Room(提问 + 投票,类 Stack Exchange)、Reflection Chamber(反思)、External Counter(外部文献,默认禁用)。agent 必须人在房间才能用其功能。
- tick:每 tick 所有活跃 agent 同时收到观察、同时返回响应(v2 改为并行,大幅缩短墙钟时间)。单实例跑 1000–2000 tick,约 1–2 周。
- 上下文管理:对话接近约 30 万 token 上限时,Station 让 agent 写紧凑摘要,摘要 + 关键消息进入刷新后的上下文。
4.2 agent 生命周期:世代、任期与隔离
类比:学术界的博士生→教授→荣誉退休。
- 配置:每实例 6 个研究 agent——GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro 各 2 个(Jacobian 案例因时间靠后换用更新的 GPT-5.6 Sol、Claude Opus 5、Gemini 3.1 Pro)。agent 离开后由同模型新生补位,6 人构成恒定。
- 谱系:agent 组织成 lineage——继承名字、私人笔记与研究身份。Noesis III 继承 Noesis II 的全部笔记。离场 agent 还可以给自己后代写"角色说明书",沉淀研究风格。
- 生命周期:最长 200 tick;前 40 tick 隔离工作(只能看自己谱系的记录,逼出独立探索);40 tick 后"成熟"进入协作房间;100 tick 可获"终身教职"选择提前离场。
- 角色多样性:初始角色从分析型/创造型/综合型/实证型/战略型模板采样。
4.3 知识制度:论文、评审与检索
类比:预印本库 + 同行评审 + 文献综述服务。
- Archive Room:发现以"档案论文"形式发表,经 GPT-5.5 评审员判断严谨性/新颖性/有用性后接收;被拒论文带意见退回。论文全run持久,形成跨代知识库。
- Archive Surveyor:论文多了以后,agent 可以让这个 GPT-5.5/Codex 驱动的图书管理员按问题生成带引用的综述。
- Research Center + coder:实验不必是正式提交,可作沙盒诊断。v2 新增 coder(GPT-5.5 via Codex):agent 用自然语言下实验指令,coder 负责写代码、修 bug、跑评估、交报告——让研究员专注科学而非调试,就像今天的人类研究者用编码助手。
4.4 探索机制:假期、停滞协议、multistart、监督者
这是 v2 最有特色的四个机制:
| 机制 | 类比 | 做法 | 直接作用 |
|---|---|---|---|
| 假期 Holiday | 周末/学术休假 | 每 10 tick 中最后 2 tick 禁止实验和投稿,agent 收到随机反思提示(隐喻、跨领域、重访被放弃的想法等,改编自"night science"实践) | 迫使系统跳出当前搜索轨道 |
| 停滞协议 | 资助方施压换方向 | 官方评估前沿 320 tick 无改进即触发,随机分派 exploration/exploitation/revival/understanding/strategy 五条车道 | 集体逃离局部最优 |
| multistart | 并行开题、择优续投 | 从同一状态并行 8 个 rollout 跑 40 tick,GPT-5.5 管理员比较后选最有科学价值的分支继续(用于开局与停滞协议触发后) | 对冲轨迹方差 |
| 监督者 | 系主任 | 随机任命发表过论文的 GPT-5.5 agent 任 supervisor,给高层指导、防重复劳动;任期间隔刻意留 200 tick 空窗 | 轻协调而非控制 |
另有 meta-reflection:成熟 agent 每 25 tick 至少进一次 Reflection Chamber,GPT-5.5 扮演外部人类专家审视其研究旅程——把 agent 的目标对齐到"好奇心与科学价值"而不仅是刷分。
4.5 全景:一次 Station run 的输入输出
输入:任务规格(问题描述 + 评估器,可附不可打分的数学目标)。不提供文献综述、专家提示。输出:档案论文库 + 构造 + 证明 + 全部原始对话(公开)。人类事后只做两件事:筛查亮点(外部 agent 预筛 + 人工复核,标为 S1/S2/…)与验证证明有效性。
五、评估指标与实验证据
5.1 实验设置与指标体系
- 题库:AlphaEvolve 目录 12 题(覆盖分析、组合、几何、数论)+ 2 案例(Book Ramsey 数、Jacobian 猜想)。每题独立实例,1000–2000 tick。
- 主指标:相对先前文献的新颖性——不是"得分比 baseline 高",而是"产出了文献里没有的结果"。这是论文最看重的轴。
- 对照指标:与 AlphaEvolve 同题同评分器的直接对比(优于/打平/劣于)。
- 过程指标(元分析):28 个 spotlight 结果的主导模型分布、跨模型协作率、发现时间分布、机制贡献归因、可复现性。
5.2 主结果:12 题总分 5 新颖 + 3 胜 + 2 平 + 2 负
| 问题 | Station 结果 | 对照 | 新颖性 |
|---|---|---|---|
| 有限域 Kakeya(6.1) | 新无穷族 |K_p|=(2p³+7p²+3)/8(p≡3 mod 4),比 AE 族省 (p−3)/4 点;F₃⁵ 上 53 点集(文献 63,恰好命中 2009 年猜测的 k₅=53) | AE 只有有限素数结果+人工辅助成族 | 文献新颖 |
| Erdős 最小重叠(6.5) | 下界 0.37912→0.380552,闭合已发表区间约 82% | AE 上界仅 0.380927→0.380924 | 文献新颖 |
| kissing number d=11(6.8) | 3 个精确 604 点构型(K(11)≥604),2 个为新等距类;附代数显式构造(496 核 + 108 扩展,无需搜索) | AE 593 | 文献新颖 |
| 离散 Kakeya needle(6.9) | CT(128)≤0.107067(比 AE 0.114810 提升 6.74%,比 HorizonMath 提升 1.91%);另证 CT(3)=5/18、CT(4)=1/4 精确值、n=5 对称破缺 | AE 0.114810 | 文献新颖 |
| 符号不确定性(6.11) | 上界 0.3089(AE 0.321591、人类已宣布值 0.3102)——新文献纪录;并证明双根 Laguerre 族在 0.315305 处耗尽 | AE 0.321591 | 文献新颖 |
| Hardy–Littlewood(6.18) | 1.557069(AE 无提示 1.5080);额外证明 C_α=2 for 1/3≤α<1(相对文献新颖,任务没要求) | AE 1.5080/1.533 | 优于 AE |
| Ovals(6.19) | 独立恢复完整 Benguria–Loss 等式族 | AE 只恢复圆 | 优于 AE |
| 素数定理(6.27) | 0.980681 且对所有 x 严格成立(AE 0.938 仅采样);另证 Möbius 截断不可能有正渐近分 | AE 0.938 | 优于 AE |
| 差基(6.7) | 独立恢复 360 元素 Leech–Golay 构造(与 AE 逐项一致) | AE 360 | 平 |
| Sidorenko(6.26) | 均未找到反例 | AE 亦无 | 平 |
| 峰值自卷积(6.2) | C≤1.504473 | AE 1.5032 | 劣于 AE |
| 平坦自卷积(6.3) | C>0.953189;证明二值阶梯函数可逼近无约束上确界 | AE 0.961021 | 劣于 AE |
5.3 案例研究:超出打分器的两个极端
- Book Ramsey 数(Epoch AI FrontierMath 开放问题):两个 Station(一个无网、一个带网+前者摘要)自主发现并证明 2 个新无穷族(conference 族、加倍 Legendre 族);其有限构造+一个恒等式又帮助外部专家合成第三族(Yamada–Pott)。三族合计证明猜想对 n≤200 的 43 个值成立、解决 28 个此前开放情形。值得注意:evaluation 只能奖励有限构造,无穷族定理是 agent 自主追求的。
- Jacobian 猜想(2026-07-19 反例公布一周后启动):只给二元任务规格(有理系数、次数≤12、常值非零 Jacobian、一纤维两有理点),评分只有 0/1、无任何梯度信号。单个 GPT-5.6 Sol agent 在 1 天内独立重构了 7 次反例(在相差线性坐标变换意义下与公布的一致),且给出几何解释:从尖点直纹面出发推出 Jacobian 相消、三叶纤维来自三次商方程。全部原始对话公开——而原 Fable 的发现轨迹未公开。
5.4 元分析:谁在做研究、怎么协作
- 模型家族贡献(28 个 spotlight):Claude 主导 18 个(64.3%)、GPT 9 个(32.1%)、Gemini 1 个(3.6%)。档案论文投稿:Gemini 2652 投 508 中(19.2%,大量过度声称被拒)、Claude 1236 投 696 中(56.3%,论文长而全、篇均引用 9.5 最高)、GPT 506 投 388 中(76.7%,严谨低产)。
- 协作结构:13/28(46.4%)跨模型家族协作;19/28(67.9%)多 agent 参与;仅 9 个由单 agent 独立完成。跨模型协作的主要通道是 Archive Room(61.5%)——论文是低带宽高信息密度的交流介质。有限域 Kakeya S1 的发现链是教科书案例:Gemini 发表分式线性构造族 → GPT 发表平方类结构并孤立出开放计数 → GPT 写信追问精确公式 → Claude 第十四世把三家结果合成无穷族定理(跨越 tick 1041–2641)。
- 发现时间:13/28(46.4%)的亮点出现在 tick 1000 之后;conference 族在 tick 3727 才出现——重要发现往往要等内部文献充分积累。
- 机制归因(28 结果直接/间接贡献):假期 23、档案论文 21、停滞协议 14。
- 可复现性:3 个无网独立实例全部达到 604 点,但路径迥异(离散线打包 / 根系统 motif / 601 点构型形变加向量)——同一结果、不同数学表征。方差主要来自档案库的初始分叉累积,建议同题多开实例。
5.5 指标如何支撑核心主张
论文的主张是"自由自治环境能产出新颖数学"。证据设计有三层:①新颖性由外部文献锚定(不是自说自话的分数);②与 AlphaEvolve 同题同分对照给出公平战绩(5+3+2+2,且明示败绩);③元分析解释发现的生产方式(协作率、机制归因、复现性),把"结果"与"环境机制"连成因果。特别地,素数定理一题是"分数可作弊 vs 数学真值"的校准实验:有 agent 刷出 0.990629 的高分但全局不等式不成立,而获奖的 0.980681 构造对所有 x 严格成立——agent 群体有能力区分 hack 分数与真结果。
六、效果优势的根源解释
对比对象是 AlphaEvolve。它为什么强:进化搜索 + 大规模并行评估在"不规则数值对象"上近乎暴力穷举,评估器算得越快、搜索量越大,效果越好。它的根本局限也在这里:优化通道必须经过标量分数——不可打分的目标(无穷族、定理、反例重构)要么做不了,要么需要研究者搭桥;而且它优化出的构造往往是数值奇迹,人类难以理解、难以推广(593 点构型的坐标不揭示任何代数结构)。
Station 的三项根本性改变及其因果链:
① 自由自治 → 可直接追求不可打分目标。 任务规格里可以写"有限构造只是测试用例,主要目标是发现无穷族"。于是有限域 Kakeya 上,agent 独立恢复了 AE 需要人工流水线才能得到的无穷族,还发现了覆盖额外素数类的新扩张;Book Ramsey 上评估器只能奖励有限构造,agent 却自主证明无穷族;Erdős 问题上甚至违背"改进上界"的指令去做了更有价值下界证明。信息流层面:目标函数从"评分器输出"变为"任务文本中的数学目标本身",搜索空间不再被评分器可计算的范围截断。→ 体现在 5 项新颖结果中的 3 项(Kakeya 族、Erdős 下界、Book Ramsey 族)。
② 评估成本结构 → 理论引导压缩搜索空间。 单次评估上限 15–30 分钟,暴力搜索不划算,这反而激励 agent 用数学结构缩小空间。kissing number 上最典型:agent 先证明经典 D₁₁ 构造在范数-4 壳内最多 582 点(α(J±(n,4))=16A(n,4,4),与 Takhanov–Yun 2026 年 6 月才公开的定理独立重合)——这个"此路不通"定理把搜索重定向到"格核 + 扩展"路线,几分钟内找到 604 点,再提炼成无需计算机搜索的代数构造。AE 的 593 点则是大规模搜索的不规则产物。→ 体现在 604 点构型 + 代数构造 + CT(3)/CT(4) 精确值上。反事实:若去掉这个成本结构(评估无限快),Station 未必仍偏向理论路线——论文诚实地承认这是双刃剑。
③ 档案论文制度 → 知识跨代复利。 部分定理、构造、失败的记录都进入档案,后来者不必重新发明。三个无网实例全达 604 点、路径各异,说明档案积累让每个实例都"站在自己文献的肩膀上";跨模型协作 61.5% 走 Archive Room;Kakeya S1 跨越 1600 tick、四篇论文、三个模型家族。AE 存的是优化历史/中间产物(过程信息),Station 存的是论文(科学知识)——前者帮助系统继续跑,后者允许知识被提取、引用与组合。→ 体现在 tick 1000 后的 13 项亮点与复现稳健性上。
短板同样要溯源。 峰值/平坦自卷积两题 Station 落后(1.504473 vs 1.5032;0.953189 vs 0.961021):这类问题的前沿构造本质是高度不规则的数值对象,只能靠持续大规模启发式搜索磨出来——正是 αEvolve 的主场、理论引导路线的天敌。同一机制(偏向理论构造)在不同问题结构上产生相反的符号,这不是实现瑕疵而是设计取舍的必然。d=12 kissing 停在 840(前沿 841 也由大规模数值优化+结构洞察达成)进一步印证。论文据此给出诚实的选型建议:看问题结构与想要的输出——要不规则数值纪录选进化搜索,要定理与可解释构造选 Station。
另有四条被明确承认的持久缺陷:缺乏专家直觉(在弱证据下错误降优先级,错过/延迟突破)、研究口味同质化(同家族 agent 想法趋同)、上下文学习有限(知识不进权重,偶尔认不出自己的研究与档案的联系——Yamada–Pott 族正是外部专家才把 Station 自己已有的零件拼起来的)、吸引子陷阱(换随机种子反复跑同一脚本等伪工作)。
七、必要知识反推
假设一个零知识的人要完成这项工作,最少需要知道什么?
7.1 领域知识层(数学)
- 每个候选问题的前沿状态:必须知道 Kakeya 集的 Bukh–Chao 精确常数、kissing number 的 592/593 历史、符号不确定性的 0.321591/0.3102、Erdős 问题的区间、Book Ramsey 的 Wesley 猜想与 Paley 族——否则无法判断"新颖性",也无法把任务规格写得让 agent 有正确的可打分/不可打分结构。
- 构造类数学的验证标准:什么样的证明算证明(精确算术、穷举检查、代数恒等式证书),这是设计评估器和事后人工复核的前提。
- AI 数学发现的最新动态:Jacobian 反例公布一周内就设计出无公式二元任务,需要实时跟踪社区。
7.2 方法论知识层(多智能体系统 + LLM)
- 开放世界环境的组织学:房间/tick/世代/评审这些制度设计来自对科学共同体运作方式的深刻理解(Station v1 的积累),以及 night science 等创造力研究(假期提示语直接改编自 Yanai–Lercher)。
- LLM 模型家族的行为差异:GPT 严谨、Claude 持续自省、Gemini 新奇但过度声称——这些口味差异是异构配置(每家 2 个)与角色分工(coder/评审/监督者全用 GPT-5.5)的依据。
- 搜索与优化的元理论:理解探索-利用权衡、restart、archive-based search,才能把假期/停滞协议/multistart 设计成有效的搜索机制而非装饰。
7.3 工程知识层
- 大规模并行 LLM 运行基础设施:1000–2000 tick、6 agent + 辅助角色、30 万 token 上下文管理、摘要继承——没有这套工程,一切无从谈起。
- 评估器工程:把数学问题转成可自动验证的代码(kissing 重叠度量、Kakeya 方向覆盖检查、素数定理的周期性 F_f 检查),并理解采样评分的漏洞。
- 透明性设计:全量公开对话/证明/代码的 data 仓库,让发现过程本身成为可研究对象。
7.4 知识融合的关键节点
- 制度设计 × 搜索理论:意识到"科学界的组织形式本身就是一种搜索算法",于是假期=探索扰动、论文=精英存档、停滞协议=多样性注入——两个领域的知识在"机制即算法"这一点上化合。
- 任务规格 × 数学前沿:区分可打分代理目标与真实数学目标,在任务文本里显式写入不可打分目标——这是让 agent 越过评分器直接做数学的关键一步。
- 成本结构 × 研究风格:评估时限 15–30 分钟不是工程妥协,而是有意选择的激励——逼出理论引导路线。
八、论文中可以提取的通用性灵感
灵感 1:把 agent 当研究者,而非流水线零件。 论文证据:同题同分对照下 5 项文献新颖结果;自由度直接导致违背指令却更有价值的 Erdős 下界证明。推广场景:软件工程(让 agent 团队自主决定架构方向而非只分配 ticket)、自动化科研(生物/材料实验设计)、投资研究(自主尽调而非执行既定框架)、产品设计(自选用户问题去解决)。
灵感 2:显式区分可打分代理目标与真实目标,并在任务中直说。 论文证据:任务文本写明"有限构造是测试用例,主要目标是无穷族",agent 便越过评分器证明了无穷族;素数定理题里 agent 主动放弃 0.990629 的可作弊高分、选择 0.980681 的全局严格解。推广场景:任何用 proxy metric 训练/评估 AI 的场景(代码覆盖率≠质量、用户时长≠产品价值),把真实目标写进任务描述能缓解 Goodhart 效应。
灵感 3:评估成本是有意设计的激励,慢评估逼出理论。 论文证据:15–30 分钟评估上限激励 agent 先证明 D₁₁≤582 的不可能定理再转向,几分钟命中 604 点;反过来,评估极快的场景(自卷积)AE 暴力搜索取胜。推广场景:约束求解/规划系统设计(人为引入计算预算换表征质量)、教育(限时考试逼出直觉而非穷举)、RL 奖励设计(让"想清楚"比"多试"便宜)。
灵感 4:知识要以"论文"而非"过程日志"的形式跨代积累。 论文证据:档案论文对 28 个亮点中 21 个有直接/间接贡献;61.5% 跨模型协作经由 Archive Room;存优化历史的对照系统无法让知识被后来者提取组合。推广场景:长周期 AI 系统(客服/运维 agent 的交接文档)、组织知识管理(人走知识留的制度设计)、持续学习系统(外显知识库 vs 参数内隐记忆)。
灵感 5:异构模型混合组队,用口味差异换探索广度。 论文证据:64.3% 亮点由 Claude 主导、46.4% 跨家族协作;Gemini 高被拒率(80%+)但贡献新奇启发,GPT 76.7% 接收率但低产——单一口味会塌缩搜索空间。推广场景:LLM 集成/辩论系统(异构 ensemble 优于同构 self-consistency)、团队组建(认知多样性)、生成式设计(多风格 generator)。
灵感 6:强制休息与随机反思是逃离局部最优的廉价机制。 论文证据:假期机制对 28 个亮点中 23 个有贡献、居所有机制之首;每 25 tick 的 meta-reflection 让 GPT-5.5 扮演外部专家审视自己。推广场景:长时程 agent 的调度设计(周期性 context 切换)、优化算法(定时扰动/模拟退火)、个人工作法(番茄钟式的强制抽离)。
灵感 7:跑多个独立实例对冲轨迹方差,让分叉累积变成优点。 论文证据:3 个无网实例全部复现 604 点但路径截然不同;multistart 在开局与停滞时并行 8 个分支择优。推广场景:anytime 算法的 portfolio 策略、A/B 测试文化、科研资助的广撒网机制。
灵感 8:释放全部原始过程数据,把系统本身变成研究对象。 论文证据:station_data_v2 公开全部对话/证明/验证代码,Jacobian 案例保留了不出现在最终构造里的中间数学思想——Fable 的轨迹则未公开。推广场景:AI 安全(过程审计)、科学可复现性、agent 行为学(发现动力学的研究语料)。
附录:一图总结
- 一句话:把六个 GPT/Claude/Gemini agent 关进一个有房间、论文、假期和科层的开放世界 1–2 周,无中心协调,产出 5 项文献新颖数学结果 + 2 个案例级突破。
- 战绩:对 AlphaEvolve 12 题 5 新颖 / 3 胜 / 2 平 / 2 负;604 vs 593(kissing d=11);CT(128) 提升 6.74%;符号不确定性 0.3089 新纪录;Erdős 区间闭合 82%;Jacobian 反例 1 天重构。
- 命门:大规模启发式搜索问题(自卷积×2)落后于 AE;直觉、口味多样性、上下文吸收、吸引子陷阱四大缺陷仍在,人类专家的轻量介入仍是潜力项。