PrimeScientist:让自主研究智能体学会战略性分配研究努力
论文信息:PrimeScientist: Strategic Allocation of Research Effort in Autonomous Research 作者:Xinle Yu, Fan Bai, Kaiser Sun, Hengshuo Miao, Abhay Anand, Zhongyan Luo, Kun Zhou, Zhen Wang(UC San Diego + Johns Hopkins University) arXiv:2609.17846(2026-09-15 提交)|代码:GitHub
一句话先给出结论:这篇论文第一次把「往哪个研究方向投入多少研究努力」本身当成一个需要显式优化的能力来做——计划构造与实验执行共享同一份推理 token 预算,用剩余预算比驱动的自适应 MCTS 在探索与开采之间动态切换,最终在三大基准上做到了「分数更高或持平,尝试次数减半」。
一、论文背景
2026 年 3 月,Karpathy 用 630 行 Python 写的 autoresearch 引爆了整个 AI 圈:一个 agent 读 Markdown 计划、改训练代码、跑固定 5 分钟实验、根据指标决定保留或回滚,一夜能跑上百次实验。围绕这个核心循环,一系列系统迅速涌现——把机器学习工程做成代码空间树搜索的 AIDE、用渐进式树搜索写出通过同行评审的 workshop 论文的 AI Scientist-v2、微软亚研的 R&D-Agent 等等。autoresearch 作为一种研究范式已经成立。
但所有这些系统都共享一个被忽视的矛盾:智能体能提出的研究方向,远远多于资源允许它尝试的方向。一次端到端的研究尝试(实现、实验、分析)要消耗大量 token,而 LLM 恰恰擅长生成看似都合理的备选方案——不同假设、不同数据集、不同模型族、不同消融策略。每一次尝试都把资源押注在一个方案上,同时挤压了后续尝试的空间。
更微妙的是,这些系统的导航策略各有缺陷:AutoResearch 把每次新尝试都分配给「当前轨迹」,走过的路径基本决定了后续努力去向;AIDE 和 AI Scientist-v2 虽有分支结构,但导航用固定规则或 LLM 直觉判断,不显式表示剩余预算;R&D-Agent 在实现前选想法并按剩余时间调整规划,但规划消耗的资源不在分配目标内。
论文的核心主张因此非常清晰:「决定往哪投入研究努力」不应该是隐式的副产品,而应该成为自主研究智能体的一种定义性能力(defining capability)。资源有限不是缺陷,而是自主研究无法逃避的常态——既然如此,精打细算本身就应该是研究策略的一部分。
二、论文定位和关联工作
论文用一张五维对比表(表 1)把自己放进谱系里。五个维度是:分支探索(保留备选方案)、计划级搜索(在尝试之间选择未执行的计划)、价值回传(用后代结果更新祖先价值)、战略努力规划(按剩余预算调整探索与精炼)、共享 token 预算(规划与执行的所有 token 计入同一预算):
| 系统 | 分支探索 | 计划级搜索 | 价值回传 | 战略努力规划 | 共享 token 预算 |
|---|---|---|---|---|---|
| AutoResearch(Karpathy) | – | – | – | – | – |
| AIDE | ✓ | – | – | – | – |
| AI Scientist-v2 | ✓ | – | – | – | – |
| R&D-Agent | ✓ | ✓ | – | ✓ | – |
| MARS | ✓ | – | ✓ | – | – |
| AlphaLab | ✓ | ✓ | – | ✓ | – |
| PrimeScientist | ✓ | ✓ | ✓ | ✓ | ✓ |
几个「最接近但不重合」的对手值得展开:
- MARS 做了成本约束的 MCTS,但它的 reward 混入了候选执行时间,且规划预算不在分配目标内;
- AlphaLab 的 Strategist 确实用「剩余实验数」从探索转向精炼,但只调整了实验队列的选择,构造这些实验的规划消耗仍游离在预算之外;
- FML-Bench 的 AdaptiveSearch 检测到停滞时一次性从贪心精炼切换到多分支探索,切换逻辑是「事件触发」而非「预算驱动」。
PrimeScientist 填的空白可以概括为一句话:计划构造与执行共享同一预算的统一分配策略——选一个未测试的计划执行是一次尝试,选一个已评估的计划展开新变体是构造备选,这两个动作花的是同一份钱,应该由同一个策略统筹。据作者所知,这是第一个在共享推理预算下联合建模计划构造与完整研究尝试的形式化。
理论上,论文自觉地把这项工作挂靠在 Simon 的有限理性、Gershman 的计算理性和 rational metareasoning(把「算什么」本身当作一个决策)这条思想脉络上——自主研究智能体的「元层决策」终于被摆到了台面上。
三、问题定义
论文的形式化(定义 1,公式 1-2)干净利落。给定研究任务 x、计划构造算子 G、执行器 A、评估器 h 和资源预算 B > 0,在决策时刻 t:
- 状态 Xt = (x, Pt, Ht, B − Ut):当前可用计划集合、历史记录(提案、结果、已计费成本)、剩余资源;
- 动作三选一:通过 G 构造或修订计划、执行某个计划 s ∈ Pt、停止;
- 目标:maxπ JB(π) = E[V(Hτ)],其中 τ 是停止时刻。
关键设计有三个。第一,核心耦合(central coupling)被明确点出:研究备选方案本身也要靠研究努力来产生。构造一个计划改变了「能测试什么」,执行一个计划改变了「后续决策有什么证据」,两者都消耗预算——这就是为什么分配策略必须联合决策「选哪个方向」和「构造还是执行」。第二,预算在完成时计费,最后一个动作允许越过阈值;期望项同时覆盖了计划构造与执行的不确定性。第三,研究样本效率(research sample efficiency)被定义为单位尝试次数获得的最好结果:V(Hτ) = max yi(最佳观察奖励),Nτ = 完整执行次数——同等质量下更少尝试,意味着更少的训练/评测循环。这个定义本身对社区就有工具价值:它强制评估同时报告分数、尝试数和总推理成本。
四、解法拆解
4.1 可执行计划树
方法的第一根支柱是可执行计划树(executable plan tree)。每个节点存储:一份计划(结构化 Markdown 文档,含研究问题分解、假设、实现方案、数据集策略、避坑提示)、记录的结果、分支统计。边 s→s’ 记录 reflector 对父策略的一次修改——每条边同时存一份可执行的 diff.py 和一段修改说明加先验估计,子计划可以随时从父计划重建。
这个设计有三个直接好处:
- 可追溯:修改与父子结果并排存储,研究策略的演化过程对 reflector 完全可见;
- 可保留:计划独立于 executor 的对话历史存储,一个分支在被评估时,另一个候选方向仍然可用——这正是线性迭代做不到的;
- 两种动作统一:树暴露两个研究动作——执行一个未测试节点,或通过反思展开一个已评估节点。选节点就同时决定了研究方向和努力的用途(测试还是构造备选)。
预算公式(公式 3)也在这里定下:Ut = Cexect + Creflt,B 只计推理 token,两个智能体的输入输出全部计入,规划与执行在推理资源层面直接竞争。
4.2 自适应 MCTS
第二根支柱是 MCTS 框架下的分配策略,四步循环:
Selection(选择)——方法的灵魂。从根出发,按概率采样子节点 v,概率正比于:
- 已评估节点:w(v) = Q(v)αt
- 未访问节点:w(v) = (Q(u)·√P(v))αt(P(v) 是 reflector 的先验)
其中指数 αt = min(1/rt, αmax),rt = (B−Ut)/B 是剩余预算比,αmax = 10。预算充裕时 αt 趋近 1,选择分布分散,鼓励探索;预算消耗殆尽时 αt 钳到 10,分布急剧集中到高价值分支,集中开采。论文反复强调一个洞见:同样的观测值,不同的剩余预算应该产生不同的分配——一次早期探索产出的证据还有很多机会被利用,而末期的探索产出的证据几乎没有机会变现了。αt 机制把这个直觉直接编码进了选择分布的形状里。
Expansion(展开)——reflector 读取已选节点的奖励、执行证据、仓库状态和树上下文,提出至多 m = 3 个子计划。Prompt 明确要求「有争议地不同」(fundamentally different hypotheses)——换超参微小数值不算独立的 bet,这从源头压制了冗余分支。
Execution(执行评估)——executor(GPT-5,走 Codex CLI)实现计划、跑实验、分析结果,任务本身的评测信号直接当奖励用,不需要额外的模拟 rollout。
Backpropagation(回传)——先应用剪枝规则:若子节点奖励比父节点当前分支值低出 δ = 0.05 以上(且父值 > 0),该子节点从后续选择中剔除;若选中节点的子节点全被剪掉,反思可以继续提变体。保留的结果沿选中路径回传:Q(v) = 所有保留已评估后代(含自身)奖励的均值。价值回传让相关计划共享证据,跨分支积累统计强度。
4.3 Reflector / Executor 双角色
两个角色都由 GPT-5(Codex CLI)承担,共享每任务 1.5M token 预算(GPT-5-mini 设置为 1M)。值得注意的细节是信息隔离:executor 收到计划但不告知全局剩余预算;reflector 可以查看运行元数据但不接收额外的分配规则——分配逻辑全部外置于选择策略本身,这也让消融实验(只换选择策略)有了干净的对照组。
五、实验与结果
5.1 三大基准主结果
FIRE-Bench(AI 研究发现重发现,12 任务):平均奖励 0.7738 vs AutoResearch 0.7018(+10.3%),尝试次数 13.33 vs 27.0(-50.6%)。24 个任务-方法对比中 23 次尝试更少(FIRE-Bench 上 12/12 全部更少);奖励 6 胜 2 平 4 负。担心被单项任务撑起来的话——排除最大单项提升 MCQ Selection Bias 后仍有 0.7533 vs 0.7266。
AutoLab(系统与代码优化,8 任务):平均 0.4824 vs 0.4428,尝试 10.0 vs 17.5。在最难的精度门控任务 Smallest Game Player 上拿到了非零奖励(0.3224 vs 0.0000);排除该任务后其余 7 项奖励基本持平(0.5052 vs 0.5061)但每项尝试都更少——说明收益不只在「找到更强解」,也在「保质量省实验」。
MLE-Bench(Kaggle 机器学习工程,4 任务):分数接近,各赢 2 项(APTOS 2019 与 Plant Pathology 2020 PrimeScientist 更高,NOMAD 2018 与 Spooky Author ID AutoResearch 损失略低),尝试 11-15 vs 21-25,样本效率优势完整迁移。
5.2 消融两连
换策略消融(同框架只换选择规则,GPT-5):自适应 0.598 > Greedy 0.563 > UCT 0.551 > Random 0.546(8 任务)。PrimeScientist 在 7 项上超 UCT、1 项持平。有趣的是 Random 在 SECA Hallucination 和 Gaussian Blur 上反而领先——最优策略确实因任务而异,但没有任何固定策略能稳定打败自适应。
固定指数消融(GPT-5-mini,1M 预算):自适应 0.537 > α=10 的 0.507 > α=0(均匀采样)的 0.502 > α=3 的 0.452。自适应策略在 3/6 任务上拿到最高均值、6/6 全部超过固定 α=3、且从不垫底——不需要为每个任务单独调一个常数指数,正是「预算自适应」相对「调参得来的固定值」的实质优势。
5.3 一致性与资源分析
三次独立搜索(GPT-5-mini,AutoLab 6 任务)验证稳定性:平均奖励 0.4363 vs 0.4359 持平,尝试 21.6 vs 28.4(-24%),且每个任务上的平均尝试数都更低。附录还有几组值得注意的数据:token 开销中编码执行占 62%、规划(反思+树上下文+子计划生成)占 38%——规划是实实在在的开销,这正是它必须进预算的原因;匹配 1M token 时奖励仍可比;匹配尝试次数时在 Hash Join、FFT、Concurrent KV WAL 上奖励反而更高;AutoLab 搜索平均耗时 32 分钟 vs 42 分钟。
5.4 两个案例
LLM Value Consistency(平台期突破):这个任务研究 LLM 在不同语境下表达的人类价值观是否一致。AutoResearch 的 running-best 在约 0.73 处进入平台期,PrimeScientist 持续爬升到约 0.89(最终 0.889 vs 0.727,14 vs 30 次尝试)——线性迭代锁死在一条轨迹上时,保留竞争分支的系统还能继续从别处获益。
Learning Order Agreement(树的选择性展开):研究为何独立训练的网络对相同图片有相似的学习顺序。reflector 先提出重复 CNN 训练加像素置换、随机标签对比的根计划(F1 0.689),然后提出标签噪声和架构两条竞争解释分支;标签噪声分支继续深挖不同错误标签模式的影响,低分的 Mixup 扩展被剪枝,架构分支通过 patch shuffling 和 Fourier phase scrambling 改变图像结构,把 F1 推到 0.857——与 AutoResearch 同分,但只用 12 vs 30 次尝试。树结构让「发展了什么、剪掉了什么、留下了什么没做」完全可见。
六、知识反推(外部交叉验证)
论文声称的「首个五项全有」定位是否站得住?我检索了相关工作的原始论文与代码逐一比对:
| 相关工作 | 实际机制(外部验证) | 与 PrimeScientist 的关键差异 |
|---|---|---|
| Karpathy autoresearch(GitHub) | 630 行代码的线性 keep-or-revert 循环:改 train.py、跑 5 分钟、看 val_bpb、保留或 git reset。Karpathy 自述其局限是单一轨迹无分支 | 纯线性轨迹,无树、无预算表示,是论文的 baseline B2 |
| AIDE(arXiv 2502.13138) | 把 MLE 形式化为代码空间优化,硬编码树搜索策略在解空间中做增量改进,用「以计算换性能」 | 搜索单元是代码 diff,导航是固定规则,无剩余资源表示,无价值回传——与表 1 定位一致 |
| AI Scientist-v2(arXiv 2504.08066) | 渐进式 agentic 树搜索由 experiment manager 管理,四阶段实验,首篇全 AI 生成的通过同行评审的 workshop 论文 | 树在代码/实验层,搜索节点类型按阶段固定,未把 token 预算作为分配变量 |
| AlphaLab(arXiv 2604.08590) | Strategist/Worker 循环加持久 playbook,Strategist 确实按剩余实验数调整队列(CUDA kernel 平均 4.4x 加速等结果) | 最接近的对手:调整了试验选择,但规划资源不在分配目标内,无价值回传——论文表述准确 |
| R&D-Agent(arXiv 2505.14738,微软亚研) | Researcher/Developer 双智能体,多 trace 并行探索可融合检查点,MLE-Bench 上 35.1% 奖牌率 SOTA | 有计划级搜索且按剩余时间调整,但无价值回传、规划不进共享预算 |
| FML-Bench(arXiv 2605.17373) | 控制变量研究 6 种搜索策略,发现贪心爬山几乎追平树搜索;AdaptiveSearch 检测到停滞时一次性切换到广域探索 | 切换是事件触发(检测停滞)而非预算驱动,分支结构由剩余步数预算决定但属一次性 |
| Rational Metareasoning(arXiv 2410.05563) | 把 Value of Computation 编进奖励,训练 LLM 只在必要时用中间推理步,省 20-37% token | PrimeScientist 理论根基的直接来源;前者优化推理步粒度,后者优化研究尝试粒度 |
| BATS(arXiv 2511.17006) | 工具调用预算下的测试时扩展,按剩余资源决定深挖线索还是换路,推 cost-performance Pareto 前沿 | 同属「预算感知」潮流,但 BATS 在单次问答的动作层,PrimeScientist 在完整研究尝试层 |
交叉验证结论:论文对表 1 中各系统机制的描述与原始文献一致,「共享预算下联合建模计划构造与执行的统一分配策略」这一空白在检索范围内确实无人填补,「首个」定位成立。更宏观地看,BATS、rational metareasoning、FML-Bench AdaptiveSearch 与本文共同构成一个趋势——预算感知(budget awareness)正在成为 agent 设计的一等公民,PrimeScientist 把它从推理步/工具调用粒度推到了研究尝试粒度。
七、通用灵感与迁移
这篇论文的价值远超「又一个自主研究系统」,它的三层迁移价值值得展开:
1. Agent 资源分配的通用模板。 αt = min(1/rt, αmax) 这个设计极其简单又极其可迁移:任何需要在多个候选间分配有限预算的 agent 场景——多方案生成后的选择、多工具调用的规划、多文档的深度阅读策略——都可以套用「剩余预算越多越分散、越少越集中」的原则,一行公式替代精细的调度器设计。「同样的观测,不同的余量,不同的决策」这个原则对产品化的 agent 尤其重要:用户给 10 次工具调用和给 100 次,agent 的策略形状本来就不该一样。
2. Coding Agent 的测试预算问题。 写代码的 agent 同样面临「改一行跑一次全套测试很贵」的困境,往往要么全跑(慢)、要么不跑(错)。可执行计划树的思路迁移过来:把「先验证哪个假设」显式建树,测试失败的分支用 δ 阈值剪掉,剩余 CI 预算少时集中验证最有希望 PR 的路径——本质上是把 MCTS 的 explore/exploit 引入了测试选择,而 24 任务中 23 次更少尝试的数据说明这种分配能实打实省一半实验。
3. 自改进系统(RSI)的资源配置。 论文自己在结论和 broader impact 里点明了这个方向:递归自我改进系统需要在「提议改进研究者本身」和「实证测试这些改进」之间分配资源——这正是一个共享预算下构造与执行的联合分配问题。设想 DGM 式系统结合 PrimeScientist 的分配层:每一代不是均等地测试所有自改方案,而是按剩余算力动态决定「再造几个变体」vs「验证现有变体」,改进循环的效率可能显著提升。这或许是「把增长的算力转化为科学突破」这条路上最值得押注的接口。
八、局限与展望
论文附录 A 诚实地列了四条局限:
- 规划本身不便宜:reflector 是完整的 LLM agent,一次反思调用的开销与一次编码运行同量级(实测规划占 38% 的 token)。何时「再想想」优于「直接干」仍是开放问题。
- 成本口径不全:只计推理 token,不含 GPU 小时、运行时和金钱成本(耗时在附录 D.4 单独报告);可换算成统一货币单位的成本可纳入同一框架,多资源约束的分配留作未来工作。
- 单次搜索方差:主实验(GPT-5 设置)每配置只跑一次完整搜索,GPT-5-mini 设置用 2-3 次重复刻画变异性,更大的重复面板才能精确估计小奖励差异;统计显著性与骨干模型效应需要单独分析。
- 计划级粒度的天花板:分配只发生在完整尝试之间,执行中途无法重新分配——哪怕一个微小的计划修改也要再花一整次尝试来评估。
展望方向上,论文提出了两个:learned allocation policies(不再用手工设计的 αt 规则,而是学习出更优的分配策略)和 RSI 中的应用(见上文第七部分第 3 点)。此外我认为评估方法论的影响不应低估——论文主张研究型 agent 评估必须同时报告结果、尝试次数与总推理成本三项,「包括花在决定研究方向上的资源」,这对整个 benchmark 社区是一个明确的评估标准升级。
九、一句话总结
PrimeScientist 把「省着花」变成了一种显式能力:在计划构造与实验执行共享同一 token 预算的序贯决策框架下,用剩余预算比驱动的自适应 MCTS 同时提升研究质量与样本效率(FIRE-Bench +10.3% 奖励、-50.6% 尝试)——当自主研究智能体能提出的方向远多于能负担的尝试时,如何分配努力本身就是智能。