论文链接:
- MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution
- ScholarEvolve: Learning from Research: Toward Lifelong Agent Harness Evolution
- Malena: How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?
代码仓库:ScholarEvolve 开源(UCSB-NLP-Chang/ScholarEvolve);MILO 附项目页;Malena 基于 OpenCode v1.15.6 构建 发表时间:2026 年 9 月 29-30 日(arXiv v1) 机构:MILO——Georgia Tech + AWS AI Labs + CMU + Washington University in St. Louis(多数作者在 AWS 实习或在职);ScholarEvolve——UC Santa Barbara + Microsoft(一作在微软实习);Malena——EPFL + Apple(前两作者在 Apple 实习) 领域标签:cs.LG / cs.AI / cs.SE
三篇论文放在一篇精读里,不是因为它们相似,而是因为它们在同两天里出现、研究同一个对象(固定模型、优化 Harness),却给出了方向相反的结论。这是一场罕见的「正反合」:MILO 和 ScholarEvolve 把「Harness 自动进化」的机制做得越来越精巧,Malena 却回过头问了一句扫兴的话——强模型时代,这些机制还剩多少必要?读完后你会发现,三者的分歧比表面看起来小,但各自守住的那块阵地都比想象中硬。
一、论文背景
1.1 Harness 是什么:模型之外的「另一半 Agent」
一个现代 AI Agent = 模型 + Harness。Harness 是包裹在模型外面的软件层:系统提示、工具集、子 Agent 拓扑、上下文管理与记忆、验证与停止条件——它决定模型的输出如何变成持续的行动。类比来说,如果模型是发动机,Harness 就是整辆车:变速箱、导航、刹车。发动机再强,装在烂车里也跑不快。
这个判断有硬数据支撑。MILO 论文开头引用了一个典型案例(引自 Terminal-Bench 系列工作):同一个 GPT-5,配 Terminus 2 Harness 在 Terminal-Bench 上解 35.2%,换 Codex Harness 解 49.6%,还少用 35% 的 token。模型没变,车换了,性能差 14 个百分点。反过来,Malena 论文的全篇都在论证:到了 2026 年的前沿编码模型,这辆车的大部分配件已经装进了发动机里。
「优化 Harness 而不是训练模型」在工程上极具吸引力:训练要 GPU 集群和数月周期,改 Harness 只要改代码;而且 Harness 是模型无关的(理论上),一次投入多次复用。这催生了 2026 年下半年爆发的「Harness 进化」方向——用进化搜索自动改 Harness,Meta-Harness、GEPA、A-Evolve、Self-Harness 等方法构成了这个方向的公共基线谱系(三篇论文不约而同地把 Meta-Harness 列为直接对照)。
1.2 进化搜索的四堵墙:MILO 的动机
把 Harness 优化交给 LLM 驱动的进化搜索(提出变异→评估→保留胜者),听起来直接,但 MILO 系统梳理了现有方法的四个结构性缺陷:
- 探索不足:LLM 变异器天生「重利用轻探索」——反复提同一族修改(比如不停加 verifier),搜索很快塌缩到少数设计的变体上。长程任务的增益恰恰主要来自全局结构变异而非局部修补。
- 对失败盲视(failure-blind):FunSearch、AlphaEvolve 这类方法的记忆只留幸存者。评估一个 Harness 要数小时,被拒候选的信息白白丢掉,死路被反复重试。
- 搜索策略不自适应:父本怎么选、怎么变异、保留谁,大多预先固定,撞上局部最优就出不来。
- 单目标漂移:几乎全部方法只优化精度,进化出的 Harness 越来越贵(token、延迟无人管)。
1.3 元智能体的三个天花板:ScholarEvolve 的动机
ScholarEvolve 从另一个角度切入。它观察到的不是搜索机制的缺陷,而是「让谁来提出变异」的缺陷——现有方法用一个元编码智能体(meta agent)看执行轨迹、提代码修改,这有三个天花板:
- 探索受限:给了它改代码的全部权限,它还是只在熟悉的机制族里打转——比如反复加验证环节、多 Agent 提案,把其他改进机制晾在一边。论文给了一个很生动的例子:给搜索工具加了一个「条件审查员」verifier,它确实拦住了错误的工具调用,但也拦住了任务必需的调用——过度保守的验证比没有验证更糟。
- 设计知识受限:变异器能提出什么,取决于它 backbone 训练时见过什么。失败轨迹能告诉你缺什么能力,却不能告诉你该用什么技术补上。
- 适应滞后:基于轨迹反馈的进化是被动的——一个缺陷要先在生产中伤害用户、积累足够证据,才会激发修复。人类工程师不这样工作:遇到新问题,先去读文献。
ScholarEvolve 的答案朴素得近乎常识:让 Agent 像研究生一样「读论文学机制」。
1.4 脚手架的原始前提已经松动:Malena 的动机
Malena 的出发点是一次前提审查。MLE Agent(自动机器学习工程智能体)的 Harness 越来越复杂——搜索树、程序种群、记忆层级、多 Agent 团队——但这些机制建立在两个 2024 年代的前提上:
- 前提一:单次对话补全不能跑代码、看数据、对错误做出反应,所以需要 Harness 代劳。但现代模型经受了大量编码 Agent 后训练(post-training),能在 OpenCode 这类环境里自己读写文件、执行代码、调试——「工作单元」的原语已经从一次补全变成了一个自足的长会话。
- 前提二:以 token 计,MLE 是超长程任务,需要专门的记忆与上下文管理。但百万 token 上下文窗口已经便宜可得,用 token 量重估,这个问题没那么「长」了。
哪个前提塌了,对应哪层机制就变成冗余。Malena 要做的就是把 MLE Harness 常见的干预手段摆上消融台,在固定模型、固定硬件、固定预算下逐层检验。它还指出现状的方法学问题:文献里的 Harness 成绩永远在不同的 backbone 和硬件上报告,种子数很少超过 3,头条边际经常小于运行间波动——归因根本做不了。忠实复评太贵(一次 75 任务 × 3 种子 × 24 小时的评估就烧数千 GPU 小时),所以没人做。Malena 花了这个钱。
二、论文定位和关联工作
三篇论文在「Harness 进化」谱系中的位置各不相同。先分谱系看,再总览。
2.1 谱系一:LLM 驱动的进化搜索(MILO 的战场)
MILO 把这个谱系按「自适应程度」分为 0-IV 五级(借用演化计算里 Eiben 等人的术语):
| 阶段 | 特征 | 代表方法 |
|---|---|---|
| 0 开环测试时扩展 | 执行结果不回流,增益无法复利 | Best-of-N、CoT、ToT |
| I 迭代精化 | 有反馈但只有一条贪心谱系,困于局部最优 | Reflexion、Self-Harness、A-Evolve |
| II 种群搜索 | 有存档保多样性,但策略按预设时间表走 | FunSearch、AlphaEvolve、OpenEvolve、GEPA、Meta-Harness |
| III 自适应策略 | 个别组件按固定规则在线调整 | ShinkaEvolve(bandit 选模型)、AdaEvolve(UCB 调岛屿预算)、DarwinX |
| IV 自适应元进化 | 停滞时由 LLM 改写搜索策略本身 | EvoX(实例级)、MILO(策略级) |
MILO 的占位陈述是:现有策略级方法(GEPA 只改提示、A-Evolve 只改技能/记忆、Self-Harness 单谱系精化、Meta-Harness 无父本选择)全部停在低阶段;唯一的 IV 级 EvoX 是实例级且只进化父本选择规则。MILO 是第一个在策略级同时自适应记忆、变异器和课程三者的搜索框架。这个表格本身就是论文的一张贡献(Table 1),也是理解整个方向的地图。
2.2 谱系二:模块化 Harness 组合与文献利用(ScholarEvolve 的战场)
ScholarEvolve 把自己的邻居分为三组:
- 模块化组合:AgentSquare 最早把 Agent 分解为模块并组合模块进化——ScholarEvolve 继承了模块化骨架,但给它接上了文献这个外部机制源,并用主题建模控制探索的多样性。
- 经验驱动进化:DGM(Darwin Gödel Machine)靠自修改+候选存档;Meta-Harness 用累积评估证据搜索可执行 Harness 程序;AHE 用细粒度轨迹修订工具/记忆。ScholarEvolve 的差异:变异方向不来自智能体自己的知识,而来自研究社区。
- 自动化研究:AI Scientist-v2、AI-Researcher 自动做假设-实验-写论文;AgentRxiv 让研究 Agent 共享报告;Paper2Agent 把论文转成可调用工具。ScholarEvolve 明确说自己不是做自动科研,而是做「文献→Harness 改进」的显式搜索过程。
它还点名了同方向的评估隐患:Meta-Harness 的 Terminal-Bench-2 实验和 AHE 的主实验在同样的 89 个任务上既搜索又报告——离线搜索的 Harness 冻结后评估才是干净做法(ScholarEvolve 全程坚持 evo/val/test 三分)。
2.3 谱系三:Harness 价值质疑线(Malena 的战友)
Malena 不是孤军。它引用了一串相邻领域的证据:跨 35 个软件工程 Harness 版本,SWE-bench 上没有统计显著的改进(Sghaier et al., 2026);单个好提示的 Agent 能匹敌多 Agent 工作流(Xu et al., 2026);多 Agent 系统的失败源于协调而非能力(Cemri et al.);编排本身引入可观开销。编码 Agent 已经成为软件工程评测的标准强基线——但在 MLE 领域,这一实践姗姗来迟,且已报告的对比记录稀疏。Malena 的定位就是:把「编码 Agent 当基线」的惯例以可控实验的方式带进 MLE,并一路爬完整个干预阶梯。
2.4 三篇论文的定位总览
| 维度 | MILO | ScholarEvolve | Malena |
|---|---|---|---|
| 论文类型 | 方法论文(新搜索框架) | 方法论文(新变异知识源) | 消融/负结果论文(强基线) |
| 核心问题 | 怎么自动搜出更强的 Harness | 变异的方向感从哪来 | 哪些 Harness 机制还有用 |
| 对「搜索」的态度 | 把搜索做到极致(元进化) | 把搜索的空间组织好(主题正交) | 质疑搜索本身(Agent 自己会搜) |
| 直接对照 | 8 个 SoTA Harness + 6 个搜索方法 | Meta Harness(同预算) | 4 个开源 MLE Harness + 内部 8 变体 |
| 主战场 | Terminal-Bench 2.1 / PaperBench / DeepSWE / EinsteinArena | AppWorld / τ2-Bench Telecom | MLE-bench / NatureBench |
同一个方向,三种立场:MILO 是「进化引擎工程师」,ScholarEvolve 是「进化方向的图书管理员」,Malena 是「来验收的审计师」。
三、问题定义
3.1 MILO:把 Harness 工程形式化为「策略级发现」
MILO 给出了本方向迄今最干净的形式化(Definition 3.1-3.2 + 问题陈述):
- Agent A = ⟨M, h⟩:模型 M(黑盒,仅推理访问)配 Harness h。Harness 表示无关——只要暴露可运行的 build_agent 入口和可编辑源码,Python、YAML、技能库都行。因此 Harness 空间 H 是可数无穷的。
- 评估:任务 τ = 初始状态 + 验证器(隐藏标准)。执行 k 次 rollout,聚合出准确率、成本向量(token、延迟)与证据(轨迹+验证报告)。
- 自动 Harness 发现(AHD):给定初始 Agent、基准 B(切成搜索集/验证集)、约束 C(可运行、通用性——禁止针对单任务硬编码)、预算 R,在 HC 中搜索 h⋆,使其在 Bval 上最推进「准确率-成本前沿」,目标是超过最强人工 Agent。
两个形式化细节值得咀嚼:其一,「准确率-成本前沿」是多目标定义——一个更便宜但略降精度的 Harness 可以是赢家,这是 MILO 区别于几乎所有前作的问题设定(前作几乎都只优化精度)。其二,「策略级 vs 实例级」的区分:实例级发现(FunSearch 等)为单个任务超优化一个解;策略级发现优化的是必须跨任务分布泛化的求解器本身——AHD 属于后者,难在每一次评估都昂贵且泛化约束必须显式执行。
类比:实例级是给一道题找最优解,策略级是给一类题找一个解题方法。MILO 后面把框架反过来套到实例级(去进化「写优化器的 Agent」而非优化器本身)拿下了数学竞赛纪录,说明这个形式化的弹性。
3.2 ScholarEvolve:Harness 进化 = 带外部知识源的终身遗传算法
ScholarEvolve 的形式化把「分布」和「有限样本」切得很清:目标是在任务分布 Ptar 上最大化 J(H) = E[R],但进化只能拿到三个互斥的有限集——Devo(供轨迹分析与技能/记忆构建)、Dval(候选评估与冠军选择)、Dtest(冻结一切选择后仅用于报告)。backbone θ 全程冻结。
它的真正贡献在搜索空间的组织方式上:把探索定义为「模块 × 机制主题」的二维矩阵——五模块(Tool/Context/Skills/Memory/Workflow,各有 typed interface)× 每模块内语义正交的研究机制族。变异=在某个格子实现一篇论文的机制;交叉=跨模块组合候选;选择=Dval 上 paired bootstrap 下界大于零才换冠军。终身进化=新文献到达即开启新一轮循环。
类比:如果说 MILO 造了一台更好的发动机(搜索机制自进化),ScholarEvolve 修了一张更好的地图(把「往哪变异」从智能体的直觉变成文献的结构)。
3.3 Malena:把「Harness 的价值」变成可归因的统计问题
Malena 的问题定义是三篇中最简单的,也最狠:固定 backbone、硬件(1×A100 80GB、12 CPU、144GB RAM)、24h 时间预算与任务集,只变 Harness 干预,问哪些干预的效应统计显著地区别于零。为此它建立了严格的统计协议:宏任务平均(先任务内平均种子、再任务间平均)、种子 bootstrap 95% 置信区间、配对任务差分(A vs B 时任务难度抵消,区间更窄)。区分 self-select(Agent 按自己报告的验证分选提交)与 oracle(按隐藏测试分选最优)两种成绩,暴露「验证-测试鸿沟」这个被 MLE 文献忽视的变量。
它的「方法」Malena 本身是问题定义的一部分:一个贯穿全预算的 OpenCode 长会话,只给三个小工具(提交注册、资源查询、后台作业),搜索、利用、知识库全由模型自主驱动。这是一个用来测量「脚手架下限」的探针,而非一个新系统。
3.4 合读:三个问题其实是同一个问题的三个面
把三个定义并排看:MILO 问「怎么搜」,ScholarEvolve 问「往哪搜」,Malena 问「还用不用搜」。它们共享同一个隐含前提——模型固定、预算有限、Harness 空间组合爆炸——分歧只在于对这个空间里还剩多少可开采的价值的判断。这个分歧最终落在两个可测的变量上:模型有多强(Malena 的核心轴),以及搜索是否做到了任务/实例自适应与多目标(MILO/ScholarEvolve 的核心轴)。
四、问题解法
4.1 MILO:双循环元进化架构
MILO = 内循环(进化 Harness)+ 外循环(进化搜索策略本身)。三组件驱动:
组件一:层次谱系记忆(Hierarchical Lineage Memory)
记忆是一个森林,每个岛屿(Island)是一棵节点/边带标签的树 L_j:节点=该岛产生过的所有 Harness(带评估成绩、成本、证据、准入判定),边=父到子的源码补丁(带编辑内容和增益)。关键设计有三个:
- 岛屿隔离:K 个岛从彼此行为最不相似的种子出发,各自独立进化,从不互相竞争生存——变异器的利用偏见被关在各自岛内。成功的想法通过「嫁接」流通,而不是通过淘汰。
- Append-only(含负证据):被拒绝的子代也留在树里,连同产生它的编辑。变异器看到的不只是「什么有效」,还有「什么失败了、怎么失败的」——死路不被重试,而且失败压力会推动更大胆的结构性重写。
- 记忆可被外循环重构:Graft(跨岛嫁接,产生跨岛边)和 Speciate(把被主流谱系挤压的行为少数派提拔成新岛)都会改写森林结构。
组件二:证据驱动的变异器智能体(Evidence-Driven Mutator Agents)
每个岛配一个变异器——不是单次 LLM 调用,而是一个多轮编码 Agent(工具:读/写/编辑/搜索/bash)。它收到三样输入:父 Harness 源码、父本的失败证据(轨迹+验证报告)、全岛谱系快照(渲染成 UNIX 目录列表样式,每行一个 Harness,含路径、编辑、成绩)。变异提示词(附录 C.1)规定「先诊断后动手」的工作流,并要求在两种编辑幅度中做选择:REFINEMENT(定向小修)vs STRUCTURAL REDESIGN(按不同运行原则重新架构)——选择依据是谱系证据(父本最近几个子代是否连续被拒、成绩是否横盘、失败是一类 bug 还是整族架构性缺陷)。提示词里有一条很直接的偏置规则:「不要默认怯懦——父本卡死时,定向编辑是错误选择,升级;父本在进步时,不要无端重写能用的设计。」
岛-变异器分配 m(r) 本身也是自适应对象:变异器池有六个编码 Agent(Claude Code/Opus 4.8、Codex/GPT-5.5、四个 DeepAgents+不同模型的自制 Agent),编排者可以给停滞的岛换变异器。
组件三:元进化编排者(Meta-Evolutionary Orchestrator)
搜索配置 Θ = (记忆 F, 变异器分配 m, 任务课程 B_search)。正常运行时只有 F 变。当某岛的停滞计数达到耐心值 P=3,编排者(一个能看全部岛屿的 Claude Code Agent)被触发,两步走:
- 诊断(O1):瓶颈归为四类之一——变异器干涸(子代反复被拒/无效/重演失败编辑)、谱系耗尽(本岛搞不定的任务别的岛在解)、选择挤压(行为独特的少数派被主流谱系挤出)、全体平台期(所有岛逼近同一上限)。
- 干预(O2):至多两个动作——Reassign 换变异器(治干涸)、Graft 跨岛嫁接双亲(治谱系耗尽)、Speciate 分家(治挤压)、Curriculum 换任务课程(按 regret ρ(τ) = 最优可达 − 种群均值,聚焦「少数 Harness 能解、多数不能解」的前沿任务,治平台期)。
内循环五阶段(每轮每岛推进一代):父本选择(dominance×similarity 的 softmax——既少被支配又行为独特者得宠,兼顾利用与探索)→ 变异 → 评估(搜索集上 k=3 rollouts)→ 准入(多目标超体积贡献:准确率、token 经济性、延迟经济性构成 Pareto 前沿,只有正超体积贡献的子代进入准入集)→ 停滞监测(准入者在验证集上复评防过拟合,无提升则计数)。
一句话概括 MILO:把「如何搜索」本身也变成被进化的对象,让失败成为一等公民的证据。
4.2 ScholarEvolve:文献引导的模块化终身进化
流程像一个研究所的运转(Figure 2):
第一步:失败审计 → 能力缺口。 在 Devo 轨迹上,审计模型把失败归因(Agent 之过 vs 环境之过),保留反复出现的 Agent 可归因失败。研究模型再把这些 benchmark 特定的证据抽象成「与基准无关的能力缺口」——刻意抹去基准名、领域实体、工具名。比如「丢失了早前的观察」这个失败,抽象出的研究问题是上下文选择、状态跟踪或记忆检索,而不是「AppWorld 里怎么记邮件」。
第二步:检索 → 主题建模。 每个模块独立生成检索词(能力短语+机制短语交错),抓取论文标题+摘要,去重成池。然后用 TopicGPT 式的提示化主题建模做三件事:诱导机制粒度一致的分类法、合并同义/重叠主题(如把示例检索与知识检索并入「外部上下文检索」)、给每篇论文一个带证据摘录的有序主题标签。这保证主题间语义正交——每个主题描述一种「作用方式不重叠」的机制。
第三步:预算分配 → 变异蓝图 → 实现。 先筛掉当前 Harness 与 backbone 已覆盖的机制,剩下的主题按簇大小排序、round-robin 轮转选论文——K 篇预算覆盖 min(K, 主题数) 个不同机制族,钱花在多样性上而不是相关性排序的头部。研究 Agent 读全文+官方代码,产出变异蓝图(源机制、目标模块与接口、所需状态、运行时操作、终止条件);编码 Agent 据此实现模块 m_j^(p),其他模块冻结。轻量健康探针(可导入性、接口兼容、产物构建、合法动作生成)把文献机制在宿主 Harness 上的接口失败挡在测量之前,修不过来就耗尽预算放弃。
第四步:交叉与选择。 每个候选先单独对冠军测 Dval 增益;组合按「加性预测增益」排序 shortlist(复用单独测量、不花额外 rollout),再对入围组合整册评估拿到真实增益(回归检查——单独增益在组合里可能不成立,也可能为负)。保留规则很保守:最优候选对冠军的 paired bootstrap 增益区间下界 > 0 才换冠;连续 sstop=1 代无确认改进即收敛。
第五步:终身化。 新文献分窗口到达(实验用了三个 arXiv 窗口:至 2025-12、2026-0104、2026-0508),每轮从现任冠军出发重新筛查主题、变异、重组。文献=变异算子,重组=交叉,Dval=适应度——一个以人类知识产出的增长为燃料的遗传算法。
一句话概括 ScholarEvolve:把「去哪找改进思路」从变异器的脑内直觉外化成文献库的结构化遍历。
4.3 Malena:干预阶梯与极简基线
Malena 的实验设计是爬一架「干预阶梯」,每一级只在统一代码库里多加一族干预:
- Chat:纯对话 API,一次给全文式数据概览,模型必须一次写出完整流水线脚本;跑挂了把报错贴回去让它改。
- Oneshot:一个编码 Agent 会话(read/write/edit/bash + git worktree),自由探索数据、写、跑、调试,6 小时内产出一次正式提交+设计文档。
- 搜索原语(24h 预算内由 Harness 编排 Oneshot):Chain(纯迭代精化)、Greedy(纯利用)、UCB1(经典探索-利用,作者特意用秩归一化分数让单一探索常数跨任务可迁移)、Best-of-N(完全独立探索)。
- Malena:撤掉所有外部编排——单个会话跑满 24h 预算,轮次结束就轻推一句「还剩 X 时间」。配三个极简工具:submission(注册提交,不给测试分)、system(查资源与剩余时间)、jobs(后台并行跑 bash、查 stdout、等待/取消)。
- 多智能体编排:+D(委派子 Agent)、+P3(三路并行 Malena)、+B(并行间广播通信)。
配套的方法学基建同样重要:修复了 MLE-bench 四个任务准备脚本的真数据缺陷(champs 测试集缺 3D 结构、hubmap 测试集泄漏标注、smartphone 泄漏参考轨迹、multi-modal 测试集带标签)——修的是可作弊/不可解的任务而不是删掉,保证对比集完整;用 Dolos 代码相似度(containment 度量)+ 块嵌入相似度双通道做了污染检查,924,750 对代码中零标记;还引入 NatureBench(40 个 Nature 子刊开放科研任务,在线评测端点)规避 Kaggle 竞赛的污染嫌疑。
一句话概括 Malena:给「模型+运行时已经够了」这个假说做一次买得起的最严格检验。
五、评估指标与实验证据
5.1 MILO:三基准双 backbone 十四基线
设置:Terminal-Bench 2.1(89 个真实命令行任务,85 个中/难档,k=5)、PaperBench-CodeDev(12h 复现 20 篇 ICML 2024 论文,GPT-5.5 裁判的 8316 叶评分细则)、DeepSWE(113 个多文件工程任务,容器完全断网)。指标用 pass@k / PR@k(每次尝试的部分分)/ RR@k(完全解决率)。所有搜索方法同 72h 墙钟、同三个专家种子(B10-B12)、同评估器;变异 LLM 统一锚定 Opus 4.8。
主结果(Opus 4.8,Table 2a):
| Harness | TB2.1 RR@5 | PaperBench RR@3 | DeepSWE RR@3 |
|---|---|---|---|
| 最小 Harness(裸循环+3 工具) | 68.0 | 20.3 | 13.6 |
| 8 个 SoTA 人工 Harness 最好者 | 74.5(Goose) | 31.7(DeepAgents) | 59.0(OpenHands) |
| Best-of-3(最优种子,无搜索) | 74.1 | 26.7 | 59.0 |
| GEPA(此前最佳提示搜索) | 78.6 | 35.0 | 58.7 |
| Meta-Harness(此前最佳整体搜索) | 78.2 | 45.0 | 59.0 |
| MILO | 86.1±2.0 | 55.0±5.0 | 69.3±3.4 |
对照此前最佳搜索增益:TB2.1 +12.0%(GEPA +4.5%)、PaperBench +28.3%(Meta-Harness +18.3%)、DeepSWE +10.3%(其余搜索全部 0%)。TB2.1 的 86.1% 高于官方榜首的 83.8±2.3%——自动搜索产出的 Harness 超过了人类团队手调的最好成绩,而且 token 消耗比初始 Harness 还少 26%。
开权重 backbone(gpt-oss-120b,Table 3):TB2.1 RR@5 34.1%(Best-of-3 23.4%,所有先前搜索 22.7-29.5%);DeepSWE 15.6%——是初始 Harness 的 20 倍,先前搜索全部低于 1%。同时先前方法的最好 Harness 都比 Best-of-3 更贵(EvoX 花 1.46× token 换 +6.1%),MILO 用 0.70× token 换 +10.7%——多目标准入在开权重档位上兑现了「更便宜且更强」。
三个反直觉观察(SoTA Harness 审计):(1) PaperBench 上 8 个 SoTA Harness 有 7 个不敌最小 Harness——人工 Harness 可以是负资产;(2) TB2.1 上 8 个 Harness 全部在 Opus 4.8 下胜最小 Harness,但换 gpt-oss-120b 有 4 个反超失败——Harness 增益不跨 backbone 迁移;(3) Mini-SWE-Agent 用近 2 倍于 Goose 的 token 得到几乎相同的 RR@5——高消耗不等于高准确。
机制消融(Table 2c,逐步加组件):RR@5 从 76.4(LLM 变异器+平面记忆)→79.1(换成 Agent 式变异器)→79.3(层次谱系记忆)→80.5(多岛)→86.1(加编排者)。最后一跳 +5.6 是最大单步增益——元进化编排者是全系统最有价值的组件。另一组演化轨迹(gpt-oss-120b,Table 3b)给了编排者一个特写:三岛在第 6-14 轮全部停滞,第 15 与 21 轮的 Graft+Reassign 恢复进展,最终全种群最佳 59.9% 竟出自初始最弱的岛(39.2%)——被保留的多样性兑现了价值。
泛化与新纪录:TB2.1 上进化的 Harness 不经任何再搜索直接上更难的 Frontier-Bench,RR@3 13.8% vs Mini-SWE-Agent 5.2%(2.7 倍)——进化产物没有过拟合基准。实例级变体(进化「写优化器的 Agent」,Opus 5 backbone)在 EinsteinArena 三个开放数学问题上刷新最优上界:Erdős 最小重叠 0.3808586→0.3808568、第一/第三自相关不等式 1.50274365→1.50274360、1.45081→1.44889,超过 AlphaEvolve、TTT-Discover 与 EvoX,且由 Arena 官方验证器复核。
极端条件:把每次模型调用的输出上限压到 4K token,12 个专家 Harness 的 RR@5 从 70-75 崩到 20-34,MILO 在同样枷锁下进化出 81.1——更强 Harness 能补偿模型被人为削弱的能力。
5.2 ScholarEvolve:两环境双 backbone 四层消融
设置:AppWorld(API 执行任务;90 训练任务=Devo、57 开发任务=Dval、Normal 168+Challenge 417 测试任务;Challenge 含训练中未出现的 Amazon/Gmail 应用)与 τ2-Bench Telecom(工具+模拟用户的客服对话;250 任务经验池、74 验证、40 测试)。backbone:Qwen3.5-27B 与 GPT-5.4-mini,全部冻结。对照 Meta Harness 用同样的 GPT-5.4 Codex 与同样的 rollout 预算。指标:TGC(任务目标完成率)、SGC(场景三变体全过的场景完成率)、pass_k。3 次独立评估取均值±标准差。
主结果(Table 1):
| 配置 | AppWorld Normal TGC | AppWorld Challenge TGC | Telecom pass1 |
|---|---|---|---|
| Qwen3.5-27B 初始 Harness | 69.0 | 49.6 | 96.7 |
| Qwen3.5-27B + Meta Harness | 76.8 | 54.6 | 96.7 |
| Qwen3.5-27B + ScholarEvolve | 81.4 | 63.6 | 98.1 |
| GPT-5.4-mini 初始 Harness | 67.1 | 46.1 | 72.7 |
| GPT-5.4-mini + Meta Harness | 67.5 | 45.6 | 66.5 |
| GPT-5.4-mini + ScholarEvolve | 72.4 | 55.6 | 81.9 |
Challenge(未见应用)的增益(Qwen +14.0、Mini +9.5)大于 Normal(+12.4/+5.3),且在 Challenge 上分别超 Meta Harness 9.0/10.0 分——进化产物泛化到了训练中不存在的外部应用;按参考 API 数分桶,超出训练最大 API 数(12 个)的任务上仍有 +9.5/+7.2。跨模型追赶:27B 进化后 81.4 追平 Kimi-K2.6 的 81.3,与 GPT-5.4 的差距从 16.7 缩到 4.3 分(关闭约 74%);Telecom 上 mini 进化后 98.1/93.3(pass1/pass4)持平或超过 DeepSeek-V4-Flash 初始 Harness 的 98.1/92.5。值得注意的负对照:Meta Harness 在 mini 上多数指标反而下降(Telecom pass1 -6.2)——执行反馈驱动的进化并非普遍正收益。
四层消融(Table 2,累积移除):完整版 81.4 → 去主题引导(换相关性排序)80.0 → 再去模块化变异(换整册编辑)78.6 → 再去文献引导(即退化成 Meta Harness)76.8。三层各有独立贡献,文献引导贡献最大(-4.6)。
终身进化(Table 5):三个文献窗口,TGC 69.0→73.4→79.8→81.5、SGC 48.8→54.2→61.9→66.7,全程模型权重与历史轨迹冻结;同期 Meta Harness 停在 69.6/51.2 附近横盘。文献增量真的能驱动已收敛的搜索再启动。
模块组合(Table 3):Qwen 五模块组合 84.8 TGC 超最强单模块(Memory,81.3)3.5 分、SGC 超 12.3 分。更妙的反例:把 standalone 75.4% 的 skills 候选换成 73.7% 的候选,组合反而从 80.7 升到 84.8——单独排名不预测组合排名,模块间交互必须整册评估才能看见。
残余失败画像:对全部 1,336 个失败回合的两遍盲标注(隐藏模型与分组身份)显示,进化后「无效响应格式」从 492 降至 206 回合(最大改善),但约束违反(91→89)与检索不全(77→70)几乎未动——进化把「表达层」修好了,「需求跟踪与证据覆盖」仍是对应训练数据的活儿。
5.3 Malena:17 对组合无一败北
主结果(MLE-bench fixed30,24h,self-select,Table 15/16):
| Harness(GLM 5.2) | Percentile | Medal rate |
|---|---|---|
| Malena | 69.74 | 62.5% |
| AiScientist | 61.39 | 47.1% |
| Arbor | 59.26 | 45.8% |
| MLEvolve | 54.32 | 39.2% |
| ScienceFlow | 47.59 | 24.4% |
配对任务差分下,Malena vs MLEvolve 达 +15.4 分位/+23.3 获奖、vs ScienceFlow +22.2/+38.1,全部显著。Kimi K3 上百分位全胜(vs Arbor +4.3*);DeepSeek V4 Flash 上要么胜要么不可区分。跨全部 17 个 Harness-backbone 组合,Malena 无一被显著击败。NatureBench 上 surpassed-SOTA 率 GLM 21.7% vs AiScientist 17.5% / MLEvolve 10.8%;Kimi K3 26.7% vs 27.1%(不可区分)/ 11.7%。
唯一反例:Gemma 4 31B(最小最弱 backbone)下,MLEvolve 百分位 42.88 显著高于 Malena 32.35(获奖率 22.2 vs 22.2 持平)——弱模型仍然从手工工作流先验中获益。作者把这读作「苦涩教训」的标准形状:专用机制的优势在弱模型上打开,随模型能力增长被通用方法追平反超。
干预阶梯各层的判决:
- 执行环境(Chat→Oneshot):测得的最大单步效应。GLM 5.2 与 Kimi K3 前沿模型急剧改善;DeepSeek V4 正式版相对 Preview 版改善放大(后训练差异);连 Gemma 4 都受益——工具使用流畅度比模型规模更关键。
- 搜索原语:四种策略配对比较全部无显著差异(最大差距 UCB1-BoN 2.71 分位,CI 含 0)。Best-of-N 自选距 oracle 天花板 6.83 分位——四种策略中最大的选择鸿沟。
- 自主性(Malena vs 四种手工搜索):获奖率显著胜出全部四种(配对 CI 下界 0.4-5.6);且自选-验证鸿沟最小(1.876 分位)——单会话内所有候选共用同一验证管线,分数天然可比。
- 多智能体:+D/+P3/+B 无一显著优于基础版;+B+P3 的自选成绩反而崩到 33.3% 获奖率——并行提升了 oracle 天花板,但独立迭代间的验证分不可比让选择鸿沟暴涨,最终自选质量持平或更差。
- 基础设施微扰(Malena 自身):定时提醒(+N)显著有害(-5.5 分位);去后台作业工具(-J)略好;去系统资源工具变差。八个 ML 工程技能包(s)、HuggingFace 搜索 MCP(H)、严格验证指南(V)等增强全部不显著。Oneshot 上的组合增强(GLM 5.2)甚至显著为负(-2.8*)。
行为学证据(轨迹分析):Malena 的搜索不是树,是「先定架构、再打补丁」——whale 任务上前 17 个 checkpoint 定型两阶段管线(嵌入+检索),后 63 个 checkpoint 全是定向补丁(换 backbone、提分辨率、调阈值、集成)。技术构成上前期均衡覆盖流水线各阶段,后期向 ensembling/模型选择/后处理倾斜;技术稀有度分布与 MLEvolve 并列最高——没有退化为平庸套路。两个 backbone(GLM 5.2 与 Kimi K3)在 aptos2019 上独立收敛到同一个稀有技术(软标签伪标签自训练,rarity 0.9,其他所有方法的 run 都没用)——这是「模型自带搜索能力」最有说服力的单点证据。上下文压力测试:把 1M 上下文人为压到 64k(触发压缩,平均 9.5 次/24h,每次丢约 76% 上下文),获奖率 57.5%→50.0%(CI 重叠);20 个获奖 run 平均在 3.25 次压缩之后才拿到首块奖牌——长会话对上下文挤压有韧性但敏感。
5.4 三组实验共同指向的一张图
把三篇的数字叠起来:MILO 在 Opus 4.8(很强)上对「搜索 vs 不搜索」拿到 +1228%;在 gpt-oss-120b(开权重、相对弱)上拿到 +10.720 倍;ScholarEvolve 在 Qwen3.5-27B(中档)上拿到 +1214%、在 GPT-5.4-mini(中档偏强)上 +511%;Malena 在 GLM 5.2/Kimi K3(前沿)上证明「精细搜索结构 vs 无结构」差异不显著,在 Gemma 4 31B(弱)上结构化搜索重新胜出。模型能力与机制收益呈单调负相关,且没有一个实验例外。 这张图是第六部分调和三篇论文的经验基础。
六、效果优势的根源解释
6.1 MILO 为什么赢:四条机制因果链
因果链一:负证据 → 免于重蹈死路 → 更大胆的结构变异。 传统记忆只存幸存者,LLM 变异器的利用偏见+信息缺失导致死路重试。MILO 的 append-only 谱系把每个被拒子代连同「哪次编辑导致的」存档,变异提示显式要求「不重试已被拒的编辑」。进化出的最佳 Harness(Listing 14)的头部注释就是明证:它明确写着「修复 VERIFIER 的方向已被试过(997d4786bea0,-0.044,被拒),此处不重试;本节点针对的是另一类已诊断失败(TIMEOUT-ZEROS,≥14/21 个失败任务死在时间上限上且 0 分)」——新一代机制(ScaffoldFloor:开局先铺最小有效交付物,把超时 0 分变成部分分)是对负证据谱系的直接响应。同理,附录 Table 8 显示其余搜索方法的最优 Harness 全是种子 B12 的提示词改写,MILO 独自重写了控制流(verifier 门+保底地板+期限总督)。【论文实验已支持:消融中谱系记忆与 Agent 式变异器各贡献 +0.2~2.7;Listing 14 的机制自述】
因果链二:岛屿隔离 → 多样性不被选择压垮 → 全局最优可能出自最弱种子。 单种群的选择会挤压行为少数派。MILO 岛屿间不竞争,gpt-oss-120b 轨迹里初始最弱的岛(39.2%)在停滞解除后产出全种群最佳(59.9%)——在贪心单谱系下这个解会被早早淘汰。这与进化计算里「岛屿模型保多样性」的经典结论同构。【论文实验已支持:Table 3b 轨迹】
因果链三:编排者元进化 → 停滞可逆 → 更长的有效搜索。 所有基线在早期收益后进入平台且不再恢复;MILO 同样停滞(6-14 轮)但被 Graft/Reassign 拉出。消融的 +5.6 最大单步增益归编排者。机制上:四类诊断对应四类病因,病因不同药不同——换变异器治不了谱系耗尽,嫁接治不了变异器干涸;固定策略不可能做对这种分型处置。【论文实验已支持:消融+轨迹;分型-处方的对应关系是机制设计陈述】
因果链四:三目标超体积准入 → 搜索不漂向高成本 → 同步兑现精度与经济性。 单目标准入的搜索会累积越来越贵的 Harness(EvoX 1.46× token 换 +6.1%);MILO 的 Pareto 准入让「更便宜」本身成为一条可胜出的路(0.70× token 换 +10.7%;Opus 下 -26% token)。【论文实验已支持:Table 2d/3c 成本-精度散点】
6.2 ScholarEvolve 为什么赢:知识源与空间组织
因果链一:外部知识源 → 跳出变异器的知识半径 → 覆盖机制族。 元变异器只能提它见过的机制(反复加 verifier→过度保守);文献池含 backbone 训练截止后出现的方法。消融去掉文献引导(退化成 Meta Harness)掉 4.6 分,是三层里最重的。20 个候选里 17 个 standalone 为正也说明文献机制的命中率——但三个深负候选(CoEvo-Mem -67.8、两个上下文压缩 -45/-43)同样说明不是文献就有效,选择层不可省。【论文实验已支持:Table 2/7】
因果链二:主题正交+round-robin → 预算买到多样性 → 更广的探索。 把主题引导换成相关性排序掉 1.4-2.6 分——相关性排序会把预算堆在头部相似机制上。这与 MILO 的「岛屿保多样性」是同一原理在不同粒度的实现:MILO 在谱系空间保多样性,ScholarEvolve 在机制语义空间保多样性。【论文实验已支持:Table 2】
因果链三:模块隔离+整册回归检查 → 组合效应可见且可选。 单独增益不可加(加性预测只是排序用),整册评估才能捕捉模块交互——73.7% 的候选在组合里胜过 75.4% 的候选这类反直觉事实只有整册评估暴露得出来。保守的 bootstrap 保留规则避免了噪声驱动的假冠军。【论文实验已支持:Table 3】
因果链四:文献驱动的主动性 → 先于失败进化。 时间窗实验里三窗口持续增益(69.0→81.5),而 Meta Harness 横盘——新知识是真增量燃料。Challenge(未见应用)增益大于 Normal 支持了一点:文献机制是通用能力,不是对验证集的对题作答。【论文实验已支持:Table 5;「先于部署失败」的直接生产场景验证论文未做,属设计陈述】
6.3 Malena 为什么「不输」:原语替代
因果链一:后训练吃掉了 Harness 的活。 编码 Agent 后训练把规划-执行-调试-记忆这些原本由 Harness 代劳的能力装进了模型。证据:Chat→Oneshot 是全实验最大效应;DeepSeek V4 正式版(更多编码 Agent 后训练)相对 Preview 版的 Oneshot 增益放大;轨迹分析显示模型自主做出了探索-利用切换、架构先行+补丁迭代、稀有技术独立复现。【论文实验已支持;「后训练量与 Chat-Oneshot 差距正相关」作者自标为假说,基于 DeepSeek 家族两点观察,属有据推测】
因果链二:外供结构 ≠ 信息增量。 当模型自己会做搜索,外面再架一棵搜索树只提供冗余信息。四种搜索策略无显著差异、Malena 自主会话反超手工搜索、多智能体编排的天花板增益被选择鸿沟吃光——三层证据同向。选择鸿沟分析补了一刀:Best-of-N 的 6.83 分位鸿沟源于各独立迭代各自设计验证集、分数互不可比;Malena 单会话共用一条验证管线,鸿沟只有 1.88。【论文实验已支持】
因果链三:弱模型例外反证。 Gemma 4 31B 上 MLEvolve 显著胜出——工作流先验对能力不足的模型是真实补品。这条反例与 MILO 在 gpt-oss-120b 上的 20 倍增益、ScholarEvolve 在 27B/mini 上的两位数增益拼成完整的剪刀差图景。【论文实验已支持,跨论文交叉】
6.4 外部对照与检索说明
需要说明:本精读的交叉验证基于三篇论文原文的相互引用、它们各自 Related Work 中核实的文献,以及同批 11 篇 Harness 论文的筛读清单(g1_extraction),本次未另行执行独立网络检索。在这个范围内,与三篇论文机制直接相关的外部证据如下:
| 外部研究 | 与哪篇相关 | 相似尝试/相关结论 | 与本文差异 | 对根源解释的影响 |
|---|---|---|---|---|
| Sghaier et al. 2026(跨 35 个 SE Harness 版本,SWE-bench 无显著改进) | Malena | 相近结论:不同域独立得出「Harness 增益存疑」 | SE 域、非 MLE;Malena 引其为出发点 | 支持 Malena 主结论的跨域普适性 |
| Xu et al. 2026(单 Agent 匹敌多 Agent 工作流) | Malena | 相近结论:多智能体冗余 | 非受控预算匹配;Malena 补上归因 | 支持「编排冗余」链 |
| Cemri et al.(多 Agent 失败源于协调) | Malena | 相近结论:+B 广播反而崩(33.3%获奖)是其实例化 | —— | 支持「多智能体选择鸿沟」解释 |
| Merrill et al. 2026(GPT-5 在 TB 上 35.2% vs 49.6% 随 Harness 变化) | MILO | 反向证据:Harness 影响巨大 | 该数据同时含模型差异混淆;MILO 的 SoTA Harness 审计在固定模型下复现方向但展示条件性(7/8 在 PaperBench 上为负) | 限定:Harness 效应是任务分布×backbone 条件的,非普适正 |
| AgentSquare(模块化组合进化) | ScholarEvolve | 相似尝试:模块+重组 | 无外部知识源、无主题正交 | 补充:ScholarEvolve 增量在知识源与空间组织,非模块化本身 |
| Meta-Harness(三篇公共基线) | 全部 | 相似尝试:整体式 Harness 进化 | 三篇均按同预算直接对比 | 三篇结论共同成立的前提(同预算对照) |
| Sutton 2019《苦涩教训》 | Malena | 相近结论:作者显式自引作框架 | 非实证文献 | 支持「机制收益随模型能力递减」的解读框架 |
| 同批 Turbo Harness / STITCH / Mid-Harness(筛读清单) | 张力调和 | 相似结论:实例自适应与测试时原语层仍有大增益 | 属同批未深读论文 | 补充:Malena 未消融「实例自适应」轴——调和点的旁证 |
未发现直接反驳 MILO/ScholarEvolve 正增益的同行工作;也未发现对 Malena 弱模型例外的外部复现。两个诚实标注:(1) Malena 的成本数据(Malena 建模 $12.12,为 AiScientist 的 6.2 倍,cache-read 主导)由单一会话重发全部历史上下文的计价模型推出,作者也注明总成本由硬件主导($24-85/24h),「冗余」不等于「免费」;(2) MILO 的 72h×三岛×多 Agent 变异器搜索自身开销不菲,论文未报告搜索期总成本,与 Malena 的预算对齐方法论相比这是一个尚不对称的对照维度。
6.5 综合判断:张力调和
当日最大的问题是:Malena 说机制冗余,MILO/ScholarEvolve 却在机制上拿到两位数增益,谁对? 答案藏在两边的实验设计差异里,而这个差异不是缺陷,是路线分野:
- Malena 消融的是「统一机制的加减」:它比较的是「同一套搜索策略/编排对全部任务施加」vs「不施加」。它的负结果只覆盖这一轴——统一结构无增量。
- MILO/ScholarEvolve 的增益来自 Malena 未覆盖的轴:(a) 任务/实例自适应——MILO 的岛屿+编排者实质上让不同任务簇走上不同谱系,其进化的 Harness 内部就是「地板-总督-验证门」的条件化组合(期限近了放松验证、开局先铺保底);ScholarEvolve 的模块组合本身就是按验证分布选定的配置;(b) 负证据与多样性的显式管理——Malena 的 Best-of-N/UCB1 都不保留失败谱系;(c) 多目标成本-精度前沿——Malena 的指标不含 token 经济性,而 MILO 的 -26% token 是真金白银;(d) 知识注入——文献机制对 backbone 是外生的,后训练「吃不掉」它。
- 模型能力是裁决变量:前沿模型(Opus 4.8、GLM 5.2、Kimi K3)上,Malena 的结论最硬——此时统一结构确实冗余,MILO 在 Opus 上的增益则来自 (a)-(d) 轴而非「结构本身」;中弱模型(gpt-oss-120b、Qwen3.5-27B、Gemma 4 31B)上,机制增益重新变大且结构化方法(MLEvolve)重新胜出。两条路线不是对错关系,是同一光谱的两端:模型越弱、任务分布越异构、成本约束越紧,机制的边际价值越高;反之则趋于零。
- 仍未决的问题:Malena 的弱模型反例在多小的模型上翻转、MILO 式搜索的一次性投入摊销到多少个新 backbone 上才回本、文献驱动的持续增益会不会遇到「文献速度>验证成本」的上限、Malena 的 cache-read 成本账在长会话普及后是否成为主要痛点——这些问题三篇论文都没有回答,也构成这个方向的下一批题目。
七、必要知识反推
假设让一个零知识背景的人复现这三篇论文,最少需要掌握什么?
7.1 领域知识层
- Agent/Harness 解剖学:必须能把一个 Agent 拆成模型与 Harness,再把 Harness 拆成提示/工具/子 Agent/记忆/中间件/控制流——MILO 的可编辑表面(SYSTEM_PROMPT、EXTRA_TOOLS、SUBAGENTS、SKILLS、MEMORY)和 ScholarEvolve 的五模块都是这套解剖学的实例化。不理解它,连搜索空间都定义不出来。
- 基准与评估协议的细节:pass@k/PR@k/RR@k 的区别、k 次 rollout 的随机性、任务-聚类置信区间、self-select vs oracle 的分别、Devo/Dval/Dtest 三分的防泄漏意义——ScholarEvolve 与 Malena 的可信度全部建立在这些「无聊」的协议上(Malena 甚至为此修复了基准的数据泄漏)。
- MLE/Kaggle 工程实务(Malena 专属):验证策略设计、伪标签、集成、阈值调优——没有这些,无法读懂轨迹分析里「后期转向 ensembling」意味着什么。
7.2 方法论知识层
- 演化计算的谱系:岛屿模型、Pareto 前沿与超体积准入、MAP-Elites、自适应 vs 自适应元进化的 Eiben 分级——MILO 的 Table 1 是这个谱系的直接产物;Eiben et al. 1999 的参数控制术语是它的分类语言。
- 测试时搜索方法谱系:Best-of-N、反思、ToT、UCB1/UCT、bandit——Malena 的搜索原语消融和 MILO 的 0-II 级分类都以此为基础;Malena 对 UCB1 做的秩归一化改造直接借自进化策略的秩适应度整形(CMA-ES/NES 一脉)。
- 主题建模与文献组织(ScholarEvolve):TopicGPT 的提示化主题生成-精化-指派范式,及其「机制粒度一致」的控制技巧。
- 统计推断:bootstrap 置信区间、配对差分设计(任务难度抵消)、多重比较的解读边界——Malena 明说有些区间宽到不能下强结论,这种自限本身就是必要知识。
7.3 工程知识层
- 编码 Agent 框架实操:OpenCode 的工具面(Malena)、LangChain/DeepAgents 的中间件钩子(MILO 的进化产物大量使用 before_model/awrap_model_call 钩子)、Bedrock/vLLM 服务与结构化输出的兼容性坑(Malena 附录 D.3 修的 GLM 5.2 forced tool_choice 崩溃、MILO 的 B12 grader 必须去 thinking 才能出结构化判定——都是只有跑过才知道的知识)。
- 容器化评测基建:Harbor/Docker 任务容器、断网制度、资源看门狗、轨迹与证据的落盘格式——「证据驱动」的前提是证据先存在盘上。
- 成本建模:token/cache-read 计价、硬件时薪——Malena 的成本结论和 MILO 的三目标都需要。
7.4 知识融合的关键节点
三篇论文各自都有一个「知识化学反应」的节点:MILO 是把「编译器/验证器反馈训练代码模型」的信号流思想(一作的前作 CoTran/RLSF/ProofBridge)搬到搜索时序上——失败证据之于 Harness 变异,如同编译错误之于代码修复;ScholarEvolve 是把情报学的话题组织方法接到遗传算法的变异算子上——文献不再是被阅读的对象而是被遍历的搜索空间;Malena 是把 Sutton 的苦涩教训从训练时叙事翻译成测试时的可测命题——并用 MLE 域的预算纪律完成了此前没人肯付钱的受控实验。三个节点都要求作者同时精通两侧的语言,这是单一领域训练难以覆盖的。
八、论文中可以提取的通用性灵感
灵感一:负证据是搜索的一等公民。 论文证据:MILO 的 append-only 谱系(被拒候选+编辑因果+判定)直接驱动了结构性重写与免重蹈死路;ScholarEvolve 的候选池里三个深负候选(-67.8)同样被选择层消化为信息。 推广场景:(1) 任何 LLM 迭代优化系统(提示、工作流、代码生成)都应保留失败档案而非只留最优;(2) 推荐系统的负反馈显式建模;(3) 个人知识管理里的「失败笔记」制度化——记录为什么放弃比记录成功更防重复劳动;(4) 自动化科研中的实验排除集。
灵感二:多样性需要结构性保护,不能指望选择压力自发产生。 论文证据:岛屿隔离让最弱种子产出最优解(MILO Table 3b);主题正交+round-robin 防止预算堆头部(ScholarEvolve 消融 -1.4);ScholarEvolve 还发现 standalone 排名不预测组合排名。 推广场景:(1) 组织管理——异端观点需要「岛屿」(独立小组)而非直接进入同一竞争池;(2) 投资组合——相关性排序的头部拥挤与主题分散配置的收益差;(3) 模型集成的成员选择;(4) 产品 A/B 测试的探索预算分配。
灵感三:把「怎么搜」本身变成被搜的对象,适用于一切昂贵的优化。 论文证据:编排者元进化贡献 MILO 消融中最大单步增益(+5.6),且四类诊断-四类处方的分型是关键——病因不同,药不同。 推广场景:(1) AutoML 的超参搜索策略在线切换;(2) 数据库查询优化器的计划选择自调;(3) 科研项目管理的停滞诊断(换人/换方向/分家/换题四型);(4) 自动化交易策略的元层风控。
灵感四:评估的「可比性」本身是一种资产。 论文证据:Malena 的选择鸿沟分析——Best-of-N 各迭代自定义验证集导致分数不可比(6.83 分位鸿沟),单会话共用管线只有 1.88;+P3 提升 oracle 却被鸿沟吃光。 推广场景:(1) 任何多候选聚合场景(招聘面试、方案评审)必须先统一「验证集」再比较分数;(2) 多模型评测的 benchmark 污染控制;(3) 分布式实验的协议标准化;(4) 竞赛评审的统一评分细则。
灵感五:机制的边际价值是模型能力的递减函数——为「谁的模型」设计机制要先问「多强」。 论文证据:Malena 在 Gemma 4 31B 上输给结构化搜索、在前沿模型上全胜;MILO 在 gpt-oss-120b 上增益 20 倍、在 Opus 4.8 上增益收缩为两位数百分点;ScholarEvolve 在 27B 上 +14、在更强 mini 上 +9.5。 推广场景:(1) 工具/中间件产品的目标客群分层——强用户要极简、弱用户要向导;(2) 教育工具的设计—— scaffolding 随能力增长逐步拆除(这正是教育学里 scaffolding 的原义);(3) 新人 onboarding 流程的能力自适应;(4) 编译器优化的指令调度按微架构分级。
灵感六:外化知识源比内化直觉更可审计、更可增量。 论文证据:ScholarEvolve 把「往哪变异」外化为文献库+主题结构,终身三窗口持续增益(69.0→81.5)而内省式基线横盘;文献机制含 backbone 训练截止后的新知识——后训练「吃不掉」外生注入。 推广场景:(1) 企业知识管理——外部情报订阅驱动内部流程迭代;(2) 法律/医疗等知识时效敏感领域的 Agent 设计;(3) 开源社区的 changelog 驱动下游自动升级;(4) 教育课程内容的年度文献刷新机制。
灵感七:先给交付物「铺地板」,再追求完美——部分分的期权价值。 论文证据:MILO 进化出的最佳机制之一 ScaffoldFloor 来自对「≥14/21 个失败任务超时得 0 分、而部分任务本可拿形状分」的谱系诊断——开局几分钟先产出最小有效交付物,把超时 0 分变成保底部分分。 推广场景:(1) 任何有截止时间的工程工作(先跑通端到端再优化);(2) 应急响应的「先保最低服务水平」设计;(3) 谈判与投标的底线预设;(4) 长程 Agent 的中间产物落盘策略。
附录:三篇论文速查卡
| MILO | ScholarEvolve | Malena | |
|---|---|---|---|
| 一句话 | 负证据谱系+编排者元进化的自动 Harness 发现 | 文献主题建模引导的模块化终身进化 | 强编码 Agent 下的 Harness 冗余消融 |
| 主基准 | TB2.1 / PaperBench / DeepSWE / EinsteinArena | AppWorld / τ2-Bench Telecom | MLE-bench fixed30 / NatureBench |
| 头条数字 | TB2.1 RR@5 86.1%(超官方榜首 83.8%),token -26% | AppWorld Challenge TGC 49.6→63.6 | GLM 5.2 获奖 62.5% vs 最佳外部 47.1% |
| 对照组 | 8 Harness + 6 搜索法,同 72h | Meta Harness 同预算 | 4 开源 Harness,同模型/硬件/预算 |
| 机制关键词 | 负证据、岛屿、超体积准入、编排者四诊四治 | 主题正交、round-robin、整册回归、文献窗口 | 干预阶梯、配对差分、选择鸿沟、轨迹标注 |
| 最反直觉发现 | 最弱种子产出最佳解;7/8 SoTA Harness 在 PaperBench 不敌裸循环 | 73.7% 候选组合胜过 75.4% 候选 | 搜索策略间无显著差;两 backbone 独立复现同一稀有技术 |
延伸阅读建议:想追「张力调和」的读者可关注同批的 Turbo Harness(实例自适应补丁)与 STITCH(测试时原语组装)——它们恰好站在 Malena 未消融的「实例自适应」轴上;想追评估方法学的可读 Malena 附录 A.5 的统计协议与附录 D.3 的基线调优披露,那是「公平对比应该怎么做」的范本。