Harness 自动进化三重奏:MILO、ScholarEvolve 与 Malena 精读

2026 年 9 月末,arXiv 上同时出现三篇方向相撞的 Harness 论文:MILO 用「负证据谱系记忆+编排者元进化」把自动 Harness 发现推上 Terminal-Bench 2.1 官方榜首之上(RR@5 86.1%),ScholarEvolve 让 Harness 从研究文献中学习模块化变异(AppWorld Challenge TGC 49.6%→63.6%),而 Malena 却用大规模控制变量消融证明:在前沿编码 Agent 之上,复杂 Harness 机制几乎全部冗余(MLE-bench 获奖 62.5% vs 最佳开源 Harness 47.1%)。本精读逐篇拆解三者的机制与实验,再正面处理这个当日最大的张力——结论是:Malena 消融的是「统一机制的加减法」,而 MILO/ScholarEvolve 的增益来自「任务自适应、负证据利用与成本-精度前沿」这些 Malena 未覆盖的轴,弱模型反例(gpt-oss-120b、Gemma 4 31B)进一步表明机制收益随模型能力变化,两条路线实为同一光谱的两端。

October 2, 2026 · 10 min