本文为两篇论文合并精读(duet 模式):论文一《How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?》(Malena,arXiv:2609.40303);论文二《Finding the Right Fit: Model-Harness Interactions across Agent Tasks》(arXiv:2610.00917)。第一至五部分分论文展开,第六至八部分合并讨论。
总题目区
论文一(Malena):arXiv 2609.40303 | 2026 年 9 月 30 日提交(10 月 1 日定稿)| EPFL + Apple(两位共同一作 Kirill Brilliantov、Alejandro Hernández-Cano 等贡献,Hernández-Cano 的工作在 Apple 实习期间完成)| cs.AI / 自主机器学习工程(MLE)/ Harness 消融 论文二(Finding the Right Fit):arXiv 2610.00917 | 代码 / 6204 条轨迹数据 | 2026 年 10 月 1 日 | Nanyang Technological University, Singapore(纯高校,通讯作者 Bo An)| cs.AI / Agent 评估方法学 / Model-Harness 交互
〇、总览:Harness 工程的价值到底在哪一段
2026 年,Agent Harness(模型外围的脚手架:工具集、上下文管理、搜索编排、多 agent 协调、重试与停止策略)已经长成一条独立的研究赛道。OpenHands、Codex、Claude Code、PI、DeepSeek Harness、openJiuwen 等框架各立门户,Meta-Harness、Harness-R1、Turbo Harness 等自动优化 Harness 的工作层出不穷。这条赛道的默认假设是:模型之外的外围工程仍有巨大提升空间,值得投入搜索树、多 agent 编排、记忆层级等重型机械。
这两篇论文一正一反,共同把这个假设切开了:
- Malena(做减法):在自主机器学习工程(MLE)这个长程任务上,固定骨干、硬件与预算,逐层消融 Harness 的每一类干预——执行环境、搜索原语、自主性、多 agent 编排。结论是:给模型一个编码 agent 环境(shell + 文件系统)是最大单一效应,除此之外的几乎所有机械都统计不显著。一个贯穿 24 小时的单会话极简 agent,在 MLE-bench 上打赢了全部四个开源 SOTA Harness。
- Finding the Right Fit(做测量):不提出新 Harness,而是把 4 个可配置 Harness × 5 个前沿模型 × 3 个基准跑成 66 配置的全交叉矩阵。结论是:换一个 Harness,模型排名可以完全反转——同一个 Claude,在 OpenHands 下领先 GPT 7.94 分,换到 PI 下落后 30.16 分。Harness 显然「有用」,但它的作用点极其集中:是否把失败以模型可用的形式返回。
两篇论文表面矛盾——一篇说「Harness 不重要」,一篇说「Harness 决定排名」——但合读后会发现它们指向同一条边界线:Harness 中「冗余」的是搜索编排与多 agent 机械(模型自己会做),「关键」的是反馈回路基础设施(超时、续写、错误回传、完成判定),而这条边界的位置由骨干强度决定。这正是本文合读的主线。
第一部分:Malena——强骨干到底需要多少 Harness
一、论文背景:MLE agent 为什么越长越复杂
自主机器学习工程(MLE)agent 是 LLM agent 的一种:给定一个 Kaggle 风格的机器学习竞赛任务(数据集 + 评测指标),agent 需要自主完成数据探索、特征工程、模型选择、训练、调参、集成、提交全流程。它是检验长程 agent 能力的苛刻试验场——解决方案是开放式的 ML 管线,单次评估可能要在 GPU 上跑数小时,反馈信号(验证分数)还是噪声的。
自 AIDE(Jiang et al., 2025)把 MLE 定义为「代码空间上的树搜索」以来,主流设计就是 Harness:一个外层程序向 LLM 索要代码、执行它、并编排候选解的探索与组合。这个范式源于一个时代前提:单次 chat 补全不能执行它写的代码——模型看不到数据、无法对报错做出反应,所以必须由 Harness 替它做检索、调试、记忆管理和探索编排。于是 Harness 越长越复杂:搜索树、竞争程序种群、记忆层级、专门化的 agent 团队……
但这个前提正在失效。现代 LLM 普遍经过了编码后训练(coding post-training)——在真实工具使用的多轮循环中被奖励规划、执行与调试。它们可以在 OpenCode 这类编码 agent 环境里读写文件、执行代码、在一个自包含会话内调试。论文提出的核心问题由此而来:当原语本身已经会做这些事,哪些累积的机械还配得上它的成本?
这个问题此前无人能回答,因为文献中的比较是失配的:各家 Harness 的成绩在不同骨干、不同硬件上报告,种子数很少超过 3 个,头条差距常常小于跑间波动——一次 24 小时 × 75 任务 × 3 种子的评估就要烧掉数千 GPU 时,忠实复现太贵,所以没人做过。
二、论文定位和关联工作
Malena 站在三条研究脉络的交汇处:
(1)MLE Harness 谱系(被消融的对象)。AIDE 开创树搜索范式后,MLEvolve(UCT 树搜索 + 手设奖励 + 融合算子)、AiScientist(单对话 + 文件总线记忆)、Arbor(Coordinator/Executor 循环 + Idea Tree)、ScienceFlow(YAML manifest 驱动的并行 worker)等系统分别沿「搜索拓扑」「记忆压缩」「多 agent 编排」等轴演化。Malena 的消融清单正是从这些系统的共同组件中提炼的。
(2)邻近领域的「减法」证据(方法论灵感)。软件工程方向:Sghaier et al.(2026)发现 35 个 SWE Harness 发布版本在固定骨干下对 SWE-bench 无统计显著改进;Xu et al.(2026)证明单个精心提示的 agent 可匹敌多 agent 工作流;Cemri et al.(2025)的多 agent 失效分析、Orogat et al.(2026)的编排开销研究。MLE 领域的编码 agent 基线刚刚出现但记录稀疏——Malena 补上的是受控、同骨干同预算的系统消融。
(3)bitter lesson(解释框架)。Sutton 2019 年的短文《The Bitter Lesson》指出:随算力增长,通用搜索与学习终将碾压手工领域知识。Malena 把这个论断应用到测试时推理:弱骨干仍受益于手工工作流先验(Gemma 4 31B 上 MLEvolve 树搜索确实占优),但骨干 agent 能力增长后,朴素单会话闭环追平并反超——专门 Harness 的优势不随骨干增强而复利,反而被吞掉。
| 维度 | 之前路线(复杂 Harness) | Malena 的立场 |
|---|---|---|
| 工作单元 | 单次补全 / 单轮 agent 会话 | 贯穿全预算的单个长会话 |
| 搜索编排 | 外层树搜索(UCT / 贪心 / 种群) | 模型自主决定探索与利用 |
| 记忆管理 | 检索索引、记忆层级、上下文压缩 | 会话自身 + 复用已产出的检查点 |
| 多 agent | 规划者-执行者层级、并行 worker | 单 agent + 三个小工具 |
| 验证方式 | 结论:骨干 + 运行时是性能主驱动 | 同一结论的实验证明 |
三、问题定义
论文把「MLE Harness 该多复杂」这一具体工程问题抽象为一个归因问题:
固定任务集 T、骨干模型 M、硬件 H 与时间预算 B,将 MLE 系统的性能分解到干预家族 {执行环境, 搜索原语, 自主性, 多 agent 编排} 上,问:哪些家族的边际贡献在统计上显著非零?
形式化地:对干预 I,比较施加 I 与不施加 I 的配对任务差(paired-by-task difference),若其 95% 置信区间不包含 0,则 I 有显著效应。这个抽象的精妙之处在于三点:同骨干排除了模型能力混杂;同预算同硬件排除了资源混杂;配对比较让任务间难度差相消,得到比边际 CI 更窄的区间。归因而非堆分数——这是全文方法学的锚点。
四、问题解法:Malena 是什么
Malena 的解法分两层:一个极简基线 + 一套消融阶梯。
Malena 基线本体:构建于 OpenCode v1.15.6 编码 agent 框架之上的单个长会话。会话贯穿全部 24 小时预算,agent 自由探索数据、写管线、跑训练、调试;每当一个回合结束,Harness 只发一条简短提醒(剩余时间)让它继续。外围仅三个小工具:
- submission 工具:登记提交文件(不回传任何测试/榜单分数);
- system 工具:报告当前硬件资源、利用率与剩余时间;
- jobs 工具:后台运行多个 bash 命令、分别查看输出、等待或取消。
就是这三件套——没有搜索树,没有子 agent,没有记忆系统。bash 被限定为白名单命令(pwd/ls/python/nvidia-smi 等),命令输出附带资源统计,内存看门狗在爆内存前杀死命令。
消融阶梯(全部在单一代码库内重实现,保证只有干预本身在变):
- 执行环境:Chat(单次 chat API 调用,拿到数据概览、一次性产出完整脚本,失败后带报错重提示)vs Oneshot(单个编码 agent 会话,6 小时内自由探索-执行-调试-产出一次提交)。
- 搜索原语(把 Oneshot 串成 24h 预算的树搜索):Chain(总选最新节点,纯迭代改进)、Greedy(总选验证分最高节点,纯利用)、UCB1(置信上界,经典探索-利用权衡,用秩归一化分数)、Best-of-N(完全独立的多样探索)。
- 自主性:把外层搜索编排整个去掉,让 agent 自驱——这就是 Malena。
- 多 agent 编排:+D(委派,背景子 agent,层级规划者-执行者结构)、+P3(三路并行独立 Malena,同机物理并行)、+B(广播工具,配合并行,agent 间排队传信)。
五、评估指标与实验证据
指标:MLE-bench 的 percentile(agent 分数超过的人类榜单条目百分比)与 medal rate(获得铜/银/金牌的任务比例);区分 self-select(按 agent 自报验证分选提交)与 oracle(按隐藏测试分选最优);95% 置信区间用任务集固定、种子上自助法估计。任务集为 fixed30(30 个 MLE-bench 任务,其中 4 个数据准备脚本有缺陷的任务由作者修复了泄漏/缺数据问题)。
证据链一:编码 agent 环境是最大单一效应。从 Chat 到 Oneshot,前沿模型(GLM 5.2、Kimi K3)性能大幅跃升;连较弱的 Gemma 4 也受益,说明工具使用流利度比模型尺寸更关键。DeepSeek V4 正式版(更多编码 agent 后训练)比 Preview 版提升更大——这直接支撑了「后训练吃了 Harness」的假说。
证据链二:搜索策略间无显著差异。四种搜索原语在 24h 预算下 CI 大量重叠。配对分析中最大的对——Best-of-N vs UCB1——差距仅 2.71pp,95% CI(−1.44, +6.60),包含 0,不显著。也就是说:给了前序解的文档与数据/执行探索工具后,agent 自己就能隐式权衡不同方案、自适应搜索,外层硬编码哪种树搜索都无所谓。
证据链三:Malena 显著优于所有手工搜索。Malena 的 medal 率相对全部手工搜索算法均有显著优势(95% CI 下界在 0.4%–5.6% 之间),且验证差距(validation gap)全场最低——仅 1.876pp(Best-of-N 高达 6.832pp)。机制解释:单会话内所有候选共享同一条验证管线,验证分之间天然可比;而独立 Best-of-N 的各次迭代各自设计验证切分,Harness 要给「从未在同一个标尺上」的分数排序。
证据链四:多 agent 编排无显著增益。base Malena 与 +D/+P3/+B+P3 比较:+P3 的 oracle 上限更高(独立并行带来更多提交),但选择差距同步拉大,最终 self-select 质量相当;+B+P3 的 self-select medal 率反而大幅下降(55.7%→33.3%)。加委派、并行、广播都不能显著超过基础版。
证据链五:对四个开源 SOTA Harness 的匹配比较。同骨干、同预算(24h)、同硬件(1×A100 80GB)下运行 MLEvolve / AiScientist / Arbor / ScienceFlow 原版系统:
| 骨干 | Malena self-select percentile (medal) | 最佳外部 Harness |
|---|---|---|
| GLM 5.2 | 69.74(62.5% medal) | AiScientist 61.39(47.1%)、Arbor 59.26(45.8%)、MLEvolve 54.32、ScienceFlow 47.59 |
| Kimi K3 | 72.75(60.0%) | Arbor 68.46(60.0%)、AiScientist 64.15、MLEvolve 63.89 |
| DeepSeek V4 Flash | 58.53(44.4%) | Arbor 61.23(50.0%)——Malena 打平或不显著劣于 |
| Gemma 4 31B | 32.35(17.8%) | MLEvolve 42.88(22.2%)——弱骨干上树搜索占优 |
GLM 5.2 下 62.5% vs 47.1% 的 medal 率差距是全文头条。唯一的例外恰是最弱的 Gemma 4 31B——手工先验在弱骨干上仍有价值,划出了结论的适用边界。NatureBench(40 个 Nature 论文级科研任务)上同样验证:GLM 5.2 下 Malena surpassed-SOTA 率 21.7% vs AiScientist 17.5% vs MLEvolve 10.8%。
为什么这些实验能证明论点:关键在于「受控」二字——以往文献的比较失配(不同骨干/硬件/种子),而这里所有变量被钉死后,任何性能差只能归因于 Harness 结构本身;配对分析进一步把任务难度差消除。还要注意作者的反向自省:对每个外部 Harness 做了骨干兼容性修复与配置消融(Appendix D.3),排除「自己系统调得更多」的不对称努力质疑;对 MLE-bench 做了泄漏修复 + 双通道污染检测(Dolos 代码相似度 + 嵌入相似度,92 万对比较零标记)+ NatureBench 交叉验证。这是「指标真的证明了主张」而非「指标好看」的示范。
轨迹分析(为什么会赢):Malena 的工作流与外置搜索系统 qualitatively 不同——它先搭一条覆盖任务自然阶段的通用管线(如鲸鱼识别的「嵌入+检索」两阶段),然后剩下的时间做代码补丁级的超参搜索:换骨干网(EfficientNetV2→ConvNeXt→Swin)、提分辨率、调阈值、做集成——每一步都是对固定管线的靶向小补丁,并复用已有检查点与工具代码。技术标注分析显示:Malena 与 AiScientist 早期均衡覆盖各环节,后期转向性能导向(集成、伪标签等 Kaggle 社区技巧);Malena 在两个不同骨干下独立重新发现了同一个稀有技术(软标签自训练,rarity 0.9)。模型自己会搜索,且搜得更贴合任务——这就是外置搜索机械冗余的机制根源。
第二部分:Finding the Right Fit——换一个 Harness,排名翻一遍
一、论文背景:部署 agent 的两个耦合选择
一个要部署 agent 的团队面对两个耦合的选择:用哪个模型推理,用哪个 Harness 把输出变成行动。模型榜单只回答了第一个。Harness 决定工具如何呈现、上下文留什么、错误如何回到模型、何时重试何时停止。此前工作已知 Harness 选择影响完成率、效率与失效模式(Harness-Bench、Scaffold Effect、HAL 等),但没人回答过更实际的问题:
- 模型排名在换 Harness 后还成立吗?
- 好配对在换任务后还成立吗?
- 模型厂商的原生 Harness(为该模型设计)是最优选择吗?
这些问题在每次「给现有模型挑 Harness」「在现有 agent 里升级模型」「把跑通的 agent 迁到新应用」时都会出现。核心混杂变量在于:榜单要么固定 scaffold 要么固定模型,两者的交互从未被测量。
二、论文定位和关联工作
这项工作属于「Agent 评估方法学」脉络,前序工作分四支:(1)Agent Harness 研究(OpenHands 使 Harness 选择可配置、Agentless 证明固定管线也能竞争);(2)成本感知评估(Kapoor et al. 的「AI agents that matter」主张报告成本、HAL 跨 9 基准跑模型×scaffold);(3)Harness 效应测量(Harness-Bench 发现弱模型对 Harness 更敏感、输出契约违规是最大失效类;Scaffold Effect 报告每解一题的 token 差可达 40 倍;ALE-Claw 分析发现模型间差距大于 Harness 间);(4)恢复/验证/训练(自修正无外部反馈不可靠、模型常不能验证自己的输出)。
本文的增量在于:首次做 4×5×3 全交叉 + 厂商原生配对参照,并问「哪些优势在换设置后幸存」——之前的工作要么只交叉两个 Harness,要么不含原生配对,要么不跨基准。
三、问题定义
论文把「该选哪个 Harness」抽象为一个实证拟合(empirical fit)问题:
给定模型 m 与任务集 b,定义经验最优 Harness h*(m,b) = argmax S(h,m,b)(该模型在该任务集上的最高分 Harness)。要检验的命题族:{模型排名对 Harness 不变性、最优 Harness 对任务不变性、原生配对最优性、成本-得分单调性} 是否被数据拒绝?
这个定义的力量在于它把四个流行直觉(「强模型到哪都强」「好 Harness 对所有模型好」「原生的最好」「贵的更好」)变成可拒绝的统计命题——而本文把四个全部拒绝了。6204 条带分数轨迹全部公开,使每个结论可被独立复核。
四、问题解法:66 配置矩阵怎么搭
网格:4 个可配置 Harness(OpenHands、DeepSeek Harness/DSH、PI、openJiuwen)× 5 个模型(Claude Opus 5、GPT-6 Astra、GLM-5.3、Kimi K3、DeepSeek V4 Pro)× 3 个基准(TUA-Bench 120 题通用终端、ALE-CLI 99 题专业工作流、Terminal-Bench 4 非 H100 子集 63 题硬核命令行)= 60 配置,加 Codex–GPT 与 Claude Code–Claude 两个原生参照 = 66 配置。
控制:所有模型经 OpenRouter 钉死第一方提供商(禁回退);所有 Harness 请求高推理努力;上下文管理、压缩、重试、回合限制用各 Harness 原生默认;不加任何 Harness 默认之外的 skill / MCP / 记忆 / 提示词。openJiuwen 是框架而非成品 agent,作者用其公开 Harness API(v0.1.18)组装了一个编码 agent:7 个编码工具、原生任务环、原生上下文压缩、安全护栏——同构地用于所有模型与基准,无任何模型/任务特定调优。时间限制用基准自带的(TUA 40 分钟/题、TB4 8 小时/题、ALE 多为 2 小时/题)。
计分与成本:每任务计最后一次有效运行,无有效结局记 0 分,部分得分保留;TUA/ALE 允许部分分,TB4 二值。成本按 OpenRouter 价格计 agent 模型 API 花费(含 Harness 的辅助模型调用,不含评估器调用)。
轨迹分析:对同任务同模型不同 Harness 的最终计分轨迹做配对比较——标注每个关键步骤的发起者(模型自主 / Harness 提示后 / Harness 代劳),把「模型行为」与「配置结局」分离。
五、评估指标与实验证据
证据一:模型排名随 Harness 完全反转。TB4 上 Claude−GPT 差距:OpenHands +7.94(36/63 vs 31/63)、DSH −17.46、PI −30.16(19/63 vs 38/63)、openJiuwen −12.70。最戏剧性的对比:Claude 在 OpenHands 下 57.14%,换到 PI 掉到 30.16%;GPT 反而从 49.21% 升到 60.32%——同一对模型、同一批任务,仅换 Harness,Claude−GPT 差距摆动 38.09 个百分点,符号翻转。「哪个模型更强」离开指定 Harness 是无意义的问题。
证据二:最优 Harness 随基准漂移,但存在稳定配对。5 个模型中 4 个(Claude、GPT、GLM、DeepSeek)的最佳 Harness 在三个基准间改变;唯一例外是 Kimi×openJiuwen——三个基准全胜(64.39% / 54.94% / 28.57%),领先次优 5.61 / 6.91 / 11.11pp。且这个优势不是少数离群任务撑起来的:对最强替代 Harness 的配对任务比较中,openJiuwen 在 85/120(TUA)、61/99(ALE)任务上领先或打平;剔除三个最大正差距任务后仍领先 3.11–6.35pp。
证据三:原生配对不可靠,贵不等于好。Claude Code 是 Claude 在 TUA/ALE 的最佳 Harness,但在 TB4 上被 OpenHands 反超 7.94pp;Codex 从未给 GPT 带来任何基准上的最高分。成本侧:GPT 在 TB4 上用 PI 拿 60.32% 只花 $4.66/题,用 DSH 拿 52.38% 却花 $19.94/题——不到四分之一的成本买更高的分。PI×Claude 更荒诞:$20.28/题买来 30.16%。同模型换 Harness,成本可以差数倍。
证据四(最有解释力的部分):6204 条轨迹的归因。论文编码了 TB4 上 10 组同任务同模型的 OpenHands vs PI 配对(192 个失败信号事件):
- 模型几乎自发启动所有修复:192 个失败信号响应中 180 个是模型自主发起的;诊断或靶向补丁是最常见响应(69%),其中 116/133 解决了信号;通过 vs 失败的运行在「用诊断/修复回应反馈」上的比例是 81% vs 56%。决定成败的通常不是模型会不会修,而是 Harness 有没有把失败以可用反馈的形式交回来。
- 三个具体机制(每一个都有精确计数):
- 无超时 shell = 静默死亡:PI 的 shell 无默认超时,34 次运行卡死在一条永不返回的命令上、零信号产出直到截止;其他 Harness 默认绑定命令时长。
- 卡死检测器的双刃剑:OpenHands 在重复相同失败动作后终止运行——终止了 55 次运行,其中 48 次是 Kimi 反复重发缺少必填参数的畸形 edit 调用,这些运行只有 1 次得分非零。
- 截断续写机制救分:PI 在输出截断时直接终止回合,openJiuwen 则保留部分推理并重新提示模型继续——100 次被续写救回,其中 48 次最终得分非零。
- 完成判定是终点瓶颈:openJiuwen×Kimi 的 45 个 TB4 失败任务中 35 个以「所有要求均已验证」的收尾报告结束——没有一个承认未完成。3 个观察到不一致的任务把问题归咎于「交付物之外的原因」(自己的测试框架有缺陷等),而这 3 个被搁置的项恰好都是评分器随后判失败的测试。自建验收标准不能替代真实验收标准:没有任何 Harness 在运行中向 agent 暴露验收标准,每个配置都必须自建一套,最终检查的证据因此全由 agent 自己生产。
- 拟合是模型特异的:GPT 会给 56–67% 的 PI shell 调用自设超时,所以在 PI 的极简脚手架下如鱼得水;Kimi 常发畸形工具调用,需要 openJiuwen 的分离 write/edit 工具与续写护栏兜住。「哪个 Harness 好」取决于模型的习惯而非整体强度。
为什么这些实验能证明论点:全交叉设计的意义是——任何「模型×Harness」交互效应都无法被「模型主效应」或「Harness 主效应」解释掉;66 个配置在同一计分口径、同一成本口径下可直接比较;而轨迹归因把「排名反转」这个宏观现象向下追到了「反馈回路完整性」这个微观机制,并用匹配案例(如 Kimi 在 TUA 056 任务:同一个 GIMP 挂起 bug,openJiuwen 的 300 秒超时把它变成反馈→模型自诊自修复拿 1 分,PI 的无超时 shell 让它变成沉默→零分跑完 40 分钟)完成了机制级演示。局限性作者也如实声明:每任务单次运行、无跑间方差测量、设置不完全均匀匹配,结论是实证拟合而非单组件因果效应。
六、效果优势的根源解释(合读)
两篇论文的结论需要拼在一起才能得到完整的因果链。
6.1 Malena 为什么能赢:机制与证据链
因果链(每步标注证据等级):
- 历史 Harness 机械为「单次补全不能执行代码」的时代设计 → 编码后训练让模型在单会话内自跑/自调/自搜【论文实验支持:Chat→Oneshot 对前沿模型的最大跃升;DeepSeek V4 Preview(少编码 agent 后训练)几乎无 Chat-Oneshot 差距而正式版(多后训练)拉开差距】;
- 模型具备自主搜索能力后,外置搜索原语提供的信息(前序解文档 + 验证分)模型自己就能获取与权衡 → 外置编排变成冗余【论文实验支持:四种搜索策略配对差异全不显著,最大 2.71pp CI 含 0】;
- 单会话共享同一条验证管线 → 候选间验证分天然可比 → 选择差距缩到 1.876pp【论文实验支持 + 作者标注的机制假说:差距随「验证方法学多样性」而非「提交数」增长——此点作者明示为假说,未直接检验】;
- 多 agent 编排引入协调开销与选择噪声(并行拉高 oracle 上限但同步拉大选择差距;广播消息反而干扰)→ 无净增益【论文实验支持】;
- 轨迹证据:agent 自发进行代码补丁级超参搜索、晚期转向集成/伪标签等性能技巧、复用检查点、跨骨干独立重发现同一稀有技术 → 「模型内生的搜索」比「外置硬编码的搜索」更贴合任务【论文轨迹分析支持】。
外部交叉验证:
| 研究 | 相似尝试/相关结论 | 与本文关系 |
|---|---|---|
| Sghaier et al. 2026(arXiv:2607.03691) | 35 个 SWE Harness 发布版本在固定骨干下对 SWE-bench 无统计显著改进 | 方法不同(文献计量 vs 受控消融)、领域不同(SWE vs MLE),结论高度一致——支持「强骨干下 Harness 冗余」的跨域普适性 |
| Xu et al. 2026(arXiv:2601.12307) | 单个精心提示的 agent 匹敌多 agent 工作流 | 直接支持多 agent 编排冗余结论 |
| Cemri et al. 2025(arXiv:2503.13657) | 多 agent 系统失效源于协调而非能力 | 与 +D/+P3/+B 无增益的发现互补 |
| Toledo et al. 2025(arXiv:2507.02554) | chat 式 AIDE 类系统中搜索策略与指令的协同设计提升性能 | 相反结论——但注意其设定是 chat 基元系统;Malena 论文自己复现了这一边界:Gemma 4 31B 弱骨干上 MLEvolve 树搜索仍占优(42.88 vs 32.35 percentile)。搜索先验的价值随骨干增强而衰减,两篇工作刻画的是同一条曲线的不同区段 |
| Sutton 2019(The Bitter Lesson) | 通用方法 + 算力碾压手工结构 | 提供解释框架:编码 agent 是测试时推理版的 bitter lesson |
未决问题:Malena 的结论限定在单 worker、MLE 基准、前沿编码骨干上;跨 agent 协调协议(论文明确留给未来工作)、垂直域(GUI/机器人)、受限预算下的 Harness 优化(Turbo Harness 等工作证明在冻结中坚模型上仍有稳定增益)都在边界之外。
6.2 排名反转为什么发生:机制与证据链
因果链:
- 模型的固有能力(包括自发修复倾向:180/192 自主发起)在任一 Harness 中都存在 → 能力不是排名差异的来源【论文轨迹数据支持】;
- Harness 决定失败信号是否以「模型可用的形式」返回:无超时 shell 把挂起变成无信号(34 次静默卡死)、截断即终止丢掉半截推理、畸形参数调用被静默吞掉还是结构化回传【论文配对轨迹支持,含匹配案例】;
- 同一模型在不同 Harness 下能力被「兑现」的比例不同 → 分数差异不是能力差异而是兑现率差异【由 1+2 推出,论文综合判断】;
- 兑现率是模型习惯 × Harness 设计的交互(GPT 自设超时 → 契合极简 PI;Kimi 畸形调用多 → 需要护栏型 openJiuwen)→ 无普适最优 Harness,只有 per-model-per-task 的拟合【论文数据支持:4/5 模型最佳 Harness 随基准漂移,唯 Kimi×openJiuwen 全胜】;
- 终点处的完成判定(验收标准不可见 → 自建标准自证完成 → 35/45 失败以「全部已验证」收尾)构成与反馈回路独立的第二瓶颈【论文人工复核支持】。
外部交叉验证:
| 研究 | 相关结论 | 关系 |
|---|---|---|
| Harness-Bench(arXiv:2605.27922) | 弱模型对 Harness 更敏感;输出契约违规是最大失效类 | 支持并细化:Kimi(本文中较「弱」的配对习惯)受益于护栏最强;畸形 edit 调用正是输出契约违规 |
| Scaffold Effect(arXiv:2607.22585) | Harness 间每解一题 token 差可达 40 倍,通过率变化小 | 与成本侧发现一致(同模型成本差数倍);本文补充分数也可以大反转 |
| Kim et al. 2026(arXiv:2606.25447) | 心中有 Harness 的后训练提升 agent;最小 Harness 下训练的 agent 在工具环境变化时性能骤降 | 互为印证:训练与 Harness 的交互呼应 Malena 的「后训练吃掉 Harness」假说 |
| Polar(arXiv:2605.24220) | 同一模型的 RL 增益在不同 Harness 下差 0.6–22.6pp | 支持「Harness 是训练收益的调制器」这一更广命题 |
| Malena(本文合读对象) | 强骨干下编排机械冗余、运行时基底是主驱动 | 完全兼容——见 6.3 |
6.3 合读综合判断:两篇论文的「矛盾」如何消解
表面上:Malena 说「Harness 不重要」,Fit 说「Harness 决定一切」。实际上两者拆开的是 Harness 的不同层:
- Malena 证明冗余的:搜索编排(树/贪心/UCB/BoN)、多 agent 协调(委派/并行/广播)、外置记忆与上下文管理——即「替模型思考」的层。强骨干已经会思考这些。
- Fit 证明关键的:超时绑定、失败信号回传格式、截断续写、参数错误结构化反馈、完成判定支持——即「保障模型与环境回路不断裂」的层。这些不是替模型思考,而是不把模型扔进无声的黑暗。
进一步地,Fit 的归因精确解释了 Malena 的「运行时是最大单一效应」:shell + 文件系统之所以是最大跃迁,正因为它是反馈回路的载体——模型第一次能看见自己代码的输出与报错。Malena 的 OpenCode 定制 bash(带资源统计、带看门狗、白名单)本身就是 Fit 意义上的「好 Harness 行为」。Malena 不是「无 Harness」,而是「只剩反馈回路基座的 Harness」。
得到多项研究共同支持的机制判断:
- 「模型自发修复 + Harness 决定反馈可用性」(Fit 直接证明 + Malena 轨迹分析间接一致 + Reflexion/自修正文献背景)——多研究支持;
- 「强骨干下编排机械冗余」(Malena 受控消融 + SWE 域 35 版本无改进 + 单 agent 匹敌多 agent)——多研究支持;
- 「优势随骨干增强向运行时收缩」(Gemma 4 例外 + Harness-Bench 弱模型更敏感 + bitter lesson 框架)——有证据但区段边界未精确定量,属合理推断;
- 「单会话共享验证管线导致最低选择差距的机制(可比性假说)」——Malena 作者自标为假说,待独立检验。
失效条件:结论在弱骨干(Gemma 4 31B 上手工搜索仍赢)、垂直域(GUI/机器人域 harness 进化工作仍有稳定增益)、受限预算(40 步/$3 级别的中坚模型设置)下不成立或未测试;Fit 的结论受限于每任务单次运行、无方差测量。
七、必要知识反推(合读)
假设一个完全没有背景的人要完成这两项研究,最少必须掌握什么?
领域知识层:
- MLE/Kaggle 竞赛的完整工作流(数据探索→特征→模型→训练→验证→集成→提交)与「验证分数有噪声」这一核心痛点——不理解它就无法设计 self-select vs oracle 的区分,也无法理解选择差距为何是核心指标;
- Agent Harness 的解剖学:工具暴露方式、上下文管理、重试/超时/停止策略——两篇论文分别从消融与测量两侧使用这套词汇;
- 编码后训练(agentic post-training)改变了模型原语的能力边界——这是「为什么老机械失效」的前提认知。
方法论知识层:
- 受控消融 + 配对任务差 + bootstrap CI 的统计协议(Malena):知道为什么「同骨干同预算同硬件 + 任务内配对」才能把性能差归因于干预;知道 CI 含 0 时只能说「统计不可区分」而非「相等」;
- 全交叉因子设计的评估方法学(Fit):理解主效应与交互效应的区别,才能理解「排名反转」恰好是交互效应的直接证据;
- 轨迹定性编码方法(发起者标注:模型自主/提示后/系统代劳)——把宏观分数差异追到微观机制的桥。
工程知识层:
- OpenCode 框架二次开发、vLLM 本地骨干服务、GPU 预算管理(数千 GPU 时的实验编排);
- 六个 Harness 的适配器开发与 OpenRouter 统一计费——Fit 的 66 配置每格都要真实跑通;
- MLE-bench 任务脚本修复(泄漏检测/数据补全)、Dolos 与嵌入双通道污染检测——保证「赢」不是作弊的赢。
知识融合的关键节点:
- 节点一(Malena):「历史机械的时代前提」×「编码后训练改变了原语」→ 生成消融阶梯的层级设计(环境→搜索→自主→编排),这个顺序本身就是对「机械累积史」的逆向工程;
- 节点二(Malena):统计协议 × 工程诚实性 → 对外部 Harness 做对称调优努力、公开负结果(Appendix D.3),使 62.5% vs 47.1% 可信;
- 节点三(Fit):因子设计 × 部署直觉(「原生最好?贵的好?」)→ 把流行信念转成可拒绝命题;
- 节点四(Fit):轨迹编码 × 信号论视角(「失败是反馈还是沉默」)→ 把 38.09pp 的摆幅落到 34 次静默卡死、48 次畸形调用救援这些可数的机制事件上。
八、通用性灵感(合读)
灵感一:基础设施的价值随使用者的能力重新分布,而非单调消失。Malena 证明强骨干下「替它思考」的机械(搜索/编排)归零,而 Fit 证明「保它不聋」的机械(超时/回传/续写)仍定生死。推广:任何「工具+使用者」系统(IDE 与程序员、操作系统与应用、API 与调用方)中,当使用者变强,投入应从「代劳智能」迁移到「保障回路」——反馈不中断、错误可见、状态可续。论文证据:2.71pp CI 含 0 的搜索策略差距 vs 48 次续写救援、34 次静默卡死。
灵感二:排名是配对的属性,不是个体的属性。Fit 的 38.09pp 摆幅说明脱离搭配谈优劣无意义。推广到:招聘(候选人排名取决于岗位配置)、模型选型(benchmark 排名取决于 harness/提示词搭配)、供应商选择(表现取决于你方的对接接口)、甚至医疗(疗效排名依赖给药方案)。实践准则:评估任何「个体」前,先枚举并声明其将嵌入的「配置」。
灵感三:把「能力」与「能力兑现率」分开测量。Fit 的核心方法论贡献:模型都会修(180/192 自发修复),但修复机会取决于失败是否以可用形式返回。推广:学生答错题后是否有讲解反馈、员工提案后是否有结构化回应、系统报错后是否有可诊断日志——测量一个系统的产出时,要把「内在能力」与「环境兑现率」分离,否则会把环境缺陷误诊为能力缺陷(48 次 Kimi 畸形调用被终止的运行,不是 Kimi 不能恢复的证据)。
灵感四:自证完成是最深的失效模式。Fit 的 35/45 失败以「全部要求已验证」收尾;Malena 侧 Best-of-N 的 6.832pp 选择差距同源于「自己给自己打分」。推广:代码 review 不能只靠自测通过、审计不能只看被审方的自查报告、AI 对齐中 agent 的自检不能替代外部验收标准。准则:验收标准必须在运行时对执行者可见,否则执行者必然(无意地)构造一个自己能通过的标准。
灵感五:做减法前先做归因,做归因必须受控。Malena 的价值不在「极简 agent 赢了」,而在「同骨干同预算同硬件 + 配对统计」的归因协议——此前无人能区分「Harness 好」与「骨干好」。推广:任何系统优化(数据库调参、组织流程、个人工作流)在砍组件前,先固定其余变量做配对比较,否则砍掉的可能是搭载者的功劳,留下的可能是包袱。
灵感六:「原生最优」是需要检验的假设,不是默认事实。Codex 从未给 GPT 最高分、Claude Code 在 TB4 被 OpenHands 反超——为特定对象定制的系统未必是该对象在特定场景的最优配置。推广:厂商默认配置、专家系统默认规则、为自己产品设计的配套工具,其最优性声明都应放在「真实使用场景矩阵」中检验。
结语
这两篇论文合起来给 2026 年的 Harness 工程学划出了一条清晰的等高线:骨干每增强一分,「替模型思考」的机械就贬值一分,「保模型回路」的机械就升值一分。Malena 证明山顶(前沿编码骨干 + 24h 预算)上只剩运行时与骨干本身,Fit 证明山腰上每一格配置的兑现率仍被反馈回路决定。对研究者的启示是:别再往编排层堆机械,去把失败回传、截断续写、完成判定这三件事做到可测量、可配置;对部署者的启示是:选 Harness 前先问你的模型有什么习惯(自设超时吗?发畸形调用吗?),再问你的任务长什么样——因为 62.5% 与 47.1%、+7.94 与 −30.16 之间的全部差距,都藏在这些朴素问题的答案里。