本文为三篇论文合并精读:论文一《Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents》(arXiv:2609.39982);论文二《STITCH: Composing Task-specific Agent Harnesses at Test Time with Reusable Primitives》(arXiv:2609.38912);论文三《Turbo Harness: Instance-Adaptive Harness Optimization》(arXiv:2609.40330)。第一至五部分分论文展开,第六至八部分合并讨论。
总题目区
论文一(Mid-Harness):arXiv 2609.39982 | 2026 年 9 月 | NVIDIA + KAIST(一作 Minki Kang 实习期间完成,NVIDIA 版权,Byung-Kwan Lee 项目主导)| cs.CL / 终端 Agent / 测试时算力扩展 论文二(STITCH):arXiv 2609.38912 | 2026 年 9 月 | University of Illinois Urbana-Champaign + University of Michigan, Ann Arbor(纯学术合作)| cs.AI / Agent Harness / 测试时组装 论文三(Turbo Harness):arXiv 2609.40330 | 代码开源于 GitHub | 2026 年 9 月 | Rutgers University + Red Hat AI Innovation + MIT-IBM Watson AI Lab(一作 Tunyu Zhang 在 Red Hat AI 实习期间完成)| cs.AI / 实例自适应 Harness 优化
〇、总览:Harness 工程学的缩放轴之争
2026 下半年,「固定模型、优化 Harness」成为 Agent 研究的爆发方向。Meta-Harness(外层程序搜索)、Harness-R1(RL 训练 Harness 工程师)、GEPA/ACE(上下文优化)等一批工作把「Harness 优化」变成了独立的研究赛道。但当大家都在问「怎么优化一个全局 Harness」时,这三篇论文问了三个更细的问题——在模型与环境的夹层里,还有哪些正交的缩放轴没被开采:
| 论文 | 缩放轴 | 粒度 | 一句话 | 代表数字 |
|---|---|---|---|---|
| Mid-Harness | 动作级 | 单步动作 | 执行前采样+验证候选动作 | TBLite 50.00→68.03%(前沿验证器 N=8) |
| STITCH | 原语级 | 机制组件 | 测试时从原语库组装任务专属 Harness | SWE-V 80.5%、组装开销 2.7% |
| Turbo Harness | 实例级 | 整个 Harness 补丁 | 按测试实例生成实例专属补丁 | SWE-V 38.4→54.4%(Gemini) |
三轴的互补性在数字上直接可见:Mid-Harness 证明动作级缩放与轨迹级缩放(Best-of-T、Sequential Refine)正交可组合;STITCH 证明机制选择应任务条件化(固定选择有理论下界的 mismatch gap);Turbo Harness 证明同一全局 Harness 在不同实例上有巨大空间头(同一基准不同执行模型增益从 +2.7 到 +17.3pp 浮动)。三篇论文放在一起,勾勒出 Harness 工程学从「设计一个更好的笼子」到「设计一个能按需变形的笼子系统」的范式转移。
一、论文背景
1.1 终端 Agent 与它的 Harness
**终端 Agent(terminal agent)**是在命令行环境里执行长程任务的智能体:修 GitHub issue、做数据处理、配置科学计算环境。它的架构分三层——模型(LLM,生成动作)、Harness(脚手架程序,决定上下文怎么组装、工具怎么调用、状态怎么维护、何时终止)、环境(Docker 容器里的真实终端)。同一个模型换不同的 Harness,任务成功率可以差几十个点——这是 2026 年「Harness 工程」成为独立研究方向的经验起点。
为什么动作可靠性是瓶颈。终端 Agent 每一步执行的命令都会改变环境:装错一个包、改错一个文件,后续所有决策都建立在被污染的状态上。模型「能生成好的动作」不等于「每次都生成好的动作」——随机采样下,同一次运行可能因为一步之差成败逆转。Mid-Harness 把这个现象命名为**动作可靠性(action reliability)**问题。
**测试时算力扩展(test-time compute scaling)**是 LLM 推理领域的成熟思路:花钱采样更多、验证、精化,换更高的成功率。已有工作把它用在轨迹级——Best-of-T 采样 T 条完整轨迹选最优、Sequential Refine(SR)跑完总结再跑一轮。但「在动作执行之前投入额外计算」这个介于模型调用与环境执行之间的夹层,此前没有被系统研究过。
1.2 全局 Harness 的失配问题
Harness 优化自动化。设计 Harness 的设计空间巨大(暴露什么信息、维护什么状态、何时干预、分配多少计算),于是出现了一批自动化方法:Meta-Harness 用外层编码 Agent 基于执行轨迹搜索 Harness 程序;GEPA 反思式进化提示;ACE 维护演进的 playbook。它们的共同输出是一个全局 Harness——优化完成后,同一个 Harness 被均匀用于所有测试实例。
失配(mismatch)从两个层面出现。任务层面:STITCH 指出,一个对 SymPy 数学库任务有帮助的机制(比如「契约用例探索」),对 Django 网页框架任务可能是纯开销——机制效用是任务条件的。实例层面:Turbo Harness 指出,即使同在 SWE-bench 里,不同仓库的开发工作流、测试约定完全不同——一个 Jinja2 回归 bug 需要「先查 git 历史」,一个逻辑错误需要「先读控制流」,全局 Harness 只能取平均。
现场生成代码的两难。任务自适应的另一条路是测试时现场生成 Harness 代码(JIT-Agent、TTHE 一线),但这引入执行风险:语法错误、逻辑缺陷、接口不匹配,而且风险随机制数量指数复合——这是 STITCH 用命题形式化的关键洞察。
1.3 外层搜索的「废气」浪费
Harness 优化很贵:外层搜索要评估大量候选 Harness、跑大量轨迹。但优化结束后,这些中间产物(候选/轨迹/评估档案)里蕴含的实例级信号——哪个策略在哪种实例上有效/失败——被全部丢弃。Turbo Harness 的类比很形象:这就像涡轮增压器(turbocharger)把发动机排出的废气重新压缩进气——搜索的副产物本身就是可回收的经验。
二、论文定位和关联工作
2.1 Mid-Harness 的坐标系:测试时扩展的三条谱系
谱系一:推理任务的测试时扩展。Self-Consistency(采样聚合)、Tree of Thoughts(搜索)、s1(延长思考)——这些工作证明了「采样+验证」范式在推理任务上的威力,但推理任务的候选之间互不影响(采 8 个答案,错了 7 个也没关系)。终端 Agent 不同:每个动作改变环境,验证必须发生在执行之前——这是 Mid-Harness 的独特约束。
谱系二:过程奖励模型(PRM)。Let’s Verify Step by Step、Math-Shepherd、Web-Shepherd 一线对中间步骤打分。Mid-Harness 的 pointwise 验证机制(对每个候选独立打分)正对应 PRM 的 step-scoring。区别:PRM 用于训练或重排推理链,Mid-Harness 用于在环境执行前从同历史候选集中选一。
谱系三:Agent 测试时扩展。LLM-as-a-Verifier(Best-of-T 的轨迹级验证)、Zainullina 等 2025(动作排序 critic + 轨迹选择用于 SWE)。Mid-Harness 与后者的区别:系统比较了 listwise/pointwise/pairwise/decision-only 四种验证机制、做了验证器蒸馏与成本模型、并验证了与轨迹级缩放的正交组合——是一份「动作级扩展何时有效、为何有效」的系统研究。
| 维度 | 轨迹级(Best-of-T/SR) | 动作级 PRM 排序(Zainullina 等) | Mid-Harness |
|---|---|---|---|
| 验证对象 | 完整轨迹 | 动作候选 | 动作候选 |
| 何时验证 | 任务完成后 | 执行前 | 执行前 |
| 环境实例数 | T 条轨迹 T 个环境 | 单环境 | 单环境(同历史采样) |
| 与轨迹级组合 | — | 部分 | 系统验证(+11.23pp) |
| 验证机制学 | — | 单一 | 四种机制+蒸馏+成本 Pareto |
2.2 STITCH 的坐标系:任务自适应 Harness 的三条路线
谱系一:全局 Harness 优化。Meta-Harness、Self-Harness、AutoSaddler、MemoHarness——搜索/进化出一个固定 Harness 用于所有任务。STITCH 与它们的分野:不改变原语实现、只做每任务的选择接线,且选择发生在测试时而非训练时。
谱系二:测试时生成 Harness 代码。JIT-Agent(蒸馏+进化 RL 现场生成模块)、TTHE(从测试批次轨迹重写 Python Harness 代码)——灵活但承受「生成+调试」的成本与指数复合的执行风险(STITCH 命题 2 形式化了这一点)。
谱系三:整库选择。HarnessX 在多个完整 Harness 之间选择——粒度是整个 Harness。STITCH 把粒度下沉到原语:库里 6 个 SWE 原语、5 个终端原语,按任务组合激活,细粒度带来更精细的适配(性能随库规模单调上升)。
| 维度 | 全局优化(Meta-Harness) | 现场生成(JIT-Agent) | 整库选择(HarnessX) | STITCH |
|---|---|---|---|---|
| 适配粒度 | 无(全局一个) | 全新代码 | 整个 Harness | 单个原语 |
| 测试时写代码 | 否 | 是(有风险) | 否 | 否(composer 只做选择) |
| 执行保证 | 高 | (1−ε)^k 指数衰减 | 高 | 100% 激活(预验证原语+确定性编译) |
| 理论支撑 | — | — | — | mismatch gap + 指数衰减两命题 |
2.3 Turbo Harness 的坐标系:实例自适应的两条先行路线
谱系一:批次自适应。TTHE 在无标注测试批次上搜索 Harness 并延续到后续批次;Harness-R1 从失败轨迹批次训练 Harness 工程师、部署时两遍式(先跑一遍收集失败、再打补丁重跑)。共同局限:适配单位仍是「批次」而非「实例」,且 Harness-R1 的两遍式把执行成本翻倍。
谱系二:实例自适应(并发工作)。JIT-Agent 同样瞄准实例级,但为每个实例从零生成完整 Harness(教师蒸馏+进化 RL)。Turbo Harness 的差异化:补丁而非重写(在全局 Harness 基础上做最小编辑)+副产物回收(playbook 来自已完成的外层搜索档案,不新增搜索)+单次调用(编辑器只调一次,无两遍式)。
| 维度 | Harness-R1 | JIT-Agent(并发) | Turbo Harness |
|---|---|---|---|
| 适配单位 | 批次 | 实例 | 实例 |
| 编辑对象 | 运行时补丁 | 从零生成完整 Harness | 对全局 Harness 打补丁 |
| 部署调用 | 两遍式(先跑再改再跑) | 每实例生成 | 每实例一次编辑器调用 |
| 经验来源 | 失败批次再训练 | 教师蒸馏 | 回收外层搜索副产物(playbook) |
| 编辑器规模 | — | 进化 RL | 9B(GRPO),追平 Opus-4.6 |
三、问题定义
3.1 Mid-Harness:动作级扩展 ≈ 无地面真值下的候选选择
具体问题:终端 Agent 单步采样的动作不可靠,一步错步步错;但换更强模型或改 Harness 都成本高昂。
抽象问题:设动作生成模型 π、交互历史 h_t。基础 Agent 执行 a ~ π(·|h_t)。Mid-Harness 定义:采样 N 个候选 A_t = (a¹_t, …, ᴺa_t)(同历史),由验证器 ψ 选出一个转发执行:
$$a_t^\star = \mathrm{Verify}_\psi(h_t, \mathcal{A}_t) \in \mathcal{A}_t$$研究问题被拆成两个可分离的条件:(1)候选覆盖——生成器的采样里是否包含「能改变轨迹结局」的有用替代动作?(2)验证能力——能否在执行前把它们识别出来?两个条件没有地面真值(无法标注「这一步的正确动作」),论文用前沿验证器作为覆盖的上界探针(64.63%@N=4 → 68.03%@N=8 证明覆盖存在)、用机制对比+蒸馏研究验证的回收率。
这个「生成不动、验证外包」的定义精妙在变量隔离:生成器与 Harness 全部冻结,所有性能变化只能归因于「动作选择」这一件事——这是研究「缩放轴收益来源」最干净的实验设计。
3.2 STITCH:任务自适应 ≈ scope 匹配下的原语激活
具体问题:同一套 Harness 机制在不同任务上有正有负,全局选择只能取平均;现场生成代码又脆又贵。
抽象问题:设任务空间 X 服从分布 D,原语库 P = {p₁, …, p_M}。每个原语 pᵢ 有应用范围 Ωᵢ ⊆ X(scope 内边际效用 uᵢ(x) > 0,scope 外惩罚 cᵢ(x) > 0)、流行率 μᵢ = P(x ∈ Ωᵢ)。Harness 由激活向量 a ∈ {0,1}^M 参数化,加性效用 R(x, a) = R₀(x) + Σ aᵢΔᵢ(x)。
命题 1(mismatch gap):最优固定 Harness 与 oracle 任务自适应 Harness 的期望差距严格为正:
$$\Gamma_{\mathrm{fixed}} = \sum_{i=1}^{M} \min(\mu_i \bar{u}_i, (1-\mu_i)\bar{c}_i) > 0$$命题 2(生成失效):独立失败模型下(每个机制以 ε 概率出错),现场生成 k 个机制的 Harness 可执行概率为 (1−ε)^k,随机制数指数衰减;而「预验证原语+确定性编译」按构造保证可执行。
两个命题合起来论证了一个工程分工:选择可以不完美(只要选择损失 < mismatch gap),但实现必须可靠——composer 只做设计级选择(不写码),编译器做确定性接线。这是「关注点分离」在 Harness 工程上的精确落点。
3.3 Turbo Harness:实例自适应 ≈ 检索+应用已发现的编辑策略
具体问题:全局 Harness H*(外层搜索产物)在不同实例上有不同最优配置——同一个「提交时机门控」参数,在 chess-best-move 上最优是 1 步、在 extract-elf 上最优是 2 步,全局只能选一个。
抽象问题:对每个测试实例 x,求 H*x ∈ argmax{H_x} r(Agent(M, H_x, x))——逐实例的 Harness 优化。直接搜索每实例代价不可承受(要评估多候选)。Turbo Harness 的转化:把「搜索新策略」问题变成「检索+应用已发现策略」问题——外层搜索档案已经记录了哪些编辑策略在哪些条件下成功/失败,蒸馏成 playbook(条件-策略表);编辑器只需学会「看实例特征、查 playbook、打补丁」。
形式化:π_θ(·|x, H*, P) 输出补丁 p_x,H_x = H* ⊕ p_x。约束:编辑器轻量(Qwen3.5-9B)、单次调用、补丁失败回退 H*(有保底)。这个定义的精妙处:搜索成本已被外层优化预付,实例适配只付检索与应用的边际成本。
四、问题解法
4.1 Mid-Harness:模型调用包装层的采样-验证回路
集成方式(类比:拦截器/中间件)。Mid-Harness 完全不改 Harness 与模型权重,只在「模型调用包装层」插入逻辑——Harness 循环里每次 model.generate(messages) 被替换为「采样 N 个候选 → verify → 返回一个」。绿色的三行代码就是全部侵入点。这意味着任何现有 Harness 都能零成本叠加 Mid-Harness。
四种验证机制(这是论文的「机制学」贡献):
| 机制 | 输入 | 调用数(N=8) | 优点 | 缺点 |
|---|---|---|---|---|
| Listwise | 全候选集一次看 | 1 | 一次调用直接比较 | 候选多时联合决策困难 |
| Pointwise | 每候选独立打分 | 8 | 可并行、类 PRM | 异质动作的分数不可比 |
| Pairwise | 两两比较偏好 | 22–25(ring+pivot 锦标赛) | 共享参照物、最准 | 调用数最多 |
| Decision-only | 两两只出 A/B 一个 token | 22–25 | 成本降 20–24% | 小模型上精度有损 |
Pairwise 的聚合用 ring+pivot 锦标赛(K=4 pivot,22–25 次比较而非全对 28 次)+ margin 加权胜率排序。类比: Listwise 像面试官一次看所有简历直接挑,Pointwise 像给每份简历独立打分,Pairwise 像候选人间两两对打排位赛——最后一种给验证器提供了「共享参照物」,这正是它在弱验证器上表现最好的机制原因。
验证器蒸馏(LoRA,117k 教师偏好响应)。前沿验证器(GPT-5.6 Sol)效果好但推理时不能用(成本/部署)。蒸馏管线:在 244 个困难任务、732 条轨迹上收集 GPT-5.6 Sol 的 pairwise 响应(推理+分数+偏好标签),A/B 平衡下采样后 117,631 条训练输入;LoRA(rank 64/alpha 128)微调 TMAX-9B,只激活在验证时、不动生成器——生成器还是那个生成器,验证器成了「戴了教师眼镜的同一个模型」。
4.2 STITCH:两阶段——离线挖原语,在线选+编
阶段一:原语开发(离线,从失败到库存)。类比「从线上事故库沉淀运维 runbook」:
- 失败挖掘:用种子 Harness(Mini-SWE-agent)在开发集(SWE-bench 100 题 + Terminal-Bench 44 题)上跑,收集失败轨迹;
- 缺陷聚类:开发 Agent 聚类分析失败模式(如「检查失败但 Agent 不修复,继续原计划」);
- 原语实现:为每类缺陷实现一个机制(如 Repair-from-Check-Feedback:用检查反馈诊断修复再验证);
- 双重验证:机制测试(原语是否真的激活并影响决策)+ 任务受益对比(带/不带原语的配对运行),正效应才入库;
- 标注 scope 与 contract:scope 描述「何时该用/不该用」(给 composer 看),contract 描述输入输出、环境需求、依赖(给编译器看)。
最终库存:SWE 域 6 个原语(Change-surface Tracer、Compatibility-envelope Gate、Contract-case Explorer、Discriminating-oracle Runner、Domain-trace Template、Environment-capability Runner)+ 终端域 5 个(State Guard、Check Replay、First-Failure Localizer、Experiment Keeper、Execution Supervisor)。每个都是「控制机制」而非「领域求解器」——actor(任务模型)仍负责解题。
阶段二:测试时组装(在线,选+编分离)。
- Composer(选择):与 actor 同 backbone 的 LLM,接收任务 x、执行规范 c_x、种子图 G_seed、原语目录,输出 composition intent——一个 JSON(strategy_id、rationale、primitives 列表),只做设计级选择,不写任何代码。
- 确定性编译器(接线):K(G_seed, I_x; P, c_x) 把选中原语接入种子图、自动补依赖(选了 repository map 就自动把它插入 actor 请求)、校验合法性(支持的基元/兼容性/有效连接/可终止/有界循环);非法则带诊断信息退回 composer 有界修正,仍失败则回退种子 Harness——测试时永远有一个能跑的兜底。
State Guard 原语的例子可以说明「scope+contract」长什么样:scope——「本地输入不可替代、动作有修改风险、输出独立存放时选用;任务要求原地编辑的文件要排除」;contract——「输入:受保护路径+声明输出路径;输出:变更报告+完整性检查;依赖:首个 actor 动作前快照、每动作后检查、违规反馈注入下一请求」。数据库恢复任务上,种子 Harness 两次尝试都因 actor 过早打开数据库毁掉 WAL 日志而失败;State Guard 快照保护后两次尝试全部成功。
4.3 Turbo Harness:三步回收废气
Algorithm 1 的两条时间线:
离线(一次性):
- Playbook 蒸馏(SUMMARIZE):把已完成 Meta-Harness 搜索的档案(所有候选 Harness、轨迹、评估)按 ACE 风格三阶段加工——抽取(每训练实例一条经验记录:对比性实例【某 Harness 解了另一个没解】配对最不相似的成功/失败变体并算源码级 diff,定位「造成结局差异的 Harness 改动」;均匀成功/失败类分析为何与 Harness 无关)→ 反思(前沿模型产出结构化反思:实例特征、变体行为差、候选编辑策略、理由、置信度;低置信与命名了已知反模式的丢弃)→ 收敛(等价策略聚合成单条目,合并适用条件、累计正负证据;净有害策略标记为反模式;TB2.1 的 playbook 最终只有 6 条策略+9 条反模式,紧凑到整个放进编辑器上下文)。
- 编辑器训练(GRPO):Qwen3.5-9B 全参数微调。每实例采 G 个候选补丁(G=8~16),应用后跑冻结执行模型拿任务奖励,组内相对优势更新策略。奖励设计有巧思:SWE 域用 1 − s/(2L)(成功且步数少奖励高);防 reward hacking——任务结果在编辑器生成的 Harness 代码之外计算(可信 runner 直接从环境取结果、Harness 拿不到评分接口、源码检查拒绝引用受保护评分内部量);无法应用/校验失败的补丁零奖励不执行。
在线(每实例):编辑器以(实例 x、全局 Harness 源码 H*、playbook)为条件生成单个补丁 p_x,应用得 H_x;应用失败回退 H*;执行模型在 H_x 里跑任务。编辑器全程只调一次——推理开销近零。
类比总结:Mid-Harness 是「每步出手前多想一下」(出手频率最高、每次最便宜);STITCH 是「进考场前按题组装文具」(每任务一次、确定性);Turbo Harness 是「考前把错题本背熟、开卷按题翻」(每实例一次、RL 训出来的检索应用能力)。
五、评估指标与实验证据
5.1 Mid-Harness:五个基准、三种模型规模、成本-成功 Pareto
指标体系:主指标 Pass@1(每任务 3 次运行的平均精确成功率)/ Pass@3(3 次至少 1 次成功的任务比例);成本指标并行化输出 token(POT,理想延迟代理)与参考定价美元成本(Qwen3.5-9B 费率 $0.08/$0.13 每百万输入/输出 token);消融指标教师一致率(pairwise/verification agreement)。
发现一:采样收益由验证支配(核心论点)。TerminalBench-Lite(98 任务,TMAX-9B 生成器):
| 配置 | N=4 Pass@1 | N=8 Pass@1 |
|---|---|---|
| Base agent(N=1) | 50.00 | 50.00 |
| First-runnable 代理(无验证,取首个可解析候选) | — | 49.66 |
| Listwise 零样本 | 49.32 | 51.02 |
| Pointwise 零样本 | 52.72 | 52.38 |
| Pairwise 零样本 | 54.42 | 54.76 |
| Pairwise 蒸馏 | 55.44 | 57.14(Pass@3 75.51) |
| 前沿验证器(GPT-5.6 Sol,listwise) | 64.63 | 68.03(Pass@3 80.61) |
三段式证据链:(a)弱验证下加宽采样几乎无益(listwise N=4→8 仅 49.32→51.02),first-runnable 甚至低于基线——没有验证,多样性是噪声;(b)同一 listwise 机制换前沿验证器直接 64.63/68.03——瓶颈不在候选质量在验证能力,生成器的候选覆盖天然存在(TMAX-9B 自己采的 8 个候选里就有够翻盘的替代动作);(c)机制间 pairwise 最优(54.76 vs listwise 51.02)而蒸馏再 +2.38(57.14)——参照物+判断力两个因子独立贡献。
发现二:与轨迹级缩放正交组合。
| 配置(9B) | Pass@1 | 环境执行数 |
|---|---|---|
| Best-of-T(T=3) | 55.10 | 3 |
| SR(R=1) | 55.10 | 2 |
| 蒸馏 Mid-Harness(N=8) | 57.14 | 1 |
| Mid-Harness + Best-of-T | 66.33(+11.23) | 3(不变) |
| Mid-Harness + SR | 60.20(+5.10) | 2(不变) |
| Best-of-T(T=7) | 59.18 | 7 |
组合在环境执行数不变的前提下 +11.23pp;蒸馏 N=8 以约 1/3 成本匹配 Best-of-T T=5;组合超过 T=7 且 token 成本不到其一半。SR 加轮数在 R=1/2/3 上平台化(55.10/56.46/55.78),组合则突破平台——两条轴真正独立。
发现三:跨模型/基准/Harness 迁移(七设置全改善)。TB2.1:TMAX-9B 21.72→27.34(+5.62);FeatureBench-Mini(对 TMAX-9B 极难,基线仅 1.45%):零样本 5.80、蒸馏 7.25(27B:17.39→23.19,Pass@3 26.09→39.13);SWE-bench-Verified Mini 46.67→48.67;换 harness(Terminus-2 + Qwen3.5-9B)与换模型族(Nemotron3.5 Lightning 30B、Nemotron3 Ultra 550B)全部 Pass@3 改善。4B/9B/27B 三规模蒸馏 Pass@1 分别 +5.10/+7.14/+5.10,任务级 bootstrap CI:9B 蒸馏 [+1.36, +12.93]、27B 蒸馏 [+0.34, +9.86] 显著为正。
发现四:蒸馏转移了什么、还缺什么。离线基准(21 个 held-out 任务的 1,355 个状态):蒸馏使分数 MAE 2.59→1.05、pairwise 一致率 59.01%→74.58%、验证一致率 38.52%→57.79%;被判「明确验证器失败」的案例 3,328→1,810,但剩余失败的 67.4% 集中在命令语义(这条命令到底会做什么)与执行可行性(在当前环境能不能跑成)——验证器不会在脑内模拟 shell。这把「动作验证」的开放难题精确制到「无执行预测命令效果」,论文建议的出路是世界模型或 V1 式生成-验证联合 RL。
成本工程细节:N=8 pairwise 零样本增加 26.6k POT/步(listwise/pointwise 至多 1.3k)、总验证输出 125.7k token——贵;decision-only(只出 A/B 一个 token)在 9B 上反而 Pass@1 +1.362.04 且成本降 20.924.1%(4B/27B 上有精度代价);「每对采 5 次响应」花 5 倍验证 token 反而降分(57.14→53.40)——验证算力也不是多多益善。
5.2 STITCH:双基准主表+四维分析
指标体系:Pass@1(成功尝试比例)/ Pass@k(k 次至少一次成功)/ Pasŝ@k(k 次全部成功);可靠性指标激活率(选中原语在 actor 执行中真实生效的比例);效率指标组装开销(相对 actor 单次尝试的成本倍数);扩展性指标库规模-性能曲线。
主结果(GPT-5.6-Luna actor,k=2)。SWE-bench Verified(100 题):
| 方法 | Pass@1 | Pass@k | Pasŝ@k |
|---|---|---|---|
| Mini-SWE-agent(种子) | 73.0 | 78.0 | 68.0 |
| SWE-agent | 47.5 | 63.0 | 32.0 |
| Codex CLI(人设) | 79.0 | 83.0 | 75.0 |
| MemoHarness | 70.5 | 77.0 | 64.0 |
| MetaHarness | 73.5 | 79.0 | 68.0 |
| 最强固定原语(Environment-capability Runner) | 76.0 | 79.0 | 73.0 |
| 随机 composer | 73.3 | 78.0 | 68.6 |
| STITCH | 80.5 | 85.0 | 76.0 |
Terminal-Bench 2(45 题):STITCH 72.2% vs Mini-SWE 60.0 / Codex CLI 56.7 / MetaHarness 55.6(+12.2pp);Pass@2 66.7 vs 51.1。
四个关键对照支撑理论命题:
- 随机 composer ≈ 固定原语均值(73.3 vs 固定单原语 71.5–76.0 的均值)——说明 composer 的选择携带信息,收益不是「拥有原语」而是「选对原语」,直接支撑 mismatch 命题。
- 性能随库规模单调上升(SWE 75.0→80.5、TB 62.2→72.2)——库越大适配空间越大,「原语库」是一个可扩展资产而非固定技巧集。
- 激活率 100%(六原语被选中率 8.6%–37.1% 不等但激活率全部 100%)——确定性编译消除了命题 2 的 (1−ε)^k 风险,且原语真的在执行中生效。composer 的选择模式稀疏:约半数任务选 0 个原语(保留种子)、多数选 1 个、少数多原语组合。
- 开销 2.7%(638 倍效率)——组装成本仅 actor 单次尝试的 2.7%(TB)/4.3%(SWE);对比「即使假设一个 oracle 编码 Agent 直接吐出有效代码不调试」,从零生成也要 17.23–23.35 倍 actor 成本。任务自适应的边际成本被压到近零。
跨模型跨域泛化:3 个域外 actor(GPT-5.6-Terra 86.5、DeepSeek-V4-Flash 91.5、Claude-4.5-Haiku 74.0)上 STITCH 全部第一(平均 84.0 vs 种子 75.2)——原语是「通用控制机制」而非对开发期 actor 弱点的过拟合;跨域(SWE↔TB 互用对方原语)虽低于同域但相对种子仍 +11.1pp(TB 上 71.1 vs 60.0)。
子组结构(TB2):easy 100% / medium 81.0 / hard 46.2——medium 上 State Guard 最强(77.6)、hard 上 Execution Supervisor 最强(46.2),STITCH 同时吃到两者(81.0/46.2);不同原语在不同 repo/难度各有优势域,正是 scope 条件化的实证。
5.3 Turbo Harness:七基准+效率 Pareto+双消融
指标体系:任务指标(ALFWorld 成功率/ScienceWorld 均分/DBBench 准确率/WebShop Success@1/SWE 双基准 pass 率/TB2.1 通过率);效率指标(步数/美元成本/token);消融指标(RL 与 playbook 的因子拆解、编辑器规模梯度);可靠性指标(三跑全解的实例数)。
Agentic 四基准(Qwen3.5-9B 执行器):
| 方法 | ALFWorld | ScienceWorld | DBBench | WebShop | 平均 |
|---|---|---|---|---|---|
| Default | 40.7 | 25.7 | 57.5 | 34.5 | 39.6 |
| ReAct | 60.7 | 26.7 | 55.8 | 33.5 | 44.2 |
| Reflection | 50.0 | 38.2 | 60.8 | 41.0 | 47.5 |
| Harness-R1 | 54.0 | 28.2 | 60.0 | 42.2† | 46.1 |
| Meta-Harness | 60.7 | 35.1 | 65.0 | 40.0 | 50.2 |
| Turbo Harness | 70.7 | 42.4 | 69.2 | 42.0 | 56.1 |
对 Meta-Harness 全面超越(+10.0/+7.3/+4.2/+2.0),对 Harness-R1 三胜一平。
SWE 双基准(关键效率证据):
| 执行模型 | 方法 | SWE-smith-MR pass | 步数 | 成本($) | SWE-V(150题) pass | 步数 | 成本($) |
|---|---|---|---|---|---|---|---|
| Haiku 4.5 | Meta-Harness | 50.7±2.9 | 18.5 | 0.151 | 56.7±2.0 | 18.8 | 0.153 |
| Haiku 4.5 | Turbo | 64.0±1.2 | 17.3 | 0.136 | 59.3±1.4 | 20.4 | 0.179 |
| Gemini 3.7 Flash | Meta-Harness | 70.7±2.4 | 23.1 | 0.310 | 38.4±0.4 | 32.5 | 0.470 |
| Gemini 3.7 Flash | Turbo | 88.0±1.2 | 8.7 | 0.046 | 54.4±2.3 | 25.9 | 0.331 |
三个层次的解读:
- 增益与执行模型剩余空间成正比:Gemini 在 SWE-V 上 Meta-Harness 基线只有 38.4(低),Turbo +16.0 到 54.4;Haiku 已被 Meta-Harness 抬到 56.7(高),Turbo 只 +2.6——实例自适应吃的是全局优化没吃干净的空间头,全局越弱实例级越有得赚。
- 既准又省:Gemini/SWE-smith 上步数 23.1→8.7、成本 0.310→0.046(约 6.7 倍降低)——实例补丁把执行模型引到更短路径;GEPA(45.9)与 ACE(44.3)平均都够不到 Meta-Harness(54.1)更够不到 Turbo(66.4),证明「Harness 工程 > 上下文工程」的搜索空间差异。
- TB2.1(最难的测试):Meta-Harness 在这个人机混合强 Harness 林立的基准上不敌人工(50.5 vs Terminus-Kira 52.3)——但 Turbo 55.5 反超所有人,且五次运行均值全部第一、turns/cost/tokens 全部低于所有竞品级 Harness——位于精度-成本 Pareto 前沿(最准且比它准的没有、比它便宜的 OpenHands 47.3 不准)。
消融一:RL 与 playbook 缺一不可(SWE-smith-MR,Haiku)。Meta-Harness 50.7 为对照:未训 9B 编辑器无 playbook 51.3(≈噪声);未训 9B + playbook 50.0(光给小模型 playbook 没用);RL 训练但无 playbook 49.3(光训 RL 没有经验也没用);RL + playbook = 64.0(+14.7)——收益来自二者的乘法:RL 学会的是「检索+应用」playbook 的能力。
消融二:更强编辑器利用 playbook 更好,RL 让 9B 追平 Opus。固定 playbook 换编辑器:未训 9B 50.0 → Sonnet-4.5 55.3 → Opus-4.6 61.3(能力越强越会用经验)→ RL-9B 64.0 追平并超过 Opus-4.6——外层搜索档案里的策略本身够用,缺的只是让小模型学会用它们的训练。
可靠性:SWE-smith 上三跑全解实例数 Haiku 20→28/50、Gemini 26→42/50,Gemini 下「只解一次」的实例 18→3——不只是平均分涨,逐实例的确定性也涨了。
定性案例(补丁到底改了什么):Jinja2 回归 bug 注入「先查 git 历史」步骤(3/3 全解)而 arrow 库逻辑错误不注入(同一 H* 不同实例不同补丁);django-13315 上放宽「立即提交」门控换探索预算(1/3→3/3);gunicorn 上改的是可执行控制代码而非提示词(验证门控提前两步触发+编辑检测器学会识别 append 重定向,0/3→3/3);TB2.1 上「强制工具调用」这个旋钮在 chess-best-move 上全局最优、在 extract-elf 上是反模式(全局强制全_suite 回退 6.7%)——同一旋钮不同实例相反最优值,全局 Harness 原理上无法同时满足,这就是实例自适应的存在性证明。
六、效果优势的根源解释
6.1 根源机制与证据链(三篇合并)
Mid-Harness 的因果链:
- 同历史候选集天然含可用替代动作——论文实验支持(前沿验证器 68.03% 上界直接证明:不改生成器,光换验证就 +18pp)。
- 弱验证器无法区分候选(listwise 一次看全部时区分度崩溃)——论文实验支持(N=4→8 仅 +1.7pp;first-runnable 无验证甚至为负)。
- Pairwise 给验证器共享参照物,把「绝对评分」简化为「相对比较」——论文实验支持(同模型同 N=8:listwise 51.02 / pointwise 52.38 / pairwise 54.76);外部支持:LLM-as-a-Verifier、V1 等工作在数学/代码域同样发现 pairwise+锦标赛优于绝对打分(方法相似+结论相近的跨域印证)。
- 蒸馏把教师的比较判断力部分迁移给同规模模型——论文实验支持(一致率 59.01→74.58、MAE 2.59→1.05、Pass@1 +2.38);知识蒸馏文献(Kim & Rush 等)的长程印证。
- 动作级与轨迹级缩放作用于不同的失败模式(步内选错 vs 轨迹级运气),故可乘法组合——论文实验支持(组合 +11.23pp 且环境执行数不变;SR 加轮平台化而组合突破)。
STITCH 的因果链:
- 机制效用任务条件(scope 内正、scope 外负)——论文实验支持(固定单原语各有优势域:Contract-case Explorer 强在 SymPy、Environment-capability Runner 强在 Django、State Guard 强在 TB-medium、Execution Supervisor 强在 TB-hard)+理论(命题 1:固定选择的期望损失 Γ>0)。
- 现场生成代码的失效随机制数指数复合——理论(命题 2:(1−ε)^k)+领域经验共识(代码生成脆弱性是 JIT-Agent/TTHE 一线公认痛点)。
- 选择与实现分离同时规避两者——论文实验支持:composer 做设计级选择规避 Γ(随机 composer=均值 vs STITCH 超最强固定原语 4.5/5.5pp 证明选择有信息量)、预验证原语+确定性编译规避 (1−ε)^k(激活率 100%)。
- 原语是通用控制机制而非模型特调——论文实验支持(3 个域外 actor 全部第一、跨域原语仍 +11.1pp)。
Turbo Harness 的因果链:
- 不同实例受益于不同 Harness 策略(实例异质性)——论文实验支持(同一「强制工具调用」旋钮两实例相反最优;同一 H* 两实例相反补丁双双 3/3)。
- 全局 Harness 留下实例级空间头——论文实验支持(增益与 Meta-Harness 基线负相关:Gemini 低基线 +16~17pp、Haiku 高基线 +2.6pp)。
- 外层搜索档案中已含实例级信号(此前被丢弃)——论文论证+消融支持(playbook 单独没用、RL 单独没用、合起来 +14.7pp——信号在 playbook 里、用它的能力在 RL 里)。
- 编辑器只调一次故推理开销近零——构造事实(且补丁常缩短执行路径:步数 23.1→8.7、成本 6.7 倍降)。
6.2 相关工作检索与对照
围绕三篇论文的关键机制,本次检索/阅读范围内发现的外部对照(检索时间 2026-10-02,覆盖论文原文引用与同批 11 篇 Harness 论文交叉验证):
| 研究(可核验链接) | 相似尝试 | 相关结论 | 与本文的差异/边界 | 对根源解释的影响 |
|---|---|---|---|---|
| LLM-as-a-Verifier, Kwok 等 | 轨迹级概率 pivot 锦标赛验证 | 验证器+锦标赛在轨迹级有效;其 per-step 候选验证是 Mid-Harness pairwise 锦标赛的方法来源 | 作用于完整轨迹而非动作;Mid-Harness 系统下沉到步级 | 方法相似+结论相近:独立工作在不同粒度确认「比较式验证+锦标赛」优于绝对打分 |
| Guided Search(非串行环境), Zainullina 等, ICML 2025 | 动作排序 critic + 轨迹选择(SWE 域) | 训练的 critic 排序候选动作能提升 SWE 成功率 | 单一机制无机制对比、无蒸馏分析;Mid-Harness 是机制学+成本模型+组合的系统研究 | 方法相似:支持「动作级验证有油水」的前提;Mid-Harness 补上「何时为何有效」 |
| V1, Singh 等 | 生成-自验证统一(pairwise,数学/代码) | pairwise 自验证与并行推理器的兼容性 | 推理任务(候选间无环境耦合);Mid-Harness 处理动作改变环境的设定 | 结论相近(跨域):支持「pairwise 给共享参照物」机制,但任务设定不同不能直接因果化 |
| Meta-Harness, Lee 等 | 外层程序搜索全局 Harness | 全局优化相对固定基线普遍有效 | 产出单一全局 Harness;是三篇共同的基线/上游 | 基线关系:其存在既是三篇的起点(Turbo 直接回收其档案),也暴露全局选择的失配 |
| JIT-Agent, Zhang 等(并发) | 实例级 Harness 现场生成 | 任务自适应方向与 Turbo/STITCH 一致 | 从零生成完整 Harness(教师蒸馏+进化 RL);Turbo 补丁式+回收副产物,STITCH 原语选择式 | 方法相似、路线分野:三者共同确认实例/任务自适应是真实空间,但实现谱系三分(生成/补丁/组装) |
| ACE, Zhang 等, ICLR 2026 | playbook 式经验沉淀(上下文工程) | 显式策略库(含反模式)可迁移可累积 | 作用于提示/上下文而非可执行 Harness;Turbo 把 playbook 用作 RL 编辑器的条件 | 方法迁移:Turbo 证明 playbook 范式可从上下文域迁移到 Harness 域 |
| Malena(Apple+EPFL,同批 2609.40303) | 强模型下复杂 Harness 机制的逆向消融 | 强编码 Agent 下复杂搜索/记忆/多智能体机制收益趋零 | 消融的是「统一机制的加减法」,未覆盖实例/任务自适应轴与成本-精度前沿 | 表面张力、实质互补:Malena 的负结果与三篇的正增益在「自适应轴」上调和——增益恰恰来自 Malena 未测的条件化激活 |
| AgentSquare / ADAS, Hu & Clune 谱系 | 模块化 Agent 设计空间搜索 | 组合优于整体设计 | 搜索发生在离线设计期;STITCH 把组合搬到测试时每任务一次 | 结论相近(时点不同):支持「组合式设计空间 > 单体设计」,STITCH 补测试时条件化 |
检索范围的诚实说明:(1)「动作级采样+验证」在终端 Agent 域,本次检索范围内 Mid-Harness 是首个系统研究,Zainullina 等在 SWE 域有最近邻但设定更窄——不能断言不存在更早工作;(2)STITCH 的「scope+contract 原语库+确定性编译」组合在 Harness 文献中未检索到前例,但「预验证组件+确定性组装」在编译器/软件工程(链接期 vs 运行期检查)是古老思想,STITCH 的贡献是把它引入 Harness 工程并配了理论;(3)Turbo 的「回收搜索副产物训练下游编辑器」未见直接先例(ACE 回收的是运行经验而非搜索档案),JIT-Agent/Harness-R1 为最近邻;(4)未发现直接反驳「验证支配采样收益」「固定选择有理论失配下界」「实例级存在空间头」三个核心命题的外部反例——最接近的限定来自 Malena(同批论文:统一机制加减在强模型下收益趋零),但它恰恰不覆盖三篇的条件化轴。
6.3 综合判断与未决问题
多研究共同支持的机制:(1)比较式验证(pairwise/锦标赛)优于绝对打分——Mid-Harness、LLM-as-a-Verifier、V1 三方在动作/轨迹/推理三个粒度一致;(2)机制效用是条件化的、固定选择次优——STITCH 的理论命题+子组实验、Turbo 的「同一旋钮相反最优」案例、(同批评审中)Adaptive-GEPA 的路由谱系三方互证;(3)测试时自适应的边际成本可以被压到近零——STITCH 的 2.7%(选择编译)、Turbo 的单次 9B 调用,与 JIT-Agent 式现场生成的 17–23 倍成本形成数量级对照。
仍属推测的部分:(1)Mid-Harness 的「蒸馏后失败 67.4% 集中在命令语义/可行性」是对教师分歧的分类学观察,「世界模型能否解决」是作者建议而非验证的假设(阅读者标注:推测);(2)STITCH 命题的加性效用假设抽象掉了原语间交互——多原语组合的真实协同/冲突(附录 F 显示多数任务只选 1 个原语)未被理论刻画;(3)Turbo 的增益依赖外层搜索档案的质量与多样性(作者自认的局限:若原始搜索只探索了弱策略,playbook 无物可回收);编辑器训练需要额外环境 rollout,成本未被完整记账。
适用条件与失效条件:Mid-Harness——弱验证器+窄采样是死局(先投资验证再谈宽度);N=8 以上的采样收益未测饱和;环境需可恢复单实例。STITCH——需要开发集失败轨迹来挖原语(冷启动成本);原语库覆盖不到的新失败模式无能为力。Turbo——全局 Harness 越完善、实例空间头越小(Haiku 仅 +2.6);执行模型太弱时补丁也救不动。共同失效边界:模型能力快速提升会压缩所有 Harness 轴的收益空间(Malena 的警示),三篇的增益数字都是「当下模型能力切片」上的测量。
七、必要知识反推
假设让一个没有背景的人重做这三项工作,最少需要知道什么?
7.1 领域知识层
- 终端 Agent 的三层架构与「动作改变环境」的耦合(三篇共用):不知道「每步命令污染后续状态」,就不会理解动作验证必须在执行前、Harness 失配的代价被长程放大。
- 测试时算力扩展的既有谱系(Mid-Harness):Best-of-T、SR、Self-Consistency、PRM——不知道「采样-验证-聚合」的成熟范式,无法把动作级放进坐标系并论证其正交性。
- Harness 优化内外循环的解剖(Turbo):Meta-Harness 怎么跑(外层提候选、内层评估、档案怎么积累)——不知道「废气」的成分就无从回收。
- SWE/终端基准的评估协议细节(三篇共用):Pass@k 语义、提交才算数、步数/成本上限——这些决定数字可比性的工程约定,是实验设计的地基。
7.2 方法论知识层
- 受控变量分解的实验设计(Mid-Harness):固定生成器与 Harness、只动「验证」这一个旋钮,用前沿验证器做覆盖上界探针——「用 oracle 探测机会、用消融回收机会」的两段式方法论。
- 简化理论模型+命题证明(STITCH):把 Harness 形式化为激活向量+加性效用,两个命题(mismatch gap、指数衰减)都来自教科书级假设——「理论不必精确、只需隔离出结构性事实」的品味。
- GRPO 与奖励防篡改设计(Turbo):组内相对优势、KL 锚定;更关键的是「在编辑器生成的代码之外计算奖励」的对抗性思维——不知道 reward hacking 就会训出一个会作弊的编辑器。
- 机制 vs 能力的因子拆解(Turbo 消融):RL 与 playbook 的 2×2 拆解、编辑器规模梯度——把「收益来自数据还是能力」这一模糊问题变成可测量对象。
7.3 工程知识层
- 模型调用包装层的实现模式(Mid-Harness):Mid-Harness 全部逻辑是三行伪代码级的包装层替换——「不动权重不动 Harness」的部署哲学是它能被产品化的原因。
- 确定性编译器与回退兜底(STITCH):合法性校验清单(支持基元/兼容/连接/可终止/有界循环)+ 失败回退种子——测试时系统必须有「永不比不用它更糟」的保底。
- playbook 蒸馏的三阶段管线(Turbo):抽取(含对比性实例的 diff 定位)→反思(置信度过滤)→收敛(反模式标记)——把 TB2.1 的海量档案压进 6 策略+9 反模式的可放入上下文的尺寸。
- 成本记账(三篇共用):POT、参考定价美元、组装开销倍数、执行步数——每一篇都有独立的成本轴,没有成本核算的缩放研究在 2026 年已不可发表。
7.4 知识融合的关键节点
三篇论文的「化学反应」分别发生在:
- Mid-Harness 的节点:「验证是与采样正交的独立资源」——以往「多采样」被当作单一旋钮,论文把它拆成采样宽度×验证能力两个因子,发现瓶颈几乎全在后者。这是「把复合变量拆开」的经典科学动作。
- STITCH 的节点:「选择的不完美可以容忍,实现的不完美不能」——命题 1 允许 composer 有选择损失(只要小于 Γ),命题 2 不允许生成有失效概率。两个命题合起来恰好论证了「LLM 做选择、编译器做实现」的分工——理论直接产出架构。
- Turbo Harness 的节点:「搜索的副产品是资产而非垃圾」——外层搜索为了找全局最优而产生的「哪个策略在哪种实例上成/败」信息,恰好是实例自适应所需的监督信号。一次付费、两次使用。
- 三篇共用的元节点:「缩放轴的发现先于缩放的投资」——与其在已知的轴(更多轨迹、更大模型)上加倍投入,先测绘还有哪些正交轴(动作、原语、实例)。识别轴的方法是问「当前优化的单位是什么,比它更细/更粗的粒度上还有没有空间」。
八、论文中可以提取的通用性灵感
灵感一:把复合旋钮拆成独立因子,瓶颈几乎总在其中一个
核心思想:一个看似单一的能力(如「多采样」)往往是多个独立资源(采样宽度×验证能力)的乘积;拆开后加宽弱因子收益近零,强化强因子立即解锁。
论文证据:Mid-Harness 中 listwise N=4→8 仅 +1.7pp(验证是瓶颈),同一机制换前沿验证器 +14pp(候选覆盖早已充足),pairwise 机制再 +3.7pp(参照物是第二瓶颈)。
推广场景:(1)推荐系统的「召回×排序」两段——召回不足时优化排序模型无意义;(2)数据库的「索引×优化器」;(3)招聘漏斗「候选人供给×面试官鉴别力」;(4)科研的「数据采集×数据分析」——仪器灵敏度往往先于算法成为瓶颈。
灵感二:机制效用是条件化的——固定启用/禁用都有不可消除的代价
核心思想:当一个组件在其适用范围内有正效用、范围外有惩罚时,任何「总是开」或「总是关」的全局决策都有严格为正的期望损失(损失=min(范围内容得, 范围外罚得));条件化激活是唯一逃逸方式。
论文证据:STITCH 命题 1 的闭式下界 Γ = Σ min(μᵢūᵢ, (1−μᵢ)c̄ᵢ) > 0;实证上固定单原语各有优势域而 STITCH 组合超最强固定原语 4.5–5.5pp;Turbo 的「强制工具调用」旋钮在两个任务上相反最优。
推广场景:(1)微服务按流量特征动态启停重试/熔断;(2)数据库优化器的 per-query 计划选择 vs 固定计划;(3)医学上「平均有效」的疗法按生物标志物分层(精准医疗的数学本质);(4)组织流程按任务类型裁剪审批链。
灵感三:选择可以不完美,实现必须可靠——关注点分离的质量不对称
核心思想:把「决定做什么」(可容忍错误、可回退)与「怎么做」(错误代价指数放大)分给不同性质的系统——前者交给灵活但不可靠的 LLM,后者交给死板但确定的编译器。
论文证据:STITCH 的 composer 只输出设计级 intent(错了回退种子 Harness,损失有界);确定性编译器保证 100% 激活率;对比现场生成代码 (1−ε)^k 的指数失效。
推广场景:(1)自动驾驶「规划(可回退)与控制(必须硬实时确定)」分层;(2)CI 里「AI 选择测试子集(漏了可补跑)与确定性执行」;(3)法律领域「AI 检索判例(可人工复核)与法条适用的确定性推理」;(4)金融「AI 选股信号与确定性风控执行」。
灵感四:优化过程的副产品是资产——为副产品设计回收路径
核心思想:任何昂贵的搜索/优化过程(为了找到好解)都会沿途产生大量「何者在何时有效」的信息;这些信息对原目标(全局最优解)是冗余的、对次级目标(条件化决策、经验迁移)是核心资产——值得为它设计显式的蒸馏与存储管线。
论文证据:Turbo Harness 把 Meta-Harness 搜索档案蒸馏成 playbook,RL+playbook 消融 +14.7pp,而二者单独皆无效;编辑器学到的「检索+应用」能力使 9B 追平 Opus-4.6。
推广场景:(1)AutoML 试验档案训练「按数据集特征推荐超参」的元学习器;(2)A/B 测试平台沉淀「何类干预对何类人群有效」的策略库;(3)临床试错记录的副作用知识挖掘(药物再定位);(4)围棋 AI 自对弈棋谱反哺人类定式库;(5)公司并购尽调档案的「交易类型×整合策略」经验库。
灵感五:上界探针方法论——用 oracle 测机会再用蒸馏回收
核心思想:没有地面真值时,用最强可用组件做「机会上界」探针(证明提升空间存在),再用蒸馏/训练把回收率尽可能推向上界——把「值不值得做」与「怎么做到」分成两个独立实验。
论文证据:Mid-Harness 先用 GPT-5.6 Sol 证明 68.03% 的覆盖上界(+18pp 机会),再用 117k 蒸馏数据回收 57.14%(回收约 40% 的差距),并用离线一致率(74.58%)诊断剩余差距的成分(67.4% 在命令语义/可行性)。
推广场景:(1)推荐系统先用人工编辑测个性化上界,再训练模型逼近;(2)编译器用超级优化器(指数搜索)标注小样本训练学习型启发式;(3)销售团队先测「完美话术」转化上界再批量培训;(4)医疗 AI 用专家共识测诊断上界,量化辅助决策的回收空间。
灵感六:补丁优于重写——增量适配的系统更易部署也更稳健
核心思想:对已有良好全局解的系统,逐实例/逐场景的适配应做成对全局解的最小编辑(补丁)而非从零重构——补丁继承全局解的大部分正确性、失败时可回退、编辑器需要学的策略空间也小得多。
论文证据:Turbo Harness 的 9B 编辑器只打补丁即追平 Opus-4.6 从零编辑;补丁失败回退 H* 的设计使系统下界=全局 Harness;对比 JIT-Agent 从零生成需教师蒸馏+进化 RL 的重装备。
推广场景:(1)特征开关/配置补丁优于为每客户 fork 代码库;(2)LoRA 等参数高效微调对全参数重训;(3)城市更新中的「织补式改造」对大拆大建;(4)法体系的判例修补对法典重写;(5)个人知识管理的卡片增量修订对笔记体系推倒重来。
附录:三篇论文对照速览
| 维度 | Mid-Harness | STITCH | Turbo Harness |
|---|---|---|---|
| 缩放轴 | 动作级(步内候选) | 原语级(机制选择) | 实例级(Harness 补丁) |
| 发生时点 | 每步动作执行前 | 每任务首个请求前 | 每实例单次编辑器调用 |
| 核心机制 | 采样 N 候选+pairwise 验证(可选蒸馏) | composer 选原语+确定性编译 | playbook 条件+GRPO 编辑器打补丁 |
| 理论贡献 | 验证支配采样收益的实证规律 | mismatch gap+指数衰减两命题 | 实例自适应问题形式化 |
| 代表数字 | TBLite 50.00→68.03%;组合 66.33% | SWE-V 80.5%、开销 2.7%、激活 100% | SWE-V 38.4→54.4%、6.7× 成本降 |
| 额外语料 | 117k 蒸馏偏好对 | 11 个带 scope/contract 原语 | 6 策略+9 反模式 playbook |
| 与轨迹级关系 | 正交可组合(+11.23pp) | —(作用于 Harness 结构) | 常缩短执行路径(23.1→8.7 步) |
| 开放难题 | 命令语义/可行性验证(占失败 67.4%) | 原语间交互未理论化 | 依赖外层搜索档案质量 |
| 机构 | NVIDIA+KAIST | UIUC+UMich | Rutgers+Red Hat AI+MIT-IBM |