论文链接:Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 代码仓库:Agent4Science-UTokyo/Task-CoEvolve(论文声明将开源) 发表时间:2026年8月 机构:东京大学(Atsuyuki Miyai、Kiyoharu Aizawa、Toshihiko Yamasaki;后两位为共同指导) 领域标签:cs.CL / Agent Harness 优化 / 评估效率

一、论文背景

1.1 什么是 Harness:模型外面的「调度程序」

一个 LLM Agent 系统的性能不只取决于模型权重,还取决于包裹模型的那层代码——harness。它决定了「存什么、取什么、以什么形式呈现给模型」:系统提示如何组织、检索策略怎么写、记忆如何更新、工具输出如何回填上下文、终端命令之间等多久。你可以把 harness 理解为模型身边的「工作台布局与操作手册」:同一个工人(模型),工具摆放顺序和操作流程不同,产出可以差好几倍。

这个差距不是理论推演。论文引用的数据是:仅改变固定 LLM 外围的 harness,同一基准上的性能差异可达 6 倍(Tian et al., 2026, SWE-bench Mobile)。这也是为什么各大榜单上「模型 + scaffold(如 Codex CLI、Terminus 2、Claude Code)」各自成为独立参赛行——scaffold 的影响大到不能忽略。

1.2 自动化 Harness 优化:让 Agent 改自己的工作台

harness 设计空间巨大,手工迭代昂贵且依赖专家直觉,于是出现了自动化 harness 优化:一个元级 Agent(meta-agent)循环地「提出 harness 修改 → 在验证任务集上评估候选 → 把结果反馈给下一轮」,保留性能提升的改动。代表工作是 Stanford 等提出的 Meta-Harness(Lee et al., 2026, COLM):一个编码 Agent 通过文件系统读取所有先前候选的源码、执行轨迹和分数,提出新候选,每轮消耗最高百万级 token 的诊断信息。

1.3 现有评估策略的两个致命伤:贵且静止

现有工作几乎都采用一种朴素策略:每轮迭代把整个固定验证集全部评估一遍。这有两个问题:

  • 昂贵。长时程终端任务(如 Terminal-Bench 上一个任务要占用沙盒几十分钟)评估一次成本极高,评估开销可能主导整个优化循环的成本。论文给出实数:Terminal-Bench 2.1 上用 GPT-5.6-Luna 做全量搜索,10 轮迭代 890 次试验要烧掉 2,888M 输入 token、117 美元、22.2 小时。
  • 静止。随着 harness 进化,「有区分力」的任务在变化。第 1 轮时一半候选能做对的任务很有信息量;到第 10 轮,所有候选都能做对(或都做不对)的任务仍在消耗预算,却不提供任何排序信号。论文的统计证实了这一点:两个极端(没人解出、几乎人人解出)的任务在池中占比稳定超过 70%,而最有区分力的「约半数解出」任务在文本分类中只占 10%。

于是自然的问题:能不能每轮只评一小撮任务,还能保证搜索质量? 这正是本文的出发点。

二、论文定位和关联工作

本文处于「自动化 harness 优化」谱系中的评估效率分支。按四条脉络梳理:

2.1 谱系一:Agent/Harness 自进化(本文的直接基础)

  • Meta-Harness(Lee et al., 2026):外循环编码 Agent + 完整历史文件系统访问,是本文的直接实验框架。关键区别:Meta-Harness 每轮全量评估验证集,评估成本随验证集大小线性增长;本文把这一成本砍掉 67-80%。
  • 同类进化框架:Harnessing Agentic Evolution(Zhang et al., 2026a)、Observability-driven 进化(Lin et al., 2026)、TTHE 测试时 harness 进化(Nie et al., 2026)、ACE/MCE 上下文工程(Zhang et al., 2026c; Ye et al., 2026)等,均采用「全量验证集每轮评估」模式,同样受评估成本制约。

2.2 谱系二:搜索侧效率优化(正交方向)

DemoEvolve(引入人类示范缓解稀疏反馈)、ShinkaEvolve / TurboEvolve(更高效的候选生成与选择)、HarnessCompass(受限、反馈引导、组件级优化)等都在减少候选数量或提升候选质量上做文章。本文的定位与之正交且可叠加:它减少的是每个候选的评估成本(评多少任务),而非候选数量。

2.3 谱系三:课程学习与自适应任务选择

课程学习按模型当前能力动态选择训练任务,优化的是「学什么」;本文按候选分歧动态选择评估任务,优化的是「评什么」。表面相似,但目标函数完全不同:训练任务提供监督信号更新参数,评估任务决定候选排序方向。

2.4 谱系四:样本高效模型评估

Active Testing(Kossen et al., 2021)用重要性加权从信息量大的测试样本估计模型性能;tinyBenchmarks(Maia Polo et al., 2024)用 IRT 挑 100 个锚点题目把 MMLU 评估成本降 140 倍;AcTracer(2026)做多阶段主动采样。这些工作针对固定模型的一次性评估;本文面对的是不断进化的候选流——任务信息量随搜索进程漂移,且估计器必须跨迭代可比。

2.5 定位总结

维度之前路线本文突破
优化对象harness 代码本身harness 代码 + 用哪些任务评估 harness
效率方向减少候选数(搜索侧)减少每候选评估任务数(评估侧),与前者正交
评估策略固定全量验证集,每轮全评自适应子集采样 + 概率加权全量分数估计
跨轮可比性天然可比(同一集合)通过纳入概率的统计估计恢复可比性
理论工具无Horvitz-Thompson / Hájek 抽样调查估计器(1952/1964)

一句话定位:本文把「验证集」从一个静态常量变成了一个与 harness 共同进化的变量,并给出了让不同迭代之间仍然可比的统计方案。

三、问题定义

3.1 从具体场景到抽象问题

具体场景:harness 搜索每轮要评估新候选,全量评估太贵,想只评子集。

难点在于子集方案的两难:

  • 固定子集 → 元 Agent 会持续偏向恰好命中这批任务的修改,过拟合子集;
  • 每轮重采子集 → 不同子集难度不同,原始子集均分不可比,「这轮 70 分」和「上轮 65 分」可能只是抽到的题难易不同,最终选优无从谈起。

核心洞察:这两个难点可以精确拆成两个独立子问题,分别对应「评什么」和「怎么比」:

  1. 评什么——哪些任务对区分当前这批候选最有信息量?
  2. 怎么比——从不同子集得到的分数,如何换算到同一标尺上?

第二个子问题在统计学里早有现成答案:不等概率抽样下的总体均值估计(Horvitz-Thompson,1952)。

3.2 形式化

  • 固定 LLM + harness $h$;验证任务集 $T=\{1,\dots,N\}$;$x_t(h)\in[0,1]$ 为 $h$ 在任务 $t$ 上 $r$ 次试验的平均成功率。
  • harness 真实性能(全量分数):$S(h)=\frac{1}{N}\sum_{t\in T}x_t(h)$。
  • 元 Agent 每轮提出候选 $h_k$(共 $K$ 轮),目标是在有限评估预算(以任务执行总次数计)下,选出 $S(h)$ 最大的候选。
  • 约束:第 $k$ 轮只在子集 $S_k\subset T$、$|S_k|=m=\lceil\rho N\rceil$ 上评估($\rho$ 为预算比例)。

3.3 这个抽象的精妙之处

问题定义里没有任何关于任务内容或 harness 代码的假设——方法只依赖「历史成功/失败结果序列」这一二值统计量。这意味着它对任意 benchmark、任意 harness 搜索框架都通用,可以插在 Meta-Harness、ShinkaEvolve 等任何进化框架上。同时,「预算按任务执行次数计」的定义把成本核算对准了真正的瓶颈(沙盒执行、API 调用),而不是候选生成这种固定开销。

四、问题解法

Task-CoEvolve 由两个组件 + 一个初始化阶段构成,恰好逐一回应第三节的两个子问题。

4.0 Phase 0:初始化(零额外成本)

搜索开始前,先在全量任务集上评估两个起始 harness(如 zero-shot 与 few-shot)。注意这不是本文方法的额外开销——harness 优化本来就需要起始 harness 作为元 Agent 写第一个候选的底座。妙处在于复用:把这两次全量评估的结果当作每个任务的初始历史记录 $\bar p_t$,于是第一轮采样就有统计可依。

4.1 Phase 1:方差加权任务选择(解决「评什么」)

类比:考试出题人给「一半学生做对、一半做错」的题最高权重——这种题最能分开学生水平;全班都会做或都不会做的题没有区分度。伯努利方差 $\bar p_t(1-\bar p_t)$ 在 $\bar p_t=0.5$ 时最大,恒对/恒错时为零,恰好是这个直觉的数学化。

第 $k$ 轮对任务 $t$ 的采样权重:

$$w_t = \max\left(\bar p_t(1-\bar p_t),\ \ell_t\right) + \frac{\lambda}{\sqrt{n_t}}$$

其中 $\bar p_t$ 是历史成功率均值,$n_t$ 是历史观测次数,$\ell_t$ 对从未被解出的任务取小正常数 $\ell$(否则取 0),$\lambda$ 是小系数。三项各有分工:

项机制解决什么
$\bar p_t(1-\bar p_t)$ 伯努利方差候选分歧越大权重越高把预算推向能力前沿
地板项 $\ell_t$从未解出的任务保留被采到的机会防止「暂时无人解出」被永久排除——harness 进步后它可能变得可解
$\lambda/\sqrt{n_t}$ 探索项观测少的任务权重更高防止任务因早期几次偶然结果被过早判死刑

由于 $\bar p_t$ 随搜索历史更新,采样分布随 harness 进化自动漂移——这就是「任务与 harness 共进化」的含义:候选普遍变强后,原本高方差的「半数解出」任务会被解穿(方差坍缩到 0),预算自动转移到新的前沿任务上。论文超参:$\ell=0.125$、$\lambda=0.025$、蒙特卡洛估计纳入概率 4000 次、历史窗口为全部过去迭代。

4.2 Phase 2:采样感知的全量分数估计(解决「怎么比」)

类比:民意调查里按「被抽中概率的倒数」加权还原全体民意。一个只按 1% 概率抽到的少数派受访者,其意见应代表 100 个同类人——这就是 70 年前抽样调查理论中的 Horvitz-Thompson 逆概率加权思想。

设 $\pi_t=\Pr[t\in S_k]$ 为任务 $t$ 在当前采样设计下的纳入概率(权重经归一化后可蒙特卡洛估计)。论文按任务池结构在两种估计器中选择:

(a)Hájek 估计器(式 3,适用于成功率靠近 0 或 1 的池):

$$\hat S(h)=\frac{\sum_{t\in S_k}x_t(h)/\pi_t}{\sum_{t\in S_k}1/\pi_t}$$

直观理解:分子是「每个被采任务的分数除以其被采概率」(低概率被采中的任务代表更多同类),分母把权重归一。文本分类属于这种情况——Phase 0 时每个数据集内部均值 $\bar p$ 接近 0 或 1(USPTO 0.08、S2D 0.71、LawBench 0.14),极小概率被采到的任务其结果接近池均值,1/π 权重虽大但结果温和,不会失控。

(b)锚定差分估计器(式 4,适用于成功率靠近中间的池):

$$\hat S(h)=\frac{1}{N}\sum_{t\in T}\bar p_t+\frac{1}{N}\sum_{t\in S_k}\frac{x_t(h)-\bar p_t}{\pi_t}$$

为什么需要它:当池均值在 0.5 附近时(Terminal-Bench 2.1:89 任务中约 34 个起始即被全部解出、32 个无人解出,但整体均值约 0.5),若一个「总是被解出」的任务碰巧以极小概率 $\pi_t$ 被采到,Hájek 里的 $x_t/\pi_t$ 项会爆炸性主导估计——论文实录:某 Qwen3.6 运行中 3 任务解出 1 个(原始分 33.3%),Hájek 估计值却冲到 85.9%。差分估计器改为加权「与历史锚点 $\bar p_t$ 的偏差」:锚点在采样前固定,期望下抵消;一个总是被解出的任务即使被采到,$x_t-\bar p_t=0$,不再扰动估计。基准事实(89 任务被两个起始 harness 全解/全不解的分布)支持 Terminal-Bench 用式 4。

估计器选择规则:由 Phase 0 的全量评估统计决定,搜索开始前一次性固定——不是事后挑好看的。

4.3 Phase 3:最终选择

$K$ 轮结束后,选 $\hat S(h)$ 最高的候选为最终 harness;精确并列时取最早迭代的候选(对 baseline 更有利,且与 Meta-Harness 实现一致;由于 $\hat S$ 是连续值,本文方法实际从未并列)。

4.4 全景对比表

组件输入输出作用
Phase 0 全量初始化2 个起始 harness每任务初始 $\bar p_t$、估计器类型零额外成本获得先验
Phase 1 方差加权采样历史 $\bar p_t,n_t$子集 $S_k$、纳入概率 $\pi_t$预算聚焦能力前沿
Phase 2 全量分数估计$S_k$ 上的结果 + $\pi_t$可比分数 $\hat S$跨迭代统一标尺
Phase 3 $\hat S$-max 选择全部候选的 $\hat S$最终 harness无需末轮全量评估

五、评估指标与实验证据

5.1 指标体系

  • 主指标:held-out 测试集准确率(文本分类)/ 89 任务全量 pass rate(Terminal-Bench,沿用「验证即测试」惯例)。衡量「子集搜索找到的最终 harness 是否真的好」。
  • 效率指标:总评估次数(Evals)、输入 token 量、美元成本、墙钟时间。衡量「省了多少」。
  • 消融指标:组件叠加性能(轮换/估计/方差加权)、$\hat S$ 与真实分数的 Spearman 秩相关。衡量「每个组件各贡献多少」。

5.2 实验一:在线文本分类(严格控制变量)

设定:GPT-OSS-120B(温度 0)做分类模型,Claude Opus 4.6 做元 Agent,20 轮迭代 × 3 候选 = 60 候选;三个数据集 LawBench(215 类罪名预测)/ Symptom2Disease(22 类)/ USPTO-50k(180 类化学反应前驱体预测),共 $N=130$ 验证样本、412 测试样本。3 个随机种子。

结果(held-out 准确率,三数据集平均):

方法ρEvalsAvg
Meta-Harness(全量)100%7,80048.6
Naive(固定子集)7%48045.2
Random-Resample7%48047.0
Task-CoEvolve7%48047.6
Naive20%1,56047.2
Random-Resample20%1,56048.2
Task-CoEvolve20%1,56049.3

两个关键读数:ρ=7%(每数据集只评 2-3 个样本!)时以 16 倍少的评估次数逼近全量;ρ=20% 时反超全量 0.7 点——论文的解释是全量搜索存在对验证集的过拟合,更换评估样本反而起正则化作用。这是个重要信号:评估越「省」,未必越差。

5.3 实验二:Terminal-Bench 2.1(真实昂贵场景)

设定:89 个长时程终端任务(修 28 个问题后的 2.1 版),Terminus 2 / Terminus-KIRA 起始 harness,r=1 单次 rollout,10 轮 × 1 候选;GPT-5.6-Luna 与 Qwen3.6-35B-A3B 两个模型(选择它们是因为有优化空间——附录 C 显示 DeepSeek-V4-Flash 从 70.8% 出发搜索后仍是 70.8%,强模型 scaffold 空间太小)。

结果(89 任务 pass rate %):

方法ρGPT-5.6-LunaQwen3.6-35B-A3BAvg
Terminus 2(起始)–52.834.843.8
Meta-Harness(全量)100%62.942.752.8
Naive20%55.139.347.2
Rotation20%59.637.148.4
Task-CoEvolve20%61.841.651.7

20% 预算下均值 51.7 vs 全量 52.8,差距 1.1 点恰好是 89 个任务中的 1 个任务。注意全量搜索在此有天然优势(验证即测试,全量每轮都能看到所有任务),因此「逼近」已很有说服力。

成本(GPT-5.6-Luna):全量 890 次试验 / 2,888M 输入 token / $117 / 22.2h → Task-CoEvolve 180 次 / 579M / $30 / 11.5h,token 降 80%、成本降 74%、时间减半;Qwen3.6 自托管侧 token 降 67%(741M→246M)、时间 38.0h→20.5h。

一个诚实的细节:三种 20% 方法的 token 消耗并不相同——Task-CoEvolve 单次试验平均 3.2M token,与全量相当,而 Random-Resample 只有 0.7M。因为方差加权把预算集中到「多轮长任务」(候选在此分歧大)上,而均匀采样把大量预算花在快速结束的简单任务上。Random-Resample 的 96% token 节省有相当部分是「没测该测的题」——其最终性能比 Task-CoEvolve 低 3.3 点。同预算不同花法,信息量天差地别。

5.4 消融:每个组件各值多少(ρ=20%,文本分类)

配置Avg
Naive 固定子集47.2
+ 每轮随机重采(Rot.)48.2(+1.0,单项最大)
+ 全量估计与 $\hat S$-max 选择(Est.)48.8(+0.6)
+ 方差加权选择(完整方法)49.3(+0.5)

反事实检验:去掉方差加权退回均匀采样掉 0.5 点;去掉概率加权估计退回原始子集分掉 0.6 点;退回固定子集共掉 2.1 点。三个组件缺一不可,且「换着子集评」本身就是最大单项收益——再次印证固定子集过拟合是首要敌人。

5.5 估计器准确性检验

把 60 个候选全部在全量验证集上重评,对照 $\hat S$ 与真实分:ρ=20% 时 Spearman 秩相关 0.62,$\hat S$-max 赢家真实分 51.3(真实最优 54.7,排第 12/60,仍在前 1/5);ρ=7% 时相关仅 0.13(每数据集 2-3 个样本信息太少——瓶颈在样本量而非估计器),但赢家仍排第 10/60(46.4 vs 47.8)。即便排序不完美,也足以避开差候选——这正是搜索需要的性质。

5.6 证据链小结

每条主张都有对应实验:预算大幅缩减(表 3 成本数据)→ 性能保持(表 1/2)→ 组件必要性(表 4 消融)→ 估计器选择规则必要性(附录 A 交换估计器掉 3.3-3.6 点、Hájek 在 TB 上失稳的实例)→ 任务分布漂移的实证(表 5:文本分类中「几乎人人解出」任务从 34 涨到 58,「无人解出」从 74 降到 45)。设计闭合,没有依赖单一数字的孤证。

六、效果优势的根源解释

6.1 Baseline 为什么失败:信息预算的错配

Naive(固定子集)的根源缺陷不是「样本少」,而是反馈信号被固定子集劫持:元 Agent 看到的是「在同样的 2/3/3 个样本上的表现」,搜索方向必然漂向恰好命中这些样本的修改——这是结构性过拟合,与元 Agent 多聪明无关。附录 B 的数据触目惊心:ρ=7% 时 Naive 有 13-16 个候选并列最高分,选择信号几乎饱和失真。Rotation(每轮均匀重采)缓解了过拟合(+1.0),但引入新问题:均匀采样把 >70% 预算花在无区分力的极端任务上,且原始子集分随子集难度波动,跨迭代不可比。

6.2 因果链一:分歧采样——把预算推向信息密度最高处

机制:伯努利方差加权 → 每轮预算集中于「约半数候选解出」的任务(能力前沿)→ 单次评估的平均信息量(对候选排序的期望区分度)大幅提升。

可验证的中间证据:(a) 表 5 显示无区分力任务占 70% 以上,均匀采样忠实继承了这一浪费,方差加权则系统性地绕开它们;(b) Terminal-Bench 上 Task-CoEvolve 单试验 token(3.2M)≈ 全量(3.2M)而远高于均匀重采(0.7M),证明其预算确实集中到长时程、高分歧的难任务上;(c) 同预算下比 Rotation 高 3.3 点(TB)——「评得更准」而非「评得更巧」。

反事实:消融去掉 VWS 掉 0.5 点(49.3→48.8),退回 Naive 掉 2.1 点。

6.3 因果链二:概率加权估计——恢复跨迭代可比性

机制:纳入概率 $\pi_t$ 进入估计 → 不同子集上的分数被换算到「全量期望」标尺 → 第 3 轮与第 17 轮的候选、不同难度子集上的表现可以直接比较 → $\hat S$-max 选择有效。

深层原因:这是抽样调查理论 70 年前的成熟结论——不等概率样本的朴素均值有偏,逆概率加权恢复无偏性。本文的贡献不是发明估计器,而是识别出 harness 搜索的「跨迭代比较」问题在结构上就是一个不等概率抽样估计问题,并按池结构区分 Hájek(极端池,方差可控)与锚定差分(中间池,防爆项)两种形态。附录 A 的交换实验直接验证:文本分类上换用差分估计掉 3.3-3.6 点(小样本下减去锚点抹平候选差异),TB 上换用 Hájek 出现 33.3% → 85.9% 的估计爆炸——估计器与任务池结构匹配本身就是必要设计。

反事实:消融中 Est. 单独贡献 +0.6 点;$\hat S$ 连续性还消除了并列问题(Naive 13-16 个并列 vs 本文 0 个)。

6.4 因果链三:共进化——信息前沿的自动追踪

机制:$\bar p_t$ 由全部历史更新 → 候选普遍解穿旧前沿任务后其方差坍缩、权重自动衰减 → 预算转移到新前沿 → 采样分布与 harness 能力同步漂移。

证据:表 5 中文本分类「几乎人人解出」任务从 34 涨到 58(旧前沿被解穿),TB「无人解出」从 32 降到 21(新任务被攻克);地板项 $\ell$ 保证未被解出的任务不被永久锁死。

6.5 综合回答「为什么不是凑巧好」

三链条分别改造了评估的信息密度(每 token 换来的区分度)、可比性(标尺统一)与适应性(前沿追踪),对应指标提升:分歧采样与共进化 → TB 上超 Rotation 3.3 点;概率加权估计 → 消融 +0.6 点、消除并列失真;三者叠加 → 20% 预算反超全量(全量搜索的验证集过拟合被「换子集」意外缓解,这是论文如实标注的可能解释而非确证)。结构上,只要「候选分歧大的任务更有区分力」与「逆概率加权恢复无偏」两个前提成立,优势就是必然的,不依赖特定 benchmark 的巧合。

七、必要知识反推

假设一个具备通用 ML 能力但对该领域一无所知的人要复现这项工作,最少需要哪些知识?

7.1 领域知识层

  • Harness 的存在与影响量级:必须知道 LLM 系统性能由「权重 + 外围代码」共同决定,且 harness 差异可达 6 倍——否则不会意识到这是一个值得优化的对象。
  • 自动化 harness 优化的循环结构:理解 Meta-Harness 的「提议-评估-反馈」外循环,才能看清成本结构(评估占大头)与切入点评估侧。
  • Benchmark 特性:Terminal-Bench 任务需沙盒执行几十分钟、r=1 rollout、基础设施偶发失败需固定重试规则;文本分类的在线设定(逐样本更新记忆)。不知道这些就无法设计「预算按任务执行次数计」的成本模型。

7.2 方法论知识层

  • 抽样调查理论(本文最关键的跨域知识):Horvitz-Thompson/Hájek 估计器、纳入概率、逆概率加权无偏性。没有这一层,「不同子集分数不可比」只能靠工程 hack(比如每轮全评),无法得到有理论保证的解。
  • 伯努利方差/不确定性与信息量的联系:知道 $\bar p(1-\bar p)$ 在 0.5 处最大,才能把「候选分歧 = 信息」直觉数学化为可计算的采样权重。
  • 探索-利用权衡:$\lambda/\sqrt{n_t}$ 与地板项 $\ell$ 的设计需要 UCB 式的探索直觉——否则小样本偶然结果会永久锁死任务的命运。
  • 相关研究脉络:课程学习(评什么 vs 学什么之辨)、tinyBenchmarks/Active Testing(固定模型 vs 进化候选流之辨)——用于精准定位差异与继承估计思想。

7.3 工程知识层

  • 进化搜索框架的实操:起始 harness 选择(zero-shot/few-shot;Terminus 2/KIRA)、元 Agent 提示、候选数量/迭代数安排、随机种子重复实验。
  • 成本核算:token/美元/墙钟的测量方法、10 路并行下「时间由最长任务决定」的规律(这解释了为何时间只降一半而 token 降 5 倍)。
  • 蒙特卡洛估计纳入概率:权重归一化后 $\pi_t$ 无解析式,需 4000 次模拟估计。

7.4 知识融合的关键节点

真正的创造性不在任何单一知识点,而在两个「连接点」上:

  1. 连接点一:harness 搜索的子集评估 ≈ 不等概率抽样调查。把「跨迭代分数不可比」翻译成「不等概率样本均值有偏」,70 年前的统计工具立刻可用。这是跨域类比产生的化学反应。
  2. 连接点二:候选分歧(伯努利方差)同时充当采样权重与估计锚点。$\bar p_t$ 一份数据两用——决定「评什么」(Phase 1 权重)与稳定「怎么比」(Phase 2 锚点),且因为锚点在采样前固定,期望下自然抵消。两个组件共享同一统计量,方法因此极度简洁(无内容特征、无嵌入模型)。

八、论文中可以提取的通用性灵感

灵感一:优化「评估什么」,而不只是优化「生成什么」

核心思想:搜索循环的成本与质量瓶颈常常在评估侧而非生成侧;把评估对象本身作为可优化变量,是与优化生成器正交且可叠加的效率维度。 论文证据:评估侧方案在 TB 上省 67-80% 成本且性能持平,而所有搜索侧工作(ShinkaEvolve 等)都无法降低单候选评估成本。 推广场景:神经架构搜索中动态挑选最有区分力的验证子集;RL 中按 TD 误差/策略分歧选择评估 episode;prompt 工程中按模型输出分歧挑选测试样例;AutoML 中按候选模型分歧采样数据分片;编译器自动调参中按性能分歧挑 benchmark 子集。

灵感二:分歧即信息——用输出方差定位「能力前沿」

核心思想:一组求解器(模型/策略/候选)输出分歧最大的样本,恰是区分它们的最有效样本;恒对/恒错样本对排序零贡献。 论文证据:表 5 显示 >70% 任务落在无区分力区间;方差加权将预算推向 1/3≤$\bar p$≤2/3 区间后同预算超均匀采样 3.3 点(TB)。 推广场景:主动学习中的 ensemble 分歧采样(query by committee);数据标注中优先标「标注者分歧大」的样本;模型合并/蒸馏中筛选对专家分歧大的 prompt 做 routing;课程学习里把训练集推到「约半数能做对」难度带;评测集设计中主动维护区分度分布。

灵感三:不等概率采样必须配概率感知估计

核心思想:只要样本不是等概率采的,任何「朴素平均」都有偏;把纳入概率显式建模进估计器,才能从有偏采样恢复无偏结论。 论文证据:Hájek/锚定差分估计使不同子集的分数可比(消融 +0.6 点);反例是 TB 上朴素 Hájek 出现 33.3%→85.9% 的估计爆炸,锚定差分修复之。 推广场景:按活跃度采样的日志数据分析(必须 IPW 校正);按难度分层的评测子集报告加权分;RL 离策略评估中的重要性采样;推荐系统按曝光概率校正的选择偏差;Agent 蒙特卡洛树搜索中按访问概率加权回传。

灵感四:估计器要和数据分布结构匹配——没有万能公式

核心思想:同一数学工具在不同分布形态(极端 vs 中间)下稳定性截然不同;选择估计器前先看数据的结构统计量。 论文证据:Phase 0 用两个起始 harness 的全量统计(各池 $\bar p$ 靠 0/1 还是 0.5)一次性决定用式 3 还是式 4,交换则分别掉 3.3-3.6 点或失稳爆炸。 推广场景:长尾分布用中位数/截尾均值而非均值;小样本 A/B 测试用 Welch t 检验而非 z 检验;稀有事件建模用 Pareto/NBD 而非正态;梯度估计中按奖励方差形态选择 baseline。

灵感五:外部统计学的成熟工具是 AI 系统设计的「免费武器库」

核心思想:AI 领域新遇到的许多「不可比/有偏/过拟合」问题,在统计学、抽样调查、实验设计等老学科中早有带保证的答案;跨域搬运的边际收益极高。 论文证据:全文核心机制(HT 1952、Hájek 1964)是教科书级统计工具,搬运后评估成本降 67-80%。 推广场景:用实验设计(DOE)规划 LLM 评测矩阵;用序贯检验控制多臂比较的假阳性;用秩相关(而非均值)比较排行榜;用生存分析处理截断的 agent 运行时间。

灵感六:被评估对象进化时,评估基准要共进化

核心思想:当被比较的对象在持续变强,静态基准会逐渐「被解穿」而失去区分度;让基准(或其采样权重)随对象动态调整,才能维持信号。 论文证据:「几乎人人解出」任务从 34 涨到 58,采样分布随之漂移;地板项保证「暂时无人解出」的任务不被锁死(TB 中 32→21 个被逐步攻克)。 推广场景:教育测评中自适应考试(IRT 动态选题);竞技体育按水平动态匹配对手(Elo 匹配);Benchmark 运营中按饱和度退役/新增题目;安全红队中随防御进化动态生成攻击用例。

附录:发现的 harness 长什么样(两个具体案例)

文本分类(ρ=20% 被选中的候选):用双 tokenizer 检索——对存储样本分别建 word-bigram 与 character-n-gram 两个 TF-IDF 索引,各自排序后用倒数排名融合(reciprocal rank fusion, $s(i)=\frac{1}{k+\text{rank}_{\text{bigram}}}+\frac{1}{k+\text{rank}_{\text{char}}}$),再按融合分数贪心填充 prompt,并对已占多数的标签施加多样性惩罚(除以随同标签数量增长的因子)。有效原因:法律文本的判别信号常在词组(bigram 命中罪名短语),分子式与症状文本的信号在子串-n-gram 更强;单一 tokenizer 只能折中,融合后每种查询都用上更强的那个信号。

Terminal-Bench 2.1(GPT-5.6-Luna 被选中的候选):修改发键后等待策略——原版 agent 发送按键后固定 sleep;进化版区分按键类型:不执行命令的键(如单独 C-c)保持原等待;执行命令的键先短等 0.5s,随后以指数退避轮询终端 pane,当「命令回显出现 + 终端安静 + 末行以 # 或 $ 结尾(shell 提示符回来了)」三条件齐备即提前返回。有效原因:元 Agent 在搜索日志中实测发现固定 sleep 吃掉每任务 1/4-1/3 的时间预算、约 1/5 试验以超时(而非答错)告终;改造后把等待时间省给真正的执行。三条件设计保证 pager、REPL、静默长编译不会被误判为命令结束。

这两个案例值得玩味之处在于:元 Agent 提出修改前先在历史轨迹中量化了浪费(「固定 sleep 占预算 1/4-1/3」是其主动测量所得),这种「先诊断后开方」的模式或许正是 harness 自动进化能超越人类直觉设计的原因之一。


一句话总结:Task-CoEvolve 把 harness 搜索里最贵的一环——评估——变成了一个自适应采样问题,用「分歧即信息」的加权采样决定评什么、用 70 年前的抽样调查估计器决定怎么比,在 Terminal-Bench 2.1 上以 1/5 的评估次数保住了全量搜索的性能。它提醒我们:在 Agentic 时代,不仅模型和代码可以进化,评估本身也应该是进化的。