Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 精读

论文链接:arXiv:2608.20169 代码仓库:Agent4Science-UTokyo/Task-CoEvolve 发表时间:2026年8月 机构:东京大学(Atsuyuki Miyai / Kiyoharu Aizawa / Toshihiko Yamasaki)——纯高校研究 领域标签:cs.AI / cs.SE(LLM Agent 效率优化)

一、论文背景

自动 harness 优化是什么? AutoSaddler(同日精读)、Meta-Harness、GEPA 等系统让一个"元 Agent"迭代改写模型外围代码(提示词/工具定义),每轮改完都要在验证任务集上评估"新版是否更好"。评估是整个循环中最贵的环节:GAIA2 一个任务要跑几十次工具调用、Terminal-Bench 全量 89 个任务每次评估要数小时与数亿 token——评估成本是 harness 优化的第一瓶颈。

被忽视的自由度:所有系统都在优化"改什么"(patch 策略),没有人优化"在哪评"——默认每次在同一个固定验证集(或随机子集)上评。但直觉告诉我们:模型已经全对的任务、模型永远做不出的任务,对"区分两个候选 harness"毫无信息量——在它们身上花预算是纯浪费。

统计学的老朋友:这个问题在统计学里有成熟对应——实验设计中的判别性采样与 survey 抽样中的无偏估计。本文的贡献是把这两个工具正确地搬到 harness 优化的动态环境里。

二、论文定位和关联工作

  • AutoSaddler(同日精读):优化"怎么改 harness"——本文优化"怎么评估",两者正交可叠加。
  • Meta-Harness / GEPA:评估侧用固定集或随机重采样——本文证明固定子集过拟合、均匀重采样浪费,判别性采样+无偏估计是更优解。
  • 主动学习/实验设计:方差最大化的样本选择是经典思想——本文的新意在"任务池的判别力分布会随优化进程漂移"(全对任务从 34 个涨到 58 个),采样必须自适应。

三、问题定义

抽象问题:迭代优化循环中,每轮以预算 ρ 采样任务子集评估候选,如何 (1) 选出判别力最大的任务(使排序决策的出错率最低);(2) 使子集上的分数与全量分数可比(跨迭代趋势不因采样而失真)?

四、问题解法

4.1 方差加权采样

按任务历史成功率的 Bernoulli 方差 p̄(1-p̄) 加权采样——成功率接近 0.5 的任务(候选们时对时错)方差最大、判别力最强;全对(p̄≈1)或全错(p̄≈0)方差趋零。两个补丁:从未解出任务的 floor ℓ=0.125(防止把"暂时全错但可解"的任务饿死);少观测任务的奖励 λ/√n(探索)。

4.2 采样感知的全量分数估计

子集分数天然有偏(选了难任务分数就低)。用 Horvitz-Thompson 式包含概率校正:每个任务的纳入概率已知(来自采样权重),据此把子集分数还原为全量的无偏估计。按任务池结构自动选择:成功率两极时用 Hájek 估计器(方差更稳),接近 0.5 时用锚定差分估计器。

五、评估指标与实验证据

在线文本分类(USPTO/S2D/Law 三数据集,N=130 验证样本):

预算 ρTask-CoEvolve全量搜索Naive 固定子集
20%49.3±0.8%48.6±0.8%47.2%
7%47.6±0.9%48.6%(1/16 样本逼近)45.5%

20% 预算反超全量——这不是噪声:全量搜索对固定验证集过拟合(每轮都在同一批任务上选优,选中"harness 恰好擅长这批任务"的解),换样本评估反而降低过拟合风险。

Terminal-Bench 2.1(全 89 任务):GPT-5.6 Luna 通过率 61.8%(全量 62.9%)——仅差约 1 个任务;评估成本:输入 token 2888M→579M(-80%)、22.2h→11.5h;Qwen3.6-35B 741M→246M(-67%)。

消融(组件各自贡献):Naive 47.2 → +重采样 48.2(解决固定子集过拟合)→ +全量估计 48.8(跨迭代可比)→ +方差加权 49.3(判别力集中)——三组件层层递进各 +0.5~1.0pp;Terminal-Bench 上比 Random-Resample 高 3.3pp。

判别力漂移的实证:优化进程中全对任务从 34 个涨到 58 个(任务池越来越两极化)——静态采样策略必然过时,自适应是必要的。

六、效果优势的根源解释

固定子集为什么输:每轮在同一批任务上选优 = 对这批任务过拟合(harness 进化方向被验证集形状绑架)。 均匀重采样为什么也输:>70% 的任务池在两极(无判别力),均匀采样把大部分预算撒在注定无信息的任务上。 方差加权为什么赢:预算集中在 p̄≈0.5 的"能力前沿"任务——正是候选 harness 表现分化的地带;floor 机制保住潜在可解任务(今天的全错可能是 harness 的锅而非任务的锅)。 为什么 20% 能反超全量:全量评估每轮给优化器的"选择压力"过强(在 89 个任务上全部优化=过拟合训练集),采样评估的噪声反而起了正则化作用——与机器学习中"小批量优于全批量"的直觉同构。

七、必要知识反推

  • 方法论知识层:Bernoulli 方差与 Fisher 信息(判别力的统计定义);Horvitz-Thompson/Hájek 估计(survey sampling 标配);重要性采样与探索-利用平衡(λ/√n 是 UCB 式设计)。
  • 领域知识层:harness 优化循环的评估瓶颈量化(token/时间成本模型);任务池难度分布的动态性。
  • 工程知识层:任务成功率的历史统计维护;包含概率的在线记录。

知识融合的关键节点:识别出"harness 优化中的任务选择"在数学上就是"实验设计中的判别性采样"——一旦建立了这个同构,统计学的全部工具箱(方差最大化、无偏估计、自适应设计)即刻可用。跨领域问题的解常常是旧领域工具的正确移植。

八、论文中可以提取的通用性灵感

  1. 评估资源要集中在"能力前沿",两极任务是浪费(机制类)

    • 证据:>70% 任务无判别力;方差加权 +0.5~3.3pp。
    • 推广:教育测验(全对/全错的题目区分度为零,好试卷要有区分度曲线)、面试设计(问题难度应落在候选人能力边缘)、健身训练(在能力边缘加负荷才进步,太轻太重都无效)。
  2. 每次都在同一基准上选优 = 对基准过拟合(方法论类)

    • 证据:20% 采样预算反超全量搜索(49.3 vs 48.6)。
    • 推广:模型选型(总在同一验证集上挑模型会挑到"验证集特化"模型)、供应商招标(同一套指标反复招标会养出指标特化型供应商)、个人成长(总用同一标准衡量自己会优化那个标准而非真实能力)——定期换评估样本是解毒剂。
  3. 子集分数必须做纳入概率校正才可比(方法论类)

    • 证据:HT 校正贡献 +0.6pp 且使跨迭代趋势不失真。
    • 推广:任何抽样评估(A/B 测试的分层抽样、抽检质检、绩效考核的样本评选)——如果抽样不是随机的(你有意挑了难样本),直接平均必然有偏,必须按抽样概率加权还原。
  4. 优化循环里每个环节都是优化变量(范式类)

    • 证据:不动"怎么改 harness"、只优化"怎么评估"就拿到 -80% 成本。
    • 推广:机器学习流水线(数据选择/评估频率都是可优化对象)、科研管理(评审资源的分配本身值得研究如何分配)、创业迭代(验证环节的 MVP 设计比开发速度更常成为瓶颈)。