论文链接:WHALE: A Simple Recipe for Joint Harness–Weight Optimization 代码仓库:github.com/krafton-ai/WHALE 发表时间:2026年8月31日(arXiv:2609.00196v1) 机构:企业+高校合作——KRAFTON(游戏公司,出场景与算力)+ KAIST + Stanford University(Chelsea Finn 组;Yoonho Lee 同时是 Meta-Harness 一作) 领域标签:cs.LG / Agent 优化 / 联合适配


一、论文背景

1.1 Agent 性能的两个半身:权重与 harness

一个部署中的 agent = 模型权重 θ + harness h(决定模型看到什么信息、能执行什么动作、执行结果如何进入后续决策的代码层)。2026 年的共识是:harness 的影响大到不可忽略——同一权重换不同 harness 可以差出两位数百分点。于是当我们要"把一个 agent 往某个任务上特化"时,理论上可以在两个半身上动手术:

  • 改权重:微调(SFT/RLHF/在线拒绝采样微调)——慢、贵,但改变模型的内在能力;
  • 改 harness:优化 prompt、工具编排、上下文管理代码——快、便宜、可回滚,但只在模型已有能力范围内"调度"。

核心困境:这两个半身互为对方的前提。权重更新会改变"哪个 harness 有效"(模型变强后,原来精心设计的检索补救逻辑可能变成累赘);harness 更新会改变"哪些模型能力被暴露出来"(好的 harness 让弱模型也能调用其潜在能力)。单侧优化时,你始终在被冻结的另一半限制——这正是这篇论文要打破的结构性瓶颈。

1.2 已有联合适配方法的局限

近期的 Fast-Slow Training(FST,Tiwari et al. 2026)迈出了第一步:把 prompt/上下文当作"快权重"、模型参数当作"慢权重",交替优化两者。但 FST 的"快权重"只覆盖文本提示空间——而 harness 是完整的可执行代码(上下文管理逻辑、工具编排、错误恢复策略、停止规则),其设计空间远大于 prompt 文本。WHALE 的出发点就是:快权重应该扩展到整个可执行 harness。

1.3 两个技术组件的前身

WHALE 的两个阶段各自有成熟前身,本文的贡献是把它们"焊接"成交替配方:

  • 在线拒绝采样微调(Online RFT):agent 在任务上 rollout,保留成功轨迹做监督微调,迭代进行——比完整 RL 便宜稳定;
  • Meta-Harness(Lee et al. 2026,Stanford IRIS 实验室):一个"用 agent 优化 agent harness"的外循环系统——一个编码 agent(proposer)读取执行轨迹,提出 harness 代码修改,搜索空间是任务特定 harness 的完整代码。

二、论文定位和关联工作

2.1 研究谱系

谱系一:单侧优化。weight-only(SFT/RLHF/RFT 一系)与 harness-only(DSPy 提示编译、GEPA 进化提示优化、Meta-Harness 代码级搜索)。共同盲区:WHALE 的实验证明这两种单侧优化在不同域上各有一个"天花板"——见第三节的 harness-limited/weight-limited 现象。

谱系二:prompt-权重联合优化。FST(快慢权重)与其前身(文本梯度类方法 TextGrad 等)。WHALE 与 FST 的对照是本文最关键的实验:相同的更新方法与调度,仅把搜索空间从 prompt 限制换成完整 harness,就能多拿 4.15–13.00 分——这隔离出"可执行 harness 空间"本身的增量价值。

谱系三:交替/坐标优化方法学。WHALE 的"交替"结构本质是非凸优化的坐标下降在 (θ, h) 空间的实例化;切换时机(固定 vs patience)借鉴了训练中早停/学习率调度的思想。

2.2 定位对比表

维度weight-onlyharness-only(Meta-Harness 等)FST(prompt+权重)WHALE
优化对象θhθ + 文本 promptθ + 完整可执行 harness
两者协同无无交替交替 + 切换时机策略
搜索空间连续参数harness 代码连续 + 离散文本连续 + 离散代码空间
成本特征rollout 密集评测密集混合混合,交错小步更省

定位结论:WHALE 是首个在"权重 × 完整可执行 harness"联合空间上给出系统配方与调度策略的工作,且实验设计专门回答了"联合优化到底比单侧/窄空间联合好在哪、好在多少"。


三、问题定义

3.1 形式化

具体场景:给定任务分布与评估函数,把 agent 系统性能写成 J(θ, h)——权重 θ 与 harness h 的联合函数。目标:找到 (θ*, h*) 最大化 J。

核心洞察:J 对 θ 与 h 各自非凸,且两个变量的最优解互相依赖(θ 变了最优 h 跟着变,反之亦然)。单侧优化是在另一个变量固定处的"切片"上爬山,切片最优 ≠ 联合最优。

抽象:这是坐标下降的非凸版本——交替最小化不保证全局最优,但两个关键经验性问题决定了配方设计:

  1. 切换时机:每次在某个坐标上优化多久?太久会过拟合当前对方坐标(对方一变就白费),太短则没有有效进展——WHALE 用固定时长 (E, I)(每周期 E epoch 权重更新 + I 次 harness 搜索迭代)或自适应 patience 规则(训练信号持续改善就延长当前阶段,最低 0.2 epoch / I=6)来回答;
  2. 两种瓶颈域的存在性:是否存在"harness 已经够好、瓶颈在权重"与"权重已经够好、瓶颈在 harness"两类不同的域?如果存在,交替优化会自动把预算投向瓶颈侧——这解释了它对不同域的自适应性。

3.2 问题的精妙之处

把 harness 显式纳入优化变量,等于承认了"agent 能力 = 模型能力 × 调度效率"的乘积结构:乘积结构下,单侧优化只能改善一个因子,而当另一因子很小时改善收益被压死(木桶效应)。WHALE 的交替优化在机制上等价于轮番补短板。


四、问题解法

4.1 WHALE 主循环

初始化 θ_0, h_0
循环 t = 1, 2, ...:
  Phase A(权重阶段): 在当前 harness h_{t-1} 下跑在线拒绝采样微调
      - agent 用 (θ, h) rollout 任务,收集成功轨迹
      - 用成功轨迹 SFT 更新 θ(持续 E epoch 或 patience 到期)
      → θ_t
  Phase B(harness 阶段): 在更新后模型 θ_t 上跑 Meta-Harness 搜索
      - proposer agent 读执行轨迹,提出 harness 代码修改
      - 在开发任务上评测、择优(I 次迭代或 patience 到期)
      → h_t
直到预算用尽,返回最优 (θ*, h*)

4.2 切换时机的两种策略

  • 固定 (E, I):每周期权重更新 E 个 epoch、harness 搜索 I 次迭代。主实验用 (0.6, 6);
  • 自适应 patience:设最小阶段长度(0.2 epoch / I=6),若训练信号(权重阶段的成功率、harness 阶段的开发分)持续改善则延长该阶段(实测最长延到 1.16 epoch / I=13),信号停滞就切换。这防止了两种浪费:在已经收敛的坐标上空转,以及在对方坐标已变的情况下继续优化过时目标。

4.3 与两段式的区别

“先训完权重再搜 harness"的 stagewise 是常见直觉做法。WHALE 的小步交错(interleaved)在实验中同时胜出准确率与 rollout 成本——机制原因:权重小更新后,harness 搜索立即在新能力分布上进行,不会把大量搜索预算花在"很快就会失效的 harness 设计"上。


五、评估指标与实验证据

5.1 实验设置

  • 模型:Qwen3.5-2B 与 Qwen3.5-4B(开源中小模型——刻意避开前沿大模型以控制成本、隔离方法效应);
  • 三域十测试集:SearchQA(七个搜索问答数据集——harness 需编排检索工具)、数学推理(AIME 2024/2025)、国际象棋题(Lichess puzzle 测试集);
  • 指标:best mean@8 accuracy(每任务 8 次采样取均值的最佳检查点);
  • 基线:weight-only(仅在线 RFT)、harness-only(仅 Meta-Harness 搜索)、FST(同方法同调度但 harness 搜索限制在 system/user prompt)。

5.2 主结果

  • WHALE 比全部单侧基线高 7.67–24.38 个百分点,比 FST 高 4.15–13.00 个百分点;
  • 在全部 10 个测试子集(7 SearchQA + 2 AIME + 1 Lichess)上 WHALE 每一个都是第一——域级优势不是靠个别数据集扛起来的;
  • 消融(Section 6.2):交错式优于两段式(准确率与 rollout 成本同时占优);patience 自适应在两个极端域上都能收敛到接近手工调优的 (E, I)。

5.3 两个瓶颈域的机制发现(本文最有信息量的实验)

  • SearchQA(harness-limited 域):harness 搜索单独就能以远少于权重训练的 rollout 数追平 weight-only 的峰值准确率——说明该域瓶颈在"检索编排的质量”,模型权重已经够用,改调度就够了;
  • Math(weight-limited 域):harness 搜索几乎零提升,直到做了一次小的权重更新后,同样的 harness 搜索才突然变得有效——说明该域瓶颈在"模型自身数学能力",harness 再聪明也调不出不存在的能力,必须先改权重再谈调度。

这个双域对照的证明力在于:它排除了"WHALE 只是在任意域机械堆叠两种优化"的平庸解释,展示了交替优化按域自适应分配预算的机制——SearchQA 上它自然多花预算在 Phase B,Math 上自然多花在 Phase A。

5.4 FST 对照的隔离设计

WHALE 的 FST 控制实验使用完全相同的更新方法与调度,仅把 harness 搜索空间限制为 system+user prompt。因此两者差值(4.15–13.00 分)干净地度量了"可执行 harness 全空间相对文本提示空间"的增量价值——这是论文因果链上最严密的一环。


六、效果优势的根源解释

对比对象一:单侧优化为何注定有天花板? 乘积结构 J = 模型能力(θ) × 调度效率(h):weight-only 在 h 固定处优化 θ,当 h 的调度效率成为短板时,θ 的改善传递不到最终分(Math 域 harness 搜索零提升恰好是镜像证据——那里权重是短板);harness-only 同理(SearchQA 域权重不是短板,所以 harness-only 也能追平)。WHALE 交替触及两侧,轮番抬高木桶的短板。

对比对象二:FST 为何系统性落后? prompt 文本只能改变"模型看到什么",不能改变"系统如何处理模型输出与工具结果"——错误重试策略、上下文裁剪逻辑、工具编排顺序这些 harness 代码层的自由度在 prompt 空间里根本不可表达。4.15–13.00 分的稳定差值就是这些不可表达自由度的价值下界。

对比对象三:stagewise 为何不如交错? 机制上是目标时效性问题:权重全面训完后再搜 harness,搜索过程隐式假设"权重不再变"——但搜索到的最优 harness 编码了大量针对当前权重的微观适配(何时截断、何时重试);反过来先搜 harness 再训权重,训练信号又被旧 harness 的调度缺陷污染(成功轨迹里混着"侥幸成功")。小步交错让每一步的优化目标在对方小变动下保持近似有效,同时滚动适应。

切何时切换为何重要? 过长的阶段会过拟合对方坐标的当前值(对方一变就归零);过短则每次都停在改善最快的区间之外。patience 规则用"信号还在改善就继续"的在线判断替代全局先验——实测 realized 预算(最长 1.16 epoch / I=13)确实在两个机制不同的域上自动分化,证明该规则捕获了真实的收敛速度差异。


七、必要知识反推

领域知识层

  • agent 系统的两半结构(权重/harness)与 harness 的影响量级——不理解"harness 差异可抵 14 分"就无法建立联合优化的动机;
  • 在线拒绝采样微调与 Meta-Harness 的机制细节——两个 Phase 的即插即用需要准确知道各自的输入(rollout/轨迹)、输出(新权重/新 harness 代码)与失效模式。

方法论知识层

  • 非凸坐标下降/交替最小化的收敛性质与停滞风险——切换时机策略的设计依据;
  • 训练信号早停/patience 思想的迁移——自适应规则的直接来源;
  • 双基线隔离实验设计(同方法同调度、只换搜索空间)——FST 对照的构造原理。

工程知识层

  • 中小模型(2B/4B)上的 rollout 管线与 mean@8 评估——成本可控地跑出统计稳健的比较;
  • 三域任务环境搭建(检索工具编排/数学评测/象棋环境)——harness 搜索空间需要可执行的任务环境;
  • 检查点与 rollout 成本核算——交错 vs 两段式的成本结论依赖准确计量。

知识融合的关键节点:最关键的融合是把"深度学习训练调度"(epoch/patience/早停)的语言推广到"harness 搜索调度"——把两种异质优化(连续梯度 vs 离散代码搜索)放进统一的阶段-切换框架,并用乘积结构的瓶颈分析预测了双域现象。没有训练方法学背景会做出不可复现的调度,没有 harness 工程经验则找不到 Meta-Harness 这样的 Phase B 引擎。


八、论文中可以提取的通用性灵感

灵感一:乘积系统的优化要轮番补短板,而非单侧拉满

  • 核心思想:当系统产出 = 因子 A × 因子 B 且两因子独立可改进时,持续改善取决于轮换投入瓶颈侧;单侧投入的边际收益会被另一因子封顶。
  • 论文证据:SearchQA(harness-limited)与 Math(weight-limited)两个镜像域的存在,及 WHALE 按域自适应的预算分配。
  • 推广场景:个人成长中"知识 × 表达"的交替投资;制造系统的设备精度 × 工艺参数;增长黑客的流量 × 转化率双轮;编译器的 IR 设计 × 后端调优。

灵感二:搜索空间的表达力决定优化上限

  • 核心思想:把优化限制在"低表达力表示"(如纯文本 prompt)上,等于预先阉割了系统的一部分设计自由度——即使方法相同,上限也系统性更低。
  • 论文证据:同方法同调度下,完整 harness 空间比 prompt 空间多 4.15–13.00 分。
  • 推广场景:AutoML 的搜索空间设计(超参 vs 架构 vs 代码);低代码平台的表达力天花板;prompt 工程 vs 程序化 agent 的路线之争;生物进化的基因调控网络 vs 点突变。

灵感三:异质优化器的"阶段-切换"协议

  • 核心思想:当两类优化器(梯度/搜索、快/慢、连续/离散)各自有效但互相扰动时,用"最小阶段长度 + 信号停滞即切换"的 patience 协议协调,比固定全局调度更稳健。
  • 论文证据:patience 自适应在两个极端域上都逼近手工最优 (E, I),且 realized 预算按域分化。
  • 推广场景:硬件/软件协同设计;课程学习与自习的交替;企业的探索期-收获期切换;强化学习中策略更新与世界模型更新的交替。

灵感四:交错小步优于分段大步(当目标会过时时)

  • 核心思想:如果阶段 A 的产出会部分作废阶段 B 的隐式假设,那么把"全部做完再换"改成"小步交错"能减少对过时目标的过度优化。
  • 论文证据:interleaved 在准确率与 rollout 成本上同时优于 stagewise。
  • 推广场景:敏捷开发的短迭代 vs 瀑布;联合训练 vs 交替训练(GAN 的教训);市场供需的双向动态调整;国际谈判的分阶段互信建设。

灵感五:用"镜像域"实验证明机制的普适性

  • 核心思想:要证明一个自适应方法"真的在做机制判断"而非机械堆叠,最有力的证据是找到两个瓶颈互换的镜像场景,展示方法在两者上自动切换行为。
  • 论文证据:SearchQA(harness-only 追平 weight-only)与 Math(harness 搜索在权重更新前零提升)构成完美镜像。
  • 推广场景:药物临床的阴阳对照;算法论文的 adversarial 消融;教育干预对不同基础学生的差异效应;A/B 测试中的反向指标设计。

本文基于 arXiv:2609.00196v1 全文(含方法、三域实验、调度消融与逐数据集结果表)撰写。关联工作:Meta-Harness (arXiv:2603.28052)、Fast-Slow Training (arXiv:2605.12484)。