论文链接:Building the Harness Automatically: Self-Play in Code Distills a Text Harness for Black-Box Optimization 发表时间:2026年9月 机构:Google(Mountain View)—— 产业界独立研究 领域标签:cs.LG / LLM Optimization / Harness Generation / Self-Play

一、论文背景

低预算黑盒优化(评估次数受限的多维函数优化)是 LLM 的传统弱项:未经辅助的 LLM 在 BBOB 类基准上的 regret 远强不过高斯过程-贝叶斯优化(GP-BO)等经典优化器。经典优化器强在数学结构,弱在不可迁移——它们是代码,不是知识,换个执行主体就得重写。

与此同时 harness 研究主线(HarnessEvolve、SGPO 等)用进化/梯度搜索直接在提示空间优化 harness,产物与搜索过程绑定,难以解释也难以验证"到底学到了什么"。本文选择了另一条路:让搜索发生在代码空间(可执行、可评估),产物沉淀在文本空间(可迁移、可解释)。

二、论文定位和关联工作

路线搜索空间产物可迁移性
经典优化器(GP-BO、CMA-ES)数学空间算法代码无(绑定实现)
LLM 直接当优化器无(提示即策略)—弱(regret 高)
Harness 进化搜索(HarnessEvolve 等)提示空间提示 harness中(绑执行模型)
OPRO/LLM-as-optimizer文本提案—弱
本文代码空间(自博弈)197 词文本 harness跨模型跨家族

定位结论:本文把"策略发现"与"策略部署"分离——代码空间保证发现的策略真的能跑(可执行评估),文本蒸馏保证部署的载体模型无关。

三、问题定义

具体问题:能否让 agent 通过可执行实践(写优化器程序+评估效果)自发发现一个数值搜索策略,并把该策略蒸馏为一段冻结的文本 harness,使未参与实践的模型立即受益?

三个必须单独验证的性质:(1) 有效性——文本 harness 显著降低 regret;(2) 可迁移性——对未参与实践的执行器与跨家族模型同样有效;(3) 可复现性——独立端到端重跑能产出同档性能的不同文本(排除"偶然撞中一段魔法提示")。

四、问题解法

1. 自博弈实践(开发期):agent 反复编写优化器程序、在实践函数族上评估,积累"什么策略有效"的程序化经验。代码空间的优点:策略正确性由执行结果直接裁决,无需求助于 LLM 评判。

2. 一次性文本蒸馏:把最终优化器程序+实践记录蒸馏成 197 词的主 harness(Harness A),评估前冻结——杜绝"为测试集定制提示"的过拟合通道。

3. 严格评估协议:独立 N=30 研究(与实践期隔离的函数实例);三个 held-out BBOB 景观(从未见过的函数族);跨执行器测试(多个 Gemini 型号);跨家族迁移(Claude Sonnet);密封生产基准(YouTube 调参,评估前不可见)。

4. 独立复现:第二团队端到端重跑全流程,产出 Harness B——不同程序、不同文本、同档性能。

五、评估指标与实验证据

  • 主结果:Harness A 使 Gemini Flash regret 降低 48%(69.5→36.0,N=30,p<.001,27/30 实例改善;paired-bootstrap 95% CI [19.0, 49.7])。
  • 性能档位:进入 GP-BO 性能区间(实践函数族上),三个 held-out BBOB 景观 mean regret 全部下降。
  • 跨模型迁移:同一文本改进每一个受测 Gemini 执行器;Claude Sonnet regret 降低 43% 与 49%(p≤.005)。
  • 生产验证:密封 YouTube 奖励调参基准上取得最低 regret。
  • 机制证据(附录 F):Harness A 改变查询序列几何——平均步长 2.17→1.90、步长变异系数 1.04→0.68(更稳定)、2 邻域内提案占比 69%→79%(更局部化的信任域行为)、改进事件上升。文本真的编码了搜索纪律。

六、效果优势的根源解释

为什么 197 个词能追上数十年历史的优化算法?机制在归纳偏置的压缩与注入:

  • LLM 原生提示下,模型对"下一步该探哪里"没有系统性纪律——步长忽大忽小、探索与开发无平衡;
  • 自博弈在代码空间里试出了有效的搜索几何(局部化、稳定步长、靠近现任提案);
  • 蒸馏把这些几何性质写成文字法则(如"在现任点邻域内提案、步长先大后小"),执行器读到文本后行为分布被重塑——附录 F 的步长统计是这一因果的直接测量;
  • 文本的可迁移性来自其内容是策略描述而非模型专属技巧:任何足够强的 LLM 都能"读懂并执行"搜索纪律,就像任何程序员都能执行一份算法描述。

因果链:代码空间自博弈(真值评估)→ 发现搜索几何 → 文本编码(模型无关)→ 执行器行为重塑 → regret 跨模型下降。

七、必要知识反推

  • 黑盒优化与 BBOB:COCO 基准的 BBOB 函数族是优化算法标准考题;regret(与最优值的差距)是主指标。
  • GP-BO:高斯过程贝叶斯优化,低预算黑盒优化的经典强基线。
  • Harness 的文本形态:harness 不一定是代码脚手架,一段精心提炼的指令文本同样是 harness——本文证明文本 harness 可以承载数值策略。
  • 预注册/冻结文化:评估前冻结产物+密封测试集,是本文可信度的方法论支柱。

八、论文中可以提取的通用性灵感

  1. 在可验证空间发现、在可迁移空间部署:策略发现要选能低成本验证的空间(代码/模拟器),部署要选模型无关的载体(文本)——“发现与部署分离"适用于任何经验沉淀流程。
  2. 冻结产物是可信评估的前提:先冻结后评估杜绝过拟合通道;任何"进化出的提示/配置"若没有冻结协议,其评测成绩都要打折。
  3. 独立复现是"学到真东西"的判据:不同文本同档性能说明方法学稳健;同一文本高分离可能是撞大运——可复现性检验应成为 harness 生成的标准环节。
  4. 行为统计验证文本机制:不只看结果指标,还测量执行行为的几何变化(步长/邻域占比),把"文本为什么有效"做成可检验命题——机制级证据比效果级证据更有说服力。
  5. 实践记录即蒸馏素材:自动生成的产物(代码+日志)本身是高质量知识源,蒸馏目标不必是人工总结。