Building the Harness Automatically: Self-Play in Code Distills a Text Harness for Black-Box Optimization 精读
Google 的这篇论文问了一个极简的问题:agent 能否通过’写优化器代码并评估’的可执行实践学会一个搜索策略,然后把这个策略蒸馏成一段文本、迁移给从未见过这段实践的其他模型?答案是肯定的——自博弈产出的 197 词文本 harness(Harness A)使 Gemini Flash 在黑盒优化上 regret 降低 48%(N=30,p<.001),同一文本让所有受测 Gemini 执行器与 Claude Sonnet 都改善(regret -43%~-49%),独立复现的 Harness B 性能同档。‘语言是部署搜索策略的便携介质’——harness 自动生成从进化搜索走向了实践蒸馏。