<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>黑盒优化 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E9%BB%91%E7%9B%92%E4%BC%98%E5%8C%96/</link><description>Recent content in 黑盒优化 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Fri, 11 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E9%BB%91%E7%9B%92%E4%BC%98%E5%8C%96/index.xml" rel="self" type="application/rss+xml"/><item><title>Building the Harness Automatically: Self-Play in Code Distills a Text Harness for Black-Box Optimization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-11-selfplay-text-harness-bbo-paper-reading/</link><pubDate>Fri, 11 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-11-selfplay-text-harness-bbo-paper-reading/</guid><description>Google 的这篇论文问了一个极简的问题：agent 能否通过&amp;rsquo;写优化器代码并评估&amp;rsquo;的可执行实践学会一个搜索策略，然后把这个策略蒸馏成一段文本、迁移给从未见过这段实践的其他模型？答案是肯定的——自博弈产出的 197 词文本 harness（Harness A）使 Gemini Flash 在黑盒优化上 regret 降低 48%（N=30，p&amp;lt;.001），同一文本让所有受测 Gemini 执行器与 Claude Sonnet 都改善（regret -43%~-49%），独立复现的 Harness B 性能同档。&amp;lsquo;语言是部署搜索策略的便携介质&amp;rsquo;——harness 自动生成从进化搜索走向了实践蒸馏。</description></item></channel></rss>