<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>进化搜索 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E8%BF%9B%E5%8C%96%E6%90%9C%E7%B4%A2/</link><description>Recent content in 进化搜索 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Fri, 02 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E8%BF%9B%E5%8C%96%E6%90%9C%E7%B4%A2/index.xml" rel="self" type="application/rss+xml"/><item><title>Harness 自动进化三重奏：MILO、ScholarEvolve 与 Malena 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-02-harness-evolution-trio-paper-reading/</link><pubDate>Fri, 02 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-02-harness-evolution-trio-paper-reading/</guid><description>2026 年 9 月末，arXiv 上同时出现三篇方向相撞的 Harness 论文：MILO 用「负证据谱系记忆+编排者元进化」把自动 Harness 发现推上 Terminal-Bench 2.1 官方榜首之上（RR@5 86.1%），ScholarEvolve 让 Harness 从研究文献中学习模块化变异（AppWorld Challenge TGC 49.6%→63.6%），而 Malena 却用大规模控制变量消融证明：在前沿编码 Agent 之上，复杂 Harness 机制几乎全部冗余（MLE-bench 获奖 62.5% vs 最佳开源 Harness 47.1%）。本精读逐篇拆解三者的机制与实验，再正面处理这个当日最大的张力——结论是：Malena 消融的是「统一机制的加减法」，而 MILO/ScholarEvolve 的增益来自「任务自适应、负证据利用与成本-精度前沿」这些 Malena 未覆盖的轴，弱模型反例（gpt-oss-120b、Gemma 4 31B）进一步表明机制收益随模型能力变化，两条路线实为同一光谱的两端。</description></item></channel></rss>