题目区
本篇是三篇论文的合读(trio 模式):
- GUI-HARVEST: Self-Improving GUI Agents through Evidence-Driven Harness Evolution(arXiv:2610.00948,代码:GitHub)——香港中文大学(深圳)领衔,联合天津大学、哈尔滨工业大学(深圳)、华东师范大学、深圳大数据研究院,纯高校联盟,通讯作者为 CUHK-SZ 的 Zhongxiang Dai。
- DynaHarness: A Dynamic Physical Harness for Self-Evolving Robot Agents(arXiv:2609.40306,项目页:denghaoyuan123.github.io/Dynaharness_page)——南洋理工大学(NTU)与南京大学合作,高校合作为主。
- EvoGen-Harness: Learning Where and How to Evolve Image-Generation Harnesses(arXiv:2610.00383,技术报告,项目页与代码见论文标注链接)——北京大学、北京工业大学、复旦大学三校联盟。
三篇都是 2026 年 9 月底至 10 月初放出的新鲜工作,共同回答一个问题:当骨干模型(GUI 多模态模型、机器人 VLA、文生图扩散模型)被冻结时,围绕它的「运行时」还能被自动改进多少?
一、论文背景:什么是 harness,为什么要让它自进化
Harness(运行时挽具)是什么。 一个 agent 从来不只是模型本身。社区流行的等式是「Agent = Model + Harness」:模型负责概率化的推理,harness 负责其余一切——组装观察与上下文、执行动作、管理工具调用、做验证、恢复失败、决定何时终止。微软 Agent Framework 文档把 harness 定义为「把语言模型变成能干活的 agent 的运行时脚手架」;Anthropic、Parallel.ai、Databricks 等厂商在 2025–2026 年的实践文章里反复强调同一个判断:同一个模型装进不同的 harness,表现可以差出一个量级。对于 GUI agent,harness 包含提示词、记忆、动作接口、控制流、验证恢复与终止逻辑;对于机器人,harness 是技能库、调度器、监控与安全检查;对于文生图系统,harness 是需求解析、工具知识、生成流程与编排策略。
为什么要自进化。 传统的 harness 是人手写、静态的——Agent S/S2/S3、VLAA-GUI 这些 GUI 框架定义了一个丰富但「评估时静止」的设计空间。但 2026 年上半年出现了两个标志性工作把 harness 本身变成优化对象:斯坦福等团队的 Meta-Harness(arXiv:2603.28052)用外层编程 agent 端到端搜索 harness 代码;Self-Harness(arXiv:2606.09498)提出 agent 改进自己运行时的范式,靠弱点挖掘、修改与回归验证闭环。更早的脉络则可追溯到 Reflexion(语言化反思存入情景记忆,arXiv:2303.11366)、STOP(递归自改进脚手架代码)与 GEPA(反思式 prompt 进化可在部分任务上超过 RL、rollout 消耗少 35 倍,arXiv:2507.19457)——它们证明了「模型不动、外围文本/代码动」这条路的有效性。
通用方法的域缺口。 Meta-Harness 与 Self-Harness 的优化证据主要是文本轨迹:序列化的源码、语言/工具 trace、分数。这在数学推理、软件工程这类「失败可以从日志里读出来」的域里够用。但本篇三篇论文各自指出了自己域里文本证据的失效场景:
- GUI 域:文本 trace 可以声称成功,而屏幕显示保存对话框还开着——「点了保存」不等于「任务完成」。GUI 执行还有强随机性:同一任务同一 agent 重复执行,11.8%–20.4% 的任务会在三次执行中同时出现零分和正分(GUI-HARVEST 附录 Table 8)。
- 机器人域:语义推理跑在粗时间尺度(秒级),物理交互跑在细时间尺度(20Hz 控制),episode 级的成败标签告诉你「失败了」,却不告诉你该修规划器、技能库还是执行层。
- 图像生成域:视觉反馈告诉你「三只鸭子只画出了两只」,却不告诉你该改需求解析、工具知识、流程编排,还是这纯粹是采样噪声——改错了地方比不改更糟。
这就是三条垂直域各自给出的同一句话:通用 harness 优化器把「证据→诊断→修改→验证」的全链路都建立在文本轨迹上,而在视觉/物理/随机性主导的域里,这条链路每一环都要重新设计。
二、论文定位与关联工作
把三篇放进研究脉络图里看:
Reflexion (2023) ──> STOP (2024) ──> GEPA/TextGrad (2025-26) 【prompt/文本组件优化】
│
v
Meta-Harness / Self-Harness (2026) 【通用 harness 代码优化,文本轨迹证据】
│ │ + JIT-Agent / Harness-R1 / AutoSaddler 等
┌───────────────┼────────────────────┐
v v v
GUI-HARVEST DynaHarness EvoGen-Harness
(GUI 桌面域) (物理机器人域) (文生图域)
视觉执行证据 物理执行契约 where+how 联合归因
- GUI-HARVEST 的直接对手是 Meta-Harness、Self-Harness 和 GUI 域先行的 LFF(Learning from Failure)。它的定位主张:GUI 特化的诊断(多模态证据对齐)与验证(行为预测门)能产生比通用搜索更能泛化到未见任务的 harness 修改。
- DynaHarness 的对比系是机器人 agentic 化框架:PhyAgentOS、Harness VLA、EmbodiedSkills、ENPIRE、Zetta、ASPIRE。它所在的 LIBERO-Pro 基准正是为解决「VLA 在 LIBERO 上靠记忆刷分」而设计(arXiv:2510.03827)。
- EvoGen-Harness 的对手分两路:prompt 优化(VisualPrompter、RePrompt 等)与 agentic 生成(OctoT2I、GenArtist、Idea2Img、ChatGen)。它批评两者都「预先承诺了一个优化维度」,并把自己接到 Agentic Harness Engineering、Self-Harness、JIT-Agent 建立的 harness 进化范式上,专攻「随机性生成」这个特殊场景。
三条线合起来,加上同期的 VeriHarness(验证侧)、Turbo Harness(实例自适应)、ActiveSaddler(课程)、Malena(「强骨干下 harness 冗余」的反结论,arXiv:2609.40303),构成了 2026 年秋 harness 工程研究的完整拼图:优化侧、验证侧、边界实证三线并进,而本篇三篇补上的是「垂直域特化」这块。
三、问题定义:三篇论文的同一个抽象问题
剥掉域的外衣,三篇论文解的是同一个抽象问题:
给定一个冻结的执行模型 M 和一个可编辑的运行时(harness)H,如何设计一个闭环 O(M, H0) → H*,使得:
- 证据采集能克服执行随机性(同一输入多次执行结果不同);
- 诊断能把失败定位到 harness 中正确的修改位置;
- 修改是有界的、可复用的(不是针对单个任务的补丁);
- 准入有硬门(分数不降)与防回归机制(不破坏已有能力);
- 结果可迁移(对新任务/新初始状态/新骨干仍然有效)。
三篇论文对这个抽象骨架做了域特化的实例化,对比如下:
| 抽象环节 | GUI-HARVEST(GUI 域) | DynaHarness(机器人域) | EvoGen-Harness(图像生成域) |
|---|---|---|---|
| 执行随机性的应对 | 同一任务 K=3 次重复执行作为联合证据单元,成功路径与失败路径对比定位分歧步 | 配对(paired)评估:同 suite+task+seed 下对照,快照在新初始状态上复测 | 同一请求 K=4 个随机种子,约束级证据聚合 |
| 诊断证据形态 | 前后截图 + 动作对齐(多模态) | 物理执行记录:接地/预算/租约/拒绝原因/完成判定 | 约束 × 轨迹 × 验证结果的证据立方体 |
| 失败定位方式 | 开放词汇跨任务聚类成「行为模式」 | N=13 层有序归因(基础设施→规划→接地→调度→能力执行→验证→恢复) | LLM Harness Localizer 给五个职责打分取 Top-r |
| 修改对象 | harness 源码有界补丁 | 物理量表述的能力修订(铰链半径、抓握闭合极限) | 五职责之一的局部编辑(Policy/Tools/Skills/Middleware/Memory) |
| 准入机制 | 效用硬门 ΔS≥0 ∧ ΔV≥0 ∧ max>0 + 行为软门(预测须成真) | 配对回归门(成功升、harness 失败不升、裸策略赢的 cell 不丢、零污染)+ 更广回归 | 匹配随机条件评估 + held-out 验证 + 保持集回归门(容差 ε=0.01) |
| 防过度修改 | 行为预测须被验证;测试集封存 | 拒绝候选直接回滚而非打补丁 | No-Patch 显式选项(94.8% 准确率地识别「不值得改」) |
这张表是全文的纲。下面三节分别展开每篇的机制与证据,第六节回到这张表解释「为什么有效」。
四、问题解法一:GUI-HARVEST——四角色闭环与「预测必须成真」
GUI-HARVEST(Harness Adaptation from Repeated Visual Executions and Structured Trajectories)在冻结骨干上跑一个四角色优化循环:
1. Evidence Analyst(证据分析师)——任务内诊断。 每个搜索任务从干净快照起跑 K=3 次(K=3 是成本与信息量的平衡点:K=1 时标准误 1.61 个百分点、选出 harness 只有 43.1%;K=3 标准误降到 0.93、选出的 harness 50.9%;K=5 成本 5 倍反而只选出 49.7%)。一个任务束(task-round bundle)进入诊断的条件是至少一次有效运行为零分。分析师比较失败运行与成功运行(如有)的分歧步:它拿到的是 GAFT(GUI Artifact and Fact Toolkit)对齐好的逐步证据——每步的模型文本、计划动作、执行动作、前后截图、工具输出,加上机械事实(整屏像素变化率 Δscreen、落点局部窗口变化率 Δlocal)。一条「发现(finding)」必须指认失败运行中的决定性步骤、引用可验证的 run/step 证据,并过确定性核查(harness 版本、引用局部性、轨迹事实的可机械检验性)。
2. Cross-task Clusterer(跨任务聚类器)——归纳可复用模式。 发现先被赋予确定性的结果类别(如 PREMATURE_DONE),类别内用开放词汇聚类出至少被两个独立任务共享的行为模式(behavior mode)。每个模式记录可观察机制、成员判定谓词、行为目标与成员发现——刻意不预设模式词表,也不预设补丁形态。
3. Harness Engineer(harness 工程师)——源码感知的干预。 工程师角色在一个受限工具会话里检视、编辑、测试 harness 源码,把模式翻译成能力清单(capability manifest)允许范围内的有界源码补丁。关键设计:评估之前必须先写下行为预测——例如一个「完成检查」补丁的预测是「agent 在声明成功前会先关闭仍处编辑态的保存对话框」。预测与不变量(不得破坏的接口/行为)一起冻结在更新计划里。
4. Validator(验证器)——双门准入。 候选先过 L0/L1 确定性代码检查(权限、diff 上限、语法、单测、冒烟),再在全部搜索/验证任务上各跑 K 次:
- 效用硬门:ΔS ≥ 0 ∧ ΔV ≥ 0 ∧ max(ΔS, ΔV) > 0——两个数据分片都不降、至少一个严格涨;
- 行为软门:每条预测需要至少一个可判定任务裁决,且支持多于反驳。判 supported/contradicted/inconclusive 时不允许从分数反推行为,必须引用具体 run 和 step。
双门都过才晋升(promotion),否则回滚并保留当前 harness 的已验证发现。更新账本(ledger)记录每次补丁、预测、分数变化与裁决,指导后续提案。测试集(201 题)在优化全程封存,直到冻结 H* 后才开启。主协议最多 B=10 轮、每轮最多 P=5 个进入 GUI 评估的候选,五连拒即停。
论文附录 I 给了一个教科书级的端到端案例:Chrome 用户名改 Thomas 的任务,三次执行都把 Thomas 打进了字段,但两次在字段仍处编辑态(蓝色下划线、光标在)时就调 done() 而失败,成功的运行先点了字段外再 done()。诊断发现是「编辑未提交就终止」而非「文本没打对」;聚类器把它与 Impress 幻灯片改背景、Calc 排序两个同构失败聚成模式 EDIT_NOT_COMMITTED_AT_DONE;工程师实现了未提交编辑计数 + Ctrl+S 清零 + 首次 done() 扣留并回传反对意见的行动门;验证器检查编辑后三次执行——三次首个 done() 都被扣留,agent 分别通过点空白/返回箭头/切设置页离开字段后 done() 才被接受,裁决 supported。这个案例把「重复执行分离稳定缺陷与成功对照」「视觉状态区分打字与完成编辑」两个机制讲得清清楚楚。
五、问题解法二:DynaHarness——快慢脑与「所有命令过一道物理契约」
DynaHarness 处理的是双时间尺度问题:语义推理(慢)与物理交互(快)。它的架构是三层:
- 慢脑:Qwen3-VL-4B,按需调用,读原子上下文快照,返回结构化建议——只命名能力(如 pick_and_place)与符号参数(如物体、目标位姿关系),不给任何位姿数字。
- 快脑:确定性代码,2Hz 运行,持有执行权威。职责是把慢脑建议接地(ground)成物理命令 γ=(m, θ, B, τ)——能力、物理参数、步预算、租约;监控进度/停滞/风险;在接地失败时拒绝(返回 ⊥ 并记录原因);在能力不适用时替换(如推不动盘子就换成抓取-搬运-放置);在需要时请求慢脑重规划。完成事件采用**闩锁(latch)**机制:一旦判定为真就保持为真——因为像「关炉灶」这种瞬时成功窗口可能只有 0.55 秒,2Hz 采样若不闩锁会漏掉(消融:不闩锁 25%、裸策略 80%、闩锁+chunk 级读取 95%)。
- 20Hz 控制器:真正执行,底下还有 50Hz 安全包络检查。
**物理执行契约(Physical Execution Contract)**是全文的枢纽设计——任何面向机器人的命令都必须满足四条:Grounded(参数与前置条件通过执行接口解析,解析不了就拒绝);Bounded(只在预算与租约内行动,付不起自身完成成本的能力在开始前就拒绝——LIBERO 里一次 pick-and-place 约 230 步、转旋钮中位成本 211.5 步,300 步预算装不下两者,就让能力自己算清楚再上场);Verifiable(以记录的局部状态/闩锁判定/预算/租约条件结束);Attributable(每条命令的观察、决策、结果、原因都进 append-only 证据库——连被拒绝而未执行的命令也留痕,这样诊断才能区分「命令没解析」与「能力执行失败」)。
离线自进化环:失败 episode 的证据库进 N=13 层有序归因(从基础设施、上下文、规划、接地、调度、能力执行、验证到恢复,取最早命中层),归因签名触发故障复现探针(注意:从 harness 自己把机械臂置于的状态复现,而不是从重置状态——杯子已放上盘子、走廊被占用的失败在新鲜场景里根本不出现),然后是以物理量表述的针对性修订——绝不按任务 ID 写分支。例如抽屉归因到能力层后,探针发现三个物理原因:前臂抵住酒架、15.4mm 把手上约三分之一真实抓握被闭合极限拒绝、接触后手位过高。两项修订(抓握点沿把手移 20mm 并放宽闭合极限;接触错位后重就位并等两次连续停滞才放弃)把该 cell 从 55% 提到 90% 和 100%,Goal 全套从 75.25% 升到 78.0%。
准入是两级门:配对门(同 suite/task/seed 上:总成功不降、harness 层失败不升、裸策略本来就赢的 cell 一个不丢、零污染 episode)+ 更广回归检查。后者不是官僚流程——有一个通过了配对门的候选(把微波炉腔体进入泛化到一切「搁在固定物上的区域」,包括只有 5mm 高腔体的炉灶平面),在整轮评估里让五个放东西到炉灶的 cell 一共掉了 79 次成功,episodes 交给裸策略的比例从 166 涨到 226(分析路线被移除的标志信号),直接回滚。论文的总结很精辟:「配对门测试针对性修改,更广验证测试局部修复是否改变了库里其他能力已经在用的行为。」
六、问题解法三:EvoGen-Harness——「在哪进化」与「如何进化」的联合决策
EvoGen-Harness 的出发点是一个别人没有正面处理的问题:harness 的可编辑面变宽之后,「在哪改」本身成了一个搜索问题。 prompt 优化改 Policy,路由方法改选择,工作流方法改流程——都预先承诺了维度。它把生成系统的外围状态拆成五个持久职责:Policy(需求/约束解释规则)、Tools(能力与局限知识库)、Skills(可复用流程模板)、Middleware(运行时编排:路由/验证/重试/终止)、Memory(跨任务经验)。
核心机制 Trace(Trajectory-Relative Attribution and Coordinated Evolution)四步走:
1. 证据聚合。 请求分解成细粒度视觉约束(「三只白鸭」是一个约束、「黄色雨衣」是另一个),在 K=4 个随机种子下执行,构建证据集 E={约束 × 相关轨迹决策 × 视觉验证结果}。单张失败图片不足以证明该进化——同一 harness 换个种子可能就成功了;跨种子的约束级聚合才能分离「持续弱点」与「随机抽样」。
2. Harness Localizer(定位器)。 一个固定的、零训练的 LLM(GPT-4.1)读证据与当前 harness 状态,给六个选项(五职责 + No-Patch)打证据强度分。取 Top-r=3 作为搜索前沿而非立即承诺单一职责——硬 Top-1 会因为过早承诺掉到 0.6815,全空间搜索 0.7112 但候选评估从 8 个涨到 20 个、生成调用从 32 次涨到 80 次,Top-r 拿到 0.7089,几乎追平全空间但成本降 60%。No-Patch 是一等公民选项:当失败更可能来自采样噪声、验证器不确定或证据不足时,明确输出「不值得持久修改」。
3. 职责条件化提案 + 匹配随机条件评估。 提案器(同一 LLM、不同 schema)只在被选中的职责内提案(每职责至多 M=3 条),编辑形如 δ=(z, o, k, v_old, v_new)——职责、操作(增/改/删)、记录键、前后值,越界编辑直接判无效。评估时候选与父 harness 在同一批 K 个种子下对比 ΔQ,把编辑效果与生成方差剥离开。候选排序打分 U = ΔQ − λ·保持回归 − μ·执行成本。
4. 渐进式再归因 + 安全持久化。 接受一次编辑后,残余失败重新定位——进化路径可以跨职责移动(先修 Policy 的计数约束,再修 Middleware 的「验证不过就立刻终止」改成「触发一次定向重试」)。进化深度至多 L=3。整条路径最后要过 held-out 验证(在触发案例之外的不相干 prompt 上也要涨)与保持集回归门(此前成功的案例变失败的比例 ≤ 1.9%),不过就整体回滚到 H_t。
两个编辑实例值得记:Policy 编辑把「显式基数表达(如 three ducks)必须表示为硬计数约束、并在构建 prompt 与视觉验证两处显式检查」写进需求规则;Middleware 编辑把「首次验证后即终止」改为「验证发现未解决的显式约束且预算尚存时,触发一次用验证器反馈的定向重试」。都是职责内的小改动,都不碰生成器。
七、评估与证据:数字怎么说
三篇的实验设计都刻意回答「你怎么知道这不是刷分」,逐篇看关键证据:
GUI-HARVEST:六骨干一致增益 + 跨平台迁移
主基准 OSWorld-Verified 361 题(80 搜索 / 80 验证 / 201 封存测试),统一 15 步、K=3 协议:
| 骨干(全部冻结) | 初始 Test | 进化后 Test | 初始 Full | 进化后 Full |
|---|---|---|---|---|
| Qwen3-VL-8B | 28.79 | 34.84 (+6.05) | 29.49 | 36.83 (+7.34) |
| Qwen3-VL-32B | 43.02 | 53.18 (+10.16) | 38.61 | 50.94 (+12.33) |
| OpenCUA-32B | 32.82 | 34.31 (+1.49) | 30.71 | 34.24 (+3.53) |
| OpenCUA-72B | 41.25 | 44.18 (+2.93) | 37.65 | 42.33 (+4.68) |
| Gemini 3.1 Pro | 66.42 | 72.63 (+6.20) | 66.46 | 73.37 (+6.91) |
| GPT-5 | 56.35 | 61.86 (+5.51) | 55.20 | 62.42 (+7.22) |
配套证据链:
- 同起点公平对比:同一 Qwen3-VL-32B/Agent S3 初始 harness、同一优化模型(Claude Sonnet 5)、同样十轮上限下,GUI-HARVEST Test +10.16 vs Self-Harness +2.00、Meta-Harness +4.38——增益来自 GUI 特化的诊断与验证,不是预算或模型。
- 跨平台冻结迁移:在 OSWorld 上优化好的 harness 只换平台适配器搬到 WindowsAgentArena(50 步),GPT-5 从 50.88% 涨到 64.75%(+13.87),Qwen3-VL-32B 从 38.21% 到 44.68%(+6.47),全程没用 WAA 轨迹优化。
- 对已发表系统:15 步下对 CoAct-1/GPT-5 领先 22.61 个百分点(62.42 vs 39.81)、对 VLAA-GUI/Gemini 3.1 Pro 领先 21.68(73.37 vs 51.69);对 LFF 官方发布补丁,OpenCUA-72B 上 44.18/42.33 vs 41.29/39.50。
- 成本反而降:GPT-5 15 步 $72 拿 62.4%,与 Agent S3 100 步 62.6%($260)几乎同分省 72%;Gemini 3.1 Pro 100 步 79.1% 只要 $125,比 Claude Sonnet 4.5(58.1%、$316)高 21 个点还便宜六成——机制解释是优化后的 harness 减少了重复失败动作与无意义续跑,准确率与推理效率同向改善。
- 消融链完整:去视觉证据 53.18→44.54(最大单项);去跨任务聚类 →45.66;K=1 →47.44(差 5.74/7.82);只留硬门 →49.36——注意这一项的教训:硬门变体跑了 9 轮反而选出比完整版(8 轮停止)更低的 harness,证明只看总分可能选中「分高但没修目标失败模式」的补丁,行为门补的正是这个洞。
DynaHarness:+58pp 的量级与四快照冻结转移
主基准 LIBERO-Pro 四个 cell(Goal/LIBERO-10 × 指令扰动 T/物体扰动 S,各 10 任务 × 20 种子 = 800 episodes),全部配对协议:
- 同配置碾压:同冻结 π0.5 + 同 Qwen3-VL-4B 上模型,DynaHarness 74.25%,对比 PhyAgentOS 20.3%、EmbodiedSkills 14.4%、ENPIRE 5.4%、CaP-Agent0 12.5%、Harness VLA 6.0%——对冻结基线 π0.5(16.2%)提升 58.0 个百分点;复测 74.1% 的配对版本里独占胜 474:11。
- 冻结后新状态转移:系统冻结后才生成 800 个新初始状态,74.25% 的系统拿 75.2% vs 冻结 π0.5 的 17.5%(+57.8pp);261 个从未动过的官方状态上 77.0% vs 16.5%。四个预注册冻结快照在新状态上排名完全保持(Spearman ρ=1.00),开发期增益 14.3pp 到新状态 14.4pp——增益是真实的能力积累,不是对特定初始状态的过拟合。
- 消融定位能力来源:去掉 7 个解析接触技能,74.0→16.6(≈裸策略 16.2,−57.4pp);同样技能库下,名义单步重规划(A2static)63.9%、冻结序列(A2seq)63.8%,Full 动态执行 74.0%——执行治理机制本身再贡献 +10.125pp(p=2×10⁻¹⁸,89/8 独占胜)。恢复/干预技能移除只掉 0.9pp(p=0.21,不显著)。
- 执行构成:770 个归档控制 episode 中 570 个从未调用 VLA、成功率 96.7%——解析技能提供主要能力,π0.5 退居「难题兜底」角色(最难 cell 里 VLA 占步数最高 91.4%)。
- 真机:UR7e + RealSense 相机 + SAM3 分割,4 个任务各 10 试,70–90% 成功。
- 诚实的负面结果:替换慢脑为 Claude Sonnet 5(经 Claude Code,每调用 74.6k prompt token vs Qwen 4k,延迟 5.9 倍)在 40 个未调参 episode 上 80% vs 75%——前沿模型没有魔法加成;失败后缀替换实验 p=0.24 不显著;标准 LIBERO 上 98.05% vs 策略参考 98.0%,天花板效应说明增益属于扰动场景。88 个基础设施丢连接 episode 按失败计入分母(不藏污)。
EvoGen-Harness:0.7089 vs 0.4456 与归因质量本身成为被测对象
三个互补基准(生成器 FLUX.1-dev 冻结,定位/提案 LLM GPT-4.1 冻结,零额外训练):
- GenEval2(Soft-TIFA GM):0.7089,最强 T2I 模型 Nano Banana 0.4456(+0.2633),最强 prompt 优化 VisualPrompter 0.2552、最强 agentic OctoT2I 0.2895;计数子项 0.6857→0.9053(Qwen-Image 骨干上的数字;FLUX 上从 0.5311 到 0.9053,涨幅 +0.34)。
- T2I-CompBench++:平均 0.6807(+0.0720),8 个维度 7 个第一。
- WISE(世界知识一致性):WiScore 0.6780(+0.0752),6 个领域全第一。
- 跨骨干泛化:同一框架套 FLUX.1-dev / Qwen-Image / Janus-Pro 三个冻结骨干,对 VisualPrompter 分别 +0.4537 / +0.3750 / +0.4674,每个视觉子项全为正——证明是「生成器无关的外围进化」而非绑定某个模型。
- 归因质量被直接测量(这点在同类论文里罕见):用受控单职责干预构造 ground truth,定位召回 87.9%–91.4%,No-Patch 准确率 94.8%;双职责复合失败下 Top-3 覆盖 94.3%、渐进再归因双因全中 88.9%、双修复成功 83.5%。
- 进化分布本身:接受的更新覆盖全部五个职责(份额 13.0%–27.8%),held-out 增益 +0.089 到 +0.182(Skills 最大)——没有塌缩到单一维度,直接验证了「where 必须是决策」的动机。
- 回归率 1.9%:去掉 No-Patch 回归率涨到 10.7%,去掉安全验证涨到 13.9%——防过度修改的机制不是摆设。
- 效率:部署期每 prompt 1.4 次生成调用、42.6s,比 VisualPrompter(2.0 次、61.8s)又快又好,排除「多采样硬堆」解释;进化语料来自 PartiPrompts 且与三个基准做过去重隔离,测试标注永不进入定位/提案/选择。
八、效果优势的根源解释
三篇的增益都不是「用了 LLM 所以好」可以解释的。把因果链拆开:
GUI-HARVEST:视觉证据与重复执行解决的是「诊断的语义鸿沟」。 因果链:GUI 失败的本质是「模型意图 ≠ 屏幕效果」(点保存≠保存完成),纯文本轨迹天然缺一半信息 → 前后截图与动作对齐把「意图-效果分歧步」显式暴露(去掉它 Test 掉 8.64 个点,最大消融项,机制→指标直接对应)→ 单次执行诊断被噪声放大(11.8–20.4% 任务三次内翻转成败)→ K 束对比在分歧步做反事实(K=1 掉 5.74/7.82)→ 行为门阻止「分高但答非所问」的补丁入库(硬门变体 9 轮选出更低分 harness 是直接证据)。这与 Gonzalez-Pumariega 等 2026 年计算机使用可靠性研究「结局变异在确定性解码下仍然存在」的外部结论互洽。
DynaHarness:契约改变的是小模型的可组合性。 最反直觉的对照是 Harness VLA 换上同一个 Qwen3-VL-4B 直接崩到 6.0%(它用 Opus-4.7 时有 76.8%)。因果链:agent 化框架让上模型直接吐动作/代码 → 4B 模型的语义错误直接进物理层(ENPIRE 的 Qwen 运行 28/40 失败归因于生成代码的接口错误;ASPIRE 的 Qwen 运行零 episode 被执行——诊断记录见 DynaHarness 附录 G)→ DynaHarness 的契约让慢脑只提「能力+符号参数」、快脑负责接地/拒绝/替换 → 语义错误被挡在物理层之外,4B 的正确部分被充分利用 → 解析接触技能承担主要能力(移除即 −57.4pp)+ 执行治理再加 10pp。Zetta 换 Qwen 归零(0.0%)同构地佐证:弱上模型下崩不崩,取决于架构是否要求它做超出能力的事,而非模型本身。 抽屉案例则展示了归因的粒度价值:没有 13 层归因,你不会知道该把抓握点移 20mm。
EvoGen-Harness:先验剪枝与匹配评估解决的是「宽搜索空间的两个统计陷阱」。 因果链:五职责空间里暴力枚举是组合爆炸(全空间要 20 候选/80 次生成调用)→ 轨迹相对归因(同约束跨种子对比)提供有判别力的证据(受控干预下 87.9–91.4% 召回,这不是自评而是对照 ground truth)→ Top-r 前沿以 8 候选/32 调用追平全空间(0.7089 vs 0.7112)→ 第二个陷阱是生成方差混淆:独立采样的 A/B 对比会把运气当效果 → 匹配种子配对评估把两者剥离 → 第三个陷阱是过度修改:No-Patch 以 94.8% 准确率吸收随机失败(去掉后回归率 1.9%→10.7%)。计数类 +0.22 以上的收益集中在「显式可验证约束」上,与「验证器能给出干净信号时进化最有效」的机制预测一致。
跨论文交叉验证与边界。 三篇的结论与 Malena(arXiv:2609.40303)「强骨干 + MLE-bench 下 harness 机制大量冗余」表面冲突,实际互补:本篇三篇的增益全部出现在冻结的非最强骨干(Qwen3-VL、π0.5、FLUX.1-dev)或域特化瓶颈(GUI 随机性、物理接触、生成随机性)上;GUI-HARVEST 自己的数据也显示 OpenCUA(围绕原生动作协议后训练过)增益 3.53–4.68 远小于 Qwen 的 7.34–12.33——骨干与 harness 的适配越「出厂预调」,进化余量越小。GEPA「反思进化用 35 倍少 rollout 追平 RL」的结论说明外围进化的样本效率优势是跨域稳定的。本次检索范围内未发现与「重复执行证据 + 行为验证门」「物理执行契约 + 分层归因」「where/how 联合归因」三个机制正面相反结论的已发表工作;最接近的反例是 Malena 的冗余论证,但它针对的是搜索/编排层的「加法机制」,而这三篇改的是接地、验证、终止这些 Finding-the-Right-Fit 所识别的「关键少数行为」。
九、必要知识反推
要做出这三篇工作,作者团队各自必须掌握(且融合)的知识颇有差异,拼起来恰好是这个方向的能力画像:
- 共同的底座:agent 运行时的工程解剖学(知道 prompt/记忆/接口/控制流/验证/恢复/终止各在哪里可切)、进化搜索与程序综合(有界补丁、Top-r 前界、账本与回滚)、实验设计中的泄漏控制(封存测试集、held-out、保持集、配对评估)。
- GUI-HARVEST 独需:多模态证据对齐(截图前后差分、落点窗口、像素变化率的机械事实设计)、GUI 执行随机性的实证测量(flip rate 协议)、软件工程的代码门(L0/L1、diff 上限、能力清单)与「预测先于评估」的可检验性设计——本质上是把循证医学的「预后登记」思想搬进了代码进化。
- DynaHarness 独需:实时系统的分层控制(2Hz 决策 / 20Hz 控制 / 50Hz 安全,budget/lease 这种嵌入式系统的经典机制)、机器人操作的几何与物理度量(闭合极限、抓握点偏移、走廊高度这些「以物理量表述修订」的词汇)、VLA 生态与 LIBERO-Pro 的评估协议、以及统计学上的配对检验与预注册习惯(快照预注册、A1 替换规则的 host 判据)。
- EvoGen-Harness 独需:T2I 组合性失败的分类学(计数/属性绑定/空间关系)、视觉验证器与开放词汇检测(OWLv2 + NVILA)的工程链路、因果归因的评测方法学(受控干预造 ground truth、混淆矩阵、复合故障)——把「归因器准不准」从假设变成被测对象,是整个 harness 进化领域此前缺少的一步。
- 三者的知识交汇点:把「验证」从外部裁判变成 harness 内的一等职责(GUI 的行为门、机器人的闩锁判定、生成的约束验证),这需要对「什么信号是可信的」有第一性理解。
十、通用性灵感
从三篇合读中可以提炼出的、可推广到其他领域的做法:
- 随机性主导的系统里,「重复执行」是最便宜的信息增益。 GUI-HARVEST 的 K=3(翻转率 20.4% 被暴露、选出的 harness 从 43.1% 变 50.9%)与 EvoGen 的 K=4(归因 F1 随 K 上升后饱和)都表明:在诊断之前先问「这次失败是必然还是抽样」,一次执行永远回答不了。适用于任何有采样随机性的评估场景(推荐、对话、代码生成)。
- 「预测先行 + 预测验证」是防止伪改进的通用门。 先写下「这个改动应该让什么行为发生」,再验证行为是否真的发生——比只看总分多了一层「改对了地方」的因果保证(GUI-HARVEST 硬门变体的反例直接展示了缺它的代价)。这个模式可以搬到任何自动调参/自动修复系统里。
- 弱组件的正确用法是「让它只做能力边界内的事,其余用确定性代码兜住」。 DynaHarness 的 4B 慢脑只提符号建议、快脑管物理,+58pp;对照组让 4B 直接写动作/代码,6%–14%。对「小模型 + 确定性治理」的组合优于「大模型裸奔」的判断,同样适用于端侧 agent、本地工具链。
- 「不修改」应该是一个显式的、被训练评估的选项。 No-Patch 94.8% 的准确率与去掉它回归率翻五倍的对照,说明自进化系统的关键能力之一是识别噪声。任何自动优化系统(从 A/B 测试到 AutoML)都可以引入显式 abstain 通道,并单独测量它的准确率。
- 修改要用对象的本体语言表述,不要用任务 ID 表述。 DynaHarness 的「铰链半径 20mm」而非「goal_swap[0] 补丁」、GUI-HARVEST 的跨任务模式成员判定、EvoGen 的职责内编辑 schema,三个设计殊途同归:可泛化的修改必须以机制词汇书写。这是「过拟合的补丁」与「能力积累」的分界线。
- 准入要有两级:配对门管「改的地方对了没」,全局回归门管「别的地方坏了没」。 DynaHarness 的炉灶灾难(−79 成功)被全局门拦下、GUI 的行为门拦下「分高但没修目标」的补丁、EvoGen 的保持集把回归率压到 1.9%——三个域独立收敛到同一结构,这不是巧合。
- 「归因器本身准不准」需要被测。 EvoGen 用受控干预造 ground truth 测归因,这个方法学价值超出文生图:任何「LLM 诊断 → 自动修改」的系统(含自动修 bug、自动调 prompt 的生产管线)都值得给自己的诊断器做一次混淆矩阵体检。
- 给系统留「诚实失败」的记录通道。 DynaHarness 连被拒绝的命令都写入证据库(区分「没解析」与「执行失败」)、88 个基础设施 episode 计入分母、负面结果(Sonnet 替换无显著增益、失败后缀替换 p=0.24)照登论文。这种记录纪律是自进化系统能持续安全积累的前提——没有可靠的事后归因,就没有可信的自我改进。
回到开头的判断:三篇论文在三条垂直域各自证明,「冻结骨干 + 进化 harness」不是通用方法在文本域的简单移植,而是一套需要按域重写的证据工程——证据怎么采(重复执行/物理契约/约束聚合)、故障怎么定位(模式聚类/分层归因/职责打分)、修改怎么表述(行为模式/物理量/职责编辑)、准入怎么把关(行为门/配对门/No-Patch)。这四个问题的答案域域不同,但问题本身通用。当骨干越来越强、越来越冻结,这一层「模型之外」的工程,正在成为 agent 能力增长的第二曲线。