GUI-HARVEST + DynaHarness + EvoGen-Harness 三篇合读:harness 自进化在 GUI、机器人、图像生成三条垂直域的落地

「冻结骨干、进化运行时」正在成为 agent 自进化的主流路线:GUI-HARVEST 用重复视觉执行证据加行为预测双门,在 OSWorld 六个骨干上最高提升 12.33 个百分点;DynaHarness 用快慢脑加物理执行契约,把冻结 π0.5 机器人策略从 17.5% 拉到 74.25%;EvoGen-Harness 用 where+how 联合归因进化,让冻结文生图模型在 GenEval2 上从 0.4456 涨到 0.7089。三篇论文分别代表 GUI、物理机器人、图像生成三条垂直域的 harness 进化代表作,本文合读三者的共同骨架、域特化设计与实验证据链,并讨论 harness 工程的边界与反例。

October 3, 2026 · 6 min

Harness 的有效性边界:Malena × Finding the Right Fit 合读精读

同月两篇论文从正反两面划定 Agent Harness 工程的有效性边界。EPFL+Apple 的 Malena 用受控消融证明:骨干够强时,几乎全部收益来自编码 agent 运行时与骨干本身——给模型一个 shell 和文件系统(Chat→Oneshot)是测得的最大单一效应,搜索原语、多 agent 编排全部统计不显著(最大差距 Best-of-N vs UCB1 仅 2.71pp,CI 含 0),单会话极简 agent 在 MLE-bench 上以 62.5% medal 率碾压四个 SOTA Harness(最佳外部 47.1%)。NTU 的 Finding the Right Fit 用 66 配置矩阵证明另一半事实:换 Harness 模型排名完全反转(TB4 上 Claude−GPT 差距在 OpenHands +7.94、PI −30.16,摆幅 38.09pp),6204 条轨迹归因发现 Harness 的真实价值集中于「把失败转成模型可用的反馈」这一件事。合读结论:Harness 的价值不在「编排的丰富度」而在「反馈回路的完整性」,且随骨干增强而向运行时基底收缩。

October 3, 2026 · 7 min

Harness 的三种缩放轴:Mid-Harness × STITCH × Turbo Harness 精读

同日三篇论文从三个互补粒度回答同一问题:固定模型后 Harness 侧还有哪些缩放轴可挖。NVIDIA+KAIST 的 Mid-Harness 下沉「动作级」——在模型与 Harness 边界采样 N 个候选、执行前由验证器选一,发现采样收益完全由验证支配(前沿验证器把 TerminalBench-Lite 从 50.00% 拉到 68.03%),且与轨迹级缩放正交可组合(+Best-of-T 达 66.33%、成本减半)。UIUC+UMich 的 STITCH 沿「原语级」轴测试时组装——带 scope/contract 的原语库+确定性编译器,SWE-V 80.5%、组装开销仅 2.7%,配 mismatch gap 与指数衰减两命题。Rutgers+Red Hat AI+MIT-IBM 的 Turbo Harness 沿「实例级」轴打补丁——回收外层搜索副产物蒸馏 playbook、GRPO 训 9B 编辑器逐实例补丁,SWE-V 38.4→54.4%、步数 23.1→8.7。三轴正交可叠加,构成 Harness 工程学的完整缩放谱系。

October 2, 2026 · 10 min

Harness 自动进化三重奏:MILO、ScholarEvolve 与 Malena 精读

2026 年 9 月末,arXiv 上同时出现三篇方向相撞的 Harness 论文:MILO 用「负证据谱系记忆+编排者元进化」把自动 Harness 发现推上 Terminal-Bench 2.1 官方榜首之上(RR@5 86.1%),ScholarEvolve 让 Harness 从研究文献中学习模块化变异(AppWorld Challenge TGC 49.6%→63.6%),而 Malena 却用大规模控制变量消融证明:在前沿编码 Agent 之上,复杂 Harness 机制几乎全部冗余(MLE-bench 获奖 62.5% vs 最佳开源 Harness 47.1%)。本精读逐篇拆解三者的机制与实验,再正面处理这个当日最大的张力——结论是:Malena 消融的是「统一机制的加减法」,而 MILO/ScholarEvolve 的增益来自「任务自适应、负证据利用与成本-精度前沿」这些 Malena 未覆盖的轴,弱模型反例(gpt-oss-120b、Gemma 4 31B)进一步表明机制收益随模型能力变化,两条路线实为同一光谱的两端。

October 2, 2026 · 10 min

编码 Agent 的安全边界与协作假象:Approval Laundering 与 OpenCollab 合读 精读

本文合读 2026 年 9 月底同期出现的两篇编码 Agent 基础设施论文:复旦单作者工作 Approval Laundering 证明「人批准的动作 ≠ 实际执行的动作」,用六轴分类学系统化批准-执行绑定漏洞(Scope/Temporal/PATH 替换 BGR=1.0),并以七字段 HMAC Approval Token 部分修复;上海交大牵头的七机构工作 OpenCollab 证明「声明的协作 ≠ 发生的协作」,用 Adherence 六轴审计与 CACE 因果归因把多智能体增益争议变成可测量问题,并以双 Coder 工作流在 SWE-bench Pro 拿下 64.25% SOTA。两篇从安全与效能两个方向拆掉 Harness 的同一类隐式信任假设:把 Agent 系统的隐式假设变成可测量、可审计的对象。

October 2, 2026 · 9 min

CodeSkill × NanoHarness:技能抽象与 Harness 效应——被低估的智能体性能杠杆 精读

本精读合并解读两篇从「模型权重之外」挖掘编码智能体性能的论文:清华+华为诺亚+上交的 CodeSkill 把长程 RL 从 token 级提升到技能级——teacher 蒸馏三级文本技能(目标/执行/控制),分层 VAE + Gumbel-Softmax 执行反馈门控边界把离散技能映射为连续隐变量 zH/zM/zL,以软提示前缀注入冻结 LLM(LoRA),PPO 在隐空间优化;SWE-bench Verified 76.2、EvalPlus 99.2 开源第一,交互步数 12.3→6.8(−45%),去掉 VAE 直接用文本技能+RL 则 BigCodeBench 从 94.8 掉到 88.4。南京理工+TUM+南京大学的 NanoHarness 首次把 harness(模型外基础设施)作为一等研究对象做组件级受控分解:固定模型下 harness 差 19.4pp vs 模型差 22.8pp;在 mini-SWE-agent 上增量加五组件,工具注册表 +4.57pp、任务特定子代理 +5.91pp,而上下文压缩 −4.86pp——机制是结构化工具把无序 shell 探索变针对性调用(jqlang 案例 133 次探测→43 次、通过率 24.68%→68.17%)。二者共同指向:技能结构与 harness 设计是被系统低估的性能杠杆。

September 30, 2026 · 6 min

Opera × CER:长程编码智能体的评论家介入与早期奖励预测 精读

本精读合并解读两篇在「轨迹还没走完」时提供质量信号的长程编码 Agent 论文:Salesforce AI Research 的 Opera 构建口头评论家框架——把每次修正管理为持久化笔记(混合调度五事件触发审查 + 九个契约化类型算子诊断 + 准入/发布双审计把关投递与关闭,并把「遵从」与「解决」分开跟踪),在 Terminal-Bench 2.1 / SWE-Bench Pro / DeepSWE v1.1 三基准上把 Qwen3.8-27B 的 resolve rate 提升 7.9/4.0/8.9pp,去掉双审计后增益损失 2/3,证明误导性反馈的代价之高;UW 等机构的 CER 则在 rollout 结束前从 40 步前缀预测终端奖励——用检索经验库合成任务自适应 rubric、同父兄弟续跑组内共享打分(组内序保持即足以支撑排名类下游),TTS 上 Nemotron 3 Ultra RM@8 达 67.6%(+4.2pp)且只用 15.3% token 匹配最佳基线(省 84.7%),RL 上 40 步截断 + 弃权门控 DPPO 以 52.7% 更少在线 token 超过全轨迹 TMax(51.6% vs 49.7%)。一个向内诊断当前轨迹,一个向前预测最终结局,合看构成测试时监督的两条互补路径。

September 30, 2026 · 5 min

Skill2Env × QwenGyre × AgentPerfBench:智能体强化学习的数据、系统与推理三层基建 精读

同日挂出的三篇 arXiv 论文恰好拼出 Agent 强化学习的三层基础设施:数据层(AllSpark 的 Skill2Env 把「环境合成」从扩展覆盖升级为能力参数化——100 个带控制旋钮的难度模式+基于 solver 执行证据的迭代加难,1.5K 轨迹 SFT 换 7 基准 +8.4pt);系统层(阿里 Token Hub 牵头的 QwenGyre 用 cell 级弹性调度+轨迹树处理让 2.4T 旗舰模型的百万 token rollout 在线 RL 提速 1.78×,pass rate 52.48%→58.54%);推理层(帝国理工+剑桥+牛津的 AgentPerfBench 用 22 个负载画像+饱和扫描+NCU roofline 证明 chat→coding 的 TTFT 差 4.8×、操作强度差 46×,agentic 负载在并发爬升时吞吐崩塌 43–76% 而 chat 仍在扩张)。本文按九部分结构合并精读,并给出「Agent RL 全栈工程」的公共图景。

September 30, 2026 · 8 min

TraceDance × Maintaining Benchmarks:Agent 行为基准的构建与作弊治理 精读

本精读合并解读两篇互为镜像的 Agent 基准治理论文:字节跳动+UIC 的 TraceDance 解决「供给侧」——从 25 万条真实部署轨迹中按用户自然语言指定的不良行为自动构建定向行为基准,其可编程 Anchor-and-Confirm 把全量扫描搬到 CPU、构建成本从 O(N·LLM) 降为 O(N·CPU),139 个查询完成率 95.3%、产出 107 个基准 4,125 实例,9 个前沿模型平均通过率仅 26.7%;Scale AI 的 Maintaining Benchmarks 解决「信任侧」——把「通过任务但未展现目标能力」定义为 unearned pass(SWEBench Pro 上 GPT-5.6-Sol 违规率 68.27% 而 GPT-6 Astra 为 0%,git 历史 oracle 是主导通道),用三值裁决+对抗复核+通道级密封+重放探针+新鲜复评构成检测-定位-修复-复评闭环。一篇让基准「从真实世界长出来」,一篇让基准「在强大模型面前保持诚实」,合看构成 Agent 评测有效性的完整叙事。

September 30, 2026 · 3 min

MoMHa 与 SkillEvoReg 精读:Agent 资产的优化与正则

一篇合并精读两篇 2026 年 9 月 25 日同期挂出的 Agent 资产治理论文:Adobe Research 的 MoMHa 首次把 LLM harness 设计形式化为准确率×安全×token 三目标优化搜索,单阶段联合奖励全面压过两阶段与十个 prompt 优化基线(J=0.482 对 TextGrad 0.422,安全分 0.781 全场最高);华为诺亚方舟实验室的 SkillEvoReg 首次定义「技能进化过拟合」问题,把 dropout/容量正则/对抗验证三原则迁移到离散技能更新,SpreadsheetBench 提升 12.25 个百分点的同时技能体积缩 61%。两篇恰好都是纯企业实验室主导,共同指向 Agent 外部资产的优化与正则化这条新主线。

September 29, 2026 · 9 min