HarnessEvo 精读:Harness 自进化的价值藏在控制槽位里

HarnessEvo 把 Agent harness 分解为 role/strategy/format/control 四个可独立进化的槽位,用 leave-one-in/out 协议做价值归因:整体指标’看似无效’(0.657 vs 0.642),但收益完全 localized 于 reflection/control 槽位(+0.119, p=0.0046);等预算下多槽位同进反而互相稀释——预算分摊陷阱。本文基于全文阅读拆解其归因协议与对自进化领域的方法论警示。

September 5, 2026 · 2 min

HookPry 精读:Agent Harness 的 hook 更新通道是全新的供应链攻击面

HookPry(北邮/网信办数据中心/北航/浙大)首次系统揭示 AI Agent Harness 生命周期 hook 的更新通道攻击面:良性插件上架获取信任后,一次携带 hook 的恶意更新即可在 LLM 完全不可见的路径上以宿主权限执行任意命令。1000 次端到端攻击攻破全部 7 个 harness(最高 92.5%),Microsoft Defender 召回率 0%。本文基于全文阅读拆解其 AMO/TD/LCI 三组件与防御失灵的机制根源。

September 5, 2026 · 2 min

Discriminative World Models for Web Agents 精读

Web agent 用世界模型做测试时动作选择:采样候选动作→预测下一状态→排序执行。但现有世界模型都用监督式’下一状态预测’训练——花大量 token 复述页面上没变化的部分,而下游 ranker 需要的恰恰是’不同动作导致的差异’。UC Berkeley 联合 MIT-IBM Watson AI Lab 提出 predicted-state matching:预测表示必须把真实结果状态从替代动作的结果状态中区分出来。同一份数据、同一个 Qwen3-8B 底座,仅换训练目标,匹配准确率从 47.77% 跳到 80.80%,WebArena-Lite 端到端成功率从 13.94% 提到 28.48%。本精读拆解’训练目标与下游任务对齐’这一教科书级修正的完整证据链。

September 4, 2026 · 3 min

Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills 精读

自主 ML 研究 agent 缺的不是更强的模型或更聪明的流程,而是’怎么把方法跑通’的操作知识层。BAAI 联合中科大、人大、港理工提出 DisCo 蒸馏框架,把 1000 个 GitHub 仓库蒸馏成 5353 个经过验证的技能,构建 AREX-Skill Library。在固定 GPT-5.5+Codex 的对照实验下,技能让 MLE-bench 相对提升 134.3%、PaperBench 提升 34.4%、FrontierCS 提升 9.2%、PassNet 提升 14.0%,并以更低 token 消耗帕累托支配 Claude Code。本精读拆解技能图三层结构、四阶段蒸馏流水线、对照实验设计,以及’试错成本越高、操作知识价值越大’的机制根源。

September 4, 2026 · 3 min

Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents — A Source-Code Study of Eleven Systems 精读

Wavestone AI Lab 对 11 个生产级编码 agent harness(Claude Code、Codex CLI、Gemini CLI、Mistral Vibe、OpenHands、Aider、Mini-SWE-Agent、Hermes、Pi、OpenCode、OpenClaw + 元 harness 对照 Omnigent)做源码级解剖:定义 harness 七大子系统、产出 13 条跨系统观察、29 个重复设计模式、18 条设计建议与 90 行最小 harness。关键发现:7/11 系统收敛于阈值触发 LLM 压缩的记忆管理事实标准;提供商抽象呈五档光谱;Codex 已把 per-model 提示作为服务器端数据运行时下发。这是’harness 工程’学科的第一部解剖学图谱。

September 3, 2026 · 2 min

Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement 精读

上海AI实验室提出 Harness-of-Harness(HoH):在现有编码 agent harness 之上再组织一层’规划-开发-测试’循环,通过双状态传递(制品态+证据态)、有界增量目标与独立 QA 验收,让 LLM 编码智能体实现多日自主软件开发与持续改进。三个 harness-模型对在 GameCraft-Bench/FrontierSWE/ProgramBench 上平均相对提升 52.25%,FrontierSWE 十轮迭代从 22% 升至 72.67%,并用 70+ 迭代自主开发出可玩的 FPS 游戏。本文从问题抽象、机制因果到通用灵感逐层拆解。

September 3, 2026 · 4 min

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? 精读

ByteDance Seed 联合 SUTD/GaTech/M-A-P 发布 HarnessDev——首个把评测单元从’任务输出’改为’可运行基础设施’的基准:creator LLM 从无策略弱种子构建完整 harness(Creation),再基于下游执行反馈迭代改进自己的 harness(Evolution),在 2207 个下游实例上按 capability+efficiency 双轴评估。核心发现:模型自建 harness 在 writing/MLE 域追平甚至反超人类参考系统,但在 code/search 域差距显著;Evolution 的增益不稳定且严重绑定 executor;换 executor 后最高回退 10.32 分。这为’harness 工程能否自动化’提供了第一份系统性体检报告。

September 3, 2026 · 5 min

HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution 精读

华为 ICT AI 能力中心提出 HarnessEvolve:针对自进化 agent 的三大失败模式(终态反馈导致的信用分配失败、捷径学习、灾难性遗忘),用’参考轨迹对齐’提取逐步误差信号、双门控(质量门+性能门)过滤候选更新、epoch 末 held-out 验证选最优快照。在企业内数据集 CloudCoreNetwork-QA 上把 Qwen3.6-27B 从 43.4% 拉到 86.9%(超最强基线 GEPA 21.6 个百分点),开源三数据集全胜 GEPA/ACE/SkillOpt,且在 OpenClaw 上优化的 skill 可迁移到 OpenCode/LAMAgent 等四个框架(SpreadsheetBench 最高 +30.4 分)。

September 3, 2026 · 3 min

WHALE: A Simple Recipe for Joint Harness–Weight Optimization 精读

KRAFTON 联合 KAIST/Stanford 提出 WHALE(Weight-Harness Alternating LEarning):把 agent 性能看作模型权重 θ 与可执行 harness 代码 h 的联合函数 J(θ,h),交替执行’当前 harness 下在线拒绝采样微调’与’更新后模型上 Meta-Harness 搜索’两阶段,用固定时长或自适应 patience 规则切换。在 Qwen3.5-2B/4B × 搜索问答/数学/国际象棋三域上,比 weight-only、harness-only 与 Fast-Slow Training 高 4.15–24.38 个百分点,且揭示 harness-limited 与 weight-limited 两种机制不同的瓶颈域。这是首个把优化空间从’权重+文本提示’扩展到’权重+完整可执行 harness’的交替优化配方。

September 3, 2026 · 3 min

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL 精读

深度精读清华大学、腾讯优图实验室与上海AI Lab 合作的 ContextPilot:一个主动上下文管理框架。针对现有方法工具集贫乏(只有搜索/删除/摘要)、探索低效(上下文编辑动作影响悬殊却被均匀采样)、信用分配粗粒度(轨迹级奖励平摊给所有编辑动作)三大缺陷,它扩展出规划、长期记忆、软卸载三类工具,并用上下文变化量+熵变化识别关键编辑决策做分支采样(context-aware partial rollout),再用所有后续分支的平均回报估计动作级优势(细粒度信用分配,方差降为 1/n)。8B-RL 在四基准平均 69.40 超 StateLM-8B-RL 的 65.85;深搜任务上每轮输入 token 稳定在 8-10K(基线线性涨到 30K);消融证明细粒度信用分配贡献最大且在全部基准一致提升。

August 31, 2026 · 5 min