Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents — A Source-Code Study of Eleven Systems 精读

Wavestone AI Lab 对 11 个生产级编码 agent harness(Claude Code、Codex CLI、Gemini CLI、Mistral Vibe、OpenHands、Aider、Mini-SWE-Agent、Hermes、Pi、OpenCode、OpenClaw + 元 harness 对照 Omnigent)做源码级解剖:定义 harness 七大子系统、产出 13 条跨系统观察、29 个重复设计模式、18 条设计建议与 90 行最小 harness。关键发现:7/11 系统收敛于阈值触发 LLM 压缩的记忆管理事实标准;提供商抽象呈五档光谱;Codex 已把 per-model 提示作为服务器端数据运行时下发。这是’harness 工程’学科的第一部解剖学图谱。

September 3, 2026 · 2 min

Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement 精读

上海AI实验室提出 Harness-of-Harness(HoH):在现有编码 agent harness 之上再组织一层’规划-开发-测试’循环,通过双状态传递(制品态+证据态)、有界增量目标与独立 QA 验收,让 LLM 编码智能体实现多日自主软件开发与持续改进。三个 harness-模型对在 GameCraft-Bench/FrontierSWE/ProgramBench 上平均相对提升 52.25%,FrontierSWE 十轮迭代从 22% 升至 72.67%,并用 70+ 迭代自主开发出可玩的 FPS 游戏。本文从问题抽象、机制因果到通用灵感逐层拆解。

September 3, 2026 · 4 min

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? 精读

ByteDance Seed 联合 SUTD/GaTech/M-A-P 发布 HarnessDev——首个把评测单元从’任务输出’改为’可运行基础设施’的基准:creator LLM 从无策略弱种子构建完整 harness(Creation),再基于下游执行反馈迭代改进自己的 harness(Evolution),在 2207 个下游实例上按 capability+efficiency 双轴评估。核心发现:模型自建 harness 在 writing/MLE 域追平甚至反超人类参考系统,但在 code/search 域差距显著;Evolution 的增益不稳定且严重绑定 executor;换 executor 后最高回退 10.32 分。这为’harness 工程能否自动化’提供了第一份系统性体检报告。

September 3, 2026 · 5 min

HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution 精读

华为 ICT AI 能力中心提出 HarnessEvolve:针对自进化 agent 的三大失败模式(终态反馈导致的信用分配失败、捷径学习、灾难性遗忘),用’参考轨迹对齐’提取逐步误差信号、双门控(质量门+性能门)过滤候选更新、epoch 末 held-out 验证选最优快照。在企业内数据集 CloudCoreNetwork-QA 上把 Qwen3.6-27B 从 43.4% 拉到 86.9%(超最强基线 GEPA 21.6 个百分点),开源三数据集全胜 GEPA/ACE/SkillOpt,且在 OpenClaw 上优化的 skill 可迁移到 OpenCode/LAMAgent 等四个框架(SpreadsheetBench 最高 +30.4 分)。

September 3, 2026 · 3 min

Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents 精读

崇实大学提出 Skill Following(SF)评测框架:现有’检索 vs 不检索任务的聚合分差’衡量技能库价值存在严重选择偏差。论文形式化 RAE(Retrieval-Invoked Actual-Use Effect)指标——仅在 agent 主动发生检索的任务上,比较同一任务开/关技能的配对执行差。17 个 LLM × 编码(MBPP+)/数学(Math500)的实测揭示’评测悖论’:多个模型聚合检索提升为正、RAE 却为负——系统层面看似受益,恰恰在真正调用了技能的任务上反而有害。诊断分析证明’上下文出现技能内容’远不等于’模型遵循技能’,当前工具使用能力被系统性高估。

September 3, 2026 · 2 min

WHALE: A Simple Recipe for Joint Harness–Weight Optimization 精读

KRAFTON 联合 KAIST/Stanford 提出 WHALE(Weight-Harness Alternating LEarning):把 agent 性能看作模型权重 θ 与可执行 harness 代码 h 的联合函数 J(θ,h),交替执行’当前 harness 下在线拒绝采样微调’与’更新后模型上 Meta-Harness 搜索’两阶段,用固定时长或自适应 patience 规则切换。在 Qwen3.5-2B/4B × 搜索问答/数学/国际象棋三域上,比 weight-only、harness-only 与 Fast-Slow Training 高 4.15–24.38 个百分点,且揭示 harness-limited 与 weight-limited 两种机制不同的瓶颈域。这是首个把优化空间从’权重+文本提示’扩展到’权重+完整可执行 harness’的交替优化配方。

September 3, 2026 · 3 min

Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement 精读

Purdue 团队对当下最火的 On-Policy Distillation(OPD)发起了一次釜底抽薪式的追问:教师监督噪声率高达 30%–50% 且随教师规模上升,学生却对噪声无感——这暗示 OPD 的增益根本不来自蒸馏。通过梯度分析定位到’低 logp token + 负优势’才是真正驱动力后,论文提出零监督的 OPSA(熵自适应负优势自改进),在 AIME24 上实现 263% 相对提升并反超标准 OPD 16.77 分。本精读覆盖其噪声测量实验、机制归因链条、OPSA 方法设计与完整实验证据。

September 2, 2026 · 3 min

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability 精读

Qwen Team 的 Qwen3.8-Flash-Next 架构报告展示了一次教科书级的’联合设计’实践:GDN 线性注意力混合 + 压缩索引稀疏注意力(QSA)+ 四分支门控残差 + 主机内存 n-gram 嵌入,125B 总参 6B 激活的模型以约 1/9 训练 FLOPs 在 14 个基准上 8 个超越 397B 旗舰,1M 上下文预填充加速 7.6 倍,且 4 倍学习率压力测试下全程零 loss spike。报告最宝贵的不是单个组件,而是’loss、基准、效率、稳定性必须当一个问题解’的方法论,以及大量’loss 与下游精度背离’的诚实披露。

September 2, 2026 · 3 min

PaperGym: Rubric-Centered Evolution for Research-Plan Generation 精读

浙江大学与 Apple 联合团队的 PaperGym 把’每篇论文’变成一个完整的 RL 训练环境:问题从研究目标+背景合成、评分准则(rubric)从方法+实验部分导出,从源头把准则泄漏率压到 3.7%(现有数据集为 11.9%–34.1%)。用 rubric 先当 OPSD 自教师的特权上下文、再当 GRPO 的奖励,Qwen3-8B 训练后在 ResearchQA 达 73.48 分超越更大的 Kimi K2.6。这项工作解决的是 AI 科学家落地的核心卡点——研究计划这类’没有可验证答案’的开放任务如何获得可靠的 RL 奖励。

September 2, 2026 · 2 min

Super Library Agent: Joint Generation and Maintenance of Multiple Applications Beyond the Single Codebase 精读

KAIST 与 DeepAuto.ai 的 Super Library Agent 为代码智能提出了一个被所有人忽视的新问题设定:LLM 编码 Agent 逐应用生成时会在代码库间复制共享逻辑,长期自主维护还会积累冗余与结构侵蚀。论文定义’Super Library Agent’问题——顺序生成 N 个相关应用的同时维护一个共享组件库,并用三项技术(候选引导抽取、抽取前巩固、调用图条件化迁移)在 WebGen-Bench/PaperBench 上同时保住功能与可维护性:共享策略更新时补丁量从 936 行降到 256 行。这是把软件工程的’库’概念引入 Agent 时代的开创性工作。

September 2, 2026 · 2 min