DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory 精读

港中深联合美团 LongCat 团队提出 DiagEvo:自进化自博弈中 solver 常平台化甚至衰退,现有方法靠难度/多样性信号出题却不指明’该修哪个弱点’。DiagEvo 的答案是分层错误记忆——4B 诊断器分析失败轨迹、按’错误原因→主题→实体’三层组织、定向采样未解决错误因生成新题,辅以双置信度过滤与自由探索。三个 solver(Qwen3-4B/8B、OctoThinker-8B)在九个基准上全胜 R-Zero/DARC 等基线;消融显示去掉分层错误记忆数学均值掉 3.8 分(最大组件贡献)。与 HarnessEvolve 同日揭示同一趋势:显式诊断信号优于隐式统计信号。

September 3, 2026 · 2 min

Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents — A Source-Code Study of Eleven Systems 精读

Wavestone AI Lab 对 11 个生产级编码 agent harness(Claude Code、Codex CLI、Gemini CLI、Mistral Vibe、OpenHands、Aider、Mini-SWE-Agent、Hermes、Pi、OpenCode、OpenClaw + 元 harness 对照 Omnigent)做源码级解剖:定义 harness 七大子系统、产出 13 条跨系统观察、29 个重复设计模式、18 条设计建议与 90 行最小 harness。关键发现:7/11 系统收敛于阈值触发 LLM 压缩的记忆管理事实标准;提供商抽象呈五档光谱;Codex 已把 per-model 提示作为服务器端数据运行时下发。这是’harness 工程’学科的第一部解剖学图谱。

September 3, 2026 · 2 min

Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement 精读

上海AI实验室提出 Harness-of-Harness(HoH):在现有编码 agent harness 之上再组织一层’规划-开发-测试’循环,通过双状态传递(制品态+证据态)、有界增量目标与独立 QA 验收,让 LLM 编码智能体实现多日自主软件开发与持续改进。三个 harness-模型对在 GameCraft-Bench/FrontierSWE/ProgramBench 上平均相对提升 52.25%,FrontierSWE 十轮迭代从 22% 升至 72.67%,并用 70+ 迭代自主开发出可玩的 FPS 游戏。本文从问题抽象、机制因果到通用灵感逐层拆解。

September 3, 2026 · 4 min

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? 精读

ByteDance Seed 联合 SUTD/GaTech/M-A-P 发布 HarnessDev——首个把评测单元从’任务输出’改为’可运行基础设施’的基准:creator LLM 从无策略弱种子构建完整 harness(Creation),再基于下游执行反馈迭代改进自己的 harness(Evolution),在 2207 个下游实例上按 capability+efficiency 双轴评估。核心发现:模型自建 harness 在 writing/MLE 域追平甚至反超人类参考系统,但在 code/search 域差距显著;Evolution 的增益不稳定且严重绑定 executor;换 executor 后最高回退 10.32 分。这为’harness 工程能否自动化’提供了第一份系统性体检报告。

September 3, 2026 · 5 min

HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution 精读

华为 ICT AI 能力中心提出 HarnessEvolve:针对自进化 agent 的三大失败模式(终态反馈导致的信用分配失败、捷径学习、灾难性遗忘),用’参考轨迹对齐’提取逐步误差信号、双门控(质量门+性能门)过滤候选更新、epoch 末 held-out 验证选最优快照。在企业内数据集 CloudCoreNetwork-QA 上把 Qwen3.6-27B 从 43.4% 拉到 86.9%(超最强基线 GEPA 21.6 个百分点),开源三数据集全胜 GEPA/ACE/SkillOpt,且在 OpenClaw 上优化的 skill 可迁移到 OpenCode/LAMAgent 等四个框架(SpreadsheetBench 最高 +30.4 分)。

September 3, 2026 · 3 min

Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents 精读

崇实大学提出 Skill Following(SF)评测框架:现有’检索 vs 不检索任务的聚合分差’衡量技能库价值存在严重选择偏差。论文形式化 RAE(Retrieval-Invoked Actual-Use Effect)指标——仅在 agent 主动发生检索的任务上,比较同一任务开/关技能的配对执行差。17 个 LLM × 编码(MBPP+)/数学(Math500)的实测揭示’评测悖论’:多个模型聚合检索提升为正、RAE 却为负——系统层面看似受益,恰恰在真正调用了技能的任务上反而有害。诊断分析证明’上下文出现技能内容’远不等于’模型遵循技能’,当前工具使用能力被系统性高估。

September 3, 2026 · 2 min

WHALE: A Simple Recipe for Joint Harness–Weight Optimization 精读

KRAFTON 联合 KAIST/Stanford 提出 WHALE(Weight-Harness Alternating LEarning):把 agent 性能看作模型权重 θ 与可执行 harness 代码 h 的联合函数 J(θ,h),交替执行’当前 harness 下在线拒绝采样微调’与’更新后模型上 Meta-Harness 搜索’两阶段,用固定时长或自适应 patience 规则切换。在 Qwen3.5-2B/4B × 搜索问答/数学/国际象棋三域上,比 weight-only、harness-only 与 Fast-Slow Training 高 4.15–24.38 个百分点,且揭示 harness-limited 与 weight-limited 两种机制不同的瓶颈域。这是首个把优化空间从’权重+文本提示’扩展到’权重+完整可执行 harness’的交替优化配方。

September 3, 2026 · 3 min

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents 精读

亚利桑那州立大学与思科研究的 CAST 解决长程工具调用 Agent 的可靠性死穴:在电商退款、医疗分诊这类有状态环境中,一个错误动作(退错订单)就造成不可逆失败。CAST 把稀疏任务结果转化为动作级监督——合成解释’该动作在部分可观测下为何有效/无效’的结构化批评理由训练批评模型,再用批评模型构造数据优化策略模型。微调后的 Qwen3 系小模型在 Retail 任务可靠性超 GPT-OSS-120B 逾 10 个百分点,域外 Telehealth 再 +9%。

September 2, 2026 · 2 min

CogEvol: Towards Efficient and Reliable Learning Environment Generation 精读

清华大学与 CogEvol Inc 联合团队的 CogEvol 是’AI 教育’方向罕见的工业级完整答卷:单模型单次前向把课程大纲变成 JSON 幻灯片或自包含交互式 HTML,22 万生产请求上中位耗时 17/59 秒,27B 模型以 26.9 倍参数效率逼近旗舰编码模型(幻灯片质量 83.7 vs 63.7 交互分)。技术看点有二:把真实生产失败转为 53,687 条验证 SFT 样本的数据飞轮;以及一次被捕获修复的 reward hacking 事件(模型学会产出视觉可信但不可玩的游戏)对混合奖励设计的修正——‘可靠性是被工程出来的,不是被期望出来的’。

September 2, 2026 · 2 min

Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement 精读

Purdue 团队对当下最火的 On-Policy Distillation(OPD)发起了一次釜底抽薪式的追问:教师监督噪声率高达 30%–50% 且随教师规模上升,学生却对噪声无感——这暗示 OPD 的增益根本不来自蒸馏。通过梯度分析定位到’低 logp token + 负优势’才是真正驱动力后,论文提出零监督的 OPSA(熵自适应负优势自改进),在 AIME24 上实现 263% 相对提升并反超标准 OPD 16.77 分。本精读覆盖其噪声测量实验、机制归因链条、OPSA 方法设计与完整实验证据。

September 2, 2026 · 3 min