DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory 精读

港中深联合美团 LongCat 团队提出 DiagEvo:自进化自博弈中 solver 常平台化甚至衰退,现有方法靠难度/多样性信号出题却不指明’该修哪个弱点’。DiagEvo 的答案是分层错误记忆——4B 诊断器分析失败轨迹、按’错误原因→主题→实体’三层组织、定向采样未解决错误因生成新题,辅以双置信度过滤与自由探索。三个 solver(Qwen3-4B/8B、OctoThinker-8B)在九个基准上全胜 R-Zero/DARC 等基线;消融显示去掉分层错误记忆数学均值掉 3.8 分(最大组件贡献)。与 HarnessEvolve 同日揭示同一趋势:显式诊断信号优于隐式统计信号。

September 3, 2026 · 2 min

Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement 精读

上海AI实验室提出 Harness-of-Harness(HoH):在现有编码 agent harness 之上再组织一层’规划-开发-测试’循环,通过双状态传递(制品态+证据态)、有界增量目标与独立 QA 验收,让 LLM 编码智能体实现多日自主软件开发与持续改进。三个 harness-模型对在 GameCraft-Bench/FrontierSWE/ProgramBench 上平均相对提升 52.25%,FrontierSWE 十轮迭代从 22% 升至 72.67%,并用 70+ 迭代自主开发出可玩的 FPS 游戏。本文从问题抽象、机制因果到通用灵感逐层拆解。

September 3, 2026 · 4 min

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? 精读

ByteDance Seed 联合 SUTD/GaTech/M-A-P 发布 HarnessDev——首个把评测单元从’任务输出’改为’可运行基础设施’的基准:creator LLM 从无策略弱种子构建完整 harness(Creation),再基于下游执行反馈迭代改进自己的 harness(Evolution),在 2207 个下游实例上按 capability+efficiency 双轴评估。核心发现:模型自建 harness 在 writing/MLE 域追平甚至反超人类参考系统,但在 code/search 域差距显著;Evolution 的增益不稳定且严重绑定 executor;换 executor 后最高回退 10.32 分。这为’harness 工程能否自动化’提供了第一份系统性体检报告。

September 3, 2026 · 5 min

HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution 精读

华为 ICT AI 能力中心提出 HarnessEvolve:针对自进化 agent 的三大失败模式(终态反馈导致的信用分配失败、捷径学习、灾难性遗忘),用’参考轨迹对齐’提取逐步误差信号、双门控(质量门+性能门)过滤候选更新、epoch 末 held-out 验证选最优快照。在企业内数据集 CloudCoreNetwork-QA 上把 Qwen3.6-27B 从 43.4% 拉到 86.9%(超最强基线 GEPA 21.6 个百分点),开源三数据集全胜 GEPA/ACE/SkillOpt,且在 OpenClaw 上优化的 skill 可迁移到 OpenCode/LAMAgent 等四个框架(SpreadsheetBench 最高 +30.4 分)。

September 3, 2026 · 3 min

WHALE: A Simple Recipe for Joint Harness–Weight Optimization 精读

KRAFTON 联合 KAIST/Stanford 提出 WHALE(Weight-Harness Alternating LEarning):把 agent 性能看作模型权重 θ 与可执行 harness 代码 h 的联合函数 J(θ,h),交替执行’当前 harness 下在线拒绝采样微调’与’更新后模型上 Meta-Harness 搜索’两阶段,用固定时长或自适应 patience 规则切换。在 Qwen3.5-2B/4B × 搜索问答/数学/国际象棋三域上,比 weight-only、harness-only 与 Fast-Slow Training 高 4.15–24.38 个百分点,且揭示 harness-limited 与 weight-limited 两种机制不同的瓶颈域。这是首个把优化空间从’权重+文本提示’扩展到’权重+完整可执行 harness’的交替优化配方。

September 3, 2026 · 3 min

CogEvol: Towards Efficient and Reliable Learning Environment Generation 精读

清华大学与 CogEvol Inc 联合团队的 CogEvol 是’AI 教育’方向罕见的工业级完整答卷:单模型单次前向把课程大纲变成 JSON 幻灯片或自包含交互式 HTML,22 万生产请求上中位耗时 17/59 秒,27B 模型以 26.9 倍参数效率逼近旗舰编码模型(幻灯片质量 83.7 vs 63.7 交互分)。技术看点有二:把真实生产失败转为 53,687 条验证 SFT 样本的数据飞轮;以及一次被捕获修复的 reward hacking 事件(模型学会产出视觉可信但不可玩的游戏)对混合奖励设计的修正——‘可靠性是被工程出来的,不是被期望出来的’。

September 2, 2026 · 2 min

WebWorld: The Browser as a World Model for Self-Improving Web Code 精读

北航联合上交、澜舟科技等机构的 WebWorld 直击 VLM 代码自改进的结构性缺陷:提出修复的模型同时是评判修复的模型,这种’自己批改自己’的闭环注定产出视觉可信但功能残缺的页面。解法是引入一个 VLM 骗不了的对手方——浏览器本身:作为确定性可执行模拟器,它扮演 Web 代码的’世界模型’,只有同时满足目标前进与既有能力保持的转换才能获得验收证书,认证数据形成只升不降的质量棘轮。WebWorld-27B 在 MiniAppBench-Val 提升 14.9 分,达到 Kimi-K2.6/GPT-5.4 水平;等尺寸消融证明去掉证书后增益几乎消失。

September 2, 2026 · 2 min

EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses 精读

精读独立研究者团队的 EvoUndo。论文直面 LLM Agent 自进化的安全盲区:能提升能力的变异未必能被安全撤销,正确恢复往往依赖变异前状态。EvoUndo 把自变异表示为四元组(前向变异+见证捕获+恢复程序+效果契约),在反事实状态上做往返验证。600 个任务中 197 个能力正向但恢复失败的变异构成失败库:原始语言下常规修复 0/197;oracle 审计分解出双瓶颈——S0 层是 grounding 瓶颈(精确地址后 0/48→38/48),S1 层是表达力瓶颈(扩展语言后 142/143),组合修复 180/197。另发现丰富语言加精确诊断反而降效。把能改与改回去拆开的开创工作。

August 31, 2026 · 5 min

openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents 精读

深度精读华为开源的 openJiuwen 编码智能体 harness。论文把 agent harness 提升为一等系统层,用两大设计原则回应长时程编码的挑战:结构可组合性(共享 Inner Loop/Outer Loop 执行基座 + Rail 生命周期钩子上的有序能力组合,同一执行语义从单智能体复用到子智能体与 Swarm Flow 多智能体流)与运行时适应性(在固定模型策略周围改变框架控制的运行时状态:Context Management 渐进压缩、Goal Mode 语义化验收停止、LSP 被动反馈闭环修正、Self-Reflection 跨任务经验蒸馏)。SWE-bench Verified 达 82.6%(超最强榜单 3.4 个百分点)、Terminal-Bench 2.1 达 87.19%;模型对齐对比下 1-4 小时长任务 52.38% vs mini-swe-agent 同设定 35.71%,佐证上下文管理在长轨迹上保住了深推理收益。

August 31, 2026 · 5 min

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment 精读

DualverseAI 与剑桥、港大、UCSD 合作论文精读。Station 是一个开放世界多智能体环境:六个来自 GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro 的 agent 像独立研究者一样自选方向、发论文、建文献,无中心协调器。在 12 个 AlphaEvolve 问题上,Station 拿到 5 项相对先前文献新颖的结果:604 点 kissing 构型、CT(128) 新界、符号不确定性 0.3089 新纪录、Erdős 最小重叠闭合 82% 区间、有限域 Kakeya 无穷族;还在 1 天内重构 Jacobian 反例。本精读按九部分结构拆解其机制、实验证据与效果根源,并提炼可迁移的通用灵感。

August 29, 2026 · 6 min