Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 精读

东京大学团队提出Task-CoEvolve,让验证任务集与harness共进化:用方差加权采样把评估预算聚焦在候选harness分歧最大的能力前沿任务上,再用Horvitz-Thompson/Hájek类估计器从采样子集无偏还原全量分数。在Terminal-Bench 2.1上仅用20%预算就逼近全量搜索(均值51.7 vs 52.8),整体搜索成本降67-80%;文本分类7%预算接近全量、20%预算反超。本精读覆盖背景、定位、方法机制、实验证据、效果根源因果链、必要知识反推与通用灵感九个部分。

August 23, 2026 · 6 min

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 精读

深度精读 Einsia.AI 与清华大学 2026 年 8 月提出的 AI4AI-Bench:首个隔离测量 LLM Agent 训练算法设计能力的基准。10 个冻结研究仓库、单块 B300 四小时改写、十二小时从零重跑、0/0.1/1.0 三锚点统一量表,29 个配置平均仅 0.166、最佳 0.250——最强系统连’已有算法到最优’距离的五分之一都没走完;而推理预算买到的主要是’敢去改’的意愿,参与率从 8% 提升到 64%。

August 22, 2026 · 3 min

EnvHarness: Awakening Static Worlds for Agent Learning 精读

深度精读 EnvHarness——与 Agent Harness 对称的环境侧革命:不改环境本身,在交互接口上包装一层可编程插件(Stage/Contract/Chain 三类组件),把静态冻结环境重塑为针对当前策略弱点的定制化训练场。EnvRigger 自动化引擎通过 Observe→Diagnose→Write→Validate 四阶段循环,自动诊断策略缺陷并生成验证过的组件,在 ALFWorld、WebArena、SWE-bench Verified、OfficeQA、SpreadsheetBench 五大基准上全面超越原环境与领域特定生成器,环境规模化收益持续未饱和。

August 22, 2026 · 4 min

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis 精读

深度精读 USTC+上海AI Lab+复旦合作的 FACET 论文——面向终端 agent 训练的任务合成框架。论文指出多阶段任务合成的两大失败根源:源信息逐步丢失与任务制品间漂移,提出三阶段方案:71K 技能库构建、五维情景重构、以及以’共享可执行状态’为核心的环境先行接地,按 I→S→V 顺序让指令/解法/验证器共享同一真实容器状态。基于 6078 个任务(每任务 22.77 项可执行检查)、仅 1.2K SFT 轨迹,即让 Qwen3.5-27B 在 Terminal-Bench 2.1 上提升 6.75 分,距 397B 巨兽仅差 1.49 分而参数少约 15 倍。

August 22, 2026 · 4 min

Inducing Task Models from Computer-Use Traces 精读

计算机使用 agent 要真正进入真实工作,必须先搞清楚’这项工作实际是怎么做的’。Stanford 与 CMU 的这篇论文提出 TMI(TaskModelInduction),从被动录制的自然计算机使用轨迹中诱导结构化任务模型:先把多条交织的并发任务解缠成独立潜任务,再为每个任务构建’层次目标模型(做什么)+ 过程模型(怎么做)‘双模型。在受控轨迹上任务分组与 ground-truth 一致性达 0.974,重建 74.9% 的观测执行步骤;由任务模型派生的技能使 held-out 任务准确率提升 30.0%。本精读覆盖其问题定义、双模型解法、内外双层评估设计、优势根源与可推广的通用性灵感。

August 22, 2026 · 3 min

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use 精读

深度精读浙大 ZJUNLP 联合 NUS、东北大学、赫瑞瓦特大学与腾讯的 MemTrapBench——首个系统评估’记忆诱导认知陷阱’的基准。论文发现:忠实记录、语义相关的记忆仍可能扭曲模型推理与信念,1050 个对抗实例上所有记忆框架全面低于无记忆基线,最好的 EverMemOS 也落后 13.99 个百分点。文章拆解两类四情景陷阱分类、三段式对抗构建流水线、四组归因消融实验,以及仅靠推理时提示就挽回 14.9 个百分点的 AdaptiveMem 修复方案。

August 22, 2026 · 4 min

PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents 精读

深度精读 KAIST 与 DeepAuto.ai 产学合作论文 PolicyGuide:客服 LLM Agent 的合规失败不仅来自危险动作,更来自跳过身份核验、跳过确认等程序遗漏,而动作局部检查的运行时守卫无法引导多步流程。该工作把每个领域的策略编译为工作流图,在用户轮次边界调用前瞻验证器,从持久化图状态对账未决请求并返回步骤级补救,兼具外部守护与工作流强制双角色;在 τ²-bench 三域上将 GPT 5.4 平均 PASS⁴ 从 0.42 提升到 0.62,telecom 域从 0.19 跃至 0.61,同一工作流零改动迁移到 Claude Sonnet 4.6 与 Gemini 2.5 Pro。

August 22, 2026 · 4 min

Repo0: Design-Driven Zero-to-All Code Generation 精读

现有代码生成系统大多假设仓库架构已经设计好,只负责往里填代码。Repo0(上海交通大学 + 重庆大学,2026年8月)直面「零到全」生成:从一句自然语言需求出发,构建整个软件项目,同时推断功能与架构。它的核心是把软件设计从「一次性静态蓝图」变成「持续结构演化过程」——用需求 DAG + 组件 DAG + 对齐关系构成的双 DAG 架构状态,在内聚/耦合等模块化度量引导下,通过 split/merge/revise/add/save 五种结构动作迭代演化至收敛,再由收敛架构引导测试驱动开发生成。在 RepoCraft 六个真实仓库 × GPT-5 mini 与 DeepSeek V3.2 双骨干上,Repo0 全部设置 Functionality Coverage 与 Pass Rate 最高,相比最强基线 RPG,Pass Rate 最高提升 29.74 个百分点。本精读覆盖问题定义、双 DAG 机制、五种结构动作、跨模型互评设计、消融证据与通用灵感。

August 22, 2026 · 5 min

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 精读

上海创新研究院与复旦大学联合发布 SWE-bench Science:覆盖 20 个科学领域、98 个真实仓库的 119 个任务,以 Issue 驱动、专家探索、工程集成三种范式考察 coding agent 在科学软件上的真实修复能力,并用隐藏预言机与反校准协议狙击伪修复。结果所有最强 agent 的 Pass@1 均不足 50%,四类失败机制归因与科学信息双向消融揭示了科学知识与代码推理交织处的深层瓶颈。

August 22, 2026 · 3 min

Agent Lightning v1.0: Towards Harnessed Agentic RL 精读

微软亚洲研究院联合复旦、浙大、爱丁堡大学发布Agent Lightning v1.0,首次系统定义harnessed agentic RL范式——当部署级agent harness直接参与RL训练时,训练引擎只能看到一串LLM请求-响应对。论文刻画了重分词破坏token前缀连续性、动态样本数下的优势计算、损失归一化与后端调度四大挑战,以约3500行代码给出参考实现,仅用6K训练样本让Qwen3.5-9B在SWE-bench Verified上从41.8%提升到56.4%(+14.6个百分点),并公开完整数据清洗管线与防reward hacking脚手架。

August 20, 2026 · 3 min