Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 精读

东京大学团队提出Task-CoEvolve,让验证任务集与harness共进化:用方差加权采样把评估预算聚焦在候选harness分歧最大的能力前沿任务上,再用Horvitz-Thompson/Hájek类估计器从采样子集无偏还原全量分数。在Terminal-Bench 2.1上仅用20%预算就逼近全量搜索(均值51.7 vs 52.8),整体搜索成本降67-80%;文本分类7%预算接近全量、20%预算反超。本精读覆盖背景、定位、方法机制、实验证据、效果根源因果链、必要知识反推与通用灵感九个部分。

August 23, 2026 · 6 min

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 精读

深度精读 Einsia.AI 与清华大学 2026 年 8 月提出的 AI4AI-Bench:首个隔离测量 LLM Agent 训练算法设计能力的基准。10 个冻结研究仓库、单块 B300 四小时改写、十二小时从零重跑、0/0.1/1.0 三锚点统一量表,29 个配置平均仅 0.166、最佳 0.250——最强系统连’已有算法到最优’距离的五分之一都没走完;而推理预算买到的主要是’敢去改’的意愿,参与率从 8% 提升到 64%。

August 22, 2026 · 3 min

EnvHarness: Awakening Static Worlds for Agent Learning 精读

深度精读 EnvHarness——与 Agent Harness 对称的环境侧革命:不改环境本身,在交互接口上包装一层可编程插件(Stage/Contract/Chain 三类组件),把静态冻结环境重塑为针对当前策略弱点的定制化训练场。EnvRigger 自动化引擎通过 Observe→Diagnose→Write→Validate 四阶段循环,自动诊断策略缺陷并生成验证过的组件,在 ALFWorld、WebArena、SWE-bench Verified、OfficeQA、SpreadsheetBench 五大基准上全面超越原环境与领域特定生成器,环境规模化收益持续未饱和。

August 22, 2026 · 4 min

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis 精读

深度精读 USTC+上海AI Lab+复旦合作的 FACET 论文——面向终端 agent 训练的任务合成框架。论文指出多阶段任务合成的两大失败根源:源信息逐步丢失与任务制品间漂移,提出三阶段方案:71K 技能库构建、五维情景重构、以及以’共享可执行状态’为核心的环境先行接地,按 I→S→V 顺序让指令/解法/验证器共享同一真实容器状态。基于 6078 个任务(每任务 22.77 项可执行检查)、仅 1.2K SFT 轨迹,即让 Qwen3.5-27B 在 Terminal-Bench 2.1 上提升 6.75 分,距 397B 巨兽仅差 1.49 分而参数少约 15 倍。

August 22, 2026 · 4 min

FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving 精读

深度精读中科院自动化所、国科大与腾讯微信联合发表的 FlashPrefill V2——面向长上下文 LLM 服务的训练免费块稀疏 prefill 注意力方案。针对前作「精度失控、内核落后、不兼容生产引擎」的三重差距,V2 以块均值校正补偿被剪枝块的注意力贡献、以对齐 FA3/4 的 warp 特化稀疏内核兑现稀疏收益、以原生 paged KV 与连续批处理无缝接入 SGLang。128K 上下文下 H20 算子级较 FA3/4 对齐 dense 基线加速 17.5 倍(FP8 达 30 倍),端到端 TTFT 最高 4.83 倍,而 RULER/LongBench 精度损失不足 1.1 分,是「算法-内核-系统」三层协同落地的教科书级范例。

August 22, 2026 · 6 min

Inducing Task Models from Computer-Use Traces 精读

计算机使用 agent 要真正进入真实工作,必须先搞清楚’这项工作实际是怎么做的’。Stanford 与 CMU 的这篇论文提出 TMI(TaskModelInduction),从被动录制的自然计算机使用轨迹中诱导结构化任务模型:先把多条交织的并发任务解缠成独立潜任务,再为每个任务构建’层次目标模型(做什么)+ 过程模型(怎么做)‘双模型。在受控轨迹上任务分组与 ground-truth 一致性达 0.974,重建 74.9% 的观测执行步骤;由任务模型派生的技能使 held-out 任务准确率提升 30.0%。本精读覆盖其问题定义、双模型解法、内外双层评估设计、优势根源与可推广的通用性灵感。

August 22, 2026 · 3 min

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use 精读

深度精读浙大 ZJUNLP 联合 NUS、东北大学、赫瑞瓦特大学与腾讯的 MemTrapBench——首个系统评估’记忆诱导认知陷阱’的基准。论文发现:忠实记录、语义相关的记忆仍可能扭曲模型推理与信念,1050 个对抗实例上所有记忆框架全面低于无记忆基线,最好的 EverMemOS 也落后 13.99 个百分点。文章拆解两类四情景陷阱分类、三段式对抗构建流水线、四组归因消融实验,以及仅靠推理时提示就挽回 14.9 个百分点的 AdaptiveMem 修复方案。

August 22, 2026 · 4 min

Phantom Gains: Auditing Self-Improvement Against a Measured Null 精读

深度精读 Phantom Gains——一篇审计 LLM 自训练’自我改进’证据的测量学论文。当社区从平均准确率转向逐题增益/损失转移分析时,转移统计本质上是两个噪声估计的差分,极易产生’幻影增益’。作者让一个冻结控制模型穿过与三轮 LoRA 自训练完全相同的流水线,识别出七类测量失效——每一类在缺少控制时都会反转结论:单次贪心解码的批处理伪影在未训练模型上制造能力变化、expansion 统计给冻结模型分配 0.28 的假获取率、阈值修复后的 null 依然非零。替代方案(逐问题精确检验 + 合并基线池 + FDR 控制)在任何 held-out 副本上检测不到任何真实转移。梯队实验进一步揭示:外部蒸馏能改善 base 模型未触及的问题而三种自训练不能,回归分析以 p<10⁻⁸ 拒绝该不对称性是总体增益差异的副产物。本文为转移级审计立下规矩:每个报告的统计量都需要单独测量的 null。

August 22, 2026 · 3 min

PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents 精读

深度精读 KAIST 与 DeepAuto.ai 产学合作论文 PolicyGuide:客服 LLM Agent 的合规失败不仅来自危险动作,更来自跳过身份核验、跳过确认等程序遗漏,而动作局部检查的运行时守卫无法引导多步流程。该工作把每个领域的策略编译为工作流图,在用户轮次边界调用前瞻验证器,从持久化图状态对账未决请求并返回步骤级补救,兼具外部守护与工作流强制双角色;在 τ²-bench 三域上将 GPT 5.4 平均 PASS⁴ 从 0.42 提升到 0.62,telecom 域从 0.19 跃至 0.61,同一工作流零改动迁移到 Claude Sonnet 4.6 与 Gemini 2.5 Pro。

August 22, 2026 · 4 min

Repo0: Design-Driven Zero-to-All Code Generation 精读

现有代码生成系统大多假设仓库架构已经设计好,只负责往里填代码。Repo0(上海交通大学 + 重庆大学,2026年8月)直面「零到全」生成:从一句自然语言需求出发,构建整个软件项目,同时推断功能与架构。它的核心是把软件设计从「一次性静态蓝图」变成「持续结构演化过程」——用需求 DAG + 组件 DAG + 对齐关系构成的双 DAG 架构状态,在内聚/耦合等模块化度量引导下,通过 split/merge/revise/add/save 五种结构动作迭代演化至收敛,再由收敛架构引导测试驱动开发生成。在 RepoCraft 六个真实仓库 × GPT-5 mini 与 DeepSeek V3.2 双骨干上,Repo0 全部设置 Functionality Coverage 与 Pass Rate 最高,相比最强基线 RPG,Pass Rate 最高提升 29.74 个百分点。本精读覆盖问题定义、双 DAG 机制、五种结构动作、跨模型互评设计、消融证据与通用灵感。

August 22, 2026 · 5 min