Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees 精读

当 Agent 技能库膨胀到成千上万份文档,往上下文装哪几份技能直接决定任务成败与 token 账单。清华交叉信息研究院 Longbo Huang 组首次把「技能选择」形式化为硬 token 预算下最大化「单调次模收益减线性上下文惩罚」,并提出多项式算法 BPS,证明该问题首个双准则(1−1/e, 1)近似保证,收益系数多项式时间最优。目标函数从执行记录拟合,拟合误差可证转移到有界选择regret。在污染受控 BigCodeBench 变体上,BPS 达 0.73 实测成功率,对已发布路由器、检索器与执行器自选的 0.20–0.52 全面胜出,且比最强路由器省 28% token。本精读拆解其形式化、BPS 算法、预算对齐插值证明,以及「上下文价值是集合级而非单体可打分」的核心洞察。

August 23, 2026 · 6 min

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 精读

深度精读 Einsia.AI 与清华大学 2026 年 8 月提出的 AI4AI-Bench:首个隔离测量 LLM Agent 训练算法设计能力的基准。10 个冻结研究仓库、单块 B300 四小时改写、十二小时从零重跑、0/0.1/1.0 三锚点统一量表,29 个配置平均仅 0.166、最佳 0.250——最强系统连’已有算法到最优’距离的五分之一都没走完;而推理预算买到的主要是’敢去改’的意愿,参与率从 8% 提升到 64%。

August 22, 2026 · 3 min

EnvHarness: Awakening Static Worlds for Agent Learning 精读

深度精读 EnvHarness——与 Agent Harness 对称的环境侧革命:不改环境本身,在交互接口上包装一层可编程插件(Stage/Contract/Chain 三类组件),把静态冻结环境重塑为针对当前策略弱点的定制化训练场。EnvRigger 自动化引擎通过 Observe→Diagnose→Write→Validate 四阶段循环,自动诊断策略缺陷并生成验证过的组件,在 ALFWorld、WebArena、SWE-bench Verified、OfficeQA、SpreadsheetBench 五大基准上全面超越原环境与领域特定生成器,环境规模化收益持续未饱和。

August 22, 2026 · 4 min

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis 精读

深度精读 USTC+上海AI Lab+复旦合作的 FACET 论文——面向终端 agent 训练的任务合成框架。论文指出多阶段任务合成的两大失败根源:源信息逐步丢失与任务制品间漂移,提出三阶段方案:71K 技能库构建、五维情景重构、以及以’共享可执行状态’为核心的环境先行接地,按 I→S→V 顺序让指令/解法/验证器共享同一真实容器状态。基于 6078 个任务(每任务 22.77 项可执行检查)、仅 1.2K SFT 轨迹,即让 Qwen3.5-27B 在 Terminal-Bench 2.1 上提升 6.75 分,距 397B 巨兽仅差 1.49 分而参数少约 15 倍。

August 22, 2026 · 4 min

FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving 精读

深度精读中科院自动化所、国科大与腾讯微信联合发表的 FlashPrefill V2——面向长上下文 LLM 服务的训练免费块稀疏 prefill 注意力方案。针对前作「精度失控、内核落后、不兼容生产引擎」的三重差距,V2 以块均值校正补偿被剪枝块的注意力贡献、以对齐 FA3/4 的 warp 特化稀疏内核兑现稀疏收益、以原生 paged KV 与连续批处理无缝接入 SGLang。128K 上下文下 H20 算子级较 FA3/4 对齐 dense 基线加速 17.5 倍(FP8 达 30 倍),端到端 TTFT 最高 4.83 倍,而 RULER/LongBench 精度损失不足 1.1 分,是「算法-内核-系统」三层协同落地的教科书级范例。

August 22, 2026 · 6 min

Inducing Task Models from Computer-Use Traces 精读

计算机使用 agent 要真正进入真实工作,必须先搞清楚’这项工作实际是怎么做的’。Stanford 与 CMU 的这篇论文提出 TMI(TaskModelInduction),从被动录制的自然计算机使用轨迹中诱导结构化任务模型:先把多条交织的并发任务解缠成独立潜任务,再为每个任务构建’层次目标模型(做什么)+ 过程模型(怎么做)‘双模型。在受控轨迹上任务分组与 ground-truth 一致性达 0.974,重建 74.9% 的观测执行步骤;由任务模型派生的技能使 held-out 任务准确率提升 30.0%。本精读覆盖其问题定义、双模型解法、内外双层评估设计、优势根源与可推广的通用性灵感。

August 22, 2026 · 3 min

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use 精读

深度精读浙大 ZJUNLP 联合 NUS、东北大学、赫瑞瓦特大学与腾讯的 MemTrapBench——首个系统评估’记忆诱导认知陷阱’的基准。论文发现:忠实记录、语义相关的记忆仍可能扭曲模型推理与信念,1050 个对抗实例上所有记忆框架全面低于无记忆基线,最好的 EverMemOS 也落后 13.99 个百分点。文章拆解两类四情景陷阱分类、三段式对抗构建流水线、四组归因消融实验,以及仅靠推理时提示就挽回 14.9 个百分点的 AdaptiveMem 修复方案。

August 22, 2026 · 4 min

PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents 精读

深度精读 KAIST 与 DeepAuto.ai 产学合作论文 PolicyGuide:客服 LLM Agent 的合规失败不仅来自危险动作,更来自跳过身份核验、跳过确认等程序遗漏,而动作局部检查的运行时守卫无法引导多步流程。该工作把每个领域的策略编译为工作流图,在用户轮次边界调用前瞻验证器,从持久化图状态对账未决请求并返回步骤级补救,兼具外部守护与工作流强制双角色;在 τ²-bench 三域上将 GPT 5.4 平均 PASS⁴ 从 0.42 提升到 0.62,telecom 域从 0.19 跃至 0.61,同一工作流零改动迁移到 Claude Sonnet 4.6 与 Gemini 2.5 Pro。

August 22, 2026 · 4 min

Repo0: Design-Driven Zero-to-All Code Generation 精读

现有代码生成系统大多假设仓库架构已经设计好,只负责往里填代码。Repo0(上海交通大学 + 重庆大学,2026年8月)直面「零到全」生成:从一句自然语言需求出发,构建整个软件项目,同时推断功能与架构。它的核心是把软件设计从「一次性静态蓝图」变成「持续结构演化过程」——用需求 DAG + 组件 DAG + 对齐关系构成的双 DAG 架构状态,在内聚/耦合等模块化度量引导下,通过 split/merge/revise/add/save 五种结构动作迭代演化至收敛,再由收敛架构引导测试驱动开发生成。在 RepoCraft 六个真实仓库 × GPT-5 mini 与 DeepSeek V3.2 双骨干上,Repo0 全部设置 Functionality Coverage 与 Pass Rate 最高,相比最强基线 RPG,Pass Rate 最高提升 29.74 个百分点。本精读覆盖问题定义、双 DAG 机制、五种结构动作、跨模型互评设计、消融证据与通用灵感。

August 22, 2026 · 5 min

Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See 精读

当低资源语言推理微调只被一个准确率数字评判时,我们到底在测什么?Sophea AI 在三家 MoE、四个模型上用 11.8 万行希腊语语料做 SFT 与 RLVR 实验,发现最佳微调 arm 76.5 分竟低于基线 77.2 分,而随机种子的噪声地板高达 7.7 分——翻译基准准确率被训练噪声主导,几乎不携带信息。改用六维行为度量后结论完全翻转:SFT 让 98% 推理轨迹切换为问题语言、token 省 3 倍;RLVR 把格式违规从 24% 修到 2.5%、答案泄漏清零,且希腊语思考习惯 98.2% 保真。一篇把 null 结果写成方法学的罕见论文。

August 22, 2026 · 4 min