One Success Isn't Reliability: Thinkingbox 沙盒与基准 精读

微软联合匹兹堡大学、西北大学、UC Irvine 发布 THINKINGBOX 沙盒与 THINKINGBOX-BENCH 基准:507 个政策条件化的有状态业务工作流,覆盖零售、酒店、车险、新银行 IT 与咨询 IT/HR 五域,用隔离的 MCP 工具会话、模拟用户与终端后端状态检查评测 Agent。最强模型 GPT-5.4 pass@1 仅 65.36%,pass@20 高达 91.12% 但 20 次全过的 pass^20 仅 25.25%,暴露「偶尔成功」与「可靠完成」之间的巨大鸿沟;79,853 次失败试验中 80.88% 干净终止且含写操作,证明响应级/调用级信号无法代理端到端完成。本精读覆盖其 POMDP 形式化、评测协议、失败归因与可靠性根源分析。

August 23, 2026 · 7 min

Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees 精读

当 Agent 技能库膨胀到成千上万份文档,往上下文装哪几份技能直接决定任务成败与 token 账单。清华交叉信息研究院 Longbo Huang 组首次把「技能选择」形式化为硬 token 预算下最大化「单调次模收益减线性上下文惩罚」,并提出多项式算法 BPS,证明该问题首个双准则(1−1/e, 1)近似保证,收益系数多项式时间最优。目标函数从执行记录拟合,拟合误差可证转移到有界选择regret。在污染受控 BigCodeBench 变体上,BPS 达 0.73 实测成功率,对已发布路由器、检索器与执行器自选的 0.20–0.52 全面胜出,且比最强路由器省 28% token。本精读拆解其形式化、BPS 算法、预算对齐插值证明,以及「上下文价值是集合级而非单体可打分」的核心洞察。

August 23, 2026 · 6 min

ReCache: 工具增强Agent的组合不变KV缓存复用 精读

工具增强Agent每个请求都要重新编码一遍以不同组合、不同顺序出现的工具与技能schema,标准前缀缓存对此无能为力。ReCache提出resource-wise attention,切断资源间注意力并重置资源内位置索引,使每个资源的KV块具有组合不变性、可独立缓存复用;再叠加贡献选择的层-KV头组路由与字段感知的语义剪枝,把KV张量内存降低92.43%、注意力加速1.423倍,同时Inv-F1基本不降。本精读覆盖其动机、机制、七数据集基准与效果根源分析。

August 23, 2026 · 3 min

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 精读

东京大学团队提出Task-CoEvolve,让验证任务集与harness共进化:用方差加权采样把评估预算聚焦在候选harness分歧最大的能力前沿任务上,再用Horvitz-Thompson/Hájek类估计器从采样子集无偏还原全量分数。在Terminal-Bench 2.1上仅用20%预算就逼近全量搜索(均值51.7 vs 52.8),整体搜索成本降67-80%;文本分类7%预算接近全量、20%预算反超。本精读覆盖背景、定位、方法机制、实验证据、效果根源因果链、必要知识反推与通用灵感九个部分。

August 23, 2026 · 6 min

【每日AI前沿追踪】2026年8月22日 核心技术与产业动态速递

神秘模型Ox Alpha免费周登顶编程榜,DeepSWE 80%碾压Fable 5与Sol,分词器指纹指向智谱GLM-5.3 Flash,中美前沿差距实质缩小;可靠性评测三线合流——Thinkingbox揭示pass@k与pass^k鸿沟、信用分配信号全部失效审计、记忆状态追踪基准;NVIDIA证明harness使Opus 5在ARC-AGI-3从30%跃至100%满分;GPT-5.6 Sol降价20%至4美元,智能成本六个月下降56倍;世界人形机器人运动会2056台机器人参赛,天工Ultra百米9.39秒打破博尔特纪录。

August 22, 2026 · 9 min

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 精读

深度精读 Einsia.AI 与清华大学 2026 年 8 月提出的 AI4AI-Bench:首个隔离测量 LLM Agent 训练算法设计能力的基准。10 个冻结研究仓库、单块 B300 四小时改写、十二小时从零重跑、0/0.1/1.0 三锚点统一量表,29 个配置平均仅 0.166、最佳 0.250——最强系统连’已有算法到最优’距离的五分之一都没走完;而推理预算买到的主要是’敢去改’的意愿,参与率从 8% 提升到 64%。

August 22, 2026 · 3 min

EnvHarness: Awakening Static Worlds for Agent Learning 精读

深度精读 EnvHarness——与 Agent Harness 对称的环境侧革命:不改环境本身,在交互接口上包装一层可编程插件(Stage/Contract/Chain 三类组件),把静态冻结环境重塑为针对当前策略弱点的定制化训练场。EnvRigger 自动化引擎通过 Observe→Diagnose→Write→Validate 四阶段循环,自动诊断策略缺陷并生成验证过的组件,在 ALFWorld、WebArena、SWE-bench Verified、OfficeQA、SpreadsheetBench 五大基准上全面超越原环境与领域特定生成器,环境规模化收益持续未饱和。

August 22, 2026 · 4 min

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis 精读

深度精读 USTC+上海AI Lab+复旦合作的 FACET 论文——面向终端 agent 训练的任务合成框架。论文指出多阶段任务合成的两大失败根源:源信息逐步丢失与任务制品间漂移,提出三阶段方案:71K 技能库构建、五维情景重构、以及以’共享可执行状态’为核心的环境先行接地,按 I→S→V 顺序让指令/解法/验证器共享同一真实容器状态。基于 6078 个任务(每任务 22.77 项可执行检查)、仅 1.2K SFT 轨迹,即让 Qwen3.5-27B 在 Terminal-Bench 2.1 上提升 6.75 分,距 397B 巨兽仅差 1.49 分而参数少约 15 倍。

August 22, 2026 · 4 min

FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving 精读

深度精读中科院自动化所、国科大与腾讯微信联合发表的 FlashPrefill V2——面向长上下文 LLM 服务的训练免费块稀疏 prefill 注意力方案。针对前作「精度失控、内核落后、不兼容生产引擎」的三重差距,V2 以块均值校正补偿被剪枝块的注意力贡献、以对齐 FA3/4 的 warp 特化稀疏内核兑现稀疏收益、以原生 paged KV 与连续批处理无缝接入 SGLang。128K 上下文下 H20 算子级较 FA3/4 对齐 dense 基线加速 17.5 倍(FP8 达 30 倍),端到端 TTFT 最高 4.83 倍,而 RULER/LongBench 精度损失不足 1.1 分,是「算法-内核-系统」三层协同落地的教科书级范例。

August 22, 2026 · 6 min

Inducing Task Models from Computer-Use Traces 精读

计算机使用 agent 要真正进入真实工作,必须先搞清楚’这项工作实际是怎么做的’。Stanford 与 CMU 的这篇论文提出 TMI(TaskModelInduction),从被动录制的自然计算机使用轨迹中诱导结构化任务模型:先把多条交织的并发任务解缠成独立潜任务,再为每个任务构建’层次目标模型(做什么)+ 过程模型(怎么做)‘双模型。在受控轨迹上任务分组与 ground-truth 一致性达 0.974,重建 74.9% 的观测执行步骤;由任务模型派生的技能使 held-out 任务准确率提升 30.0%。本精读覆盖其问题定义、双模型解法、内外双层评估设计、优势根源与可推广的通用性灵感。

August 22, 2026 · 3 min