A Jagged Frontier: 代码Agent对语义保持变换的锯齿鲁棒性 精读

当代码库被改写成语义等价的形式——控制流重写、死代码注入、标识符重命名——修 bug 的代码 Agent 还靠得住吗?Colorado State、Microsoft、UIUC 与 CMU 四方合作,用一套随机变体采样器对 2 个 Agent 框架 × 4 个前沿模型 × 54 个 SWE-bench 实例做了首个仓库级 Agent 鲁棒性系统评估:多数配置出现小幅退化(最大平均 6.7 个百分点,16 个配置中 6 个统计显著),但更扎心的发现是「锯齿前沿」——没有任何模型鲁棒性排名能跨框架、跨基准保持稳定,Qwen 在一个框架下最鲁棒、换一个框架反而最脆弱;更简单的框架反而更皮实;即使 solve 率不掉,token 成本最多也要多花 22.9%。本精读覆盖其 14 种语义保持变换的设计、非反馈采样的下界逻辑、配对实验统计方法,以及锯齿现象背后的机制因果链。

August 23, 2026 · 9 min

Adversarial Review: Structured Disagreement for Grounded Agentic Code Review 精读

康奈尔与斯坦福的两位研究者提出 Adversarial Review(AR):主编码 Agent 冻结工件后,reviewer 评审、critic 以结构化分歧审计这份评审,收敛后才允许修改代码。AR 在 LiveCodeBench 上以三个 Agent 取得 87% 最高通过率,胜过五 Agent 的 MARS;在 SWE-PRBench 上先暴露「伪共识」失败模式——Agent 为一致而一致,再用一次 prompt 迭代把分歧显式化即取得最高 F1 0.533;在 SWE-bench Verified 上以纯文本 SKILL.md 协议达到 75.2%。本精读拆解其构造式方法、三基准证据链,以及「分歧必须最小、结构化、有证据」的设计哲学。

August 23, 2026 · 7 min

Agent如何发现、阅读与书写技术文档:行为实证研究 精读

北大团队用557个真实Agent编码会话的94,813个事件与33,097个Agent PR的69万条文件变更,首次系统测量了编码Agent与技术文档的真实交互。四大发现颠覆行业直觉:60.5%的文档交互指向AGENTS.md等Agent自有工件而非经典技术文档;读文档→写代码的关联在数据上未获解析;零次显式文档验证;文档产出速率达咨询的0.87倍却始终滞后于代码。论文据此提出双瓣循环模型,并指出「可操作性」「可验证性」两大agent-friendly文档假设缺乏行为支撑。

August 23, 2026 · 4 min

Can Agent Memory Systems Track Evolving State? StateMemBench 精读

LLM Agent 走向跨会话长程任务后,记忆系统能否跟上不断被修订的世界状态?UIUC Jiawei Han 组把「状态追踪」从「事实回忆」中剥离:答案必须反映当前状态而非被取代的旧状态。论文先证明「状态漂移」在检索完美时仍是最大失败源,再发布 StateMemBench——234 个多会话场景、闭集三分评分,把漂移答案显式放入干扰池;随后提出显式追踪取代与依赖的 StateMem,在 DeepSeek-V4-Flash 上把准确率从 0.205 提到 0.363(1.8 倍),并以单次调用 Wrapper 给六个记忆后端带来 +32 到 +67 点提升。精读覆盖定义、构造、机制与根源解释。

August 23, 2026 · 7 min

Credit Without Ground Truth: 步级信用分配的执行回放审计 精读

USC 单作者论文用「执行回放」为 LLM Agent 的步级信用信号建立因果真值:在每个决策点重采样策略自身支持的动作并前滚,度量结局分布的实际改变。审计结论是全面否定——LLM judge 分数、结果条件化 logprob 比、策略自身置信度识别因果关键步骤均不优于随机;implicit 信用实为策略流畅度的回声(秩相关 +0.75),结果条件化不增加任何因果信息(偏相关 -0.004);七臂预注册训练实验中无一臂可靠超过未训练策略,表面差异全由训练剂量解释。本文精读其仪器设计、否定性证据链、剂量匹配协议与完整性分类学,并讨论它对整个步级信用分配赛道的冲击。

August 23, 2026 · 7 min

MidTool: 面向Agent工具使用的中期训练数据合成 精读

工具使用是 LLM Agent 的核心能力,但此前几乎全靠后训练习得。MidTool(华盛顿大学 + Snowflake + UNC,工作完成于 Snowflake 实习)提出首个面向通用工具使用的开放中期训练语料管线:从网页、PDF、代码、真实 API 与 MCP 技能四类源出发,经「上下文接地增广」与「原生 Agent 轨迹合成」两条分支构建 20.3B token 的 MidTool-Mix,中期训练 Qwen3-4B/8B-Base 后再统一 SFT+RL。在 BFCL、τ²-Bench、MCP Universe 三基准上,两种后训练配方下均一致超过 SFT-only 基线,RL 通常进一步放大增益,MCP-Universe 上 4B/8B 全面超过 Qwen3 官方同尺寸模型。本精读覆盖背景、定位、问题抽象、管线解法、实验证据、机制因果链、必要知识反推与可迁移灵感。

August 23, 2026 · 6 min

MileGPO: 里程碑推断的长程Agent过程级信用分配 精读

北交大团队提出 MileGPO,针对长程 LLM Agent 训练中最棘手的过程级信用分配问题:GraphGPO 等图方法按最短路径距离赋信用,只能刻画「可达性」而非「可靠进展」。MileGPO 从同一 rollout 图中挖出三类被忽视的信号——成功轨迹的候选里程碑、失败轨迹的反复陷阱、同状态兄弟分支对比——经可靠性加权塑形 RCS 与进度对比校准 PCC 两级校准后注入优势估计。ALFWorld 整体成功率 94.60,超 GraphGPO 3.13 点、超 GiGPO 4.43 点;ID–OOD 差距仅 1.69 点;WebShop 同状态平局率达 72.7%,图上 83.0% 的平局可被 RCS 纠正。全程零辅助模型、零额外环境交互,本精读重点拆解「共享状态覆盖率相同、歧义结构决定增益」的机制因果链。

August 23, 2026 · 5 min

One Success Isn't Reliability: Thinkingbox 沙盒与基准 精读

微软联合匹兹堡大学、西北大学、UC Irvine 发布 THINKINGBOX 沙盒与 THINKINGBOX-BENCH 基准:507 个政策条件化的有状态业务工作流,覆盖零售、酒店、车险、新银行 IT 与咨询 IT/HR 五域,用隔离的 MCP 工具会话、模拟用户与终端后端状态检查评测 Agent。最强模型 GPT-5.4 pass@1 仅 65.36%,pass@20 高达 91.12% 但 20 次全过的 pass^20 仅 25.25%,暴露「偶尔成功」与「可靠完成」之间的巨大鸿沟;79,853 次失败试验中 80.88% 干净终止且含写操作,证明响应级/调用级信号无法代理端到端完成。本精读覆盖其 POMDP 形式化、评测协议、失败归因与可靠性根源分析。

August 23, 2026 · 7 min

Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees 精读

当 Agent 技能库膨胀到成千上万份文档,往上下文装哪几份技能直接决定任务成败与 token 账单。清华交叉信息研究院 Longbo Huang 组首次把「技能选择」形式化为硬 token 预算下最大化「单调次模收益减线性上下文惩罚」,并提出多项式算法 BPS,证明该问题首个双准则(1−1/e, 1)近似保证,收益系数多项式时间最优。目标函数从执行记录拟合,拟合误差可证转移到有界选择regret。在污染受控 BigCodeBench 变体上,BPS 达 0.73 实测成功率,对已发布路由器、检索器与执行器自选的 0.20–0.52 全面胜出,且比最强路由器省 28% token。本精读拆解其形式化、BPS 算法、预算对齐插值证明,以及「上下文价值是集合级而非单体可打分」的核心洞察。

August 23, 2026 · 6 min

ReCache: 工具增强Agent的组合不变KV缓存复用 精读

工具增强Agent每个请求都要重新编码一遍以不同组合、不同顺序出现的工具与技能schema,标准前缀缓存对此无能为力。ReCache提出resource-wise attention,切断资源间注意力并重置资源内位置索引,使每个资源的KV块具有组合不变性、可独立缓存复用;再叠加贡献选择的层-KV头组路由与字段感知的语义剪枝,把KV张量内存降低92.43%、注意力加速1.423倍,同时Inv-F1基本不降。本精读覆盖其动机、机制、七数据集基准与效果根源分析。

August 23, 2026 · 3 min