The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models 精读

这篇来自 VIDRAFT AI Research(韩国)的论文证明:‘看 mask’这个全行业默认的因果性检查,在混合架构时代完全失效——192 次注入故障中 mask 检查 0/192 发现,而两次前向传播的前缀不变性审计 192/192 精确定位到泄漏层。更重磅的是实际战果:在两个已发布模型(Zamba2-1.2B 与 Nemotron-H-8B)中挖出真实因果泄漏——chunk 边界处未来信息泄漏进当前表示,缺陷源于同一段三行代码(inter-chunk 递归 reduce 求和轴错误),两行修复后泄漏精确归零。方法只需两次前向、无梯度,135M 模型 CPU 上半秒。

August 25, 2026 · 2 min

What Process Evaluation of Coding Agents Actually Measures: Action, Task, and Step Are Three Different Levels 精读

这篇 ICLR 2027 论文(阿里 Amap × 南京大学)用结构因果模型(SCAE)把编码 Agent 的’过程评测’拆成三个被混用的层次,并给出三个可检验的颠覆性结论:下一动作由’执行出处’(provenance,模型刚看到什么)而非代码图结构决定(top-3 0.326 vs 0.058);不确定性属于任务而非步骤(190 个步骤级因果效应 0 个通过 FDR);全轨迹 LLM judge 存在系统性 collider 偏置——judge 能看到下游步骤时,归责位置系统性后移 +0.537。‘过程分数测的是语义相关性,不是认证的因果贡献。’

August 25, 2026 · 2 min

Phantom Gains: Auditing Self-Improvement Against a Measured Null 精读

本文精读 arXiv 2608.20290《Phantom Gains: Auditing Self-Improvement Against a Measured Null》。论文指出:逐题得失(transition-level)分析已成为自我改进研究的标准证据,但一次得失是两个含噪估计之差,极易产生测量伪影。作者让一个从未训练的冻结模型走完完全相同的评估管道,实测每个统计量的噪声底,识别出七种测量失败——单次贪心解码、m=1 扩展统计量、固定 token 上限、欠功效、单训练种子、欠功效探针、只测一次的零假设——每一种在缺少对照时都会反转一个结论。受控审计表明:外部蒸馏能真正改进基模型几乎够不到的题,而三种自训练不能;自训练毁掉的题远超噪声底;其全部新增解均为锐化而非能力扩张。论文主张:逐题审计必须为每个统计量单独实测零假设。

August 24, 2026 · 5 min

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 精读

SWE-bench Science 由上海创新研究院与复旦大学联合提出,是一个仓库级科学软件工程基准:119 个任务、98 个真实 GitHub 仓库、覆盖 20 个科学领域,通过证据链协议将公有测试与私有科学断言物理隔离,并把任务分为 Issue 驱动、专家探索、工程集成三种范式。八个前沿 coding agent 横评中最高 Pass@1 仅 47.90%(Claude-Opus-5),而同配置公开分高达 96.64%,暴露出「表面修复」问题。论文还人工归因出四类失败机制,并用 91 任务配对消融证明科学知识注入并非普遍有益——错位信息反而诱发锚定。

August 24, 2026 · 4 min

Adversarial Review: Structured Disagreement for Grounded Agentic Code Review 精读

康奈尔与斯坦福的两位研究者提出 Adversarial Review(AR):主编码 Agent 冻结工件后,reviewer 评审、critic 以结构化分歧审计这份评审,收敛后才允许修改代码。AR 在 LiveCodeBench 上以三个 Agent 取得 87% 最高通过率,胜过五 Agent 的 MARS;在 SWE-PRBench 上先暴露「伪共识」失败模式——Agent 为一致而一致,再用一次 prompt 迭代把分歧显式化即取得最高 F1 0.533;在 SWE-bench Verified 上以纯文本 SKILL.md 协议达到 75.2%。本精读拆解其构造式方法、三基准证据链,以及「分歧必须最小、结构化、有证据」的设计哲学。

August 23, 2026 · 7 min

Agent如何发现、阅读与书写技术文档:行为实证研究 精读

北大团队用557个真实Agent编码会话的94,813个事件与33,097个Agent PR的69万条文件变更,首次系统测量了编码Agent与技术文档的真实交互。四大发现颠覆行业直觉:60.5%的文档交互指向AGENTS.md等Agent自有工件而非经典技术文档;读文档→写代码的关联在数据上未获解析;零次显式文档验证;文档产出速率达咨询的0.87倍却始终滞后于代码。论文据此提出双瓣循环模型,并指出「可操作性」「可验证性」两大agent-friendly文档假设缺乏行为支撑。

August 23, 2026 · 4 min

Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees 精读

当 Agent 技能库膨胀到成千上万份文档,往上下文装哪几份技能直接决定任务成败与 token 账单。清华交叉信息研究院 Longbo Huang 组首次把「技能选择」形式化为硬 token 预算下最大化「单调次模收益减线性上下文惩罚」,并提出多项式算法 BPS,证明该问题首个双准则(1−1/e, 1)近似保证,收益系数多项式时间最优。目标函数从执行记录拟合,拟合误差可证转移到有界选择regret。在污染受控 BigCodeBench 变体上,BPS 达 0.73 实测成功率,对已发布路由器、检索器与执行器自选的 0.20–0.52 全面胜出,且比最强路由器省 28% token。本精读拆解其形式化、BPS 算法、预算对齐插值证明,以及「上下文价值是集合级而非单体可打分」的核心洞察。

August 23, 2026 · 6 min

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 精读

东京大学团队提出Task-CoEvolve,让验证任务集与harness共进化:用方差加权采样把评估预算聚焦在候选harness分歧最大的能力前沿任务上,再用Horvitz-Thompson/Hájek类估计器从采样子集无偏还原全量分数。在Terminal-Bench 2.1上仅用20%预算就逼近全量搜索(均值51.7 vs 52.8),整体搜索成本降67-80%;文本分类7%预算接近全量、20%预算反超。本精读覆盖背景、定位、方法机制、实验证据、效果根源因果链、必要知识反推与通用灵感九个部分。

August 23, 2026 · 6 min

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use 精读

深度精读浙大 ZJUNLP 联合 NUS、东北大学、赫瑞瓦特大学与腾讯的 MemTrapBench——首个系统评估’记忆诱导认知陷阱’的基准。论文发现:忠实记录、语义相关的记忆仍可能扭曲模型推理与信念,1050 个对抗实例上所有记忆框架全面低于无记忆基线,最好的 EverMemOS 也落后 13.99 个百分点。文章拆解两类四情景陷阱分类、三段式对抗构建流水线、四组归因消融实验,以及仅靠推理时提示就挽回 14.9 个百分点的 AdaptiveMem 修复方案。

August 22, 2026 · 4 min

Phantom Gains: Auditing Self-Improvement Against a Measured Null 精读

深度精读 Phantom Gains——一篇审计 LLM 自训练’自我改进’证据的测量学论文。当社区从平均准确率转向逐题增益/损失转移分析时,转移统计本质上是两个噪声估计的差分,极易产生’幻影增益’。作者让一个冻结控制模型穿过与三轮 LoRA 自训练完全相同的流水线,识别出七类测量失效——每一类在缺少控制时都会反转结论:单次贪心解码的批处理伪影在未训练模型上制造能力变化、expansion 统计给冻结模型分配 0.28 的假获取率、阈值修复后的 null 依然非零。替代方案(逐问题精确检验 + 合并基线池 + FDR 控制)在任何 held-out 副本上检测不到任何真实转移。梯队实验进一步揭示:外部蒸馏能改善 base 模型未触及的问题而三种自训练不能,回归分析以 p<10⁻⁸ 拒绝该不对称性是总体增益差异的副产物。本文为转移级审计立下规矩:每个报告的统计量都需要单独测量的 null。

August 22, 2026 · 3 min