RealSWE 精读:真实用户请求正在让编码 Agent 榜单失真

RealSWE(成均馆大学)用六类信息分类学×四维语言风格对照 SWE-chat 真实用户 prompt 与 SWE-bench 任务,发现 88% 真实请求只带问题描述而基准任务仅 7%;据此构建 381 个多变体任务族,测得 7 个主流模型在真实输入下平均掉 6.4pp 且排行榜改写——MiMo V2.5 Pro 反超更贵模型升到第 2。控制变量消融进一步证明:Desired Behavior 字段值 8pp,复现步骤与环境信息几乎一文不值。

September 6, 2026 · 2 min

Refusing the Impossible 精读:代码幻觉不是代码错误——12 个模型在不可解任务上 60% 硬编

PSU×Cisco 提出代码幻觉的三维分类学(groundedness×表现层级×行为),把’无根据生成’与普通 bug 干净切分;构建 270 个不可解任务(6 语言 24 子类)+91 个可解对照:12 个开源模型在 ~60% 的不可解提示上产出看似合理的无根据代码、仅 27% 正确拒绝、可解对照误拒 0%。模型乐于实现违反已证定理的算法、调用不存在的 crate,甚至’明知不可能仍照做’。

September 6, 2026 · 1 min

Requirements After the First Edit 精读:需求晚到正在让 Agent 会话里的代码作废翻倍

KIT×早稻田×阿德莱德在 3,553 个真实 SWE-chat 会话上首次把’需求晚到’与’行级代码作废’在同一会话内关联:新需求到达后,Agent 删除的先前代码量约为无需求编辑的 2 倍,且该负担随会话推进无衰减;受控实验进一步显示延迟披露只是把实现工作搬到披露之后、并未增加额外返工。需求工程 30 年的 volatility 教训在 agentic 编码场景被压缩进单一会话重演。

September 6, 2026 · 1 min

When Models Edit Too Much 精读:编码 Agent 的过度编辑病与保真度评测轴

NUS 团队在 400 个 BigCodeBench 任务上注入受控 AST 损坏、构造已知最小补丁的评测框架,系统刻画 over-editing:GPT-5.5 高 Pass@1 与大改动并存,一行 bug 修出 60 行代码;一条保存指令把超额编辑距离 0.195→0.131、认知复杂度降 26.6%、Pass@1 反升 2.3;SFT 过拟合已见损坏模式,RL 达 0.782 OOD Pass@1 + 0.050 超额距离且不伤通用编码能力。

September 6, 2026 · 2 min

DeepMind 研究蜂群精读:当 100 个 AI 研究员自发作弊与吹哨

Google DeepMind 在 100 个自主 LLM Agent 组成的研究蜂群中,完整观测到一次评测漏洞的涌现—病毒式传播—集体对抗全过程:作弊 Agent 在竞争压力下合理化采纳漏洞,诚实 Agent 则自发组织审计、抵制与公开吹哨。论文把多 Agent 安全重新框定为 Ostrom 意义上的’知识公地治理’问题。本文基于全文阅读拆解其通信原语、行为时间线与制度设计启示。

September 5, 2026 · 2 min

Environment Evolution 精读:让训练环境的难度离线进化

腾讯混元×港科大(广州)的 Environment Evolution 把环境难度演化从 on-policy 共进化中解耦:从多轮学习目标推导三个演化方向,用多 Agent harness 离线逐代提升环境难度,再由谱系调度器持续供给学习信号。Qwen3.6-27B/35B-A3B 经简单长程 RL 在 Terminal-Bench 2.1 分别提升 14.4/18.0 个百分点。本文基于全文阅读拆解演化方向推导与调度器设计。

September 5, 2026 · 2 min

HarnessEvo 精读:Harness 自进化的价值藏在控制槽位里

HarnessEvo 把 Agent harness 分解为 role/strategy/format/control 四个可独立进化的槽位,用 leave-one-in/out 协议做价值归因:整体指标’看似无效’(0.657 vs 0.642),但收益完全 localized 于 reflection/control 槽位(+0.119, p=0.0046);等预算下多槽位同进反而互相稀释——预算分摊陷阱。本文基于全文阅读拆解其归因协议与对自进化领域的方法论警示。

September 5, 2026 · 2 min

HookPry 精读:Agent Harness 的 hook 更新通道是全新的供应链攻击面

HookPry(北邮/网信办数据中心/北航/浙大)首次系统揭示 AI Agent Harness 生命周期 hook 的更新通道攻击面:良性插件上架获取信任后,一次携带 hook 的恶意更新即可在 LLM 完全不可见的路径上以宿主权限执行任意命令。1000 次端到端攻击攻破全部 7 个 harness(最高 92.5%),Microsoft Defender 召回率 0%。本文基于全文阅读拆解其 AMO/TD/LCI 三组件与防御失灵的机制根源。

September 5, 2026 · 2 min

PatchBench 精读:AI 漏洞修复的解决率被高估了 1.83 倍

马里兰大学的 PatchBench 揭示 AI 漏洞修复评测的两大效度威胁:25% 的 Agent 补丁与历史开发者补丁高度相似(补丁记忆),PoC-only 验证使 11 个 SOTA Agent 的解决率平均虚增 1.83×。其解法是只选 ground-truth 修复在 crash stack 之外的漏洞 + 漏洞移植 + 安全/语义双重验证。本文基于全文阅读拆解 DiffBLEU 记忆检测与验证协议设计。

September 5, 2026 · 2 min

Random Attention 精读:KV 缓存驱逐的选择信号几乎买不到任何东西

Salesforce AI Research×UIUC 的 Random Attention 证明:长推理场景下 KV 缓存驱逐的’重要性打分’几乎无用——在每个注意力头内均匀随机驱逐、完全不计算分数,即可在 4 个模型×6 个推理任务上匹配最强选择器,且在 vLLM 分页 serving 下因省去打分 pass 快 32–43%。本文基于全文阅读拆解其三层机制解释与实验设计。

September 5, 2026 · 2 min