When Models Edit Too Much 精读:编码 Agent 的过度编辑病与保真度评测轴

NUS 团队在 400 个 BigCodeBench 任务上注入受控 AST 损坏、构造已知最小补丁的评测框架,系统刻画 over-editing:GPT-5.5 高 Pass@1 与大改动并存,一行 bug 修出 60 行代码;一条保存指令把超额编辑距离 0.195→0.131、认知复杂度降 26.6%、Pass@1 反升 2.3;SFT 过拟合已见损坏模式,RL 达 0.782 OOD Pass@1 + 0.050 超额距离且不伤通用编码能力。

September 6, 2026 · 2 min

SWE-Gate 精读:通过功能测试对软件工程 Agent 并不够

SWE-Gate(中山大学/浙大/重大)从真实 PR 评审评论中提取约束并构造 303 个仓库级修复实例,发现 644 个通过功能测试的补丁中 221 个(34.3%)违反评审约束——SWE-bench 式功能唯一评测系统性高估了 Agent 的真实修复能力。本文基于全文逐页阅读,拆解其约束提取管线、双测试设计与 221 个隐藏失败的分布规律。

September 5, 2026 · 2 min

Agent如何发现、阅读与书写技术文档:行为实证研究 精读

北大团队用557个真实Agent编码会话的94,813个事件与33,097个Agent PR的69万条文件变更,首次系统测量了编码Agent与技术文档的真实交互。四大发现颠覆行业直觉:60.5%的文档交互指向AGENTS.md等Agent自有工件而非经典技术文档;读文档→写代码的关联在数据上未获解析;零次显式文档验证;文档产出速率达咨询的0.87倍却始终滞后于代码。论文据此提出双瓣循环模型,并指出「可操作性」「可验证性」两大agent-friendly文档假设缺乏行为支撑。

August 23, 2026 · 4 min