When Models Edit Too Much 精读:编码 Agent 的过度编辑病与保真度评测轴
NUS 团队在 400 个 BigCodeBench 任务上注入受控 AST 损坏、构造已知最小补丁的评测框架,系统刻画 over-editing:GPT-5.5 高 Pass@1 与大改动并存,一行 bug 修出 60 行代码;一条保存指令把超额编辑距离 0.195→0.131、认知复杂度降 26.6%、Pass@1 反升 2.3;SFT 过拟合已见损坏模式,RL 达 0.782 OOD Pass@1 + 0.050 超额距离且不伤通用编码能力。