Refusing the Impossible 精读:代码幻觉不是代码错误——12 个模型在不可解任务上 60% 硬编

PSU×Cisco 提出代码幻觉的三维分类学(groundedness×表现层级×行为),把’无根据生成’与普通 bug 干净切分;构建 270 个不可解任务(6 语言 24 子类)+91 个可解对照:12 个开源模型在 ~60% 的不可解提示上产出看似合理的无根据代码、仅 27% 正确拒绝、可解对照误拒 0%。模型乐于实现违反已证定理的算法、调用不存在的 crate,甚至’明知不可能仍照做’。

September 6, 2026 · 1 min

When Models Edit Too Much 精读:编码 Agent 的过度编辑病与保真度评测轴

NUS 团队在 400 个 BigCodeBench 任务上注入受控 AST 损坏、构造已知最小补丁的评测框架,系统刻画 over-editing:GPT-5.5 高 Pass@1 与大改动并存,一行 bug 修出 60 行代码;一条保存指令把超额编辑距离 0.195→0.131、认知复杂度降 26.6%、Pass@1 反升 2.3;SFT 过拟合已见损坏模式,RL 达 0.782 OOD Pass@1 + 0.050 超额距离且不伤通用编码能力。

September 6, 2026 · 2 min