Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It? 精读
SWE-bench 上的高分到底是真实的仓库级推理能力,还是对训练语料的死记硬背?上海交通大学等机构提出 SchrodingerRepo 评测框架,把测试仓库从一份静态代码变成评估期才『定型』的潜变量:agent 进入环境前,仓库处于语义等价但表面形态不定的叠加态;进入环境后才按随机种子实例化为重命名、重排、重写过的陌生仓库。实验显示,所有受测 LLM 在 SWE-bench Verified 上解决率下降 6.0–14.4 个百分点(p<0.05),且超过八成的额外交互开销花在仓库探索上;而在时间上隔离污染的 SWE-rebench 实例上解决率不变、只有成本上升——说明退化确实来自对熟悉仓库线索的记忆依赖,而非任务变难。本精读覆盖其四级变换方法、四组实验证据、外部交叉验证与可推广启发。