SWE-Proof: Can Language Models Resolve Real-World Issues with Machine-Checked Proofs? 精读
SWE-Proof 把 SWE 类基准的判定信号从「隐藏测试」升级为「机器检查的形式化证明」,提出 BENCHPROOFER 流水线(规范合成 + 环境公理化 + 13 道正确性门)与 SWE-PROOF 基准(500 例 SWE-Bench Verified 100% 过门 + 242 例 SWE-Bench Pro)。核心发现:隐藏测试只采样有限输入,会放过四分之一到一半的缺陷 patch;给定正确形式化规范可将解决率从 85.0%/81.2% 提升至 96.2%/94.4%,且对抗审计后仅损失 0.9 个百分点;但让模型自写规范对解决率零收益,瓶颈在于 faithfulness——规范只约束了部分行为面。本文按九部分结构拆解其背景、定位、问题定义、解法、评估、根源与外部交叉验证。