论文链接:Coding Agents Have Converged 代码仓库:Adkid-Zephyr/resolution-audit 发表时间:2026年9月 机构:Imperial College London + 香港理工大学 + Korea University + 暨南大学 领域标签:cs.SE / Agent Evaluation / Benchmark Saturation

一、论文背景

SWE-bench 是什么:从真实 GitHub issue 构建的代码智能体基准——agent 读 issue、改仓库、跑测试,以"解决实例数"计分。Verified 子集 500 实例经人工校验,是业界引用最密的 coding agent 排名来源:前两名各解 396 题,再往下 6 个系统都在 14 题以内——榜单显示 1-8 名,被广泛读作能力排序,用于模型选型、采购与研究汇报。

榜单质量质疑的两条线:第一条问"题目好不好"——自动审计发现超四分之一任务有质量问题、过滤后排名变化且均分 +9.9%,还有弱测试/泄漏/幸运通过等发现。第二条问本文的核心:即使题目都好,这些名次读得出吗?两者正交:前者审任务,后者审比较。

为什么紧迫:榜单日趋饱和之际,大量企业正构建内部基准选型——如果"分数差 1 题"根本不构成统计证据,据此做的采购与研究结论都是噪声。

二、论文定位和关联工作

研究脉络代表工作核心思想与本文关键区别
SWE-bench 任务质量SWE-bench+、SWE-bench Illusion、AgentLens任务缺陷/泄漏/幸运通过审"题目",本文审"排名"
榜单可分性诊断Kotawala 2026(paired LLM eval)配对分辨诊断,不可分是例外(11/40、4/9)本文:Verified 前沿 29/29 全不可分
排名区间Neuhof & Benjamini rank intervals层次模型给排名区间提供不确定度,不定位机制
基准功效分析Card et al.(little power)、tinyBenchmarks样本量与降维设计均值功效,非配对前沿
IR 测试集可靠性Sakai、Sanderson & Zobel、Roitero et al.n_eff 与主题集设计传统本文把该传统引入 agent 评测
心理测量学IRT 两参模型、KR-20项目区分度/内部一致性诊断"区分度对着全池而非前沿"

定位结论:这是一篇评测审计方法学论文——不跑任何模型,只用榜单已经公开的逐实例判定矩阵,给出比既往 leaderboard 审计极端得多的结论(29/29 vs 11/40),并把"为什么读不了"归因到可检验的机制(解集嵌套)。

三、问题定义

具体场景:SWE-bench Verified 榜单前两名同解 396/500,前十里 6 个系统挤在 14 题内——这些 1-2 题的差距支持"谁更强"的读法吗?

抽象问题:一个基准对给定比较集的有效分辨率是多少——多少实例真正参与区分,相邻差距是否经得起配对检验,分数该以"严格排名"还是"分档"呈现。

形式化:定义退化实例(比较集内全对或全错,对任何组内比较零贡献)与有效规模 n_eff(S)=|{i: 0<resolved_S(i)<|S|}|;嵌套系数 cov(A,B)=|A∩B|/|B| 对"仅按得分随机分配"的期望基线 E[cov]=|A|/n;相邻对用精确 McNemar 检验;分档用 leader 规则(与当前档 лидер不可分则同档)。

精妙之处:n_eff 是 (benchmark, 比较集) 的联合属性而非基准固有属性——同一 Verified 全池 n_eff/n=0.94(很健康),Top10 内只剩 0.33(近乎失效)。“基准饱和"不是基准的属性,是前沿比较集的属性。

四、问题解法

五步审计协议(Protocol 1):

  1. Profile:对嵌套比较集(全池→Top50→Top20→Top10→Top2)算 n_eff,定位分辨率在哪里塌掉;
  2. Explain:嵌套系数对得分隐含基线,量化"共享成功"超出随机多少(机制归因);
  3. Test:全部配对精确 McNemar,报原始+Holm 校正 p 值;
  4. Partition:走排序表做 leader-based tier,报告对规则/校正的敏感性;
  5. Budget:反演配对条件 |b−c|≥1.96√(b+c),给"再收多少实例才能分开这对"定价。

机制检验三板斧(排除替代解释):IRT 拟合(区分度高的退化实例——它们区分 2023-2025 全程但对 2025 年系统零区分——证明"项目区分度"对着全池而非前沿);人工工时标注(285 全对题 49% 标”<15 分钟"、0 题">4 小时"——退化不是任务损坏);PR 年份相关(−0.069,无年龄效应——非污染驱动)。

model×scaffold 重构:手工规范化 134 个提交的模型标签,得 34 scaffold×30 模型×55 格子——榜单分数是 (模型, scaffold) 对的属性,而榜单两个因子都不展示。

五、评估指标与实验证据

发现关键数字证明什么
有效规模塌缩全池 n_eff/n=0.94 → Top10 0.33 → Top2 0.07(36 题)分辨率是比较集函数
解集嵌套前沿嵌套系数 0.935 vs 基线 0.774;每档均超基线收敛机制=共享成功,非互补
组合上限Top2 并集 414 vs 最佳 396;Top10 并集 449互补收益小且需"组合"而非"排序"
相邻不可分Verified 29 对 0 可分(最小 p=0.545);Lite 29 对 0 可分前沿排名无统计支撑
反例检验Test split(2294 题)23 对中 14 可分同方法在未收敛比较集正常工作
scaffold 效应claude-3-5-sonnet 九 scaffold 差 149 题(29.8pp);Top30 总差 8.8pp分数非模型属性;复制底线 5.4pp
交互反转epam-ai-run vs agentless 在两模型间反号(−75.5 题,p<0.001)固定 scaffold 校正救不回模型排名
退休不可救重打分于 209 非退化题:差距 8.8→18.7pp,3 对换位,可分仍 0/29配对检验本就忽略共识题——退休买规模不买分辨率
分档敏感性435 对全检:44.6% 原始可分、9.4% 过 Holm;四种规格得 2-3 档档数依赖规则,须随附声明

证明力分析:Test split 反例是全文最强设计——同一统计量在 Verified 找不到任何东西、在 Test 找到 14/23,证明"29/29 不可分"是收敛比较集的现象而非方法失灵或基准家族缺陷。反过来,734,000 实例的独立样本参照(检测 0.2pp 差距@80% 功效)与 26,000 同质实例的配对定价形成数量级锚:光堆同质题没用,要故意收不一致且方向倾斜的题(54/500 不一致率下,倾斜 0.2 只需约 900 题)。

六、效果优势的根源解释

根源机制与证据链

  1. 嵌套是分辨率丧失的直接机制(论文实验已支持):前沿系统弱者的解集几乎被强者包含(0.935)——多出的"信息性实例"里双方你对我错基本对消(McNemar 的 b≈c),|b−c| 无法越过 1.96√(b+c)。机制链:前沿模型能力同质化→解同一批题→嵌套→不一致近似平衡→配对差恒不显著。
  2. 退化不是任务缺陷(论文实验已支持):工时标注/IRT/年龄三重检验排除"全对题是坏题"“全错题是坏题"“污染"三个替代解释——剩余解释就是真的共同会做/都不会做。
  3. 分数的 (model×scaffold) 二元性(论文实验已支持,观察性):同模型 scaffold 差 29.8pp + 交互反转(scaffold 排序依模型变号)→“榜单名次=模型能力"的读法在两个方向上都破产:跨模型不可比(scaffold 混杂)、固定 scaffold 也不行(交互反转)。加性拟合 scaffold 效应幅度 37.6pp vs 模型 47.9pp(比值 0.78)——同数量级。
  4. 纸面 oracle 与实际达成的鸿沟(论文数据间接支持):Top10 的 oracle(任一系统解出)达 90%,但任何单一系统 79%——嵌套结构使"选对系统"的上限收益只剩组合价值(+18 题),远小于榜单表面差距暗示的想象空间。

相关工作检索与对照

研究相似尝试相关结论与本文差异影响
Kotawala, Resolution diagnostics(2605.30315)配对 LLM 评测分辨诊断不可分是例外(11/40、4/9)本文场景远极端(29/29)支持:配对诊断方法可用;补充:饱和前沿的极端形态
SWE-bench Illusion(ICSE-SEIP 2026)记忆 vs 推理给 issue 文本即可 76% 定位 bug 文件污染维度限定:本文年龄检验未见效应,但年龄只是污染代理
AgentLens(2605.12925)幸运通过通过≠正确实现任务效度维度补充:本文采信 harness 判定,两者正交
Rank intervals(2606.08679)排名区间名次应有不确定度带前置工作支持:严格排名过度承诺的一致结论
tinyBenchmarks(ICML 2024)少样本基准设计8% 题可估全榜分均值估计限定:省题不等于保分辨率——本文退休实验反证
MAST(2503.13657)MAS 失败分类系统层失败普遍正交维度支持:agent 评测需系统视角

相反结论检索:未发现主张"Verified 前沿差距具备统计意义"的研究;最接近的张力是"退休退化题"直觉——本文用图 4 直接证伪(重打分后差距视觉放大但可分对数不变),这是对社区流行修复方案的有力否证。

综合判断与未决问题

多研究共同支持:(1) 前沿不可分(本文+rank intervals 的不确定度方向);(2) 分数混杂 scaffold(与 SWE-RL/AceCoder 训练报告中 scaffold 敏感性的普遍观察一致)。仍属推测:scaffold 效应的因果分离——观察性 2×2 设计无法排除团队投入共线;需要受控同 harness 因子实验(论文列为 future work)。适用边界:单一基准家族、单一 harness、自愿提交池;协议本身可移植但量值未必。可能失效条件:若新模型能力出现代际跳变(解集去嵌套化),分辨率会自然恢复——审计应周期性重跑。

七、必要知识反推

领域知识层:SWE-bench 榜单机制(每提交公开逐实例判定——这是审计得以可能的前提;多数榜单不公开,审计无从下手);agent scaffold 生态(epam-ai-run/sweagent/agentless/autocoderover 各自的结构差异)——重构 2×2 设计需要知道谁是谁。

方法论知识层:配对检验设计(McNemar 的 b/c 不一致计数直觉);多重比较校正(Holm 家族定义怎么影响档数);IR 测试集传统的 n_eff 概念;心理测量学 IRT/KR-20(并知道它们为什么不够——区分度对全池);bootstrap 与功效反演。

工程知识层:元数据清洗的现实工作量(46% 提交无可用单一模型标签、命名混乱需手工规范化——这个"脏"本身是发现);可复现性打包(冻结输入+脚本+种子+哈希)。

知识融合关键节点:全文枢纽是把 IR 的"测试集可靠性"传统移植到 agent 评测——同一个"很多系统都对的题不携带排序信息"洞见,在 IR 里叫 topic set design,在心理测量里叫区分度,在本文里变成 n_eff+嵌套系数。作者必须同时知道这三个传统才能"新瓶装旧酒"并诚实标注"统计机器本身是成熟的”。

八、通用性灵感

  1. 基准的分辨率是比较集的函数,不是基准的属性:全池 n_eff/n=0.94 vs Top10 内 0.33——同一套题对不同对手的区分力天差地别(论文证据:嵌套比较集剖面)。推广:招生考试(对清北线附近 vs 全体考生区分力不同)、KPI 考核(顶尖团队内排名多半是噪声)、体育淘汰赛(顶尖选手间胜负由运气主导的区间)。
  2. 解集嵌套时,“组合"优于"排序”:Top2 并集只多 18 题但配对全不可分——当强者解集几乎包含弱者,正确的价值提取是集合运算而非名次崇拜(论文证据:union 414 vs 396)。推广:投资(相关性极高的策略排序无意义)、招聘(顶尖候选人间"谁第一"不可辨识,应看互补性组队)。
  3. 先审"比较"再审"任务”:审计一个评测体系时,“题目质量"与"名次可读性"是两个正交问题——都好才算好基准(论文证据:任务质量线与本文正交互补)。推广:审计任何评分体系都该有两问——测得对不对(效度)、分得开吗(分辨率)。
  4. 丢弃共识项买不来分辨率:重打分于非退化题让差距"看起来"翻倍但可分对数不变——视觉上的尺度放大是统计幻觉(论文证据:8.8→18.7pp 而 0/29 不变)。推广:去掉所有人都会做的题不等于让考试更能区分尖子——要加"方向性不一致"的题。
  5. 发布方元数据纪律是公共品:榜单不记录 (model, scaffold, version) 的机器可读字段,导致 54% 提交进不了因子设计、需要手工清洗——最便宜的治理改动是补字段(论文证据:元数据重构的艰辛)。推广:任何开放数据平台——元数据质量决定二次研究的天花板。