论文链接:Coding Agents Have Converged 代码仓库:Adkid-Zephyr/resolution-audit 发表时间:2026年9月 机构:Imperial College London + 香港理工大学 + Korea University + 暨南大学 领域标签:cs.SE / Agent Evaluation / Benchmark Saturation
一、论文背景
SWE-bench 是什么:从真实 GitHub issue 构建的代码智能体基准——agent 读 issue、改仓库、跑测试,以"解决实例数"计分。Verified 子集 500 实例经人工校验,是业界引用最密的 coding agent 排名来源:前两名各解 396 题,再往下 6 个系统都在 14 题以内——榜单显示 1-8 名,被广泛读作能力排序,用于模型选型、采购与研究汇报。
榜单质量质疑的两条线:第一条问"题目好不好"——自动审计发现超四分之一任务有质量问题、过滤后排名变化且均分 +9.9%,还有弱测试/泄漏/幸运通过等发现。第二条问本文的核心:即使题目都好,这些名次读得出吗?两者正交:前者审任务,后者审比较。
为什么紧迫:榜单日趋饱和之际,大量企业正构建内部基准选型——如果"分数差 1 题"根本不构成统计证据,据此做的采购与研究结论都是噪声。
二、论文定位和关联工作
| 研究脉络 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| SWE-bench 任务质量 | SWE-bench+、SWE-bench Illusion、AgentLens | 任务缺陷/泄漏/幸运通过 | 审"题目",本文审"排名" |
| 榜单可分性诊断 | Kotawala 2026(paired LLM eval) | 配对分辨诊断,不可分是例外(11/40、4/9) | 本文:Verified 前沿 29/29 全不可分 |
| 排名区间 | Neuhof & Benjamini rank intervals | 层次模型给排名区间 | 提供不确定度,不定位机制 |
| 基准功效分析 | Card et al.(little power)、tinyBenchmarks | 样本量与降维设计 | 均值功效,非配对前沿 |
| IR 测试集可靠性 | Sakai、Sanderson & Zobel、Roitero et al. | n_eff 与主题集设计传统 | 本文把该传统引入 agent 评测 |
| 心理测量学 | IRT 两参模型、KR-20 | 项目区分度/内部一致性 | 诊断"区分度对着全池而非前沿" |
定位结论:这是一篇评测审计方法学论文——不跑任何模型,只用榜单已经公开的逐实例判定矩阵,给出比既往 leaderboard 审计极端得多的结论(29/29 vs 11/40),并把"为什么读不了"归因到可检验的机制(解集嵌套)。
三、问题定义
具体场景:SWE-bench Verified 榜单前两名同解 396/500,前十里 6 个系统挤在 14 题内——这些 1-2 题的差距支持"谁更强"的读法吗?
抽象问题:一个基准对给定比较集的有效分辨率是多少——多少实例真正参与区分,相邻差距是否经得起配对检验,分数该以"严格排名"还是"分档"呈现。
形式化:定义退化实例(比较集内全对或全错,对任何组内比较零贡献)与有效规模 n_eff(S)=|{i: 0<resolved_S(i)<|S|}|;嵌套系数 cov(A,B)=|A∩B|/|B| 对"仅按得分随机分配"的期望基线 E[cov]=|A|/n;相邻对用精确 McNemar 检验;分档用 leader 规则(与当前档 лидер不可分则同档)。
精妙之处:n_eff 是 (benchmark, 比较集) 的联合属性而非基准固有属性——同一 Verified 全池 n_eff/n=0.94(很健康),Top10 内只剩 0.33(近乎失效)。“基准饱和"不是基准的属性,是前沿比较集的属性。
四、问题解法
五步审计协议(Protocol 1):
- Profile:对嵌套比较集(全池→Top50→Top20→Top10→Top2)算 n_eff,定位分辨率在哪里塌掉;
- Explain:嵌套系数对得分隐含基线,量化"共享成功"超出随机多少(机制归因);
- Test:全部配对精确 McNemar,报原始+Holm 校正 p 值;
- Partition:走排序表做 leader-based tier,报告对规则/校正的敏感性;
- Budget:反演配对条件 |b−c|≥1.96√(b+c),给"再收多少实例才能分开这对"定价。
机制检验三板斧(排除替代解释):IRT 拟合(区分度高的退化实例——它们区分 2023-2025 全程但对 2025 年系统零区分——证明"项目区分度"对着全池而非前沿);人工工时标注(285 全对题 49% 标”<15 分钟"、0 题">4 小时"——退化不是任务损坏);PR 年份相关(−0.069,无年龄效应——非污染驱动)。
model×scaffold 重构:手工规范化 134 个提交的模型标签,得 34 scaffold×30 模型×55 格子——榜单分数是 (模型, scaffold) 对的属性,而榜单两个因子都不展示。
五、评估指标与实验证据
| 发现 | 关键数字 | 证明什么 |
|---|---|---|
| 有效规模塌缩 | 全池 n_eff/n=0.94 → Top10 0.33 → Top2 0.07(36 题) | 分辨率是比较集函数 |
| 解集嵌套 | 前沿嵌套系数 0.935 vs 基线 0.774;每档均超基线 | 收敛机制=共享成功,非互补 |
| 组合上限 | Top2 并集 414 vs 最佳 396;Top10 并集 449 | 互补收益小且需"组合"而非"排序" |
| 相邻不可分 | Verified 29 对 0 可分(最小 p=0.545);Lite 29 对 0 可分 | 前沿排名无统计支撑 |
| 反例检验 | Test split(2294 题)23 对中 14 可分 | 同方法在未收敛比较集正常工作 |
| scaffold 效应 | claude-3-5-sonnet 九 scaffold 差 149 题(29.8pp);Top30 总差 8.8pp | 分数非模型属性;复制底线 5.4pp |
| 交互反转 | epam-ai-run vs agentless 在两模型间反号(−75.5 题,p<0.001) | 固定 scaffold 校正救不回模型排名 |
| 退休不可救 | 重打分于 209 非退化题:差距 8.8→18.7pp,3 对换位,可分仍 0/29 | 配对检验本就忽略共识题——退休买规模不买分辨率 |
| 分档敏感性 | 435 对全检:44.6% 原始可分、9.4% 过 Holm;四种规格得 2-3 档 | 档数依赖规则,须随附声明 |
证明力分析:Test split 反例是全文最强设计——同一统计量在 Verified 找不到任何东西、在 Test 找到 14/23,证明"29/29 不可分"是收敛比较集的现象而非方法失灵或基准家族缺陷。反过来,734,000 实例的独立样本参照(检测 0.2pp 差距@80% 功效)与 26,000 同质实例的配对定价形成数量级锚:光堆同质题没用,要故意收不一致且方向倾斜的题(54/500 不一致率下,倾斜 0.2 只需约 900 题)。
六、效果优势的根源解释
根源机制与证据链
- 嵌套是分辨率丧失的直接机制(论文实验已支持):前沿系统弱者的解集几乎被强者包含(0.935)——多出的"信息性实例"里双方你对我错基本对消(McNemar 的 b≈c),|b−c| 无法越过 1.96√(b+c)。机制链:前沿模型能力同质化→解同一批题→嵌套→不一致近似平衡→配对差恒不显著。
- 退化不是任务缺陷(论文实验已支持):工时标注/IRT/年龄三重检验排除"全对题是坏题"“全错题是坏题"“污染"三个替代解释——剩余解释就是真的共同会做/都不会做。
- 分数的 (model×scaffold) 二元性(论文实验已支持,观察性):同模型 scaffold 差 29.8pp + 交互反转(scaffold 排序依模型变号)→“榜单名次=模型能力"的读法在两个方向上都破产:跨模型不可比(scaffold 混杂)、固定 scaffold 也不行(交互反转)。加性拟合 scaffold 效应幅度 37.6pp vs 模型 47.9pp(比值 0.78)——同数量级。
- 纸面 oracle 与实际达成的鸿沟(论文数据间接支持):Top10 的 oracle(任一系统解出)达 90%,但任何单一系统 79%——嵌套结构使"选对系统"的上限收益只剩组合价值(+18 题),远小于榜单表面差距暗示的想象空间。
相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| Kotawala, Resolution diagnostics(2605.30315) | 配对 LLM 评测分辨诊断 | 不可分是例外(11/40、4/9) | 本文场景远极端(29/29) | 支持:配对诊断方法可用;补充:饱和前沿的极端形态 |
| SWE-bench Illusion(ICSE-SEIP 2026) | 记忆 vs 推理 | 给 issue 文本即可 76% 定位 bug 文件 | 污染维度 | 限定:本文年龄检验未见效应,但年龄只是污染代理 |
| AgentLens(2605.12925) | 幸运通过 | 通过≠正确实现 | 任务效度维度 | 补充:本文采信 harness 判定,两者正交 |
| Rank intervals(2606.08679) | 排名区间 | 名次应有不确定度带 | 前置工作 | 支持:严格排名过度承诺的一致结论 |
| tinyBenchmarks(ICML 2024) | 少样本基准设计 | 8% 题可估全榜分 | 均值估计 | 限定:省题不等于保分辨率——本文退休实验反证 |
| MAST(2503.13657) | MAS 失败分类 | 系统层失败普遍 | 正交维度 | 支持:agent 评测需系统视角 |
相反结论检索:未发现主张"Verified 前沿差距具备统计意义"的研究;最接近的张力是"退休退化题"直觉——本文用图 4 直接证伪(重打分后差距视觉放大但可分对数不变),这是对社区流行修复方案的有力否证。
综合判断与未决问题
多研究共同支持:(1) 前沿不可分(本文+rank intervals 的不确定度方向);(2) 分数混杂 scaffold(与 SWE-RL/AceCoder 训练报告中 scaffold 敏感性的普遍观察一致)。仍属推测:scaffold 效应的因果分离——观察性 2×2 设计无法排除团队投入共线;需要受控同 harness 因子实验(论文列为 future work)。适用边界:单一基准家族、单一 harness、自愿提交池;协议本身可移植但量值未必。可能失效条件:若新模型能力出现代际跳变(解集去嵌套化),分辨率会自然恢复——审计应周期性重跑。
七、必要知识反推
领域知识层:SWE-bench 榜单机制(每提交公开逐实例判定——这是审计得以可能的前提;多数榜单不公开,审计无从下手);agent scaffold 生态(epam-ai-run/sweagent/agentless/autocoderover 各自的结构差异)——重构 2×2 设计需要知道谁是谁。
方法论知识层:配对检验设计(McNemar 的 b/c 不一致计数直觉);多重比较校正(Holm 家族定义怎么影响档数);IR 测试集传统的 n_eff 概念;心理测量学 IRT/KR-20(并知道它们为什么不够——区分度对全池);bootstrap 与功效反演。
工程知识层:元数据清洗的现实工作量(46% 提交无可用单一模型标签、命名混乱需手工规范化——这个"脏"本身是发现);可复现性打包(冻结输入+脚本+种子+哈希)。
知识融合关键节点:全文枢纽是把 IR 的"测试集可靠性"传统移植到 agent 评测——同一个"很多系统都对的题不携带排序信息"洞见,在 IR 里叫 topic set design,在心理测量里叫区分度,在本文里变成 n_eff+嵌套系数。作者必须同时知道这三个传统才能"新瓶装旧酒"并诚实标注"统计机器本身是成熟的”。
八、通用性灵感
- 基准的分辨率是比较集的函数,不是基准的属性:全池 n_eff/n=0.94 vs Top10 内 0.33——同一套题对不同对手的区分力天差地别(论文证据:嵌套比较集剖面)。推广:招生考试(对清北线附近 vs 全体考生区分力不同)、KPI 考核(顶尖团队内排名多半是噪声)、体育淘汰赛(顶尖选手间胜负由运气主导的区间)。
- 解集嵌套时,“组合"优于"排序”:Top2 并集只多 18 题但配对全不可分——当强者解集几乎包含弱者,正确的价值提取是集合运算而非名次崇拜(论文证据:union 414 vs 396)。推广:投资(相关性极高的策略排序无意义)、招聘(顶尖候选人间"谁第一"不可辨识,应看互补性组队)。
- 先审"比较"再审"任务”:审计一个评测体系时,“题目质量"与"名次可读性"是两个正交问题——都好才算好基准(论文证据:任务质量线与本文正交互补)。推广:审计任何评分体系都该有两问——测得对不对(效度)、分得开吗(分辨率)。
- 丢弃共识项买不来分辨率:重打分于非退化题让差距"看起来"翻倍但可分对数不变——视觉上的尺度放大是统计幻觉(论文证据:8.8→18.7pp 而 0/29 不变)。推广:去掉所有人都会做的题不等于让考试更能区分尖子——要加"方向性不一致"的题。
- 发布方元数据纪律是公共品:榜单不记录 (model, scaffold, version) 的机器可读字段,导致 54% 提交进不了因子设计、需要手工清洗——最便宜的治理改动是补字段(论文证据:元数据重构的艰辛)。推广:任何开放数据平台——元数据质量决定二次研究的天花板。