论文链接:The Double Measurement Confound in Agent Benchmarks: De-Scaffolding, Ground-Truth Scoring, and Reliability Beyond the Mean 发表时间:2026年9月10日 机构:Universidad Autónoma de Madrid × IMDEA Nanociencia × Universidad Complutense de Madrid(西班牙)—— 高校合作 领域标签:cs.CL / Evaluation Methodology / Measurement Theory

一、论文背景

Agent benchmark 正在成为模型选型与部署决策的依据,但"分数"的前提假设很少被审视:分数测的是模型能力,还是评测管线的属性?此前评测危机的讨论集中在污染与难度(SWE-Bench Pro Verified、PatchBench 等),本文指出两个更隐蔽的混杂:

第一重:scaffold 所有权混杂。许多 agent 基准中,执行的关键决策(选什么工具、何时停止、如何解析输出)由基准自带的固定 scaffold 写死——模型只是 scaffold 流水线里的一个可替换组件。此时分数差异反映的是"模型在给定管线里的适配度",而非自主能力。

第二重:scorer 有效性混杂。评分器常用形状匹配(输出格式对不对)而非任务正确性(答案对不对)打分——格式正确但内容错误的回答得分,反之亦然。

双混杂叠加的后果是排行榜的区分度失真:论文实测 ComtradeBench 上,一个不含任何 LLM 的规则基线得 96.8 分,与 Kimi、Claude 的 97.5 只差 0.7 分。

二、论文定位和关联工作

工作关注点与本文关系
SWE-Bench Pro Verified / PatchBench验证协议漏洞(捷径/虚高)数据侧评测危机,本文是测量侧
Discovery Certification Protocol(同日)过程公证防"假发现"同属评测有效性,本文更系统
AgentAudit(同日)全生命周期信任维度审计框架,本文给测量论基础
De-Scaffolding 相关讨论scaffold 混杂的个案报告本文首次测量论化+协议化

定位结论:本文把散落的评测抱怨统一进测量论(measurement theory)框架——分数作为能力证据需要满足什么条件,并给出可操作的审计协议。这是从"发现个案"到"建立学科"的一步。

三、问题定义

具体问题:agent benchmark 的分数在什么条件下可以解释为"模型能力"的证据?如何审计并修复不满足条件的基准?

形式化:观测分数 S = f(model, scaffold, scorer, seed)。能力解释要求 ∂S/∂model 主导其余偏导;审计即测量 f 对各分量的敏感度,修复即把执行决策与评分的权重移回模型与任务。

四、问题解法

审计修复协议三步(audit-and-repair):

1. De-Scaffolding(移交执行决策):识别基准 scaffold 中由固定代码做出的执行关键决策(工具选择、停止规则、输出解析),把这些决策改写为模型可承担的形式(让模型自己选工具/宣布完成),scaffold 只保留安全护栏。

2. 种子化金标评分(替换形状评分):为每个任务构造带种子的金标(seeded ground truth),评分对照金标内容而非输出形状;形状只作必要条件不作充分条件。

3. 超越均值的可靠性报告:除均值外报告最差情形(worst-case)与尾部风险(tail-risk,如 P5 分位)指标,按种子分箱给出可靠性谱——一个模型可能均值 97 但尾部 60,另一个均值 95 但尾部 90,部署含义完全不同。

五、评估指标与实验证据

  • ComtradeBench 审计:规则基线(无 LLM)96.8 vs Kimi/Claude 97.5(数值几乎相同)——原始排行榜近乎无区分度;联合干预后排行榜变为"平均性能×种子鲁棒性"二维谱,模型间差异被还原。
  • 匹配均值对照(T9_clean_ab):三模型 Δ=+0.000(Cliff’s δ=0.05,95% CI [−0.30, +0.40]);SKIP 通道(模型唯一能移动分数的通道)在 120 个 episode 中触发 0 次——净化后"能力"消失,说明原分数几乎全由管线承载。
  • 跨基准审计:scorer 有效性是基准特定的(有的有效有的无效),但 scaffold 所有权在所有探查过的基准中都是失控轴——普适性结论。

六、效果优势的根源解释

这不是性能竞赛论文,其"效果"是测量有效性的恢复:干预前,分数方差主要由 scaffold(固定)与 scorer(宽松)吸收,模型差异被压扁成 0.7 分;干预后,执行与评分两个噪声源被移除,模型真实差异(包括均值与尾部)从管线噪声中析出。机制上等价于把测量仪器的系统误差校准掉——仪器没有更灵敏,只是不再说谎。

scaffold 所有权成为普适失控轴的深层原因:基准作者为保证"可比性"倾向把执行逻辑写死,而写死的逻辑恰恰替所有模型做了同样的决策——模型间可比的是"谁更适应这条流水线",不是"谁更能干"。

七、必要知识反推

  • 测量论:关于"测量工具在何种条件下测到目标构念"的理论,心理学/教育测量学成熟工具,本文移植到 LLM 评测。
  • Scaffold/Harness:agent 基准自带的执行脚手架,模型嵌入其中工作。
  • 构造效度:分数与目标能力(构念)的对应程度,本文的核心关切。
  • 尾部风险指标:P5/P95、最差种子表现等,衡量部署时"坏运气"下的下限。

八、论文中可以提取的通用性灵感

  1. 先问"分数测什么"再问"分数多高":任何依赖第三方基准做决策前,审计其 scaffold 所有权与 scorer 有效性——本文证明无 LLM 基线可以拿 96.8 分,“高分"的测量学含义可能是零。
  2. 把系统误差从方差里拆出来:S = f(model, 管线, seed) 的分解思维适用于任何 A/B 测试与自动化评测——先估计管线项,再相信模型项。
  3. 均值掩盖尾部:报告最差情形与分位数是廉价而高信息量的补充;对部署决策者,尾部往往比均值更致命。
  4. 可比性的悖论:为了公平而固定 scaffold,反而让测量目标从能力变成适配度——标准化与测量有效性存在张力,审计协议是解药。
  5. 负结果同样可发表:T9_clean_ab 的 Δ=+0.000 与 0/120 次 SKIP 是漂亮的"无效果"证据——净化后能力消失本身就是发现。