The Double Measurement Confound in Agent Benchmarks 精读
这篇来自西班牙团队的论文给 agent benchmark 的分数有效性下了诊断书:执行关键决策由固定 scaffold 而非模型做出(第一重测量混杂),scorer 用与任务正确性脱节的标准打分(第二重),两者合谋让排行榜测的是’评测管线属性’而非’模型能力’。论文提出测量论框架+审计修复协议三步——把执行决策移交给模型(de-scaffolding)、种子化金标评分替代形状匹配、用最差情形/尾部风险报告超越均值的可靠性。在 ComtradeBench 上:无 LLM 的规则基线得 96.8 分 vs Kimi/Claude 的 97.5,联合干预把平坦排行榜变成’平均性能×种子鲁棒性’的可靠性谱。