论文一:Agents Are Systems, Not Models: Rethinking Agentic Evaluation | 代码与数据 论文二:ReLiveGym: Evaluating Long-Lived Agents over Weeks of Replayed Reality | 代码 论文三:Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents 发表时间:2026 年 9 月 30 日 – 10 月 1 日(arXiv v1) 机构:论文一 = TU Munich(MCML)+ Helmholtz Munich + Inria/ENS Paris(三所欧洲研究机构合作);论文二 = Sahara AI(企业)+ University of Southern California(Xiang Ren 组,企业+高校合作);论文三 = UC Berkeley(Javad Lavaei 组)+ Virginia Tech(高校合作) 领域标签:cs.AI / cs.SE,agent 评测方法学
当评测本身成为研究对象:Agent 评测方法学三支柱合读精读
〇、为什么把这三篇放在一起读
过去两年,agent 论文的标配实验是:挑一个基准,跑一遍,报一个成功率,宣布 SOTA。2024 年 Princeton 的 Kapoor 与 Narayanan 在《AI Agents That Matter》里已经拆过这个范式的台:不计成本的 SOTA 没有意义,社区对「准确率提升来自哪里」的判断常常是错的(arXiv:2407.01502)。2026 年 ICML 的《Towards a Science of AI Agent Reliability》进一步把「可靠性」拆成一致性、鲁棒性、可预测性、安全性等十二个指标(arXiv:2602.16666)。
但这一波反思仍然默认了一个前提:被评测的对象是固定的。你拿来一个 agent,测它,报分数。三篇本篇合读的论文分别击碎了这块基石的三个侧面:
- 论文一(Agents Are Systems, Not Models)说:agent 不是固定对象,而是一个可配置系统——用户告诉它什么、给多少时间、用哪个底座模型,每一项都改变它的表现。不分解配置的贡献,评测就没有意义。
- 论文二(ReLiveGym)说:真实部署的 agent 要在数周时间尺度上稀疏行动、抓住时机。现有基准要么环境静止,要么只跑几分钟到几小时,时间维度整个缺失。
- 论文三(Groundability)说:agent 交回来的答案还需要审查。弱审查者到底能不能可靠地审强 agent?答案不在审查者的参数量,而在它拿到的是「证词」还是「接地证据」。
三者合起来正好构成评测方法学的三支柱:配置系统观(测什么对象)、时间维度(在什么世界里测)、审查证据观(怎么判定对错)。更深一层,三篇论文共享同一个元方法:把「评测」本身当作实验对象做受控实验——论文一对方差做分解,论文二对触发机制做方差分解(ω²),论文三对证据类型做因子隔离。这是评测学(metrology for agents)从「报分数」走向「科学」的标志。
下面按合读结构展开:先补背景,再定位关联工作,然后把三篇的问题定义、方法、实验证据、根源解释依次讲清,最后提炼可迁移的通用灵感。
一、论文背景:每个概念从「是什么」讲起
1.1 Agent、Harness、底座模型:一篇论文测的到底是什么
先澄清术语链(论文一第 2 节给了严格定义):
- 模型(model / backbone):LLM 本身。没有跨调用的记忆,自己不能行动。
- Agent:把模型包进一个循环——读当前状态、决定动作、执行、观察结果、再决定。类似 ReAct 范式(Yao et al., ICLR 2023,arXiv:2210.03629:推理与行动交替进行)。
- Harness(挽具/脚手架):运行这个循环的基础设施——派发工具调用、管理上下文、管理记忆与压缩。OpenAI 与 Anthropic 的工程博客已把「harness engineering」当成正式学科(论文一引用 Lopopolo 2026、Young 2025)。
一句类比:底座模型是马,harness 是挽具和马车,agent 是整套马车系统。你评测的从来不是马,是整辆车——但多数论文只报「车跑了多快」,不告诉你挽具换了什么。
1.2 为什么「配置」是个被忽视的变量
用户能配置 agent 的东西远比想象的多:告诉它多少任务信息(是只给任务描述,还是给完整操作手册)、要不要它自我验证、给多少时间预算、用小模型还是大模型。直觉上大家都承认这些有影响,但没有定量答案:哪个轴影响最大?轴之间会不会互相抵消?「多给时间」是不是总是好的?论文一就是把这个灰色地带变成可测量的格子世界。
1.3 「长寿智能体」:时间维度的空白
论文二定义 long-lived agents:在数天到数月的时间跨度上间歇行动、环境自行演化的 agent。典型场景:监控新闻做市场分析、每日例行报告、在事件发生后限时完成操作。它和流行的 long-horizon agent(连续工作几小时解一道难题)不同——后者环境是静止的,前者世界按自己的钟表走,不管你看不看。
这条赛道 2026 年刚起步:GAIA2(ICLR 2026,arXiv:2602.11964)评测异步移动应用环境,发现 agent 挫败于「何时行动」的决策;SentinelBench 比较了不同等待机制。但它们的时间尺度只有几分钟到几小时。回放式评测(如 FutureSim)虽然能跨 90 天,却固定按天唤醒 agent——唤醒策略本身从不被评测。这是 ReLiveGym 的切入口。
1.4 「弱审强」与省略型缺陷:审查侧的空白
论文三的背景是 coding agent 的日常:agent 交回一个看起来很有道理的 patch 和一段自信的总结,你要判断「它真的解决了 issue 吗」。审计工作已经发现大量「貌似解决、实则未解决」的 patch(SWE-bench 事后审计,arXiv:2503.15223;OpenAI 2026 年对 SWE-bench Verified 的审计也发现大量有缺陷的测试用例)。
最大的一类缺陷是省略(omission):缺一个分支、缺一段实现、缺一项检查。这类缺陷最难审——长轨迹里全是合理步骤,总结自信满满,缺的东西在可见文本里根本不出现。与此同时,AI 安全领域的 scalable oversight 研究长期问「弱模型能否监督强模型」(weak-to-strong、sandwiching 实验、辩论,见 Kenton et al. 2024 与 Bowman et al. 2022),但多数实验用「叙述性证据」做裁判,容易被话术攻破。论文三把两条线拧在一起:弱审查者 + 可机械核验的执行证据。
二、论文定位和关联工作
三条谱系各自清晰,先分述再合观。
2.1 谱系一:agent 评测的「元批判」路线
| 工作 | 核心思想 | 与论文一的关系 |
|---|---|---|
| AI Agents That Matter(Kapoor et al., TMLR 2025) | 成本+准确率 Pareto 曲线,破除不计成本 SOTA | 论文一直接继承其「多指标」主张,并补上「配置分解」维度 |
| Holistic Agent Leaderboard(Kapoor et al., ICLR 2026) | 排行榜基础设施 | 论文一的方差结论(54% 噪声)为排行榜必要性提供了最强弹药 |
| Towards a Science of AI Agent Reliability(Rabanser et al., ICML 2026) | 可靠性分解为一致性/鲁棒性/可预测性/安全性 | 论文一复用其 outcome consistency 指标(Cout)与 hurdle 分解框架 |
| AI4S 复现类基准(PaperBench、MLE-bench、ScienceAgentBench 等) | agent 复现/执行科学工作流 | 论文一的四个任务属于此列,但独创「专家模型+参照分」结构 |
论文一的位置:第一个把 agent 的配置空间本身当作实验对象的系统性研究——不是提新 agent,而是问「配置轴如何塑造结果与可靠性」。
2.2 谱系二:动态环境与回放式评测
| 工作 | 核心思想 | 与论文二的关系 |
|---|---|---|
| GAIA2(Froger et al., ICLR 2026) | 异步动态环境,agent 挣扎于时机决策 | 时间尺度仅分钟~小时;ReLiveGym 拉长到数周 |
| SentinelBench(Maldaner et al. 2026) | 比较长时监控任务的等待机制 | 直接前驱;ReLiveGym 扩展到重复义务+稀疏行动+累积预算 |
| FutureSim(Goel et al. 2026) | 90 天新闻回放+预测修正 | 最近亲缘;但按日固定节奏唤醒,不评触发策略 |
| 实盘交易/预测市场评测(FinMem、TradingAgents 等) | 真实市场评测 | 不可复现、不可对照;回放式解决了因果可比性 |
论文二的位置:第一个把「何时行动」(触发机制)当作 harness 一等设计轴、并做模型×触发方差分解的周尺度评测环境。
2.3 谱系三:可验证监督与代码评审
| 工作 | 核心思想 | 与论文三的关系 |
|---|---|---|
| Proof-Carrying Code / Certifying Algorithms(Necula 1997 等) | 不信任生产者,检查其证据 | 论文三自认的智力源头:审查侧在审计时构造可检查证据 |
| Scalable oversight / sandwiching(Bowman et al. 2022;Kenton et al. 2024) | 弱模型审强模型 | 论文三把「弱」固定、只变证据——反转了「换更强审查者」的默认思路 |
| Prover-Verifier Games(Kirchner et al. 2024) | 训练强模型输出弱验证器可读的结果 | 论文三不重训被审 agent,在审查时构造证据 |
| SWE-bench 审计 / UTBoost(Yu et al. 2025) | 「已解决」的 issue 未必真正解决 | 提供了省略型缺陷的经验分布(101/154 缺陷中 76 个是省略) |
| LLM-as-judge 批判(MT-Bench、JudgeBench 等) | 裁判有位置偏差/自偏好,难题上近似乱猜 | 论文三的回应:问题不在裁判大小,在证据是否接地 |
论文三的位置:在「弱审强」实验里首次做证据因子隔离,提出 groundability 概念并量化上界(官方执行证据)与可部署级联之间的差距。
2.4 合观定位
| 维度 | 之前的路线 | 三篇的突破 |
|---|---|---|
| 被测对象 | 固定 agent 报分数 | 可配置系统做方差分解(一) |
| 环境时间 | 静态/分钟级 | 数周真实回放(二) |
| 判定方式 | 裁判模型/隐藏测试二选一 | 证据类型因子隔离+机械门+弃权(三) |
| 共同元方法 | —— | 把评测本身当实验对象 |
三、问题定义:三篇各自抽象出的最本质问题
3.1 论文一:配置贡献分解问题
具体场景:一个 coding agent 在沙箱里找专家模型、写代码操作它,完成科学任务。 抽象问题:设 agent 得分为 S,它由配置向量 c =(信息、推理、验证、预算、模型)与运行噪声 ε 共同决定。评测要回答的不是「S 是多少」,而是方差分解:Var(S) 中各配置轴、轴间交互、与 run-to-run 噪声各占多少?哪个轴的单位改动「性价比」最高?
一句话:从「测分数」升维到「测分数从哪里来」。这相当于把农业田间试验的析因设计(factorial design)搬进 agent 评测——每个配置轴是一个因子,格子是处理组,重复运行是重复小区。
3.2 论文二:时机与持续性剥离问题
具体场景:agent 守着回放的新闻/市场流数周,稀疏提交承诺(警报/预报/检测/例行报告)。 抽象问题:agent = (harness H, 模型 M)。性能方差可分解为模型主效应、触发机制主效应、模型×触发交互、种子(重复运行)方差四块。「何时行动」的贡献能否从「模型能力」中干净地剥离出来? 耦合的成本预算 B(花完即终止)使这成为一个约束优化下的测量问题。
一句话:把「何时看、何时出手」从模型能力中剥离为 harness 设计轴,并量化其方差贡献(ω²)。
3.3 论文三:证据接地性问题
具体场景:弱模型审查强 coding agent 的 patch 是否真解决了 issue,输出 accept/reject/uncertain。 抽象问题:固定审查者 R,只变证据 E ∈ {证词,结构化未检查证据,接地证据}。定义 groundability(可接地性):一项争议需求能否被一个独立检查(可靠静态分析、可运行测试)裁决。核心问题是:审查可靠性的决定因子是 R 的规模还是 E 的接地性? 同时用选择性预测框架(coverage / risk / catch / over-rejection / abstention)把「审不准时能不能弃权」纳入度量。
一句话:审查问题从「谁来审」改写为「拿什么审」。
3.4 三者的同构性
| 要素 | 论文一 | 论文二 | 论文三 |
|---|---|---|---|
| 固定什么 | 任务、评分 | 任务、指标、预算 | 审查者、协议 |
| 变什么 | 5 条配置轴 | 模型 × 触发 × 改进方法 | 证据类型 |
| 测什么 | 方差归属(效应量/ICC) | 方差归属(ω²) | 因果贡献(catch/over-rej 对比) |
| 噪声处理 | hurdle 过滤+重复运行 | 多种子+报告 std | 设计集冻结+run-once 测试集 |
三篇都是因子隔离实验——这正是它们能放进同一篇合读的深层原因。
四、问题解法:三支柱各自的机制
4.1 支柱一(论文一):432 格的配置世界
基准设计。沙箱里有四个已发表的专家模型(天体物理两个 + 基因组学两个),agent 像人类科学家一样用 README、读文件、跑终端命令来操作它们——专家模型不以工具调用形式提供。四个任务构成 2×2 设计:领域(天体/基因组)× 体制(GAP_POSITIVE:专家强于底座,该用;GAP_NEGATIVE:专家弱于底座,该弃用):
| 任务 | 专家模型 | 挑战点 | 指标 |
|---|---|---|---|
| 红移估计 | AstroCLIP | 输入预处理 | R² |
| MMLU 天文 | AstroSage-8B | 该弃用弱专家(GAP_NEGATIVE) | 准确率 |
| 启动子预测 | DNABERT-2 | 需自行微调 | MCC |
| RNA 折叠 | RiNALMo | 输出后处理 | 配对 F1 |
每个任务自带参照分 R(专家模型在原文评测复现上的分数)与底座分 B(LLM 裸答分数),主指标为 GAP_CLOSED:G = (S−B)/(R−B)——agent 关闭了底座与专家之间多大的差距。G=1 即复现专家水平。这个设计的妙处:不同任务不同指标被归一到同一尺度,且真值免费(不用人工评判)。
五条配置轴(论文的实验变量):
| 轴 | 级别(逐级累加/递进) |
|---|---|
| 信息 | none → identity(告知哪个专家模型)→ interface(+ 如何加载调用)→ protocol(+ 完整任务配方) |
| 推理 | act-only → think-act(推理即弃)→ ReAct(推理保留在上下文) |
| 验证 | none → asked(要求验证)→ reported(+ 须报告预期分与证据)→ binding(+ 验证不过不许提交) |
| 预算 | 5 分钟 → 10 分钟 → 20 分钟(墙钟时间) |
| 模型 | Qwen3.5-35B-A3B → 122B-A10B → 397B-A17B |
全因子格:4×3×4×3×3 = 432 格,每格重复 5 次,每任务 2160 次运行,4 任务共 8640 次主实验;加上 Step-3.7-Flash、Claude Sonnet 5、oracle 消融,总计释放 18240 条轨迹。
两个精细的统计装置:
- Hurdle 指示符:一次运行若得分没超过平凡分 T 加边际 μ,记为「未做真实尝试」(比如调用错专家、交白卷式答案)。只有过了 hurdle 的运行才进分数分析——否则离群失败会不成比例地污染方差分解。
- ICC(组内相关系数):把总方差拆成「格间(信号)」与「格内(噪声)」,ICC = 格间/总。这一步直接产出论文最著名的数字:格内噪声占 54%。
行为分类学(第 5 节):用 judge 模型对每条轨迹做六维自由文本描述(结果定性、根错误、专家用法、验证行为、规划探索、执行质量),Sentence-BERT 嵌入 + HDBSCAN 聚类,再由 judge 归纳合并成至多 8 个行为类别。这是 extract-then-cluster 方法在 agent 行为上的应用,把「分数背后的行为」变成可统计对象。
4.2 支柱二(论文二):数周回放世界与三种唤醒方式
世界构造。五路真实数据流按时间戳回放:Common Crawl 新闻(带 BM25 全文检索 API)、Polymarket 预测市场(分钟级价格与结算)、三所交易所 5 分钟 K 线、SEC EDGAR 文件快照、Reddit 帖子与评论树。数据只取 2026 年 3 月之后——超出全部被测模型的知识截止,把数据污染压到最低。模拟时钟只在 agent 等待时前进,t 时刻只返回当时可见的信息。
八个任务横跨三个难度轴(时机敏感性 × 推理深度 × 是否有后见反馈):
| 任务 | 类型 | 承诺 | 指标 |
|---|---|---|---|
| 突发新闻检测 | 预测+警报 | 价格变动前 24h 内报警 | coverage F1 |
| 预测组合 | 预测 | 60 个市场问题的实时概率 | Brier skill score |
| 结算检测 | 检测 | 判断问题已在世界上尘埃落定 | time-weighted F1 |
| 热度预测 | 预测 | 推荐 6h 内会火(≥50 评论)的帖子 | time-weighted F1 |
| 每日摘要 | 例行 | 每天 10 帖 | 准点率 |
| 价格检查 | 例行 | 每小时报 3 资产现货价 | 准点率(±5bp) |
| SEC 文件追踪 | 例行+浏览器 | 下一开盘前录入财务数据 | 准点率 |
| 券商运维 | 例行+浏览器 | 成交后 2h 挂止损/追保 4h 内注资 | 准点率 |
三种触发机制(harness 的核心变量,均可表达任意唤醒计划):
- sleep 工具:agent 自己调 sleep(n),时间快进 n。唤醒策略完全由 LLM 即兴决定。
- watcher 程序:agent 写一个 Python 监视程序(CodeAct 范式),程序内可调用 agent 的工具,条件满足才把控制权交回 LLM。唤醒策略被外化为代码。
- cron 调度:系统给一个只读基线调度表(如每 6 小时),agent 可增删一次性/循环触发。唤醒策略由调度器执行,LLM 只在触发时跑一段有界 ReAct。
两种持续改进方法:Outcome memory(每天把过往承诺与世界结算结果整理成记忆条目注入上下文);Best-of-N+Prune(并行开 3 个 agent,第 2/7 天按累计表现剪枝,只采纳最优者的承诺)。
成本约束:硬预算 $20/次(按厂商牌价计费),花完即终——这让「过度唤醒」本身成为惩罚项,也是 Gemini-3.5-flash 在 forecast 上 -45.6 分这类灾难的来源之一。
4.3 支柱三(论文三):groundability 与冻结式评审级联
数据。411 条执行标注的真实轨迹:GPT-5.4 核心集 154 条(101 条缺陷,其中 76 条是省略——省略是最大缺陷类);Gemini-2.5-Pro 迁移集 59 条;两个 accept/no-change 集(61 条正确 patch + 137 条零改动提交);外加 101 个合成对照(37 官方参照 patch、34 个已知删改的消融 patch、30 个自然试点)。标签由官方隐藏测试的执行结果钉死。
证据三分类(论文的概念核心):
| 类型 | 定义 | 例子 |
|---|---|---|
| 证词(testimony) | agent 自己的话 | 最终总结、轨迹文本 |
| 结构化未检查证据 | 管道整理但未独立核验 | 改动块、需求覆盖、启发式风险提示 |
| 接地证据(grounded) | 有独立检查背书 | 可靠静态分析、真实测试运行结果 |
上界诊断:给审查者看官方执行结果(FAIL_TO_PASS / PASS_TO_PASS 是否通过)。这不可部署(部署时哪有官方隐藏测试),但它回答「如果存在决定性检查,弱审查者能多可靠」。方法学上的关键纪律:在 32 条设计集上为每个审查者二选一证据格式(保留/删除未核验风险注记),冻结后才在 122 条 held-out 上跑一次——杜绝测试集调参。
可部署级联(Algorithm 1)——先机械后智能,逐级拦截:
- Stage 0:patch 为空 → 机械 reject。
- Stage 1:patch 引起的静态错误(如未绑定符号,且该符号由 patch 自身引入——归因过滤防止误伤旧问题)→ 机械 reject,零 LLM 调用。
- Stage 2:LLM 从 issue+patch 生成测试(≤3 次修复尝试),先在未打补丁的 base 上跑:必须行为性失败才算可用(证明它测的是缺失行为,而非环境错误);base 失败 + patch 通过 → accept(评测规则);base 失败 + patch 仍失败 → reject。
- Stage 3:残余案例交给 Llama-3.1-8B 弱评审(k=5 多数票,平票为 uncertain)。
「base 必须先失败」这道闸门是整个级联的灵魂:它不需要形式规约,就构造出一个行为级检查;同时用独立生成器而非 agent 自己写的测试——agent 写的测试可能和 agent 共享盲区(Chen et al. 2026 的发现,以及 Knight & Leveson 1986 的经典独立性论证)。
五、评估指标与实验证据
5.1 论文一:四个反直觉的核心发现
发现一:agent 结果是噪声海洋。排除 hurdle 失败后的真实尝试中,约 54% 的分数方差是同配置 run-to-run 噪声(不排除则配置间只能解释 39.4% 方差)。噪声还不均匀:分数越高的格方差越低(Spearman ρ=−0.79)。任务间天差地别:红移估计 53.8% 的完成运行过不了 hurdle、一致性 Cout 仅 0.727;启动子预测 Cout 达 0.986。含义:单次运行的分数本身不是信号。
发现二:信息轴碾压一切。效应量 = 轴各水平平均 G 的极差 ÷ 格内标准差。信息轴在全部三个 GAP_POSITIVE 任务上排第一:1.925 / 1.452 / 1.496(promoter / redshift / rna,均值排名 1.00);模型第 2.67、推理 3.00、预算 3.33、验证垫底 5.00。bootstrap 中信息排第一的概率 ≥99%。给用户配 agent 的实操结论:与其换更大的模型,不如把任务信息写清楚——而且信息(protocol 级)同时提分、降成本、降运行时长、改善校准,四赢无权衡。
发现三:轴之间强交互。给小/中模型加时间:完成率升、G 反降(把错误路线走到底);给大模型加时间:两者齐升。红移任务案例:none 信息级下预算从短到长,R² 从 −0.429 恶化到 −0.713;interface 级下从 −0.605 改善到 −0.380;protocol 级下无差异(全对)。预算只在你知道该干什么或够聪明时才有用。
发现四:提示验证无效,工具验证有效(×3)。提示式验证轴(none→binding 四级)对分数几乎无影响(排名垫底);行为分类学显示,从 none 到 binding,参照式验证行为占比仅从 19% 升到 22%,四分之三的运行只查答案格式。换上 oracle_check 工具后,参照式验证行为大约三倍(升至约 55–63%),且两个开源模型在所有任务上全部提分(Qwen-122B 池化 G 0.822→0.923,Step-3.7-Flash 0.865→0.889),校准误差骤降(0.093→0.002)。爬山作弊仅 4.4% 的运行,剔除后结论不变。有些行为(自我验证)用户.prompt 不动,系统工具一动就变。
附加发现同样扎心:GAP_NEGATIVE 任务上(正确行为是弃用弱专家),99.8% 的运行仍盲用 AstroSage——agent 对「专家模型」有近乎权威偏见的信任。换模型族消融:Step-3.7-Flash 下信息仍第一;Claude Sonnet 5 下预算跃升第一(效率极高:工具调用不到 Qwen-397B 一半、错误约 1/5,但列表价更贵、池化 G 反而更低)——最优配置轴随模型族漂移,没有万能 harness。
5.2 论文二:方差都去哪儿了
种子方差是每项任务的最大成分(54–95%)。图 6 的 ω² 分解(每任务取最强 5 模型):daily digest 种子方差高达 95%,web broker 62%,forecast 62%,breakout 60%,web filing 55%,popularity 54%。作者做了个关键区分:影响单个可评事件的波动(加事件可减少)vs 持久性行为差异(反复睡过头、忘指令、提前烧光预算)——后者是长寿任务的本质挑战而非测量噪声。
触发主效应(ω²,permutation 检验):
| 任务 | 触发主效应 | 方向 |
|---|---|---|
| 突发新闻检测 | ω²=11%,p=0.039 | cron/watcher 领先 sleep 约 5 个 F1 点(GPT 系) |
| 预测组合 | ω²=7%,p=0.016 | cron 反而最差——过度唤醒→预测反复推向极端→过度自信+错误 |
| SEC 文件追踪 | ω²=31%,p=0.031 | cron 碾压 sleep(GPT-5.6-terra:sleep 23.3% vs cron 83.1% 准点率;sleep 会整日跳过工作) |
| 券商运维 | ω²=31%,p=0.023 | 同上,cron 显著领先 |
模型×触发交互显著:breakout 19%、popularity 38%——最优触发取决于模型,没有全局最优 harness。模型主效应在 resolution detection 最大(44%)、forecast 21%、web broker 15%。
失败模式两连:(a)指令漂移——Claude-Haiku 在 sleep 下正常运行一周后连睡三周,最后一天试图把剩余产出一次性交齐;(b)早期策略固化——sleep 档的睡眠间隔在整个 run 期间中位变化不足 1 小时;Qwen 每 12h 触发的 run F1=5.5,每 6h 触发 F1=38,灾难性差距纯粹来自开局选择。
持续改进:Best-of-N+Prune 对「早期失败」模式是对症药——popularity 上 GPT-5.6-luna(sleep)43.3→49.2、Qwen3.7-plus(sleep)23.9→32.1,种子方差减半,成本仅 1.61×;但对没有该模式的 breakout 无一致增益。Outcome memory 方向性为正(6 格中 5 格)但不一致——记忆不足以扭转已固化的坏策略。弱模型+正确触发可以打败错配的强模型:Gemini-3.5-flash-lite 配 cron 在 daily digest 拿 100% 准点率。成本与分数仅弱相关(ρ∈[−0.22, 0.09])。
5.3 论文三:规模不是预测子,接地才是
未检查证据的两难:patch-only 审查——Llama-8B 对设计集 9 个目标省略全盘接受(9/9),GPT-4.1 catch 仅 0.27;看起来「精确」是因为几乎什么都接受(over-rejection≈0)。完整原始轨迹对六个审查者都给不出最佳权衡——更多文本不等于更可验证(Qwen-32B 从全轨迹只 catch 0.17)。结构化未检查证据则「catch 与误拒齐升」:GPT-4.1 catch 0.91 的同时误拒 0.86。
官方证据的上界结果(122 条 held-out:90 缺陷 + 32 可接受;格式在设计集选定后冻结):
| 审查者 | 结构化 catch / 误拒 | 官方证据 catch / 误拒 |
|---|---|---|
| Llama-3.1-8B | 0.70 / 0.75 | 0.98 / 0.00 |
| Qwen-2.5-32B | 0.69 / 0.66 | 0.96 / 0.09 |
| Qwen-2.5-72B | 0.43 / 0.44 | 0.91 / 0.47(唯一例外:误拒未降) |
| GPT-OSS-120B | 0.51 / 0.41 | 1.00 / 0.00 |
| Qwen3-235B | 0.28 / 0.19 | 0.90 / 0.00 |
| GPT-4.1 | 0.69 / 0.62 | 1.00 / 0.00 |
三个数字值得放大看:GPT-4.1 从 0.69/0.62 跃迁到 1.00/0.00(122 条全对);8B 的 Llama 到 0.98/0.00——一个 2025 年的 8B 小模型配上接地证据几乎完美;而参数量不是单调预测子:Qwen3-235B 的未检查 catch(0.28)不到 Llama-8B(0.70)一半——30 倍参数换来更差的审查。三个评审的同一冻结格式迁移到 59 条 Gemini 轨迹:全部 catch 44 条缺陷,GPT-OSS-120B 与 GPT-4.1 再次全对。缩放分析(换审查者/加投票/换证据)中只有证据干预在所有测试的审查者上一致改善。
可部署级联的诚实成绩单(run-once):held-out 121 条 coverage 0.89 / risk 0.33 / catch 0.76 / 误拒 0.66;Gemini 59 条 0.86 / 0.26 / 0.80 / 0.67。生成测试是不对称证据:校验过的测试在 patch 上仍失败 → 拒绝精度 0.82;测试通过 → 接受精度仅 0.30——「一条通过的测试」远弱于「一条失败的测试」。21 个假拒里 19 个来自流入弱评审阶段的未解决案例。作者定位明确:这是高压覆盖率的压力测试,不是可部署的可靠评审器;上界与级联之间的差距 =「生产决定性检查」的能力缺口。
5.4 为什么这些实验设计有证明力
三篇都做了「指标真的证明了主张」的功课:论文一的轴排名经过 bootstrap(≥99%)与线性模型 partial η² 双重校验,且用匹配配置排除了「预算效应其实是幸存者偏差」的替代解释;论文二的触发效应用 Wilcoxon 检验(跨 8 模型配对)而非看图说话,并区分了「事件级噪声」与「持久行为差异」两种种子方差;论文三的格式选择冻结在设计集、测试集只跑一次、泄漏审计零失败,把「在测试集上挑最好条件」这一 LLM 评测常见作弊路径焊死。
六、效果优势的根源解释
6.1 论文一:为什么信息 > 模型 > 预算,为什么工具验证碾压提示
因果链(论文实验已支持的 部分):
- 科学任务的瓶颈在「知道操作专家模型的正确程序」,而非通用推理能力 → 信息轴直接消除搜索空间中最大的一块 → 效应量 1.93(表 3 + 表 18 partial η² 0.26–0.41)。
- 模型/预算只提升「执行已知程序」的效率;当程序未知(none/identity 级),多时间反而放大错误路径(表 9 交互数据),大模型的探索能力也无处着力 → 主效应与交互同时得到解释。
- 提示式验证失败的行为学机制:提示改变的是「说辞」不是「行为」——行为分类学显示 3/4 的运行只做格式检查,因为验证缺少「可执行的检查手段」;oracle 工具把验证从言语承诺变成可调用动作,行为三倍转移、分数提升(图 4 + 表 12)。
外部交叉验证:
| 研究 | 相似尝试/相近结论 | 与本文差异 | 影响 |
|---|---|---|---|
| AI Agents That Matter(arXiv:2407.01502) | 不少准确率增益来自 harness 而非模型 | 未做全因子方差分解 | 支持「配置贡献可超过模型」 |
| Towards a Science of AI Agent Reliability(arXiv:2602.16666) | 能力增益不自动转化为可靠性增益 | 提出指标框架,未定位配置轴 | 支持「单分数不可靠」与 Cout 指标 |
| Jimenez et al. SWE-bench(ICLR 2024) | 任务信息量决定 agent 需自行检索多少 | 未量化信息作为配置轴 | 支持「信息决定探索负担」 |
| Reflexion / Self-Refine(NeurIPS 2023) | 自我验证提升成功率 | 单模型小规模设定 | 部分相反:本文化学/天文长任务上提示验证无效——提示长度依赖性是适用边界 |
| ReAct(arXiv:2210.03629) | 保留推理带来提升 | 短程玩具任务 | 限定:本任务上推理轴仅排第三,增益远小于信息 |
| Position bias / LLM-judge 文献(arXiv:2406.07791 等) | 言语性输出不可靠 | 评测裁判场景 | 补充:校准误差高企与「自信总结掩盖省略」同源 |
推测部分(阅读者假设,论文未直接检验):99.8% 盲用弱专家的「权威偏见」解释引自 Xie et al. 2024 知识冲突研究,作者自己也标注为待验证假设。
6.2 论文二:为什么触发机制是独立杠杆
因果链:
- 长寿任务的价值函数对时机敏感(报警只在价格变动前值钱、SEC 录入只在下一开盘前值钱)→ 错过窗口 = 零收益,而 sleep 机制把唤醒决策交给即兴的 LLM → 持久性失败(睡过头/整日跳过)直接归零整段时间的工作 → cron(外部调度保证唤醒下界)在浏览器任务上产生 ω²=31% 的主效应。
- forecast 的反向效应同理:cron 过度唤醒 → 每次醒来都重估概率 → 预测推向极端 → Brier 恶化。触发机制的价值取决于任务的时机价值函数形状,不是越勤快越好。
- 早期策略固化的机制:sleep 间隔在 run 开头被选中后几乎不变(中位变化 <1h)→ 单次早期决策锁死整局 → Best-of-N+Prune 用前几天的后见反馈在多 seed 间做选择,恰好替换掉这个「一次性决策」环节,所以对 popularity(早期失败型)有效、对 breakout(非该模式)无效。
外部交叉验证:
| 研究 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|
| GAIA2(arXiv:2602.11964) | agent 在时机决策上挣扎 | 分钟~小时尺度 | 支持时间维度挑战的真实性 |
| SentinelBench(arXiv:2606.05342) | 等待机制设计影响监控表现 | 单任务类型 | 支持「触发是一等设计轴」 |
| FutureSim(arXiv:2605.15188) | 回放世界可评测适应 | 固定日节奏,不评触发 | 互补:本篇评了触发选择 |
| Kirchner et al. Prover-Verifier Games(arXiv:2407.13692) | 让输出对弱验证器更可读 | 训练时干预 | 方向一致:系统能力而非模型能力 |
| 论文一 | 「系统提供 > 用户提示」 | 分钟级任务 | 跨论文互证:harness 提供的机制胜过对模型的软约束 |
限定条件:每配置仅 3–6 个种子、1–3 个 episode,作者明言这是诊断性研究不是排行榜;结论适用于「方差归属」而非「个别格子的排序」。
6.3 论文三:为什么接地证据碾压规模
因果链:
- 省略型缺陷的不可见性:缺失的行为不在任何可见文本中出现(diff 只显示改了什么,总结只声称做了什么)→ 基于文本(无论 patch 还是全轨迹)的审查在信息论意义上缺料 → patch-only 全盘接受、全轨迹反而更糟。
- 接地证据改变信息结构:执行结果把「patch 是否具备缺失行为」这个不可见属性变成一行可读的二元事实(FAIL_TO_PASS passed/failed)→ 审查任务从「推断」退化为「读取」→ 8B 模型也能 0.98 catch。
- 未检查风险注记的干扰机制:编译器生成的 warning 级提示(「改动触及测试文件」)在正确 patch 上也会触发 → 结构化证据下 catch 与误拒齐升;删掉这些注记(grounded_clean)后恢复正确接受(12/5/7 → 49/61/61)。
- 级联的剩余误差有两个干净来源:弱评审误读证据(rationale 与 cited_evidence 自相矛盾的实例分析)与生成测试的质量缺口(欠规格 probe 通过了 patch 却被官方拒绝 → accept 精度 0.30)。
外部交叉验证:
| 研究 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|
| Bowman et al. 2022 sandwiching(arXiv:2211.03540) | 弱审强有时可行有时不行 | 用叙述性证据 | 本篇指出变量是证据不是运气 |
| Kenton et al. 2024(arXiv:2407.04622) | 弱 LLM 评强 LLM 的 scalable oversight | 无执行真值 | 支持「决定性检查存在时弱者可靠」 |
| SWE-bench 审计(arXiv:2503.15223) | 「已解决」大量实为未解决 | 审计基准而非评审机制 | 提供省略缺陷的现实分布 |
| Chen et al. 2026(arXiv:2602.07900) | agent 自写测试常无有效断言 | 观察性结论 | 支持「独立生成+base 失败校验」必要性 |
| Zhou et al. 2024 Don’t Trust: Verify(ICLR 2024) | 只信可机械核验的证据 | 数学推理域 | 跨域相近结论:groundability 思想普适 |
| Goel et al. 2025(ICML 2025) | 裁判与 agent 相关错误削弱监督 | 无接地通道 | 补充:接地证据切断相关性错误传播 |
综合判断:三篇共同支持的核心机制——「系统的可执行约束/证据 > 对模型的言语请求/更大的模型」——已在至少两个独立实验体系(论文一的工具验证、论文三的接地证据)和多个外部域(prover-verifier、Don’t Trust: Verify、SentinelBench)得到一致印证,是目前最稳固的结论。仍有条件限制:论文一的「系统>提示」仅在验证这一个行为维度上演示(作者自认需扩展);论文三的上界依赖官方测试的存在,可部署级联的 0.66 误拒说明生成决定性检查仍是瓶颈;论文二的种子方差 54–95% 限制了任何单次比较的说服力。
七、必要知识反推:做出这三篇研究最少需要知道什么
7.1 领域知识层
- Agent/harness 分解的工程事实:必须知道 Codex、Claude Code 等生产级编码 agent 的实际形态(模型+harness),否则「把配置当对象」的问题意识无从产生(论文一)。
- 科学工作流的可复现结构:知道「已发表专家模型自带可复现评测与参照分」这个 AI4S 特性,才能设计 GAP_CLOSED 这种免人工真值的指标(论文一)。
- 真实数据流的时间戳结构:新闻/市场/SEC/Reddit 的回放可行性、Polymarket 分钟级价格、breakout 的统计学定义(日间变化相对近期波动显著)——没有这些领域数据知识,八个任务造不出来(论文二)。
- 软件工程测试体系:FAIL_TO_PASS / PASS_TO_PASS 语义、patch 归因的静态分析、SWE-bench 的标签机制、以及「agent 自写测试与 agent 共享盲区」的独立性风险(论文三)。
7.2 方法论知识层
- 析因实验设计与方差分解:one-way 随机效应 ANOVA、ICC、bootstrap 排名稳定性、partial η²、两两交互检验——论文一的统计脊柱。
- hurdle 模型与选择性预测:Cragg 1971 的两部分分解;Geifman & El-Yaniv 2017 的 coverage/risk 框架——分别撑起论文一的「真实尝试过滤」和论文三的「弃权度量」。
- ω² 方差分解与 permutation/Wilcoxon 检验:论文二量化模型×触发×种子贡献的工具。
- 评测协议纪律:设计集/held-out 分离、格式冻结、run-once 评估、泄漏审计——论文三方法学可信度的来源。
- LLM-as-judge 的已知偏差谱系(位置/自偏好/相关性错误)与 extract-then-cluster 行为归纳法(论文一第 5 节)。
7.3 工程知识层
- 单 GPU 沙箱 + SLURM 阵列作业调度 8640+ 次运行;FP8 量化 vLLM 服务多尺寸模型(论文一)。
- 模拟时钟引擎:时间只在等待时前进、t 时刻信息可见性过滤、成本计费与预算执行(论文二)。
- Docker 环境复现、生成测试的 base-first 校验流水线、patch 归因过滤(论文三)。
7.4 知识融合的关键节点
三篇各自有一个「化学反应时刻」:论文一把农业析因设计与 agent 配置空间焊在一起——G=(S−B)/(R−B) 这个归一化让异构任务的方差可合并;论文二把回放世界与触发机制矩阵交叉,让「何时行动」第一次成为可测因子;论文三把**证明携带代码(PCC)的「不信生产者、查证据」**与 LLM 审查结合——groundability 是 PCC 思想在自然语言审查上的再发明。共同点:都是把一个成熟领域的度量范式移植到 agent 评测这个新对象上。
八、通用性灵感:可迁移到其他领域的结论
灵感一:先测噪声,再测差别——「54% 法则」
核心思想:任何系统的输出方差中,若重复运行噪声占比过半,单次比较毫无意义;先做方差分解,再谈提升。 论文证据:论文一 54% 格内噪声、论文二种子方差 54–95%(且区分「事件噪声」与「持久行为差异」)。 推广场景:A/B 测试平台(先估计用户行为的 run-to-run 方差再上线实验);自动化交易策略回测(同一策略多种子回测的方差下界);任何 LLM 应用上线前的「一致性验收」;甚至科研实验的可重复性审计。
灵感二:写清楚任务说明书,性价比高于一切——「信息 > 模型 > 预算」
核心思想:当任务瓶颈在「知道正确程序」时,注入信息的单位回报高于扩大模型或延长预算,且无权衡(同时降成本、提校准)。 论文证据:效应量 1.93/1.45/1.50,bootstrap 第一概率 ≥99%,protocol 级四赢。 推广场景:企业落地 LLM 的第一优先级应是写 SOP/上下文文档而非买更大模型;人机协作系统设计(给新人的 onboarding 手册价值高于招更强的人);教育系统(教材质量 vs 课时 vs 学生选拔);RAG 系统的「检索质量优先于模型升级」。
灵感三:可执行约束胜过言语请求——「工具验证 ×3」
核心思想:想改变一个自主系统的行为,提供可执行的机制(工具、闸门、调度器),比在指令里请求它更有效;提示改变说辞,机制改变行为。 论文证据:提示式验证 19%→22% vs oracle 工具约 ×3 至 55–63%;cron 的外部唤醒保证 vs sleep 的即兴承诺。 推广场景:组织管理(流程与激励设计 vs 口头要求);安全工程(强制门禁 vs 培训宣传);API 设计(schema 校验 vs 文档约定);自我提升习惯(环境触发器 vs 意志力)。
灵感四:监督可靠性取决于证据的接地性,而非监督者的规模
核心思想:弱审查者 + 可机械核验的证据 ≈ 完美监督;强审查者 + 不可核验的证词 ≈ 随机。投资顺序应是「生产决定性检查」,不是「升级审查者」。 论文证据:8B 的 Llama 配官方证据 0.98/0.00;Qwen3-235B 未检查 catch 0.28 < Llama-8B 的 0.70;换证据是唯一在所有审查者上一致有效的干预。 推广场景:金融合规(可审计的流水 vs 更资深的审计师);内容审核(工具检测标记 vs 审核员规模);学术同行评审(代码+数据可复现性要求 vs 提高审稿人级别);供应链质检(测量仪器 vs 检验员经验)。
灵感五:证据是不对称的——失败的证据强于通过的证据
核心思想:一条校验过的失败几乎可以定案,一条通过只能弱推断;机制设计要利用这种不对称。 论文证据:生成测试失败→拒绝精度 0.82,通过→接受精度仅 0.30;「base 必须先失败」闸门把测试从证词变成行为检查。 推广场景:招聘(项目筛选的一票否决项 vs 加分项);医学诊断(排除性检查的价值层级);安全测试(一个可复现漏洞即拒绝上线);文献审稿(可复现失败的权重)。
灵感六:时间敏感性系统需要「唤醒策略」这个独立设计轴
核心思想:当价值随时机衰减时,「何时看」与「看什么」同等重要,且最优策略随任务价值函数形状变化(cron 宜例行、事件驱动宜检测、过度唤醒毁预测)。 论文证据:ω²=11%(breakout)、31%(web filing/broker)主效应与 forecast 的反向效应。 推广场景:监控与告警系统(SRE 的轮询 vs 事件触发);投资研究(定期报告 vs 事件驱动研究);个人知识管理(定时回顾 vs 情境触发笔记);IoT 边缘计算的唤醒词设计。
灵感七:把评测对象从「点」升级为「格」
核心思想:理解一个复杂系统的最好方式不是测它在某个配置下的表现,而是测它对配置扰动的响应面——响应面的形状(主效应、交互、噪声)才是系统的「指纹」。 论文证据:三篇共同的析因设计哲学;论文一发现最优轴随模型族漂移(Sonnet 5 下预算第一)。 推广场景:模型选型(对提示模板×温度×上下文做小格子扫描而非单点评测);产品 A/B 设计(价格×功能组合的响应面);材料/药物筛选的经典析因范式向自动实验科学的回归;政策试点(多因子试点设计)。
结语:评测学的三块基石
把三篇放回一句话里:论文一告诉我们 agent 是系统,所以评测要分解配置;论文二告诉我们世界在走,所以评测要丈量时机;论文三告诉我们答案是 claims,所以评测要构造证据。
三篇论文有一个共同的谦逊姿态——它们都没有提出新 agent、没有刷新任何排行榜,只是把「我们到底在测什么」这个问题往前推了三步。而三篇合读最大的启示或许是:在 54% 的方差是噪声、99.8% 的运行盲信弱专家、30 倍参数的审查者不如 8B 配证据的世界里,agent 领域最稀缺的不是更强的模型,而是更诚实的测量。
三篇论文均于 2026 年 9 月 30 日至 10 月 1 日上传 arXiv;论文一开源基准与 18240 条轨迹,论文二开源环境与数据管道,论文三未附公开代码链接。写作中所有数字均核对自论文正文与附录表格。