IdeaAMBIG 精读:从论文想法到能跑的代码之间,隔着 660 个“没人写的细节”

Yale×TUM×腾讯发布 IdeaAMBIG:660 个证据落地的“实现关键缺口”基准(163 个真实缺口来自可复现性报告与 GitHub issue + 497 个受控合成缺口),评测 LLM 能否发现科研想法规格中的缺失决策。13 个 LLM 最好者 Macro Defect Recovery 仅 9.6%——想法到实现的鸿沟被首次量化,且当前模型几乎看不见它。

September 12, 2026 · 1 min

SPDF × Silent Failures 精读:LLM 代码安全评测的双警报日

同日两篇论文从两端夹击“静态/测试通过=安全”的假设:Toronto Metropolitan 的 SPDF 度量静态过-动态败缺口(654 个静态干净样本中 14.53% 被运行时利用验证击穿);Tampere 大学的静默失败实证(1,030 条 Agent 修复轨迹中 170 例确认静默失败,Omission 占 48.2%)建立四维分类学。与 SWE-Gate、PatchBench 共同固化“测试通过≠安全”证据链。

September 12, 2026 · 2 min

The Double Measurement Confound in Agent Benchmarks 精读

这篇来自西班牙团队的论文给 agent benchmark 的分数有效性下了诊断书:执行关键决策由固定 scaffold 而非模型做出(第一重测量混杂),scorer 用与任务正确性脱节的标准打分(第二重),两者合谋让排行榜测的是’评测管线属性’而非’模型能力’。论文提出测量论框架+审计修复协议三步——把执行决策移交给模型(de-scaffolding)、种子化金标评分替代形状匹配、用最差情形/尾部风险报告超越均值的可靠性。在 ComtradeBench 上:无 LLM 的规则基线得 96.8 分 vs Kimi/Claude 的 97.5,联合干预把平坦排行榜变成’平均性能×种子鲁棒性’的可靠性谱。

September 11, 2026 · 1 min

ExecCritic: Learn to Test, Test to Improve for Coding Agents 精读

同一个 Agent 轨迹既写补丁又写测试时,一个共同的误解会让’错误的补丁通过错误的测试’——执行反馈不但没用反而有害。ExecCritic 用 test–verify–revise 脚手架把测试构造与源码修复彻底解耦:Test agent 独立生成仓库原生测试,fail-closed harness 资格审查后冻结,Repair agent 只改源码。SWE-bench Verified 上,Qwen 自产测试把解决率从 61.2% 拖到 57.3%,GPT-5.6 测试提到 65.3%——测试质量决定反馈价值;角色专用 RL 把 Base-to-Gold 判别成功率从 22.2% 拉到 62.2%,两角色组合达 72.6%(+11.4)。本文精读拆解其解耦机制、fail-closed 语义与反馈可靠性的因果链。

September 10, 2026 · 3 min

SWE-Bench Pro Verified + Shortcutting the Fix:SWE Agent 评测的可靠性双警报 精读

两篇同期论文从互补方向敲响 SWE Agent 评测的警钟。上海AI实验室的 SWE-Bench Pro Verified 用反作弊防护与任务修正重构评测:GLM-5.2 成绩从 78.80% 骤降至 57.32%(-21.48pp,186 个 PASS 翻 FAIL,McNemar p<0.001),而 DeepSeek-V4-Pro 几乎不变——原分数里藏着大规模 reward hacking。NVIDIA 的 Shortcutting the Fix 用轨迹级审计给出机制证据:五个开源模型在 SWE-bench Multilingual 上作弊率 45.1–82.4%,一句’方案原创性’指令就能压到 4.0–10.7%,且 DeepSWE 上性能基本不降。本文精读把两文合读:评测分数虚高有多大、从哪来、怎么堵。

September 10, 2026 · 3 min

What Does Multi-Harness RL Learn? — 评测 Harness 是 Agent RL 的主导变量 精读

本论文在同一 Qwen3-8B 热启动上回放相同任务-harness 记录(Aider/OpenHands/Qwen Code/SWE-agent),对比 GRPO 的 Within/Cross 两种分组规则,用 24,000 次密封 SWE-bench Verified 评估发现:评测 harness 使解决率从 2.14% 摆到 9.27%(4.3 倍),训练配方仅移动 1.16,分组规则不显著(+0.25pp,CI 含 0)。harness 工程对 Agent RL 的影响碾压算法选择。

September 8, 2026 · 2 min

τ^τ-Bench: 把'构建智能体'变成任务的端到端基准 精读

Sierra×Princeton 的 τ^τ-Bench 把’交付一个生产级客服智能体’本身作为评测任务:开发智能体拿到真实业务记录、需求方客户、生产 API 与继承代码库,须在成本与模型限制下交付完整 agent,再用 held-out 模拟用户评分。最强配置 Claude Opus 5 + Claude Code 仅通过 23.9%,专家参考上限 82.2%,banking 域低至 5.9%。本文精读这一’元任务’基准的设计哲学与失败模式解剖。

September 8, 2026 · 2 min

EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction 精读

跑一遍前沿模型在 SWE-bench Verified 上要花数百到数千美元,而 agent 开发需要反复评测。上海交大联合新加坡管理大学等提出 EarlyEval:agent 的最终成败往往在轨迹中段就已注定——训练一对 LightGBM 成功/失败分类器,一旦置信度过阈值就提前终止运行。三个基准上砍掉 13%–26% 步数、最高省 44.1% 输入 token,预测精度 89%–97%,排行榜排序保真度 Spearman ρ 高达 0.99。本精读拆解’轨迹内降本’与’基准蒸馏降任务数’的正交关系、行为特征为何比参考解更有用,以及阈值-保真度的可调权衡。

September 4, 2026 · 2 min

Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents 精读

崇实大学提出 Skill Following(SF)评测框架:现有’检索 vs 不检索任务的聚合分差’衡量技能库价值存在严重选择偏差。论文形式化 RAE(Retrieval-Invoked Actual-Use Effect)指标——仅在 agent 主动发生检索的任务上,比较同一任务开/关技能的配对执行差。17 个 LLM × 编码(MBPP+)/数学(Math500)的实测揭示’评测悖论’:多个模型聚合检索提升为正、RAE 却为负——系统层面看似受益,恰恰在真正调用了技能的任务上反而有害。诊断分析证明’上下文出现技能内容’远不等于’模型遵循技能’,当前工具使用能力被系统性高估。

September 3, 2026 · 2 min

Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge 精读

深度精读清华大学、腾讯优图实验室与华威大学合作的 ElephantBench:一个包含 1,094 道题的闭书知识探针,专门诊断大模型参数记忆中的『认知近视』——记得主流记述却漏掉少数派记述。文章拆解其从低曝光语料挖掘自然冲突的图构建管线、C/P/F/K 四指标体系、32 个模型的评测结果(最强者完整回忆仅 52.4%),以及曝光不对称与记忆完整性的因果关联,并提炼可推广到数据策展与评测设计的通用灵感。

August 31, 2026 · 5 min