What Does Multi-Harness RL Learn? — 评测 Harness 是 Agent RL 的主导变量 精读

本论文在同一 Qwen3-8B 热启动上回放相同任务-harness 记录(Aider/OpenHands/Qwen Code/SWE-agent),对比 GRPO 的 Within/Cross 两种分组规则,用 24,000 次密封 SWE-bench Verified 评估发现:评测 harness 使解决率从 2.14% 摆到 9.27%(4.3 倍),训练配方仅移动 1.16,分组规则不显著(+0.25pp,CI 含 0)。harness 工程对 Agent RL 的影响碾压算法选择。

September 8, 2026 · 2 min

τ^τ-Bench: 把'构建智能体'变成任务的端到端基准 精读

Sierra×Princeton 的 τ^τ-Bench 把’交付一个生产级客服智能体’本身作为评测任务:开发智能体拿到真实业务记录、需求方客户、生产 API 与继承代码库,须在成本与模型限制下交付完整 agent,再用 held-out 模拟用户评分。最强配置 Claude Opus 5 + Claude Code 仅通过 23.9%,专家参考上限 82.2%,banking 域低至 5.9%。本文精读这一’元任务’基准的设计哲学与失败模式解剖。

September 8, 2026 · 2 min

RealSWE 精读:真实用户请求正在让编码 Agent 榜单失真

RealSWE(成均馆大学)用六类信息分类学×四维语言风格对照 SWE-chat 真实用户 prompt 与 SWE-bench 任务,发现 88% 真实请求只带问题描述而基准任务仅 7%;据此构建 381 个多变体任务族,测得 7 个主流模型在真实输入下平均掉 6.4pp 且排行榜改写——MiMo V2.5 Pro 反超更贵模型升到第 2。控制变量消融进一步证明:Desired Behavior 字段值 8pp,复现步骤与环境信息几乎一文不值。

September 6, 2026 · 2 min

Refusing the Impossible 精读:代码幻觉不是代码错误——12 个模型在不可解任务上 60% 硬编

PSU×Cisco 提出代码幻觉的三维分类学(groundedness×表现层级×行为),把’无根据生成’与普通 bug 干净切分;构建 270 个不可解任务(6 语言 24 子类)+91 个可解对照:12 个开源模型在 ~60% 的不可解提示上产出看似合理的无根据代码、仅 27% 正确拒绝、可解对照误拒 0%。模型乐于实现违反已证定理的算法、调用不存在的 crate,甚至’明知不可能仍照做’。

September 6, 2026 · 1 min

When Models Edit Too Much 精读:编码 Agent 的过度编辑病与保真度评测轴

NUS 团队在 400 个 BigCodeBench 任务上注入受控 AST 损坏、构造已知最小补丁的评测框架,系统刻画 over-editing:GPT-5.5 高 Pass@1 与大改动并存,一行 bug 修出 60 行代码;一条保存指令把超额编辑距离 0.195→0.131、认知复杂度降 26.6%、Pass@1 反升 2.3;SFT 过拟合已见损坏模式,RL 达 0.782 OOD Pass@1 + 0.050 超额距离且不伤通用编码能力。

September 6, 2026 · 2 min

PatchBench 精读:AI 漏洞修复的解决率被高估了 1.83 倍

马里兰大学的 PatchBench 揭示 AI 漏洞修复评测的两大效度威胁:25% 的 Agent 补丁与历史开发者补丁高度相似(补丁记忆),PoC-only 验证使 11 个 SOTA Agent 的解决率平均虚增 1.83×。其解法是只选 ground-truth 修复在 crash stack 之外的漏洞 + 漏洞移植 + 安全/语义双重验证。本文基于全文阅读拆解 DiffBLEU 记忆检测与验证协议设计。

September 5, 2026 · 2 min

SWE-Gate 精读:通过功能测试对软件工程 Agent 并不够

SWE-Gate(中山大学/浙大/重大)从真实 PR 评审评论中提取约束并构造 303 个仓库级修复实例,发现 644 个通过功能测试的补丁中 221 个(34.3%)违反评审约束——SWE-bench 式功能唯一评测系统性高估了 Agent 的真实修复能力。本文基于全文逐页阅读,拆解其约束提取管线、双测试设计与 221 个隐藏失败的分布规律。

September 5, 2026 · 2 min

Aspire: Can Models Self-Evolve from Vague Goals? 精读

现有 LLM 自进化研究都从人类定义好的显式任务出发,agent 只搜索’怎么优化’;但人类学习往往始于’成为更好的物理学家’这样的模糊目标。ByteDance Seed 联合 SUTD、M-A-P 等发布 Aspire 基准:只给一句自然语言能力目标,评测集对 agent 完全隐藏,agent 必须自己决定优化什么、怎么训练、如何验证。实验给出罕见的机制级阴性结果——24 次 final-only 运行仅 1 次超过基线分,最佳进化 harness 仍低于人工 Qwen-Agent。本精读拆解隐藏评测设计、三条研究问题(RQ1-RQ3)的实验逻辑,以及’代理增益不迁移’这一失败模式的根源。

September 4, 2026 · 3 min

Discriminative World Models for Web Agents 精读

Web agent 用世界模型做测试时动作选择:采样候选动作→预测下一状态→排序执行。但现有世界模型都用监督式’下一状态预测’训练——花大量 token 复述页面上没变化的部分,而下游 ranker 需要的恰恰是’不同动作导致的差异’。UC Berkeley 联合 MIT-IBM Watson AI Lab 提出 predicted-state matching:预测表示必须把真实结果状态从替代动作的结果状态中区分出来。同一份数据、同一个 Qwen3-8B 底座,仅换训练目标,匹配准确率从 47.77% 跳到 80.80%,WebArena-Lite 端到端成功率从 13.94% 提到 28.48%。本精读拆解’训练目标与下游任务对齐’这一教科书级修正的完整证据链。

September 4, 2026 · 3 min

EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction 精读

跑一遍前沿模型在 SWE-bench Verified 上要花数百到数千美元,而 agent 开发需要反复评测。上海交大联合新加坡管理大学等提出 EarlyEval:agent 的最终成败往往在轨迹中段就已注定——训练一对 LightGBM 成功/失败分类器,一旦置信度过阈值就提前终止运行。三个基准上砍掉 13%–26% 步数、最高省 44.1% 输入 token,预测精度 89%–97%,排行榜排序保真度 Spearman ρ 高达 0.99。本精读拆解’轨迹内降本’与’基准蒸馏降任务数’的正交关系、行为特征为何比参考解更有用,以及阈值-保真度的可调权衡。

September 4, 2026 · 2 min