SWE-Gate 精读:通过功能测试对软件工程 Agent 并不够
SWE-Gate(中山大学/浙大/重大)从真实 PR 评审评论中提取约束并构造 303 个仓库级修复实例,发现 644 个通过功能测试的补丁中 221 个(34.3%)违反评审约束——SWE-bench 式功能唯一评测系统性高估了 Agent 的真实修复能力。本文基于全文逐页阅读,拆解其约束提取管线、双测试设计与 221 个隐藏失败的分布规律。
SWE-Gate(中山大学/浙大/重大)从真实 PR 评审评论中提取约束并构造 303 个仓库级修复实例,发现 644 个通过功能测试的补丁中 221 个(34.3%)违反评审约束——SWE-bench 式功能唯一评测系统性高估了 Agent 的真实修复能力。本文基于全文逐页阅读,拆解其约束提取管线、双测试设计与 221 个隐藏失败的分布规律。
Qwen 团队×清华的 Terminal-Universe 通过回放轨迹中的文件操作逆向恢复环境,把海量 Agent 轨迹转化为 37.3k 个可重查询、可验证的终端环境,并沿广度(跨代码库任务)与深度(多轮需求迭代)两轴扩展。Qwen3.5-27B 微调后 Terminal-Bench 2.1 +11.9、多轮 EvoCode-Bench +13.8。本文基于全文阅读拆解环境重建管线与数据飞轮设计。
现有 LLM 自进化研究都从人类定义好的显式任务出发,agent 只搜索’怎么优化’;但人类学习往往始于’成为更好的物理学家’这样的模糊目标。ByteDance Seed 联合 SUTD、M-A-P 等发布 Aspire 基准:只给一句自然语言能力目标,评测集对 agent 完全隐藏,agent 必须自己决定优化什么、怎么训练、如何验证。实验给出罕见的机制级阴性结果——24 次 final-only 运行仅 1 次超过基线分,最佳进化 harness 仍低于人工 Qwen-Agent。本精读拆解隐藏评测设计、三条研究问题(RQ1-RQ3)的实验逻辑,以及’代理增益不迁移’这一失败模式的根源。
RLVR 用最终答案的对错给整条推理链打分,粒度太粗;PRM 要训练专用奖励模型,OPD 要求师生推理同构。Amazon Web Services 联合 UIUC 的 Cliff 给出过程监督的最小充分形式:只用现成 LLM 定位每个错误 rollout 的’第一个错误步’(Pitfall Step),把轨迹切成正确前缀与错误后缀,前缀正优势、后缀负优势。12 个场景上一致超越:比 On-Policy Distillation 高约 15%、比标准 GRPO 高约 7%,且弱教师(27B)下依然有效。本精读拆解’错误前缀之后无信息’这一核心洞察、token 级优势的构造细节,以及教师定位能力与人类标注 80% 一致率的验证实验。
Web agent 用世界模型做测试时动作选择:采样候选动作→预测下一状态→排序执行。但现有世界模型都用监督式’下一状态预测’训练——花大量 token 复述页面上没变化的部分,而下游 ranker 需要的恰恰是’不同动作导致的差异’。UC Berkeley 联合 MIT-IBM Watson AI Lab 提出 predicted-state matching:预测表示必须把真实结果状态从替代动作的结果状态中区分出来。同一份数据、同一个 Qwen3-8B 底座,仅换训练目标,匹配准确率从 47.77% 跳到 80.80%,WebArena-Lite 端到端成功率从 13.94% 提到 28.48%。本精读拆解’训练目标与下游任务对齐’这一教科书级修正的完整证据链。
跑一遍前沿模型在 SWE-bench Verified 上要花数百到数千美元,而 agent 开发需要反复评测。上海交大联合新加坡管理大学等提出 EarlyEval:agent 的最终成败往往在轨迹中段就已注定——训练一对 LightGBM 成功/失败分类器,一旦置信度过阈值就提前终止运行。三个基准上砍掉 13%–26% 步数、最高省 44.1% 输入 token,预测精度 89%–97%,排行榜排序保真度 Spearman ρ 高达 0.99。本精读拆解’轨迹内降本’与’基准蒸馏降任务数’的正交关系、行为特征为何比参考解更有用,以及阈值-保真度的可调权衡。
长上下文解码时,模型每生成一个 token 都要把整个 KV cache 读一遍——1M token 上下文意味着每步约 15GB 的内存搬运,而注意力其实高度集中。KAIST AI 联合 Google DeepMind 提出 Declarative Attention:让模型在思维链里用 // 三种标签自己声明’现在需要看哪里’,推理引擎像解析工具调用一样解析声明并跳过绝大部分 KV 读取。零训练、零外部打分器,15 个长上下文任务上 Gemma-4-31B 注意 token 降 52.0%、精度仅降 1.27pp。本精读拆解三模式协议、与代理打分式稀疏注意力的机制差异,以及’模型自己最知道该看哪里’的第一性原理。
自主 ML 研究 agent 缺的不是更强的模型或更聪明的流程,而是’怎么把方法跑通’的操作知识层。BAAI 联合中科大、人大、港理工提出 DisCo 蒸馏框架,把 1000 个 GitHub 仓库蒸馏成 5353 个经过验证的技能,构建 AREX-Skill Library。在固定 GPT-5.5+Codex 的对照实验下,技能让 MLE-bench 相对提升 134.3%、PaperBench 提升 34.4%、FrontierCS 提升 9.2%、PassNet 提升 14.0%,并以更低 token 消耗帕累托支配 Claude Code。本精读拆解技能图三层结构、四阶段蒸馏流水线、对照实验设计,以及’试错成本越高、操作知识价值越大’的机制根源。
Agent 每天与环境交互积累海量轨迹,但经验真的变成了能力吗?ByteDance Seed 姊篇基准 S3Gym 把’自改进’拆成自测试、自判断、自改进三个可测环节,在 7 个可执行验证的文本游戏上比较三种经验注入通路:原始历史 ICL、摘要记忆、参数训练。7 个前沿模型的核心发现:自改进既不自动也不均匀——GPT-5.5 在 PvZ 上 History ICL 的 AUC⁺ 高达 548.5,换摘要记忆暴跌到 33.2;同一模型同一环境换个通路结果天差地别。本精读拆解宽松探索/严格评测的分离设计、自评分与环境真值的对照记录,以及’经验压缩可行性决定通路优劣’的机制规律。
港中深联合美团 LongCat 团队提出 DiagEvo:自进化自博弈中 solver 常平台化甚至衰退,现有方法靠难度/多样性信号出题却不指明’该修哪个弱点’。DiagEvo 的答案是分层错误记忆——4B 诊断器分析失败轨迹、按’错误原因→主题→实体’三层组织、定向采样未解决错误因生成新题,辅以双置信度过滤与自由探索。三个 solver(Qwen3-4B/8B、OctoThinker-8B)在九个基准上全胜 R-Zero/DARC 等基线;消融显示去掉分层错误记忆数学均值掉 3.8 分(最大组件贡献)。与 HarnessEvolve 同日揭示同一趋势:显式诊断信号优于隐式统计信号。