WideSWE × AsynCodeBench × RepoMAS:超越单仓库的软件工程智能体三重维度 精读
同日挂出的三篇 arXiv 论文从三个正交维度宣判了传统 SWE 基准的「单仓库、单 Agent、单次规格」范式已经不够用:浙大+清华的 WideSWE 首次把「一个需求横跨多个仓库协同修改」做成可执行基准,最强配置任务成功率仅 42.50%,但至少完成一个仓库的比例高达 83.33%——连乘判定暴露出被单仓库评估遮蔽的范围缩窄与交付中断;休斯顿大学牵头六校的 AsynCodeBench 用显式依赖图+可执行 Checker 直接度量异步多 Agent 的「协作」本身,发现 TestPass 48.0% 而 ADPR 仅 18.8%、Qwen 三代模型单体编码能力大涨而协作能力停滞;哈工大的 RepoMAS 定义「渐进式指定任务」并提出 Issue 驱动的仓库状态维护框架,ProgSpec 44.7 分且结构化 Issue 消融直降 13.9 分。本文按九部分结构合并精读三篇论文,并给出统一结论:软件工程 Agent 的评估单元正在从仓库走向生态、从结果走向依赖轨迹、从静态规格走向可修订规格。