cua-swe-duet: 编码 Agent 基准的两条新轴(视觉×SWE 与 repo 级从零生成)合读
当 SWE-bench 式修补基准逐步饱和、任务缺陷与训练污染被系统曝光之后,「编码 Agent 该测什么」成了比「模型怎么变强」更紧迫的问题。本精读合读 2026 年 9 月底同期发布的两篇基准论文:CUA-SWE(CMU+USC+UW-Madison+ASU+AWS)把「视觉通道」引入软件工程——agent 在同一任务内改代码、跑命令、操作运行中软件的 GUI 并依据截图诊断修复,Hybrid 较 code-only 平均提升 12.8~48.6 个百分点,DevOps 域 code-only 全军 0%;E2E-SWE(Meta Superintelligence Labs)则把评估推向「从零建库」——186 任务 11 种语言,把可解性作为一等设计目标,13 个前沿模型 pass@1 拉开 11.7%~67.7% 的分布。两篇论文殊途同归:都把「评估有效性设计」置于「难度堆叠」之上,分别回答了饱和之后基准竞赛的两个正交方向。