RealSWE 精读:真实用户请求正在让编码 Agent 榜单失真

论文:RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests(arXiv:2608.27831,cs.AI,2026-08-31 v2) 作者:Gyuhyeong Kim, Hyojung Gwon, Jeonghyeon Kim, Kyuhong Shim, Sunjae Lee*(通讯) 机构:成均馆大学(Sungkyunkwan University) 开源:RealSWE-bench + RealSWE-framework 均开源发布


一、题目

  • 会议/期刊:arXiv 预印本(2026 年 8 月末),评测资源论文形态,写作与实验规范对标 ICSE/FSE 数据论文(含统计显著性、Holm 校正、预注册式消融路径)。
  • 发表单位:成均馆大学软件学院。Sunjae Lee 组长期做 LLM 软件工程评测,此前工作覆盖代码生成与缺陷修复方向。
  • 一句话概括:论文证明 SWE-bench 榜单测的不是"用户会得到的体验"——把同样的任务换成真实用户的短促随意表达,主流模型平均掉 6.4pp,而且排行榜直接改写。

二、背景

研究脉络

仓库级修复评测的演进史,本质上是一条"任务输入不断美化"的路径:SWE-bench 从真实 GitHub issue 采集任务,但为了可执行性做了严格筛选——留下的问题陈述普遍长、结构化、信息密集(94% 用正式语气、89% 用陈述句)。而 SWE-chat 等真实交互数据集显示,用户对 Agent 说话的方式完全不同:87% 是随意的口吻、51% 用祈使句、大多数只有一句"这个在空输入时崩了,修一下"。

既有工作分两派回应这一错配:CursorBench 等直接用真实编码会话数据(闭源不可审查);另一派通过启发式变形近似真实感(截断问题陈述、注入歧义)。两派的共同缺陷是:能证明差距存在,但不能解释差距由什么构成——你既不知道该给任务补什么信息,也不知道哪些信息是冗余的。

与既有工作的差异

  • 与 CursorBench:RealSWE 完全开源且可复现,任务族共享同一 gold patch,支持受控消融。
  • 与变形式基准(truncate/注入歧义):RealSWE 的变体不是启发式扰动,而是由 SWE-chat 实测分布驱动的系统构造——每一格信息组合都有真实频率依据。
  • 与 SWE-Gate(9 月初精读过的约束合规基准)互补:SWE-Gate 问"通过测试的补丁是否可合并",RealSWE 问"榜单分数在真实输入下还剩多少"。

三、定位

  • 领域:软件工程 Agent 评测(SE Benchmark)。
  • 问题层级:评测效度问题——不提出新方法,而是给现有 Agent 评测基础设施补"真实输入分布"这块地基。
  • 目标读者:模型厂商(榜单营销 vs 真实体验)、Agent 使用者(如何写 prompt)、后续评测研究者(可配置框架)。

四、问题定义

输入:一个待修复/实现的仓库任务,以自然语言请求形式给出。

核心概念:

  • 六类信息字段(bug 修复):[P] 问题描述、[D] 期望行为、[R] 复现步骤、[E] 环境信息、[A] 附加上下文(URL/日期)、以及 feature request 侧的 [M] 动机。
  • 四维语言风格:语气(正式/随意)、句式(陈述/祈使)、结构化程度、长度。
  • 多变体任务族:同一底层任务+同一 gold patch,只变信息构成与语言风格的一组任务。

测量目标:

  1. 真实请求 vs 基准任务在两轴上的分布差(错配量化);
  2. 信息构成/语言风格对 resolution rate 的因果贡献(字段级消融)。

五、解法

5.1 错配测量(§3.1–3.2)

对 SWE-chat 真实用户 prompt 与 SWE-bench Verified/Pro 任务做双轴标注:

维度真实 prompt基准任务
仅 [P] 或 [P]+少量上下文88%7%
随意语气87%6%(94% 正式)
祈使句51%11%(89% 陈述句)

标注经双人独立+仲裁,LLM 辅助标注与人工一致率达标(附录 F)。

5.2 任务族构造(§3.3)

从 SWE-bench Verified/Pro 派生 381 个任务族:先做任务类型分类(bug fix vs feature request),再把问题陈述分解到六类信息字段,最后用真实用户风格重写(保持信息不变只变语气句式)。每个变体保留原 gold patch 与测试,保证"分辨率差异只能来自输入形式"。

质量控制:分解与重写质量由 LLM 判分+人工抽检双重把关;选择偏差分析(附录 A.4/F.1)证明入选任务与原分布无系统性偏移。

5.3 RealSWE 双形态发布(§3.5)

  • RealSWE-bench:固定评测集,采样分布严格匹配 SWE-chat 实测分布——“真实体验版排行榜”。
  • RealSWE-framework:开放全部变体与配置接口,支持自定义信息组合的语言风格做受控消融。

5.4 评估设计(§4.1)

7 个当代 LLM(含 DeepSeek V4 Pro、Qwen3.7 Plus、MiMo V2.5 Pro/标准版、MiniMax M3 等),统一 Agent 脚手架与执行环境,每任务 3 次独立运行(2/3 通过才算解决),配对比较+Holm 校正。

六、实验结果

6.1 基准-现实差距(主结果)

  • 平均下降 6.4pp(相对降幅 10.3–16.2%,均值 13.6%);
  • 绝对降幅区间:MiniMax M3 -4.0pp(34.1%→30.1%)至 DeepSeek V4 Pro -8.0pp(53.9%→45.9%);
  • 所有模型掉分比例相近 → 榜单分数系统性高估真实体验约 1/7。

6.2 排行榜改写

  • MiMo V2.5 Pro 原第 4 → RealSWE 第 2,超越 Qwen3.7 Plus 和 DeepSeek V4 Flash(MiMo-Qwen 差距 +3.7pp,95% CI [0.7, 7.3],显著);
  • 且 MiMo V2.5 Pro 单任务成本仅 Qwen3.7 Plus 的约 40%(6.5 vs 16.1 美分)——按原榜单选型会把用户导向"更贵且实测不更好"的模型;
  • 顶部四强(Qwen3.7 Plus/DeepSeek V4 Flash/MiMo V2.5 Pro/MiMo V2.5)的分差从 1.7 拉大到 3.3pp——原本"看起来 interchangeable"的模型被真实输入拉开。

6.3 字段级消融(控制变量核心发现)

  • [D] Desired Behavior 是 bug 修复的王牌字段:从 [PD] 移除 D 掉 7.1–8.9pp(均值 8.0,四模型全部显著 p<.01);而同时移除 [A][E][R] 合计仅 1.8pp(且唯一显著的变化是 +6.2pp 的提升——去掉冗余信息反而更好)。
  • [M] Motivation 是 feature request 的关键:[PM]→[P] 全模型平均掉 3.4pp,是特征请求侧唯一平均效应非零的字段(95% CI [0.2, 8.2])。
  • [PD] 全胜 [PA]:bug 修复上 3.8–6.1pp——“期望行为+问题"胜过"问题+复现步骤+环境+附件"的堆料。
  • 语言风格≈无影响:信息不变只重写风格,bug 修复平均效应 0.0pp、feature request -1.8pp,八个对比无一显著(Holm 校正 p≥.35)。
  • 按任务类型的差距分解:bug 修复掉 9.1pp、feature request 仅掉 3.7pp——欠指定的 bug 报告伤害最大,因为修复依赖精确的行为 oracle。

6.4 可操作结论

真实用户中仅 5% 会写明 Desired Behavior——显式写出期望行为与动机是用户侧零成本的最大杠杆;Agent 侧则应主动追问期望行为而非等待复现步骤。

七、知识反推

  1. 评测效度的因果分解方法论:把"输入形式"拆成正交字段做同 gold patch 的控制变量对比,才能从"有差距"走到"差距由什么构成”。这套成分化评测(compositional evaluation)设计可平移到任何"输入形式 vs 任务本质"纠缠的评测领域。
  2. 信息价值高度不均匀:给 Agent 喂信息的边际价值排序是 [D] ≫ [M] > [A][E][R]≈0——上下文工程的核心不是堆料而是识别 oracle 规定性信息。
  3. 语言风格是伪问题:口语化/正式对成功率几乎无影响,说明当前模型的语言理解已不是瓶颈,瓶颈在任务语义的欠指定。
  4. 榜单改写的经济含义:真实输入下的性价比重排意味着厂商优化方向可能错位——对着 SWE-bench 榜单优化的模型未必优化对了用户体验。

八、通用灵感

  • 对评测体系构建者的启发:本课题(多场景自迭代代码评审系统)的 V5 实验评测设计可直接借鉴"同 gold patch 控制变量"思路——评审 Agent 的 Precision/Recall 也应在"真实评审输入分布"(如评审 comment 的信息稀疏度)下复测,而非仅在基准分布上报数。
  • 对 Harness 工程的启发:Agent 框架可以在任务开始时主动追问 Desired Behavior(一个问题换取 ~8pp),这是比检索/推理优化便宜得多的杠杆。
  • 对数据合成的启发:多变体任务族构造管线(类型分类→字段分解→风格重写)是可复用的评测资产工厂。
  • 潜在后续工作:把 RealSWE-framework 的信息配置空间与主动澄清策略(asking clarifying questions)联合优化;多轮场景下 Agent 追问的信息增益量化。

基于论文全文逐页阅读撰写;统计数字均出自原文正文与表格。