Gagar × SWE-MILE × CRR:代码智能体强化学习的细粒度信用分配三重奏 精读

本文合并精读 2026 年 9 月底三篇聚焦「代码智能体 RL 细粒度信用分配」的论文:小米+人大+北大+港大的 Gagar 用组内 agentic 评审排出补丁质量层级,再以保和重分配把质量偏好注入 GRPO 优势,DeepSWE 从 50.2% 提到 62.2%;中科院自动化所+国科大+腾讯的 SWE-MILE 定义导航势与验证势两个运行时势函数,以势差做过程奖励塑形,SWE-bench Verified 63.8 全面超越五条过程奖励基线;北邮+卢森堡大学的 NeurIPS 2026 论文 CRR 利用沙箱可 fork 的物理性质真实执行反事实动作,把「续走终局的回报差」作为免费过程奖励,Verified 41.7% vs GRPO 36.4%。三篇论文回答同一个问题——终态二值奖励下如何区分好坏决策——却给出质量对比、运行时信号、反事实执行三条机制迥异的路线。每篇覆盖背景、关联工作、问题、解法、证据、根源(含外部交叉验证)、知识反推与通用灵感。

September 30, 2026 · 6 min

RepoReuse × VulContextBench:代码智能体的复用行为与安全证据审计 精读

本精读一次读两篇互补论文:北大等六机构的 RepoReuse 审计 coding agent 在多轮迭代开发中『写了什么』——是复用仓库既有代码还是重复造轮子(recall 饱和但 self reuse 仍从 83.9% 跌到 69.1%,Cdup 升至 51–69%,pass 率却纹丝不动);新加坡管理大学等三机构的 VulContextBench 审计安全审查中『看了什么』——浏览 86.3% 金标准行却只申报 12.9%,37–73 个百分点的『看到但不上报』差距。二者共同宣告:功能测试通过 ≠ 过程正确,viewed vs declared、recall vs reuse 的分离测量是过程可信的关键仪器。

September 30, 2026 · 9 min

SWE-Game × CUA-SWE:软件工程基准的游戏化与视觉化扩展 精读

当「写代码」不再是软件工程的唯一通道,SWE 评估如何保持确定性?本精读合并解读两篇 2026 年 9 月的新基准论文:SWE-Game 把评估对象扩展到游戏构建/修复/移植,用共享仪表接口与确定性运行时检查把缺陷检出率做到 94.25%(视频 VLM 裁判仅 75.40%);CUA-SWE 把信息通道扩展到运行中应用的视觉界面,用 code-only 与 Hybrid CUA 配对对照及 S/M 规格来源分层,证明 GUI 的价值不在「看」而在「恢复只存在于应用材料中的规格」(M 任务 +42~48pp)。二者共同回答:交互维度扩展之后,确定性验证依然是 SWE 基准的定海神针。

September 30, 2026 · 5 min

WideSWE × AsynCodeBench × RepoMAS:超越单仓库的软件工程智能体三重维度 精读

同日挂出的三篇 arXiv 论文从三个正交维度宣判了传统 SWE 基准的「单仓库、单 Agent、单次规格」范式已经不够用:浙大+清华的 WideSWE 首次把「一个需求横跨多个仓库协同修改」做成可执行基准,最强配置任务成功率仅 42.50%,但至少完成一个仓库的比例高达 83.33%——连乘判定暴露出被单仓库评估遮蔽的范围缩窄与交付中断;休斯顿大学牵头六校的 AsynCodeBench 用显式依赖图+可执行 Checker 直接度量异步多 Agent 的「协作」本身,发现 TestPass 48.0% 而 ADPR 仅 18.8%、Qwen 三代模型单体编码能力大涨而协作能力停滞;哈工大的 RepoMAS 定义「渐进式指定任务」并提出 Issue 驱动的仓库状态维护框架,ProgSpec 44.7 分且结构化 Issue 消融直降 13.9 分。本文按九部分结构合并精读三篇论文,并给出统一结论:软件工程 Agent 的评估单元正在从仓库走向生态、从结果走向依赖轨迹、从静态规格走向可修订规格。

September 30, 2026 · 7 min

FLARE:用生成式奖励模型为长程编码智能体提供全生命周期稠密监督 —— 精读

深度精读北京大学、南京大学、北京邮电大学与独立研究者联合提出的 FLARE。它通过 RADAR 双轨数据合成训练一个 4B 生成式奖励模型(GRM),输出结构化的步级风险诊断(风险等级+错误类+修复建议),在推理时做断点再生、训练时做 SFT 筛选与 RL 稠密奖励,首次把测试时干预与训练时对齐闭环到同一套诊断信号。F2P Pass@1 14.10% 近乎翻倍于全局重采样 7.80%,token 省 5×;ROC-AUC 75.74%;SFT 相对提升 19.13%,RL 平均提升 9.19%。

September 23, 2026 · 4 min

ReqEvolve 精读:ASE 2026 上的用户驱动软件自演化范式

UCD+CNR 提出“用户驱动自演化”新范式:终端用户用自然语言表达需求,软件在执行中自动生成并集成新功能。ReqEvolve 实现(需求解释→代码生成→运行时集成)在 72 个演化案例/18 项目基准上 Pass@1 89.2%,超 SpecFix +18.8pp(大效应量 r=0.79)。ASE 2026 已录用。

September 12, 2026 · 1 min

VP-Control 精读:Agent 提交门的“证据血统比模型多样性重要 3.6 倍”

WashU+SMU 发布 VP-Control:Agentic AI 提交门的代价感知验证组合设计。2880 场景确定性基准+2×2 因子实验证明:共享证据的跨模型投票批准 62.9% 不安全提案,独立证据源仅 22.9%——源效应 40.9pp vs 模型效应 11.3pp。共模数据失效让“多模型投票”这一直觉失效,组合控制器以部署可观测元数据实现 1.9% 不安全执行。

September 12, 2026 · 1 min

A-JIT: Agentic Just-In-Time Software Construction 精读

Kentucky×UCL 的这篇范式论文把 JIT 编译的思想搬到软件交付层:A-JIT 应用=代码+运行时 harness+内嵌 agent 的活组装体,语言层显式标注’留待 JIT 构建的部分’(code holes),agent 持续观察系统使用与执行轨迹,像 JIT 编译器特化机器码那样按需特化软件逻辑、工作流与工具接口。传统’先构建后部署’的静态范式被’按需即时构建、持续适应’取代,软件从固定制品变成会生长的有机体。本文精读其三支柱设计(语言标注/运行时支持/实现新定义)与 Bosque 原型上的 trace 驱动人-AI 协同构建。

September 11, 2026 · 1 min

RealSWE 精读:真实用户请求正在让编码 Agent 榜单失真

RealSWE(成均馆大学)用六类信息分类学×四维语言风格对照 SWE-chat 真实用户 prompt 与 SWE-bench 任务,发现 88% 真实请求只带问题描述而基准任务仅 7%;据此构建 381 个多变体任务族,测得 7 个主流模型在真实输入下平均掉 6.4pp 且排行榜改写——MiMo V2.5 Pro 反超更贵模型升到第 2。控制变量消融进一步证明:Desired Behavior 字段值 8pp,复现步骤与环境信息几乎一文不值。

September 6, 2026 · 2 min

Requirements After the First Edit 精读:需求晚到正在让 Agent 会话里的代码作废翻倍

KIT×早稻田×阿德莱德在 3,553 个真实 SWE-chat 会话上首次把’需求晚到’与’行级代码作废’在同一会话内关联:新需求到达后,Agent 删除的先前代码量约为无需求编辑的 2 倍,且该负担随会话推进无衰减;受控实验进一步显示延迟披露只是把实现工作搬到披露之后、并未增加额外返工。需求工程 30 年的 volatility 教训在 agentic 编码场景被压缩进单一会话重演。

September 6, 2026 · 1 min