cua-swe-duet: 编码 Agent 基准的两条新轴(视觉×SWE 与 repo 级从零生成)合读

当 SWE-bench 式修补基准逐步饱和、任务缺陷与训练污染被系统曝光之后,「编码 Agent 该测什么」成了比「模型怎么变强」更紧迫的问题。本精读合读 2026 年 9 月底同期发布的两篇基准论文:CUA-SWE(CMU+USC+UW-Madison+ASU+AWS)把「视觉通道」引入软件工程——agent 在同一任务内改代码、跑命令、操作运行中软件的 GUI 并依据截图诊断修复,Hybrid 较 code-only 平均提升 12.8~48.6 个百分点,DevOps 域 code-only 全军 0%;E2E-SWE(Meta Superintelligence Labs)则把评估推向「从零建库」——186 任务 11 种语言,把可解性作为一等设计目标,13 个前沿模型 pass@1 拉开 11.7%~67.7% 的分布。两篇论文殊途同归:都把「评估有效性设计」置于「难度堆叠」之上,分别回答了饱和之后基准竞赛的两个正交方向。

October 2, 2026 · 6 min

编码 Agent 的安全边界与协作假象:Approval Laundering 与 OpenCollab 合读 精读

本文合读 2026 年 9 月底同期出现的两篇编码 Agent 基础设施论文:复旦单作者工作 Approval Laundering 证明「人批准的动作 ≠ 实际执行的动作」,用六轴分类学系统化批准-执行绑定漏洞(Scope/Temporal/PATH 替换 BGR=1.0),并以七字段 HMAC Approval Token 部分修复;上海交大牵头的七机构工作 OpenCollab 证明「声明的协作 ≠ 发生的协作」,用 Adherence 六轴审计与 CACE 因果归因把多智能体增益争议变成可测量问题,并以双 Coder 工作流在 SWE-bench Pro 拿下 64.25% SOTA。两篇从安全与效能两个方向拆掉 Harness 的同一类隐式信任假设:把 Agent 系统的隐式假设变成可测量、可审计的对象。

October 2, 2026 · 9 min

编码 Agent 训练三条线:token 效率、自验证与安全 精读

本篇合读 2026 年 9 月底同期发布的三篇编码 Agent 后训练论文:HERO 用分层强化学习在不牺牲解题率的前提下把 token 开销降下来(SWE-bench Verified 上 4B 模型 32.8→40.0% 且相对 GRPO 省 39.8% token);SCVD 先用候选态重放诊断出终端 agent 自验证「报错可靠但通过不可信、检出错误仅半数能修」,再用学生条件化蒸馏修复(PASS@1 +9.7~16.9pp 且 OOD 不掉点);SecureVibe 先归因不安全 agent 缺的是安全规划与测试行为,再用 Security Suite SFT + rl/hg 双路后训练补齐(unseen CWE SecPass 7.69→19.23 且 SWE-bench +4.1)。三篇论文共享同一方法论:先归因行为缺口,再设计监督信号——共同回答「编码 Agent 的后训练到底该优化什么」。

October 2, 2026 · 9 min

CAMG × Comet-9B:文件即记忆与程序状态推理的 Agent 训练新范式 精读

本篇精读两篇 2026 年 9 月的代码 Agent 训练论文:京东的 CAMG/CAMG-RL 发现专用记忆工具落在预训练分布之外(surprisal 6.371 vs 0.252 nats/token),转而用纯任务奖励让 shell 文件操作自发生长为记忆,4B 模型追平 35B;UCSB 与微软合作的 Comet-9B 不直接训练写补丁,而是训练「程序状态推理」(bug 何时触发、错误如何传播),反而把 SWE-bench Pro 从 24.35 推到 30.51。两篇论文共同指向一个反直觉结论:不直接优化目标行为,而是优化能迁移的中间能力。文章按背景、定位、问题、解法、证据、根源、知识反推、通用灵感九部分展开,并用外部文献交叉验证两大机制。

September 30, 2026 · 7 min

CodeSkill × NanoHarness:技能抽象与 Harness 效应——被低估的智能体性能杠杆 精读

本精读合并解读两篇从「模型权重之外」挖掘编码智能体性能的论文:清华+华为诺亚+上交的 CodeSkill 把长程 RL 从 token 级提升到技能级——teacher 蒸馏三级文本技能(目标/执行/控制),分层 VAE + Gumbel-Softmax 执行反馈门控边界把离散技能映射为连续隐变量 zH/zM/zL,以软提示前缀注入冻结 LLM(LoRA),PPO 在隐空间优化;SWE-bench Verified 76.2、EvalPlus 99.2 开源第一,交互步数 12.3→6.8(−45%),去掉 VAE 直接用文本技能+RL 则 BigCodeBench 从 94.8 掉到 88.4。南京理工+TUM+南京大学的 NanoHarness 首次把 harness(模型外基础设施)作为一等研究对象做组件级受控分解:固定模型下 harness 差 19.4pp vs 模型差 22.8pp;在 mini-SWE-agent 上增量加五组件,工具注册表 +4.57pp、任务特定子代理 +5.91pp,而上下文压缩 −4.86pp——机制是结构化工具把无序 shell 探索变针对性调用(jqlang 案例 133 次探测→43 次、通过率 24.68%→68.17%)。二者共同指向:技能结构与 harness 设计是被系统低估的性能杠杆。

September 30, 2026 · 6 min

Codoku × SecProbe:可再生谜题与自适应出题的评估方法学双星 精读

本精读合并解读两篇互为犄角的评估方法学论文:ETH Zurich(含 Zhendong Su)的 Codoku 用 semantic reification(PLDI'26)从零合成 witness 程序、掩码成程序推理谜题,以全局约束 Φ 验证任意有效填充——谜题不编译、不可执行,执行/调试/穷举三条捷径全部失效(16,200 个填充仅 6 个有效),GLM 5.2 五分钟解光 CruxEval 全部 1600 题,而 Codoku large 最强模型仅 54%,小谜题不足 40 行仍让最强模型漏 23%+,专有/开源差距从 26pp 拉大到 37pp;Notre Dame 等 8 机构的 SecProbe 把心理测量学的 2PL IRT 与自适应测试引入 agent 安全评测,用 information-gap 分数定位「能力密集但信息不足」区域,驱动五专家 agent 管线按 12 维难度向量按需合成仓库级漏洞修复任务(353 任务/151 CWE,最强 GLM-5.3 pass 仅 28.33%),同等估计精度比随机合成省 29.5% 任务、held-out 能力估计 RMSE 0.110 vs 0.140。一篇治污染与作弊,一篇治饱和与低效,合看是基准评估两大顽疾的两份独立解方。

September 30, 2026 · 4 min

Gagar × SWE-MILE × CRR:代码智能体强化学习的细粒度信用分配三重奏 精读

本文合并精读 2026 年 9 月底三篇聚焦「代码智能体 RL 细粒度信用分配」的论文:小米+人大+北大+港大的 Gagar 用组内 agentic 评审排出补丁质量层级,再以保和重分配把质量偏好注入 GRPO 优势,DeepSWE 从 50.2% 提到 62.2%;中科院自动化所+国科大+腾讯的 SWE-MILE 定义导航势与验证势两个运行时势函数,以势差做过程奖励塑形,SWE-bench Verified 63.8 全面超越五条过程奖励基线;北邮+卢森堡大学的 NeurIPS 2026 论文 CRR 利用沙箱可 fork 的物理性质真实执行反事实动作,把「续走终局的回报差」作为免费过程奖励,Verified 41.7% vs GRPO 36.4%。三篇论文回答同一个问题——终态二值奖励下如何区分好坏决策——却给出质量对比、运行时信号、反事实执行三条机制迥异的路线。每篇覆盖背景、关联工作、问题、解法、证据、根源(含外部交叉验证)、知识反推与通用灵感。

September 30, 2026 · 6 min

Opera × CER:长程编码智能体的评论家介入与早期奖励预测 精读

本精读合并解读两篇在「轨迹还没走完」时提供质量信号的长程编码 Agent 论文:Salesforce AI Research 的 Opera 构建口头评论家框架——把每次修正管理为持久化笔记(混合调度五事件触发审查 + 九个契约化类型算子诊断 + 准入/发布双审计把关投递与关闭,并把「遵从」与「解决」分开跟踪),在 Terminal-Bench 2.1 / SWE-Bench Pro / DeepSWE v1.1 三基准上把 Qwen3.8-27B 的 resolve rate 提升 7.9/4.0/8.9pp,去掉双审计后增益损失 2/3,证明误导性反馈的代价之高;UW 等机构的 CER 则在 rollout 结束前从 40 步前缀预测终端奖励——用检索经验库合成任务自适应 rubric、同父兄弟续跑组内共享打分(组内序保持即足以支撑排名类下游),TTS 上 Nemotron 3 Ultra RM@8 达 67.6%(+4.2pp)且只用 15.3% token 匹配最佳基线(省 84.7%),RL 上 40 步截断 + 弃权门控 DPPO 以 52.7% 更少在线 token 超过全轨迹 TMax(51.6% vs 49.7%)。一个向内诊断当前轨迹,一个向前预测最终结局,合看构成测试时监督的两条互补路径。

September 30, 2026 · 5 min

RepoReuse × VulContextBench:代码智能体的复用行为与安全证据审计 精读

本精读一次读两篇互补论文:北大等六机构的 RepoReuse 审计 coding agent 在多轮迭代开发中『写了什么』——是复用仓库既有代码还是重复造轮子(recall 饱和但 self reuse 仍从 83.9% 跌到 69.1%,Cdup 升至 51–69%,pass 率却纹丝不动);新加坡管理大学等三机构的 VulContextBench 审计安全审查中『看了什么』——浏览 86.3% 金标准行却只申报 12.9%,37–73 个百分点的『看到但不上报』差距。二者共同宣告:功能测试通过 ≠ 过程正确,viewed vs declared、recall vs reuse 的分离测量是过程可信的关键仪器。

September 30, 2026 · 9 min

Self-Evolving Coding Agents × RE-0:从数字程序到物理世界的自进化智能体 精读

二重奏精读两篇互补论文:hexafuture.ai 的 Self-Evolving Coding Agents 提出物理编码范式,用 Code as World + Code as Policy 双可执行表征与类型化验证器,把编码代理范式迁移到物理世界,在 RoboCasa365 上把成功率从 56.6% 提升到 61.1%;吉林大学与大连理工的 RE-0 用 locate-verify-weight 递归和 LCB 准入,仅凭 3-67 条验证数据把具身 Code-as-Policy 基线从 4-68% 提升到 62-100%。一篇搭系统、一篇做训练,勾勒物理世界自进化智能体的完整图景。

September 30, 2026 · 7 min