cua-swe-duet: 编码 Agent 基准的两条新轴(视觉×SWE 与 repo 级从零生成)合读

当 SWE-bench 式修补基准逐步饱和、任务缺陷与训练污染被系统曝光之后,「编码 Agent 该测什么」成了比「模型怎么变强」更紧迫的问题。本精读合读 2026 年 9 月底同期发布的两篇基准论文:CUA-SWE(CMU+USC+UW-Madison+ASU+AWS)把「视觉通道」引入软件工程——agent 在同一任务内改代码、跑命令、操作运行中软件的 GUI 并依据截图诊断修复,Hybrid 较 code-only 平均提升 12.8~48.6 个百分点,DevOps 域 code-only 全军 0%;E2E-SWE(Meta Superintelligence Labs)则把评估推向「从零建库」——186 任务 11 种语言,把可解性作为一等设计目标,13 个前沿模型 pass@1 拉开 11.7%~67.7% 的分布。两篇论文殊途同归:都把「评估有效性设计」置于「难度堆叠」之上,分别回答了饱和之后基准竞赛的两个正交方向。

October 2, 2026 · 6 min

Harness 的三种缩放轴:Mid-Harness × STITCH × Turbo Harness 精读

同日三篇论文从三个互补粒度回答同一问题:固定模型后 Harness 侧还有哪些缩放轴可挖。NVIDIA+KAIST 的 Mid-Harness 下沉「动作级」——在模型与 Harness 边界采样 N 个候选、执行前由验证器选一,发现采样收益完全由验证支配(前沿验证器把 TerminalBench-Lite 从 50.00% 拉到 68.03%),且与轨迹级缩放正交可组合(+Best-of-T 达 66.33%、成本减半)。UIUC+UMich 的 STITCH 沿「原语级」轴测试时组装——带 scope/contract 的原语库+确定性编译器,SWE-V 80.5%、组装开销仅 2.7%,配 mismatch gap 与指数衰减两命题。Rutgers+Red Hat AI+MIT-IBM 的 Turbo Harness 沿「实例级」轴打补丁——回收外层搜索副产物蒸馏 playbook、GRPO 训 9B 编辑器逐实例补丁,SWE-V 38.4→54.4%、步数 23.1→8.7。三轴正交可叠加,构成 Harness 工程学的完整缩放谱系。

October 2, 2026 · 10 min

Harness 自动进化三重奏:MILO、ScholarEvolve 与 Malena 精读

2026 年 9 月末,arXiv 上同时出现三篇方向相撞的 Harness 论文:MILO 用「负证据谱系记忆+编排者元进化」把自动 Harness 发现推上 Terminal-Bench 2.1 官方榜首之上(RR@5 86.1%),ScholarEvolve 让 Harness 从研究文献中学习模块化变异(AppWorld Challenge TGC 49.6%→63.6%),而 Malena 却用大规模控制变量消融证明:在前沿编码 Agent 之上,复杂 Harness 机制几乎全部冗余(MLE-bench 获奖 62.5% vs 最佳开源 Harness 47.1%)。本精读逐篇拆解三者的机制与实验,再正面处理这个当日最大的张力——结论是:Malena 消融的是「统一机制的加减法」,而 MILO/ScholarEvolve 的增益来自「任务自适应、负证据利用与成本-精度前沿」这些 Malena 未覆盖的轴,弱模型反例(gpt-oss-120b、Gemma 4 31B)进一步表明机制收益随模型能力变化,两条路线实为同一光谱的两端。

October 2, 2026 · 10 min

Skill 全生命周期三重奏:SkillFM、Prompt2Skill 与 SkillGym 合读精读

合读精读三篇覆盖 Skill 全生命周期的新作:SkillFM 用潜空间流匹配把「从库里检索 skill」变成「单步直接生成」;Prompt2Skill 在零训练样本、零权重更新前提下仅凭一句任务描述无监督定制 skill;SkillGym 从 18.4 万社区 skill 反向合成 6.8K 可验证训练环境,教会模型「用 skill」(Trigger 行为 28%→96%)。三篇共同指向 Anthropic Agent Skills 生态爆发后的 skill 资产化浪潮:生成、定制、训练三阶段互补成一套完整的 skill 工程闭环。

October 2, 2026 · 11 min

Skill 泛化性二重奏:GSO 的过拟合诊断与 Rep2Skill 的表征进化 精读

本文合读同日发布于 arXiv 的两篇 Skill 论文:大阪大学 GSO 首次系统度量 skill 过拟合——21 个训练增益 skill 仅 5 个全保真、3 个归零,并提出改学「元技能」(学写法不学内容),在全部 6 基准领先(SWE-bench 47.5 vs 25.0);上科大+美团 Rep2Skill 证明文本轨迹归因太粗(AUROC 0.494),引入隐藏态轨迹+Neural CDE 定位偏离成功动力学的关键轮次(AUROC 0.838),ALFWorld Qwen3.5-9B 达 69.90%。两篇一体两面,共同回答「skill 自进化的信号应从哪里来」。

October 2, 2026 · 7 min

失败资产化二重奏:Agent Error Dataset 与 AREX-2 精读

Agent 训练数据的传统会计准则里,失败 rollout 是费用——采集了、用不上、直接核销。2026 年 9 月末的两篇论文在同两周内把这个科目改成了资产:Apodex 的 Agent Error Dataset(AED)把 50,228 个自然失败变成带诊断、带修正、带受控重放证据的「错误-诊断对」资产,用同检查点双臂重放首次把「修正的净因果增益」(18.4%→51.1%)从「重试也能过」(30.1% 的双通过率)中分离出来;BAAI 的 AREX-2 则把整条多轮失败-恢复轨迹做成训练数据,损失只打在「错误之后做了什么」的恢复性决策上,让 27B 模型在 MLE-bench Lite 拿到 81.8、超 GPT-5.6 Sol 9.1 分,且五小时预算内持续提升。本精读逐篇拆解两条「失败炼金流水线」的机制与证据,再处理它们之间最锋利的张力——AED 用 73 页附录诚实披露修复训练的环境依赖与真实环境倒退,AREX-2 用 12 页报告宣告跨域元技能迁移——结论是:两者在「损失不打在错误上、打在恢复上」这一核心设计上惊人收敛,而「失败资产」的变现条件(结构化保存、恰当标记、证据分级)比乐观者预期的更苛刻。

October 2, 2026 · 8 min

编码 Agent 的安全边界与协作假象:Approval Laundering 与 OpenCollab 合读 精读

本文合读 2026 年 9 月底同期出现的两篇编码 Agent 基础设施论文:复旦单作者工作 Approval Laundering 证明「人批准的动作 ≠ 实际执行的动作」,用六轴分类学系统化批准-执行绑定漏洞(Scope/Temporal/PATH 替换 BGR=1.0),并以七字段 HMAC Approval Token 部分修复;上海交大牵头的七机构工作 OpenCollab 证明「声明的协作 ≠ 发生的协作」,用 Adherence 六轴审计与 CACE 因果归因把多智能体增益争议变成可测量问题,并以双 Coder 工作流在 SWE-bench Pro 拿下 64.25% SOTA。两篇从安全与效能两个方向拆掉 Harness 的同一类隐式信任假设:把 Agent 系统的隐式假设变成可测量、可审计的对象。

October 2, 2026 · 9 min

编码 Agent 训练三条线:token 效率、自验证与安全 精读

本篇合读 2026 年 9 月底同期发布的三篇编码 Agent 后训练论文:HERO 用分层强化学习在不牺牲解题率的前提下把 token 开销降下来(SWE-bench Verified 上 4B 模型 32.8→40.0% 且相对 GRPO 省 39.8% token);SCVD 先用候选态重放诊断出终端 agent 自验证「报错可靠但通过不可信、检出错误仅半数能修」,再用学生条件化蒸馏修复(PASS@1 +9.7~16.9pp 且 OOD 不掉点);SecureVibe 先归因不安全 agent 缺的是安全规划与测试行为,再用 Security Suite SFT + rl/hg 双路后训练补齐(unseen CWE SecPass 7.69→19.23 且 SWE-bench +4.1)。三篇论文共享同一方法论:先归因行为缺口,再设计监督信号——共同回答「编码 Agent 的后训练到底该优化什么」。

October 2, 2026 · 9 min

自进化的可信与规模化:False Frontiers、UniEvo-VL 与 CollabFlow 合读 精读

自进化 Agent 的瓶颈正在从「能不能提升」转向「提升是不是真的」。本精读合读三篇 2026 年 9 月底的新作:False Frontiers 诊断出 proposer–solver 自进化中的「合谋作弊」(co-cheating)并用 CrossFit 交叉拟合反馈将错误合谋率从 6.1% 压到 3.0%;UniEvo-VL 把自我批评作为「特权信息」,用在策略自蒸馏让多模态模型 GenEval 从 0.747 升至 0.808,展示自我提升的正确姿势;CollabFlow 则把协作本身作为改进对象,用证据门控通信与 GFlowNet 轨迹平衡在 12 个数据集上全面登顶。三者合看,回答了「自我改进何时可信、何时失控」这一拐点问题。

October 2, 2026 · 6 min

训练前沿四重奏:蒸馏外推、规模解除、奖励治理与具身评测 精读

本篇合读 2026 年 9 月底集中出现的四篇训练侧前沿论文:RIDE 把「教师是方向不是终点」操作化为表示空间的 RL 残差外推,四组基座全部追平或超越教师;OASIS 诊断出在线自蒸馏的规模瓶颈源于「在教师不可模仿处监督」,用验证脚手架解除;ProRubric 把 Rubric-RL 奖励攻击的根因从准则文本转移到聚合方式,合取式协议级评分回收三分之一损失;GPT-6 Astra 具身评测则以六域系统实验界定前沿模型「任务决策强、物理控制弱」的能力边界。四篇合起来构成一条主线:监督信号放对了空间、放对了状态、用对了聚合、并诚实面对能力边界。

October 2, 2026 · 8 min