SWE-Game × CUA-SWE:软件工程基准的游戏化与视觉化扩展 精读

当「写代码」不再是软件工程的唯一通道,SWE 评估如何保持确定性?本精读合并解读两篇 2026 年 9 月的新基准论文:SWE-Game 把评估对象扩展到游戏构建/修复/移植,用共享仪表接口与确定性运行时检查把缺陷检出率做到 94.25%(视频 VLM 裁判仅 75.40%);CUA-SWE 把信息通道扩展到运行中应用的视觉界面,用 code-only 与 Hybrid CUA 配对对照及 S/M 规格来源分层,证明 GUI 的价值不在「看」而在「恢复只存在于应用材料中的规格」(M 任务 +42~48pp)。二者共同回答:交互维度扩展之后,确定性验证依然是 SWE 基准的定海神针。

September 30, 2026 · 5 min

WideSWE × AsynCodeBench × RepoMAS:超越单仓库的软件工程智能体三重维度 精读

同日挂出的三篇 arXiv 论文从三个正交维度宣判了传统 SWE 基准的「单仓库、单 Agent、单次规格」范式已经不够用:浙大+清华的 WideSWE 首次把「一个需求横跨多个仓库协同修改」做成可执行基准,最强配置任务成功率仅 42.50%,但至少完成一个仓库的比例高达 83.33%——连乘判定暴露出被单仓库评估遮蔽的范围缩窄与交付中断;休斯顿大学牵头六校的 AsynCodeBench 用显式依赖图+可执行 Checker 直接度量异步多 Agent 的「协作」本身,发现 TestPass 48.0% 而 ADPR 仅 18.8%、Qwen 三代模型单体编码能力大涨而协作能力停滞;哈工大的 RepoMAS 定义「渐进式指定任务」并提出 Issue 驱动的仓库状态维护框架,ProgSpec 44.7 分且结构化 Issue 消融直降 13.9 分。本文按九部分结构合并精读三篇论文,并给出统一结论:软件工程 Agent 的评估单元正在从仓库走向生态、从结果走向依赖轨迹、从静态规格走向可修订规格。

September 30, 2026 · 7 min

编码智能体经济学三重奏精读:成本行为、紧凑文档与上下文蒸馏

一次读完三篇 2026 年 9 月 25 日同日发布的编码智能体经济学论文:Purdue 的成本低效行为实证研究(三种行为覆盖 79%–98% 任务、最高吃掉 22.75% 成本,7 条开发者原则降本 41.73% 反超检索工具与智能体自合成技能)、孟加拉 DIU 与夏威夷马诺阿分校的紧凑文档基准(源码扣留时 0.08→0.71 的大提升 vs 源码在场时 33 vs 29/30 的大规模 null 结果)、北大的 LOHA+ACD 上下文蒸馏(压缩所见而非所言,上下文降 43%–57%,32K 限制下解决率反升至 21.1%,吞吐 1.9 倍)。本精读逐篇覆盖九部分结构,并在合并结语中回答同一个问题:什么信息值得放进上下文。

September 29, 2026 · 13 min

环境演化、跨图溯因 SWE 与 AI 主导模型开发:RSI 三重奏精读

本篇三重奏精读覆盖递归自改进(RSI)方向的三篇最新论文:Env-Rethink 把「文件环境准备」变成可学习目标,用 27B 验证模型让 9 个下游模型在噪声环境平均通过率从 59.4% 提升到 72.7%,并用事件驱动演化生成可验证的更难环境;SWE-PolyVision 构建首个 100% 多图可执行 SWE 基准(92 任务、三种视觉访问模式受控干预),揭示「可得性不等于整合」的 access-to-integration gap;iCoder-27B 则让 Codex agent 在人类只提供可执行 Research Skills 的前提下自主跑完数据/SFT/OPSD/RLVR 全流程,训出 RTLLM 68.0 超越 GPT-5.5 与 Claude-Opus-4.8 的 27B 工业编码模型。三篇合起来勾勒出 RSI 的环境侧、评测侧与模型侧全景。

September 26, 2026 · 9 min

视觉编码基准与内核级失控遏制:PPTBench 与 Hard Stop 精读

本期二重奏精读覆盖两篇 2026 年 9 月的新作。PPTBench 用 500 张真实 arXiv 流程图测试 coding agent 的「视觉编码」能力:31 个配置中最佳的 Kimi K3 也只拿 67.80 分,97.92% 的运行能交出合法 PPTX,但 70.43% 死于语义门——agent 会写格式、读不好图;自检渲染次数与分数相关 r=0.881,而编辑次数几乎无关。Hard Stop 则对 2026 年 7 月真实发生的 agent 入侵 HF 生产网事件(4.5 天 17,600 个动作)做法医解剖,提出内核级 Andon 架构:eBPF/cgroup 在 syscall 边界以 0.0048ms 中位延迟抢占,应用层 82% 可绕过的对抗载荷在内核层 100% 被拦。一篇测能力上限,一篇防失控下限,合起来正好是 agentic 时代的两面。

September 26, 2026 · 10 min

Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It? 精读

SWE-bench 上的高分到底是真实的仓库级推理能力,还是对训练语料的死记硬背?上海交通大学等机构提出 SchrodingerRepo 评测框架,把测试仓库从一份静态代码变成评估期才『定型』的潜变量:agent 进入环境前,仓库处于语义等价但表面形态不定的叠加态;进入环境后才按随机种子实例化为重命名、重排、重写过的陌生仓库。实验显示,所有受测 LLM 在 SWE-bench Verified 上解决率下降 6.0–14.4 个百分点(p<0.05),且超过八成的额外交互开销花在仓库探索上;而在时间上隔离污染的 SWE-rebench 实例上解决率不变、只有成本上升——说明退化确实来自对熟悉仓库线索的记忆依赖,而非任务变难。本精读覆盖其四级变换方法、四组实验证据、外部交叉验证与可推广启发。

September 25, 2026 · 5 min

代码几分钟就能写完,交付为什么还没变快:云栖2026 Qoder论坛复盘——个人提效和组织提效之间,隔着一套Harness

2026 云栖 Qoder 专场复盘:满帮、海信、慧博、中宏与 Qoder 团队同台回答一个矛盾——模型写代码越来越快,企业交付效率并没有同步提升,因为个人提效不等于组织提效。卡住 AI Native 组织的不是模型,而是 harness 执行系统、全链路流程、安全左移与组织文化四重基建;Agent SDK 与 Cloud Agents 宣布开放,Veracode 45% 漏洞率讲清安全账。

September 24, 2026 · 5 min

代码能自动生成,共识不会:Qoder 五人七天之后,下一个同事是硅基的

云栖2026「Qoder:AI Coding赋能超级个体」回放复盘:谢文欣复盘五人七天做出 QoderWork,与八月重做 Qoder 撞上的共识瓶颈——AI 放大实现速度,不放大共同理解,解法是架构协议、AGENTS.md 与 E2E 三步链路。高萱展示硅基同事程知远:现场称月均 3000+ 任务、685 次提交覆盖 51 库。核心判断:效率不是乘法题,权限矩阵就是数字员工的岗位说明书。

September 24, 2026 · 1 min

One to More, More to One:面向软件工程 Agent 的类别感知迭代专家训练(类别感知 SWE 专家训练精读)

阿里巴巴提出类别感知的 SWE 专家训练与策略整合框架:SWE Labeler 用 47 个语义族 227 个标签做多轴标注,Agentic-miniRL 在可执行奖励下做长程 RL,RRE 循环(Refresh-Repair-Expand)让专家自蒸馏成功轨迹,Label-routed MOPD 用 ReLU 门控奖励外推把同起源多教师整合为单一可部署学生。最终在 Pro-618 上达 58.04%(较基座 +5.39),多语言 59.00%(+2.78),且每个类别都优于 Pooled/Balanced RL。本文按九部分拆解背景、类别跷跷板、标注体系、RL 配方、自改进循环、多教师蒸馏、实验、外部交叉验证与局限。

September 23, 2026 · 6 min

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 精读

CodeMidas(小米 LLM Core 联合北大、港大、人大)提出用源代码作为唯一输入,把开源库中「已实现功能」自动转化为带可靠验证器的编码强化学习(RL)环境。相比此前依赖 issue/PR/commit/测试/文档的环境合成路线,CodeMidas 首次做到五项开发记录全免,覆盖 3,185 个代码库、23 种语言、15 个领域,经四模块漏斗从 22,575 候选筛得 5,545 个高质量任务。用 GRPO 训练 MiMo-V2.5,在 SWE-bench Pro、DeepSWE、ProgramBench、RepoZero、Terminal-Bench 五个异构基准上全面提升(DeepSWE +11.7pp、ProgramBench +17pp)。消融证明「质量>数量」:清洗过滤后的 3k 子集即可击败 8k 未清洗样本。本文从根因上解释其优势来自可靠的二值奖励与任务供给的去绑定化。

September 22, 2026 · 6 min