SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 精读

上海创新研究院与复旦大学联合发布 SWE-bench Science:覆盖 20 个科学领域、98 个真实仓库的 119 个任务,以 Issue 驱动、专家探索、工程集成三种范式考察 coding agent 在科学软件上的真实修复能力,并用隐藏预言机与反校准协议狙击伪修复。结果所有最强 agent 的 Pass@1 均不足 50%,四类失败机制归因与科学信息双向消融揭示了科学知识与代码推理交织处的深层瓶颈。

August 22, 2026 · 3 min

Agent Lightning v1.0: Towards Harnessed Agentic RL 精读

微软亚洲研究院联合复旦、浙大、爱丁堡大学发布Agent Lightning v1.0,首次系统定义harnessed agentic RL范式——当部署级agent harness直接参与RL训练时,训练引擎只能看到一串LLM请求-响应对。论文刻画了重分词破坏token前缀连续性、动态样本数下的优势计算、损失归一化与后端调度四大挑战,以约3500行代码给出参考实现,仅用6K训练样本让Qwen3.5-9B在SWE-bench Verified上从41.8%提升到56.4%(+14.6个百分点),并公开完整数据清洗管线与防reward hacking脚手架。

August 20, 2026 · 3 min

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents 精读

华为LegoX团队联合港中文发布LEGO-RL——在不修改原生编码agent harness内部控制流的前提下接入可扩展策略梯度训练。三大支柱:进程内LLM代理捕获原始生成流实现token级对齐与训练端logprob重算(即使harness压缩/重序列化上下文)、Nydus镜像缓存+分级防御抑制reward hacking、插件化校验监控+Live UI轨迹诊断。训练Qwen3.5-35B-A3B(GSPO)在三大harness上全面提升:OpenHands SDK 64.0%→70.4%、Claude Code 62.4%→68.2%、OpenCode 57.2%→66.6%,rollout-训练概率相关性保持0.99以上。

August 20, 2026 · 2 min

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation 精读

美的AIRC联合KUKA、上海交大、浙大发布SemaPLC——一个项目接地、验证门控的PLC代码生成agent harness。它由常规工具组装而成,却由一条严格的完成纪律统治:agent不许凭自判断宣布完成,只有工具日志确认的规格审计、编译、运行时三类外部检查全部过关才准交付;任何编辑作废全部旧判定并重跑全部检查。在117个独立POU任务上它让全部7个模型拿到最高严格通过率(均值72.6%,超最强基线8.8个百分点);在65个真实工厂项目任务上,其动态行为分52.2碾压基线最高31.4——静态分相近的方法在运行时被彻底分离。编译通过≠跑得对,执行才是生成控制逻辑最忠实的检验。

August 20, 2026 · 6 min

SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution 精读

上海交通大学顾晓东组提出SkillForge——面向项目特定issue解决的自蒸馏框架。核心洞察是冷启动问题:agent在特定仓库上缺乏项目知识,历史驱动方法依赖过往issue信号、在线方法每题付出昂贵探索成本。SkillForge反其道行之:主动重新实现仓库中带测试覆盖的核心功能来合成项目特定issue,解决后把经验蒸馏为实体锚定技能。SWE-bench Verified上DeepSeek-V3.2达72.2%(+5.8超基线,超最强对手+3.0),GPT-5-mini 60.6%(+5.6),SWE-bench Pro上同样领先,单issue成本仅$0.069-0.087。

August 20, 2026 · 2 min

StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents 精读

哈佛大学联合Raycaster AI、斯坦福等机构提出StagedWorkspace——为知识工作agent建立版本化工作区。论文形式化workspace-state contract概念:agent检索的解析视图、编辑的原生文件、审阅的diff、提交的制品可能指向同一工作产物的不同版本,这是PDF/表格/幻灯片等非代码制品长期缺乏的契约。内容哈希绑定使视图与版本显式关联,OfficeQA Pass@1提升8.3-12.1点,SW-AGENT用Gemini 3.1 Pro达OfficeQA 63.9%(同模型已发表分数仅29.3%),证明工作区状态是被忽视的实验变量。

August 20, 2026 · 2 min

Agentic Kernel Optimization: Generating State-of-the-Art GPU Kernels Without Hand-Written CUDA 精读

Intellifusion(云天励飞)技术报告:验证通用代码Agent能否在无任何手写CUDA的前提下产出SOTA GPU内核。在Houmao多Agent编排框架中构建“正确性门控”的内核优化工作流——人类仅做编排(定义流程、强制正确性与反作弊约束、提供关键参考、卡住时重定向搜索),完全不审阅内核代码;起点仅为PyTorch参考实现+工作负载定义+基准命令+紧凑CUDA优化技能集。约19亿agent token在NVIDIA B200上产出:Fused MoE加速92.68×(FlashInfer库为47.08×)、DSA TopK 1101.02×(FlashInfer 52.03×)、DSA Sparse Attention 181.35×(FlashInfer 10.33×);MLSys 2026 FlashInfer竞赛官方评测中Fused MoE内核1.71×超FlashInfer基线并超过agent-assisted赛道第一名(1.68×)。

August 19, 2026 · 2 min

The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks 精读

马普所软件系统、EPFL、Apple与奥尔胡斯大学联合提出编码Agent的“一致性负债”(coherence debt)理论与实证框架:把仓库级任务建模为耦合事实图的重建——每次编辑所需事实要么来自近期上下文要么来自参数记忆,两通道都不覆盖的事实构成一致性负债。通过供应/扣押双通道与注入故障的因果操纵设计(虚构API迁移的闭卷/前置对照、真实Pydantic迁移及其全重命名孪生使记忆失效),在7模型×5 harness上证明:双通道皆空时无一模型能完成任务(能力下限),事实前置后即可解(瓶颈在事实可得性而非推理);上下文与记忆呈“亚可替代性”——更多上下文只在包含与当前编辑耦合的事实时才有帮助,分解只在让互相一致的事实同处一个分区时才有效。

August 19, 2026 · 1 min

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior 精读

普渡大学、微软研究院与芝加哥大学团队对编码智能体的工具架构做了受控对比实验:在能力等价前提下比较六种工具架构(BashOnly、Atomic、NLSearch、Python、HypoTrack、Scratchpad),覆盖三个模型共11700条轨迹。结果显示结构化原子工具将弱模型重复运行稳定性最高提升4.7倍,自然语言搜索拓宽仓库探索广度超过11%,代码执行接口在任务表现相近的情况下减少41.6%步数与56.3%token消耗,而轻量认知脚手架几乎无效——接口本身就在塑造智能体行为。

August 17, 2026 · 4 min

CAPRI: 契约感知的Isabelle证明修复 精读

深度精读多国团队合作的 CAPRI——面向 Isabelle 证明修复的契约感知工作流。核心洞察是『假成功』问题:LLM 不修证明,而是把要证的结论直接加进假设再用 by assumption 一步证完,Isabelle 完全正确地接受了这个被改弱的定理——build 通过不等于修复发生在授权边界内。CAPRI 的解法是双接受规则:Build(Isabelle 构建)与 Conforms(独立契约检查器逐字节比对保护区)缺一不可,配合 proof-body-only 最小暴露接口把违规提案物理挡在证明器之外。180 次冻结运行中,144 个被 Isabelle 接受的终态候选里有 6 个动了保护文本,全部来自可编辑完整理论的迭代工作流;而接口受限的 C2 零契约违规。论文给一切 LLM 辅助修改场景立了一条铁律:权限边界的验证必须独立于能力验证。

August 16, 2026 · 3 min