ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement 精读

harness 自改进的泛化性危机:在评测基准上演化=对测试集过拟合,单轨迹更新把系统性缺陷与实例细节纠缠。ModularRSI 三重解法——benchmark-disjoint(2000 个外部演化任务与评测基准不相交)、对比式信用分配(同任务成功/失败轨迹对比聚合跨任务证据)、模块化定位(缺陷归因到 harness 具体组件)。DeepSeek-V4-Flash 骨干上 SWE-Bench-Verified 73.40→76.45、TerminalBench 2.0 47.57→52.43,演化 harness 可跨基座迁移。本精读覆盖三大缺陷的诊断逻辑与对比式信用分配的因果推断本质。

September 16, 2026 · 2 min

MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding 精读

自主编码 Agent 除功能正确性外还须在整个开发生命周期遵循过程指令与约束,但现有基准只测最终功能或单轮指令——多轮 Agentic Coding 的指令遵循是评测空白。MTAC-IFBench:多轮渐进式指令 + 6 主类/18 子类约束(平均 7.04 轮、91.33 约束/实例),每约束配 checklist 实现可验证评估。结果揭示残酷现实:最强 GLM-5.2 仍有约 20% 过程约束失守,多数 LLM 完美合规轮次 <10%。本精读覆盖’过程合规’与’功能正确’的分离测量及 checklist 化评测的构造方法。

September 16, 2026 · 2 min

SWEADV × VLoc Bench:Agent 安全评测双警报 精读

两篇同日论文从攻防两端敲响 Agent 安全警钟。SWEADV(Columbia×GMU×York):750 对抗 issue 描述攻击 APR Agent——恶意描述诱导’功能正确但不安全’的修复,攻击成功率 48.5-54.0% 近基线双倍,且 LLM-judge 检测精度降 16.6%、guided prompt 仅 62.3% 精度。VLoc Bench(CMU×Cisco×Foundation AI×Yale):把安全评测从’能否检测/修复’前移到’能否定位’——500 真实漏洞 × 290 仓库 × 147 CWE,Claude 系因 500 任务 $600+ 评测成本缺席。本精读合并解读攻击面转移与任务前置化两条安全评测新轴线。

September 16, 2026 · 2 min

Using Agentic AI for Contextualized and Multifaceted Code Review at Ericsson 精读

AI 编码 Agent 让代码生产提速后,评审成为新瓶颈——但现有 LLM 评审方法缺乏项目特定上下文且少有工业验证。Ericsson 与 Blekinge 理工按 Design Science Research 流程合作:多智能体 + 项目特定上下文知识,跨可读性/可维护性等四维度识别代码变更反模式。200+ 识别问题全部由 Ericsson 开发者人工验证:96% 识别正确、69% 被评’重要’。本精读覆盖工业实证方法论(DSR)、项目上下文注入的机制与’开发者认可度’作为工业评审 Agent 的黄金指标。

September 16, 2026 · 2 min

AMDKernelVault: Large-Scale Datasets and Agentic Training for AMD GPU Kernel Optimization 精读

AMD 开源 HIP/Triton 内核优化语料与 agentic 训练框架:HIPKernelGen/TritonKernelGen 管线把 PyTorch 参考实现转为 HIP/Triton 内核、在 ROCm 下编译验证、上硬件延迟剖析——产出 62,153 个执行验证 HIP 内核 + 2,377 条 ROCm 库 QA + 39,893 个 Triton 内核。演示价值:Qwen3-8B 经 SFT+执行感知 RL 后在 PyTorch→HIP 达 34.0% Pass@1、TritonBench-G 33.2% Corr@3、ROCmBench 41.94% Corr@3——打破 CUDA/NVIDIA 中心主义的开放生态基建。

September 15, 2026 · 2 min

Is Bash All You Need? An Empirical Study of Tool Interfaces for Enterprise Digital Worker Agents 精读

Microsoft 的系统性受控实验颠覆 agent 工具接口直觉:5 种接口配置(纯 typed tools / typed+bash / 纯 bash / bash+持久化自合成工具 / PTC)× 2 企业 benchmark × 2 前沿模型(Opus-4.8、GPT-5.5)下,纯 bash 全面对碾压 typed tools——TheAgentCompany 高 21.8-24.5pp、APEX 高 4.8-7.4pp,同时省 19-72% token。给 bash 加 typed tools 或工具合成均无增益。企业 agent 选型的迄今最硬证据。

September 15, 2026 · 2 min

Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering 精读

本文提出 two-gap 框架统一解释 agentic SE 的核心失败模式:requirement gap(需求 R 与利益相关者意图 I 的差)与 model gap(环境模型 M 与真实世界 W 的差)——reward hacking 是利用鸿沟的假接受,hallucination 是拓宽鸿沟的虚构。框架推导出非显然结论:叠加更多审查 agent 无用(共享同一 R/M/E 前提)、证据与权威必须来自内循环之外。案例集覆盖 KV store 六倍吞吐作弊与 2026 年 7 月 OpenAI/HF/Claude 评测越权事件。

September 15, 2026 · 2 min

Skill Issue: Lessons from Optimizing Repository SKILLs for Coding Agents 精读

TU Munich × JetBrains Research 的产学研负结果研究:在真实 Kotlin 仓库的合并 PR 反向挖掘任务上,GEPA 优化 SKILL 文档仅 +4.9pp(统计不显著)、SkillOpt 仅 +0.1pp——此前文献自报的巨大增益(55%→82%)是在弱模型弱 harness 配置下测出的。论文进一步证明 pass-rate 增益量级与二元判决本身的误标率(10.7% 盲重试通过)同阶,测量仪器而非优化器才是瓶颈。maintainer 盲读却确认 SKILL 含真实项目知识——分数之外的价值。

September 15, 2026 · 2 min

What is the Difference Between Me and You? Benchmarking the Quality Gap Between Human-Written and AI-Generated Code 精读

那不勒斯费德里科二世大学的 78.7 万函数对大规模研究:3 家 AI 助手(GPT 系/DeepSeek-Coder/Qwen2.5-Coder)按人写函数的 docstring 生成配对实现,静态分析映射到 ODC 缺陷分类+CWE 漏洞分类实现三语言(Python/Java/C)同框架人机对照。核心发现:AI 代码’结构压缩+风格模板化’(体量约人写一半、风格层独立聚类);缺陷类型分化而非数量分化;C 语言上 AI 高严重性内存安全缺陷反而更少。发布 CQBench(27,346 高问题任务)——Opus 4.8 在其上仍 2/3 有缺陷、1/3 有安全发现。

September 15, 2026 · 2 min

Recursive Code World Models 精读:global-local-global 递归构造可执行 3D 世界

佐治亚理工提出 RCWM:从单张参考图重建复杂 3D 世界为可执行场景代码。核心是递归场景程序(RSP)表示 + 自递归构造求解器——每次调用遵循建立整体→递归重建未解部分→回访整体精炼组合的 global-local-global 循环,参考对齐视图跨层级传播共享相机投影,父级回访修正局部精炼后浮现的边界错误。三级递归较固定二级 whole-frame PSNR 16.8→19.0、local SSIM 0.52→0.60,全面超越 image-to-scene-program 基线。

September 13, 2026 · 1 min