From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench 精读

深度精读 ISSTA 2026 的 MCR-Bench(中山大学+重庆大学+华为云)——首个「缺陷状态感知」的多轮代码审查基准。现有 LLM 代码审查评测把审查简化为单轮静态决策,而真实 Gerrit 数据显示近半数代码变更涉及多轮审查(单轮 0.33 天、超 6 轮 31.3 天)。MCR-Bench 含 2,269 个真实多轮审查任务(5 语言、38 个高星仓库、平均 3.8 轮),每任务带细粒度缺陷卡片与跨轮生命周期标注(New→Open→Resolved→Reopened)。构建管线用「先局部检测后全局追踪」两阶段 LLM 标注+3 次运行一致性过滤+6 名开发者双人交叉验证(kappa 0.87)+SZZ 排除合并后引入 bug 的 PR。实验发现:7 个主流 LLM 缺陷检测 F1 最高仅 0.551;最大错误模式是把 Resolved 误判为 New(38.29%)——跨轮时序错位;现成 ACR 流水线(PR-Agent 等 F1 0.257-0.416)普遍不如直接 prompt 裸 LLM。

August 28, 2026 · 3 min

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents 精读

Agent 的自我改进大多发生在一次任务结束之后——但那时这次运行已经救不回来了。AllSpark 团队的 PILOT 把自改进做成 live 的:监督者通过双向活通道在工作者执行中途重定向或中止(live steering),同时从活轨迹蒸馏可复用技能进持久 harness(live self-evolution),模型参数全程冻结。在 Terminal-Bench 2.0 上 PILOT 以 71.6 均分领先最强单 Agent 基线 5.3 个点;20 轮自改进迭代后 GLM-5.1 从 66.3 升至 80.9(+14.6pp),每任务输出 token 反降 42.9%。评测协议设计严谨:运行中零基准反馈,验证器只决定哪些更新进入下一轮。本文精读其监督者-工作者架构与两个中途纠偏案例。

August 28, 2026 · 4 min

Same Model, Different Harness: Different Coding-Agent Results 精读

同一个模型、同一批任务,只换 Agent Harness 的配置,编码成功率能差多少?独立研究者 Sydney Lewis 用严格的配对实验给出答案:在 20,480-token 紧窗口下,SWE-bench Verified 的平均 F2PF 从 28% 涨到 49%,完全解决数从 43 到 72。treatment 只有三件机械武器:半衰期规则缩短旧工具结果、检测器打断重复劳动、命令防护。论文最有冲击力的结论是方法论层面的——模型加 harness 才是被测求解器,单报模型名字的编码评测并不完整。本文精读其实验设计、跨四模型迁移证据与机制分析(阅读边界翻倍)。

August 28, 2026 · 3 min

Unsaid, Unsafe? Implicit Security Obligations in LLM-Based RTL Code Generation 精读

深度精读投 IEEE TDSC 的浙大+南通大学论文——研究 LLM 生成 RTL(硬件描述语言)代码时被忽略的「隐式安全义务」问题。软件漏洞还能打补丁,不安全的硬件一旦流片就无法修复。作者构建 SECRTL-GEN 基准:98 个真实 SoC IP 设计×4 种硬件语言=392 个任务,实测 5 个前沿模型功能通过率 73-79% 但安全通过率仅 14-35%,功能强不等于安全。提出 RTL-Obliger 神经符号框架:LLM 提取功能语义图,符号引擎对照 CWE 模式本体做确定性匹配找出「缓解证据缺口」,最后两阶段生成先写功能草稿再做义务引导局部修订,将全通过率从基线 49.6-51.4% 提升到 61.6%,token 成本仅为编码 Agent 的 1/3.6 到 1/8.7。

August 28, 2026 · 3 min

A Few Pages of Markdown: Committed AI Configuration and Lower Quality Cost after Coding-Agent Adoption 精读

深度精读 Stanford + CMU + Grid Dynamics 的 ASE 2026 论文:提出 RAMP 四级仓库 AI 成熟度标度(基于团队 commit 到版本库的 AI 配置工件而非问卷),对 509 个采用 coding agent 的仓库分层再分析——agent 在各成熟度层都加速开发(+28~38% commits),但质量代价分化:无配置仓库的认知复杂度增幅约为有配置仓库的 2 倍(+53% vs +27%)。

August 27, 2026 · 3 min

Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization 精读

深度精读 KOPE 论文——香港城市大学与华为联合提出的硬件内核优化自进化 Agent 框架。在公共语料极度稀缺的昇腾 NPU 场景下,KOPE 用经验图记忆保留「决策-结果」证据链,配合预算化三层上下文注入,使模型参数完全冻结的前提下通过率达 84.6%(最强基线 57.8%),token 消耗反而下降 93%。本文从内核优化领域背景、经验记忆机制、主动上下文管理、双消融实验到 RISC-V 跨硬件迁移,完整拆解「经验复用为何在语料稀缺场景碾压模型能力」的因果链。

August 27, 2026 · 5 min

Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks 精读

斯坦福单作者实证研究:固定模型、系统性变化任务描述本身,量化 prompt 信息量对编码 agent token 开销的影响。2,700 次受控运行显示——把完整规格砍到裸 user story 使成本 +29.7%、轮数 +16.4%(五个任务全部同向);prompt 只动均值不动方差(重复运行几何标准差恒为 ×1.34);输出 token 仅占 2.7% 却占 51.1% 花费;单次 $0.11 探测可把未知任务成本预测误差从 161% 降到 36%。「具体性而非要求的存在」才是省轮数关键。

August 27, 2026 · 3 min

Code World Model: Coding Agent as World Brain 精读

西湖大学 AGI Lab 与南洋理工提出 Code World Model:让编码 Agent 充当「世界大脑」,用可执行代码维护持久世界状态并驱动世界演化,再通过 proxy(粗粒度代理视频)接口把状态翻译成帧级时空约束,交给视频模型渲染高保真画面。该框架把「世界演化」与「视觉实现」解耦,直面视频世界模型只能从画面反推规则、上下文不足一分钟、离屏后果无法延续三大结构性缺陷。在仅 5.6 小时 GTA V 游戏数据上 LoRA 微调 MiniMax-H3 后,模型即可跟随 proxy 指定的角色位置、轨迹、场景布局与相机运动,并泛化到训练之外的角色与风格。本精读覆盖其问题定义、方法组件、数据管线与局限。

August 27, 2026 · 3 min

FuzzingBrain-Bench V1: Evaluating Open-Ended Bug Discovery by LLMs 精读

Texas A&M 与诺维萨德大学团队提出 FuzzingBrain-Bench:第四代 LLM 漏洞发现评测范式——不再要求模型复现预定义目标漏洞,而是在自包含 Docker 沙箱中经 fuzzing harness 触发尽可能多的不同 crash,按「去重后的不同 crash 签名数 × 难度系数」计分。基准含 77 道挑战(43 个开源项目,36 C/32 C++/9 Java),覆盖内存安全与 DoS 等 14 类缺陷;三跑复现门控防 flaky 虚增、每挑战 3 签名封顶防单一多产缺陷主导、答案剥离+无网络+oracle 不可达防作弊。三个 Claude 模型实测:Opus 4.8 以 196/579(34%)居首,触发 60/77 挑战的 crash;13 道 D5 挑战无一模型攻破。实验还证明模型常发现计划外缺陷——这正是放弃「目标复现式」评分的直接证据。附带成本/token/轮次的行为分析揭示输入 token 是输出的 84–188 倍。

August 27, 2026 · 4 min

Narcissus: Program Synthesis Using Context-Aware LLM Approximations 精读

代尔夫特理工大学团队提出 Narcissus:当任务固定目标语言(CFG 定义的 DSL)时,LLM 提案通常违反语法或不满足规格——与其反复重提示,不如把提案一次性编译成「上下文感知」的搜索启发式。它将提案解析修复为语法树,用前缀对齐(相同上下文的提案是否用了同一规则)、子程序复用(提案反复出现的片段)与正则化(提案指示的程序规模+保底项)三个信号给每次扩展打分,搜索期间零 LLM 调用。在五个域、两种搜索后端上,Narcissus 在每个预算下击败静态先验:SLIA-70 上 51.4 对 32.2,ARC-100 上解决 40% 而原始提案仅 13%,到达提案区域快约 12 倍;DeepSeek 弱提案加搜索甚至超过 GPT-4o 直接采样。正则化保底项保证任何规则不被剪枝——错误提案只会延迟解、不会藏死解。

August 27, 2026 · 4 min