If It's Not Buggy, Don't Fix It: On the Dynamics of Iterative Bug-fixing with LLMs 精读

Warwick×UnlikelyAI 的这篇论文把’LLM 迭代修 bug’当作动力系统研究:每轮修复在修好一部分的同时引入新 bug(修复率与损伤率并存),系统收敛到几类吸引子——正确修复、振荡、或’幻觉修复’(模型虚构不存在的代码块导致循环早停)。最有趣的发现:bug 倾向性可以作为 steering vector 从 layer ~19 的激活中线性读出并双向干预——放大它模型更爱修(也更多幻觉)、抑制它模型更保守。‘没病别修’在机制层面有了操作含义。

September 11, 2026 · 1 min

XAgent: eXecution-guided Agentic AI for GitHub Issues 精读

XAgent 把仓库级 issue 解决从’读描述猜位置’升级为’跑起来看分歧’:执行引导定位对 buggy/非 buggy 版本做差分执行分析+树编辑距离定位行为分歧点,上下文感知测试增强器生成超越 issue 描述的边缘用例验证补丁。SWE-bench-Lite 上 resolve rate 62.0%(SOTA)、函数级定位准确率 72.8%、每 issue 成本 $1.56(比前 SOTA 便宜 37%)、token 省 40%,并解决 7 个所有顶级基线(SWE-Agent/EXPEREPAIR/Refact)全部失败的问题。本文精读’静态描述→动态执行’范式转移的机制细节。

September 11, 2026 · 1 min