From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench 精读
深度精读 ISSTA 2026 的 MCR-Bench(中山大学+重庆大学+华为云)——首个「缺陷状态感知」的多轮代码审查基准。现有 LLM 代码审查评测把审查简化为单轮静态决策,而真实 Gerrit 数据显示近半数代码变更涉及多轮审查(单轮 0.33 天、超 6 轮 31.3 天)。MCR-Bench 含 2,269 个真实多轮审查任务(5 语言、38 个高星仓库、平均 3.8 轮),每任务带细粒度缺陷卡片与跨轮生命周期标注(New→Open→Resolved→Reopened)。构建管线用「先局部检测后全局追踪」两阶段 LLM 标注+3 次运行一致性过滤+6 名开发者双人交叉验证(kappa 0.87)+SZZ 排除合并后引入 bug 的 PR。实验发现:7 个主流 LLM 缺陷检测 F1 最高仅 0.551;最大错误模式是把 Resolved 误判为 New(38.29%)——跨轮时序错位;现成 ACR 流水线(PR-Agent 等 F1 0.257-0.416)普遍不如直接 prompt 裸 LLM。