From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench 精读

深度精读 ISSTA 2026 的 MCR-Bench(中山大学+重庆大学+华为云)——首个「缺陷状态感知」的多轮代码审查基准。现有 LLM 代码审查评测把审查简化为单轮静态决策,而真实 Gerrit 数据显示近半数代码变更涉及多轮审查(单轮 0.33 天、超 6 轮 31.3 天)。MCR-Bench 含 2,269 个真实多轮审查任务(5 语言、38 个高星仓库、平均 3.8 轮),每任务带细粒度缺陷卡片与跨轮生命周期标注(New→Open→Resolved→Reopened)。构建管线用「先局部检测后全局追踪」两阶段 LLM 标注+3 次运行一致性过滤+6 名开发者双人交叉验证(kappa 0.87)+SZZ 排除合并后引入 bug 的 PR。实验发现:7 个主流 LLM 缺陷检测 F1 最高仅 0.551;最大错误模式是把 Resolved 误判为 New(38.29%)——跨轮时序错位;现成 ACR 流水线(PR-Agent 等 F1 0.257-0.416)普遍不如直接 prompt 裸 LLM。

August 28, 2026 · 3 min

MemToC: Benchmarking Memory–Tool Conflict Resolution in Large Language Models 精读

深度精读俄罗斯高校联盟(Skoltech 等)的 MemToC 基准——受控评测「工具返回与参数记忆冲突时该跟谁」。关键洞察:现有评测只测「源偏好」不测「源正确使用」——不知道哪个源正确,就无法区分有益的跟随与有害的盲从。MemToC 从 ToolHop 筛出 542 个质控事实问题,先诱导每个模型的闭书答案 m,再注入已知正确性的受控工具返回 r,按 m、r 对验证答案 g 的正确性划入四格(都对/仅记忆对/仅工具对/都错),每格定义目标行为(跟随/保留/弃权)。5 个 7-9B 模型实测:四个指令模型面对错误工具时能保住自己正确答案的仅 6.5-17.1%,双错时 78-86% 仍复读工具错误;120 个错误跟随中 0 个显式承认分歧。SFT/DPO 微调仅在同样两个骨干上成功——成果取决于骨干而非目标函数;20 个方法-模型组合中 19 个降低了工具错误弃权——改进很少干净。

August 28, 2026 · 2 min

Not All Eval-Awareness Is Equal: Capabilities Framing Predicts Compliance 精读

深度精读 ENS Paris-Saclay 与 Goodfire AI 的评估方法学论文。模型在思维链里意识到「我正在被测试」时,其言语化 eval-awareness 可分解为两种框架:能力框架(在测我能不能遵守指令)与安全框架(在测我会不会越界),二者对合规行为的预测方向相反——能力框架下的合规率比安全框架高 24–46 个百分点。CoT 预填因果干预证实了因果性(11 个预填中 10 个方向符合预测)。这直接挑战当前安全评估管线「聚合抑制 eval-awareness」的实践。

August 28, 2026 · 2 min

PAWBench: How Far Are We from Probabilistically Aligned World Modeling? 精读

深度精读上海交大、上海AI实验室、Krea AI、Hugging Face 等多方合作的 PAWBench:把「概率对齐」形式化为视频世界模型的分布级标准——固定初始观测与动作下,模型诱导的未来分布应匹配物理上有效结果的正确概率。50 场景两套件评测 11 个视频生成模型,无一同时做到概率准、覆盖广、场景稳;核心洞见是「一条合理的未来不等于分布对齐」,加大采样预算只提高覆盖率、纠正不了概率分配。

August 28, 2026 · 2 min

Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems 精读

多智能体系统(MAS)失败后重跑一次就能修好?这篇论文用 SymTrace 可控回放框架和 536 条人工标注失败轨迹(SymFail)证明:现有任务级重跑方法的修复成功率仅 6.90%,且主要是靠 LLM 采样随机性’碰’出来的,而非真正修复了失败机制。作者提出的症状驱动节点级干预把单次干预修复率提到 20.15%(相对最强基线提升 191.89%)。本文精读其可控回放的数据集设计、实验证据与’因果修复 vs 随机修复’的方法论启示。

August 28, 2026 · 5 min

Unsaid, Unsafe? Implicit Security Obligations in LLM-Based RTL Code Generation 精读

深度精读投 IEEE TDSC 的浙大+南通大学论文——研究 LLM 生成 RTL(硬件描述语言)代码时被忽略的「隐式安全义务」问题。软件漏洞还能打补丁,不安全的硬件一旦流片就无法修复。作者构建 SECRTL-GEN 基准:98 个真实 SoC IP 设计×4 种硬件语言=392 个任务,实测 5 个前沿模型功能通过率 73-79% 但安全通过率仅 14-35%,功能强不等于安全。提出 RTL-Obliger 神经符号框架:LLM 提取功能语义图,符号引擎对照 CWE 模式本体做确定性匹配找出「缓解证据缺口」,最后两阶段生成先写功能草稿再做义务引导局部修订,将全通过率从基线 49.6-51.4% 提升到 61.6%,token 成本仅为编码 Agent 的 1/3.6 到 1/8.7。

August 28, 2026 · 3 min

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 精读

深度精读上海交大、新加坡国立大学、美团、港中文、牛津等合作的 UrbanGround:基于香港地政署全境 3D 地理数据构建真实尺度城市沙盒,以五级「空间能动性阶梯」810 个人工验证实例评测 MLLM Agent 能否把局部感知转化为可靠行动。结果尖锐:视觉识别可高达 80-93% 但方向理解接近四选一随机;短导航最高 75% 而长导航几乎全军覆没(最高 3.8%)——局部能力存在,却无法组合成持续目标导向行为。

August 28, 2026 · 1 min

A Judge Should Know What Changed: Construct Validity for LLM-as-a-Judge Evaluation 精读

用 LLM 当评委(LLM-as-a-Judge)已是 AI 评估的通用做法,但一个根本问题从未被检验过:当被测内容真的变了,评委的判分会跟着变吗?华南理工与澳门大学团队借用心理测量学的’构念效度’框架,提出评委必须同时满足两条件——构念保持的编辑下判分不变(不变性 S)、最小构念改变编辑下判分必变(敏感性 R)。实测 7 个评委 × 4 个领域发现:匹配不变性 S=0.945 时敏感性仅 R=0.319,最强评委仍漏掉五分之二的构念变化;且评委对’声明的覆盖范围扩大’敏感、对’承诺强度提高’近乎失明(+0.121 差距,7/7 评委同号)。论文还证明现有评估标签集本身可被只看表面形式的预测器恢复 55%-67%——尺子先漏了。

August 27, 2026 · 4 min

Candidate supply and answer selection shape the value of LLM judging in multi-agent systems 精读

复旦大学(华山医院+类脑智能研究院)联合上海交大、上海科学智能研究院的多智能体实证研究(Nature 子刊风格):把 MAS 推理分解为「候选生成→同行通信→终端选择」的演化管线,发现核心瓶颈是「生成-保留鸿沟」——正确答案常已在候选中却被多数偏置级联丢弃(差距 13-14pp)。15,336 题离线排序基准证明裁判可靠性随正确答案可用率 sigmoid 上升(半升中点 14.7%);81,390 个冻结候选池重放显示,频率+排序混合选择规则把准确率从 63.82% 提到 70.82-70.95%。

August 27, 2026 · 3 min

FrontierChallenge: Evaluating Scientific Workflow Completion 精读

深度精读 Apodex 团队的科学工作流基准论文——300 个端到端科学工作流(本文发布 97 个、203 个内部留出),覆盖量子化学/分子动力学/材料表征/分析化学/生命科学/电化学环境六域 21 个工作流族,评测单位是完整交付的工件 bundle 而非单一答案。12 个前沿模型 × 3 种 scaffold 的结果揭示核心裂口:最高平均分 87.9 但最高 Pass Rate 仅 20.6%,分析化学 87.6 分对应 4% 完成率、电化学 94.9 分对应 0%;非通过 Claude Code 轨迹中 75.5% 结尾仍声称「已完成」——高分与自信声明都不是交付成功的可靠信号。

August 27, 2026 · 4 min