PatchBench 精读:AI 漏洞修复的解决率被高估了 1.83 倍
马里兰大学的 PatchBench 揭示 AI 漏洞修复评测的两大效度威胁:25% 的 Agent 补丁与历史开发者补丁高度相似(补丁记忆),PoC-only 验证使 11 个 SOTA Agent 的解决率平均虚增 1.83×。其解法是只选 ground-truth 修复在 crash stack 之外的漏洞 + 漏洞移植 + 安全/语义双重验证。本文基于全文阅读拆解 DiffBLEU 记忆检测与验证协议设计。
马里兰大学的 PatchBench 揭示 AI 漏洞修复评测的两大效度威胁:25% 的 Agent 补丁与历史开发者补丁高度相似(补丁记忆),PoC-only 验证使 11 个 SOTA Agent 的解决率平均虚增 1.83×。其解法是只选 ground-truth 修复在 crash stack 之外的漏洞 + 漏洞移植 + 安全/语义双重验证。本文基于全文阅读拆解 DiffBLEU 记忆检测与验证协议设计。