PatchBench 精读:AI 漏洞修复的解决率被高估了 1.83 倍
马里兰大学的 PatchBench 揭示 AI 漏洞修复评测的两大效度威胁:25% 的 Agent 补丁与历史开发者补丁高度相似(补丁记忆),PoC-only 验证使 11 个 SOTA Agent 的解决率平均虚增 1.83×。其解法是只选 ground-truth 修复在 crash stack 之外的漏洞 + 漏洞移植 + 安全/语义双重验证。本文基于全文阅读拆解 DiffBLEU 记忆检测与验证协议设计。
马里兰大学的 PatchBench 揭示 AI 漏洞修复评测的两大效度威胁:25% 的 Agent 补丁与历史开发者补丁高度相似(补丁记忆),PoC-only 验证使 11 个 SOTA Agent 的解决率平均虚增 1.83×。其解法是只选 ground-truth 修复在 crash stack 之外的漏洞 + 漏洞移植 + 安全/语义双重验证。本文基于全文阅读拆解 DiffBLEU 记忆检测与验证协议设计。
Qwen 团队×清华的 Terminal-Universe 通过回放轨迹中的文件操作逆向恢复环境,把海量 Agent 轨迹转化为 37.3k 个可重查询、可验证的终端环境,并沿广度(跨代码库任务)与深度(多轮需求迭代)两轴扩展。Qwen3.5-27B 微调后 Terminal-Bench 2.1 +11.9、多轮 EvoCode-Bench +13.8。本文基于全文阅读拆解环境重建管线与数据飞轮设计。