FuzzingBrain-Bench V1: Evaluating Open-Ended Bug Discovery by LLMs 精读
Texas A&M 与诺维萨德大学团队提出 FuzzingBrain-Bench:第四代 LLM 漏洞发现评测范式——不再要求模型复现预定义目标漏洞,而是在自包含 Docker 沙箱中经 fuzzing harness 触发尽可能多的不同 crash,按「去重后的不同 crash 签名数 × 难度系数」计分。基准含 77 道挑战(43 个开源项目,36 C/32 C++/9 Java),覆盖内存安全与 DoS 等 14 类缺陷;三跑复现门控防 flaky 虚增、每挑战 3 签名封顶防单一多产缺陷主导、答案剥离+无网络+oracle 不可达防作弊。三个 Claude 模型实测:Opus 4.8 以 196/579(34%)居首,触发 60/77 挑战的 crash;13 道 D5 挑战无一模型攻破。实验还证明模型常发现计划外缺陷——这正是放弃「目标复现式」评分的直接证据。附带成本/token/轮次的行为分析揭示输入 token 是输出的 84–188 倍。