How Do LLM Agents Actually Get the Flag? Trace-Level Provenance for Agentic Offensive Security Evaluation 精读
CTF 夺旗赛是评估 LLM 攻击性安全能力的主流方式,但传统评分只看提交的 flag 是否正确,不问 flag 从何而来。这篇论文提出 ctf-abacus 框架,把 1,435 次攻击轨迹重构成证据接地的 solve profile:将每步动作标注到 PTES 渗透阶段与 OWASP/CWE/ATT&CK 等标准技术,溯源 flag 首次出现的位置与来源,再经双 judge 独立标注与人工裁决。结果发现真实利用仅占恢复 flag 的 62-87%,直接暴露的捷径是记忆检索的 8.9 倍,而廉价关键词检测器 F1 只有 0.28——证明必须做序列级重构才能给 CTF 分数挤水分。