SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation 精读
提示注入被 OWASP 列为 AI 智能体的头号威胁,而现有“安全 LLM“在自适应攻击下攻击成功率接近 100%。UC Berkeley 团队提出 SecOPD,把在线策略蒸馏(OPD)改造为注入防御训练信号:学生在被攻击输入上滚动生成,冻结的初始模型在对应干净输入上给同一 token 打分,实现 token 级信用分配。在 SEP + PISmith 自适应攻击下,防御后的 Qwen3.6-27B 攻击成功率仅 9.0%,比此前最强防御 Meta-SecAlign 的 94.0% 低一个数量级;同时七项效用基准平均 88.1%,与未防御模型持平。本精读覆盖问题定义、方法机制、实验证据、效果根源解释与可迁移灵感。