CoordPoison × Pretext × TrustProbe × ActionGuard:Skill 生态的信任危机——攻防测四面体 精读
本精读合读四篇 Skill 安全新工作,构成「攻×测×防」完整对抗格局:北航+百度 CoordPoison 将恶意执行与情境借口解耦到两个 skill(ASR 76.19%、跨模型迁移 96.88%、跨生命周期 cASR 100%),证伪孤立 skill 审计;华为苏黎世 Pretext 用白盒 LLM 攻击者击穿 NVIDIA SkillSpector(冻结检测器 ASR 至 96.7%),证明「静态规则+LLM 语义 judge」类检测器设计性缺陷;中科院信工所 TrustProbe 以污点分析+定向模糊在 11 个 agent 中挖出 104 个已验证漏洞(成本仅 $2.19),揭示 skill 递送机制使攻击面放大 3 倍;高丽大学 ActionGuard 用上下文分离+fail-closed 授权将 ASR 从 29.05% 压至 8.65%。四篇共同宣判:孤立 skill 审计的防御假设已被系统性证伪,安全边界必须移到运行时执行点。