HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety 精读
UNC教堂山分校Tianlong Chen组联合UCF、密歇根州立发布HarnessRisk——首个覆盖agent harness全生命周期的安全基准:把harness安全组织为配置/能力扩展/运行时/状态持久化/动作控制/事件恢复六个运营阶段,128个沙箱案例每个配对良性用户目标与嵌入不可信工作流制品的对抗指令。14个模型-harness配置的评估揭示:攻击成功率12.6%-80.9%波动,配置阶段最脆弱,同一模型跨harness的ASR差4.3倍——安全是部署配置的属性而非模型属性,且风险识别不等于安全行动。