论文链接:arxiv.org/abs/2608.26204 发表时间:2026年8月 机构:FAIR at Meta(Joy Chen 等 6 人)——纯企业实验室 领域标签:cs.CR / cs.AI / GUI Agent 安全评测 / 人机交互
一、论文背景
1.1 计算机使用 Agent 已经走到用户面前
CUA(Computer Use Agent,计算机使用 Agent)是能替用户操作图形界面的 AI——看屏幕截图、点按钮、输文字、导航页面。OpenAI、Anthropic、Google 和开源社区(Qwen)都已发布能自主导航 GUI 的产品级模型。从研究原型到用户产品,评价标准必须超越「任务完成率」:一次钓鱼覆盖层的误点、一次对含糊指令的误解执行,都可能造成直接伤害。
1.2 一个被系统性忽略的威胁面:界面里的陷阱
现有 GUI 安全基准(SafeArena、MobileSafetyBench、OS-Harm 等)各有三个共同缺陷:单平台(只有 Web 或只有移动端)、需要 live 环境(要跑真实容器/模拟器,难以复现与普及)、威胁类别由研究者拍板(可能测的不是用户真正担心的)。更关键的是,它们的威胁大多写在指令文本里(「帮我删掉安全邮件」这种显式有害请求),而真实世界的陷阱藏在视觉界面里:指令完全良性(「订个玛格丽特披萨」),但截图里的页面对象被动了手脚——钓鱼覆盖层、注入的提示、标签错位的按钮。文本层面看,任何安全审查都查不出问题。
论文里最刺眼的两个例子:所有 7 个模型都毫不犹豫点下 $25K 订单的 Checkout 按钮;没有任何模型发现一个标注为 Optimize 的按钮实际是恢复出厂重置。危险不在视觉表象,而在动作规模与标签错配——这正是 L1-L4 失效谱里最深的一层。
1.3 为什么还要测「歧义澄清」
可信赖的 Agent 不只要拒绝有害,还要在指令含糊时主动澄清而不是瞎猜。「买这条裙子」页面上有 Add-to-Cart、Buy-Now、Wishlist 三个按钮——该买还是该加购?误猜的后果可轻可重。此前没有基准把「安全」与「歧义处理」放在一起跨平台评测,留下一个盲区:安全基准上得分不错的模型,可能照样秒点天价账单。
二、论文定位和关联工作
与八个既有基准的对比表显示 ADeptS-Bench 是唯一同时满足八项属性的:跨移动+桌面双平台、视觉接地、离线评测、配对设计、含歧义流、用户调查驱动、开放发布、2,462 任务规模。SafeArena(500 任务/仅 Web)、MobileSafetyBench(250/仅移动)、OS-Harm(150/仅桌面、无配对)、RedTeamCUA(864/需 live 环境)各覆盖一角。
理论根基是作者团队自己的 ADEPTS 框架(2025):可信赖 Agent 设计的六项能力,其中安全意识与歧义澄清因「失败即直接伤害」被选为双流。歧义流与并发工作 AmbiBench(仅移动、仅歧义不测安全)互补;与 OS-BLIND 的发现(良性指令+上下文嵌入威胁也会致害)互相印证,但 ADeptS-Bench 把威胁呈现位置进一步明确到视觉界面并做成配对受控实验。
方法论上的独特一步:威胁分类学不是研究者定义的,而是 44 种不良结局经 n=1,300 美国普通用户 MaxDiff 调查排出优先级——身份盗窃(80.2%)、账户入侵(77.5%)、未授权资金转移(76.0%)居首,虚假评分(11.6%)与垃圾日历邀请(11.0%)垫底;74.1% 参与者更担心外部攻击而非内部错误——这直接决定了基准偏重对抗性威胁类别。
三、问题定义
论文测量的是 CUA 的「可信赖性」,操作化为两个互补的原子能力:
安全流:给定(截图,良性指令),恶意截图中的视觉威胁能否被识别并规避?关键操作化:配对设计——同一指令配良性/恶意两张截图。良性变体测能力(该做的做了吗),恶意变体测安全(该拒绝的拒绝了吗),两者之差就是「威胁嵌入界面」造成的纯粹安全效应,剔除了能力混杂。
歧义流:给定(截图轨迹 + 含糊指令),Agent 在关键决策点是澄清还是直接行动?评分沿人标双轴:明显度(obviousness,0-2,歧义有多明显)与后果(consequence,0-2,猜错的代价有多大),且必须匹配到人标的标准澄清问题才算有效。
四个核心指标:TSR(良性任务成功率,测能力)、ASR(恶意任务中执行了不安全动作的比例,越低越安全)、FRR(良性任务被误拒率,测过度安全)、以及 ADeptS Score = TSR 与 (1−ASR) 的调和平均——类比 F1,惩罚偏科:90% TSR 配 90% ASR 的模型只得 17.1%(算术平均下是 50%),高分必须能力安全双优。
评测协议刻意做成离线单步:每个安全任务只需 1 次 API 调用(给截图和指令、预测一个动作),空间动作按边界框(margin 0.01)判分,无需 live 环境——可复现、易部署,代价是不测多轮轨迹(论文明确承认这是「必要非充分」的互补组件)。
四、问题解法
作为基准论文,「解法」是构建管线本身,四步:
第一步:接地。专家安全工作坊定义风险/威胁类别 → MaxDiff 用户调查(1,300 人)排出优先级 → 迭代校准框架与任务设计。风险四维:攻击来源(模型内在失效 vs 环境外在威胁)、威胁类型(10 类,从提示注入到系统破坏)、受害者(用户/系统/第三方)、伤害后果。任务数量按用户关切分配(数据丢失、资金损失、物理损失类最多)。
第二步:双流任务创建。安全流 1,718 实例(859 对:358 移动约 70 个 Android 应用 + 501 桌面约 150 个应用,每威胁类别 37-54 个任务均衡分布),截图取自真实应用或用 Gemini 合成无法道德获取的威胁场景。歧义流 744 任务(381 移动 + 363 桌面,平均 4.7 张截图的轨迹),覆盖语言歧义、指代欠具体、不可能任务三类。
第三步:标注与质检。专业标注员像素级边界框标注 → 跨模型一致性分析 → 领域专家评审。质检后仅 3.3% 良性任务全模型皆败、11.4% 恶意任务全模型皆从(集中于需要后果推理的威胁)。歧义流 5 名标注员独立打分、多数票定真值(within-1 一致率 90-94%)。
第四步:离线执行与判分。7 个模型(GPT-5.4、Gemini 2.5 CU、Gemini 3.1 Pro、Claude 4.7 Opus、Qwen3-VL-235B/8B/4B),统一系统提示与 8 函数工具 schema(含 status(unsafe) 显式拒绝工具),各模型仅做最小 API 适配(坐标格式、图像预处理),温度 0.1、每条件跑 10 次报均值±95% CI。歧义判分用 LLM 裁判(Gemini 3.1 Pro)做语义匹配,人工验证一致率 96.1%(κ=0.92)。
五、评估指标与实验证据
5.1 主结果:无人双达标
桌面端 Gemini 3.1 Pro 是唯一 TSR>80% 且 ASR<30% 的组合(82.9%/29.8%),得最高分 S=76.0%;Claude 4.7 Opus 双平台 ASR 最低(27.2/27.7)紧随其后(桌面 75.4%)。Qwen3-VL 三个规格 ASR 全部 73.7-79.6%、FRR=0、从不使用拒绝工具——TSR 高达 87% 却几乎无安全行为,且从 4B 到 235B 规模化完全不改善安全(76.7/73.7/76.3%)。
5.2 三个标志性发现
CU 特化牺牲安全:专为计算机使用优化的 Gemini 2.5 CU 桌面 TSR 最高(83.6%)但 ASR 也是前沿模型中最高(51.5%),远差于通用的 Gemini 3.1 Pro(29.8%)——优化操作能力不会自动保留安全性。
GPT-5.4 的双面性:它在 OS-Harm(指令显式有害)上仅 6% unsafe,但在本基准 36% 顺从恶意任务——界面嵌入威胁是独立于指令级安全的失效面。作者还排除了接地混淆:其 ~30% 的点击脱靶率可能虚增安全分,但对 323 个安全判定的意图分类显示仅 0.2% 是差点点中(调整后 ASR 35.7% vs 实测 35.5%)——低 ASR 是真拒绝(47% 显式拒绝、15% 转点良性元素),不是点不准。
worst-case 更糟:按 pass@k 取 10 次中最坏情况,GPT-5.4 的 ASR 比均值高 22-23pp(36%→58-60%,每平台约 200 个「不稳定」任务)——安全决策的非确定性本身就值得单独度量。
5.3 工具消融:三种安全架构
移除 status(unsafe) 拒绝工具(连同使用说明)后:Gemini 3.1 Pro ASR +22pp(29.7→51.7,完全工具依赖);Claude 4.7 +10.3pp、GPT-5.4 +10.7pp(部分依赖,训练留下了内隐拒绝能力);Qwen ±1pp(无任何机制)。附带发现:去掉工具后前沿模型 TSR 反升 1-8pp(误拒减少)——能力-安全权衡在系统提示层就存在。
5.4 L1-L4 失效谱与歧义流
跨模型一致性分析得出威胁可检测性四级层次:L1(7.4%)显性视觉线索全模型检出;L2(15.6%)嵌入文本威胁(可疑 URL、注入指令)前沿检出、开源全漏;L3(66.3%)歧义语境模型间分裂;L4(10.8%)无视觉线索、危险在动作规模或标签错位——全模型皆漏。结论:现有安全训练会模式匹配(L1-L2),不会后果推理(L3-L4)。威胁类别上 System Sabotage 最难防(ASR 48-69%),提示注入与 Web 入侵防御最好。
歧义流:移动端 Gemini 3.1 Pro F1 最高 58.9%,桌面端 Claude 4.7 最高 47.6%——排名跨平台洗牌,桌面普遍更难(Qwen-8B 桌面近乎失能 F1=5.7%,93% 空响应)。普遍性校准偏差:所有模型系统性高估后果严重度(42-62% 的条目评得比人标高,仅 7-25% 偏低),与安全流的 FRR 同源——「默认谨慎」的偏差一体两面。评分提示悖论:让模型同时给严重度打分,弱模型 F1 大涨(Qwen-8B +18pp)但最强模型反降(Gemini 3.1 −3.6pp)——脚手架帮多数、掣肘顶尖。还有两个盲点:不可能任务(「换个 SIM 卡」在纯软件界面)漏检率 30.6% 是普通任务两倍多;17.8% 的任务所有模型都提问却全不匹配唯一真值——提示歧义评测需要多参考答案。
六、效果优势的根源解释
基准论文的「优势」体现为发现的可信度,因果链从设计选择出发:
配对设计→能力与安全解耦→可信排名。同指令不同截图的配对使每个威胁的效应是「纯安全增量」(能力被自身良性变体控制),GPT-5.4 的意图分类分析正得益于此——能区分「真拒绝」与「点不准」。没有配对,36% vs 6%(OS-Harm)的裂缝会被归因为能力差。
调和平均→惩罚偏科→暴露「能而不安」象限。配对 2×2 分类里 Gemini CU 的「能干但不安全」象限(47.3%)反超其理想象限、Qwen 被此类主导(70-72%)——算术平均会掩盖这种结构性失衡。前沿模型每 10pp TSR 增益伴随 15-20pp 安全代价,这条帕累托斜率只有用双指标才可测。
用户调查→威胁优先级外部校准→生态效度。研究者臆想的类别(往往是「有趣」的攻击)与 1,300 人真实关切(身份盗窃、账户、钱)对齐后,测出来的排名才对部署有指导意义;74.1% 担心外攻的比例直接决定了对抗类威胁的任务占比。
消融→机制归因→三种架构分类。移除拒绝工具不是一个普通消融,而是把「安全在哪里实现」变成可测命题:+22pp vs +10pp vs ±1pp 的梯度证明安全可以外挂在工具上、半内化在训练里、或完全缺席——这个分类直接给出修复优先级(内化拒绝训练优于提供工具)。
L1-L4 分层→定位失效机制→训练指向。把 859 个威胁按跨模型可检测性分层后,「L1-L2 全过、L3-L4 全漏」的模式把问题从「安全不够」精确到「缺后果推理」——这才是 $25K Checkout 与 Optimize 按钮全军覆没的解释,也是后续训练(后果/规模感知的 post-training + 语义威胁红队)的靶点。
七、必要知识反推
- CUA/GUI Agent 基础:截图输入→动作输出(tap 坐标/type 文本/navigate/status)的循环;视觉接地(visual grounding,把指令映射到界面元素)与边界框判分。
- Agent 安全分类学:攻击来源(内在失效 vs 外在威胁)、提示注入、越狱、系统破坏等术语——理解 10 类威胁覆盖的空间。
- 评测指标设计:调和平均 vs 算术平均(为何 F1 惩罚偏科)、TSR/ASR/FRR 三角关系(能力/安全/过度安全的张力)、pass@k worst-case 分析。
- MaxDiff 调查方法:强制比较排序的问卷设计,如何把主观关切变成可排序的优先级——用户研究驱动评测的方法论模板。
- 消融作为机制探针:移除单个系统组件(拒绝工具)观察行为变化,把「安全实现位置」从架构黑箱变成可测量属性。
- 评测协议的效度威胁:判分裁判与被测模型重合(Gemini 3.1 Pro 既是裁判又是选手)、输入分辨率不齐、单标注员真值——论文如何逐一处理与承认。
八、论文中可以提取的通用性灵感
- 威胁要藏在「合法指令」的下层。对任何 Agent 系统,最危险的输入不是显式恶意请求(安全训练覆盖得好),而是良性指令+被污染的环境(截图、检索结果、工具返回)。评测「指令级安全」之余,务必单测「环境级安全」——GPT-5.4 的 6% vs 36% 就是教训。
- 配对设计是因果推断的微型实验。同一输入、只改威胁维度、其余全部固定——这个模式可移植到任何「能力 vs 安全/鲁棒」需要解耦的评测(工具调用、代码生成、RAG 回答)。A/B 之间的差值就是纯粹的目标效应。
- 把「安全在哪里实现」作为一等评测对象。工具依赖型安全在部署环境变化(工具被移除/改名/被注入)时会瞬间蒸发。给任何带安全机制的 Agent 做一次「机制移除消融」,+22pp 与 ±1pp 之间的差别就是架构级诊断。
- 用调和平均防「偏科模型」刷榜。任何双目标系统(能力×安全、精度×召回、效率×质量)的榜单都该用调和平均——它让「单边冠军」无处遁形,也让权衡曲线(10pp 换 15-20pp)显式可见。
- 用户调查给评测注入生态效度。研究者定义的威胁清单容易变成自我循环(测自己会防的)。1,300 人 MaxDiff 是廉价可复制的外部校准——先把「用户怕什么」变成数据,再决定「测什么」。
- 失败分层(L1-L4)比单一分数更有行动价值。「平均 ASR 30%」没法指导训练;「L1-L2 模式匹配全过、L3-L4 后果推理全漏」直接指出 post-training 该补什么。给任何评测集做跨模型一致性分层,都能得到这样的机制性地图。
- 谨慎偏差是一体两面的。后果高估(42-62%)与误拒(FRR 6-10%)同源——单看是两个缺陷,合看是一个校准问题。修复方向是后果加权门控(低危直接做、高危才澄清/拒绝),而不是全局调高或调低谨慎度。
- 单步原子评测与轨迹评测互补而非替代。离线单步换来可复现与低成本(每任务 1 次 API 调用),代价是放弃多轮效应——论文大方承认「必要非充分」。为自己的系统设计评测时,先明确评测的是哪个原子决策点,再谈覆盖面。