论文链接:ASIL: Replacing Screenshot-and-Click with Structured State and Semantic Actions (arXiv:2608.26991) 发表时间:2026年8月27日 机构:上海交通大学 X-LANCE 实验室、北京通用人工智能研究院(BIGAI)——高校合作为主 领域标签:cs.AI,计算机使用 Agent / Agent-软件接口设计

一、论文背景

1.1 从代码 Agent 到 GUI Agent 的落差

先说两个基础概念。代码 Agent(如 Claude Code、Codex)是一类在终端、IDE、CI 流水线里工作的大模型智能体:它们读代码库、跑命令、改文件、用测试验证结果。它们之所以强,是因为吃的是机器可读的项目上下文,动作是可执行的工具调用。GUI Agent(计算机使用 Agent)则试图让大模型操作图形界面软件:看屏幕截图,输出点击坐标、按键、拖拽序列——模仿人类操作电脑的方式。

问题在于:大量重要软件(创意工具、办公套件、桌面工具、带服务后端的应用)的主要功能仍然只能通过 GUI 访问,即使底层系统早已包含丰富的内部状态、结构化文档和可执行逻辑。于是当前主流路线把「人类原生接口」硬塞进了 Agent 的核心循环。

1.2 截图加点击为什么低效

论文对 screenshot-and-click 循环给出了双重批判,这是全文的立论基础:

观察侧失配:截图不是软件状态,只是状态的可见投影。隐藏面板、后台进程、文档结构、内部元数据统统丢失。模型每一步都要对「表现层」做多模态推理才能间接推断状态。一个直观类比:这就像只通过看别人家的窗户照片来判断屋里所有房间的摆设——你能看见的只有窗前那一小块。

动作侧失配:GUI 事件是坐标敏感的「运动原语」。一个语义意图(重命名图层、修改属性、触发导出)要展开成一长串脆弱的点击拖拽序列,严重依赖视觉定位,布局或主题一变就崩。论文给出的实锤案例:GPT-5.4 在一个 LibreOffice 薪资单任务中,GUI 模式陷入 15 次字面制表符粘贴循环,最终 0 分;同一模型在 ASIL 模式下用一个 modify_file 动作写完 99 个单元格,6 项检查全过。

此外还有训练侧的代价:GUI Agent 的 RL rollout 每步都要付截图采集、模型调用、GUI 执行、状态等待、验证的开销,且轨迹一长(OSWorld-Verified 上不少任务预算超过 50 步甚至接近 100 步),任何一次定位失误都会污染后续所有状态。

二、论文定位和关联工作

2.1 三条相邻研究线

研究线代表工作与 ASIL 的区别
GUI Agent 与计算机使用基准OSWorld、AgentSrt、ShowUI 等它们默认截图加点击为 substrate,改进集中在视觉定位与 UI 解析;ASIL 质疑的是这个默认本身
给 GUI Agent 加脚本/工具/APIOS-Copilot、UFO2、DynaSaur、AXIS、CLI-Anything、draw.io MCP、LibreOffice UNO目标相似(让软件可调用),但多为单点方案;ASIL 评测的是一套耦合「规范化观察 + 模式约束动作 + 状态验证器 + 可复用轨迹」的统一契约,并与这些原生接口做了正面对比
代码 Agent 接口设计SWE-agent 的 ACI、CodeAct 的可执行 Python 动作ASIL 明确承认这是「最接近的正面先例」——把代码仓库的教训迁移到 GUI 软件上

2.2 定位结论

ASIL 的核心主张是范式级的:GUI Agent 失败应该被重构为「接口失配」问题。中心问题不是「如何让模型更会看屏幕」,而是「软件操作 Agent 原生应该用什么观察与动作接口」。同时论文很克制:在与成熟原生接口(draw.io MCP)对比持平甚至落后时如实报告,把主张限定为「组合性契约」而非逐应用统治。

三、问题定义

3.1 形式化表述

把软件操作 Agent 的接口定义为观察-动作-转移循环:

$$o_t = \Phi(s_t),\quad a_t \sim \pi_\theta(\cdot|o_t),\quad s_{t+1} = T(s_t, a_t)$$

其中 $S$ 是软件的潜在状态,截图接口对应 $\mathrm{Pix}$(像素投影)+ 坐标动作空间 $M$;ASIL 替换为结构化观察空间 $O$ 与模式约束的语义动作空间 $A$。

关键的数学化洞察有两条:

  1. 观察侧:Pix 把视口之外的任务决定性属性(隐藏面板、文档属性、后台状态)压缩成不可区分的等价类——信息被系统性丢弃;而 $\Phi$ 被工程化设计为在任务相关子空间上近单射(near-injective),即观察基本不丢任务需要的信息。
  2. 动作侧:一个语义动作 $a \in A$ 实现的转移等价于 GUI 事件序列 $(m_1, \dots, m_k)$,$k \gg 1$。动作的「语义压缩比」直接缩短了 RL 的信用分配时域。

3.2 设计原则

ASIL 围绕四原则构建:完整性(暴露可见表面之外的软件状态)、语义性(动作对齐有意义的软件操作而非 GUI 机械操作)、稳定性(标识符在表现层变化下保持有效)、可组合性(复杂任务用少量高层动作表达)。

四、问题解法

4.1 协议对象:观察与动作的 JSON 契约

OBSERVATION 对象把当前软件状态组织成六个字段:meta(任务元数据)、app_state(应用状态)、interactive_elements(可交互元素)、environment(环境上下文)、navigation(导航结构)、summary(简洁文本摘要)。这恰好保留了截图型 Agent 最难恢复的信息:哪个文档是活动的、哪些实体可编辑、哪些后台条件影响正确性。

ACTION 对象的类型、目标、参数由应用的动作模式定义,六种动作类型:set_value(设值)、invoke_function(调用函数)、modify_file(改文件)、api_call(调 API)、navigate(导航)、batch(批量)。动作空间从「点这里」升级为「设这个值」「调这个函数」。

4.2 最深可行访问路径:三种实现模式

ASIL 不绑定单一后端,而是为每个应用寻找最深可行访问路径——最直接暴露稳定状态与语义操作、又实际可运行可评估的接口。15 个应用落地为三种模式:文件级执行(SVG、ODF、notebook 等,6 个)、脚本级执行(如 Blender Python,4 个)、服务/API 级执行(REST、WebSocket,5 个)。三种模式是同一协议的实现路径,不是三种不同的 Agent。

配上半自动 ASIL 化管线:可重复的接入工作在人工审核的接口 profile 之后自动化——一次 GPT-5.4 调用 24.8 秒把 97 行 Gitea API profile 编译成 1 个观察视图加 2 个语义动作,审计零错误,随后通过 3/3 宿主探针与 3/3 Docker 探针。接口发现、任务/评估器设计、GUI 同步等仍由人工审核。

4.3 基准:同一套任务、两种接口

380 任务自建基准:15 应用 × 20 单应用任务 + 80 多应用任务,覆盖 Inkscape、Blender、GIMP、Audacity、Kdenlive、LibreOffice Calc/Writer/Impress、draw.io、code-server、JupyterLab、Gitea、Thunderbird、Nautilus、OBS。关键设计:ASIL 与 GUI 模式共享同一任务定义、初始工件、状态验证器;ASIL 运行还从底层状态渲染每步 GUI 快照,供与截图驱动运行对照检查。评估器检查最终软件状态而非表面动作历史,且同一评估器贯穿确定性执行、ASIL 运行、GUI 运行、SFT 过滤与 RL 奖励。

4.4 训练闭环:可复用的轨迹工件

验证过的 ASIL 轨迹(状态、动作、工件、得分)同时供给 SFT 数据集(步骤级、来自已知正确动作与验证过的 GPT-5.4 rollout)和 on-policy RL(GRPO 式更新,奖励来自与推理时相同的评估器)。RL 使用与评测基准分离的训练任务池(512/128 v3 池中抽取 320 训练/80 验证任务,覆盖全部 15 域)。

五、评估指标与实验证据

5.1 主表:380 任务严格成功率

模型ASIL / 15步GUI / 50步(修复后)
GPT-5.481.66.6
sonnet4.681.226.6(同轨迹截断到 15 步为 17.9)
Qwen3.6-plus81.12.9
Kimi K2.584.8—

ASIL 平均每任务执行不到 5 个动作(预算 15 步)。给 GUI 三倍预算(50 步)后差距依然巨大:GPT-5.4 差 75 个点、sonnet4.6 差 54.6 个点。

5.2 有效性检验:论文自己补的三刀

  • 可比难度带:在与 OSWorld-369 用结构代理校准的 easy60 带上,修复后 GUI 升至 15.0(GPT-5.4)/53.3(sonnet4.6)——说明 GUI 侧并非全面疲软,强原生计算机使用模型能恢复许多单应用任务,但全基准刻意更难(含无预置中间进展的完整工作流)。
  • 原生接口对比:60 个 LibreOffice 任务上 ASIL 超原生 UNO API 28-38 个严格点——UNO 虽暴露完整自动化表面,但规范化观察加契约化动作层比底层原生 API 更好用。20 个 draw.io 任务上 ASIL 与 draw.io MCP 打平(GPT-5.4 55.0/55.0),sonnet4.6 落后 25.0/55.0。结论是组合性主张而非逐应用统治。
  • 提示对称性:主表中 ASIL 提示含评估器成功提示而 GUI 只有任务指令,存在不对称——camera-ready 用 hint-off 对照补齐(balanced-30 上 GPT-5.4 有提示 29/30、无提示 26/30),fail-closed 原始验证器与官方评估器在 60/60 平衡最终状态上一致。

5.3 训练结果:小成本双位数提升

模型Base+SFT+RL
Qwen3.5-2B58.072.174.4
Qwen3.5-9B66.680.482.2

SFT 只用数千条步骤级样本;RL 只用 320 训练任务、4-8 张 A800。分域看,9B 的 SFT 在 Multi-App 上 +35.2、Office & Diagrams 上 +27.2,RL 拿到全部报告行中最好的 Multi-App 分数。

5.4 边界:像素级任务仍是瓶颈

在刻意挑选的 80 任务 hard suite(真实照片编辑、跨应用工件迁移等交付级工作流)上,最强行也只有 15.2 分,GIMP 24 任务零全过。GIMP 视觉补充消融(44 任务、无提示、50 步)给出 ASIL-only 44.1 vs 每步加截图 43.7——说明当前瓶颈是感知型动作词汇表而非缺截图观察,像素级任务需要混合接口。

六、效果优势的根源解释

建立「方法差异→机制变化→指标提升」的因果链:

链条一:观察从有损投影变为近单射映射 → 状态推断错误消失。截图把任务相关属性压进不可区分等价类,模型必须靠多模态推理「猜」隐藏状态;ASIL 的六字段观察在任务相关子空间近单射,模型直接读到「哪个文档活动、哪些实体可编辑、后台条件是什么」。机制变化:每步省去表现层推理,且不会因看不到隐藏状态而做错决策。

链条二:动作从 k≫1 事件序列压缩为单语义动作 → 轨迹缩短、错误传播链减少。GUI 动作高度步间依赖,一次定位/焦点/布局/时机错误污染之后所有状态,恢复需要在新界面里重新定位。ASIL 一个动作等价 k 个 GUI 事件,轨迹从几十步缩到不到 5 步——错误传播的链长度被直接砍断,验证也可以直接读下一帧结构化状态而非截图比对。这直接解释了 81.6 vs 6.6 与「<5 动作/任务」两个数字。

链条三:同一契约贯穿推理与训练 → 训练成本骤降。截图加点击的 rollout 每步付视觉处理、长动作时域、脆弱状态恢复三重税;ASIL 轨迹可序列化、可验证、可复用,SFT 数千样本 + 少量 GPU 就能双位数提升(2B +16.4、9B +15.5),且奖励来自与推理时相同的评估器,训练-评测一致性天然成立。

诚实标注:主表的提示不对称意味着 81.6 vs 6.6 不能全归因接口本身;hint-off 对照与原生接口对比补齐后,「接口效应」仍然成立但幅度更保守。GIMP 案例则标出该范式的适用边界——感知主导的任务上结构化接口无米下炊。

七、必要知识反推

假设零基础读者要复现这项工作,需要三层数识:

7.1 领域知识层

  • GUI Agent 的实际失败形态:必须亲手读过大量截图驱动轨迹(如 LibreOffice 制表符循环案例),才能意识到「反复粘贴字面制表符」不是模型笨,而是坐标动作空间里没有「写 99 个单元格」这个原语。
  • 软件的内部可访问面:要知道哪些软件有结构化文件格式(ODF/SVG)、哪些有脚本运行时(Blender Python)、哪些有服务 API(Gitea REST)——这是「最深可行访问路径」的选路依据。
  • 代码 Agent 接口设计的先例:SWE-agent 的 ACI 与 CodeAct 的教训(可读状态 + 可执行动作 + 可验证反馈)是可直接迁移的模板。

7.2 方法论知识层

  • 信息论式的接口分析:用「投影/等价类/近单射」的语言形式化观察接口的信息保留度——这不是工程直觉而是可论证的表述。
  • 受控对比设计:同一任务定义、同一验证器、双模式渲染快照对照——把「接口」变成唯一变量的实验设计能力。
  • 诚实报告的规范:主动报告提示不对称、补 hint-off 对照、跑原生接口对比——这些是把强主张变得可信的评估素养。

7.3 工程知识层

  • 半自动接入管线:用强模型一次调用编译接口 profile、探针验证、人工审核关卡——规模化接入 15 个应用而不被人肉成本卡死。
  • SFT/RL 训练设施:LoRA 级资源下跑 GRPO 式 on-policy RL、用同一评估器产奖励、任务池与评测集重叠审计。

八、论文中可以提取的通用性灵感

8.1 失败归因先问接口,再怪模型(范式级)

核心思想:当一个 AI 系统在某个环境持续失败时,优先检查「模型与环境的接口」是否是有损投影 + 脆弱动作的组合,而不是先去改模型。 论文证据:同一 GPT-5.4,接口换成结构化状态 + 语义动作后从 6.6 到 81.6——模型能力没变,变的是信息的保真度与动作的语义粒度。 推广场景:① 操作企业内部系统的 Agent(很多系统有 API/数据库却让 Agent 走网页);② 机器人(关节力矩 vs 技能原语);③ 任何「让 AI 模仿人类操作界面」的设计决策评审。

8.2 近单射观察是最小充分信息(机制级)

核心思想:好的观察接口应在「任务相关子空间」上接近单射——任务需要的信息一个不丢,任务不需要的噪声一个不给。 论文证据:六字段 JSON 观察恰好覆盖截图 Agent 最难恢复的三类信息(活动文档、可编辑实体、后台条件),这是刻意工程而非巧合。 推广场景:① Agent 工具的返回值设计(返回结构化结果而非 dump 全量日志);② 仿真环境的观测空间设计;③ 数据库视图/中间层 API 的裁剪。

8.3 动作语义压缩比决定可靠性(机制级)

核心思想:一个动作原语等价的底层事件数 k 越大,轨迹越短、错误传播链越少、RL 信用分配越容易。 论文证据:ASIL 平均 <5 动作完成任务(GUI 50 步预算还不够),2B/9B 模型都能便宜训练。 推广场景:① 工具 API 的粒度设计(提供「批量写入」而非只有「单击」);② 机械臂技能层级;③ 多步工作流的产品化封装。

8.4 同一验证器贯穿推理与训练(工程级)

核心思想:让评估、SFT 过滤、RL 奖励共用同一个状态验证器,训练信号与评测标准天然一致,且轨迹工件跨阶段可复用。 论文证据:评估器同时用于确定性执行、ASIL 运行、GUI 运行、SFT 过滤与 RL 奖励,380 任务分数与训练增益在同一标尺上闭环。 推广场景:① 任何 verifiable reward 的 Agent 训练管线;② 评测基准与训练环境的统一设计;③ CI/CD 中测试套件复用为数据筛选器。

8.5 半自动化接入管线是规模化的关键(工程级)

核心思想:把「接入一个新环境」的重复劳动交给强模型自动编译 + 探针验证 + 人工审核关卡,人力只花在不可自动化的发现与设计上。 论文证据:一次 GPT-5.4 调用 24.8 秒编译 Gitea profile,零审计错误过探针;15 应用中 15 个都走通了该管线。 推广场景:① 企业 Agent 接入内部系统;② MCP server 的自动生成;③ 测试环境的多环境搭建。

8.6 范式有边界:感知型任务需要混合接口(科研级)

核心思想:结构化接口的适用域止于「状态可结构化、操作可语义化」的任务;像素级感知任务(真实照片编辑)上,加截图观察不解决问题,缺的是感知型动作词汇。 论文证据:GIMP 视觉补充消融 44.1 vs 43.7(加截图几乎无益),hard suite 最强 15.2 分。 推广场景:① 判断哪些场景该用 GUI Agent、哪些该做接口打通;② 混合接口(结构化 + 视觉)的设计空间。