论文链接:LegacyWorld: Atomicity-Aware Evaluation of GUI Agents for Legacy Workflows 基准仓库:github.com/ThiloReintjes/LegacyWorld 发表时间:2026年8月14日 机构:Technical University of Munich(Alexander Pretschner组)+ 领域专家(医疗/行政/企业) 领域标签:cs.SE / GUI Agent评测与企业自动化
一、论文背景
遗留系统的自动化刚需。大量企业核心流程运行在遗留系统上:可编程接口有限、必须人工GUI操作——牙科管理软件DSWin、电子病历OpenMRS/Open Clinic、ERP系统Adempiere等。计算机使用Agent(computer-use agent)成为自动化这类工作流的希望。
成功演示掩盖的陷阱。论文源于legacy-use框架的开发实践:领域专家指出,成功的演示不够——一个失败的Agent运行可能在业务或医疗记录中留下持久无效变更。GUI自动化的真实风险画像不是"任务没完成",而是"任务没完成+系统被弄脏":错误添加的病人记录、错误更新的电话号码、污染的数据库状态会在后续真实业务中持续发酵。
评测的结构性缺口。现有GUI Agent基准(WebArena、OSWorld等)以任务成功率为核心指标——它无法回答"失败时系统是否安全"。医疗记录被污染的代价与"任务失败"完全不同量级。
二、论文定位和关联工作
GUI Agent基准线:WebArena/VisualWebArena(Web任务)、OSWorld/AndroidWorld(OS/移动任务)等以成功率为主。LegacyWorld的差异化:(1)遗留Windows桌面软件(而非Web或现代OS);(2)有状态工作流(改数据库/文件而非浏览);(3)原子性一等指标。
数据库思想线:原子性(atomicity)借自数据库事务的ACID——事务要么全部发生要么全不发生。本文把它改造为GUI自动化的评估维度:运行要么正确完成(有效成功)、要么干净失败(有效失败),不应有中间态(无效结果=报告完成但留污染,或失败且留污染)。
| 维度 | WebArena/OSWorld | LegacyWorld |
|---|---|---|
| 目标系统 | 网站/现代OS | 遗留Windows企业软件 |
| 状态影响 | 多为只读或可重置 | 持久业务/医疗记录 |
| 核心指标 | 任务成功率 | 有效成功+原子性(双指标) |
| 任务来源 | 人工构造 | 领域专家识别的真实工作流 |
| 副作用建模 | 无 | 允许/禁止副作用显式契约 |
三、问题定义
抽象问题:当代价不对称(漏做工作的代价远小于污染持久状态的代价)时,Agent评测的指标空间应如何重构?
形式化为四维结果分类:每条运行按(报告状态×实际状态有效性)分为——有效成功(报告完成且达成目标态)、无效成功(报告完成但留下无效/非预期变更)、有效失败(未完成但保持基准相关状态可接受)、无效失败(未完成且留下非预期持久变更)。派生两个正交指标:有效成功率(自动化价值)与原子性(有效成功+有效失败占比,即状态可接受率)。
精妙之处:两个指标揭示相反的风险画像——高原子性可能来自保守不作为(全失败但干净),高成功率可能伴随状态污染。单一指标的排名会系统性误导部署决策。
四、问题解法
任务契约构造:每个工作流转为可执行契约——自然语言指令+显式初始状态假设+目标状态定义+运行时参数+期望返回值模式+任务特定验证逻辑+允许/禁止的基准相关状态变更清单。契约化是把"什么算完成、什么算污染"从隐式判断变成显式规范。
验证逻辑(独立于Agent自报):通用快照检查(前后基准状态对比:必需/禁止文件、目录清单、哈希、窗口状态)+任务特定验证器(数据库增量、导出报告、返回标识符、计算值)。例如DSWin病人任务对比运行前后数据库,Windows Hello World任务校验文件精确内容。
评测流程:每任务每模型每提示条件一条轨迹,隔离VM中执行,运行后状态捕获→验证→四维分类→聚合。
提示条件对照:专家精制提示 vs 录屏生成提示(领域专家黄金路径录屏→仅生成程序主体,初始/目标/参数/验证器不变)——迈向"从演示学规程"的受控一步。
类比:这像给外科手术机器人定考核——不只问"手术成功了吗",还问"失手时有没有把器械留在体内"。后者(无效失败)在医疗语境下是独立于成功率的不可接受事件。
五、评估指标与实验证据
指标体系:四维结果分布(主分析)+派生的有效成功率/原子性;六模型(GPT-5.4、Gemini 2.5 CU、Opus 4.6、Sonnet 4.6、Haiku 4.5、Kimi K2.5)×双提示条件。
核心数据表:
| 实验 | 关键数字 | 含义 |
|---|---|---|
| 保守极端 | GPT-5.4专家提示:原子性100.0%但有效成功仅3.6%(96.4%为有效失败) | 干净地几乎什么都不做 |
| 激进极端 | Opus/Sonnet/Haiku有效成功78.6%/75.0%/71.4%但部分运行非原子 | 高完成伴随状态污染 |
| 高危画像 | Kimi K2.5:有效成功42.9%但不安全副作用率35.7%(该条件最大) | 中等完成+最脏状态 |
| 指示意义 | 单一指标下GPT-5.4"100%原子"看似最优、Kimi"42.9%成功"看似合格——双指标下两者画像完全不同 | 指标重构改变结论 |
| 录屏提示 | 专家与录屏生成提示的对比显示程序主体可从演示推导(视频只供程序体,契约固定) | 演示驱动自动化的可行性一步 |
实验设计为何有证明力:四维分类由独立于Agent自报的验证器判定(防"报告成功即成功");每条件单轨迹的描述性定位(作者明确不称推断性排名——诚实边界);专家/录屏提示对照固定契约只变程序体,隔离"程序来源"变量。
六、效果优势的根源解释
为什么单一成功率必然误导。成功率的分子只含有效成功(+可能误计无效成功),分母含全部运行——它把"做对工作"与"不弄脏系统"两个独立维度压进一个数字。GPT-5.4的3.6%成功在只看原子性时是满分公民、只看成功率时是差生——真实画像是"极端保守"。机制根源:部署语境中两类代价不对称(医疗记录污染»任务未完成),对称度量的排名与风险排序无关。
为什么会出现无效成功(报告完成但留污染)。Agent的完成判断基于自身观察(流程走完了、界面显示成功提示),但持久状态的正确性需要外部验证(数据库里的值、导出文件的内容)。GUI的视觉反馈与底层状态可以脱节——Agent"看见"了成功画面而状态实际错误。这与RA-Bench中"呈现相关性≠生成因果性"结构同源:可见信号与真实状态的相关但不等价。
为什么保守策略(GPT-5.4)可检测且有意义。原子性100%且96.4%为有效失败的模式只能来自"倾向不行动"的策略——检测到无把握即停止。在医疗语境这是可接受的(不写错记录),但自动化价值近零——双指标把这个"安全的无用"显式化为可讨论的部署选项而非隐藏的失败。
七、必要知识反推
领域知识层:遗留企业软件的交互形态(菜单/表格/向导,无API);医疗/行政工作流的合规约束(记录完整性的业务含义——没有领域专家就无法定义"污染");计算机使用Agent的接口(截图/坐标/系统调用)。
方法论知识层:四维结果分类的构造论(报告状态×实际有效性的笛卡尔积中舍弃不可能格);任务契约的形式化(初始/目标/允许/禁止变更的显式规范);快照差分验证设计(防Agent自报偏差);描述性vs推断性统计的边界意识。
工程知识层:隔离VM的基准执行与状态捕获;数据库增量对比验证器的实现;录屏→程序体的转换管线。
知识融合的关键节点:最关键的融合是把数据库事务原子性的概念移植到GUI Agent评测——但做了本质适配:GUI任务无法要求严格原子(部分进度有价值),于是退为"可接受终态"的柔性原子性。其次是把安全工程的双指标传统(可用性×安全性,如密码强度与易用性的权衡)引入Agent评测,承认两类风险不可公度。
八、论文中可以提取的通用性灵感
灵感1:代价不对称时必须用正交双指标,任何合成单指标都会误导。有效率与原子性揭示相反极端。论文证据:GPT-5.4与Kimi在单指标下皆"合格"、双指标下画像颠覆。推广场景:医疗(治愈率vs并发症率);自动驾驶(接管率vs事故率);投资(收益vs最大回撤);员工评估(产出vs合规)。
灵感2:可见反馈与持久状态的相关不等于等价,验证必须独立于自报。无效成功源于界面成功≠状态正确。论文证据:外部验证器发现报告完成但状态错误的运行。推广场景:CI/CD(绿测试≠生产正确);区块链(确认≠最终性);API测试(200响应≠语义正确);表单提交(提交成功提示≠数据落库正确)。
灵感3:契约先行——允许什么、禁止什么必须显式化,提示词不构成验收标准。每任务显式的允许/禁止副作用契约。论文证据:任务契约中的基准相关状态变更清单。推广场景:外包开发(验收标准前置);权限设计(白名单而非黑名单);数据共享协议(用途限制显式化);自动化审批(越权行为显式禁止)。
灵感4:“安全的无用"是真实的策略选项,应被显式度量而非视为失败。GPT-5.4的100%原子性/3.6%成功画像。论文证据:有效失败作为合法结果类。推广场景:医疗AI(保守转诊人类的价值);金融风控(拒绝可疑交易的误杀成本核算);法律AI(不做判断优于错误判断);自动驾驶(靠边停车优于冒险通过)。
灵感5:领域专家的角色在"定义什么算伤害"而非"判断做没做对”。专家识别有状态工作流与不可接受变更,验证器自动判定。论文证据:18个经外部验证任务的构建分工。推广场景:安全评测的威胁模型共建;产品可用性测试的任务设计;政策评估的指标选择;AI对齐的价值规范来源)。