论文链接:arXiv:2609.22000 代码仓库:GitHub | Hugging Face | ModelScope 发表时间:2026 年 9 月(arXiv v1, 18 Sep 2026) 机构:Alibaba Token Hub, Alibaba Group 领域标签:cs.CL / cs.AI | 计算机使用智能体 / Benchmark
一、论文背景:什么是 CUA,又为何被割裂?
计算机使用智能体(CUA) 是能像人一样操作电脑的 AI:它看屏幕、点按钮、敲键盘,也能写程序、跑命令。最近一年 CUA 沿两条几乎互不往来的路线发展:
- GUI 路线:只通过「看屏幕 + 模拟点击」操作现成软件,擅长观察却不会自己造软件。
- 代码/终端路线:在命令行写程序、调构建测试,擅长造软件却看不到自己造出的界面,无视觉反馈判断「跑出来的样子对不对」。
论文洞见:真实数字工作往往交替进行——理解要操作、改造要重建,且两步不能像流水线各做一次:观察修正实现,运行实现又提示「下一步看什么」。因此要的不是两者拼接,而是把 GUI 与代码融进同一条长轨迹、自己决定何时探索/实现/验证的「混合 CUA(hybrid CUA)」。混合回路还有被低估的好处:自锚定性——造出的东西能立刻运行、被自己看到,每轮产出客观可执行反馈,既能轨迹内自我纠错,又能被「打分、筛选」拿去训练,是「可验证、可自我改进」的天然土壤。
二、定位和关联工作:CUA 基准谱系中的位置
过去大批 CUA 评测大多只强调一种交互模式,导致「长轨迹内自主协调 GUI↔代码回路」长期未被好好测量。
| 基准 | 形态 | 核心交互 | 交付物 | 与本文差异 |
|---|---|---|---|---|
| OSWorld / 2.0 | 桌面 | GUI+部分代码 | 任务状态 | 规范是人写的描述,不要求交付可编译代码 |
| WebArena | 网页 | 浏览器 | 操作结果 | 仅 Web,规范显式给定 |
| Windows Agent Arena | Windows | GUI | 任务状态 | 平台单一、非代码交付 |
| WeaveBench | Ubuntu | GUI+CLI 混合 | 真实工件 | 要求混合,但规范由人写、目标明确 |
| RecreationWorld | 五平台 | GUI↔代码深度融合 | 可编译应用代码 | 规范只能靠操作参考应用「从做中学」,参考充当隐藏测试 oracle |
从谱系看,RecreationWorld 站在「GUI 基准」与「视觉/代码编码基准」交叉点,把「规范获取」从「人写规格」换成「智能体自己从运行中的参考反推」,承接 OSWorld、WebArena 等执行/状态可验证评测与 Design2Code、Vision2Web 等视觉+功能编码评测,但把对象翻转为「给定运行实例反推规格再做实现」。
定位结论:它不是一个更长的 GUI 任务集,而是把「探索—实现—验证」闭环本身做成了可评测、可扩展的训练/评测范式。
三、问题定义:规范获取与交付形态的不对称
论文把「应用复刻(Application Recreation)」抽象为一个尖锐的不对称问题:
给定一个正在运行的参考应用 A⋆,智能体必须发现它的行为,并构造忠实的可运行实现;不规定任何工作流。
| 抽象要素 | 含义 | 类比 |
|---|---|---|
| 输入 | 高层提示 + 可交互运行参考 + 含 GUI 与开发工具的环境 | 一台正在跑的样机 + 一间工作室 |
| 过程约束 | 顺序/模态自定,但「看」与「写」必须交替 | 不能光看不动手,也不能光写不看 |
| 输出 | 完整源码 S,满足构建/启动契约,跑出候选 bA | 交出一个能独立运行的复制品 |
| 评测 | 只对可观察行为打分(程序化+视觉断言) | 比「像不像」,不比「代码像不像」 |
精妙处:它用同一运行实例同时充当「规范来源」与「验证 oracle」,把「拿不到 ground-truth 规格」变成天然可验证信号——参考能跑,就能从它身上采出隐藏行为测试,原样回放考任何候选。
四、问题解法:五平台框架 + 双通道测试生成 + 训练管线
① 五平台可复现执行底座。 每任务一个「版本化、任务隔离」worker,钉死图形运行时、自动化接口与构建链;桌面暴露原生截图/输入/无障碍树,Android 用钉死硬件加速模拟器,Web 用本地服务 + Playwright。worker 在多次「探索—实现—验证」间保留工作区、构建产物、进程与图形状态;单轨迹墙钟超时 20 小时,让复杂度而非基础设施决定交互深度。平台差异经「交付契约 + 程序化测试接口」归一(桌面 AT-SPI/AXUIElement/UI Automation,Android UiAutomator,Web DOM/ARIA)。
② 参考锚定测试生成:程序化 + 视觉双通道。 流程:准备参考→行为盘点→写测试→验证→冻结。orchestrator 结合源码/页面分析与实操建立「功能—可达界面—触发—响应」清单,交由**多条专门子代理(lane)**按互补行为维度并行写用例,每例固定「初始状态/夹具 + 交互序列 + 断言」,断言分两路:程序化(Prog)经无障碍/自动化接口读精确文本、控件状态、导航、持久化或计算值;视觉(VLM)由 Qwen3.7-Plus 裁判对「候选截图 + 参考锚定自然语言断言」做温度 0 二值判定,覆盖布局、配色、画布内容。两道闸门保可信:先在干净参考实例回放每条用例弃无效项,再经人工审查确认无歧义后冻结为隐藏套件。覆盖审计:约 77% 用例离开起始界面、94.2% 检查交互结果(40.7% 要求精确期望值)。
③ 大规模拒绝采样训练。 任务来自 GitHub/F-Droid 高质量开源 GUI 应用,覆盖五平台。用 Qwen3.8-Max 生成「探索→实现→构建运行→检查精修」长轨迹,经任务专属验证器拒绝采样:每平台选 7000 条,得 35000 条均衡 SFT 混合。两臂分别微调 Qwen3.7-Plus 与 Qwen-Flash-CPT。
五、评估:为何「58% 但满分仅 2.8%」很有信息量
主指标:Prog 与 VLM 分开报,平台内宏平均、平台间等权,综合为二者均值。梯度指标:Prog≥90%/=100% 覆盖、导航深度、五地道 OOD 迁移增益。
RECREATIONBENCH(250 任务,每平台 50)十模型(节选):
| 模型 | Prog % | VLM % | 综合 % | Prog=100% |
|---|---|---|---|---|
| GPT-6 Astra | 58.19 | 57.92 | 58.06 | 2.8% |
| Claude Opus 5 | 45.99 | 42.34 | 44.16 | ≤0.8% |
| GPT-5.6 Sol | 40.63 | 43.49 | 42.06 | ≤0.4% |
| Qwen3.8-Max-0902 | 35.53 | 34.07 | 34.80 | 0% |
分布设计为何有信息量? GPT-6 Astra 以 58.06% 领先 Claude Opus 5 达 13.9pp,且唯一多平台拿 Prog 全覆盖;但全程序化满分仅 2.8% 任务。说明平均分不能误读成「完整复刻的概率」——最强模型也只是「大部分行为对了」,离「完整、精确、计算正确」仍有鸿沟。报「综合分 + 阈值分布」比单一 pass/fail 更能暴露边界。
OOD 迁移证明了什么? 五地道分布外基准上两臂均提升,最高 +17.9pp:
| 基准 | Qwen3.7-Plus(首→末) | 性质 |
|---|---|---|
| OSWorld 2.0 | 28.2→46.1 (+17.9) | 混合计算机使用 |
| WeaveBench | 54.2→60.2 | 混合接口长程 |
| GameCraft-Bench | 30.6→47.6 | 游戏构建 |
| Vision2Web | 49.8→57.7 | 视觉网页编码 |
| ProgramBench | 41.9→44.6 | 代码重建 |
可编程 SDK 实验:把逐原语 MCP 换成持久化 Node.js REPL + 类型化 JS SDK,50 个 Windows 任务质量持平,但工具结果文本 −65.5%、墙钟 4.12→3.04 小时、成本 $90.50→$41.58(−54.1%)。
六、效果优势的根源解释
因果链(论文实验支持):参考即 oracle(规范只能从运行反推)→ 单轨迹不可分段闭环(探索↔实现↔验证同轨迹反复横跳)→ 自锚定反馈(每轮运行产出客观可执行信号)→ 隐藏测试与实现无关(只测行为不测源码)→ 可扩展(开源应用持续供给)。
- 只看不写/只写不看都失败:规范靠操作获得、交付只能是代码,二者必须交替(2.2,已支持)。
- 弱模型差距源于受控输入探测稀缺:同字段输入≥2 不同值的探测仅 13.4–17.0% 轨迹;弱模型在「交互/计算」类落后结构类 9.1–34.4pp,更常复刻静态结构而非动作触发的状态变化与计算(6.3,已支持)。
- 更宽参考探索伴随更强表现:GPT-6 Astra 覆盖 58.1% 参考侧 GUI 交互类型、每轨迹看 5.23 个不同窗口,与最高分共现(6.1.1,论文标注为相关性非因果)。
相关工作交叉验证(外部检索):
| 研究 | 相似尝试 / 结论 | 与本文差异 | 影响 |
|---|---|---|---|
| OSWorld 2.0(2606.29537) | 108 长程真实工作流混合 GUI+代码;最强模型严格完成率仅 20.6%,失败在隐式状态推断、跳过验证 | 给显式任务描述,交付任务状态非代码 | 支持:长程混合中验证缺失是普遍瓶颈 |
| WeaveBench(2606.09426) | 114 混合接口任务强制 GUI+CLI 同轨迹;最佳 41.2%,单接口≤3.5%,outcome-only 高估 10–20pp | 规范由人写,未把参考当 oracle 生成隐藏测试 | 支持:跨接口编排远未饱和,印证双通道+轨迹验证必要 |
| 生成式 Web 环境线(InfiniteWeb/AutoWebWorld/VeriEnv) | 程序化验证合成/重建功能网站,共享「可执行参考作 oracle」思路 | 目标为合成网页非真实运行实例 | 补充:说明「参考即 oracle」是共识方向 |
综合判断:「复刻强制单轨迹闭环 + 参考作 oracle 生成实现无关测试」是多研究共同指向的机制(非本文自证);但「更强因更宽探索」仍属描述性共现,论文已标注非因果。优势成立条件为「存在可运行参考 + 可冻结隐藏测试」,对依赖实时外部服务/动态状态/多用户协作的工作流则受限(论文 Limitations 已承认)。
七、必要知识反推:做这件事最少必须知道什么
- 领域层:GUI 自动化栈(AT-SPI/AXUIElement/UI Automation/UiAutomator/DOM-ARIA)读值语义;各平台原生构建链(Qt/GTK、AppKit/SwiftUI、.NET/WPF、Gradle/APK、React→静态页);沙箱隔离与反评估作弊机制。
- 方法论层:CUA 基准谱系与 GUI-only/code-only 割裂;拒绝采样/SFT 筛选;程序化与 VLM 断言各自覆盖盲区;验证不对称性(验证比生成易,故可用隐藏测试做客观奖励)。
- 工程层:长轨迹状态持久化(20h 墙钟);测试「参考回放验证 + 人工审查再冻结」双闸门;轨迹级指标(GUI↔代码切换率、受控探测率、最终闭环率)区分描述性工作流与因果性能力。
- 融合节点:创造性在把「开源应用是无限任务源」与「运行实例可作 oracle」化合——用同一实例同时解决「规范从哪来」与「怎么客观打分」,使环境既可控又可扩展。
八、可提取的通用性灵感
- 「参考作 oracle」的任务构造法(范式迁移):运行参考可双通道采出隐藏测试回放考候选、实现无关,可推广至编译器测试、数据库迁移、API 兼容性、机器人动作回放等「有可运行正确答案」的领域。
- 程序化 + 视觉双通道验证(机制):程序化读精确状态、视觉补布局配色,VLM 裁判温度 0 可复现,适用于代码评测、UI 生成、设计稿还原,避免「只比文本」或「只比截图」。
- 行为级而非源码相似度评分(信号利用):交付物无需复刻架构,行级重叠中位数仅 0.014–0.088% 仍能量出差异,可推广至学生作业、Agent 产出、蒸馏保真度判定。
- 长程闭环 > 分段流水线(关注点分离):规范靠操作获得、交付只能是代码,二者不可分段;受控探测稀缺是弱模型落后根因,故「读懂系统再改造它」类任务应强制探索—实现—验证同轨迹往返。
- 可扩展来自「开放供给 × 客观可验证」(规模):开源应用持续刷新供给无限任务与轨迹,验证器自动打分使数据规模化;自改进系统瓶颈常在「可验证信号供给」,优先建「自动产出可信奖励」的环境比堆人标数据更可持续。
小结:RecreationWorld 用「同一个运行中的参考应用」一并化解「规范获取」与「客观验证」两大难题,并把混合 CUA 闭环变成可扩展、可训练的信号源;它也诚实暴露了 frontier 模型的真实水位:能复刻「样子」,却难复刻「行为」。