论文链接:arXiv:2609.22000 代码仓库:GitHub | Hugging Face | ModelScope 发表时间:2026 年 9 月(arXiv v1, 18 Sep 2026) 机构:Alibaba Token Hub, Alibaba Group 领域标签:cs.CL / cs.AI | 计算机使用智能体 / Benchmark


一、论文背景:什么是 CUA,又为何被割裂?

计算机使用智能体(CUA) 是能像人一样操作电脑的 AI:它看屏幕、点按钮、敲键盘,也能写程序、跑命令。最近一年 CUA 沿两条几乎互不往来的路线发展:

  • GUI 路线:只通过「看屏幕 + 模拟点击」操作现成软件,擅长观察却不会自己造软件。
  • 代码/终端路线:在命令行写程序、调构建测试,擅长造软件却看不到自己造出的界面,无视觉反馈判断「跑出来的样子对不对」。

论文洞见:真实数字工作往往交替进行——理解要操作、改造要重建,且两步不能像流水线各做一次:观察修正实现,运行实现又提示「下一步看什么」。因此要的不是两者拼接,而是把 GUI 与代码融进同一条长轨迹、自己决定何时探索/实现/验证的「混合 CUA(hybrid CUA)」。混合回路还有被低估的好处:自锚定性——造出的东西能立刻运行、被自己看到,每轮产出客观可执行反馈,既能轨迹内自我纠错,又能被「打分、筛选」拿去训练,是「可验证、可自我改进」的天然土壤。

二、定位和关联工作:CUA 基准谱系中的位置

过去大批 CUA 评测大多只强调一种交互模式,导致「长轨迹内自主协调 GUI↔代码回路」长期未被好好测量。

基准形态核心交互交付物与本文差异
OSWorld / 2.0桌面GUI+部分代码任务状态规范是人写的描述,不要求交付可编译代码
WebArena网页浏览器操作结果仅 Web,规范显式给定
Windows Agent ArenaWindowsGUI任务状态平台单一、非代码交付
WeaveBenchUbuntuGUI+CLI 混合真实工件要求混合,但规范由人写、目标明确
RecreationWorld五平台GUI↔代码深度融合可编译应用代码规范只能靠操作参考应用「从做中学」,参考充当隐藏测试 oracle

从谱系看,RecreationWorld 站在「GUI 基准」与「视觉/代码编码基准」交叉点,把「规范获取」从「人写规格」换成「智能体自己从运行中的参考反推」,承接 OSWorld、WebArena 等执行/状态可验证评测与 Design2Code、Vision2Web 等视觉+功能编码评测,但把对象翻转为「给定运行实例反推规格再做实现」。

定位结论:它不是一个更长的 GUI 任务集,而是把「探索—实现—验证」闭环本身做成了可评测、可扩展的训练/评测范式。

三、问题定义:规范获取与交付形态的不对称

论文把「应用复刻(Application Recreation)」抽象为一个尖锐的不对称问题:

给定一个正在运行的参考应用 A⋆,智能体必须发现它的行为,并构造忠实的可运行实现;不规定任何工作流。

抽象要素含义类比
输入高层提示 + 可交互运行参考 + 含 GUI 与开发工具的环境一台正在跑的样机 + 一间工作室
过程约束顺序/模态自定,但「看」与「写」必须交替不能光看不动手,也不能光写不看
输出完整源码 S,满足构建/启动契约,跑出候选 bA交出一个能独立运行的复制品
评测只对可观察行为打分(程序化+视觉断言)比「像不像」,不比「代码像不像」

精妙处:它用同一运行实例同时充当「规范来源」与「验证 oracle」,把「拿不到 ground-truth 规格」变成天然可验证信号——参考能跑,就能从它身上采出隐藏行为测试,原样回放考任何候选。

四、问题解法:五平台框架 + 双通道测试生成 + 训练管线

① 五平台可复现执行底座。 每任务一个「版本化、任务隔离」worker,钉死图形运行时、自动化接口与构建链;桌面暴露原生截图/输入/无障碍树,Android 用钉死硬件加速模拟器,Web 用本地服务 + Playwright。worker 在多次「探索—实现—验证」间保留工作区、构建产物、进程与图形状态;单轨迹墙钟超时 20 小时,让复杂度而非基础设施决定交互深度。平台差异经「交付契约 + 程序化测试接口」归一(桌面 AT-SPI/AXUIElement/UI Automation,Android UiAutomator,Web DOM/ARIA)。

② 参考锚定测试生成:程序化 + 视觉双通道。 流程:准备参考→行为盘点→写测试→验证→冻结。orchestrator 结合源码/页面分析与实操建立「功能—可达界面—触发—响应」清单,交由**多条专门子代理(lane)**按互补行为维度并行写用例,每例固定「初始状态/夹具 + 交互序列 + 断言」,断言分两路:程序化(Prog)经无障碍/自动化接口读精确文本、控件状态、导航、持久化或计算值;视觉(VLM)由 Qwen3.7-Plus 裁判对「候选截图 + 参考锚定自然语言断言」做温度 0 二值判定,覆盖布局、配色、画布内容。两道闸门保可信:先在干净参考实例回放每条用例弃无效项,再经人工审查确认无歧义后冻结为隐藏套件。覆盖审计:约 77% 用例离开起始界面、94.2% 检查交互结果(40.7% 要求精确期望值)。

③ 大规模拒绝采样训练。 任务来自 GitHub/F-Droid 高质量开源 GUI 应用,覆盖五平台。用 Qwen3.8-Max 生成「探索→实现→构建运行→检查精修」长轨迹,经任务专属验证器拒绝采样:每平台选 7000 条,得 35000 条均衡 SFT 混合。两臂分别微调 Qwen3.7-Plus 与 Qwen-Flash-CPT。

五、评估:为何「58% 但满分仅 2.8%」很有信息量

主指标:Prog 与 VLM 分开报,平台内宏平均、平台间等权,综合为二者均值。梯度指标:Prog≥90%/=100% 覆盖、导航深度、五地道 OOD 迁移增益。

RECREATIONBENCH(250 任务,每平台 50)十模型(节选):

模型Prog %VLM %综合 %Prog=100%
GPT-6 Astra58.1957.9258.062.8%
Claude Opus 545.9942.3444.16≤0.8%
GPT-5.6 Sol40.6343.4942.06≤0.4%
Qwen3.8-Max-090235.5334.0734.800%

分布设计为何有信息量? GPT-6 Astra 以 58.06% 领先 Claude Opus 5 达 13.9pp,且唯一多平台拿 Prog 全覆盖;但全程序化满分仅 2.8% 任务。说明平均分不能误读成「完整复刻的概率」——最强模型也只是「大部分行为对了」,离「完整、精确、计算正确」仍有鸿沟。报「综合分 + 阈值分布」比单一 pass/fail 更能暴露边界。

OOD 迁移证明了什么? 五地道分布外基准上两臂均提升,最高 +17.9pp:

基准Qwen3.7-Plus(首→末)性质
OSWorld 2.028.2→46.1 (+17.9)混合计算机使用
WeaveBench54.2→60.2混合接口长程
GameCraft-Bench30.6→47.6游戏构建
Vision2Web49.8→57.7视觉网页编码
ProgramBench41.9→44.6代码重建

可编程 SDK 实验:把逐原语 MCP 换成持久化 Node.js REPL + 类型化 JS SDK,50 个 Windows 任务质量持平,但工具结果文本 −65.5%、墙钟 4.12→3.04 小时、成本 $90.50→$41.58(−54.1%)。

六、效果优势的根源解释

因果链(论文实验支持):参考即 oracle(规范只能从运行反推)→ 单轨迹不可分段闭环(探索↔实现↔验证同轨迹反复横跳)→ 自锚定反馈(每轮运行产出客观可执行信号)→ 隐藏测试与实现无关(只测行为不测源码)→ 可扩展(开源应用持续供给)。

  • 只看不写/只写不看都失败:规范靠操作获得、交付只能是代码,二者必须交替(2.2,已支持)。
  • 弱模型差距源于受控输入探测稀缺:同字段输入≥2 不同值的探测仅 13.4–17.0% 轨迹;弱模型在「交互/计算」类落后结构类 9.1–34.4pp,更常复刻静态结构而非动作触发的状态变化与计算(6.3,已支持)。
  • 更宽参考探索伴随更强表现:GPT-6 Astra 覆盖 58.1% 参考侧 GUI 交互类型、每轨迹看 5.23 个不同窗口,与最高分共现(6.1.1,论文标注为相关性非因果)。

相关工作交叉验证(外部检索):

研究相似尝试 / 结论与本文差异影响
OSWorld 2.0(2606.29537)108 长程真实工作流混合 GUI+代码;最强模型严格完成率仅 20.6%,失败在隐式状态推断、跳过验证给显式任务描述,交付任务状态非代码支持:长程混合中验证缺失是普遍瓶颈
WeaveBench(2606.09426)114 混合接口任务强制 GUI+CLI 同轨迹;最佳 41.2%,单接口≤3.5%,outcome-only 高估 10–20pp规范由人写,未把参考当 oracle 生成隐藏测试支持:跨接口编排远未饱和,印证双通道+轨迹验证必要
生成式 Web 环境线(InfiniteWeb/AutoWebWorld/VeriEnv)程序化验证合成/重建功能网站,共享「可执行参考作 oracle」思路目标为合成网页非真实运行实例补充:说明「参考即 oracle」是共识方向

综合判断:「复刻强制单轨迹闭环 + 参考作 oracle 生成实现无关测试」是多研究共同指向的机制(非本文自证);但「更强因更宽探索」仍属描述性共现,论文已标注非因果。优势成立条件为「存在可运行参考 + 可冻结隐藏测试」,对依赖实时外部服务/动态状态/多用户协作的工作流则受限(论文 Limitations 已承认)。

七、必要知识反推:做这件事最少必须知道什么

  • 领域层:GUI 自动化栈(AT-SPI/AXUIElement/UI Automation/UiAutomator/DOM-ARIA)读值语义;各平台原生构建链(Qt/GTK、AppKit/SwiftUI、.NET/WPF、Gradle/APK、React→静态页);沙箱隔离与反评估作弊机制。
  • 方法论层:CUA 基准谱系与 GUI-only/code-only 割裂;拒绝采样/SFT 筛选;程序化与 VLM 断言各自覆盖盲区;验证不对称性(验证比生成易,故可用隐藏测试做客观奖励)。
  • 工程层:长轨迹状态持久化(20h 墙钟);测试「参考回放验证 + 人工审查再冻结」双闸门;轨迹级指标(GUI↔代码切换率、受控探测率、最终闭环率)区分描述性工作流与因果性能力。
  • 融合节点:创造性在把「开源应用是无限任务源」与「运行实例可作 oracle」化合——用同一实例同时解决「规范从哪来」与「怎么客观打分」,使环境既可控又可扩展。

八、可提取的通用性灵感

  1. 「参考作 oracle」的任务构造法(范式迁移):运行参考可双通道采出隐藏测试回放考候选、实现无关,可推广至编译器测试、数据库迁移、API 兼容性、机器人动作回放等「有可运行正确答案」的领域。
  2. 程序化 + 视觉双通道验证(机制):程序化读精确状态、视觉补布局配色,VLM 裁判温度 0 可复现,适用于代码评测、UI 生成、设计稿还原,避免「只比文本」或「只比截图」。
  3. 行为级而非源码相似度评分(信号利用):交付物无需复刻架构,行级重叠中位数仅 0.014–0.088% 仍能量出差异,可推广至学生作业、Agent 产出、蒸馏保真度判定。
  4. 长程闭环 > 分段流水线(关注点分离):规范靠操作获得、交付只能是代码,二者不可分段;受控探测稀缺是弱模型落后根因,故「读懂系统再改造它」类任务应强制探索—实现—验证同轨迹往返。
  5. 可扩展来自「开放供给 × 客观可验证」(规模):开源应用持续刷新供给无限任务与轨迹,验证器自动打分使数据规模化;自改进系统瓶颈常在「可验证信号供给」,优先建「自动产出可信奖励」的环境比堆人标数据更可持续。

小结:RecreationWorld 用「同一个运行中的参考应用」一并化解「规范获取」与「客观验证」两大难题,并把混合 CUA 闭环变成可扩展、可训练的信号源;它也诚实暴露了 frontier 模型的真实水位:能复刻「样子」,却难复刻「行为」。