Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents 精读
论文链接:Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents 发表时间:2026年8月 机构:阿里云 智能计算终端用户 BU(AI Model Application & Engineering Team) 领域标签:cs.AI / 浏览器 agent
一、论文背景
演示与部署的鸿沟。浏览器 agent 在学术基准(平均 8-10 步的干净任务)上成绩亮眼,但真实部署完全不同:要在活网页上维持数十步决策、从错误中恢复、穿过复杂 UI(动态加载、弹窗、iframe 嵌套)。论文开篇的基准扫描显示:WebArena 平均 10 步、WebVoyager 中位 8-15 步、Online-Mind2Web 平均 8.4 步——而真实任务动辄 30-50 步。现有基准短到暴露不出长程失败模式。
“只学成功"的监督盲区。标准 SFT 只用成功轨迹训练——但真实执行中 agent 会出错,出错的瞬间之后没有"正确下一步"的监督信号。论文给出一个尖锐数字:仅用成功数据的 SFT 只能恢复 8.5% 的错误步骤——模型在出错后基本是"盲飞"状态。
多轮 RL 的功劳分配难题。浏览器任务的奖励同样稀疏(终局成败),但轨迹长达几十步——GRPO 类组相对方法在如此长的 horizon 下 credit assignment 严重退化。
二、论文定位和关联工作
| 谱系 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| 浏览器 agent 基准 | WebArena/WebVoyager/Online-Mind2Web | 评测浏览器任务 | 平均 8-15 步,太短 |
| 开源浏览器 agent | OpenCUA、GUI-Owl、EvoCUA、UI-Venux 等 | 各自开源模型 | Wuying-27B 以更小规模全面领先 |
| 恢复训练 | 各类 reflection/自纠错方法 | 事后反思 | RUIC-SFT 把恢复轨迹做进课程化 SFT |
| 长程 RL | GiGPO/势函数塑形系 | 步级优势/塑形 | DAO-GRPO 组合势塑形+发散感知加权 |
定位结论:Wuying 是"全栈对齐"路线的代表——不指望单一技巧(更大模型/更多数据/更强 RL)解决部署差距,而是让执行层(harness)、监督层(SFT 数据)、优化层(RL 算法)、评测层(基准)四层同时瞄准"真实长程”。
三、问题定义
核心洞察:演示-部署差距是四层错位的乘积,单层修补会被其他层的错位抵消。执行层若不稳定(页面状态获取、动作原语),上层的训练信号全是噪声;监督层若只有成功轨迹,模型学到的是"不犯错的假象";优化层若功劳分配失效,长程任务的 RL 增益趋零;评测层若任务太短,一切改进不可见。
形式化:给定真实网页环境 E 与任务分布 T(长 horizon),求模型 π 与 harness H 的联合优化,使得 Success(π, H, T) 最大——注意 π 与 H 被放进同一目标函数,这是"agent 能力=模型×harness"观点的操作化。
四、问题解法
4.1 执行层:结构化浏览器 harness
稳定执行原语(页面状态获取、元素定位、动作执行的动作空间标准化)+ 面向决策的上下文管理(长任务中把历史压缩为决策相关的摘要,而非全量保留)。
4.2 监督层:RUIC-SFT(反思+UI 专项课程)
两类特殊数据显式进入 SFT:(1)恢复轨迹——出错后的"错误→纠正→继续"序列,让模型在错误状态之后仍有正确下一步的监督;(2)复杂 UI 交互课程——从简单元素到弹窗/iframe/动态加载的分级训练。
4.3 优化层:DAO-GRPO(发散感知在线 GRPO)
两个组件针对长程痛点:基于势的奖励塑形(potential-based reward shaping)给中间状态提供稠密信号而不改变最优策略(势函数理论保证);发散感知步加权——检测 rollout 内部"发散"(如重复无效动作、绕圈)并对发散后的步骤重新加权,改善几十步轨迹上的 credit assignment。
4.4 评测层:BrowserBench
350 个双语(中英)真实网页任务、254 个网站、平均 37.9 步(最长 100 步)、LLM-as-Judge 评测——比现有基准长 3-5 倍,专为暴露长程失败模式而设。
五、评估指标与实验证据
主结果(开源 SOTA):Wuying-27B 达 WebVoyager 80.6%、Online-Mind2Web 66.7%、BrowserBench 65.1%;9B 版分别为 69.0/56.8/48.9。对照开源对手:OpenCUA-72B(72B!)WebVoyager 71.7%、EvoCUA-32B 69.0%、UI-Venux-30B 61.4%——27B 超越 72B,单位参数效率显著领先。闭源对照:Ernie-5.0 82.6%、GPT-5.5 77.8%(WebVoyager)。
泛化:同一管线产出在 Tau2-Bench/Claw-Eval/BFCL-v4 平均 73.8——浏览器训练的能力迁移到通用 agent 任务。
为什么实验设计有证明力:三个基准覆盖离线(WebArena 类)/在线真实(Online-Mind2Web)/自建超长程(BrowserBench)三种 regime;9B/27B 双尺寸证明管线的尺寸无关性;与 72B 开源对手的对比直接检验"全栈对齐 vs 堆参数"的路线之争。
六、效果优势的根源解释
对比对象:更大参数的通用 agent 模型(OpenCUA-72B 等)。
根本局限:通用大模型的参数规模没有针对"浏览器长程"的三类特化——错误状态后的行为(SFT 数据里没有)、网页 UI 的特有交互模式(通用语料稀缺)、几十步的稀疏奖励结构(RL 功劳分配退化)。规模解决的是"单步智力",长程需要的是"出错后的稳健"。
本文的根本性改变:因果链分三支——RUIC-SFT 给错误状态后的每一步提供监督(从 8.5% 恢复率的盲飞变为有恢复能力)→ 长任务中"出错不可避免、恢复决定成败";DAO-GRPO 的势塑形给中间状态稠密信号、发散加权切断绕圈轨迹的奖励污染 → 几十步 horizon 上的梯度不再失真;结构化 harness 让页面状态获取稳定 → 训练信号本身可信。三者相乘:27B 在长程基准上超越 72B——不是模型更强,是每一层的信号质量更高。
如实说明:与闭源顶级(Ernie-5.0 的 82.6%)仍有差距;BrowserBench 为自建基准(虽开源但有自评风险)。
七、必要知识反推
领域知识层:浏览器 DOM/无障碍树的元素表示、动态页面与 iframe 的交互陷阱;现有基准的步数分布与失效面——“基准太短"的判断来自这个普查。
方法论知识层:势函数奖励塑形的策略不变性理论(为何塑形不改变最优策略);课程学习的难度分级设计;恢复轨迹的数据构造方法(如何在训练中注入可恢复的错误)。
工程知识层:双语真实网页环境的维护(网页会变,基准要防腐化);vLLM 推理与在线 RL 的工程协同;LLM-as-Judge 的校准。
知识融合的关键节点:最有创造性的一步是发现并量化"成功数据 SFT 的恢复盲区”(8.5%)——这个数字把"恢复能力"从模糊诉求变成可测量的缺口,后续 RUIC-SFT 的设计有了靶子。第二个节点是把浏览器 agent 的能力公式改写为"模型×harness"的联合优化——执行层的稳定性成为上层训练的前提而非外部给定。
八、论文中可以提取的通用性灵感
1. 系统性差距需要分层对齐,单点优化会被其他层抵消 论文证据:执行/监督/优化/评测四层同时瞄准长程,27B 超 72B——任何单层的改进(如只加 RL)都会被监督层的盲区或执行层的噪声抵消。 推广场景:性能优化要同时看算法/IO/架构;教育改革课程/考核/师资单改无效;数字化转型业务/组织/技术需同步。
2. 只学成功的教学隐含"不会犯错"的错误假设 论文证据:仅成功数据的 SFT 错误恢复率 8.5%——训练分布里没有"出错之后怎么办"的样本。 推广场景:医学教育缺并发症处理训练则实战慌乱;驾驶培训只教理想路况;员工培训只讲标准流程不讲异常处置——凡真实系统必出错处,教学必须含恢复样本。
3. 评测的"长度"要与部署的复杂度匹配 论文证据:8-15 步的基准测不出 30-50 步真实任务的失败模式——自建 37.9 步基准后改进才可见。 推广场景:算法面试单题 vs 工程长项目;短跑测试 vs 马拉松选拔;压力测试的持续时间要匹配真实负载曲线。
4. 中间信号的"不改变最优性"添加是安全的增益 论文证据:势函数塑形给稠密中间奖励但理论上不改变最优策略——纯增益的辅助信号设计。 推广场景:游戏成就系统引导而不改变通关目标;教育的过程性反馈不改变学习目标;OKR 的里程碑不改战略意图。