论文链接:Discriminative World Models for Web Agents 项目主页:dhruvpendharkar.github.io/dwm 发表时间:2026年9月 机构:UC Berkeley(Kelvin Li、Dhruv Pendharkar、Chuyi Shang、Trevor Darrell、Roei Herzig)+ MIT-IBM Watson AI Lab(Anish Pahilajani、Rogerio Feris)+ Cal Poly San Luis Obispo + Xero——高校与产业实验室联合,Berkeley 主导方法设计,MIT-IBM 参与数据与训练 领域标签:cs.AI / Web Agent / 世界模型

一、论文背景

Web agent 的规划范式演进。早期 web agent 是反应式的:看当前页面+历史,直接预测下一个动作。这条路的问题是从不比较备选项——人类点按钮前会在心里过一遍"点这个会发生什么、点那个会发生什么"。

新一代范式补上了这一环——测试时动作选择:先采样 N 个候选动作,再对每个候选预测其后果(下一状态会变成什么样),最后由 ranker 或过程奖励模型(PRM)排序选出最优执行。这条管线里多了一个关键角色:世界模型——负责"想象"每个动作执行后页面会变成什么。

现有世界模型怎么训练的:监督式下一状态预测——给它(历史、当前页、动作),让它生成目标格式的下一状态快照(完整 AXTree 或文本摘要)。这看起来天经地义:世界模型嘛,不就是预测下一状态?

本文发现的错位:下游 ranker 拿预测状态来干什么?区分候选动作。而监督式预测的目标格式与"区分"毫无关系——一个忠实复述整页 AXTree 的预测(90% 内容与动作无关),在 ranker 眼里的信息量可能还不如一句"这个动作会把购物车里商品 X 删除"。训练目标(复述状态)与下游任务(区分动作后果)从一开始就没对齐。

二、论文定位和关联工作

谱系一:Web agent 测试时选择

  • WebDreamer(2025):模型化规划的先行者,世界模型输出自然语言的结果摘要。本文将其 7B 版作为直接对比基线。
  • WebWorld(2026):结构化状态世界模型,生成 AXTree 风格表示。同为本文核心基线。
  • 两者共同点:都用监督式预测目标训练——正是本文要修正的对象。

谱系二:过程奖励模型与动作排序

  • WebPRM Collection / WebShepherd / WebArbiter:动作偏好排序模型。本文不做新的 PRM,而是证明"给任何 PRM 喂上判别式世界模型的预测状态"都能显著提分。

谱系三:对比/判别式表示学习

  • 思想源头可追溯至对比学习(表示的价值观=可区分性)。本文把这一原则具体化到"世界模型预测表示"上:表示的价值由它能否区分决策备选项来定义。
维度WebDreamer-7BWebWorld-8B判别式世界模型(本文)
训练目标监督式文本摘要预测监督式 AXTree 预测predicted-state matching(对比匹配)
监督信号单一目标状态串单一目标状态串真状态 vs 替代动作状态的判别奖励
输出特征摘要但非动作定制大量复述未变化结构聚焦动作引起的差异
匹配准确率74.51%70.17%80.80%

定位结论:本文不是又一个世界模型,而是对"世界模型该怎么训练"这个问题给出的目标级修正——同数据同底座下,只换目标就带来 33 个百分点的匹配提升,说明瓶颈一直在目标函数上。

三、问题定义

具体问题:监督式世界模型生成的下一状态表示,对下游动作排序没有区分力。

抽象问题:世界模型的训练目标应当由下游使用方式反推——ranker 需要的不是"状态的真实复述",而是"能把本动作的后果与其他动作的后果区分开的表示"。

形式化:给定决策点 (历史 h, 当前状态 s, 动作集 A),动作 a 的真实结果状态为 s′ᵃ。训练信号定义为:预测表示 r(s, a, h) 必须满足

match( r(s,a,h), s′ᵃ ) > match( r(s,a,h), s′ᵃ′ ), ∀ a′ ≠ a

其中 match 由固定判别 judge(Qwen3-32B)计算——预测表示与哪个候选状态"更像",judge 就选哪个。奖励只在预测表示把真状态从替代状态中区分出来时才给分。

这个抽象的精妙之处:它让表示学习的目标函数表示无关(representation-agnostic)——不规定输出格式(可以是文本、可以是结构化串),只规定"必须可区分"。评测同样表示无关:判别 judge 读预测表示做二选一,而非与标准答案做精确匹配。这为表示形式的自由演化(未来换更强格式)留出了空间。

四、问题解法

4.1 训练目标:predicted-state matching

  • 训练底座:Qwen3-8B;
  • 数据:从 WebArena 的 Go-Browse 轨迹构建分支化数据集——每个决策点记录多个候选动作及各自执行后的真实结果状态(这是对比目标的数据前提:没有分支就没有"替代状态");
  • 判别奖励:固定 Qwen3-32B judge 拿预测表示与两个候选状态(真实结果+一个替代动作结果)比对,选对则得分;候选顺序随机化;
  • 输出格式:自然语言的下一状态描述,但训练压力全部压在"动作引起的差异"上。

4.2 三层评测设计

  1. 世界模型孤立评测(predicted-state matching 基准):held-out 分支数据、五域(Shopping/CMS/Reddit/GitLab/Map),judge 二选一匹配准确率;
  2. PRM 排序评测(WebPRMBench):把冻结世界模型的预测状态拼进 ranker 输入,看 Pairwise/BoN 准确率变化;
  3. 端到端评测(WebArena-Lite):GPT-4o 做策略,Bo5+状态匹配的测试时选择 vs ReAct vs 纯 Bo5。

4.3 两组关键对照

  • 数据匹配 SFT 基线:同一份分支数据、同一个 Qwen3-8B 底座,但用标准监督目标(生成完整 AXTree 目标)训练——唯一差异是训练目标;
  • 多 judge 鲁棒性:换 GPT-4o、Llama-3.1-70B 做匹配 judge 重评——排除"表示过拟合训练 judge"的解释。

五、评估指标与实验证据

第一层:匹配准确率(Table 1)

方法ShoppingCMSRedditGitLabMap总体
GPT-4o(直接预测)44.4447.8048.2247.0055.8149.40
WebDreamer-7B72.8070.8075.6375.0076.7074.51
WebWorld-8B79.0167.5877.6654.0077.2170.17
数据匹配 SFT 基线(AXTree 目标)45.6846.1547.7246.0051.6347.77
Predicted-state matching(本文)77.7877.4779.7082.5084.1980.80

最有信息量的一行是 SFT 基线的 47.77%——接近随机(50%)!同数据同底座,监督式 AXTree 目标训练出的世界模型在"区分动作后果"这个它本该服务的任务上几乎完全失效。而换成本文目标,同一个模型跳到 80.80%。

Judge 鲁棒性(Table 2)

模型Qwen3-32BGPT-4oLlama-3.1-70B
WebDreamer-7B74.5176.9176.10
WebWorld-8B70.1774.0676.00
本文80.8081.2679.31

三个 judge 下全部领先,排除 judge 过拟合。

第二层:WebPRMBench 动作排序(受控三行,均为 Qwen2.5-7B + 相同偏好训练)

Ranker 输入Pairwise(平均)BoN(平均)
Direct(无预测状态)82.0255.80
+ WebWorld-8B 预测状态85.4867.63
+ 本文预测状态89.3672.70

预测状态本身就有用(Direct→+WebWorld +11.8 BoN),但换成判别式预测状态再多拿 5 个点——目标函数的差异完整传导到了下游。

第三层:WebArena-Lite 端到端成功率

推理设置任务成功率
ReAct(单动作直选)13.94%
Bo5(采样 5 动作+自排序)21.82%
Bo5 + state matching(本文世界模型介入排序)28.48%

实验为什么能证明论点:三层评测构成完整证据链——孤立层证明表示本身可区分(且数据匹配对照把原因锁定在训练目标),中间层证明可区分性对 ranker 有用,端到端证明最终任务受益。judge 随机化与多 judge 复评封堵了替代解释。

六、效果优势的根源解释

Baseline(监督式预测)为什么会失效到随机水平:机制上,监督目标的最优解是忠实复述目标格式。一张 AXTree 里 95% 的内容(导航栏、页脚、静态列表)对所有候选动作都一样——监督压力全部集中在这 95% 的"复述"上,模型学到的是页面结构先验而非动作-状态转移。ranker 读这种表示时,真正含有决策信息的那 5%(“点击后弹窗"“输入后列表变化”)被淹没在复述里。这不是数据不够或模型不够强,是目标函数把学习容量引向了错误的地方——SFT 基线 47.77%(≈随机)就是铁证。

predicted-state matching 的机制性改变:

  1. 奖励结构直接编码"区分”:判别奖励只在表示能区分真状态与替代状态时给分——复述共同结构不得分,编码动作差异才得分。学习容量被强制重定向到 5% 的动作相关部分。
  2. 数据构造配合目标:分支数据集让"替代状态"是真实执行得来的(而非合成负例),区分难度天然真实——这也解释了为什么 GPT-4o 直接预测只有 49.4%:强模型知道页面长什么样(结构先验),但没人训练过它"聚焦动作后果"的表达方式。
  3. 表示无关性带来迁移:判别 judge 读任何格式的表示都行,所以学到的能力不绑定输出模板——换 judge(GPT-4o/Llama)不掉点,正是因为学到的是"内容可区分"而非"格式匹配"。

下游传导链:可区分的表示 → ranker 拿到的候选描述之间有信息差 → 排序不再靠动作文本的表面相似度而靠"后果推演" → BoN 准确率 +5.1、端到端 +6.7pp。每一环都有对应表格支撑。

反事实收尾:如果去掉分支数据(无替代状态可对比),matching 目标无从构造——数据匹配 SFT 基线实际上就是这个反事实的"退化版"(同一数据只用了单调方向),47.77% 的结果说明目标与数据缺一不可,但目标的边际贡献(47.77→80.80,+33pp)远大于数据本身的边际贡献(WebWorld-8B 用自己的数据也只有 70.17)。

七、必要知识反推

领域知识层:

  • Web agent 环境的可执行性:AXTree(浏览器无障碍树)作为状态表示的性质、WebArena/Go-Browse 的轨迹采集、动作空间定义——分支数据集只能建在可真实执行动作的环境上。
  • Web agent 测试时选择的管线结构(提议-想象-排序-执行)与各环节的失败模式。

方法论知识层:

  • 表示学习的价值观:可区分性(判别式)优于可复述性(生成式)——对比学习三十年的核心洞见,作者把它迁移到世界模型。
  • 表示无关评测的设计:用 judge 二选一替代精确匹配,让不同格式的表示可比。
  • 严格对照实验:数据匹配基线(唯一变量=目标函数)+ judge 随机化 + 多 judge 复评。

工程知识层:

  • 分支数据采集系统:在每个决策点真实执行多个动作并记录各自结果状态(成本远高于普通轨迹采集)。
  • LLM 微调管线(Qwen3-8B 底座、判别奖励的 RL/SFT 化实现)。
  • WebArena-Lite 端到端框架的统一实现(三种推理设置在同一 harness 内对比,排除 harness 差异污染)。

知识融合的关键节点:核心融合点是**“看 ranker 需要什么"的逆向工程视角 × 对比学习原理**——作者团队里既有做 agent 系统的(知道下游 ranker 拿表示干什么)也有做表示学习的(知道判别目标的构造法),两者对话才可能问出"监督式世界模型训练的到底是 ranker 需要的东西吗”。第二个融合点是分支数据集的提出:意识到对比目标需要"同一决策点的多结果"这一数据结构,而这恰好是 web 环境可执行性提供的独特能力——纯 NLP 数据集思维想不到去采集这个。

八、论文中可以提取的通用性灵感

  1. 训练目标要从下游使用方式反推

    • 核心思想:中间组件(世界模型、编码器、检索器)的训练目标不是"忠实预测/复述",而是"对下游决策有区分力";目标与使用错位时,数据越多错得越整齐。
    • 论文证据:同数据同底座,AXTree 监督目标 47.77%(≈随机)vs matching 目标 80.80%。
    • 推广场景:RAG 检索器训练(优化引用支撑力而非相似度);推荐召回模型(优化排序区分度而非点击回归);仿真器训练(优化策略可区分性而非画面保真)。
  2. 表示的价值由它区分的备选项定义

    • 核心思想:好表示不是"信息多"而是"对决策相关差异敏感";为表示设计评测时,先问"它需要把什么和什么区分开"。
    • 论文证据:预测表示的价值 = 判别 judge 二选一的准确率;表示无关评测让不同格式可比。
    • 推广场景: Embedding 评测协议设计(按区分任务而非相似度任务评测);面试/人才评估(区分绩优者与绩平者的维度);产品埋点设计(记录影响决策的行为差异)。
  3. 对比目标需要"真实分支"数据

    • 核心思想:判别式训练的数据前提是同一决策点的多个真实结果——合成负例替代不了真实执行的分支。
    • 论文证据:Go-Browse 分支数据集(每个决策点多动作+各自真实结果状态)是 matching 目标可构造的基础。
    • 推广场景:对话系统训练(同一上下文多回复分支的采集);A/B 实验数据复用为对比训练集;自动驾驶 corner case 库(同一场景多策略结果)。
  4. 接近随机的中间指标是"目标错位"的诊断信号

    • 核心思想:当某组件在它本该服务的指标上接近随机、而在训练目标上表现良好时,第一怀疑对象应是目标函数与任务的对齐性,而非容量或数据量。
    • 论文证据:SFT 基线匹配准确率 47.77% ≈ 随机,但它是合格的 AXTree 生成器。
    • 推广场景:评测系统各组件时的"职责对齐审计";code review 中识别"指标好但下游没用"的模块;组织协作中的"交付物与需求错位"诊断。
  5. 端到端收益要沿管线逐层归因

    • 核心思想:+14.5pp 的端到端提升(13.94→28.48)不是黑盒魔法——孤立评测→组件评测→端到端的三层设计让每一层贡献可分离、可复用。
    • 论文证据:匹配层 +33pp(vs SFT 基线)→ 排序层 BoN +5.1(vs WebWorld 状态)→ 端到端 +6.7pp(vs Bo5)。
    • 推广场景:ML 系统优化的收益归因报告模板;技术方案评审的证据链标准;复杂系统性能优化的实验设计。