论文链接:WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning 发表时间:2026年8月 机构:Senyu Fei、Xipeng Qiu(复旦大学) 领域标签:具身智能 / VLA 强化学习 / 世界模型

一、论文背景:VLA 强化学习的 critic 困境

什么是 VLA(Vision-Language-Action)模型? VLA 是一类让机器人"看图+听指令→输出动作"的多模态模型,代表性工作有 Pi0、Pi0.5、OpenVLA-OFT。它们是当前具身智能的主流范式。

什么是 RL 后训练? 预训练后的 VLA 模型用强化学习在真实/仿真环境里继续训练,根据任务成功/失败获得奖励,提升表现。这和 LLM 的 RLHF 思路类似。

什么是 critic(价值估计器)? 在 actor-critic 强化学习里,actor(策略)决定"做什么动作",critic(价值函数)估计"当前状态有多好、未来能拿多少回报"。critic 给 actor 提供学习信号。critic 的好坏直接决定 RL 的收敛速度和最终性能。

问题在哪? 机器人控制本质上是部分可观测的——一张画面看不到完整状态(比如物体被遮挡、运动速度看不出来)。但现有 critic 主要基于单帧观测或单帧 VLM backbone 的 latent,这与部分可观测根本不匹配。

朴素的解法为什么失败? 把多帧历史喂给 critic?论文实验证明:(1) 给 MLP critic 加更多历史帧,性能反而下降;(2) 用 ViT 处理历史帧(不加世界建模目标)仍然无效。根因是:纯标量回报回归提供的监督信号,不足以让 critic 学会跨时序的动态。

二、论文定位和关联工作

VLA 强化学习的 critic 路线:

路线代表思路局限
单帧 critic标准actor-critic只看当前帧忽略部分可观测
多帧堆叠 criticMLP/ViT+历史帧堆叠多帧输入监督不足,仍无效
世界模型LeJEPA/Dreamer预测未来表示通常与 critic 分离
WCM(本文)联合世界建模+价值critic 显式预测未来+估价值—

WCM 的定位:首次把"世界建模"目标注入 critic 内部,让 critic 的表示同时服务于"预测未来"和"估计价值"——两个目标共享一个表示空间,互相约束。

三、问题定义:critic 的状态近似问题

论文把问题抽象为critic 的状态近似问题:

机器人控制是一个部分可观测马尔可夫决策过程(POMDP)$(\mathcal{S}, \mathcal{O}, \mathcal{A}, \mathcal{T}, \mathcal{R}, \gamma)$——真实状态 $\mathcal{S}$ 不可直接观测,只能通过观测 $\mathcal{O}$(画面)推断。

critic 要估准价值 $V(s)$,就必须先从观测序列 $o_{t-K+1:t}$ 准确近似真实状态 $s_t$。没有显式的世界建模目标,critic 的表示无法捕捉时序结构——它只被训练去回归一个标量回报,没有任何信号告诉它"未来会怎样"。

形式化:critic 需要一个表示 $h_t = f(o_{t-K+1:t}, \ell)$($\ell$ 是语言指令),既支撑 $\hat{V}_t = \mathcal{D}_{value}(h_t)$,又支撑 $\hat{z}_{t+1} = \mathcal{D}_{world}(h_t, a_t, z_t)$(预测下一帧 latent)。

四、问题解法:基于 LeJEPA 的世界评论家

WCM 有四个核心组件:

4.1 观测编码器

将过去 $K$ 帧历史编码为潜在嵌入 $z_{t-k} = \mathrm{enc}_\epsilon(o_{t-k})$。编码器可以是 ViT 或 VLA 策略的 VLM backbone。

4.2 语言指令编码

用 CLIP 编码语言指令,通过学习适配器映射到 WCM 潜在空间:$u_\ell = \mathcal{A}_{lang}(\mathrm{CLIP}(\ell))$。

4.3 世界预测器(因果 Transformer 历史主干)

先对视觉历史与指令 token 做交叉注意力,再用因果 Transformer 处理:$h_t = \mathrm{Tr}_\phi(\mathrm{XAttn}(z_{t-K+1:t}, u_\ell))$。

4.4 两个解码头

  • 价值头:$\hat{V}_t = \mathcal{D}_{value}(h_t) \in \mathbb{R}$
  • 世界预测头(残差更新):$\hat{z}_{t+1} = \mathcal{D}_{world}(h_t, a_t, z_t)$,用动作编码器和门控 FiLM 残差块实现。

4.5 三项组合损失

$\mathcal{L} = \mathcal{L}_{value} + \lambda \cdot \mathcal{L}_{pred} + \eta \cdot \mathcal{L}_{SIGReg}$

  • 预测损失(teacher-forcing):$\|\hat{z}_{t+1} - z_{t+1}\|_2^2$
  • SIGReg 正则化:强制潜在表示匹配各向同性高斯,防止特征坍塌
  • 价值损失(L2):$\|\hat{V}_t - G_t\|_2^2$,回报 $G_t$ 归一化到 $[-1,1]$

4.6 兼容性

无缝集成 on-policy(PPO/Flow-SDE)和 off-policy(AWR/RECAP),兼容 Pi0、Pi0.5、OpenVLA-OFT。

五、评估指标与实验证据

5.1 ManiSkill 主结果(149 任务,4 基准之一)

Backbone方法IND avgOOD avg
π₀SFT38.418.1
π₀Flow-SDE78.839.3
π₀+WCM84.451.5
OpenVLA-OFTSFT28.118.3
OpenVLA-OFTPPO97.777.1
OpenVLA-OFT+WCM99.077.9
OpenVLA-OFTZero-Shot0.80.8
OpenVLA-OFT+WCM98.773.5

从 0.8% zero-shot 到 98.7%——提升超 12000%。

5.2 LIBERO-Plus——最关键的证据

Backbone训练方式平均
π₀Full-SFT(20k 轨迹)71.2
π₀One-SFT(每任务1演示)+ WCM(~250步RL)72.8
OpenVLA-OFTFull-SFT(20k 轨迹)71.7
OpenVLA-OFTOne-SFT(每任务1演示)+ WCM(~250步RL)74.0

这个实验为什么有证明力? 它显示每任务只用 1 个演示 + 约 250 步 RL,就能超越用 20,000 条轨迹训练的 Full-SFT。这说明 WCM 不是靠数据量,而是靠"世界建模目标提供的时序结构监督"——critic 学会了动态,就能从极少数据泛化。

5.3 消融——为什么单纯加历史帧没用

架构配置结果
MLP critic(单帧)基线
MLP + 更多历史帧性能下降
ViT 历史 critic(λ=0,无世界预测)仍然无效
WCM(含世界预测)最佳

最优历史长度 K=3(隐式捕获二阶动态/加速度),λ=0.3-0.5 时 IND/OOD 均最佳。OOD 对 λ 更敏感(波动 10.6pp vs IND 仅 2.7pp)——世界预测对泛化贡献更大。

5.4 真实世界机器人(7 任务,WidowX-250S)

OpenVLA-OFT 在所有 7 个真实任务上全面超越 AWR 基线(如 Cloth Folding 15/50→38/50,Stovetop Cleaning 1/50→15/50)。WCM 的可训练参数仅 107.2M,RTX 5090 推理,训练时间 <1 小时。

六、效果优势的根源解释

baseline(单帧 critic)的根本局限:它把"价值估计"当成了一个纯回归问题——给一帧画面,回归一个标量。但价值本质上依赖"未来会发生什么",而未来无法从单帧推断。这不是"它没看历史",而是"它看的表示里没有任何信号告诉它时序动态"。

WCM 的根本性改变:它给 critic 加了一个与世界建模共享表示的预测头。这个预测头强制 critic 的表示 $h_t$ 不仅要支撑价值回归,还要能预测下一帧的 latent 状态。预测未来 latent 是一个有丰富监督信号的任务(每一帧都有监督),它把时序结构"灌"进了表示空间。

因果链:方法差异(联合世界建模+价值估计)→ 机制变化(critic 表示被显式训练捕捉时序动态,而非仅回归标量)→ 指标提升(OOD 远超 IND 提升幅度,证明泛化来自动态建模)。

为什么单纯加历史帧反而下降? 因为更多高维视觉输入增加了优化难度,而监督信号没变(还是标量回报)——优化landscape 变差但监督没增强,所以变差。只有增加世界预测目标,监督才匹配了更丰富的输入。

七、必要知识反推

领域知识层:

  • 机器人控制的部分可观测本质(POMDP)。
  • VLA 模型的架构(Pi0/OpenVLA-OFT 的 backbone 如何工作)。

方法论知识层:

  • JEPA(Joint-Embedding Predictive Architecture)——LeCun 的自监督范式,预测表示而非像素,这是 WCM 架构的基础。
  • Actor-critic RL 的价值估计理论。
  • SIGReg 正则化——防止潜在表示坍塌(高维空间中的各向同性约束)。

工程知识层:

  • On-policy(PPO/Flow-SDE)与 off-policy(AWR/RECAP)的兼容实现。
  • 门控 FiLM 残差块的动态预测。

知识融合的关键节点:把"JEPA 的表示预测"和"RL 的价值估计"在同一个表示空间里联合优化——意识到 critic 的根本瓶颈不是输入不够,而是监督不足以学时序动态。

八、论文中可以提取的通用性灵感

灵感一:监督信号要匹配输入丰富度

  • 核心思想:当输入变丰富(更多历史帧),监督信号也必须相应增强;否则输入越丰富优化越难,性能反而下降。
  • 论文证据:MLP+历史帧性能下降(监督没变);WCM 加世界预测目标(监督增强)后最佳。
  • 推广场景:(1) 多模态学习的监督设计;(2) 长视频理解的监督信号;(3) 多步预测任务的辅助目标。

灵感二:用"预测未来"作为表示学习的通用监督

  • 核心思想:预测未来(表示空间)是一个有密集监督的任务,可以作为任何需要时序理解的模块的辅助监督。
  • 论文证据:世界预测头让 critic 表示学会动态,OOD 泛化大幅提升。
  • 推广场景:(1) 视频理解的表示学习;(2) 时序预测的表示;(3) 决策模型的状态表示;(4) 推荐系统的用户状态建模。

灵感三:从极少数据泛化靠的是"学会结构"而非"记住样本"

  • 核心思想:当模型学会了世界的动态结构(而非记住具体轨迹),就能从极少先验数据泛化。
  • 论文证据:每任务 1 演示 + 250 步 RL 超越 20k 轨迹 Full-SFT。
  • 推广场景:(1) 低资源学习(学结构而非记样本);(2) Sim-to-Real 迁移;(3) 元学习的结构先验。

本精读基于 WCM 论文全文撰写,覆盖 Method(LeJEPA 架构、三项损失、on/off-policy 兼容)、Experiments(ManiSkill/LIBERO-Plus/MetaWorld/CALVIN 全部结果、消融、7 个真实任务、sim-to-real)。