论文信息
论文标题:Q-Learning with World Models 论文链接:https://arxiv.org/abs/2608.17163 发表时间:2026 年 8 月(arXiv 2608.17163,2026-08-17 提交) 作者与机构:Perry Dong*、Chelsea Finn、Dorsa Sadigh(Stanford University),Yueru Jia*(Peking University),*为共同一作 合作模式:高校-高校合作(斯坦福 × 北京大学)
一句话新闻版:斯坦福与北大新研究 QWM,让世界模型"不掺和"训练,只在测试时帮机器人挑动作——在 Robomimic 和 LIBERO 操作任务上显著提升了样本效率,而传统把世界模型当"数据工厂"的 model-based RL 方法在同样预算下几乎学不动。
一、研究背景与动机:世界模型这把好刀,一直没砍在对的地方
先补充两个基础概念,方便初学者进入。
什么是 off-policy 强化学习(Q-learning)? 想象机器人学抓杯子。它一边与环境交互收集"状态-动作-奖励-下一状态"的四元组,一边把这些经验存进回放缓冲区反复学习。Q 函数学的是"在某个状态下执行某个动作,未来总共能拿多少回报"。off-policy 的好处是旧数据也能反复利用,样本效率天然比 on-policy 高,因此成了当前用 RL 微调视觉-语言-动作(VLA)大模型的主流底座。
什么是世界模型(world model)? 它是一个学到的环境模拟器:给定当前状态和动作,预测下一个状态长什么样。与 Q 函数"只给动作打分"不同,世界模型能预测状态如何变化,理论上蕴含了更丰富的环境信息——它不只告诉你这条路能走,还能"预演"这条路走下去的样子。
按理说,off-policy RL + 世界模型是强强联合。但论文开篇指出了一个尴尬的现状:世界模型的成功主要局限在监督式策略学习里(比如当教师信号、当数据增广器),而在真正的在线 RL 里始终没能大规模兑现潜力,尤其是真实机器人这类高维、长时序的问题。
为什么?传统 model-based RL 的用法是:让世界模型生成大量"想象出来"的轨迹(imagined rollouts),然后直接在这些假轨迹上训练策略或价值函数。 Dreamer、TD-MPC2、EfficientZero V2 都属此类。问题在于世界模型必然不完美——预测的下一帧画面总有一点偏差。在假轨迹上一步步往前推,误差就像滚雪球一样随预测深度复合累积,任务越长、画面越复杂,雪球越大。策略在失真的想象里学得越认真,继承的偏差就越深。这在 Atari 这种小规模仿真里还能靠海量数据压住,到了真实机器人操作(稀疏奖励、样本昂贵、任务长达数百步)就格外致命。
于是作者提出核心问题:能不能让世界模型帮上忙,又完全不污染训练过程? 换句话说,不让世界模型替代真实交互,而是让它"磨快"一个始终在真实世界里学习的 RL 智能体。
二、核心问题与挑战
把动机翻译成技术问题:如何在标准 Q-learning 之上直接利用世界模型提升性能,同时保持策略和价值函数只在真实在线数据上训练?
这个问题说起来一句话,做起来要闯三关:
挑战一:模型偏差的复合。 任何把想象轨迹喂进训练目标的做法(无论是当额外数据、还是当策略优化环境),都会把模型误差写进策略参数里,且随任务时序(horizon)和视觉复杂度恶化。必须从机制上杜绝"模型生成数据进入训练"这条路。
挑战二:怎么用模型才算"用在刀刃上"。 已有一种朴素做法是 best-of-N:策略采样 N 个候选动作,用 Q 函数挑分最高的执行(IDQL、EXPO 的 OTF 策略都这么干)。但这只看了单步 Q 值——每个候选动作只被"面试"了第一句话,没人知道它后续会把机器人带向何方。要评估一个动作的下游未来价值,就得真的往未来看几步,这恰恰是世界模型的看家本领。
挑战三:算力与误差的平衡。 想象一棵树:每个节点分出 N 个动作、每个动作再分出 K 个未来状态,深度为 D,节点数是指数级爆炸的。搜太浅没信息,搜太深世界模型的预测误差又开始复合,搜太宽算力又扛不住。需要一个在"看得远"与"算得准"之间精妙平衡的搜索机制。
三、方法详解:QWM——世界模型只当"军师",不当"教官"
QWM(Q-Learning with World Models)的解法可以用一个类比概括:传统 model-based RL 相当于让学员在模拟器里学开车,学员会把模拟器的物理瑕疵也一并学进肌肉记忆;QWM 则让学员始终在真实道路上练车,只是副驾坐着一位懂路况的导航员,每次打方向盘之前帮学员预演几条走法,选最稳妥的那条。 导航员预演得再离谱,也不会污染学员的驾驶技术——因为训练数据永远来自真实道路。
方法分四块:构建搜索树、聚合节点价值、用 Q 剪枝、世界模型的两种实现。
3.1 总体流程:搜索用在两处,训练只在真实数据
在每个决策时刻(无论是在线采样收集数据时,还是评估执行时),QWM 都执行一次树搜索来选动作。而策略 π 和 Q 函数的参数更新,完全沿用底座算法(论文实现了 EXPO 和 RLPD 两个底座),只用真实环境转移训练。这一点是全文的"宪法":世界模型只出现在决策时刻,绝不作为训练数据源。
由此得到双重收益:在线采样时搜索得更好 → 收集到的转移价值更高 → 后续的策略和 critic 更新从"更肥"的数据里受益;评估时搜索得更好 → 直接选出更优动作执行。
3.2 构建搜索树:广撒网、短 rollout
从当前状态 s₀ 出发建一棵树,由三个量控制:
- N:每个状态节点上,策略采样 N 个候选动作;
- K:每个动作节点上,世界模型采样 K 个预测的未来状态;
- D:递归展开的深度。
节点在"状态层"与"动作层"之间交替,一直展开到深度 D,最后再从策略采 N_leaf 个叶子动作。注意一个细节:这个树是短视野的前瞻,不是穷尽式规划——作者刻意把 rollout 长度压短,防止世界模型自身的预测误差有充分时间累积。这也呼应了传统 MBRL 的教训:不是不能想象,而是别想象太远。
3.3 节点价值:两个互补的估计器,等权相加
树建好了,怎么给根节点那 N 个候选动作打分?论文的答案是:树上每个中间节点的价值都有用,而且有两种打分方式,各有所长,取等权平均(式 8)。
估计器一:V_Q——直接问 critic。 在深度 d 的状态上,把 N 个候选动作直接喂给学好的 Q 函数打分再聚合:
$$V_Q(d|s_d) = \text{agg}_{n \in [N]} \, Q_\phi(s_d, a_d^n)$$它的优点是低方差、与搜索深度无关——Q 函数本来就估计"此后整条轨迹的回报",不依赖世界模型往前推演,因此不会累积模型误差;缺点是对 rollout 视而不见,一切押注在"Q 函数学得准"这一个假设上。
估计器二:V_r——用想象往前走一步。 用世界模型的预测奖励 r_ψ(s_d, a_d^n) 加上折扣后的下一状态价值递归:
$$V_r(d|s_d) = \text{agg}_{n \in [N]} \left[ \text{agg}_{k \in [K]} \left( r_\psi(s_d, a_d^n) + \lambda V(d+1|s_{d+1}^{n,k}) \right) \right]$$它吃满了想象 rollout 的信息,但代价是随深度复合世界模型误差。到了叶子层没有 rollout 可递归,叶子价值退化为对 N_leaf 个动作 Q 值的聚合。
组合(式 8):$V(d|s_d) = \frac{1}{2}(V_Q(d|s_d) + V_r(d|s_d))$。两个估计器估计的是同一个底层量,但失败模式互补——一个"近视但稳",一个"看得远但飘"。等权平均(也可推广为 α 加权)后,单个估计器的短板被另一个补上。最终根节点每个候选动作的树搜索分数 Q_ts 由式 9 给出:一半是它自己的 Q 值,一半是它想象出的未来奖励加折扣后续价值。
一个值得玩味的实现细节:论文实验处于稀疏奖励设定(除终止步外奖励全为零),所以实践中连奖励模型都没学,r_ψ 恒为零——V_r 里真正干活的是"想象一步 + 折扣的未来价值"。这让整套搜索几乎不依赖额外的奖励建模,工程上干净利落。
3.4 用 Q 剪枝:J 束保留的贪心搜索
指数爆炸怎么办?QWM 用 Q 函数本身当"搜索策略"来剪枝。每条部分路径 b 维护一个累积折扣分数:
$$\Sigma(b,d) = \sum_{d'=1}^{d} \lambda^{d'} Q_\phi(s_{d'}^b, a_{d'}^b)$$每往深一层,幸存路径各展开 N 个子动作,按"父路径累积分 + 子动作折扣 Q 分"排序,只留总分最高的 J 条(式 12,top-J 选择)。当 J 取满时等于不剪枝,J 很小时就是贪心束搜索。主实验里 J=1——每层只保留一条最优路径。消融显示性能对 J 相当不敏感,说明"每层留一条最值钱的分支"已经足以捕捉有用的候选未来。这与"树是短视野前瞻而非穷尽规划"的设计哲学一脉相承。
3.5 世界模型怎么来:状态版 MLP,视觉版改造视频生成模型
状态输入(Robomimic):一个极简的残差动力学模型 M_ψ(s_t, a_t) = s_t + Δ_ψ(s_t, a_t),三层 MLP、隐藏维 256,输入是末端执行器位姿、夹爪状态、物体特征加 7 自由度动作,在演示转移上用 MSE 目标离线预训练 10 万步,之后冻结不动。就这么朴素。
像素输入(LIBERO):直接把视频生成大模型 Wan2.2-TI2V-5B 改造成动作条件化的视频世界模型。做法是加一个三层 MLP 动作编码器,把机器人动作映射成 action tokens,与文本条件 tokens 拼接后作为扩散Transformer(DiT)的额外条件输入;VAE 与文本编码器冻结,动作编码器与 DiT 用标准 Wan2.2 flow-matching 目标联合微调。推理时为 LIBERO 生成 5 帧 128×128 视频片段,取生成片段的第二帧作为"预测的下一帧观测",再以它为条件继续下一步生成,实现逐步 rollout 供树搜索使用;推理仅用 1 步去噪。这个"视频生成模型 × 动作条件化 × 逐步预测"的组合,是当下具身智能领域把视频世界模型接入控制的代表性做法。
3.6 训练协议速览
底座算法的原有优化流程原封不动:策略与 critic 只在真实转移上训练。主实验共享设置:5000 环境步后才开始在线训练(之前纯靠演示数据热身)、离线数据比例 0.5、不做额外离线预训练、UTD=20、batch 256、critic TD 折扣 γ=0.99、目标网络更新系数 τ=0.005。树搜索超参:N=8、K=8、D=4、N_leaf=8、J=1、树搜索折扣 λ=0.1、中间节点取 max 聚合、叶子取 mean 聚合。注意 λ 和 γ 是两个互不相干的折扣因子:γ 管 critic 的 Bellman 回传,λ 只管树搜索里"深处的想象价值打几折"。
四、实验结果:曲线全面领先,传统 MBRL 几乎交白卷
基准与任务:Robomimic(状态输入)四个任务——Lift(抓起物体)、Can(抓圆柱放到目标位)、Square(方形螺母精准插到钉上)、Tool Hang(长时序多阶段装配:搭支架并挂工具);LIBERO(像素输入)五个任务(Task 60/79/29/28/2)。指标统一为在线成功率,正文结果以学习曲线(成功率随训练步数变化)呈现,论文未在文字中给出具体数值,以下皆为原文曲线与文字的定性结论,不编造数字。
对比对象:7 个强 model-free 方法(EXPO、RLPD、DSRL、QSM、QAM、FQL、IDQL)加 2 个 model-based 方法(TD-MPC2、EfficientZero V2)。
4.1 对 model-free 基线:全面领先
QWM 在所有任务上取得最强表现,样本效率与最终性能均显著优于(significantly outperforms)这些基线。论文的归因分析很有层次:
- RLPD、DSRL、QSM、QAM、FQL 这类方法每步只从策略采一个动作执行——虽然设计意图是让该动作近似最大化 Q 值,但优化延迟与优化误差让"近似"打了折扣;
- IDQL 做了 best-of-N,比单动作采样好,但它只比较下一个动作的单步 Q 值,而 QWM 评估的是候选动作的未来序列价值——后者携带的长期回报信号多得多。
一句话:QWM 的测试时搜索与 Q-learning 是互补关系,它改进的是动作选择这一环,而非替代在线交互。
4.2 对 model-based 基线:差距悬殊
论文为 TD-MPC2 和 EfficientZero V2 同时跑了稀疏与稠密奖励两个变体(这些方法原生为稠密奖励设计)。结果是:在相同训练步数内,TD-MPC2 与 EZ-V2 仅在 Lift(最简单的任务)上拿到非零成功率,其余任务全军覆没;而 QWM 在全部任务上表现一致地强。原因回溯到设计哲学:TD-MPC2/EZ-V2 把模型预测揉进策略优化目标或训练目标(隐式规划、搜索统计量回传),继承并复合模型偏差;QWM 的模型只活在测试时,策略与价值学习始终锚定真实转移。
4.3 挂在底座上:谁来都能涨,底座越强涨得越高
- 挂在 EXPO 上(主实验配置):Tool Hang、Square、Can 三个任务上学习效率一致提升,越难的任务(如 Tool Hang)提升越显著;
- 挂在 RLPD 上:同样一致提升,尤其样本效率改善明显;
- 两者对比:QWM-EXPO 整体比 QWM-RLPD 更省样本。结论有二:QWM 是即插即用的通用框架,不挑底座;同时底座本身越样本高效,QWM 的绝对性能也水涨船高。
4.4 像素级 LIBERO:收益自然延伸到视觉
视觉实验受算力限制,世界模型只用于在线采样阶段,评估阶段不用。即便如此,QWM 对 EXPO 仍取得整体清晰的优势:Task 60、79、29 上学得更快、后期性能更强;Task 28 上两者最终都接近满分成功率,但 QWM 明显更早达到高水平。作者还援引消融指出:若算力允许把搜索也用于评估,视觉结果还能更好(因为消融中"仅采样"变体的性能确实低于"采样+评估")。这说明 QWM 的收益能自然外推到高维视觉输入——这恰是学习动力学模型最难的场景。
4.5 消融:四个旋钮分别拧什么
| 消融项 | 结论 |
|---|---|
| 搜索用在哪(采样 / 评估 / 两者) | 采样+评估最稳最强。采样时搜索改善回放缓冲区里数据的质量(后续策略和 critic 更新间接受益);评估时搜索直接改进行为;两者互补叠加 |
| 搜索深度 D | D=2 通常增益最强;D=1 太浅,不足以可靠区分候选动作;更长时序规划任务可受益于更深搜索,但过深会暴露于更多世界模型预测误差。适度深度是"纳入未来信息"与"保持预测可靠"的甜点 |
| 折扣 λ | 过大或过小都掉性能:太大则深层想象值权重过高,对复合误差更敏感;太小则深层搜索几乎没贡献。偏小到中等的值(消融中 λ=0.2 最佳)学习效率最高——即"重短期、轻未来"的加权最划算 |
| 候选动作数 N | 从极小值往上加有增益(太少的候选彼此没区分度);超过中等值后收益递减,过大甚至有害——更多想象 rollout 放大了世界模型与价值估计误差的影响,且算力开销徒增 |
| 保留节点数 J | 性能相当不敏感,贪心保留少数高价值分支已足够近似全树最优 |
4.6 附录 B:为什么是 Q,不是 V
这是理解论文定位的关键消融。传统 model-based RL(如 TD-MPC 系)搜索用的是状态价值函数 V。作者实现了一个"只学 V、用 V 搜索"的对照变体(V 经优势估计以 AWR 方式优化策略),分别在 EXPO 内和独立使用两种设定下对比。结果:用 V 搜索在所有设定下都显著逊色于在 Q-learning 上搜索。原因有二:Q 函数天然提供"以动作为条件"的额外估计器(V 做不到),组合出的估计更强;且 Q-learning 底座本身就更强。这为"世界模型应当嫁接在 Q-learning 上"提供了直接证据。
五、亮点与启发
1. 角色重定义:从"数据工厂"到"决策顾问"。 这是最核心的洞察。世界模型的用法存在一个谱系:一端是当训练数据生成器(Dyna、Dreamer 系、VLA 世界模型系列),偏差复合是宿命;另一端是 QWM 的纯粹测试时使用——模型再差,也只是"这一步选得不够好",误差不会写进参数里世代相传。把模型严格限制在决策时刻,训练天然无偏。 这个思路对任何"生成式模型辅助 RL"的场景都有借鉴意义。
2. 测试时计算的 RL 版诠释。 LLM 领域的 test-time scaling / best-of-N 已被反复验证:推理时多花算力能换性能。但经典 best-of-N 用验证器独立地、单步地给候选打分。QWM 相当于把"打分"升级为"预演后续几步再打分",评估的是候选的下游未来价值。这是把 LLM 的推理时扩展哲学移植到连续控制、并补上"后果建模"这一环的有益尝试。
3. 互补估计器的等权组合,简单得近乎优雅。 V_Q 稳但盲、V_r 远但飘,式 8 的等权平均一行搞定,没有复杂的加权学习或不确定性估计。加上稀疏奖励下干脆不学奖励模型的工程决断,整套方法透着"少即是多"的克制。
4. 视频生成大模型成为可用的机器人物理模拟器。 把 Wan2.2-TI2V-5B 加个动作编码器、微调成动作条件世界模型、逐步预测下一帧——这条路径被本文验证可用于真实的树搜索决策。随着视频生成模型继续进步,“世界模型即接口"的基础设施正在成型。
六、局限与未来方向
作者在讨论部分坦承两点,我们如实转述并稍作展开:
1. 推理时算力开销不可忽视。 每走一步环境动作,都要展开一棵 N=8、K=8、D=4 的树(还有逐层的 Q 评估与剪枝),相比一次策略前向传播是实打实的额外计算。对延迟敏感的实时控制场景,这套搜索可能 prohibitively expensive。缓解方向包括:更激进的剪枝、更小的树、蒸馏搜索结果回策略本身。
2. 世界模型本身昂贵且难训。 QWM 免除了"模型偏差复合进训练"的病症,但没免除"先要有一个好世界模型"的成本——视觉版要微调一个 5B 参数的视频生成模型(8 卡、20 万梯度步)。降低搜索开销、获取更高质量的世界模型,被作者点名为两个重要未来方向。
此外从读者视角还可补充两点观察:其一,世界模型在演示数据上离线训练后即冻结(状态版),而策略在线进化会导致数据分布漂移,冻结的模型对新策略想象的未来会逐渐"过时”,是否随在线数据持续更新世界模型是个开放问题;其二,搜索收益依赖 Q 函数质量,训练早期 Q 还很不可靠时,树搜索的打分可能放大噪声——论文通过 5000 步演示热身期部分规避,但冷启动阶段的稳健性仍值得研究。
七、相关工作全景:QWM 站在哪里
| 路线 | 代表方法 | 世界模型的角色 | 与 QWM 的本质区别 |
|---|---|---|---|
| 带先验数据的 RL | RLPD、Cal-QL、AWAC、IQL 系在线微调 | 无 | 关注"先验数据如何进 RL 目标";QWM 关注"世界模型如何改进在线 RL",与它们正交、可叠加 |
| MBRL:模型当数据源 | Dyna、MBPO、Dreamer 系列 | 生成合成转移当真经验 | 想象数据直接进训练,偏差复合 |
| MBRL:模型当规划器 | TD-MPC2、MPC 系(MPPI/CEM 规划) | 在隐空间/模型上做轨迹优化 | 模型预测进入策略优化目标或训练目标,仍继承偏差 |
| MBRL:模型+树搜索 | AlphaZero、MuZero、EfficientZero 系 | MCTS 引导,搜索统计量回传作训练目标 | 多依赖已知模型/离散动作/海量仿真数据;QWM 面向连续动作、稀疏奖励、真实机器人 |
| 世界模型 × VLA | VLAW、World-VLA-Loop、WMPO、RISE、GigaBrain 等 | 生成合成数据或想象 rollout 上跑 RL | 世界模型主要当训练数据生成器,易复合偏差 |
| 测试时扩展 / best-of-N | LLM 自洽性、扩散推理时扩展;IDQL、EXPO(OTF) | 无(验证器单步打分) | 候选被独立、单步打分;QWM 用世界模型评估候选的下游后果 |
可以看到,QWM 精准地卡在几个学派的交叉空位上:它继承 test-time scaling 的"推理换性能",补上世界模型的"后果预演",又坚持 model-free 训练的"真实数据无偏"——三者此前从未被这样组合过。作者还强调 QWM 可套用在任何带 Q 函数的 RL 微调算法(包括 VLA 微调)之上,通用性是设计目标之一。
八、总结与个人思考
QWM 用一个干净的问题定义(“世界模型能否直接架在标准 Q-learning 上用”)和一个克制的答案(“只在测试时做动作搜索”),交出了在 Robomimic 与 LIBERO 上显著超越 model-free 强基线、并把传统 model-based 基线甩在身后的成绩单。它的价值不在组件多新——树搜索、best-of-N、世界模型全是老朋友——而在角色的重新分工:让最不可靠的组件(学到的模型)只承担一次性的、可被真实验证的决策辅助,让需要长期复利的组件(策略与价值)只吃最干净的真实数据。这种"风险隔离"式的系统设计思维,比任何单一技巧都更值得迁移。
对后续研究的启发可以归纳为三个问题:第一,推理时算力换性能的天花板在哪里——搜索更深、更宽、与策略迭代互蒸馏是否能把开销摊薄?第二,世界模型能否随在线数据持续进化而不引入新的偏差复合?第三,这条"测试时模型辅助"路线与 VLA 微调、长时序操作、乃至真实硬件部署结合时,延迟与算力约束如何化解?在"世界模型热"的当下,QWM 提醒我们:模型不必进入训练循环,也能兑现价值——有时候,最好的参与方式是保持距离。
本文基于论文 arXiv 2608.17163 全文撰写,所有实验结论以原文曲线图与文字表述为准,未添加论文之外的数值。