WM-R1: Training GUI Agents to Reason and Leverage World Models with Reinforcement Learning 精读
用强化学习训练手机 GUI 智能体,为什么必须忍受昂贵的真实环境交互?华东师范大学提出的 WM-R1 给出了第一个完全相反的答案:把世界模型从推理时的辅助工具升级为训练环境本身。冻结的 Code2World-8B 世界模型生成全部状态转移,Agent 通过 GRPO 在纯模拟环境中学习;更关键的是 <call_wm> 机制把世界模型嵌进思维链,让 Agent 学会『提出候选动作—模拟后果—评估修正—再提交』的推理策略。AndroidWorld 上 WM-R1-7B 达到 39.8 的 SOTA(超 UI-R1 达 9 个百分点),OOD 平均提升 +16.0,训练全程零真实环境交互、单卡 11.2 小时完成。本精读拆解其训练框架、奖励设计与效果根源。