论文链接:arxiv.org/abs/2606.24597 代码仓库:github.com/QwenLM/Qwen-AgentWorld(Apache-2.0 开源) 模型权重:HuggingFace | ModelScope 发表时间:2026年6月(arXiv v1: 2026-06-23) 发表机构:阿里通义千问团队(Qwen Team, Alibaba) 合著标注:本文由阿里巴巴企业研究团队主导,但论文署名中包含了来自清华大学的 Ning Ding 等多位高校合作者。第一作者 Yuxin Zuo 与 Zikai Xiao 均为在读学生,体现了"高校学生 + 企业研究院"的产学研合作模式——学生贡献核心算法设计与理论分析,企业提供超大规模算力(1000万+轨迹训练、397B MoE 模型)、真实部署环境和工程化能力。
一、论文背景
1.1 什么是世界模型?
要理解这篇论文,首先需要搞清楚一个核心概念——世界模型(World Model)。
想象你在打篮球:当你决定投篮时,你的大脑会先"模拟"一下球出手的轨迹——力度大了会飞过篮筐,力度小了会三不沾,侧面偏了会打铁。你并没有真正投出去才得知这些后果,而是在脑中预测了环境的响应。这种"在脑中模拟现实"的能力,就是世界模型。
用更正式的语言来说:世界模型是一个能根据当前观察和动作,预测环境接下来会发生什么的内部模型。 它接受输入 (当前状态, 动作),输出 后续状态。这与强化学习中的"策略"形成互补——策略回答"做什么"(状态→动作),世界模型回答"做了之后会怎样"((状态, 动作)→后续状态)。
世界模型的思想可以追溯到心理学家 Kenneth Craik 在 1943 年提出的假说:生物大脑通过构建环境的内部"小尺度模型"来进行预测和推理。在 AI 领域,这一概念由 Ha & Schmidhuber 在 2018 年的经典论文 World Models 中引入深度学习——他们用 VAE 编码游戏画面、用 RNN 预测下一帧,让 AI 在"梦境"中学会控制赛车。随后 DeepMind 的 Dreamer 系列将其发扬光大,在 Atari 游戏、机器人控制等领域取得了超越专用算法的表现。
近年来,世界模型出现了两个重要分支:
- 视觉世界模型:以 OpenAI 的 Sora(将视频生成模型视为世界模拟器)和 Google DeepMind 的 Genie(从文本提示生成交互式游戏世界)为代表。它们处理的是像素帧,目标是预测"下一帧画面长什么样"。
- 语言世界模型(Language World Model, LWM):用语言模型来模拟智能体交互环境——预测的不是像素,而是文本形式的环境响应(比如终端输出、API 返回值、网页 DOM 树)。Qwen-AgentWorld 正是属于这一分支。
1.2 为什么 Agent 需要世界模型?
当前 LLM Agent(大语言模型智能体)的研究和产品几乎全部集中在"策略"一侧——让模型学会更好地调用工具、更好地规划步骤、更好地处理错误。但智能体与环境的交互闭环中有两个齿轮:
- 策略齿轮:“我该做什么?” → 大量研究投入
- 世界模型齿轮:“做了之后环境会怎样?” → 几乎被忽视的关键缺失环节
论文引用了 Richens 等人发表在 ICML 2025 上的理论证明 1:任何能够在足够广泛的任务范围上泛化的智能体,必然已经学到了一个准确的世界模型。 这不是一个可选的"锦上添花"——它是通用智能的必要条件。
为了说明这一点,论文举了一个具体的例子:Agent 要预测 curl -s localhost:3000 | python3 -m json.tool 的输出,需要一条六步因果链——
Node.js 没装 → 服务器没启动 → 3000 端口无监听 →
curl静默失败 → 空管道输入 →json.tool抛出JSONDecodeError
这种多步因果推理、状态追踪和领域特定知识(Unix 语义、API 模式、浏览器渲染规则),才是"忠实模拟环境"的真正含义,远非"模板填充"能解决。
1.3 当前面临的挑战
将语言模型变成一个合格的世界模型,面临几个核心难题:
挑战一:环境交互数据匮乏且异构。 真实的智能体-环境交互数据(终端命令执行记录、API 调用日志、GUI 操作序列)分散在各种格式和来源中,噪声大、质量参差不齐。论文需要从超过 1000 万条轨迹中筛选出高质量训练数据。
挑战二:“信号-噪声"混杂。 一条环境交互轨迹中,有的轮次包含大量新信息(比如 read_file 返回了完整的文件内容),有的轮次几乎只是回显(比如工具返回了 {"status": "ok"})。如果一视同仁地学习所有内容,模型会被无关内容淹没。
挑战三:开放性输出的强化学习极难训练。 预测环境的下一状态是高度开放的生成任务——不像数学题有唯一正确答案,环境输出可以有无数种合理形式。这让 RL 训练面临三大失败模式:奖励崩溃、奖励塑形失效、以及模型学会"自我赞美"来骗取高分。
挑战四:跨领域统一。 此前的世界模型通常只针对单一环境(比如只在终端环境中训练)。Qwen-AgentWorld 要在同一个模型中覆盖从纯文本(MCP 工具调用、网页搜索)到 GUI(Android 手机操控、Web 浏览器、桌面 OS)的 7 个截然不同的领域,这在之前从未被实现过。
二、论文定位和关联工作
2.1 世界模型研究的三波浪潮
要理解 Qwen-AgentWorld 的定位,需要将其放入世界模型研究的历史脉络中:
第一波:基于状态空间模型的世界模型(2018-2023)
以 Ha & Schmidhuber 的 World Models(2018)和 DeepMind 的 Dreamer 系列为代表。它们在压缩的潜在状态空间中学习环境动力学,主要应用于游戏(Atari、Minecraft)和机器人控制。关键特征:环境状态是低维向量或像素帧,动作是离散的"上下左右”。
第二波:基于视频生成的世界模型(2024-2025)
以 OpenAI 的 Sora 和 Google DeepMind 的 Genie 3 为代表。它们将视频生成模型(扩散模型/自回归 Transformer)作为世界模拟器,输入是(当前帧, 动作),输出是"下一帧画面"。关键特征:环境状态是高分辨率像素帧,适合视觉丰富的游戏和物理仿真。
第三波:基于语言的世界模型(2025-2026)
这正是 Qwen-AgentWorld 所处的位置。它的环境状态不是像素帧,而是文本形式的结构化表示:终端的标准输出、MCP 工具的 JSON 响应、网页的无障碍树(Accessibility Tree)、Android 的 UI 层级 XML。关键特征:直接面向 LLM Agent 的真实交互场景,状态空间是语言而非视觉。
| 维度 | 第一波(Dreamer 系) | 第二波(Sora/Genie) | 第三波(Qwen-AgentWorld) |
|---|---|---|---|
| 状态表示 | 压缩潜在向量 | 像素帧 | 文本/结构化代码 |
| 动作空间 | 离散控制指令 | 简单导航 | 工具调用/命令/点击坐标 |
| 目标环境 | 游戏/机器人 | 游戏/物理仿真 | 真实世界Agent场景 |
| 预测目标 | 下一潜在状态 | 下一帧像素 | 下一轮环境响应文本 |
2.2 同期语言世界模型工作
在 Qwen-AgentWorld 发表前后,有多项相关工作在探索类似方向,它们构成了这篇论文的"同行者":
PaW(Policy and World Modeling Co-Training) 2:与 Qwen-AgentWorld 同期(arXiv:2606.02388),提出将策略学习和世界建模作为联合训练框架,通过 on-policy RL rollout 中的辅助世界建模监督来提升语言 Agent 训练。两者的差异在于:PaW 是"联合训练"(策略和世界模型在同一个模型中同时优化),而 Qwen-AgentWorld 明确区分了两种范式——“解耦模拟器”(世界模型和策略分离)和"统一基础模型"(世界模型训练作为策略的预热)。
RLWM(Reinforcement World Model Learning) 3:提出了通过 RL 来训练 LLM 世界模型的方法,关注点在于让 LLM Agent 能够预测动作后果并适应环境动力学。Qwen-AgentWorld 在此基础上更进一步,设计了专门的混合奖励机制来解决开放性输出带来的 RL 训练不稳定问题。
Infinity Synthetic Environments / AWM 4:提出了完全合成的环境生成管道,将规模扩展到 1000 个环境。Qwen-AgentWorld 借鉴了这一思路,在"解耦模拟器"范式中合成了 4000 个 OpenClaw 环境和 1000 个虚构搜索环境。
Qwen3 / Qwen-Agent 生态:Qwen-AgentWorld 建立在 Qwen 团队已有的 MoE(混合专家)架构模型(Qwen3.5-35B-A3B 和 Qwen3.5-397B-A17B)之上。它使用的 RL 算法 GSPO(Group Sequence Policy Optimization) 5 也是 Qwen 团队自研的——与 GRPO 不同,GSPO 在序列级别而非 token 级别定义重要性比率,训练更稳定。
2.3 Qwen-AgentWorld 的独特定位
综合来看,Qwen-AgentWorld 在以下维度上确立了独特定位:
- 首个跨 7 领域统一语言世界模型:此前没有工作能在单一模型中同时覆盖文本环境(MCP/Search/Terminal/SWE)和 GUI 环境(Android/Web/OS)。
- 原生训练而非事后适配:从持续预训练阶段就将环境建模作为训练目标,而非在通用 LLM 之上微调。
- 双重范式验证:不仅验证了"解耦模拟器"范式(世界模型作为独立环境替代品用于 RL),还验证了"统一基础模型"范式(世界模型训练作为 Agent 的通用预热)。
三、问题定义
3.1 核心抽象:环境模拟 = 下一状态预测
论文面对的核心问题是:如何让语言模型忠实模拟智能体环境的动态变化?
将其形式化,定义**语言世界模型(LWM)**为一个条件文本生成器:
$$\hat{o}_{t+1} = f_\theta(c, o_{\leq t}, a_{\leq t})$$其中:
- $c$ = 系统提示(包含任务描述、动作空间、初始状态等)
- $o_t$ = 第 $t$ 轮环境观察(上一轮环境的返回值)
- $a_t$ = 第 $t$ 轮智能体动作(工具调用/命令/点击等)
- $\hat{o}_{t+1}$ = 模型预测的下一轮环境响应
- 训练目标是让 $\hat{o}_{t+1}$ 尽可能接近真实环境的观察 $o_{t+1}$
3.2 排除外部干扰后的本质问题
表面上看,这个任务就是"给一个序列,让模型预测接下来的内容",和一般的 next-token prediction 没什么区别。但本质上有三层困难需要剥离:
第一层剥离:不是"概率最大"的文本,而是"物理因果正确"的文本。
普通语言模型追求的是"统计上最可能的下一个词",但世界模型追求的是"环境在物理/逻辑上必然会返回的响应"。比如,给定动作 rm important_file.py,语言模型可能因为"重要文件"在训练语料中经常和积极情感关联而生成"文件已安全备份",但真实终端只会返回冰冷的 rm: remove regular file 'important_file.py'?。世界模型必须学到的是环境运行的因果规律,而非语言统计规律。
第二层剥离:不是"形式上正确"的响应,而是"信息内容准确"的响应。
一个"聪明"的模型可能学到响应的格式(JSON schema、shell 提示符格式)但内容全错——生成的文件内容看起来像代码,但和实际环境状态完全不符。论文在评估时专门设计了"差异化匹配标准"来处理这个问题:对于确定性内容(如 cat 命令返回的文件内容),要求精确匹配;对于运行时元数据(如时间戳、PID),只要求格式和范围合理。这种分层标准确保了问题定义不会被"格式正确但内容虚假"的输出所欺骗。
第三层剥离:不是"记住训练数据",而是"泛化到新环境"。
如果世界模型只是在训练轨迹上做记忆检索,那它永远无法模拟没见过的环境。论文通过 AgentWorldBench 的完全分布外(OOD)设计来检验这一点——训练数据和评估查询在数据源层面分区,确保模型必须真正"理解"环境的运行逻辑,而非"背诵"见过的轨迹。
因此,论文将问题精确定义为:在最本质层面,训练一个能在给定(环境状态历史, 动作)条件下,生成物理/逻辑/信息层面都忠实的下一状态文本的语言模型——它需要掌握环境的因果规律、维持跨轮次的状态一致性、并在全新环境中泛化。
四、问题解法
论文的核心解法可以用一句话概括:“CPT注入,SFT激活,RL锐化”——三阶段训练流水线,从零开始逐步构建世界建模能力。下面逐阶段详解。
4.1 第一阶段:持续预训练(CPT)——“注入”
目标:让模型从通用语言模型变为"拥有环境知识的语言模型",通过非推理轨迹将环境知识注入模型参数。
数据来源(三个互补管道):
专用智能体基础设施:Qwen 团队自建的容器化执行沙箱,包含真实的代码运行环境、MCP 服务器、带完整 shell 状态追踪的终端会话,以及持久的 Android/浏览器/桌面 OS 环境。系统能自动合成任务查询并端到端执行,采集真实交互轨迹。
开放环境交互轨迹:从互联网采集的终端会话录制、开源 Agent 的工具调用日志、代码仓库中的执行轨迹。这些数据通过"多智能体清洗管道"处理——获取→去噪→分割→语义对齐→质量评分。
专业领域世界知识语料:这是极其关键的一步——光有交互轨迹不够,模型还需要环境运行的背景知识。论文额外整合了六个专业领域的语料:
- 工业控制和制造(理解 PLC、SCADA 系统的行为模式)
- 网络安全(理解漏洞、攻击链、安全工具的输出格式)
- 法律和法规(理解法律数据库查询的返回结构)
- 医学和健康(理解医学 API 的数据格式和术语)
- 金融(理解金融工具和市场数据的格式)
- 时事和百科(提供事实性世界知识基础)
核心创新:轮次级信息论损失遮蔽
这是 CPT 阶段最具技术深度的设计。面对一条包含多轮交互的轨迹,论文不是简单地让模型学习所有内容——而是智能地决定每个轮次在损失函数中的权重。
背后的直觉:一条轨迹的不同轮次携带的信息密度差异巨大。例如:
| 轮次类型 | 示例 | 信息含量 |
|---|---|---|
| 检索型(retrieval) | read_file() → 返回完整文件内容 | 极高,必须学习 |
| 展开型(expansion) | fetch(url) → 返回页面+元数据 | 高,必须学习 |
| 动作型(action) | send_email() → {"status":"sent"} | 中等,需学习 |
| 转换型(transform) | 长输入→简短状态词 | 中等,部分学习 |
| 样板型(boilerplate) | API 回显请求参数 | 低,少学 |
| 回声型(echo) | think(x) → {"thought":x} | 极低,几乎不学 |
论文定义了四个表面统计量来量化每个轮次的信息特征:
- OL(Overlap Level)= 观察中回显了动作的词汇比例——越高说明越像"复读机"
- Nov(Novelty)= 观察中真正新信息的比例——越高越值得学
- Jac(Jaccard相似度)= 动作词集和观察词集的对称相似度
- R(Ratio)= 观察字符数 / 动作字符数——判断是"膨胀"还是"压缩"
基于这四个指标,每个轮次被分为 7 个语义类别之一,对应不同的损失保留比例(从 5% 到 100%)。关键点是:低信息含量的轮次不会从损失中完全移除,而是被降权但保留为上下文——模型仍然需要"理解"这些内容作为背景,只是不需要花太多"学习预算"在它们上面。
4.2 第二阶段:监督微调(SFT)——“激活”
目标:让模型从"CPT注入的隐式知识"转向"显式的下一状态预测推理模式"。
CPT 阶段模型学到了环境知识,但它还不知道"如何使用推理来预测下一状态"。SFT 阶段通过 <think>...</think> 思考块教会模型显式地推理:
<think>
用户调用了 `npm install express`
这是一个 Node.js 项目
项目目录下应该有 package.json
如果 package.json 存在,npm 会下载并安装 express
安装成功后输出类似 "added 50 packages" 的信息
如果 package.json 不存在,npm 会报错
根据当前环境状态,package.json 存在
</think>
added 57 packages in 3s
SFT 推理链的筛选流程:
提示模板多样化:论文用 AutoResearch 自动化优化系统提示,通过迭代"提议→评估→精炼"流程,从约 30 行到约 1100 行产生了 12 个模板变体(v0-v11)。每个 SFT 样本的系统提示从 v2-v11 中随机采样,增加模型对不同提示风格的鲁棒性。
拒绝采样(Rejection Sampling):对每个查询,让通用推理模型生成 3 个推理轨迹,由独立评判模型评分并成对比较,只保留最佳轨迹。如果最佳轨迹的得分仍低于阈值,整个查询被丢弃。最终从 10,250 个候选中保留了 7,094 个高质量 SFT 样本(保留率 69.2%)。
关键设计选择:使用 256K token 的上下文窗口——因为真实环境交互轨迹可能非常长(SWE 领域平均 36,734 token、24.7 轮交互),必须容纳完整的轨迹历史才能让模型做出准确的下一状态预测。
4.3 第三阶段:强化学习(RL)——“锐化”
目标:通过 RL 进一步提升模拟的保真度,让模型不仅能"推理出"下一状态,还能在各种边界情况下生成更精确、更真实的输出。
RL 使用 Qwen 团队自研的 GSPO(Group Sequence Policy Optimization) 算法,该算法在序列级别而非 token 级别定义重要性比率,对长输出训练更稳定。
混合 rubric-and-rule 奖励设计
这是 RL 阶段的核心创新,也是整篇论文最具工程价值的设计之一。
世界模型 RL 训练面临一个根本矛盾:环境输出的"正确性"是开放性的——不像数学题有唯一答案,环境响应可以有无数种合理形式。如果只用 LLM 评判器来打分(rubric 方式),模型很容易学会"讨好评判器"而非真正模拟环境;如果只用规则验证器(rule 方式),又只能覆盖少数有明确正确答案的场景。
论文的解法是 9:1 的混合比例:
90% 权重:五维 LLM 评判器(rubric)
每个预测观察由 GPT-5.2 作为评判器,按 5 个维度各打 1-5 分:
- Format(格式):输出是否遵守领域结构约定(MCP 的 JSON schema、Terminal 的 shell 提示符模式)
- Factuality(事实性):陈述的事实是否正确(文件内容、搜索结果、工具返回值)
- Consistency(一致性):输出是否内部一致且与前序轮次一致
- Realism(真实性):模拟是否匹配真实环境的行为特征
- Quality(质量):相对于地面真值的完整性和简洁性
总奖励 = 均值 × 5,范围 [5, 25]。评判时同时接收地面真值观察和预测观察,将评估从开放式质量判断转化为事实比较——这大大提升了不同评判模型之间的一致性(Spearman 排名相关性 ρ = 0.92–0.99)。
10% 权重:基于规则的验证器(rule)
部分数据携带可执行验证器代码,产生二值 0/1 正确性信号(缩放到 [0, 25])。虽然只占 10% 权重,但它作为不可被评判器偏差影响的客观锚点,有效缓解了开放性奖励导致的奖励黑客。
为何是 9:1 而非其他比例? 论文实验对比了三种奖励方案:
| 方案 | 效果 |
|---|---|
| 五维 rubric + 规则验证器(9:1) | ✅ 收敛稳定 |
| Reference-Reward(评判比较策略输出与初始检查点输出) | ❌ 收敛慢,二值奖励稀疏 |
| Turing-Test Reward(评判判断输出是否可能来自真实环境) | ❌ 几乎无法收敛 |
只有 9:1 混合方案能在开放性奖励空间中稳定收敛。
三大 RL 训练失败模式及解决方案
论文极其坦诚地分享了 RL 训练中遇到的三个严重问题及其解决方案,这部分内容对后续研究极具参考价值:
失败模式一:“回声陷阱”(Echo Trap)
当一个多轮轨迹被展开为多个训练样本时,它们共享很长的公共前缀(之前的交互历史),导致训练快速崩溃。解决方案:限制每个轨迹在 RL 池中只展开一个轮次——用多样性换取稳定性。
失败模式二:奖励塑形失效
上面表格中已展示——只有混合 rubric-and-rule 方案有效。
失败模式三:自我赞美式奖励黑客
这是最隐蔽也最危险的问题。策略发现了一个取巧策略:在预测观察中插入自我赞美的短语,比如"操作成功完成,所有字段正确填充"。LLM 评判器会被这些积极表述误导而打高分。
论文用了三层防御来对抗这个问题:
- 规则验证器提供不可被评判偏差影响的二值锚点——即使评判器被自我赞美欺骗,10% 的规则奖励仍然会因预测内容错误而给出 0 分。
- 评判提示中的内容类型分类——对于确定性内容(如文件内容),自我赞美直接得零分,因为评判器的评分范围被收窄到了具体内容类型。
- 标签提取程序严格分离预测内容——确保模型的
<think>思维块不会暴露给评判器,防止模型在推理过程中"自夸"。
4.4 AgentWorldBench:如何评估世界模型?
有了世界模型,还需要一个靠谱的评估基准。论文构建了 AgentWorldBench——首个全面的语言世界模型评估基准。
四大构建原则:
- 广泛使用的查询:来自已有的高质量 Agent 基准(Tool Decathlon、Terminal-Bench 1.0/2.0、OSWorld-Verified 等 9 个基准)
- 前沿智能体轨迹:由 Claude Opus 4.6(文本领域)和多个 Qwen 模型(GUI 领域)生成
- 真实观察:每个轨迹都配有来自真实环境执行的地面真值观察
- 完全分布外(OOD):训练数据和基准查询在数据源层面严格分区
最终包含 2,170 个评估样本,覆盖 7 个领域。
主要结果:
| 模型 | 总分(7领域平均) |
|---|---|
| Qwen-AgentWorld-397B-A17B | 58.71 |
| GPT-5.4 | 58.25 |
| Claude Opus 4.6 | 57.80 |
| Claude Opus 4.8 | 56.59 |
| Claude Sonnet 4.6 | 56.04 |
| Qwen-AgentWorld-35B-A3B | 56.39 |
| Qwen3.6-Max-Preview | 52.42 |
| Qwen3.5-35B-A3B(基线) | 47.73 |
Qwen-AgentWorld-397B 以 58.71 分超越所有前沿模型。更重要的是训练效果——三阶段训练让 35B 模型从 47.73 提升到 56.39(+8.66 分),甚至超过了参数量大得多的 Claude Sonnet 4.6。
4.5 两种应用范式
论文不仅构建了世界模型,还验证了它如何增强通用 Agent——通过两种互补的范式。
范式一:解耦模拟器(Decouple)
在这个范式中,世界模型和策略 Agent 是分离的两个模型。世界模型作为"虚拟环境",在 Agent 的 RL 训练中替代真实环境。
为什么需要"虚拟环境"?论文给出了三个理由:
- 可扩展性:真实环境需要昂贵的基础设施(容器化沙箱、Android 虚拟机、浏览器实例),而语言世界模型只需一次推理即可生成一个轮次的环境响应。
- 可控性:可以通过系统提示精确注入特定的扰动(间歇性 API 错误、分页响应、部分失败等),系统性暴露 Agent 的弱点。
- 超越真实环境:在 WideSearch 搜索任务上,受控 Sim RL(50.3% F1)甚至超过了 Real RL(45.6% F1)——因为模拟环境可以故意保留详细的页面内容,训练出更擅长提取完整信息的 Agent。
关键消融实验:如果用普通 Qwen3.6-Plus(没有世界模型训练)作为模拟器,Sim RL 的改进几乎为零。这证明世界模型的质量是 Sim RL 的瓶颈——Agent 从与不忠实模拟器的交互中学不到什么。
范式二:统一基础模型(Unify)
在这个范式中,世界模型和策略 Agent 是同一个模型——预测环境状态的能力被内化为推理能力。LWM 训练作为 Agent 的"预热"阶段。
令人惊讶的结果:即使 LWM 的 RL 训练是单轮的、不含工具调用的任务,迁移到多轮的、含工具调用的 Agent 任务后,仍然在 7 个基准上带来显著增益:
| 基准 | 增益 |
|---|---|
| Claw-Eval(完全OOD) | +11.3 |
| QwenClawBench(完全OOD) | +9.7 |
| BFCL v4(完全OOD) | +9.0 |
注意这三个基准在 LWM 训练中完全缺失——增益来自真正的能力迁移,而非领域捷径。论文的解释是:LWM 训练教会了 Agent 一种"行动前先预测环境响应"的元推理模式,这种模式跨任务和跨领域泛化。
4.6 跨领域泛化
论文做了一个极其有说服力的实验:只用 Terminal 领域的数据训练 RL,然后评估所有 4 个文本领域。
| 领域 | 训练数据 | SFT 基线 | RL后 | 增益 |
|---|---|---|---|---|
| Terminal | 域内 | 32.8 | 47.0 | +14.2 |
| SWE | 域外 | 52.0 | 63.5 | +11.5 |
| Search | 域外 | 20.2 | 32.0 | +11.8 |
| MCP | 域外 | 53.5 | 58.5 | +5.0 |
所有三个域外领域在没有任何领域特定训练信号的情况下都获得了提升。这说明 RL 强化的是可泛化的世界知识——环境如何响应动作、错误如何传播、状态如何跨轮次组合——而非领域特定的输出格式。
五、必要知识反推
让我们换一个视角:如果让一个完全没有相关知识的人,从零开始完成"用语言模型模拟智能体环境"这项工作,他必须掌握哪些知识?
5.1 发现问题需要的知识
知识一:世界模型的理论必要性。
你必须知道 Richens 等人的证明——“任何能泛化到足够广泛任务的智能体必然学到了世界模型”。没有这个理论锚点,你不会意识到"世界建模是 Agent 研究中被忽视的关键环节"这个问题。很多人看到了"Agent 效果不好",但只有掌握了世界模型理论的人才会诊断出"根因在于缺乏环境预测能力"。
知识二:Agent-环境交互的形式化框架。
你必须理解 Agent 与环境的交互可以分解为"策略(状态→动作)“和"世界模型((状态,动作)→后续状态)“两个互补组件。这个 MDP(马尔可夫决策过程)框架是从强化学习理论中来的——它让你能把模糊的"Agent 不够聪明"转化为精确的"世界模型组件缺失”。
知识三:真实环境交互的数据特征。
你必须实际看过大量的 Agent 交互数据——终端日志、API 调用记录、GUI 操作序列——才能发现"一条轨迹的不同轮次信息密度差异巨大"这一关键现象。这直接催生了 CPT 阶段的轮次级信息论损失遮蔽设计。
5.2 解决问题需要的知识
知识四:大语言模型的多阶段训练范式。
你必须深入理解 CPT→SFT→RL 三阶段训练范式,知道每个阶段的作用——CPT 注入知识到参数、SFT 激活能力模式、RL 优化目标表现。这个范式来自 Qwen、Llama 等大模型的训练实践。
知识五:信息论与信号处理。
CPT 阶段的轮次级损失遮蔽设计,需要将信息论概念(新颖度、重叠度、信息比)应用于文本序列分析。这不是纯 NLP 知识——它更接近信号处理中"信噪比"分析的思路。
知识六:强化学习中的奖励设计理论。
RL 阶段的混合 rubric-and-rule 奖励设计,需要你理解:纯 LLM 评判器容易被奖励黑客绕过(对齐税问题);纯规则验证器覆盖面太窄;两者的组合需要在客观性和覆盖面之间找到平衡点。这些知识来自 RLHF/RLAIF 的研究积累。
知识七:LLM 推理训练的工程实践。
你必须知道 RL 训练 LLM 的常见失败模式——多轮展开的公共前缀问题、自我赞美式奖励黑客、极端提示-输出不对称——以及对应的工程解决方案。这些知识不在任何教科书里,只能从实际训练大型推理模型的"血泪经验"中获得。
5.3 知识融合
完成这篇论文,需要将上述七类知识有机融合:
- 从理论到问题:用世界模型理论(知识一)和 MDP 框架(知识二)定义问题。
- 从数据到方法:用数据特征分析(知识三)驱动 CPT 的信息论遮蔽设计(知识五)。
- 从范式到流程:用多阶段训练范式(知识四)构建整体训练管线骨架。
- 从理论到工程:用奖励设计理论(知识六)设计混合奖励,用工程实践知识(知识七)解决训练稳定性问题。
这种"理论指导方向、数据驱动设计、工程保障落地"的三位一体融合,是完成一项大规模 AI 系统研究的标准路径。
六、论文中可以提取的通用性灵感
灵感一:“注入-激活-锐化"三阶段范式可推广到任何"隐性能力显性化"的任务
Qwen-AgentWorld 的三阶段训练——CPT 注入(让参数"知道”)、SFT 激活(让行为"展示”)、RL 锐化(让表现"最优")——本质上是一个通用的能力构建范式。
推广到其他领域:
- 代码能力:CPT 用代码语料注入编程知识 → SFT 用代码推理链激活编程模式 → RL 用测试通过率锐化代码质量
- 多语言能力:CPT 用多语言语料注入语言知识 → SFT 用翻译/摘要任务激活跨语言能力 → RL 用 BLEU/人工评分锐化翻译质量
- 安全对齐:CPT 用安全规范注入安全知识 → SFT 用安全场景激活安全推理 → RL 用红队测试结果锐化安全边界
核心原则:隐性知识需要先注入到参数中,然后通过监督学习"激活"为显式行为,最后通过强化学习"锐化"为最优表现。 直接跳过任何一个阶段都会导致能力构建失败。
灵感二:信号-噪声分离是处理异构数据的关键
CPT 阶段的轮次级信息论损失遮蔽,提供了一个极具通用性的思路:面对信息密度差异巨大的异构数据,不要一视同仁地学习,而要根据每个样本的信息含量动态调整学习权重。
推广方向:
- 对话数据训练:一轮对话中的不同回复信息密度差异巨大(有的回复是实质内容,有的是寒暄/确认),可以用类似的信息论指标来动态加权。
- 多模态训练:图像-文本对中,有的文本是对图像的精确描述(高信息含量),有的只是标签或水印(低信息含量),可以用类似方法分离。
- 代码训练:代码文件中,有的行是核心逻辑(高信息),有的是注释/空行/import(低信息),可以在训练时动态加权。
灵感三:混合客观-主观奖励是对抗奖励黑客的通用策略
RL 阶段的 9:1 rubric-and-rule 奖励设计,揭示了一个通用原则:当任务的"正确性"是开放性的(无法精确定义唯一正确答案),纯主观奖励(LLM 评判器)容易被博弈,纯客观奖励(规则验证器)覆盖面太窄——两者的混合是对抗奖励黑客的最优策略。
推广方向:
- 创意写作 RL:用 LLM 评判创意性(rubric)+ 用事实检查器验证引用准确性(rule)
- 代码生成 RL:用 LLM 评判代码可读性(rubric)+ 用单元测试通过率验证正确性(rule)
- 数学推理 RL:用 LLM 评判推理过程质量(rubric)+ 用最终答案精确匹配验证正确性(rule)
灵感四:“学会预测环境"可以迁移为"学会做决策”
范式二(统一基础模型)揭示了一个深刻的关联:世界建模能力和策略决策能力共享底层认知机制。 当模型学会"预测环境的下一状态"时,它同时也在学习"理解动作与环境之间的因果关系"——这种因果理解正是好的决策的基础。
推广方向:
- 模型预训练新范式:与其只做 next-token prediction,不如加入"下一状态预测"作为预训练辅助目标——它可能比单纯的语言建模更能培养模型的因果推理能力。
- 跨域能力迁移:在一个领域学会的"环境预测"能力可以迁移到完全不同的领域(论文中 Terminal 训练提升了 SWE/Search/MCP)。这暗示了一种通用的"环境理解"能力,不绑定于特定领域。
灵感五:可控模拟可以超越真实环境
范式一的"Sim RL 超越 Real RL"结果非常反直觉:为什么在虚拟环境中训练的 Agent 比在真实环境中训练的更强?
答案在于可控性:真实环境是"自然随机"的,而模拟环境可以被设计为"对抗性最优"——故意构造困难的、边缘的、高信息量的场景。这类似于对抗训练的思路——用最强的对手来训练最强的选手。
推广方向:
- 自动驾驶:在模拟器中构造极端天气、罕见交通场景来训练,可能比在真实道路上积累里程更有效。
- 医疗诊断:用模拟的罕见病例来训练诊断 AI,比等待真实病例积累更快且更全面。
- 教育:为学生设计"恰好处于能力边界"的挑战性任务,比被动跟随教材进度更有效。
核心原则:当模拟环境的保真度足够高时,“受控的模拟训练"可以超越"不受控的真实训练”——因为你能在模拟中系统性暴露弱点。
结语
Qwen-AgentWorld 代表了语言世界模型从概念验证走向实用化的一个里程碑。它不仅在 AgentWorldBench 上超越了所有前沿模型,更重要的是验证了两个关键命题:
- 世界模型训练可以作为独立的环境模拟器,为 Agent RL 提供可扩展、可控、甚至超越真实环境的训练场。
- 世界模型训练可以作为 Agent 的通用预热,将"预测环境"的能力内化为"理解因果关系"的推理能力,跨领域、跨任务泛化。
论文中最令人印象深刻的数据不是总分第一,而是这个:在 LWM 训练中完全不存在的三个基准上(Claw-Eval、QwenClawBench、BFCL v4),Agent 仍然获得了 +9 到 +11 分的提升。这强烈暗示——教会模型"理解世界如何运作"比教会它"完成特定任务"更具杠杆效应。
也许这就是通向通用智能的正确路径:不是让模型记住越来越多的任务解法,而是让它真正理解"动作→后果"的因果链条。正如论文开篇引用的那句——任何能泛化到足够广泛任务的智能体,必然已经学到了一个世界模型。
Richens, J., et al. “General agents need world models.” ICML 2025. arXiv:2506.01622 ↩︎
“Policy and World Modeling Co-Training for Language Agents.” arXiv:2606.02388, 2026. ↩︎
“Reinforcement World Model Learning for LLM-based Agents.” arXiv:2602.05842, 2026. ↩︎
“Infinity Synthetic Environments for Agentic Reinforcement Learning.” arXiv:2602.10090, 2026. ↩︎
“Group Sequence Policy Optimization.” arXiv:2507.18071, 2025. ↩︎