论文链接:arXiv:2608.06197 代码仓库:github.com/Within-yao/EnvACE 发表时间:2026年8月(8月6日提交 arXiv) 机构:蚂蚁集团(Weiwen Liu / Xingshan Zeng / Yasheng Wang 团队)+ 上海交通大学(Weinan Zhang 团队)—— 企业(提供算力、Agent 工程实践场景)与高校(提供强化学习理论支撑)合作 领域标签:cs.AI / cs.LG — Agentic RL, World Model, Test-Time Scaling, LLM Post-training
一、论文背景
什么是 Agentic Reinforcement Learning(智能体强化学习)?
要理解 EnvACE 解决的问题,我们需要先建立一个认知阶梯:LLM → Agent → Agentic RL。
大语言模型(LLM) 本质上是一个「单轮文本续写器」——给它一段开头,它预测下一个词。但真实世界中,我们希望 AI 不只是聊天,而是能主动做事:查数据库、调用计算器、订机票、操作代码解释器。这种「会用工具的 LLM」就被称为 Agent(智能体)。
类比:如果把 LLM 比作一个只会纸上谈兵的军师,那么 Agent 就是一个能真正领兵打仗、调用各种兵器(工具)的将军。
让 Agent 学会「用工具」并非易事。早期做法是用监督微调(SFT)——收集大量「人在这种情况下应该调用什么工具」的示范数据,让模型模仿。但 SFT 有一个根本缺陷:它只学会了「像示范那样做」,却不知道「为什么这样做更好」。于是研究者引入了 强化学习(RL)——让 Agent 自己去尝试,用任务的成功/失败作为奖励信号,通过反复试错学到更优的策略。把 RL 应用到 Agent 上,就是 Agentic RL(智能体强化学习)。
当前 Agentic RL 遇到了什么瓶颈?
一个完整的 Agent 任务通常是一个多轮交互过程:
用户提问 → Agent 生成工具调用 a_1 → 环境返回结果 o_1
→ Agent 生成工具调用 a_2 → 环境返回结果 o_2
→ ...
→ Agent 给出最终答案
这里的「环境」是真实的外部世界——它可能是真实的搜索引擎、数据库 API、代码沙箱。要让 Agent 通过 RL 学会优化这个多轮过程,它必须在训练中大量地与真实环境交互:生成一个动作 → 等环境响应 → 拿到结果 → 再生成下一个动作……这带来了三个严重问题:
- 训练成本高昂:每一步都要真实调用外部工具,耗时且费钱。复杂任务可能需要十几轮交互,一次完整的训练样本就要消耗大量 API 调用。
- 环境不可微:环境是一个黑盒(搜索引擎不会告诉你它的内部状态梯度),梯度无法从最终奖励回传到中间的每一步决策,学习信号稀疏。
- 环境不可复现:同一个查询,搜索引擎今天和明天返回的结果可能不同;数据库状态会变化。这让 RL 训练样本的方差极大,策略难以稳定收敛。
一句话总结瓶颈:传统 Agentic RL 把「策略学习」和「环境交互」死死绑在一起——要进步就必须付昂贵的环境交互代价。
是否可以不依赖外部环境?
一个自然的想法是:能不能让模型自己模拟环境? 如果模型在内部就能预测「我调用工具 X 会得到什么结果」,那它就可以在「脑内」完成整个多轮推理,完全不需要真实环境,RL 训练成本将骤降。
这个想法并不新——它正是世界模型(World Model) 的核心思想:学习一个环境的内部表征,用来预测动作的后果。但把世界模型和 Agentic RL 结合起来,长期面临一个尴尬:世界模型是单独训练的,它和策略是两张皮。先用数据训一个世界模型,再用它辅助策略训练,两者各自优化各自的损失,很难对齐,误差也会叠加。
EnvACE 要解决的,正是这个「两张皮」问题。
二、论文定位和关联工作
把 EnvACE 放在 Agentic RL 的研究谱系中,可以清晰地看到三条线索:
谱系一:真实环境交互派
| 代表方法 | 核心思想 | 与 EnvACE 的关键区别 |
|---|---|---|
| ToRL / RAGEN / ToolRL | 让 Agent 在真实工具环境中用 GRPO/PPO 做 RL | 必须真实调用环境,训练成本随交互轮数线性增长 |
| Search-R1 | 让模型边检索边推理,用真实搜索引擎做 RL 信号 | 环境不可复现,方差大;无法在「脑内」预演 |
这条路线是最直接的 Agentic RL,但被前述三大瓶颈(成本、不可微、不可复现)死死卡住。
谱系二:显式世界模型派
| 代表方法 | 核心思想 | 与 EnvACE 的关键区别 |
|---|---|---|
| EnvSim(世界模型单独训练) | 先用 SFT 训练一个环境模拟器,再用它生成数据训策略 | 世界模型与策略分离训练,表征不对齐;需要额外标注数据 |
| SWIM / 双模型架构 | Policy 模型 + World 模型两个独立网络 | 两个网络各自优化,世界模型的误差会全部传导到策略 |
这条路线意识到了「环境是瓶颈」,但选择了堆叠两个模型的方案——策略是策略,世界是世界,仍然没有融为一体。
谱系三:Agent 自演化派
| 代表方法 | 核心思想 | 与 EnvACE 的关键区别 |
|---|---|---|
| AWM(Agent Workflow Memory) | Agent 在任务中积累「工作流技能」,14B 模型做到 32.54% | 仍依赖真实环境交互收集经验;靠记忆而非内化世界动力学 |
| EnvScaler | 通过环境扩展和课程学习提升 Agent(8B 在 τ²-Bench 32.9%) | 优化的是「如何更好地用环境」,而非「摆脱环境」 |
这条路线追求 Agent 的自我提升,但提升路径仍离不开外部环境。
EnvACE 的突破定位
| 维度 | 之前的路线 | EnvACE |
|---|---|---|
| 环境依赖 | 训练时必须真实调用环境 | 训练时零环境交互 |
| 世界模型 | 单独训练 / 不使用 | 与策略共享参数,端到端联合优化 |
| 表征对齐 | 世界模型与策略表征不一致 | 同一个网络同时扮演两个角色,天然对齐 |
| 推理时用法 | 用策略直接行动 | 策略先在脑内排练验证(TTS),再行动 |
定位结论:EnvACE 开辟了一条新路线——内化环境动力学(Internalizing Environment Dynamics)。它不是「更好地使用环境」,也不是「单独训一个世界模型」,而是让策略网络本身同时成为行动者和环境,把世界知识「长」进策略参数里。这使得 RL 训练彻底摆脱环境依赖,同时推理时还能用这份内化的世界知识做自我验证。
三、问题定义
从具体场景到本质问题
具体问题:怎么训练一个 Agent,让它在多轮工具调用任务上表现更好,同时不付出昂贵的环境交互代价?
表面上看这似乎是「鱼和熊掌」——要好效果就得用环境,不用环境就没监督信号。但 EnvACE 抓住了一个深层结构相似性:
核心洞察:Agent 任务中的对偶结构
在一个多轮 Agent 任务中,每一步其实只有两类输出:
- 动作(Action):Agent 决定调用什么工具、传什么参数。
- 观察(Observation):环境对这个动作的响应(搜索结果、计算结果、报错信息)。
这两者形成了一个对偶——动作是「因」,观察是「果」。传统做法只让 LLM 学习「生成动作」,把「生成观察」的任务交给真实环境。但既然两者都是文本序列、都遵循语言规律,为什么不让同一个 LLM 同时学习生成这两者呢?
类比:这就像下棋。你可以找两个棋手对弈(策略 vs 真实环境),也可以让一个人「左右互搏」——左手执黑,右手执白,一个人同时扮演双方。AlphaGo 的自我对弈就是这种思路。EnvACE 把这个思想搬到了 Agent 训练中:让一个策略网络「左右互搏」,同时扮演 Agent 和 Environment。
形式化问题定义
给定:
- 一个策略模型 $\pi_\theta$(参数为 $\theta$)
- 一个任务集合 $\mathcal{D}$,每个任务 $x$ 有奖励函数 $R(x, \tau)$,其中 $\tau$ 是 Agent 的完整多轮轨迹
- 一个角色集合 $\mathcal{R} = \{\text{Act}, \text{Rehearse}\}$,分别代表「行动者」和「环境排练者」
一条轨迹按如下方式生成:
$$a_t \sim \pi_\theta(\cdot \mid h_t, \text{Act})$$$$\hat{o}_t \sim \pi_\theta(\cdot \mid h_t, a_t, \text{Rehearse})$$$$h_{t+1} = h_t \oplus (a_t, \hat{o}_t)$$其中 $h_t$ 是历史,$\hat{o}_t$ 是策略自己生成的环境响应(区别于真实环境响应 $o_t$)。
约束:训练过程完全不调用真实环境,只使用 $\hat{o}_t$(模型生成的观察)来推进轨迹。
求解:寻找参数 $\theta$,使得在任务奖励 $R$ 下策略的期望收益最大化,同时要求 Rehearsal 角色生成的 $\hat{o}_t$ 与真实环境响应 $o_t$ 分布一致(这样策略学到的行为才能迁移到真实环境)。
这个抽象的精妙之处
- 排除了外部环境的干扰:问题被还原为「如何让一个语言模型同时学好两种文本生成模式」——这是纯语言建模问题,可以用成熟的 RL 方法解决。
- 抓住对偶本质:动作和观察都是 token 序列,共享同一个语言表征空间,天然适合用同一个网络建模。
- 保留了迁移性:通过约束 $\hat{o}_t \approx o_t$,确保「脑内排练」学到的策略在真实环境中仍然有效。
四、问题解法
EnvACE 的解法由三个核心组件构成:双角色扮演、Role-Wise GRPO、Test-Time Scaling。
4.1 双角色扮演(Dual-Role Playing)
核心机制:给策略 $\pi_\theta$ 一个角色提示,让它知道自己当前是「行动者」还是「环境」。
类比:就像一个演员在排练一出双人戏——他先演 A 角色说台词(生成动作),然后切换到 B 角色回应(生成观察),再切回 A 角色继续。一个人演完整出戏。
具体地,在每个时间步 $t$:
| 步骤 | 角色 | 输入 | 输出 |
|---|---|---|---|
| 1 | Acting | 历史 $h_t$ + 「你是行动者」 | 工具调用 $a_t$(如 search("量子计算原理")) |
| 2 | Rehearsal | $h_t$ + $a_t$ + 「你是环境,请返回该调用的结果」 | 模拟观察 $\hat{o}_t$(如伪造的搜索结果文本) |
| 3 | 更新历史 | — | $h_{t+1} = h_t \oplus (a_t, \hat{o}_t)$,重复直到结束 |
关键设计:两个角色共享同一套参数 $\theta$。这不是两个网络,而是同一个网络通过不同的角色提示切换行为模式。消融实验证明,共享参数(36.7%)显著优于分离参数(35.5%),说明这种设计让「行动知识」和「世界知识」在参数层面相互增益,而非各自为政。
4.2 Role-Wise GRPO(按角色分组的策略优化)
现在要训练这个双角色策略。直接用标准 GRPO 会遇到一个问题:Acting 和 Rehearsal 两个角色的生成难度、奖励分布差异很大,如果混在一起算基线,优势估计会有很大噪声。
类比:就像高考要分文科、理科分别排名。把理科生的分数和文科生混在一起算平均分,会让理科高分看起来「没那么突出」——因为分母被难度不同的文科拉低了。正确的做法是分科排名。
Role-Wise GRPO 的做法:
- 对每个任务 $x$,采样 $G$ 条轨迹,每条轨迹包含多个 token,每个 token 属于某个角色 $r \in \{\text{Act}, \text{Rehearse}\}$。
- 对每个角色 $r$,单独计算该角色下所有 token 的平均奖励作为基线:
- 每个token的优势按其所属角色的基线计算:
其中 $r(i)$ 是 token $i$ 所属的角色。
效果:这样 Acting 角色的 token 只和 Acting 角色的轨迹比,Rehearsal 角色的 token 只和 Rehearsal 角色的轨迹比,优势估计更纯净、方差更小。两个角色被同一个任务奖励 $R$ 端到端联合优化——Acting 学会做更好的决策,Rehearsal 学会生成更准的环境响应,两者协同提升。
4.3 Test-Time Scaling(推理时排练验证)
训练完成后,EnvACE 内化出了一个世界模型。在真实部署时,这个世界模型可以用来做推理时扩展(Test-Time Scaling, TTS)——在真正把动作提交给真实环境执行之前,先在「脑内」排练一遍,验证动作是否靠谱。
论文提出两种 TTS 策略:
TTS-Parallel(并行排练):
- 对同一个任务,独立生成 $N$ 条 rehearsal 轨迹(每条都是 Acting + Rehearsal 自演)。
- 从 $N$ 条轨迹中选出最终奖励最高(或自评最优)的一条,再把这条轨迹的动作真正提交给真实环境执行。
- 类比:下棋时先在脑中推演 $N$ 种变化,选最好的一步真正落子。
- 效果:$N=2$ 时 Overall 从 36.7% 提升到 40.9%(+4.2pp)。
TTS-Sequential(顺序排练):
- 生成第 1 条 rehearsal 轨迹并自评。
- 生成第 2 条时,让模型看到第 1 条的结果和反馈(「上一条轨迹在第三步工具调用失败了」),据此改进。
- 后续轨迹都能观察到之前所有轨迹的反馈,逐步修正。
- 类比:棋手复盘上一盘的失误,下一盘避免重蹈覆辙。
4.4 训练数据从哪来?
一个关键问题:既然训练时不调用真实环境,那 Rehearsal 角色是怎么学会「生成逼真环境响应」的?
答案是:EnvACE 使用了离线收集的真实 Agent 交互轨迹作为训练数据来源。这些轨迹包含了「动作-真实观察」配对,但它们只在训练前收集一次。训练过程中,Rehearsal 角色通过模仿这些真实观察来学习世界动力学,而 RL 优化则通过 Role-Wise GRPO 在自生成的轨迹上进行。
这里的关键区分:
- 传统 Agentic RL:训练时每一轮都要调用真实环境。
- EnvACE:只在数据准备阶段调用一次真实环境收集种子数据,之后训练全程在模型内部自演。
这就把「按训练步数线性增长的环境成本」变成了「一次性的固定成本」。
全景组件对比
| 组件 | 输入 | 输出 | 作用 |
|---|---|---|---|
| Acting 角色 | 历史 + 任务 | 工具调用 $a_t$ | 决策:下一步做什么 |
| Rehearsal 角色 | 历史 + 动作 | 模拟观察 $\hat{o}_t$ | 预测:环境会怎么响应 |
| Role-Wise GRPO | 轨迹 + 角色标签 | 梯度更新 | 分角色估计优势,联合优化 |
| TTS-Parallel | 任务 + 并行数 $N$ | 最优轨迹 | 推理时多推演选最优 |
| TTS-Sequential | 历史 + 前序反馈 | 改进轨迹 | 推理时迭代修正 |
五、评估指标与实验证据
5.1 实验设置
- 基座模型:Qwen3-8B
- 训练资源:16 块 H20 GPU,训练 470 步
- 评估基准:
- BFCL-v4:通用函数调用基准,考察工具选择和参数填写准确性
- τ²-Bench(tau-squared-bench):多轮工具调用交互基准,考察长程对话中的策略一致性
- VitaBench:复杂真实世界任务基准,任务难度高
- FinMCP-Bench:金融领域 Agent 基准,考察垂直领域的工具调用能力
- 核心指标:任务成功率(Success Rate),越高越好
- Overall:BFCL-v4 + τ²-Bench + VitaBench 三个基准的综合得分
5.2 主实验结果
| 方法 | 模型规模 | BFCL-v4 | τ²-Bench | VitaBench | Overall |
|---|---|---|---|---|---|
| Qwen3-8B(基座) | 8B | 44.04% | 28.3% | 13.0% | 28.45% |
| EnvScaler | 8B | — | 32.9% | — | — |
| AWM | 8B | — | 31.2% | — | — |
| AWM | 14B | 45.80% | 35.0% | 16.0% | 32.54% |
| EnvACE(本文) | 8B | 46.04% | 36.7% | 16.0% | 32.91% |
关键观察:
- EnvACE 以 8B 参数超越了 14B 的 AWM,Overall 32.91% vs 32.54%——参数效率显著更高。
- 在 τ²-Bench 上,EnvACE(36.7%)比同规模的 AWM-8B(31.2%)高 +5.5pp,比 EnvScaler-8B(32.9%)高 +3.8pp。
- 在 VitaBench 上,EnvACE(16.0%)是 7B-8B 规模方法中的最高分。
- BFCL-v4 上,EnvACE(46.04%)比基座 Qwen3-8B(44.04%)提升 +2.00pp。
5.3 金融垂直领域:FinMCP-Bench
| 指标 | EnvACE | 说明 |
|---|---|---|
| TF1(Task-level F1) | 46.78% | 所有方法最高 |
| TP(Task Pass) | 54.04% | 任务通过率 |
这证明 EnvACE 内化的世界知识可以迁移到垂直领域——即使是在通用数据上训练得到的世界模型,在金融工具调用场景中也能帮助策略做出更好的决策。
5.4 Test-Time Scaling 效果
| TTS 策略 | N | Overall | 相对增益 |
|---|---|---|---|
| 不使用 TTS | — | 36.7% | 基线 |
| TTS-Parallel | N=2 | 40.9% | +4.2pp |
TTS-Parallel 在 $N=2$(只多排练一次)时就能带来 4.2 个百分点的提升。这证明训练阶段内化出的世界模型是有意义的——它能区分「好动作」和「坏动作」,否则多排练一条轨迹不会有任何收益。
5.5 跨模型规模的泛化
| 模型规模 | BFCL-v4 | τ²-Bench |
|---|---|---|
| Qwen3-1.7B + EnvACE | 较低 | 较低 |
| Qwen3-8B + EnvACE | +14.23pp | +21.4pp |
从 1.7B 扩展到 8B,BFCL-v4 提升 14.23pp,τ²-Bench 提升 21.4pp。这种显著的规模收益说明:EnvACE 的方法能从更大的基座模型中提取更多世界知识——模型越大,内化的世界动力学越精细,策略收益越大。
5.6 关键消融实验
| 设计选择 | τ²-Bench 得分 | 结论 |
|---|---|---|
| 共享参数(双角色同一网络) | 36.7% | 优于分离 |
| 分离参数(两个独立网络) | 35.5% | -1.2pp |
| 不使用 Role-Wise GRPO(标准 GRPO) | 下降 | 角色混合导致优势估计噪声大 |
共享参数 +1.2pp 看似不大,但意义重大:它证明「行动知识」和「世界知识」确实能在同一个参数空间中相互增益,而非相互干扰。这是 EnvACE「单网络双角色」设计的机制正当性证据。
5.7 指标如何证明核心论点
论文的核心主张是:不依赖外部环境交互的训练,也能训出更好的 Agent。上述实验从四个角度共同支撑了这一主张:
- 效果超越依赖环境的 baseline(主实验):如果「不用环境」是劣势,EnvACE 不可能超过 AWM-14B。事实是它用更小参数超越了——证明内化世界知识比真实环境交互更高效。
- 跨基准一致提升(BFCL/τ²-Bench/VitaBench/FinMCP):不是只在某类任务上侥幸有效,而是普遍有效。
- TTS 带来收益:内化的世界模型能在推理时提供有效的自我验证——如果学到的世界知识是假的,TTS 不可能提升效果。
- 规模收益:更大的模型能内化更精细的世界动力学——说明这是一种「可扩展」的能力,而非依赖某种 trick。
六、效果优势的根源解释
本节要回答一个尖锐的问题:为什么「在脑内自己演」比「在真实环境中练」效果反而更好? 这看似违反直觉——真实环境不是更准确吗?
我们从机制层面逐层剖析因果链。
6.1 baseline 的根本局限
先看传统 Agentic RL(真实环境交互派)为什么不是最优。
局限一:环境交互成本导致样本量不足。 RL 需要大量样本才能收敛。但真实环境调用又慢又贵,实际训练中每个任务能跑的轨迹数非常有限。样本不足 → 策略探索不充分 → 学到的策略次优。这是「成本」直接导致的「效果」损失。
局限二:环境不可复现导致方差爆炸。 同一个任务,今天环境返回这个结果,明天返回另一个。策略做同样的动作却得到不同的反馈——奖励方差极大。高方差会让 RL 的梯度估计噪声化,收敛缓慢甚至无法收敛。这是「不可复现」直接导致的「优化困难」。
局限三:环境黑盒导致信用分配困难。 真实环境不会告诉模型「第三步的工具调用错了」。最终任务失败时,梯度无法回传到具体的中间步骤。策略无法学到「哪一步该改进」——这是「不可微」直接导致的「信用分配失败」。
根本瓶颈:传统路线把策略学习和环境耦合在一起,环境的三个特性(慢、不可复现、不可微)直接变成了策略学习的三个瓶颈。
6.2 EnvACE 的根本性改变
EnvACE 不是「更好地使用环境」,而是改变了环境本身的性质——把真实环境替换成了模型自己生成的环境 $\hat{o}_t$。这个替换带来了信息流和优化路径的本质变化:
改变一:样本量从「受限于环境」到「受限于算力」。 模型生成 $\hat{o}_t$ 的成本远低于真实环境调用。同样算力下可以跑多得多的轨迹。样本充足 → 探索充分 → 策略更优。
改变二:环境从「不可复现」到「完全可控」。 同一个模型,给定相同的动作 $a_t$ 和相同的随机种子,生成的 $\hat{o}_t$ 完全一致。环境变成确定性的、可复现的。方差骤降 → RL 梯度估计更稳定 → 收敛更快更稳。
改变三:环境从「黑盒」到「白盒」。 $\hat{o}_t$ 是模型自己生成的 token 序列,它的每一步生成都可微。最终任务奖励可以通过 Role-Wise GRPO 回传到每一个中间 token——无论是 Acting 的动作 token 还是 Rehearsal 的观察 token。信用分配精确到每一步、每个 token。
改变四:策略和世界知识表征对齐。 两个角色共享参数 $\theta$,意味着「行动知识」和「世界知识」被编码在同一组参数中。Acting 学到的「什么动作有效」会直接丰富 Rehearsal 对「环境如何响应这个动作」的理解,反之亦然。这是消融实验中共享参数(36.7%)优于分离参数(35.5%)的根本原因——不是参数量的问题,而是两个知识源在同一表征空间中相互约束、相互增益。
6.3 完整因果链
方法差异:用模型自演的环境替代真实环境
↓
机制变化:环境变快(样本量↑)、变可控(方差↓)、变白盒(信用分配精确)
+ 行动知识与世界知识在同一参数空间对齐
↓
缓解瓶颈:突破「成本-样本」瓶颈、「不可复现-方差」瓶颈、「不可微-信用分配」瓶颈
↓
指标体现:8B 参数超越 14B(参数效率↑)、TTS 带来+4.2pp(世界知识有用)、
跨基准一致提升(不是 trick)
6.4 反事实推理:如果去掉关键设计会怎样?
- 去掉 Rehearsal 角色(退化为只用真实环境的标准 RL):样本量受限于环境成本,效果会退化到 baseline 水平。
- 去掉参数共享(双角色用独立网络):消融显示 τ²-Bench 从 36.7% 降到 35.5%(-1.2pp)。看似降幅不大,但考虑到训练只跑了 470 步,这个差距会随训练延长而放大。
- 去掉 Role-Wise GRPO(混用标准 GRPO):角色间奖励分布差异会让优势估计噪声化,两个角色互相干扰,训练难以收敛。
每个关键设计都有可验证的必要性——这证明效果不是凑巧,而是结构上必然。
6.5 关键澄清:$\hat{o}_t$ 不等于真实 $o_t$,为什么不崩?
一个自然的疑问:模型自己生成的 $\hat{o}_t$ 肯定有误差,用它训练策略,为什么不会学到错误的行为?
答案是:EnvACE 的训练目标是策略的任务奖励 $R$,而不是 $\hat{o}_t$ 与 $o_t$ 的严格匹配。 Rehearsal 角色生成 $\hat{o}_t$ 只是一个「中介」——它让轨迹能推进下去,最终还是要靠任务奖励 $R$ 来判断好坏。只要 $\hat{o}_t$ 的分布足够接近真实环境,策略学到的行为模式就能迁移。而 Role-Wise GRPO 在联合优化中,会自动把 Rehearsal 往「对策略学习最有利」的方向推——这不一定是「最逼真的环境模拟」,而是「最有教育价值的环境模拟」。这是 EnvACE 比「单独训练世界模型」高明的地方。
七、必要知识反推
假设找一个完全没有相关知识的人来做 EnvACE 这项工作,他至少必须掌握以下知识,并在关键节点上融合它们。
7.1 领域知识层
必须掌握:
Agent 的多轮交互机制:Agent 不是单轮问答,而是「动作→观察→动作→观察」的多轮循环。不理解这个循环,就无法理解为什么「环境」是训练瓶颈。
- 为什么必须:这是 EnvACE 要优化的对象本身。
工具调用的形式化:工具调用(如
search(query))本质上是一段结构化文本,观察结果也是文本。不理解这一点,就不会产生「动作和观察都是 token 序列,可以统一建模」的洞察。- 为什么必须:这是双角色共享参数的认知前提。
强化学习的基本框架:策略、奖励、轨迹、优势函数。不理解 RL,就无法理解 Role-Wise GRPO 在做什么。
- 为什么必须:这是 EnvACE 的优化引擎。
7.2 方法论知识层
必须掌握:
GRPO 算法:DeepSeek 提出的分组相对策略优化,用同一批样本的均值作为基线来估计优势。必须理解它的基线机制,才能发现「不同角色混用基线会引入噪声」这个问题。
- 为什么必须:Role-Wise GRPO 是对标准 GRPO 的改进,不理解原版就无从改进。
世界模型的理论:世界模型预测「动作的后果」,是 RL 中「model-based」路线的核心。必须知道「世界模型可以辅助策略学习」,才能想到「让策略自己内化世界模型」。
- 为什么必须:决定了方法的整个出发点。
自我对弈(Self-Play)思想:AlphaGo 的自我对弈让一个模型扮演双方。必须知道这个范式,才能迁移到「策略扮演 Agent 和环境」。
- 为什么必须:这是双角色设计的灵感来源。
已有 Agentic RL 工作(AWM、EnvScaler 等)的局限:必须知道现有方法的瓶颈在哪里,才能提出有针对性的改进。
- 为什么必须:决定了方法的定位和创新点。
7.3 工程知识层
必须掌握:
大规模 RL 训练工程:16 块 H20 GPU 上的分布式训练、显存管理、梯度同步。必须能稳定地跑通 RL 训练流程。
- 为什么必须:没有工程实现,方法只是纸上谈兵。
Agent 评测基准的设计:BFCL、τ²-Bench、VitaBench 分别考察什么能力,如何避免「刷分但不通用」。必须能设计出区分度强的实验。
- 为什么必须:实验的说服力取决于评测设计的质量。
7.4 知识融合的关键节点
EnvACE 的创造性不在于任何单一知识点,而在于三个节点的融合:
融合节点一:「Agent-环境对偶」+「自我对弈」
- 观察 Agent 任务中动作与观察的对偶结构,联想到自我对弈范式。
- 结果:诞生「双角色扮演」的核心机制。
融合节点二:「双角色」+「GRPO 基线机制」
- 理解 GRPO 的基线是按分组算的,发现不同角色应该分开算基线。
- 结果:诞生 Role-Wise GRPO,让两个角色纯净地联合优化。
融合节点三:「内化的世界模型」+「Test-Time Scaling」
- 训练好的世界模型不仅用于训练,还能在推理时做自我验证。
- 结果:诞生 TTS-Parallel / TTS-Sequential,把训练成果延伸到推理阶段。
这三个融合节点体现了「知识的化学反应」——不是简单叠加,而是在洞察层面产生新的方法。
八、论文中可以提取的通用性灵感
灵感 1:对偶角色自演——把外部依赖内化进同一个模型
核心思想:当一个系统的两个组件之间存在天然的对偶关系(如「策略↔环境」「提问↔回答」「生成↔判别」),与其用两个独立模型分别处理,不如让同一个模型通过角色切换同时扮演两方,让两种知识在同一参数空间中相互增益。
论文证据:EnvACE 让策略同时扮演 Acting 和 Rehearsal,共享参数(36.7%)优于分离参数(35.5%);8B 参数超过 14B 的 AWM——证明两种知识在同一空间中产生了「1+1>2」的效果。
推广场景:
- 生成-判别对偶:让一个模型同时学习「生成代码」和「审查代码」,生成知识提升审查能力,审查经验反哺生成质量。
- 提问-回答对偶:让检索增强系统同时学习「生成查询」和「判断文档相关性」,避免检索器与阅读器表征不对齐。
- 攻击-防御对偶(安全):让一个模型同时学习「生成攻击 payload」和「检测攻击」,在红蓝对抗中自我演化。
- 用户-系统对偶(推荐):让推荐模型同时学习「模拟用户偏好」和「生成推荐策略」,用内化的用户模型做离线策略验证。
灵感 2:分组建基线——异质任务的优势估计应分组比较
核心思想:当 RL 训练中存在多种「角色」或「任务类型」,且它们的奖励分布差异显著时,把所有样本混在一起算基线会引入系统性噪声。正确做法是按角色/类型分组计算基线,让每个样本只和「同类的样本」比较——优势估计更纯净,训练更稳定。
论文证据:Role-Wise GRPO 把 Acting 和 Rehearsal 的基线分开计算。消融显示去掉这一设计(用标准 GRPO)训练难以稳定——证明混合基线的噪声是实质性的。
推广场景:
- 多任务 RL:同时训练导航、抓取、交互等多个机器人技能时,按技能分组算基线,避免「难技能」的进步被「易技能」的高分稀释。
- 多模态 RL:文本、图像、代码生成的奖励量纲不同,应分模态算基线。
- 课程学习中的难度分层:简单题和难题的奖励分布不同,按难度分组算基线,让「在难题上的进步」不被「在简单题上的满分」掩盖。
- 多智能体训练:不同智能体的角色(进攻/防守/辅助)贡献不同,按角色分组算信用分配。
灵感 3:内化的世界模型可用于推理时自我验证(TTS 思想)
核心思想:如果一个模型在训练中内化了对环境/世界动力学的理解,那么在推理时,这份理解不仅能「生成」行动,还能**「验证」行动**——先在内部推演多条轨迹,选最优的再执行。这把「训练时学到的世界知识」延伸成了「推理时的免费算力红利」。
论文证据:EnvACE 的 TTS-Parallel 在 $N=2$ 时 Overall 提升 4.2pp。这个收益直接证明内化的世界模型是有意义的——它能区分好坏动作。
推广场景:
- 代码生成:模型在训练中学会了「代码执行的结果」(内化的解释器),推理时可以先在脑中「执行」多个候选程序,选出语法/逻辑正确的那个提交。
- 数学推理:模型内化了「证明的检查规则」,推理时可以先在脑中验证多条证明路径,选自洽的那条输出。
- 机器人规划:内化了物理动力学的机器人,可以先在脑中模拟多条运动轨迹,避碰撞的那条再执行。
- 对话系统:内化了「用户反应」的对话模型,可以先模拟「如果我说 X,用户会怎么回」,选择预期反馈最好的回复。
灵感 4:把按步增长的交互成本变成一次性固定成本
核心思想:当某个外部依赖(环境、API、专家标注)在训练循环中被反复调用、成本随训练步数线性增长时,考虑一次性收集种子数据,之后让模型自己模拟这个依赖,把「线性成本」转化为「一次性固定成本 + 模型自演的边际算力成本」。
论文证据:EnvACE 只在数据准备阶段调用真实环境,训练全程零环境交互。这使得 470 步训练能在 16 块 H20 上完成——如果用真实环境交互,成本会高几个数量级。
推广场景:
- 依赖人类专家标注的 RLHF:一次性收集一批专家反馈,训练一个「专家模拟器」,之后用模拟器做 RL——把「每步都要问专家」变成「一次问一批,之后自演」。
- 依赖昂贵仿真的机器人学习:先用高保真仿真器生成一批种子数据,训练一个「轻量环境模拟器」,之后在轻量模拟器里做大量低成本 RL。
- 依赖在线 A/B 测试的推荐系统:一次性收集用户反馈,训练用户模拟器,离线做策略优化,减少线上实验风险。
附录:EnvACE 方法全景图
EnvACE 训练与推理全景
┌─────────────────────────────────────────────────────────────┐
│ 数据准备阶段(一次性) │
│ 真实环境 → 收集种子轨迹 {(x, a_t, o_t)} → 训练数据 │
└────────────────────────────┬────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────────────────┐
│ 训练阶段(零真实环境交互) │
│ │
│ 任务 x ──┬──► Acting 角色 ──► a_t (动作) │
│ │ │
│ └──► Rehearsal 角色 ──► ô_t (模拟观察) │
│ │
│ h_{t+1} = h_t ⊕ (a_t, ô_t) → 推进到任务结束 │
│ │
│ Role-Wise GRPO: │
│ · 按角色分别算基线 μ_{x,Act}, μ_{x,Rehearse} │
│ · 优势 A = R - μ_{x,r} │
│ · 端到端联合优化共享参数 θ │
└────────────────────────────┬────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────────────────┐
│ 推理阶段(Test-Time Scaling) │
│ │
│ 方式 A(不排练):Acting 直接生成动作 → 提交真实环境 │
│ │
│ 方式 B(TTS-Parallel, N=2): │
│ 脑内独立排练 2 条轨迹 → 选最优 → 提交真实环境 │
│ Overall: 36.7% → 40.9% (+4.2pp) │
│ │
│ 方式 C(TTS-Sequential): │
│ 排练轨迹 1 → 反馈 → 排练轨迹 2(看前一条)→ ... → 提交 │
└─────────────────────────────────────────────────────────────┘
总结:EnvACE 最漂亮的洞察在于——Agent 任务中「动作」和「环境响应」都是 token 序列,本就该用同一个语言模型建模。把这个对偶关系显式化为双角色,用 Role-Wise GRPO 让两种知识在同一参数空间相互增益,再用内化的世界模型做推理时自我验证——这是一条从「问题本质」到「方法设计」到「工程红利」都自洽的完整链路。它不仅是一项 Agent 训练技术,更是「如何把外部依赖内化进模型」这一通用方法论的优秀示范。