Environment Evolution 精读:让训练环境的难度离线进化
论文:Environment Evolution for Terminal Agents(arXiv:2609.04128,cs.AI,2026-09-03) 作者:Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiang Zhou, Jiangtao Guan, Jincheng Liu, Yun Yang, Dingxin Hu, Zhuo Han, Xing Wu, Feng Zhang, Lilin Wang 等 机构:腾讯混元团队(Hunyuan Team, Tencent)× 香港科技大学(广州)
一、题目
- 类型:环境工程方法论文(环境合成 + 训练调度)。
- 发表单位:腾讯混元团队与港科大(广州)联合——企业提供 RL 基础设施与评测环境,第一作者为港科大(广州)背景(zhiyuan.fan@connect.ust.hk),通讯为腾讯研究员。
- 一句话概括:共进化方法让环境跟着模型弱点长,但依赖 on-policy rollout——模型一强信号就枯竭;本文改为离线地把环境逐代变难、排好"课程表",让 RL 训练全程都有可学习边缘的环境可用的环境可用。
二、背景
研究脉络
- Agentic RL 的瓶颈转移:算法(异步基础设施、工业级 PPO/GRPO 变体)成熟后,可验证环境的数量与难度成为 scaling 的新瓶颈。
- 三代环境范式:
- 一代:人工管线从 GitHub/网页等静态资源一次性合成——模型变强后立即失效;
- 二代:co-evolution(如 RAGO/自博弈类)——环境按模型 rollout 暴露的弱点迭代,但学习信号与当前策略耦合:模型强了、弱点暴露少了、环境进化就停了;且 on-policy 环境的泛化性存疑;
- 三代(本文):离线环境进化——难度演化不依赖当前模型,环境谱系像课程一样预先准备好、逐代调度。
- 课程学习的老问题新场景:何时给多难的任务,是 curriculum learning 的经典问题;本文把它搬到"环境合成 + Agent RL"的语境,并用调度器工程化。
本文要解决的矛盾
共进化的信号供给是"被动反应式"的(等模型暴露弱点),供给速率随模型增强而衰减;训练需要的是"主动供给式"的持续难度爬坡。
三、定位
| 维度 | 定位 |
|---|---|
| 问题类型 | 环境难度供给(合成 × 调度) |
| 与 Terminal-Universe 的关系 | 互补:后者解决环境"从哪来"(轨迹重建),本文解决难度"怎么跟上模型"(演化+调度) |
| 演化载体 | 多 Agent harness 驱动的循环工程(Loop 1 计划细化 / Loop 2 环境细化) |
| 评测 | Terminal-Bench 2.1 + Qwen3.6-27B/35B-A3B 的 RL 增益 |
| 目标会议口径 | ICLR/NeurIPS Agent track |
四、问题定义
目标:给定种子环境集与一个正在变强的 Agent 策略,持续提供"略高于当前能力"的可验证环境流,使 RL 全程保有学习信号。
三个演化方向(从多轮学习的目标函数推导):论文将环境难度分解为三个可控维度——交互步数/轮次深度、工具组合复杂度、验证条件严格度——每个方向都对应学习目标中的一项损失来源,因此"往这些方向演化"是有理论动机的,而非随机加难。
五、解法
5.1 序列引导的环境进化(Sequence-Guided Environment Evolution)
两个循环:
- Loop 1 计划细化:分析当前环境序列的失败模式,生成"下一个环境应该难在哪"的演化计划;
- Loop 2 环境细化:多 Agent harness 按计划实际改造环境(加深轮次、增加工具耦合、收紧验证),产出新一代环境。
进化努力(evolution effort)可配置——用多少算力换多少难度提升有明确的量化曲线。
5.2 Evolution-Lineage Scheduler(谱系调度器)
- 环境不是一次性合成完,而是逐代产出(Gen0 → Gen1 → Gen2…),同一任务在谱系上越来越难;
- 调度器在 RL 训练过程中按代际推进环境供给——训练早期用 Gen0,模型变强后逐步切换到高代环境;
- 与 agent-environment co-evolution 对照:这里环境演化是 off-policy 的,不需要等当前模型 rollout。
六、实验结果
6.1 主结果
| 模型 | 训练方式 | Terminal-Bench 2.1 提升 |
|---|---|---|
| Qwen3.6-27B | 简单长程 RL | +14.4 |
| Qwen3.6-35B-A3B | 简单长程 RL | +18.0 |
强调"简单":RL 算法没有任何花活,增益全部来自环境供给方式——这是干净归因的关键设计。
6.2 环境难度的外部验证
用三个前沿模型(Hy4 preview、Claude Opus 5、GPT-5.6 Sol)做定量 rollout:环境进化一致性地产出更难的环境(前沿模型的通过率显著下降),证明"变难"不是对特定学生模型的过拟合,而是真实的难度提升。
6.3 对照与消融
- vs environment ensemble(不同环境混合):谱系调度更有序,学习曲线更稳;
- vs agent-environment co-evolution:off-policy 进化在模型变强后仍能持续供给信号,co-evolution 则衰减;
- 演化方向消融:三个方向各自贡献可分离;轮次深度方向的收益最大;
- 训练动态:RL 轮次与 token 消耗在调度器下的分配效率优于均匀供给。
七、知识反推
- 环境供给应该"课程化"而非"应答式":共进化是应答式(模型暴露弱点→环境反应),谱系进化是课程式(预先排好难度爬坡)。课程式的信号供给速率与模型能力解耦,天然可持续。
- 难度应该是可设计维度而非单一标量:把难度分解为轮次/工具耦合/验证严格度三个正交方向,使得"加难"变成有针对性的工程操作,也使消融归因成为可能。
- 外部模型验证环境难度是必要步骤:只用学生模型验证会陷入"对特定模型过拟合的难"——用多个前沿模型 rollout 验证难度真实性,这个流程应成为环境工程的标准环节。
- “改环境不改算法"的增益上限可观:+14.4/+18.0 全部来自供给侧。对算力有限的团队,环境工程是比算法调优性价比更高的投入方向。
八、通用灵感
- 对 Agent RL 训练团队:把环境合成预算从"一次性大规模"转向"谱系化持续供给”;调度器的代际切换点可以用训练指标(如当前代环境的通过率)自动控制。
- 对评测基准设计:环境谱系本身就能构成动态 benchmark(同任务多难度层级),比静态榜单更能区分模型的真实能力梯度。
- 与 Terminal-Universe 组合的工程蓝图:轨迹重建解决冷启动(环境从哪来),离线进化解决续供(难度怎么长),两者拼起来是一个完整的环境工程流水线——这是本轮"环境工程"研究潮最实用的合流点。
- 对课程学习理论:本文提供了课程学习在 LLM Agent RL 语境下的新实例,“off-policy 课程 + on-policy 学习"的分解值得在理论层面形式化。