Environment Evolution 精读:让训练环境的难度离线进化

论文:Environment Evolution for Terminal Agents(arXiv:2609.04128,cs.AI,2026-09-03) 作者:Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiang Zhou, Jiangtao Guan, Jincheng Liu, Yun Yang, Dingxin Hu, Zhuo Han, Xing Wu, Feng Zhang, Lilin Wang 等 机构:腾讯混元团队(Hunyuan Team, Tencent)× 香港科技大学(广州)


一、题目

  • 类型:环境工程方法论文(环境合成 + 训练调度)。
  • 发表单位:腾讯混元团队与港科大(广州)联合——企业提供 RL 基础设施与评测环境,第一作者为港科大(广州)背景(zhiyuan.fan@connect.ust.hk),通讯为腾讯研究员。
  • 一句话概括:共进化方法让环境跟着模型弱点长,但依赖 on-policy rollout——模型一强信号就枯竭;本文改为离线地把环境逐代变难、排好"课程表",让 RL 训练全程都有可学习边缘的环境可用的环境可用。

二、背景

研究脉络

  1. Agentic RL 的瓶颈转移:算法(异步基础设施、工业级 PPO/GRPO 变体)成熟后,可验证环境的数量与难度成为 scaling 的新瓶颈。
  2. 三代环境范式:
    • 一代:人工管线从 GitHub/网页等静态资源一次性合成——模型变强后立即失效;
    • 二代:co-evolution(如 RAGO/自博弈类)——环境按模型 rollout 暴露的弱点迭代,但学习信号与当前策略耦合:模型强了、弱点暴露少了、环境进化就停了;且 on-policy 环境的泛化性存疑;
    • 三代(本文):离线环境进化——难度演化不依赖当前模型,环境谱系像课程一样预先准备好、逐代调度。
  3. 课程学习的老问题新场景:何时给多难的任务,是 curriculum learning 的经典问题;本文把它搬到"环境合成 + Agent RL"的语境,并用调度器工程化。

本文要解决的矛盾

共进化的信号供给是"被动反应式"的(等模型暴露弱点),供给速率随模型增强而衰减;训练需要的是"主动供给式"的持续难度爬坡。

三、定位

维度定位
问题类型环境难度供给(合成 × 调度)
与 Terminal-Universe 的关系互补:后者解决环境"从哪来"(轨迹重建),本文解决难度"怎么跟上模型"(演化+调度)
演化载体多 Agent harness 驱动的循环工程(Loop 1 计划细化 / Loop 2 环境细化)
评测Terminal-Bench 2.1 + Qwen3.6-27B/35B-A3B 的 RL 增益
目标会议口径ICLR/NeurIPS Agent track

四、问题定义

目标:给定种子环境集与一个正在变强的 Agent 策略,持续提供"略高于当前能力"的可验证环境流,使 RL 全程保有学习信号。

三个演化方向(从多轮学习的目标函数推导):论文将环境难度分解为三个可控维度——交互步数/轮次深度、工具组合复杂度、验证条件严格度——每个方向都对应学习目标中的一项损失来源,因此"往这些方向演化"是有理论动机的,而非随机加难。

五、解法

5.1 序列引导的环境进化(Sequence-Guided Environment Evolution)

两个循环:

  • Loop 1 计划细化:分析当前环境序列的失败模式,生成"下一个环境应该难在哪"的演化计划;
  • Loop 2 环境细化:多 Agent harness 按计划实际改造环境(加深轮次、增加工具耦合、收紧验证),产出新一代环境。

进化努力(evolution effort)可配置——用多少算力换多少难度提升有明确的量化曲线。

5.2 Evolution-Lineage Scheduler(谱系调度器)

  • 环境不是一次性合成完,而是逐代产出(Gen0 → Gen1 → Gen2…),同一任务在谱系上越来越难;
  • 调度器在 RL 训练过程中按代际推进环境供给——训练早期用 Gen0,模型变强后逐步切换到高代环境;
  • 与 agent-environment co-evolution 对照:这里环境演化是 off-policy 的,不需要等当前模型 rollout。

六、实验结果

6.1 主结果

模型训练方式Terminal-Bench 2.1 提升
Qwen3.6-27B简单长程 RL+14.4
Qwen3.6-35B-A3B简单长程 RL+18.0

强调"简单":RL 算法没有任何花活,增益全部来自环境供给方式——这是干净归因的关键设计。

6.2 环境难度的外部验证

用三个前沿模型(Hy4 preview、Claude Opus 5、GPT-5.6 Sol)做定量 rollout:环境进化一致性地产出更难的环境(前沿模型的通过率显著下降),证明"变难"不是对特定学生模型的过拟合,而是真实的难度提升。

6.3 对照与消融

  • vs environment ensemble(不同环境混合):谱系调度更有序,学习曲线更稳;
  • vs agent-environment co-evolution:off-policy 进化在模型变强后仍能持续供给信号,co-evolution 则衰减;
  • 演化方向消融:三个方向各自贡献可分离;轮次深度方向的收益最大;
  • 训练动态:RL 轮次与 token 消耗在调度器下的分配效率优于均匀供给。

七、知识反推

  1. 环境供给应该"课程化"而非"应答式":共进化是应答式(模型暴露弱点→环境反应),谱系进化是课程式(预先排好难度爬坡)。课程式的信号供给速率与模型能力解耦,天然可持续。
  2. 难度应该是可设计维度而非单一标量:把难度分解为轮次/工具耦合/验证严格度三个正交方向,使得"加难"变成有针对性的工程操作,也使消融归因成为可能。
  3. 外部模型验证环境难度是必要步骤:只用学生模型验证会陷入"对特定模型过拟合的难"——用多个前沿模型 rollout 验证难度真实性,这个流程应成为环境工程的标准环节。
  4. “改环境不改算法"的增益上限可观:+14.4/+18.0 全部来自供给侧。对算力有限的团队,环境工程是比算法调优性价比更高的投入方向。

八、通用灵感

  • 对 Agent RL 训练团队:把环境合成预算从"一次性大规模"转向"谱系化持续供给”;调度器的代际切换点可以用训练指标(如当前代环境的通过率)自动控制。
  • 对评测基准设计:环境谱系本身就能构成动态 benchmark(同任务多难度层级),比静态榜单更能区分模型的真实能力梯度。
  • 与 Terminal-Universe 组合的工程蓝图:轨迹重建解决冷启动(环境从哪来),离线进化解决续供(难度怎么长),两者拼起来是一个完整的环境工程流水线——这是本轮"环境工程"研究潮最实用的合流点。
  • 对课程学习理论:本文提供了课程学习在 LLM Agent RL 语境下的新实例,“off-policy 课程 + on-policy 学习"的分解值得在理论层面形式化。