Environment Evolution 精读:让训练环境的难度离线进化
腾讯混元×港科大(广州)的 Environment Evolution 把环境难度演化从 on-policy 共进化中解耦:从多轮学习目标推导三个演化方向,用多 Agent harness 离线逐代提升环境难度,再由谱系调度器持续供给学习信号。Qwen3.6-27B/35B-A3B 经简单长程 RL 在 Terminal-Bench 2.1 分别提升 14.4/18.0 个百分点。本文基于全文阅读拆解演化方向推导与调度器设计。