Environment Evolution 精读:让训练环境的难度离线进化

腾讯混元×港科大(广州)的 Environment Evolution 把环境难度演化从 on-policy 共进化中解耦:从多轮学习目标推导三个演化方向,用多 Agent harness 离线逐代提升环境难度,再由谱系调度器持续供给学习信号。Qwen3.6-27B/35B-A3B 经简单长程 RL 在 Terminal-Bench 2.1 分别提升 14.4/18.0 个百分点。本文基于全文阅读拆解演化方向推导与调度器设计。

September 5, 2026 · 2 min

Terminal-Universe 精读:把 Agent 轨迹逆向成可复用的训练环境

Qwen 团队×清华的 Terminal-Universe 通过回放轨迹中的文件操作逆向恢复环境,把海量 Agent 轨迹转化为 37.3k 个可重查询、可验证的终端环境,并沿广度(跨代码库任务)与深度(多轮需求迭代)两轴扩展。Qwen3.5-27B 微调后 Terminal-Bench 2.1 +11.9、多轮 EvoCode-Bench +13.8。本文基于全文阅读拆解环境重建管线与数据飞轮设计。

September 5, 2026 · 2 min