Terminal-Universe 精读:把 Agent 轨迹逆向成可复用的训练环境
论文:Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments(arXiv:2609.04148,cs.AI,2026-09-03) 作者:Jie Wu, Zhenru Zhang, Beichen Zhang, Xuwu Wang, Yuhui Su, Mouxiang Chen, Peng Wang, Zhihai Wang, Que Shen, Hao Zhou, An Yang, Fei Huang, Yujiu Yang, Dayiheng Liu 等 机构:Qwen Team(阿里巴巴)× 清华大学
一、题目
- 类型:环境合成框架 + 数据管线 + 实证验证的系统论文。
- 发表单位:Qwen 团队(阿里巴巴通义实验室)与清华大学的产学研合作,Qwen 供给数据、教师模型(Qwen3.7-Max)与算力,清华参与方法设计与验证。作者含 Dayiheng Liu(Qwen 对话模型负责人)等。
- 一句话概括:与其费劲从零合成环境,不如把已有 Agent 轨迹里记录的文件操作"倒放"来恢复环境——每条轨迹都能变成一个可反复出题、可执行验证的环境资产。
二、背景
研究脉络
- Agent RL 的瓶颈转移:算法与基础设施稳定后,可验证环境成为规模化训练的稀缺资源——环境数量与质量直接决定学习信号的供给。
- 既有环境合成路线:从 GitHub 仓库/网页/技能库人工设计管线生成任务(如 SWE-Gym、Terminal-Bench 类)——管线长、成本高、分布偏移风险大;co-evolution 类方法(让环境跟着模型弱点长)又依赖 on-policy rollout。
- 被浪费的资产:公开 Agent 轨迹数据集规模巨大(每个都有数十轮工具调用记录),但每条轨迹只是一次冻结的演示——用过即弃。
关键洞察
轨迹中的工具执行历史暴露了它所在环境的结构与内容:每次 cat、grep、文件编辑都在泄露环境的文件树与依赖关系。既然 Agent 能在环境里走一遍,就能把环境从足迹里重建出来。
三、定位
| 维度 | 定位 |
|---|---|
| 问题类型 | 环境资产化(数据飞轮):轨迹 → 环境 → 新任务 → 新轨迹 |
| 与从零合成的区别 | 真实性来自"曾经真实运行过"的环境,天然贴近工程分布 |
| 与 co-evolution 的区别 | 完全 off-policy:环境重建与当前模型能力无关,无需 rollout 反馈 |
| 评测面 | 单轮(Terminal-Bench 2.0/2.1)与多轮(EvoCode-Bench v2)双验证 |
| 目标会议口径 | ICLR/NeurIPS Agent track;亦具 EMNLP 资源论文属性 |
四、问题定义
输入:一条公开的终端 Agent 轨迹(含系统 prompt、每轮的命令与输出、文件操作记录)。 输出:(1) 可执行的环境工作区;(2) 原始任务的重构版本;(3) 广度/深度扩展出的新任务集(每个带验证器)。
环境 vs 轨迹的本质差异(论文反复强调):轨迹是"一个问题的一个解";环境是"一个可反复出题的世界"——它能生成任意多个可验证任务,并提供执行反馈用于 RL。
五、解法
5.1 环境重建(Environment Reconstruction)
- 回放文件操作:按时间序"倒放"轨迹中记录的文件修改,恢复 Agent 动手前的每个文件状态,得到部分工作区(轨迹未触碰的文件仍缺失);
- 补全 Agent(Completion Agent):推断并补齐缺失的文件与依赖(配置、测试夹具等),使环境可执行。
5.2 重查询(Re-querying)
在恢复的环境上生成四类新任务:
- 原始意图重构:还原轨迹本来要解决的任务;
- 单工作区新任务(Single-WS):同一环境里的新需求;
- 跨工作区任务(Cross-WS):挖掘环境间的依赖方向关系,合成需要同时读改两个代码库的任务——对应真实开发的跨库协作;
- 多轮任务(Multi-Round):用户 Agent 模拟真实需求迭代,把单轮任务扩展为多轮反馈会话。
5.3 验证与过滤
每个任务配一个 Agent 撰写的验证器(可执行断言),教师 rollout 未通过验证的轨迹一律丢弃。配套 13-gram 污染检查,剔除与 Terminal-Bench 重叠的源数据,保证评测干净。
六、实验结果
6.1 规模
从公开轨迹产出 37.3k 个任务充分环境;SFT 语料 32.0k 条(验证器过滤后的 Single-WS + Cross-WS + Multi-Round 轨迹混合)。
6.2 主结果
Qwen3.5-27B 在 Full Mixture 上 SFT 后:
| 评测 | 提升 |
|---|---|
| Terminal-Bench 2.1(Terminus2-XML) | 58.1%(+11.9) |
| Terminal-Bench 2.0(Terminus2-XML) | +11.2 |
| Terminal-Bench 2.1(Claude Code harness) | 58.2%(+10.4) |
| EvoCode-Bench v2 MT@4(多轮) | +13.8 |
6.3 关键消融
- 难度证据:Cross-WS 任务的教师 pass@1 从 72.3%(Single-WS)降到 49.2%,轨迹长度 1.5×——跨库任务真实地更难,而模型仍从中获益;
- 重求解最关键:re-solving(在重建环境中重做原任务)信号显著优于纯新任务合成;
- 验证器过滤必要:无过滤语料引入噪声后增益缩水;
- 跨域泛化:在非源域环境上训练仍保持增益,说明环境多样性本身有迁移价值。
七、知识反推
- 环境是比轨迹高一个数量级的数据资产:一条轨迹只能 SFT 一次,其环境可以出任意多道验证过的题。数据飞轮的正确单位是环境而非演示——这会改变团队对"数据资产"的记账方式。
- 真实性不可伪造但可恢复:从零合成环境的分布偏移问题,被"从真实足迹重建"绕开。历史行为的副产品(日志、操作记录、diff)是尚未被充分挖掘的真实性来源。
- 任务难度可以由结构设计出来:跨库(广度)与多轮迭代(深度)两轴不靠更强的教师就能把任务难度抬上去(pass@1 72.3%→49.2%),这比"堆更难的题面"更可控。
- off-policy 环境供给与 on-policy 共进化互补:与同日腾讯 Environment Evolution 论文对照——前者解决"环境从哪来"(供给端),后者解决"难度怎么跟上模型"(调度端),两者组合即是完整的环境工程栈。
八、通用灵感
- 对 Agent 训练团队:立即开始积累并结构化存储轨迹的完整工具执行记录(而不只存对话)——今天的轨迹就是明天的环境重建原料。
- 对自主代码评审系统:评审 Agent 的历史会话同样可以逆向出"被评审过的代码环境",从中合成"带已知缺陷的评审任务",为评审器提供可验证的训练/评测分布。
- 对数据工程:验证器即数据质量闸门的设计模式(生成→验证→过滤)在环境合成、SFT 语料、评测集构造中通用;“验证器本身也是 Agent 生成的"这一步值得后续研究其错误率传播。
- 对产学研分工的启示:Qwen 供给数据与教师、清华供给方法验证的组合再次出现(同日 CORE 论文亦然)——环境工程这类重数据重算力方向,高校的可行站位是协议设计与评测科学。