Skill2Env × QwenGyre × AgentPerfBench:智能体强化学习的数据、系统与推理三层基建 精读
同日挂出的三篇 arXiv 论文恰好拼出 Agent 强化学习的三层基础设施:数据层(AllSpark 的 Skill2Env 把「环境合成」从扩展覆盖升级为能力参数化——100 个带控制旋钮的难度模式+基于 solver 执行证据的迭代加难,1.5K 轨迹 SFT 换 7 基准 +8.4pt);系统层(阿里 Token Hub 牵头的 QwenGyre 用 cell 级弹性调度+轨迹树处理让 2.4T 旗舰模型的百万 token rollout 在线 RL 提速 1.78×,pass rate 52.48%→58.54%);推理层(帝国理工+剑桥+牛津的 AgentPerfBench 用 22 个负载画像+饱和扫描+NCU roofline 证明 chat→coding 的 TTFT 差 4.8×、操作强度差 46×,agentic 负载在并发爬升时吞吐崩塌 43–76% 而 chat 仍在扩张)。本文按九部分结构合并精读,并给出「Agent RL 全栈工程」的公共图景。