<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>环境工程 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E7%8E%AF%E5%A2%83%E5%B7%A5%E7%A8%8B/</link><description>Recent content in 环境工程 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 05 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E7%8E%AF%E5%A2%83%E5%B7%A5%E7%A8%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>Environment Evolution 精读：让训练环境的难度离线进化</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-05-environment-evolution-paper-reading/</link><pubDate>Sat, 05 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-05-environment-evolution-paper-reading/</guid><description>腾讯混元×港科大（广州）的 Environment Evolution 把环境难度演化从 on-policy 共进化中解耦：从多轮学习目标推导三个演化方向，用多 Agent harness 离线逐代提升环境难度，再由谱系调度器持续供给学习信号。Qwen3.6-27B/35B-A3B 经简单长程 RL 在 Terminal-Bench 2.1 分别提升 14.4/18.0 个百分点。本文基于全文阅读拆解演化方向推导与调度器设计。</description></item><item><title>Terminal-Universe 精读：把 Agent 轨迹逆向成可复用的训练环境</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-05-terminal-universe-paper-reading/</link><pubDate>Sat, 05 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-05-terminal-universe-paper-reading/</guid><description>Qwen 团队×清华的 Terminal-Universe 通过回放轨迹中的文件操作逆向恢复环境，把海量 Agent 轨迹转化为 37.3k 个可重查询、可验证的终端环境，并沿广度（跨代码库任务）与深度（多轮需求迭代）两轴扩展。Qwen3.5-27B 微调后 Terminal-Bench 2.1 +11.9、多轮 EvoCode-Bench +13.8。本文基于全文阅读拆解环境重建管线与数据飞轮设计。</description></item></channel></rss>