论文链接:arxiv.org/abs/2608.20634 发表时间:2026年8月21日(arXiv v1) 机构:Meridian Intelligence Global Inc. × University of Massachusetts Amherst(企业 + 高校合作) 领域:cs.CL / cs.AI(环境合成、Agent 训练、强化学习)
一、论文背景
1.1 Agent 的环境从哪里来
Agent 的能力来自与环境的交互,这一点已是共识。但一个更根本的问题常年被绕过:环境本身从哪里来?
当前的答案主要有两种。第一种是人工构建:ALFWorld、WebArena、OSWorld、TheAgentCompany 这类环境,由研究者手工定义实体、工具、状态和转移逻辑,为一个特定领域服务。质量高,但成本极高——构建一个 WebArena 级别的环境需要数月工程量,而且一旦建成,世界就冻结了。第二种是围绕任务的合成:给定任务描述、用户指令或评测规范,让模型生成一个能跑通这个任务的环境。这条路看起来自动化了,但它有个隐蔽的副作用——环境的存在是为了让某个任务可执行、可测量,而不是为了忠实表示一个更宽的场景。任务数量增加,底层世界的多样性未必增加。
论文把这种范式称为任务中心(task-centric),并指出其根本缺陷:真实工作流中的任务不是孤立目标,而是从一个持续演化的世界里自然涌现的——用户有意图、系统有持久状态、服务之间有依赖、动作会跨系统传播。先有任务再造世界,等于把因果关系倒过来了。
1.2 业务场景为什么最难
在所有环境类型里,企业业务工作流是对这种“世界先于任务”特性要求最苛刻的一类。一个客服任务可能牵扯 CRM 查记录、邮件通知、工单系统建单、日历排期;上游一个业务事件发生,下游系统里应当存在对应记录——这是跨服务不变量。这些约束不属于任何一个任务,而属于世界本身的规则。任务中心的合成范式天然无法表达这种结构:它只会为“发一封邮件”造一个邮箱,而不会为“整个公司如何运转”造一个世界。
这就是 AgentMercury 的出发点:不再问“这个任务需要什么环境”,而是问“这个业务场景对应一个什么样的世界”——先把世界造出来,再让任务从世界里长出来。
二、论文定位和关联工作
2.1 三角色框架:把“造世界”拉进学习回路
论文用一个清晰的概念框架给自己的工作定位。一个完整的 Agent 系统包含三个角色:
- PLANET:决定什么世界存在——实体、服务、工具、状态、转移结构;
- 策略 π:决定 Agent 在世界里做什么;
- 世界模型 W:预测世界如何响应动作。
近年研究在策略学习(RL、agentic RL)和世界建模(如 Qwen-AgentWorld)上都进展迅速,但 PLANET 这个角色几乎始终是学习回路之外的“预制工件”。AgentMercury 的核心主张是:PLANET 应当成为一等公民,而且本身可以被学习。
2.2 环境合成工作的两条谱系
沿着这个视角,现有环境合成工作可以分为两条谱系:
| 谱系 | 代表工作 | 输入 | 输出 | 验证方式 | 构造过程可学习 |
|---|---|---|---|---|---|
| 任务中心合成 | EnvScaler、EnvFactory、AgentBench 类 | 任务描述 / 评测规范 | 支撑该任务的环境实例 | 任务级通过率 | 通常不可(环境是数据,不是能力) |
| 世界中心合成 | agent-world(AWM)、Agent World Model、Qwen-AgentWorld、Terminal-World、PhoneWorld | 场景 / 技能 / 真实交互数据 | 可复用的持久世界 | 各异,多为模型辅助判定 | 部分尝试(世界模型方向) |
| AgentMercury(本文) | — | 高层业务场景简报 | 带跨服务不变量的可执行世界 | 12 项结构验证器 + 确定性 SQL 断言 | 是:构造轨迹可直接微调模型 |
与最接近的 agent-world(AWM)和 Agent World Model 相比,AgentMercury 的差异化在于两点:其一,验证的确定性——世界级不变量被渲染成可执行的 SQL 检查而非模型判定,使奖励信号可复现、可回放;其二,它不仅造环境,还公开了完整构造轨迹并证明这些轨迹足以教会一个模型从零创作新世界。相比 AppWorld、τ-bench、MCPMark 这类固定基准环境,AgentMercury 的 4,783 个环境在规模与多服务深度上同时占优,且全部可验证。
三、问题定义
论文把问题抽象为一句很凝练的话:环境合成是一种可学习的技能。
形式化地,给定一份高层业务场景描述 σ(比如“一家巴西的制造业公司,有销售、客服、仓储三条线”),要求生成一个可执行世界:
$$w = \langle S, A, \Omega, T, O, s_0, R \rangle$$其中 S 是状态空间、A 是动作空间、Ω 是观察空间、T 是可执行转移函数、O 是观察函数、s₀ 是种子初始状态,而 R 是世界级不变量集合——世界要求成立但不自己在转移时强制执行的属性,每条不变量关联一个可执行验证条件。
这个定义的约束相当严格:生成的世界必须包含自洽的服务(CRM、邮件、Slack、计费、工单等)、状态 schema(数据库表结构)、工具(每个资源四种操作:search / list / get / update)以及跨服务不变量(如“上游业务事件发生后,下游记录必须存在”——但环境不会替 Agent 自动创建该记录,留待事后检查)。通过了 12 项结构验证器的世界才算合格:语法上看着像不算数,必须真的能跑。
用一个类比来理解:传统任务中心合成像是“为考题印一张答题卡”,而 AgentMercury 要做的是“培养一个出题人”——给他一份考试大纲(业务简报),他要能独立命出一整张结构严谨、答案可判的试卷(可执行世界)。
四、问题解法
4.1 总体管线:世界、任务、策略、评分四方分离
AgentMercury 的核心流程可以写成一串符号:
$$\sigma \xrightarrow{\text{PLANET}} w \xrightarrow{\text{TASK}} (u, \rho) \xrightarrow{\pi} \tau \xrightarrow{\text{GRADE}} r$$一份业务简报 σ 经 PLANET 变成世界 w;任务生成器从世界中实例化出用户指令 u 和评分规约 ρ;策略 π 在世界里交互产生轨迹 τ;评分器按 ρ 和隐藏不变量打分得奖励 r。
这套设计里最值得称道的是世界与任务的分离——就像游戏引擎与关卡的关系:引擎(世界)定义物理规则和可用操作,关卡(任务)只是在这个引擎上的一次状态播种。同一个世界可以派生无数任务(每环境 10 个任务种子),同一个任务目标也不会被误编码进世界规则。论文特别强调,任务规约 ρ 与世界规则 R 分离,“防止任务目标与世界本身的规则混淆”——这是整个框架能扩展的基石。
4.2 PLANET:结构化的世界构造
PLANET 不是一次性生成整个世界,而是把构造过程因子化为五步链式生成:
$$\text{PLANET}(w|\sigma) = p(C|\sigma)\, p(G|C)\, p(\Sigma|G,C)\, p(s_0|\Sigma)\, p(R|G,\Sigma,s_0)$$依次生成:公司身份 C(行业、国家、匿名化命名)→ 服务图 G(这个公司用哪些系统)→ 状态 schema Σ(数据库表)→ 种子初始状态 s₀ → 世界不变量 R。每一步的输出作为下一步的条件,失败的中间产物可以定位到具体环节修复。
不变量 R 还区分可见视图与隐藏视图:可见视图以世界内文档、政策等形式存在,需要 Agent 在交互中自己发现(比如翻公司的报销制度文档才知道跨部门审批要求);隐藏视图是可执行验证条件,只在评分时使用。同一个规则,一面是给玩家的谜题,一面是给判卷人的答案。
4.3 可执行交互与确定性评分
Agent 通过 MCP 工具调用与世界交互,每回合最多 20 轮工具调用。因为转移函数由环境真实执行(而非学习模型预测)、初始状态有种子,任意轨迹都可以确定性回放和重新评分——论文称之为“黄金推理轨迹”。评分基于最终数据库状态的程序化断言(记录存在性、字段相等、字段不等三类),辅以行为惩罚项(防退化、防复读、防答后继续)。奖励聚合用比例制,LLM 裁判(DeepSeek-V4-Flash,温度 0)仅用于少量对话式评估。
4.4 构造轨迹:让“出题人”可被训练
这是论文最亮的一步。AgentMercury 公开每个世界从简报到成品的完整构造轨迹——实体怎么定、服务图怎么长、schema 怎么建、不变量怎么写、验证器报错后怎么修。作者用这些轨迹构造了 29,823 条训练样本,覆盖四类互补监督:
- 简报到世界:从高层简报生成完整世界;
- 中间阶段补全:给半成品环境,补全缺失组件;
- 验证器引导的损坏修复:给一个违规环境加验证器报错,要求修复;
- 意图到差分:给一个改动意图,预测对现有环境的结构修改。
这组设计让模型不仅学会“正向出题”,还学会“改错题”——第 4.4 节的实验会证明这种监督的效果惊人。
4.5 RL 训练配置
策略训练用 GRPO(含 Dr. GRPO 的非对称裁剪 0.2/0.28),每 prompt 采样 8 条、全局 batch 128、学习率 1e-6 恒定、Adam(β₁=0.9,β₂=0.98),零标准差奖励组直接过滤。训练在 8 卡单节点上全异步执行(2 卡 actor、6 卡 rollout),环境本地进程内运行避免网络开销。训练语料是 43,300 个任务实例(来自 4,326 个公司环境、每环境 10 个种子),覆盖 2,287 种行业描述、842 个工具、222 类状态表、148 种服务组合;每环境平均暴露 16.1 个工具,每任务平均触及 2.9 个服务、携带 5.4 条断言。为验证环境不绑定特定 RL 算法,35B 规模还跑了单 rollout 的 SAO 作为对照。
五、评估指标与实验证据
5.1 域内:EnterpriseOps-Gym 八域全测
EnterpriseOps-Gym 覆盖 Teams、CSM、Email、ITSM、Calendar、HR、Drive、Hybrid 八个企业域,用 oracle 判定(所有任务级验证器全部通过才算成功):
| 模型 | Teams | CSM | ITSM | Calendar | HR | Drive | Hybrid | 平均 | |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5-4B | 20.8 | 9.2 | 23.9 | 6.8 | 10.4 | 9.5 | 6.2 | 11.7 | 12.3 |
| 4B + GRPO + 本文 | 23.0 | 5.6 | 33.3 | 7.4 | 13.1 | 10.8 | 15.6 | 17.0 | 15.7(+27.6%) |
| Qwen3.5-35B-A3B | 33.9 | 7.6 | 53.2 | 14.6 | 18.6 | 11.4 | 35.9 | 23.5 | 24.8 |
| 35B + GRPO + 本文 | 39.8 | 11.1 | 53.8 | 15.6 | 21.9 | 17.7 | 41.2 | 23.7 | 28.1(+13.3%) |
| 35B + SAO + 本文 | 39.1 | 12.5 | 54.8 | 16.5 | 22.6 | 17.7 | 39.1 | 24.1 | 28.3(+14.1%) |
几个关键读数:4B 上 Drive(6.2→15.6)和 Email(23.9→33.3)各涨 9.4 分,Hybrid 涨 5.3 分;CSM 是 4B 唯一下降的域(9.2→5.6)。35B + GRPO 则八域全升(Teams +5.9、Drive +5.3、CSM +3.5 等),换用 SAO 算法结论不变、平均分 28.3——证明提升来自环境而非算法偏好。作为参照,未训练的 Qwen3-235B(Think)平均只有 18.1 分,训练后的 35B-A3B 明显反超了这个大三倍多的模型。
5.2 域外:九个基准的意外收益
更值得注意的是,训练环境完全独立于所有评测基准构建,但域外普遍提升:
| 模型 | AIME26 | HMMT | LCB | SciCode | τ3-Airline | τ3-Retail | τ3-Telecom | BFCL | GPQA-D |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5-4B | 45.9 | 28.5 | 36.6 | 22.6 | 48.8 | 70.4 | 92.5 | 30.3 | 76.5 |
| 4B + GRPO + 本文 | 56.0 | 35.4 | 44.0 | 25.7 | 58.7 | 73.6 | 91.9 | 31.7 | 77.5 |
| Qwen3.5-35B-A3B | 91.0 | 77.0 | 74.3 | 29.7 | 39.1 | 52.7 | 49.1 | 31.1 | 82.8 |
| 35B + GRPO + 本文 | 91.9 | 80.0 | 79.0 | 29.9 | 52.5 | 57.1 | 68.9 | 42.5 | 85.0 |
4B 的 AIME26 从 45.9 涨到 56.0(+10.1 分)——用业务环境练出来的模型,数学竞赛成绩大幅提升。35B 上最醒目的是 BFCL 从 31.1 涨到 42.5(+11.4 分),以及 τ3-Telecom 从 49.1±49.8 到 68.9±20.5——不仅均值上升,run 间方差大幅收窄,说明训练让 Agent 的工具调用从“时灵时不灵”变得稳定可靠。checkpoint 分析显示这些提升随训练渐进发生,不是单点评测噪声;训练动态上奖励稳步上升、截断率从 0.35 降到近零、退化输出比例始终接近于零,排除了“靠输出崩坏刷分”的可能。
5.3 训练足迹:7.4% 的任务,53.5% 的世界
一个容易被忽略的细节:4B 的 RL 训练在 200 步里只让 3,200 个任务(占语料 7.4%)真正收到梯度,但这 7.4% 覆盖了 53.5% 的环境、62.9% 的行业、75.8% 的工具和 62.8% 的服务组合。这直接印证了世界中心范式的主张——多样性存在于世界里而非任务文本里。附录的结构分析进一步发现:任务描述的 TF-IDF 聚类与领域、角色等元数据毫无对应关系,而按工具集合投影则呈现清晰的领域结构——任务多样性的主要来源是可执行工具面,不是任务语言。
5.4 环境作者:从 3.3% 到 83.3%
最后一个实验直接检验“出题人能否被训练”。在 30 个留出业务简报、12 项结构验证器全过才算成功的严格标准下:
| 模型 | Zero-shot | Recipe(附构造范例) |
|---|---|---|
| Claude Opus 4.8 | 83.3% | 80.0% |
| DeepSeek-V4-Pro | 83.3% | 86.7% |
| GLM-5.2 | 80.0% | 76.7% |
| GPT-5.4 | 66.7% | 66.7% |
| API 模型均值 | 78.3% | 77.5% |
| Qwen3.5-35B-A3B(基线) | 3.3% | 20.0% |
| Qwen3.5-35B-A3B + 构造轨迹微调 | 83.3% | 10.0% |
三个层次的发现:其一,强通用模型 zero-shot 就能造出结构合格的世界(66.7%–90%),说明“造世界”能力部分已存在于前沿模型中;其二,Qwen3.5-35B-A3B 基线只有 3.3%(频繁截断、格式崩坏),但在 29,823 条构造轨迹上微调后跃升至 83.3%(Fisher 精确检验 p = 1.2×10⁻¹⁰),追平最强 API 模型,平均通过 11.5/12 项验证器;其三,最有意思的对比——给基线模型附构造范例能从 3.3% 拉到 20.0%,但给微调后的模型附同样的范例反而从 83.3% 跌到 10.0%(30 次生成中 27 次倒在跨服务验证上)。提示词补偿的是模型缺失的能力,而微调把构造流程内化进了参数,此时外部范例反而干扰已学会的生成策略——这直接证明了学到的是程序性知识,不是指令跟随。
六、效果优势的根源解释
6.1 为什么域外也提升
用业务工具环境训练,为什么 AIME26 能涨 10 分?论文的讨论给出了方向,结合数据可以拼出完整解释:业务工作流合成迫使模型反复练习服务编排、持久状态追踪、多步工具调用中的约束满足——这些是跨任务通用的交互结构。解一道多服务调查任务(先在 CRM 找到账户、再查邮件线索、最后跨系统修正记录)所需的分解、排序、中间状态维护,与解一道多步数学题所需的规划在认知结构上部分重叠。信号又是确定性的(SQL 断言而非模型投票),梯度干净、无判定噪声,学到的模式更稳固。35B 上 BFCL +11.4、τ3 全域提升且方差骤降,进一步说明越是依赖结构化工具交互的能力,从这种训练中获益越大;而 4B 的 τ3-Telecom 基本持平(92.5→91.9)也表明迁移不是无差别的普遍增益——已饱和的能力不再动。
6.2 CSM 为什么唯一下降
4B 在 CSM(客户成功管理)从 9.2 降到 5.6,是八域中唯一的退步。论文没有专节分析,但从数据可以合理推断:其一,CSM 是所有模型的高方差域——GPT-5 得 36.4 而 Gemini-2.5-Pro 只有 11.6、Kimi-K2 只有 7.1,域内任务形态异质;其二,客户成功任务更依赖长程对话中的意图理解与跨系统行动协调,4B 的容量在学习 3,200 个异质任务的工具编排时,可能挤占了这类对话-行动耦合能力。值得注意的是 35B 上 CSM 不降反升(+3.5),且 SAO 下 +4.9——这更像容量瓶颈而非环境缺陷。
6.3 世界中心范式的成立证据
把三条证据链放在一起看:域内八域提升(世界结构可教)、域外九基准提升(学到的结构可迁移)、7.4% 任务覆盖 53.5% 环境(多样性在世界里)——这三点共同支撑了论文的核心论断:环境的有效学习信号不由它与目标基准的对应关系决定,而由世界的多样性、结构与真实性决定。换句话说,该扩展的不是任务数量,而是世界的多样性。
七、必要知识反推
要复现或延伸这项工作,需要三层知识储备:
领域层:企业软件栈的运作常识——CRM、邮件、Slack、工单、计费、项目管理各系统的典型数据模型与交互模式;六类用户角色(客户经理、协调员、销售经理、运营协调、支持主管、分析负责人)的工作流语义;MCP 工具协议。没有这层,“业务场景”就退化成空洞文本。
方法论层:GRPO 及 Dr. GRPO 变体(非对称裁剪、零标准差组过滤、组内相对优势);SFT 与 RL 的分工——构造轨迹用 SFT 内化、策略用 RL 优化;世界模型(预测 T)与可执行环境(直接运行 T)的区别;确定性验证器设计——把语义约束编译成 record existence / field equality / field inequality 三类 SQL 断言。
工程层:全异步 agentic RL 训练栈——actor 与 rollout 分卡(2/6)、SGLang 推理、最大 staleness 4、partial rollout;进程内环境执行避免网络开销;构造轨迹的数据工程——四类监督样本(正向生成、阶段补全、错误修复、意图差分)的组织方式。
知识融合节点:这项工作真正的融合点在于把“数据工程”变成“能力工程”——传统视角里环境是静态资产,AgentMercury 视角里环境是模型的输出物,而验证器是连接两端的契约。工程、RL 方法论、领域知识在“可执行世界”这个对象上交汇。
八、通用性灵感
灵感一:环境构造本身可以形成数据飞轮。 “出题人可以被训练出题”是这个工作最具复制价值的发现。任何需要评测集或训练环境的团队——代码评测、安全红队、教育出题、业务流程自动化——都可以套用同一公式:先用工程管线造出第一批合格环境并留存构造轨迹,用轨迹微调模型,再让模型造更多环境。第一批环境的成本是一次性的,飞轮转起来后环境的边际成本趋近于推理成本。83.3% 对 3.3% 的跃升说明这个飞轮的启动增益极大。
灵感二:不瞄准基准的环境扩展带来域外收益。 这是给“数据配比该跟着 benchmark 走”这一行业直觉的一记反例。训练环境与评测基准完全无关,AIME26 却涨 10 分。启示是:当你缺某类能力的训练数据时,与其直接合成同构任务,不如合成一个迫使模型练习该能力底层结构的世界——结构迁移比表面形式迁移更耐用。
灵感三:世界与任务分离是世界设计的通则。 游戏引擎与关卡分离的比喻值得写进任何环境设计文档:把规则放进世界(引擎),把目标放进任务(关卡),把评分做成世界自带的隐藏属性(答案卡)。三者混同的后果在论文里有实证——零样本造世界的模型最常犯的错误恰恰是“把跨服务约束的两个端点塞进同一个服务”,即把本应属于世界结构的规则错误地局部化了。
灵感四:确定性验证是合成数据的信用基础。 4,783 个环境、43,300 个任务之所以能直接喂给 RL,是因为每条断言都可回放、可复算。合成数据的瓶颈从来不是数量,而是“谁为质量背书”。把语义约束编译成可执行检查,是当前最可靠的背书方式。
灵感五:提示词与参数学习会互相干涉。 recipe 对基线模型 +16.7 分、对微调模型 −73.3 分的现象,是“内化知识后外部指令成为噪声”的漂亮实证。它提醒我们:评估一个微调后的模型时,应该剥离为基线模型设计的提示工程——两者不是叠加关系,可能互相破坏。
附录:关键数字速查
| 项目 | 数值 |
|---|---|
| 环境库总量 | 4,783 个(14 行业、50 国) |
| RL 语料 | 43,300 任务 / 4,326 环境 / 每环境 10 种子 |
| 语料结构 | 2,287 行业描述、842 工具、222 状态表、148 服务组合 |
| 每环境工具数 | 10–26(均值 16.1),取值仅 {10,14,18,22,26} |
| 每任务断言数 | 2–10(均值 5.4) |
| 跨系统风险任务 | 25,991 / 43,300(60.0%) |
| 作者微调样本 | 29,823 条构造轨迹 |
| 4B 训练足迹 | 3,200 任务(7.4%),覆盖 53.5% 环境、75.8% 工具 |
(注:论文正文与表格在 35B 个别分域增量上存在微小出入,本文分域数值以论文表 1、表 2 为准。)