论文 A 链接:SkillGym: Internalizing Large-Scale Human Skills into LLMs for Real-World Problem Solving 论文 A 代码仓库:ECNU-ICALK/SkillGym 论文 B 链接:Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms 发表时间:2026年9月 机构:论文 A 为华东师范大学(ICALK 实验室)与上海人工智能实验室联合出品,学生团队主导、校企协作;论文 B 为佐治亚理工学院一作(暑期实习期间完成)与阿里巴巴 Token Foundry 合作,企业方为项目主导 领域标签:cs.AI / cs.CL / cs.LG,Agent 训练、环境合成、可验证奖励强化学习
一、论文背景
1.1 从「会说」到「会做」:程序性能力的缺口
大语言模型在推理、指令跟随、工具调用上的进步有目共睹,但真正可靠的现实问题求解要求的不是孤立的推理步骤或单次工具调用,而是程序性能力(procedural competence):遵循领域工作流、在长跨度上协调工具、从失败中恢复、对照任务要求验证结果。两篇论文都从同一个观察出发——交互式基准(WebArena、OSWorld、SWE-bench 等)反复暴露出模型在网页、桌面、软件工程环境里执行完整工作流时的脆弱性。
一个直观的类比:这就像「背交规手册」和「在驾校开车」的区别。背下所有交规的人不一定会开车——踩离合、看后视镜、预判行人,这些能力只能在真实的方向盘后面、在踩错的顿挫和教练的反馈中长出来。当前 LLM 的问题正是:它们读了全世界的「交规手册」(预训练文本),却几乎没有摸过方向盘(可执行的因果反馈)。
1.2 知识的三种存在形态:外挂、模拟、内化
目前模型使用领域知识的方式主要有两种:
第一种:推理时外挂。人类撰写的 Agent 技能(Agent Skills)把工作流指令、脚本、示例、执行约束打包成可复用文档(如 Anthropic 的 Agent Skills、OpenClaw 的 Clawhub 技能注册表)。模型在推理时检索并加载这些技能,效果高度依赖检索质量、上下文管理和指令遵循的忠实度——重复使用并不会沉淀为模型自身的能力。这正是 SkillGym 要改变的状态。
第二种:LLM 模拟环境。用语言模型扮演环境、生成工具响应,成本极低但有幻觉和不一致问题;用 LLM 做裁判打分,裁判自身的有效性又需要被验证。VHD-Play 的相关工作部分引用了一项覆盖 21 个裁判模型、约 54.1 万次判断的系统性评估,发现高重测信度与严重位置偏见并存——可靠不等于有效。
第三种:本文共同指向的「内化」路线。两篇论文分别从两个端口切入同一命题:
- SkillGym(技能端):把人类技能文档变成可执行、可验证的训练环境,让模型在「执行工作流」的过程中通过结果反馈学习,而不是训练模型去复述技能描述。技能从推理时外挂变成训练信号,最终内化为参数中的程序性能力。
- VHD-Play(环境端):把环境合成的顺序倒过来——先采样并求解一个数学模型,再让这个预解同时供出环境动力学和奖励函数。奖励不再来自事后定义的裁判或清单,而是与动力学同源,从机制层面消除奖励与行为不一致的空间。
1.3 为什么是现在
两条路线同时出现并非偶然。它们的共同背景是:可验证奖励强化学习(RLVR)在数学和代码上已被验证有效(DeepSeek-R1、Tulu 3 等确立了「用确定性验证器替代学习型奖励模型」的范式),但 RLVR 的题库——有唯一可验证答案的问题——太窄。要把它扩展到 Agent 训练,必须解决两个前置问题:训练环境从哪来(环境合成问题)、奖励信号凭什么可信(结果验证问题)。SkillGym 用「技能文档 + 代码验证器」回答,VHD-Play 用「预解数学模型 + 求解器参考值」回答。两者都把知识变成了环境的因果反馈,而不是文本的表面模仿——这是本篇精读的主线。
二、论文定位和关联工作
2.1 谱系一:技能的表示与复用(SkillGym 的上游)
| 工作 | 核心思想 | 与 SkillGym 的关键区别 |
|---|---|---|
| Voyager(arXiv 2305.16291) | LLM 具身智能体在 Minecraft 中持续探索,把掌握的技能存为可执行代码组成的「技能库」,通过检索复用 | 技能存在外部库里,通过上下文调用,不更新参数;SkillGym 把技能执行经验蒸馏进权重 |
| Reflexion(NeurIPS 2023) | 把语言化反馈存入情节记忆,改进后续尝试 | 无权重更新,记忆是文本;SkillGym 用权重更新固化经验 |
| Anthropic Agent Skills(2025) | SKILL.md + 脚本的文件夹约定,渐进式披露,推理时加载 | 官方定位是推理时能力扩展;SkillGym 证明这些技能还能反向成为训练资源 |
| AutoSkill(arXiv 2603.01145) | 经验驱动的技能自进化 | 关注技能的生成与积累;SkillGym 关注技能到训练环境的转化 |
这一谱系的共同点是:技能知识始终在模型外部循环(库、记忆、上下文)。SkillGym 的定位是把这条外部循环接入训练循环。
2.2 谱系二:Agent 训练环境与交互基准
| 工作 | 核心思想 | 与两篇论文的区别 |
|---|---|---|
| 工具学习数据集(API-Bank、ToolAlpaca、ToolBench) | 围绕工具接口与调用序列组织监督 | 无状态、短交互;SkillGym 轨迹平均 49 次工具调用、35.2 个交互步 |
| 交互基准(WebArena、OSWorld、SWE-bench、GAIA、τ-bench) | 真实任务设定 + 程序化成功检查 | 任务为特定环境撰写或从平台收集;SkillGym 从人类技能派生任务并验证技能依赖性 |
| Agent World Model(arXiv 2602.10090,ICML 2026) | 全合成 1000 个代码驱动 + SQLite 支撑的环境 | 环境由 LLM 从场景描述生成,奖励为生成后定义的验证模块——属于环境优先 |
| Qwen-AgentWorld(arXiv 2606.24597) | 训练语言世界模型模拟环境动态 | 用学习到的模拟器换廉价训练;保真度本身是瓶颈;VHD-Play 用数学模型获得精确动力学 |
| EnvScaler(arXiv 2601.05808) | SkelBuilder 合成环境骨架,ScenGenerator 生成场景与验证函数 | 环境优先的代表:先有环境、后定义奖励(检查清单 + 终态验证器);VHD-Play 与其做了同预算对照实验 |
2.3 谱系三:可验证奖励 RL(两篇论文共同的下游)
DeepSeekMath/DeepSeek-R1 确立了「可验证奖励 + RL」的推理训练范式;RLVR 的关键优势在于验证器是无噪声、难被攻击的地面真值。但传统 RLVR 的验证对象是最终答案——数学题算对了没有、代码通过测试没有。两篇论文都在把 RLVR 往「验证整条轨迹」推进:SkillGym 验证工作流的交付物(文件、测试、结构化输出),VHD-Play 验证多期决策的累计效用。VHD-Play 论文自己的表述是:把可验证强化学习「从答案扩展到轨迹」。
2.4 定位总结
| 维度 | 之前的路线 | 两篇论文的突破 |
|---|---|---|
| 知识来源 | 文本(技能文档、教科书) | 可执行过程(工作流执行、机制回放) |
| 环境构造 | 人写或环境优先合成 | A:技能派生 + 两级验收;B:机制优先,预解供出动力学与奖励 |
| 奖励来源 | LLM 裁判 / 事后定义的验证器 | A:任务级代码验证器;B:与动力学同源的求解器参考值 |
| 能力存续 | 推理时外挂(上下文) | 内化为参数中的程序性能力 |
| 扩展成本 | 每环境人工撰写 | A:4.5 小时/任务;B:每个被录取环境约 $0.01–0.03 |
两篇论文是同一命题的互补解:SkillGym 回答「训练内容从哪来」(人类已写好的工作流知识),VHD-Play 回答「训练环境与奖励如何大规模可信地生成」(预解机制)。
三、问题定义
3.1 论文 A(SkillGym):把技能文档变成训练环境
具体问题:人类技能文档描述的是可复用流程而非具体问题,无法直接当训练数据用;而流程性任务的成功与否,不能靠「输出像不像技能描述」来判定。
核心洞察:技能文档和训练环境之间缺的是**落地(grounding)与验证(verification)**两件事——把流程落成有输入、目标、交互协议的具体任务实例,再用代码检查器判定结果是否达标。
抽象问题:给定技能集合 S 与参考智能体配置,构造任务环境 E_i =(指令 x_i,输入资产 A_i,运行约束 ρ_i,验证器 V_i),使得:(1)任务可执行、可验证(可行性);(2)参考智能体带技能能过验证器、不带技能过不了——即 (r⁺, r⁻) = (1, 0) 的对比条件(经验技能依赖性)。求:从被录取环境采样轨迹,使模型的程序性能力最大化。
这个抽象的精妙之处在于「对比式技能依赖性测试」:它不问「技能在理论上是否有用」,而问「在参考配置下,拿掉这个技能任务是否真的会失败」。这把「技能依赖」从哲学断言变成了可执行的判据——同时论文诚实标注其边界:这是参考配置下的经验证据,不证明该技能对所有智能体都必要。
一个类比:教练手册上写了一百种训练方法,怎么知道哪种真有效?让同一个学员分别「照着练」和「瞎练」,看成绩差。有差距的才是真有效的方法。
3.2 论文 B(VHD-Play):让动力学与奖励同源
具体问题:扩产 Agent RL 训练需要多样环境 + 可靠结果信号 + 低扩展成本三者同时成立,但现有生成流水线都是「环境优先」——先造环境、事后定义奖励或标注轨迹,动力学与评估的对齐只能事后建立,LLM 裁判又引入新的可信度问题。
核心洞察:运筹学的数学模型天然同时携带两样东西——决策过程的动力学(状态转移、约束、目标)和可精确求解的参考答案。先采样求解一个数学模型 M(θ),其解 z_θ 同时固定了奖励规则 R_θ;再由同一个模型实现出可执行动力学 D(θ) 并包装为智能体环境 E(θ)。
形式化(论文式 (1)(2)(4)):
- 环境优先:E → 定义 R_E(或采样轨迹后标注 y_π)
- 机制优先:M(θ) →解→ z_θ →固定→ R_θ(·; z_θ),同时 M(θ) →实现→ D(θ) = (S, Λ_θ, U_θ) →包装→ E(θ)
- 奖励:r(π; θ) = clip_[0,1] ( (u(π;θ) − u⁰(θ)) / (u*(θ) − u⁰(θ)) ),其中 u* 为最优值(上锚点)、u⁰ 为固定默认策略值(下锚点)
抽象问题:给定机制族分布 P_f,求环境生成与评估的一体化构造,使得动力学语义与评估语义来自同一预解对象,且信息边界可控(构建者看全部参数与参考值,玩家只能通过接口观察)。
这个抽象的精妙之处有两点。其一,「先有标准答案再造题库」:奖励不再是一个需要被信任的第三方(裁判、奖励模型),而是题目的组成部分——就像高考数学卷,评分标准与题目同时印刷,不存在事后讨价还价。其二,归一化奖励的上下锚点设计:默认策略映射到 0、全信息最优映射到 1,分数于是有了绝对含义——不是「裁判觉得不错」,而是「你拿到了最优与躺平之间百分之几的效用」。
3.3 两篇论文的同一性
剥离具体差异,两篇论文解决的是同一个抽象问题的两个对偶侧面:
| SkillGym | VHD-Play | |
|---|---|---|
| 知识载体 | 人类技能文档 | 数学模型 + 求解器 |
| 落地机制 | 模板实例化 + 验证器 | 机制实现 + 接口包装 |
| 可信奖励来源 | 任务级代码检查器 | 求解器参考值 |
| 质量控制 | 对比式技能依赖测试 | 录取重放审计 |
| 反「表面模仿」 | 验证交付物而非措辞 | 评分用算术而非语言判断 |
共同命题:让学习信号来自环境的因果反馈(做对了环境真的会变好),而不是来自文本相似度或语言评判(看起来像对的)。
四、问题解法
4.1 论文 A:SkillGym 的技能道场(三阶段流水线)
阶段一:技能感知的模板构建——把「手册」拆成「卡片 + 题架」
类比:把一本厚厚的操作手册拆成「技能卡」(描述这个技能怎么用)和「题型模板」(这类任务怎么考)。
- 技能组织与筛选:从在线技能注册表(Clawhub)整理出 12 大类、63 子类的分类体系,在每个子类里选高星技能,把描述、示例、脚本、约束打包成结构化技能卡 K_i。
- 可复用任务模板:人工为每个子类 c 构造模板 T_c,规定任务蓝图、输入资产、文件结构、运行时要求、检查器规范、执行约束。关键设计是卡片与模板分离:技能卡说明「流程是什么」,模板定义「流程如何被考试」。同一模板下,输入、指令、期望输出、成功条件随技能变化——既提供了统一脚手架,又不把所有技能压成同一个任务,也不依赖完全无约束的自动生成。
- 面向结果的规范:内容生成类任务要求章节、长度、格式、关键词覆盖、文件命名;软件/数据/自动化任务用可执行测试、文件检查、结构化输出比对、终态检查。注意定义的是「完成判据」而非「参考答案」——不要求逐字复现某个标准回答。
阶段二:环境构建与两级验收——先验证「能考」,再验证「技能真有用」
- 可执行实例化:E_i = Instantiate(K_i, T_c(i)) = (x_i, A_i, ρ_i, V_i),每个任务打包进 Docker 保证可复现执行。验证器实现任务级完成判据,含反捷径检查——防输入篡改、答案抄袭、绕过要求、伪造输出。这是对「奖励作弊」的直接防御。
- 两级验收(论文式 (2)):
- 第一级(可行性 F_i = 1):通过设计检查、结构检查、端到端执行检查,验证器可用且有验证器通过解。
- 第二级(对比技能依赖):参考智能体带技能跑 (r⁺) 与不带技能跑 (r⁻),仅 (1, 0) 标记为 Skill-Dep.;通过第一级但不满足对比条件的保留为 Verifier-Passed 兜底任务;两级都不过则丢弃。
- 失败驱动迭代:验证失败分为环境错误、检查器错误、难度失配、弱技能依赖四类,构造轨迹、执行日志、验证器输出、反思笔记共同指导修订,形成反馈闭环。每个任务有构造预算,可带着反思记录重启。
阶段三:多骨架轨迹采样——不同驾校、不同教练、同一考场
- 多样配置:用 Claude Code(配 DeepSeek V4 Pro / GLM-5.2)与 Codex(配 GPT-5.4 / Nex-N2-Pro)四种「骨架-模型」组合在录取环境里采样。骨架(harness)提供交互接口,模型提供决策——两个维度都换,扩展了执行轨迹的来源分布。
- 轨迹与结果奖励(论文式 (3)):τ = rollout(E, π),奖励 r = V(z(τ)) ∈ {0,1}——验证器检查结果与执行状态而非轨迹措辞。重要区分:任务级标签 ℓ_i 记录的是构造期验收,轨迹级奖励记录的是这一次执行是否达标——Skill-Dep. 标签不保证每个采样智能体都能解出来。
- 学习用途:成功轨迹供 SFT,失败轨迹支持失败模式分析,环境与验证器支持基于结果的 RL。技能、任务、轨迹、验证结果始终关联存储——把程序性知识与观察到的行为及其测量结果连在一起。
最终资源:2,756 个环境(1,081 Skill-Dep. + 1,675 Verifier-Passed)、8,364 条成功轨迹(平均 49 次工具调用、63.4k tokens、35.2 步,峰值 350 次调用 / 318 步)。整体采样成功率仅 17.4%(48,152 次试验),可见环境难度之高。
4.2 论文 B:VHD-Play 的机制优先流水线
第一步:采样与求解——先把答案算出来
每个实例从 θ ~ P_f 开始,用族级求解器 S_f 计算 z_θ = (u*(θ), u⁰(θ)):闭环算术、精确枚举、动态规划或数值优化——全程无语言模型参与参考值计算。求解的同时,把决策变量映射为状态更新、约束写进转移函数、目标累积为终局效用,得到可执行动力学 D(θ)。
论文的 11 个机制族覆盖广泛:库存 DP(联合补货)、路由(带积压的多期车辆路径)、谈判(现金账本下的序贯双边议价)、背包(共享预算的多期二维背包)、线性/二次规划、设施选址、调度(加权完工时间/延迟)、序贯停止、序贯搜索。每个族的求解器都是教科书级算法:Held-Karp 回归、Bellman 递归、HiGHS、SLSQP、Smith 规则……
第二步:语料落地的实现——同一个数学题,换一千种皮
类比:这就是「先有标准答案再造题库」——库存DP 这道数学题是固定的,但皮可以是深圳湾硬件配送中心(工业伺服电机、光学编码器、热管理单元的补货),也可以是任何其他行业场景。
- 冻结的 setter(语言模型,但角色被刻意缩小):接收完整参数抽取 θ 和一条从 28 个主题域语料中独立采样的真实文档片段 c,生成场景、关系数据库、至少 10 个工具的模式与实现、玩家指令。文档片段提供实体、关系、领域语言;M(θ) 决定决策过程;z_θ 固定评估——setter 只被要求「实现与包装」,不被要求「发明」。
- 信息不对称接口:构建者 G 看到 (θ, c),玩家 π 只看到接口发布的观察 o_≤t。接口把动作分为探测(probe,返回隐藏状态/参数的指定视图)与决策(改变状态),两者共享回合预算 T。默认接口不提供对完整抽取或参考值的直接读取——模型必须像真实运营者一样「先调研、再下单」。
- 关键工程结论:冻结的 Qwen3.6-35B-A3B(后来被训练成玩家的那个起点检查点)就能当 setter,有效录取率 70%;更强的 Qwen3.7-Max 录取率 100%、平均尝试次数从 2.50 降到 1.03。更强的 setter 主要提高产量与接口精修,不改变机制本身。
第三步:录取与规模——三个关卡杜绝「题错了还不知道」
- C1 可执行性:生成的动力学与声明的接口工具必须无异常初始化和执行;兼容重放时,各参考策略必须到达数值终局。
- C2 默认区域有效:默认策略的结果必须落在目标尺度/方向对应的允许区域内,否则重新生成。
- C3 最优处奖励一致:参考驱动器必须在家族特定数值容差内复现预计算的最优值——即「生成的环境跑出来的满分,等于造题前算出的满分」。
- 审计:从 8 个可重放族各抽 10 个环境,oracle/默认/idle 策略各跑两次,共 480 次执行——零异常、240 次重复终局全部一致、没有任何重放原始效用超过预计算上界。
最终:3,300 个录取环境(2,200 训练 / 300 训练族 held-out / 800 未见族评估),28 个主题域熵 0.997(最大域仅占 4.67%),每个录取成本约 $0.01–0.03,回合中位数 31 / 均值 59.7 / P95 211。
第四步:策略优化——GRPO 消费同源奖励
GRPO(64 prompt/步 × 16 保留 rollout,无 KL 惩罚、无价值模型),34 步后停在检查点。机制优先构造与优化器解耦——论文附录明确该构造可配 PPO 或其他优化器。
4.3 两套解法的全景对照
| 组件 | SkillGym | VHD-Play |
|---|---|---|
| 知识源 | 人类技能文档(高星筛选) | 数学模型族(教科书算法) |
| 落地者 | 人工模板 + LLM 实例化 | 预解机制 + 冻结 LLM setter |
| 环境载体 | Docker + 代码验证器 | 可执行动力学 + 接口包装 |
| 质量闸门 | 两级验收(可行性 + 对比依赖) | 三准则录取(执行/默认区/最优一致)+ 审计重放 |
| 奖励 | 验证器 0/1(含反捷径) | 求解器锚点归一化效用 [0,1] |
| 反作弊 | 反输入篡改/抄袭/绕过/伪造 | 信息不对称 + 参考值在交互前固定 |
| 多样性来源 | 12 类 63 子类技能 × 4 种骨架-模型 | 参数重采样 × 28 域语料种子 |
| 训练方式 | SFT(RL 留作未来工作) | GRPO RL |
五、评估指标与实验证据
5.1 论文 A:SkillGym 的实验体系
指标体系:主指标为 GDPval-AA v2 的 Elo 评分(220 个任务、44 职业、9 行业的专业交付物盲评 pairwise 对比)与 Terminal-Bench 2.1 任务成功率(容器化命令行环境中的调试、安全修复);辅助指标为 SkillsBench v1.1 带技能/不带技能两种设定的成功率(87 任务、8 领域、确定性验证器);消融指标覆盖教师模型组合与骨架组合。
核心结果一:相对基座的全面提升(表 4):
| 骨架 | 模型 | GDPval-AA v2 | TB 2.1 | SkillsBench | SkillsBench (w/o) |
|---|---|---|---|---|---|
| Claude Code | Qwen3.5-35B-A3B 基座 | 974 | 39.33 | 23.34 | 12.13 |
| Claude Code | SkillGym-Agent | 1173 (+199) | 58.43 (+19.10) | 51.47 (+28.13) | 24.51 (+12.38) |
| Codex | 基座 | 942 | 10.11 | 5.33 | 0.69 |
| Codex | SkillGym-Agent | 979 (+37) | 46.07 (+35.96) | 33.02 (+27.69) | 21.08 (+20.39) |
最能支撑「内化」主张的证据是不带技能列:训练后的模型在不给推理时技能的情况下(24.51 / 21.08),超过了基座模型带着技能的成绩(23.34 / 5.33)。也就是说,练过之后裸考上场,比没练过开卷考试更强——这是「技能沉淀为参数中的程序性能力」的直接证据。同时提供技能还能进一步提升训练后的模型,说明内化能力与外部指导是互补而非替代。
核心结果二:与 SOTA 对比:技能辅助 SkillsBench 上 51.47%,超过 Claude Sonnet 4.6(47.2%)、GPT-5.4 Mini(41.4%)、DeepSeek V4 Pro Preview(50.1%);TB 2.1 上 58.43% 几乎追平 Sonnet 4.6(58.5%)——35B 规模打出这样的成绩,训练数据的价值可见一斑。
核心结果三:消融的诚实面。混合教师提升终端与技能类指标(Codex 下 All Teachers 比 GPT+Nex 在 TB 2.1 上 +5.62),但两个双教师组合的 GDPval 反而比最强单教师低 98 和 51 Elo;跨骨架混池对 Codex 全面提升(技能辅助 19.91→33.02),但给 Claude Code 的 DeepSeek+GLM 加 Codex 轨迹后技能无关成绩从 28.41 降到 24.51。增益并非单调,教师/骨架多样性按能力维度各有所长。
实验设计为何能证明论点:GDPval/TB/SkillsBench 都不是 SkillGym 的训练分布(训练任务来自技能注册表派生环境),提升发生在分布外基准上;带/不带技能的双设定直接检验「内化」;对比基线包含四个专门训练的 32-35B 智能体模型。
5.2 论文 B:VHD-Play 的实验体系
指标体系:主指标为五族均值智能体得分(Eq. 4 的求解器锚定 [0,1] 分数);诊断指标为 F/I/A 三形态对比(written-out / 参数公开的智能体形态 / 参数需探测的智能体形态)与 11 族全网格;外部指标为 BFCL V4 十个交互单元、TravelBench 计划分、E-Commerce Bench 365 天 storefront 终局余额;控制分析包括代码工具采用分解(Oaxaca-Blinder)与策略 KL 散度。
核心结果一:主增益与迁移(表 2 / 图 1b):
| 形态 | 基座 | 训练后 | 变化 |
|---|---|---|---|
| Written-out (F) | 0.962 | 0.992 | +0.030 |
| Informed-agentic (I) | 0.231 | 0.875 | +0.644 |
| Agentic (A) | 0.204 | 0.815 | +0.611 |
迁移证据按 OOD 距离分层:训练族 held-out +0.56,未见优化族(near-OOD)+0.63,决策结构不同的 far-OOD +0.24,探测受限的 far-OOD +0.16——增益随 OOD 距离衰减但到处为正。
核心结果二:F/I/A 分离揭示了「会做题 ≠ 会做事」。基座在 F 形态 0.962 近满分——同一批题把参数摆出来它都会做;但 I 形态跌到 0.231——参数照样全给,只是要求通过多步环境的状态变化、共享约束、持续承诺来执行,就崩了。这说明可学习缺口的大头在状态化交互而非底层解题能力;训练弥合了 84% 的 I 缺口和 77% 的 F-to-A 总缺口,且 F 形态不降反升——训练不是牺牲解题换执行。
核心结果三:外部长跨度迁移。365 天 storefront:基座 5 跑 4 完成含 1 次破产,终局均值 54,294;训练后 5 跑全完成零破产,1147–1825 个回合(远超训练环境均值 59.7),均值 182,844(3.4×),超过 Qwen3.7-Max 的参考值 165,224——一个 35B-A3B 训练检查点在超长地平线经营任务上打赢了自家更大规模的前辈。BFCL 十单元 +2.84,TravelBench 0.700→0.794(仍低于 Max 的 0.891)。
核心结果四:与最强环境优先基线的受控对照(附录 E.2)。同一起点(Qwen3.6-35B-A3B)、同一 GRPO 配置、同 2,200 训练记录、同 34 步预算,直接对比 EnvScaler 场景与 VHD-Play 环境:EnvScaler 控制组学得动自家奖励(原生奖励升至 0.854),但外部迁移不均匀——BFCL 十单元 58.56(低于基座 61.25)、storefront 余额 52,661(贴着基座 54,294);VHD-Play 三项外部汇总全部提升。这不是说 EnvScaler 无效(其对 8B 弱基线的原始实验增益显著),而是暴露了环境优先路线在强基座上的一个结构性风险:训练奖励在涨 ≠ 外部能力在涨,事后对齐的验证器与动力学的缝隙可能被策略钻进去。
核心结果五:机制与策略共同扩产(图 5)。背包族从 6×5 到 11×11 四档规模,每档独立训练:增益从 +0.41 涨到 +0.86(11×11 基座仅 0.085,训练后 0.946)——环境越难,训练挖出的空间越大,且同一个冻结检查点就能造出比自己当前能力更难的环境。这为「环境随策略能力共同扩展」的滚雪球式自进化训练底座提供了直接证据。
控制分析:代码工具采用率从 50.4% 升到 79.2%,但 Oaxaca-Blinder 分解显示 +0.443 的智能体增益中仅 +0.030(7%)来自采用率变化,93% 在固定采用分层内部;策略 KL 散度仅 0.089 nats/token——小幅度策略调整撬动大增益,与「能力激发(capability elicitation)」而非「学到全新知识」的解释一致。
六、效果优势的根源解释
6.1 根源机制与证据链
因果链 A(SkillGym):执行验证经验 → 策略层学习 → 程序性能力内化
- 基线为何曾经有效:推理时挂载技能文档对弱执行能力的模型是廉价的能力放大器——把工作流写进上下文,模型照着做即可。Voyager 式技能库证明了外部技能复用的价值(获得 3.3× 独特物品等增益)。
- 基线的根本局限:外部技能的有效性受制于三个环节——检索对不对、上下文装不装得下、指令遵循忠不忠实。任何一环出错都前功尽弃,且每次使用都要重新交这三笔「税」。更深层地:技能文档是声明性知识,模型读了一万遍「应该先探查再决策」也不等于会在状态流中做对,因为预训练从未对「执行该流程并拿到因果反馈」提供梯度。【论文实验已支持:基座带技能 23.34% vs 训练后不带技能 24.51%】
- 本文的根本性改变:把技能的使用从「读」变成「练」。梯度不再流向「复述技能描述」,而是流向「在 Docker 环境里完成 49 次工具调用并让验证器通过」——监督信号是验证过的动作-观察序列本身。信息流的本质变化:学习信号从文本空间(与技能描述的相似度)切换到环境空间(交付物的因果后果)。
- 因果链:技能派生环境 + 代码验证 → 成功轨迹覆盖完整决策序列(平均 49 次调用、35 步)→ SFT 把长视野工具协调、失败恢复、结果核对固化进参数 → 体现在无技能成绩 +12.38/+20.39 与 GDPval +199 Elo。【论文实验已支持】
- 反事实:若去掉对比式依赖测试会怎样?论文没有直接消融这一组件,但类别数据给出间接证据:技能依赖率从区块链的 15.6% 到商业的 58.3% 差异巨大,若把全部任务当技能任务训练,相当比例的「伪技能依赖」任务会稀释信号。【阅读者推测,论文未直接验证】
- 诚实标注:SkillGym 只做了 SFT,环境对 RL 的支持是资源声明而非实验事实;17.4% 的采样成功率同时说明该数据源对教师模型也很难——成功轨迹的难度分布偏尾部。【论文实验已支持】
因果链 B(VHD-Play):预解机制 → 奖励与动力学同源 → 无裁判的可信 RL → 状态化策略学习
- 基线为何曾经有效:环境优先合成(EnvScaler、AWM 等)把环境构造从人工撰写解放出来,BFCL-v3 等基准上对 8B 弱基线增益显著;LLM 裁判把奖励覆盖扩展到开放性任务。
- 基线的根本局限:环境优先把「环境跑得通」和「奖励评得对」拆成两件事事后拼接——验证器与动力学的对齐只能靠生成后检查,两者的缝隙构成 reward hacking 的温床;LLM 裁判则自带系统性缺陷(外部检索:21 裁判 54 万次判断的评估发现 kappa 缩水 33-41 个百分点、高信度与重位置偏见并存)。机制层面:奖励信号的「合法性」没有来源——它既不来自物理事实也不来自数学事实,只来自另一个模型的意见。
- 本文的根本性改变:把奖励的合法性锚定在造题之前就存在的数学事实上。z_θ 在 D(θ) 生成之前由无 LLM 参与的求解器算出;评分是「实现效用与两个固定锚点」的纯算术——评分路径上没有任何被学习出来的组件。这改变的不是某个组件的性能,而是奖励的本体论地位:从「第三方意见」变成「题目固有属性」。
- 因果链:预解固定 z_θ → 生成环境与参考值一致性可被 C3/审计机械检验(480 次审计全过)→ GRPO 的每个 rollout 拿到的分数与语言判断完全解耦 → 学习信号精确指向状态化决策质量 → I/A 形态缺口被弥合 84%/77%,且外部长地平线任务迁移 3.4×。【论文实验已支持】
- 反事实:若奖励与动力学不同源会怎样?EnvScaler 对照组就是反事实——同预算下其原生训练奖励升到 0.854,但 BFCL 十单元降到基座之下。训练奖励与真实能力可以脱钩,恰恰因为其验证器是环境造好后另生成的。【论文实验已支持】
- 诚实标注:训练只用终端结果信号,无中间监督;三个训练族全部来自数学/运筹模型——对没有可计算参考结果的领域(写作、审美、社会判断),机制优先无法直接套用,论文附录 K 明确承认这一点。【论文实验已支持】
两条链的交汇
两条因果链在同一个深层机制上汇合:可信的因果反馈。SkillGym 的验证器与 VHD-Play 的求解器锚点都在做同一件事——把「做对了吗」从语言判断变成机械事实。区别只在覆盖面:SkillGym 的验证器是任务级手工+模板生成的(覆盖现实工作流广但每个都需构造,4.5 小时/任务);VHD-Play 的参考值是族级算法复用的(每个环境 $0.01-0.03 但限于可形式化机制)。一个广而贵,一个廉而窄——恰好互补。
6.2 相关工作检索与对照
以下为围绕关键机制假设的外部检索结果(检索时间 2026-09-25,来源含 arXiv 官方页、ICML 官方页、Anthropic 工程博客等):
| 研究(可核验链接) | 相似尝试 | 相关结论 | 与本文的差异与适用边界 | 对根源解释的影响 |
|---|---|---|---|---|
| Voyager(arXiv 2305.16291) | 技能库 + 代码技能复用,环境反馈迭代改程序 | 外部技能复用有效(3.3× 物品等),但不更新参数 | Minecraft 具身场景;技能靠上下文检索调用 | 支持 SkillGym 对「外部技能三重税」的刻画:Voyager 证明外挂有效,恰与内化形成对照,SkillGym 的 w/o 技能超越 w/ 技能基座补上了外挂路线给不了的一环 |
| ExpRAG(arXiv 2603.18272) | 经验轨迹检索 + SFT 组合训练 | 发现「微调常不能外推、免训练经验检索常弱于监督基线」,两者结合显著提升未见任务泛化 | ALFWorld 等文本环境;检索的是整条轨迹而非技能文档 | 补充:外部经验(检索)与内部化(微调)各有失败模式、组合最优——与 SkillGym「内化与外挂互补」结论从不同场景一致得出,交叉印证 |
| EnvScaler(arXiv 2601.05808) | SkelBuilder+ScenGenerator 程序化合成 191 环境/7K 场景 | 对 Qwen3-8B 的 SFT+RL 在 BFCL-v3 Multi-Turn 28.88→41.88 | 环境优先:先骨架后验证器;对弱基线增益显著 | 限定:VHD-Play 对照显示同预算下对 35B 强基座外部迁移不均匀(BFCL 降至基座下)——提示「合成环境+生成验证器」的增益可能与基座强度交互,机制优先的同源奖励在强基座上更稳 |
| Agent World Model(arXiv 2602.10090,ICML 2026) | 全合成 1000 个代码驱动 + SQLite 环境做 RL | 纯合成环境训练在三个基准上 OOD 泛化强;强调代码驱动状态转移比 LLM 模拟可靠 | 奖励仍是生成后定义的验证模块 | 补充:其「代码驱动优于 LLM 模拟」的结论与 VHD-Play 的动力学实现选择一致;但其奖励先于验证器生成,恰是机制优先要修正的顺序 |
| Qwen-AgentWorld(arXiv 2606.24597) | 训练语言世界模型模拟 7 域环境用于 RL | 学习型模拟器可扩展训练,但保真度决定迁移上限 | 世界模型的「物理」是学出来的;VHD-Play 的「物理」是数学模型 | 对照:代表「学习环境」与「形式环境」两条路线;VHD-Play 用确定性求解器换掉保真度问题,代价是场景限于可形式化机制 |
| Tulu 3 / RLVR 综述与工业实践(多来源) | 用确定性验证器替代学习型奖励模型 | 验证器无噪声、不可梯度攻击、成本近零,是 R1 等推理模型的标准配置 | 传统 RLVR 验证的是最终答案 | 支持:两篇论文把 RLVR 从「验证答案」推向「验证轨迹/交付物」,继承并扩展了同一可信性机制 |
| Reliability without Validity(arXiv 2606.19544) | 21 个 LLM 裁判、54.1 万次判断的系统性审计 | 精确匹配一致率高估判别力 33-41pp(kappa 缩水);高重测信度与重位置偏见并存 | 评估场景而非训练场景 | 支持:为 VHD-Play「评分路径不进语言模型」的设计提供独立动机;注意其为评估场景结论,对训练中 reward hacking 的外推属合理推断而非直接证明 |
| Anthropic Agent Skills 工程博客(2025) | SKILL.md 渐进披露、推理时技能加载 | 技能生态被定位为推理时能力扩展,官方愿景是让 Agent 自我沉淀技能 | 非研究论文;无训练实验 | 支持:SkillGym 顺延该生态,把「技能在推理时被用」翻转为「技能执行经验被训练」;Clawhub 注册表正是其技能源 |
| AgentScaler / Echoverse / Beyond Simply Environment Scaling(ACL 2026 系列综述转述) | 环境数量扩展、深度设计、难度课程 | 环境数量增益递减;分布设计(多样性+难度结构)比堆量重要 | 转述来源,未逐篇核验原文 | 补充+限定:与 VHD-Play 的 co-scaling 发现互证——环境设计质量与难度结构是关键变量;但该综述结论来自另一批实验条件,不能直接当作因果证明 |
方法相似 vs 结论相近的区分:EnvScaler/AWM 是「方法相似」——同为环境合成,但构造顺序不同,其结果在强基座上的退化恰好构成对机制优先的反事实验证;ExpRAG 与 RLVR 工业实践是「结论相近」——从不同出发点得出「可信信号+内化训练优于单一外挂或学习型奖励」的一致结论,对根源解释的支撑是间接但多源的。
6.3 综合判断与未决问题
得到多项研究共同支持的机制:
- 确定性验证优于学习型评判(作为奖励来源):RLVR 在数学/代码上的成功(DeepSeek-R1 等)、EnvScaler 对照的反面教材、LLM 裁判审计的系统性缺陷,加上两篇论文各自的实验,四个独立来源指向同一结论。
- 执行经验可内化为参数能力:SkillGym 的 w/o 技能反超、ExpRAG 的微调+检索组合、Voyager 反衬的外挂局限,三方互证。
- 环境与策略可共同扩展:VHD-Play 的 co-scaling 实验(增益随规模从 +0.41 涨到 +0.86)与 ACL 2026 环境设计系列的「分布重于数量」结论方向一致(后者条件不同,作旁证)。
仍属推测或单源支持的机制:
- SkillGym 的对比式依赖测试是否是必要组件——无直接消融,类别间依赖率差异只提供间接暗示。
- VHD-Play 的 F/I/A 三形态结论能否推广到非优化机制——三形态设计精巧但机制族同质(均为可形式化决策问题),在感知丰富或语言主导的任务上「状态化缺口」的构成可能完全不同。
- 增益的「能力激发」解释依赖 KL=0.089 与工具采用分解两个间接证据,非直接因果证明。
优势成立的条件:SkillGym 路线要求技能文档已大量存在且可机器落地(依托 Clawhub 生态),验证器能覆盖任务目标(交付物可检查);VHD-Play 要求机制可参数化、可执行实现、可控制信息不对称、结果标准可在交互前固定——论文自己概括为「任何满足这四条的形式机制都可扮演类似角色」。
可能的失效条件:奖励与目标错位时(验证器只查部分要求),两条路线都会被钻空子——SkillGym 的反捷径检查是对此的局部防御而非根除;VHD-Play 在 hindsight 上界不可在线达到的族(序贯停止/搜索)里分数语义要谨慎解读;两者对「无 ground truth 的开放性任务」(品味、创作)都暂无答案。
未决问题:SkillGym 宣称支持 RL 但未做——SFT 蒸馏教师轨迹与 RL 自探索在该环境集上的增益分配未知;VHD-Play 的 11 族均为教科书机制,「机制优先」如何覆盖非形式化领域(或证明不需要覆盖)是路线之争的关键开放问题;两条路线本身可以组合——用 SkillGym 式验证器给 VHD-Play 式生成环境提供更广的目标覆盖,或用机制优先的可信奖励驱动技能环境的 RL——目前没有工作做这个乘法。
七、必要知识反推
假设让一个零基础的人从零完成这两篇论文,最少必须掌握什么?
7.1 领域知识层
- Agent 交互的基本结构:骨架(harness)—模型—环境三元分工;动作-观察序列;回合预算。不理解这个就无法解释为什么换骨架会改变同一模型的成绩(SkillGym 的 Codex 基座 TB 2.1 仅 10.11% 而 Claude Code 下 39.33%)。
- 人类技能生态:SKILL.md 约定、渐进式披露、Clawhub 注册表的组织方式——SkillGym 的数据源与分类体系直接建立在其上。
- 运筹学模型族谱:库存论、车辆路径、背包、LP/QP、调度、最优停止、Weitzman 搜索的数学形式与求解算法(Bellman 递归、Held-Karp、HiGHS、SLSQP、Smith 规则)——VHD-Play 的 11 个族是现成教科书内容,但要能判断「哪个族的参考值可计算、信息结构可设计」必须真懂这些模型。
- 部分可观测决策过程(POMDP):探测动作与决策动作共享预算、隐含状态包含参数抽取——信息不对称接口的理论语言。
7.2 方法论知识层
- RLVR 范式谱系:从 Tulu 3 命名到 R1 规模化,验证器类型(精确匹配/单元测试/格式正则)与已知失败模式(验证器噪声、稀疏奖励死组)——两篇论文都站在「把验证对象从答案扩展到轨迹」的延长线上。
- GRPO/策略优化细节:组相对优势、无价值模型、KL 惩罚取舍——VHD-Play 的训练配置每一项都是对该知识的调用。
- 构造顺序的形式化:环境优先 vs 机制优先的依赖图(Eq. 1)——这是 VHD-Play 最核心的方法论抽象,需要能把「先有 E 还是先有 R」表达为工件可用性偏序。
- 对比实验设计:F/I/A 三形态控制变量(同题同评不同呈现)、同预算对照(EnvScaler 实验)、固定分层分解(Oaxaca-Blinder)——工具箱级别的知识。
7.3 工程知识层
- Docker 化环境工程:可复现执行、依赖封装、访问接口——SkillGym 2,756 个环境的载体。
- 验证器工程与反作弊:文件检查、结构化输出比对、schema 验证、终态检查,以及输入篡改/答案抄袭/伪造输出的检测模式。
- LLM setter 的能力边界评估:如何设计「setter 只实现不发明」的职责收缩,如何用录取率/尝试次数/接口精修率量化 setter 容量——VHD-Play 的关键工程结论。
- 大规模采样与审计:多骨架-模型组合采样的调度;480 次重放审计、10 环境×8 族分层抽样的审计设计。
7.4 知识融合的关键节点
- 节点一(SkillGym):技能卡 × 模板的分离式落地。把「流程知识」与「考核结构」拆开再正交组合——这个设计让 63 个子类共享构造逻辑,是把生态级技能库变成千级环境的支点。需要的融合:对技能生态的结构理解 × 对任务模板化工程的判断。
- 节点二(SkillGym):对比式依赖测试的判据化。把哲学问题「技能是否必要」翻译成二元实验 (r⁺, r⁻)——需要融合实验设计方法论与对「经验证据 vs 普遍断言」的边界意识(论文对标签语义的双重诚实标注就是这种意识的体现)。
- 节点三(VHD-Play):预解模型的一物两用。发现「解」同时携带动力学语义与评估语义——需要融合运筹学(模型可解性)与 RL(奖励来源问题)两个原本少有交集的知识域。
- 节点四(VHD-Play):信息边界的接口化。把「部分可观测」从环境固有属性变成 wrapper 的设计旋钮(Ω_θ 与动作集属于包装层)——需要融合 POMDP 理论与软件接口设计思维。
- 节点五(两篇共有):信任的工程化。都不试图让评估更聪明(更好的裁判),而是让评估不需要被信任(机械事实)——这是对「可信性来自何处」这一认识论问题的工程回答。
八、论文中可以提取的通用性灵感
灵感一:范式迁移——把「读知识」改成「练知识」
- 核心思想:任何以文档/指令形式存在且被反复查询的知识,都可以尝试转化为「可执行 + 可验证」的练习环境,让使用经验沉淀为系统能力。
- 论文证据:SkillGym 用技能执行轨迹 SFT 后,不带技能反超带技能基座(24.51 vs 23.34)。
- 推广场景:(1) 企业内部 SOP → 新员工培训模拟器 + 考核系统;(2) API 文档 → 开发者 Agent 的训练环境;(3) 临床诊疗指南 → 医学生虚拟病例系统;(4) 法律实务手册 → 检索/起草 Agent 的演练场;(5) 游戏攻略库 → NPC 策略训练环境。
灵感二:机制类——先固定评价标准,再造被评价对象
- 核心思想:当评价规则与被评价对象分开构造时,两者的缝隙会被优化器利用;把评价标准锚定在构造之前的独立事实上,可信性有了本体论来源。
- 论文证据:VHD-Play 的 z_θ 在环境生成前由求解器算出,C3 准则机械检验一致性;对照 EnvScaler 组原生奖励涨到 0.854 但外部 BFCL 降到基座之下。
- 推广场景:(1) 招聘——先定结构与评分锚点再看候选人,而非看完再定标准;(2) 自动化测试——验收标准与需求同时冻结(行为驱动开发的强化版);(3) 教育——先命题后教书的「以考定教」反转;(4) 智能体评估——基准的 ground truth 生成时间应早于被测系统的构造时间;(5) 区块链 oracle——价格锚点来自链外既有事实而非请求时计算。
灵感三:信号利用类——归一化需要双锚点
- 核心思想:给连续反馈信号同时固定上锚点(最优)与下锚点(默认/躺平),分数才获得绝对含义并可跨实例比较。
- 论文证据:r = clip (u − u⁰)/(u* − u⁰),默认策略映射 0、全信息最优映射 1;「拿到最优与躺平之间百分之几」取代「裁判觉得不错」。
- 推广场景:(1) 绩效管理——以「团队历史最优 vs 什么都不做」定标尺;(2) 算法基准——以「SOTA vs 随机基线」归一化跨数据集分数;(3) 自动评分——作文以「范文上限 vs 空写下限」定区间;(4) 医疗质控——以「临床路径最优 vs 不干预」框定干预价值。
灵感四:对比类——依赖性要用减法证明
- 核心思想:判断某输入/组件是否真的有用,做减法实验(去掉它看是否失败),不要做加法断言(有它时成功了)。
- 论文证据:Skill-Dep. 标签只授予 (r⁺, r⁻) = (1, 0) 的任务;39.2% 的任务通过该检验,其余诚实降级为兜底任务。
- 推广场景:(1) 特征工程——逐特征剔除而非只看加入后 AUC;(2) prompt 工程——对照「无该指令」而非只看「有该指令」;(3) 咨询诊断——先问「去掉这个部门会坏什么」再决定价值;(4) 依赖管理——安全删除候选:删掉后测试仍绿的真依赖才警告;(5) 教育评估——开卷/闭卷双设定分离「检索能力」与「内化能力」。
灵感五:跨域能力迁移——用形式学科的既有解法库做「题库发动机」
- 核心思想:成熟学科(运筹学、形式逻辑、组合数学)积累的模型族 + 求解器是现成的「题目 + 标准答案」发生器,参数重采样即得无限实例。
- 论文证据:11 个教科书机制族 × 参数抽取 × 28 域语料种子 = 3,300 环境,$0.01-0.03 一个。
- 推广场景:(1) 形式验证——SMT 求解器生成带证明的随机电路测试;(2) 游戏开发——用图论生成器量产关卡并自带通关 par 值;(3) 金融风控——随机生成的市场模型 + 解析对冲最优解做策略回测;(4) 教育测评——参数化命题自动携带答案与难度分层。
灵感六:关注点分离类——让生成模型只做「实现者」不做「发明者」
- 核心思想:缩小生成模型的职责范围(从发明任务+规则收缩到仅实现给定规格),能力门槛骤降、产出可控性骤升。
- 论文证据:被训练的 35B 检查点自己就能当 setter(70% 录取率);机制与解已被数学模型给定,setter 只做语料落地与包装。
- 推广场景:(1) 代码生成——先给形式规约再让 LLM 写实现(spec-first);(2) 数据合成——先定 schema 与不变量再让 LLM 填充内容;(3) 流程自动化——人类定控制流、LLM 只填叶子节点;(4) 文档写作——先定大纲与事实清单再让模型成文。
灵感七:自进化类——环境可以比当前策略更难,且这正是滚雪球的燃料
- 核心思想:如果一个构造系统能产出「当前策略做不好但未来策略可以学会做好」的挑战,且评价标准在扩展中保持不变,那么环境生成与策略学习可以互相追赶、共同扩产。
- 论文证据:co-scaling 实验——同一冻结构造器在四档规模上的训练增益从 +0.41 涨到 +0.86;同一检查点能构造出比自己当前能驾驭的更难的环境(11×11 上基座 0.085 vs 训练后 0.946)。
- 推广场景:(1) 自适应教育——出题系统始终保持在学生能力前沿上方一点;(2) 自动红队——攻防系统互相促进的预算受控版本;(3) 自动课程学习(curriculum)——难度由机制参数旋钮连续控制;(4) 科学仪器——先造出超越当前分析能力的探测器再发展理论。
附录:速览卡片
A. 一句话对比
- SkillGym:把人类写好的操作手册改造成驾校考场,让模型在真实方向盘后面练出肌肉记忆——练完裸考超过没练过的开卷。
- VHD-Play:先算出标准答案再反推题库,评分标准与题目同时印刷——彻底没有「裁判能不能被收买」这个问题。
B. 关键数字备忘
| 指标 | SkillGym | VHD-Play |
|---|---|---|
| 环境规模 | 2,756 环境 / 12 类 63 子类 | 3,300 录取环境 / 11 机制族 / 28 主题域 |
| 轨迹/回合 | 8,364 成功轨迹,均值 49 工具调用 / 35.2 步 / 63.4k tokens | 回合中位 31 / 均值 59.7 / P95 211;storefront 达 1,147–1,825 回合 |
| 采样成功率 | 17.4%(48,152 试) | setter 首试录取 65.6%;审计 480 执行零异常 |
| 单位成本 | 4.5 小时/任务(构造) | $0.01–0.03/录取环境 |
| 训练配方 | SFT(全参,16×H200) | GRPO(2,200 环境 / 34 步 / 34,816 rollouts) |
| 旗舰数字 | GDPval-AA v2 +199 Elo;SkillsBench 51.47% 超 Sonnet 4.6 | 五族均值 0.204→0.815;storefront 3.4× 超 Qwen3.7-Max |
C. 阅读提示
两篇论文都刻意区分了两类容易混淆的量:SkillGym 反复强调任务级标签(构造期验收)≠ 轨迹级奖励(单次执行结果);VHD-Play 反复强调训练奖励曲线(在训练实例上)只证明优化在进行、held-out 评估才证明迁移。这种对「哪个数字证明什么」的克制,是判断 Agent 训练论文质量的一个可用信号。