论文一:SkillFM: Generating Skills for LLM Agents via Latent Flow Matching | 代码 论文二:Prompt2Skill: Unsupervised Skill Optimization From Natural Language Instructions | 代码 论文三:SkillGym: Training Skill-Use Agents with Automatic Verifiable Environment Generation | 代码 发表时间:均为 2026 年 9 月末(9 月 29–30 日 arXiv) 机构:SkillFM——南洋理工大学 + 爱丁堡大学 + Meta(产学研);Prompt2Skill——Vanderbilt + 南加州大学 + Adobe(产学研);SkillGym——穆罕默德·本·扎耶德人工智能大学(MBZUAI,Timothy Baldwin 组) 领域标签:cs.AI / cs.CL,Agent Skills、生成式建模、无监督优化、数据合成


〇、合读导览:为什么把三篇放在一起读

2025 年 10 月 Anthropic 发布 Agent Skills 生态后,「skill」——一份插入 Agent 上下文的可复用操作手册——迅速成为现代 Agent Harness(Claude Code、Codex CLI、OpenClaw)的标配资产。当社区 skill 库滚到十几万量级(skills.sh 单站即收录约 9.7K 精选 skill),围绕 skill 的问题自然分化成三个阶段:

  1. 供给阶段:skill 从哪来?手工写太贵,从执行轨迹里沉淀又需要不断维护 skill 库——能不能直接「生成」?
  2. 定制阶段:通用 skill 不贴合具体模型与具体任务描述——能不能只凭一句话需求,无监督地「定制」?
  3. 消费阶段:skill 给了,模型却不会用——能不能系统性地「训练」模型用好 skill?

本篇合读的三篇论文恰好各占一阶段:SkillFM 把 skill 库「内化」成一个潜空间生成模型,从「检索」范式转向「生成」范式;Prompt2Skill 去掉「带标注训练集」这一前提,仅凭自然语言任务描述构建目标模型专属的优化 skill;SkillGym 反过来从 18.4 万公网 skill 出发反向合成可验证任务环境,用 19K 验证过的轨迹做 SFT,教会模型「先去读 skill」。三篇放在一起,构成 skill 作为一种「资产」的完整生命周期工程:生产 → 定制 → 消费。

三篇也有一个共同的暗线:skill 的价值必须可测量,才能被系统化地优化。SkillFM 用任务成功率为生成器提供间接监督,Prompt2Skill 构造可执行的代理评估器 μ̂,SkillGym 干脆为每个任务写一个可执行 verifier——「可验证性」是三篇工作共同的地基。


一、论文背景

1.1 什么是 Agent Skill?

对于不熟悉 Agent 生态的读者,先把概念补全。LLM Agent(智能体) 是以大模型为大脑、能感知环境、规划、调用工具、执行多步操作的行动主体。而 Skill(技能) 是一份结构化的自然语言文档(通常是一个 SKILL.md 文件加附属脚本、参考资料),在推理时被放进 Agent 的上下文,为它提供特定领域的程序性知识——就像给一位通才型员工发一份「岗位操作手册」:员工本身很聪明,但面对特定领域任务时,一份好手册能让表现产生质变。

一份典型 skill 包含三部分:任务求解流程(先做什么后做什么、异常怎么办)、领域知识(术语、约定俗成的规则)、操作指南(工具怎么调、常见陷阱)。它的最大优点是无需权重更新——换个 markdown 文件就能给模型「装」上新能力,这使 skill 成为 2026 年 Agent 生态里增长最快的资产类别。

1.2 供给困境:检索式 skill 复用的三重诅咒(SkillFM 的动机)

当前主流的 skill 自进化系统由三个组件构成:检索器(从 skill 库里选相关 skill)、执行器(带着 skill 干活)、总结器(把执行轨迹蒸馏成新 skill 或修订旧 skill)。这个「检索—执行—总结」循环让经验得以积累,但也带来三个结构性问题:

  • 归因难:一条 skill 更新是否有用,在入库时看不出来,往往要到很多个之后的任务上、多条 skill 被组合使用后才能评估——反馈既延迟又间接,很难判定哪条 skill 该留、该改、该删。
  • 检索不准:库越大,相关程序越容易被相似但冗余甚至误导的条目淹没。「More skills, worse agents?」这篇论文(arXiv:2605.24050)专门研究了 skill 库扩张导致的「skill 遮蔽」退化。
  • 维护贵:效用估计、检索优化、剪枝……每一样都要系统同时维护 skill 本体和「管理 skill 的规则」,还要和策略优化协同训练。

另一条路线是把 skill 内化进权重:Skill0 通过强化学习逐步撤掉 skill 上下文把程序性知识压进策略;LatentSkill 把文本 skill 编译成模块化 LoRA 适配器。但前者绑定执行策略,后者仍需要一段合适的 skill 描述作为输入——它们都没有回答:能不能学会「生成」任务所需的 skill? 这是 SkillFM 的切入点。

1.3 定制困境:没有训练集怎么优化 skill?(Prompt2Skill 的动机)

skill 供给的另一个方向是自动优化。Trace2Skill 把执行轨迹归纳成 skill 目录;SkillOpt 把 skill 创建建模为受控文本空间优化——优化器模型把打分后的 rollout 转成对 skill 文档的有界增删改编辑,只有严格提升留出集分数的编辑才被接受。

但这条线有个隐藏前提:你得有一批带标签、同分布的训练任务。此前研究显示,训练集缩到单个样本时,SkillOpt 的增益会塌缩到与「无视数据的草稿」相当。而现实中,一个用户往往只有一句需求——「我想要一个能读维基百科段落并回答相关问题的模型」——没有标注数据,更谈不上同分布。同时,专家写的 skill 昂贵且不针对特定模型:每个模型的失败模式随版本、规模、训练方式而变,一份给 GPT 写的 skill 套到 Llama-1B 上可能严重负增益。如何仅凭自然语言任务描述、零训练样本、零权重更新地构建「模型专属」skill? 这是 Prompt2Skill 的问题设定。

1.4 消费困境:模型根本不会用 skill(SkillGym 的动机)

即使 skill 供给充足,还剩最后一公里:模型得会用。有效使用 skill 需要模型解读 skill 内容、判断如何适配当前任务、把文档翻译成恰当动作——一份工作流文档可能要求适配可用输入、解决依赖、应对意外执行结果。SkillGym 的行为分析给出了刺眼的基线数字:Qwen3.5-9B 在只有不到三分之一的任务里会去打开相关 skill(Trigger 率 28%)——skill 摆在面前都不读,遑论用好。

现有的 skill 使用训练方法大多「从固定环境中 agent 自身经验导出 skill」(SkillRL、SAGE、Skill-to-LoRA 等),技能学习被锁死在少数几个任务域。而公网社区 skill 横跨软件工程、科学、金融、文档处理、营销等 18+ 领域——问题是这些 skill 是按「可复用资源」写的,不是按「训练材料」写的:没有任何一个附带任务、环境或成功判定。把存量 skill 资产转成可靠训练数据,要解决两个硬问题:其一,任务必须 skill-critical——用 skill 会显著影响成败,但不至于无 skill 完全不可解(否则学到的是「绕过 skill」或「死记 skill」);其二,结果必须可靠可验证——验证器要能识别合法的替代解法、区分真正的完成与表面正确的输出。这是 SkillGym 的战场。


二、论文定位和关联工作

三篇论文各自站在不同的研究谱系中,下面分谱系统一梳理。

2.1 谱系一:skill 内化与参数化(SkillFM 的坐标系)

工作核心思想与 SkillFM 的关键区别
Voyager / ExpeL从交互中积累 skill 库,检索复用仍是测试时检索,SkillFM 直接过掉检索
Skill0(arXiv:2604.02268)课程 RL 中逐步撤出 skill 上下文,压进策略权重知识绑定执行策略,不可跨执行器迁移
LatentSkill(arXiv:2606.06087)文本 skill 编译成模块化 LoRA仍需 skill 文本作输入;LoRA 绑定骨干网络
SHINE / Text-to-LoRA上下文→LoRA 超网络权重形态不可跨家族移植;SkillFM 输出文本接口
SkillOS / SkillRL / MemSkill学习 skill 策展、递归更新、协同进化都需要测试时库管理循环;SkillFM 离线内化后摆脱

SkillFM 的定位结论:它是第一个用潜空间流匹配直接生成文本 skill 的工作,且刻意保留文本输出接口,使同一个生成器能驱动 GPT、Llama、Mistral 等异构冻结执行器——这是与全部「参数化 skill」路线的本质差异。

2.2 谱系二:提示优化与 skill 自动创建(Prompt2Skill 的坐标系)

工作核心思想与 Prompt2Skill 的关键区别
APE / ProTeGi自动生成、批判式编辑指令提示仍需带标签评估集;作用对象是提示非 skill
GEPA(arXiv:2507.19457)反思执行反馈 + Pareto 候选搜索同上,依赖标注数据
Trace2Skill(arXiv:2603.25158)执行轨迹归纳成可迁移 skill 目录需要轨迹语料;Prompt2Skill 连数据都不要
SkillOpt(arXiv:2605.23904)有界编辑 + 验证集门控的 skill 文本优化需带标签同分布训练集——Prompt2Skill 移除的正是这个前提
Prompt2Model(arXiv:2308.12261)任务描述→检索/合成数据→微调模型产出是微调权重;Prompt2Skill 产出 skill、零权重更新(附录 B 中两者正面对比)

Prompt2Skill 的定位结论:它把「prompt-to-X」家族从「生成数据 + 微调」(Prompt2Model)推进到「生成数据 + 优化上下文技能」,是首个端到端的多 agent「描述→skill」框架,其真正新颖之处在于问题设定(无监督 skill 优化)而非单个组件。

2.3 谱系三:任务/环境合成与 skill 使用训练(SkillGym 的坐标系)

按「合成管线由什么驱动」分三支:

  • 任务驱动:Endless Terminals、CLI-Universe——从任务描述反推环境容器;
  • 环境驱动:EnvScaler、Agent-World——先收集环境主题再合成任务;
  • 技能驱动:SKT(arXiv:2608.02287,同期平行工作)从 skills.sh skill 合成模板化任务包训练 agent;SkillGym 同属此支但更系统:显式围绕四种推理结构建任务、并用 reviewer 审计验证器是否过严/过弱/泄漏答案。

与训练侧前作的对比:Skill-to-LoRA 用合成轨迹训 skill 专属适配器,SAGE 用 skill 增强RL 改进 skill 创建与利用,SkillRL 从 SkillBank 联合进化 skill 库与策略——这些方法把 skill 编进权重或锁在小环境集合;SkillGym 则保持 skill 外置,训练「使用公开 skill」的通用能力(3.5K skill、18 领域),且学到的东西迁移到训练中未见过的 skill。

2.4 合读定位总结

维度SkillFMPrompt2SkillSkillGym
生命周期阶段供给(生成)供给(定制)消费(训练)
输入离线 skill 库(任务-skill 对)一句自然语言任务描述18.4 万公网 skill
输出任务条件化的新 skill 文本目标模型专属的 SKILL.md19K 轨迹 + SFT 后的模型权重
是否动模型权重否(冻结执行器)否(冻结目标模型)是(SFT)
核心范式转换检索 → 生成有监督优化 → 无监督优化从环境导 skill → 从 skill 造环境
共同地基可测量的 skill 价值信号(任务成功率 / 代理评估器 / 可执行验证器)同左同左

三、问题定义

三篇论文各自把工程问题抽象成了什么数学问题?这一步最能看出各自的味道。

3.1 SkillFM:skill 生成 ≈ 潜空间条件生成建模

具体问题:新任务来了,不再去库里检索,直接生成一份可读 skill。 抽象问题:把 skill 建模成连续潜空间中的点,学一个「任务条件 → skill 潜码」的生成分布。

形式化:给定固定 bank 中的(条件 c,skill s)对(c 含任务类型与原始指令,s = (s₁,…,s_L) 含适用条件与执行步骤)。学三件事:

  1. 编码器 E_φ(s) → z ∈ R^d(‖z‖₂=1,单位球面);
  2. 解码器 D_ω 在条件 c 下从 z 重建 s:p_ω(s | z, c) = ∏ p_ω(s_j | s_{<j}, P_ψ(z), c);
  3. 条件流模型 u_θ(x_t, r, t, q)(q 为任务编码)拟合从噪声到 skill 潜码的速度场,推理时单步采样。

精妙之处:把「skill 库管理」这个离散、组合、反馈稀疏的问题,转化成一个连续空间上的回归/生成问题——流匹配的监督信号(配对速度 ε−x)是即时、稠密、无歧义的,从根源上消解了 1.2 节所述「延迟间接反馈」的归因诅咒。skill 库从「运行时要检索维护的资产」降格为「离线训练语料」。

3.2 Prompt2Skill:skill 优化 ≈ 无分布信息的代理优化 + 统计选择

具体问题:用户只有一句描述 d,例如「我想要一个读文章答问题的模型」。 抽象问题:目标分布 D 从未被观测,任务仅由自然语言描述 d 隐式指定(d 同时隐式固定了分布 D 与度量 μ,但系统两者都看不到)。求程序 A: (d, E, M, R, G, B) → ŝ,使 J(ŝ) = E_{(x,y)∼D}[μ(M_s(x), y)] 最大——J 只能在事后测试集上度量。

精妙之处:论文诚实地把「系统对任务的理解」(代理度量 μ̂_τ)与「任务真实度量」(μ)区分开,并给出 Theorem 1:在 TV(D, D̃) ≤ ε_dist、评估器失配 ≤ ε_eval 条件下,冻结选择集上选出的 skill 满足 J(ŝ) ≥ max J(s) − 2(ε_dist + ε_eval) − √(2log(2K/δ)/n)。这个界把「无监督」问题重述为控制两类代理失配 + 控制选择估计误差——误差来源被拆解得清清楚楚,框架的每个组件(数据验证、配对检验、冻结选择集)都各自压一项误差。

3.3 SkillGym:skill 使用训练 ≈ 从资产反向合成可验证环境

具体问题:公网 skill 没有 accompanying 任务/环境/判定。 抽象问题:构造任务五元组 T = (u, E, x₀, v, ρ)——指令 u、可执行环境 E、初始工作区 x₀、可执行验证器 v、参考解 ρ——满足两条硬约束:

  • skill-critical:至少一个关键步骤依赖 skill 特有知识(指令中不给出),但任务保持无 skill 也可解(保证学的是「用」而非「背」或「绕」);
  • 可验证:v 接受任意合法解法、拒绝表面正确的错误输出,且必须满足有效性门 v(x₀) = 0 ∧ v(Exec(ρ; E, x₀)) = 1(初始状态必失败、参考解必通过)。

精妙之处:把「数据质量」这个模糊概念操作化为可执行的谓词。skill-critical 性本身也被实验验证:让最强教师 Kimi-K3 做测试,无/有 skill 成功率 60.5%→68.8%(McNemar 检验 p≈10⁻⁴,52 题只有 skill 解出、19 题只有无 skill 解出)——任务确实「因 skill 而易、不因 skill 而封」。

3.4 三者的问题定义对照

监督信号前提假设被移除的内容
SkillFM任务-skill 对(离线库)移除「测试时可检索到正确 skill」假设
Prompt2Skill自建代理数据 + 代理评估器移除「存在带标注训练集」假设
SkillGym可执行 verifier 的二值结果移除「训练环境必须人工构建」假设

一个值得玩味的递进:SkillFM 假设有 skill 库,Prompt2Skill 连库都没有(只有描述),SkillGym 则把「库」本身变成训练环境的原料——三者的前提逐级放缩,恰好铺满生命周期。


四、问题解法

4.1 SkillFM:codec + improved MeanFlow 的两阶段流水线

类比先行:这套架构相当于「skill 界的 VAE + 扩散生成」。codec 像 VAE——把离散文本压进连续潜空间并能解码回来;流模型像扩散模型——学从噪声到数据的映射;improved MeanFlow 像蒸馏——让采样一步到位。

阶段一:skill 收集与 codec 训练

  • skill 收集:执行器(Qwen3-8B)在训练任务上迭代执行,总结器(Qwen3.6-27B)从成功轨迹蒸馏可复用程序(固定输出三字段 JSON:when_to_use / high_level_guidance / low_level_guidance),余弦相似度去近重复,成功率不再提升即停,形成固定 (c, s) 对(ALFWorld 3,553 对、单跳 QA 4,000 对、多跳 2,723 对、WebShop 2,000 对)。
  • codec 结构:编码器只读 skill(不读条件),用 Qwen3-Embedding-4B 末态与短尾部平均池化后归一化,得 2560 维单位球码;投影器 P_ψ(LayerNorm+Linear)把 z 映射为 K=16 个连续前缀嵌入,喂给 Qwen3-4B-Instruct 解码器做 teacher-forcing 重建,损失只算 skill token 与终止符。
  • 球面扰动增强:这是 codec 最有想法的设计——以 0.75 概率把训练码替换为 z̃ = cos(α)z + sin(α)v(v 为垂直随机单位向量,α 标准差 0.16 rad、8 epoch 渐进拉满)。为什么必须:流模型推理采样的潜码不可能精确落在训练码位置,decoder 必须对邻域码也稳健,否则生成码稍微偏一点就解码失败。这相当于给 codec 学了一个「带噪声信道」的解码鲁棒性。

阶段二:条件流训练(improved MeanFlow)

冻结 codec 与查询编码器,把码缩放到 √d·E_φ(s) 匹配高斯噪声的 RMS 范围。标准流匹配训练瞬时速度场,而 MeanFlow 学的是区间平均速度——使得单步采样在数学上自洽。improved MeanFlow 的关键改进是复合预测:

V_θ = u_θ(x_t, r, t, q) + (t−r)·stopgrad(D_t u_θ)

其中 D_t u_θ = ∂t u_θ + (J{x_t}u_θ)b_θ 用 JVP 计算,b_θ = u_θ(x_t, t, t, q) 为对角评估即瞬时速度估计。附录 A 严格证明了该目标与目标形式 stopgrad[v_pair − δA_θ] 的梯度等价性,以及总体回归解释——回归目标本质上是边缘速度场 v*(配对速度的条件均值),配对噪声 ξ 成为与 θ 无关的不可约项。流网络是 12 层 DiT(宽 768),query、时间 t、区间长度 t−r 通过 adaLN-Zero 注入每个块。

推理:单步生成 skill——给定新任务,算 q,采高斯噪声 y₁,一次前向 y₀ = y₁ − u_θ(y₁, 0, 1, q),归一化回单位球得 ẑ,冻结解码器贪婪生成 skill 文本,冻结执行器带着 skill 干活。全程 NFE=1,没有任何测试时库查找。

全景:skill 库(离线语料)→ codec(潜空间接口)→ 流模型(任务→潜码映射)→ 解码器(潜码→可读文本)→ 冻结执行器。信息流单向、组件各司其职——消融将证明每个组件都不可省。

4.2 Prompt2Skill:Data Agent + Skill Agent 的双代理流水线

类比先行:Data Agent 像「自动文献调研员」,Skill Agent 像「做对照实验的工程师」——前者在没有实验材料时把材料找齐/造出来,后者用统计严格的实验协议迭代改进。

任务建立:f_setup(d, E) 联合产出任务规范 τ(输入结构、任务类型、语言、答案风格、可执行代理度量 μ̂_τ——归一化精确匹配/数值等价/包含判定)与种子 skill s₀(1–2 句极简系统提示)。μ̂_τ 与 μ 的区分是全框架诚实性的锚点:前者是系统对请求的理解,后者才是真实任务表现。

Data Agent:三步构造代理数据池

  1. 检索:从任务规范生成检索请求(HF 数据集目录 + Wikipedia 两个工具),还让 agent 先写一份「假想中的完美数据集卡片」再从中提取搜索词——用假想卡反向引导检索,这个小技巧显著提升发现率。
  2. 适配:检索到的源往往字段不匹配(如有文章有问题但缺参考答案),agent 检查样本行后产出转换计划(选输入列/输出列、行转换),可执行变换 T_π 把记录转成 (x, y) 对。
  3. 合成:结构转换不够时,从检索材料生成新题——生成提示要求题目自包含、可客观作答、且「专门锻炼当前弱点、比示例略难」。

每条数据要过验证:结构完整性、与规范 τ 的兼容性(语言/答案风格/输入完整性逐项比对)、答案可用性筛选(带种子 skill 的目标模型在源样本上至少做对一题,否则整个源被拒——挡掉不可用参考答案与输入错配)、合成项一致性检查(种子模型或裸模型至少一个做对)。最后去重成池 P。

P 的三用途划分是优化协议的骨架:反思集 T_t(供失败分析)、每轮新鲜接受批 B_t(供候选 vs 现任对比)、冻结选择集 V(初始化即固定,只用于终选)。

Skill Agent:反思编辑 + 配对统计接受

每轮:现任 skill s_t 在 T_t 上 rollout 收集失败反馈 → 反思编辑器提出 K 个候选(编辑规则严格禁止主题特定规则——只许过程性指令如「如何分解输入、如何验证候选答案、如何选粒度与格式」,禁止「当输入是 X 就做 Y」式的补丁,保证泛化)→ 候选与现任在同一个新鲜批 B_t 上配对评估:wins w(只有候选做对)、losses ℓ(只有现任做对),接受条件为 w > ℓ 且 z = (|w−ℓ|−1)/√(w+ℓ) ≥ κ=1(带连续性校正的筛选统计量;注意 κ=1 是单候选筛查阈值而非 5% 显著水平,论文对此很诚实)→ 取净增益最大者成为新现任,文本存档。

终选:全部被接受过的 skill + 初始 skill 在冻结集 V 上一次性比较,最高分导出为 SKILL.md。这个设计直指自适应优化循环的经典隐患——最后一代 incumbent 未必是全程最优,被中途某批「侥幸」接受的 skill 可能在后续轮里退化。Theorem 1 保证:只要保留全部历史接受项,终选的损失被 2(ε_dist+ε_eval) + 选择误差一致有界——「保留历史 + 独立终选」是防自适应过拟合的结构性保险。

4.3 SkillGym:skill 策展 → builder-reviewer 双阶段构造 → 多 harness 轨迹采集

类比先行:builder-reviewer 像软件工程里的「开发—代码审查」对;三种门控像 CI 流水线;四种任务档案像教练给同一批学员设计的四类训练课目。

阶段 I:skill 爬取与策展。从 skills.sh(约 9.7K 精选)与 claude-skill-registry(GitHub 聚合,17.5 万条目)爬取共 184,430 条,抓取去重后 51,131 个真实 skill;规则 + LLM 三维标注(基本属性/运行时要求/质量,人工抽检 100 个一致率 94%);硬性筛选——英文、非归档非批量发布、≤300 文件、无网络、无 GPU、无交互输入、无破坏性动作——得 11,897 个可离线复现的 skill。这个漏斗本身就说明「公网 skill 可训练化」的可行性边界。

阶段二:四档案任务构造。每个任务档案是一段插入 builder 系统提示的契约,核心是四种推理结构:

档案结构验证要点难度设计举例
程序性线性依赖链,步骤 k 消费步骤 k−1 产物每步一个 PASS/FAIL至少两个来自 skill 自述警告的边界情形;纳入/排除陷阱
溯因诊断系统行为错误,需推断未言明的隐因并修复重算全部病人/组件得分隐因植入「朴素代码写错 skill 文档化的注意事项」处
约束满足多个可度量约束互相冲突每条约束独立断言且须全过「修 A 必破坏 B」的真实张力;禁止清单式伪 CSP
偏序规划随机 DAG(4–6 节点),join 必须约定一致、skip 边要求早期产物存活每节点 PASS/FAIL「错 join 默认值」只有用 skill 规则才能修正

共享的难度层是三篇论文里最见功力的 prompt 工程:真实规模(输入大到无法手算/猜出)、重算验证(验证器用独立参考实现从输入重算期望值,而非硬编码——「若输入换值,test.sh 不改一行仍能算出正确答案吗?」)、skill 关键未言明步骤(至少一步依赖指令不给出的 skill 特有事实——「有 skill 直接修,没 skill 要研究或实验,更难但仍可行」)。

两阶段 builder-reviewer 构造:先建环境(builder 写 Dockerfile 与依赖文件,reviewer 构建镜像并真实运行依赖检查——「import 并调用」而非 pip show 元数据检查,杜绝伪验证),再建任务(builder 在活容器里产出任务包:instruction.md + 初始工作区 + 参考解 solution/solve.sh + 验证器 tests/test.sh)。任务要过三门:fit-check(skill 撑不起该结构就跳过,宁缺毋滥)、有效性门(v(x₀)=0 且 v(Exec(ρ))=1,且改动「承载事实的文件」而保留参考输出时验证器仍须通过、损坏每个被检输出时必须失败)、质量门(reviewer 按「最紧的仍接受所有正确解的测试」标准审查:Defect A 过严——检查了指令未要求的标识符/格式/单选一;Defect B 过弱——存在性检查、起点即满足的关键词、只查结构不查值;外加答案泄漏扫描)。最多五轮修订。

产出:6.8K 任务(3,494 skill、19 领域;passed 5,191 + unresolved 1,581,偏序任务另行构造)。unresolved 任务也被利用——数据消融正是用它们对照出 review 的价值。

阶段三:多教师多 harness 轨迹采集与 SFT。三个开源教师(Kimi-K3、DeepSeek-V4-Flash、GLM-5.2)× 四种 harness(MiniSwe-Agent 全 Bash、AgentFly/OpenCode 专用文件工具、Terminus-2 JSON 协议),再叠加系统提示/工具名/schema 变体——多样性从模型、接口、提示三个正交轴注入。采得 19,070 条验证通过轨迹(中位 25K token)+ 15,649 条失败轨迹(只用于统计)。SFT 2 epochs、lr 1e-5、batch 128。评估用 MiniSwe-Agent(仅 Bash),skill 名字与描述放系统提示、详细内容需 agent 自己逐步披露(progressive disclosure)——忠实模拟真实 harness 的 skill 使用方式。


五、评估指标与实验证据

5.1 SkillFM:三域主结果 + 噪声鲁棒性

指标体系:主指标——ALFWorld/WebShop 成功率(SR)、Search-QA 精确匹配(EM);辅助——平均交互步数(Step,越低越好)、跨执行器迁移增益;消融——去 codec/去 flow/decoder-only SFT。

主结果(Qwen3-8B 冻结执行器):

基准SkillFM最强基线(LatentSkill)提升
ALFWorld seen SR82.14%74.3%(按任务型分解)约 +7.8 pp
ALFWorld unseen SR84.33%69.4%约 +14.9 pp
ALFWorld 总体83.21%(228/274)—步数同时降至 15.8–16.6
Search-QA 微平均 EM39.36%35.62%+3.74 pp
WebShop SR / Score20.00 / 55.35Reflexion 28.80 / 58.10(不同骨干)超 8 个基线中的 7 个

在 Search-QA 上 SkillFM 击败了包括 RAG(34.43)、全参 SFT(34.21)、Text-to-LoRA(27.68)、SHINE(34.11)在内的 12 个基线;WebShop 上以 Qwen3-8B 对阵他人 Qwen2.5-7B 的口径仍超 7/8(诚实标注了骨干差异)。

迁移实验(最有说服力的一组):同一个在 Qwen3-8B 轨迹上训练的生成器,直接驱动 GPT-5.6-luna(68.61→90.15)、GPT-4o(42.70→86.13)、Llama-3.3-70B(43.43→83.21)、Mistral Small 4(22.26→56.93),增益 +21.53~+43.43 pp——文本接口的可移植性直接兑现。跨规模同样单调:ALFWorld 4B 77.01 → 8B 83.21 → 32B 91.97。

消融(每个组件的必要性都被量化):去 codec 适配(用预训练原权重)→ ALFWorld seen 从 82.14 崩到 10.00;去 flow(用训练好的解码器直接解码某个潜向量)→ 25.00;decoder-only SFT(把 skill 生成直接塞进 LLM 微调,8B 版)→ 41.24 overall,比完整方法低 42 pp。这组数字支撑「分工论」:解码器负责重建可读 skill,流匹配负责任务条件化的泛化——二者不可互相替代。

噪声鲁棒实验(论文的点睛之笔):往 skill 库注入 25% 无关 skill,SkillFM 从被污染的库训练,嵌入检索从同一库测试时检索。ALFWorld seen 74.29 vs 38.57(+35.71 pp)、unseen 77.61 vs 30.60(+47.01 pp)、Search-QA 单跳 +3.53、多跳 +4.37、WebShop +3.20——生成式全面胜出。机制直觉:生成器从污染库学的是任务→skill 的条件分布,无关样本对这个映射的扰动有限;而检索器必须在推理时逐条精确命中,噪声条目一旦被检回就直接进入上下文。

训练规模:3553→1000 减半库仅小降(83.21→79.56);成功率 75% 的混合源轨迹会让性能下降但库越大降幅越小——高质量 skill 承载的是可复用程序知识,少量即可学好生成。

5.2 Prompt2Skill:4 域 × 5 模型矩阵

指标体系:主指标——各基准任务得分(SearchQA 1400 条 EM、SQuAD 1000 条 EM、AIME 120 题通过率、SpreadsheetBench 280 测试任务的执行验证);聚合——相对直接提示的平均相对变化(Avg ∆);消融——种子敏感性、示例数敏感性、同预算对 SkillOpt。

主结果(Table 1 核心,格式:P2S 得分(Direct 得分)):

模型SearchQASQuADAIMESpreadsheetAvg ∆
Qwen3-8B0.640(0.431)0.768(0.738)0.175(0.208)0.079(0.044)+29.1%
Qwen3-32B0.778(0.613)0.825(0.694)0.222(0.211)0.233(0.152)+26.1%
Llama-3.2-1B0.340(0.140)0.492(0.207)0.017(0.017)N/A+93.5%
Claude Haiku 4.50.839(0.857)0.793(0.416)0.508(0.467)0.269(0.297)+22.0%
GPT-5.50.868(0.839)0.852(0.651)0.861(0.525)0.263(0.266)+24.3%

平均绝对提升 +10.8 pp,19 个模型-基准对上平均相对提升 36.1%(对 off-the-shelf skill 83.0%)。两个关键叙事:其一,从不显著回退(5 模型 × 4 域无一显著为负——AIME 8B 上 0.175 vs 0.208 属统计噪声内);其二,固定 skill 可以严重倒退——off-the-shelf skill 把 Llama-1B 的 SQuAD 从 0.207 打到 0.048,而 P2S 升到 0.492。这两个事实合起来才是完整的论点:skill 的价值是模型相关、任务相关的,「未经目标模型执行反馈校准的 skill 不可信任」。

对照实验:同代理数据、同初始 skill、同预算(7400 次求解评估)下对 SkillOpt:SearchQA EM 48.71 vs 45.79、SQuAD EM 82.50 vs 81.30——证明增益不止来自代理数据获取,优化与选择协议本身有效。

消融:换 off-the-shelf 种子 vs 默认种子——各模型有涨有跌、无一致差异(框架不依赖特定种子);0/1/4 个示例——P2S 基本不变(SearchQA 61.1% vs 60.9%)而 direct prompting 从 70.5% 涨到 79.0%,说明示例被 P2S「内化」进了 skill 而非推理时依赖。

数据泄漏审计(这类「自动取数」框架最容易被质疑的点,论文正面处理):对全部检索源做 NFKC 归一化、精确/包含/近文本匹配(5-gram Jaccard ≥ 0.8 或字符比 ≥ 0.9)、spreadsheet 双 SHA-256 工作簿哈希——0 文本重叠标记、0 工作簿哈希命中。

5.3 SkillGym:6 模型 × 4 基准 + 行为归因

指标体系:主指标——四个基准(SkillGym 自有测试集 400 任务分 held-in/held-out skill、SkillEval 归一化奖励、SkillsBench 归一化奖励、Skill-Use-Bench 的 SU 分);行为指标——SU 三分量(Trigger 是否调取相关 skill / Compliance 是否忠实遵循程序 / Boundary 是否避免禁止操作);泛化指标——held-out skill 增益、结构迁移回归;消融——review 门控价值、四结构混合价值。

主结果(base → SFT,24 组对比 22 组提升):

模型SkillGymSkillEvalSkillsBenchSU
MiniCPM5-2B33.2→33.263.0→68.110.8→6.124.1→44.7
Ministral-3-8B17.5→49.555.7→77.53.9→16.94.3→55.1
Qwen3.5-4B33.8→47.062.8→70.810.1→14.38.8→48.7
Qwen3.5-9B41.3→59.565.7→74.714.8→22.414.8→49.6
Qwen3.5-27B55.3→62.876.2→80.132.6→47.428.3→74.2
Qwen3.5-122B53.0→65.069.8→80.030.1→53.616.8→72.2

平均增益:SkillGym +13.8、SkillEval +9.7、SkillsBench +9.7、SU +41.2。规模叙事:9B SFT 在 SkillGym(59.5 vs 55.8)与 SkillEval(74.7 vs 73.8)双超未训练的 Qwen3.5-397B-A17B;27B 超其三个教师中的两个(SkillEval 80.1 vs GLM-5.2 的 79.6、DeepSeek-V4-Flash 的 78.6);9B 匹敌 SKT 报告的同规模结果(74.7 vs 74.1)且 SkillsBench 大幅领先(22.4 vs 14.2)。

行为归因(论文最精彩的发现):SU 三分量分解——Trigger 28.0→96.0(+68)、Compliance 32.5→49.0(+16.5)、Boundary 57.7→64.0(+6.3)。训练带来的最大行为改变是「会去读 skill 了」:基线模型在超过三分之二的任务里根本不打开相关 skill,这是其 SU 低的头号原因;受训模型几乎总是先查 skill,且读了之后遵循得更忠实。配套证据:有/无 skill 的成功率增益从 base 的 +7.5 pp 翻倍到 SFT 的 +16.5 pp,同时无 skill 条件也 +9.2 pp——训练既提升了一般任务能力,更教会了「利用所给 skill」。

泛化证据链:held-out skill(训练中完全未见的 skill)增益 +19.5 pp(42.5→62.0)反而略高于 held-in 的 +17.0 pp——学到的不是技能字典而是「用 skill」的行为;对 5 种推理结构标注回归,无结构特异性效应,且训练中仅占 12% 的 rule application 结构在 SkillEval 上仍 +13.9 pp——增益覆盖训练少数派结构。

数据消融(token 配平对比):review-approved vs validated-only 任务训练——前者全面胜出(+4.7/+6.7/+9.3 pp),证明质量门的训练信号价值超出纯执行验证;四结构混合 vs 纯程序性——基本持平,说明此规模下结构多样性是「拓宽覆盖」而非「提高均分」。

成本:按 DeepSeek 折后价估算全管线 $5.7K–8.4K,约合每任务 $1——对「6.8K 可验证环境」而言是极低的单位成本。

5.4 三篇实验设计的共同优点与各自缺口

共同优点:都有主结果之外的「机制级」实验(SkillFM 的噪声对照与解码过程可视化、Prompt2Skill 的泄漏审计与理论界、SkillGym 的行为分解与结构回归),不是只堆分数。

各自缺口(诚实列出):SkillFM 的基准偏经典(ALFWorld/WebShop/Search-QA)且主要在「向量化 skill 方法」圈内比较,NFE=1 的分配公平性依赖「各方法标准推理预算」的约定;Prompt2Skill 的 κ=1 筛选阈值未做多重比较校正(论文自认),四域均为短答案/可判分任务,对开放式任务的代理度量可行性未验证;SkillGym 仅做 SFT 未上 RL(验证器已天然给出 outcome reward,作者自认是下一步),且 SkillsBench 上增益集中于「参考文档类」skill(+28.0)而「领域方法/捆绑工具/改系统」类不升(见 6.3 节讨论)。


六、效果优势的根源解释

6.1 根源机制与证据链

SkillFM:为什么生成优于检索?

因果链:检索范式的根本局限在于推理时的逐条精确命中要求——嵌入检索必须指望「库里存在正确条目 ∧ 检索器把它排到前面 ∧ 该条目单独可用」,三个 AND 概率在库含噪声、任务新颖时连乘衰减。SkillFM 的本质改变是把「逐条查表」换成「学条件分布」:训练时对 (c, s) 对的回归目标(边缘速度场)天然对库中的噪声样本做了条件平均——无关 skill 与给定任务条件的联合分布近似独立,在回归中被稀释而非被检索命中。证据链:25% 噪声下 +35.7/+47.0 pp(论文实验支持);训练库减半仅小降——生成器学到的是「任务→程序知识」的映射而非记住条目(论文实验支持);跨执行器 +21.5~+43.4 pp 迁移——文本接口把 skill 知识与特定执行器权重解耦(论文实验支持)。一个更深的推测(阅读者假设,论文未直接论证):SkillFM 实际上完成了一种「程序性知识的分布压缩」——3,553 条 skill 中的冗余被流模型吸收为条件分布的平滑结构,这正是它能从污染库中「自愈」的机制来源。

Prompt2Skill:为什么无监督优化仍有效?

因果链:skill 优化的信息瓶颈不在数据量而在「执行反馈信号」。固定 skill 负增益的根源是内容与目标模型失败模式的错配——同一份 general-reasoning skill 在 GPT-5.5 的 AIME 上 +38.9 pp、在 Llama-1B 的 SQuAD 上 −15.9 pp,因为两个模型在读题、验证、格式上的弱点完全不同。Prompt2Skill 的机制改变:Data Agent 把「无分布信息」问题转成「代理分布 + 已知失配界」问题(Theorem 1 的 ε_dist 项),Skill Agent 的配对 win/loss 检验 + 冻结终选把「优化噪声」控制在统计有界范围内(√(2log(2K/δ)/n) 项)。证据链:无监督设定下 19 对无显著回退(论文实验支持);同数据同预算胜 SkillOpt(论文实验支持)——增益来自协议而非数据;Llama-1B 增益最大(+93.5%)因为弱模型的失败模式最多、可修复空间最大(合理推测,论文未单独验证)。值得强调的边界:Theorem 1 的界依赖 TV 距离与评估器失配有界——若任务描述本身歧义(μ̂_τ 与 μ 系统性偏离),框架无能为力。

SkillGym:为什么 SFT 能教会「用 skill」?

因果链:skill 使用的第一瓶颈不是「读了不会做」而是「根本不读」(Trigger 28%)——这是一个行为习惯问题而非能力问题,恰好是 SFT 最擅长改变的:训练轨迹里教师模型反复演示「看到任务 → 打开 SKILL.md → 沿用其程序」,该模式以极高频率出现在 19K 轨迹中,SFT 把它压成默认行为。证据链:Trigger +68 pp 远大于 Compliance/Boundary 增益(论文实验支持);held-out skill 增益不低于 held-in(论文实验支持)——习得的是行为而非 skill 内容字典;review-approved 数据优于 validated-only(论文实验支持)——验证器质量决定奖励信号纯度,间接证明「可验证性是训练信号的瓶颈」。反向证据同样有启发:SkillsBench 上「领域方法/捆绑工具」类 skill 任务不升——说明 SFT 教会的主要是「consult skill」(查阅),对「apply method」(把 skill 里的方法转成操作)的迁移有限,这部分能力可能需要 RL 级别的试错信号(阅读者推测,与论文自认局限一致)。

6.2 相关工作检索与对照

围绕上述因果链做外部检索,区分「方法相似」与「结论相近」:

研究(可核验)相似尝试相关结论与三篇的差异与边界对根源解释的影响
TipsWarm(arXiv:2609.32339)skill 检索时机优化:在检索前注入预算化的 skill 关键点确认「agent 常在决定检索前浪费精力」是真实痛点仍属检索范式内的修补;SkillFM 直接消解检索支持 SkillFM 动机的真实性
Contextual Agentic Memory is a Memo, Not True Memory(arXiv:2604.27707)理论对比检索式记忆 vs 权重学习证明组合泛化上检索需 Ω(k²) 样本、参数学习只依赖规则复杂度纯理论工作;SkillFM 内化进流模型(非执行器权重)属中间形态,SkillGym 才是完整权重学习支持两条路线的理论必然性;提示 SkillFM 的生成器也可能面临组合泛化上限
SkillsBench(arXiv:2602.12670)人工专家 skill 任务基准据其 v1 报告,自生成 skill 平均无增益(见 dikrana.dev 综述)评估基准 vs 训练管线;但「自生成 skill 无平均增益」与 P2S 的固定 skill 负增益案例互补支持 Prompt2Skill「skill 必须针对模型优化」论点
Guardrails Beat Guidance(arXiv:2604.11088)679 个规则文件对照实验随机规则与专家规则在 SWE-bench 判别子集上同样 +13.8 pp任务子集经筛选(58 题),非全域结论;且规则 ≠ 完整 skill限定性挑战:文本指导的内容价值可能部分来自「有指导」这一行为本身——间接呼应 SkillGym 的 Trigger 发现
EMF(GitHub: AMAP-ML/EMF)把 MeanFlow 从类别条件扩展到文本条件文生图单步生成要求条件表征有高判别性;LLM 编码器需适配训练图像域 vs 文本 skill 域;但「单步生成对条件表征要求高」的结论相通补充 SkillFM:其 query 编码器冻结使用的设定能成立,部分依赖任务类型离散性
Token2Wav(arXiv:2606.18072)MeanFlow 潜空间单步 token→波形,RTF 提升 17 倍潜空间 + 平均速度建模是跨模态有效的单步生成配方音频解码 vs skill 生成;同为「压缩潜空间 + MeanFlow」架构支持 SkillFM 架构选择的范式有效性
SKT(arXiv:2608.02287)同期 skill→任务合成训练(4K 任务、2 harness)同样验证 skill 驱动合成可训练 skill 使用无 reviewer 审计验证器、无显式推理结构;SkillGym 对比中 SkillsBench 22.4 vs 14.2平行印证「skill 反向造环境」路线的稳健性
实践报告:12 Grams of Carbon(转引自 dikrana.dev)SWE 任务上检索过往会话零收益(有其他上下文时)无样本量披露,证据等级弱实践观察 vs 受控实验;条件不同(有替代上下文时)限定 SkillFM 噪声实验结论的适用面:库检索的劣势在「有其他上下文可用」时可能被稀释

6.3 综合判断与未决问题

多研究共同支持的机制:(1)「未经目标模型校准的固定 skill 不可靠」——Prompt2Skill 的负增益案例、SkillsBench v1 的自生成 skill 无增益、Guardrails 的随机规则等效应三者从不同角度收敛;(2)「skill 使用的第一瓶颈是调取/阅读行为」——SkillGym 的 Trigger 分解与 TipsWarm 的动机分析互证;(3)「潜空间 + 平均速度建模支持高质量单步生成」——SkillFM 与 EMF、Token2Wav、OneFlowSeq 跨模态互证。

仍属合理推测的部分:SkillFM 对污染库「条件平均自愈」的机制解释(论文只给了现象,未做库噪声成分分析);SkillGym 中 SFT 为何无法迁移到「方法应用型」skill(作者推测需 RL,未实验);Prompt2Skill 的弱模型增益最大规律(样本仅 5 个模型,且 LLM-generated 基线同样在弱模型上增益大)。

优势成立条件:SkillFM 的生成优势在「库有噪声 / 任务新颖 / 需跨执行器」时最大;库极干净且任务与库内条目几乎同分布时,检索未必差(论文未报告 0% 噪声下的检索对照,这是证据缺口)。Prompt2Skill 要求任务可形式化为可执行代理度量 μ̂_τ(开放式生成任务待验证)。SkillGym 的行为迁移依赖训练与测试的 harness 相近(评估统一用 MiniSwe-Agent;跨 harness 泛化未系统报告)。

可能的失效条件:任务条件极度长尾时 SkillFM 的单步采样可能不足以覆盖多峰 skill 分布(NFE>1 的对比未做);Prompt2Skill 遇到 μ̂_τ 系统性偏离 μ 的歧义描述时 Theorem 1 的界会松到无意义;SkillGym 遇到「工具型 skill」时 SFT 增益归零的边界仍未摸清。


七、必要知识反推

假设让一个零基础的人重做这三件事,最少必须知道什么?

7.1 领域知识层

  • Agent 与 skill 的运行机制:skill 如何进入上下文、progressive disclosure 怎么工作、harness 提供什么接口——不理解这些就无法定义「生成什么样的 skill 才有用」(SkillFM 的三字段格式、SkillGym 的系统提示注入方式都由此决定)。
  • skill 自进化系统的既有痛点:归因难、检索不准、维护贵——SkillFM 的问题定义是对这些痛点的直接否定,不知道痛点就不知道它在否定什么。
  • 公网 skill 生态的形态:skills.sh 的排名机制、SKILL.md 规范、references/scripts/assets 目录结构——SkillGym 的爬取与筛选规则完全由生态现状决定(如「≤300 文件、无网络」的可执行性边界)。

7.2 方法论知识层

  • 流匹配与 MeanFlow 理论:条件流匹配的配对速度目标、平均速度身份 u* + (t−r)(∂_t u* + J u* v*) = v*、以及 improved MeanFlow 的边界参数化——SkillFM 附录 A 的推导显示作者必须自己完成目标等价性与总体回归解释的证明,这意味着不能只会调用而要能推导。
  • 统计检验与选择理论:配对 win/loss 检验、连续性校正、Hoeffding 不等式 + 一致界(union bound)——Prompt2Skill 的 Theorem 1 完全建立在「Hoeffding + union bound + TV 距离分解」这组标准工具上。
  • 优化循环的过拟合风险:知道自适应优化会在接受集上过拟合,才会设计「新鲜接受批 + 冻结选择集 + 保留历史接受项」的三重防退化结构。
  • 任务合成的推理结构分类:程序性执行、溯因诊断、约束满足、偏序规划——SkillGym 的四档案来自认知任务/规划文献的既有分类(分别对应 PDDL 执行、SWE-bench 式诊断、TravelPlanner 式约束、DAG 规划),知道这些前作才能把它们统一进 skill 任务模板。

7.3 工程知识层

  • 大规模 LLM agent 管线工程:Docker 环境构建与验证、多 harness 轨迹采集、token 配平消融——SkillGym 的 184K→6.8K 漏斗每一步都是工程决策(如 reviewer「import 并调用而非 pip show」的反作弊验证)。
  • 数据泄漏审计方法:NFKC 归一化、n-gram Jaccard、双哈希工作簿比对——Prompt2Skill 若不做审计,其自动取数设定会在评审中被击穿。
  • 潜空间 codec 训练技巧:球面扰动增强的角度参数化、前缀嵌入投影、LoRA 分层学习率——这些细节决定 SkillFM 的 codec 能否支持流采样(消融显示 codec 不适配则性能崩到 10%)。

7.4 知识融合的关键节点

三篇各自的「化学反应」节点:

  • SkillFM 的节点是把 skill 库重新想象为生成模型的训练语料——流匹配知识(怎么生成)与 skill 生态知识(生成什么)在「潜空间 codec」这个接口上融合:codec 的球面扰动设计来自「流采样码会偏离训练码」的生成模型直觉,而三字段输出格式来自 skill 工程的领域约定。
  • Prompt2Skill 的节点是把「无数据」重述为「代理数据 + 失配界」——AutoML 的数据检索知识与统计学习理论在 Theorem 1 处融合:框架的每个工程组件都能在界里找到对应项。
  • SkillGym 的节点是把「数据质量」操作化为可执行谓词——软件工程的 CI/review 实践与任务合成的推理结构分类在「三门控」处融合:有效性门来自形式验证直觉(v(x₀)=0 ∧ v(ρ)=1 是可满足性的双向检查),质量门来自代码审查直觉(过严/过弱/泄漏三类 defect)。

跨篇的融合节点:三篇合起来暗示了一个更完整的图景——skill 生命周期各阶段可以共享同一种方法论:把模糊对象(skill 价值、数据质量、使用行为)操作化为可测量/可执行/可回归的信号。


八、论文中可以提取的通用性灵感

灵感一:检索 → 生成,是「资产库系统」的普适升级路径

核心思想:任何「积累库 + 检索复用」的系统(skill 库、记忆库、代码片段库、组件库),都可以考虑升级为「把库内化成生成模型、按需生成」——生成的对象不必是库中任何具体条目。

论文证据:SkillFM 在 25% 噪声库下相对嵌入检索 +35.7~+47.0 pp;训练库减半性能仅微降——生成器学的是映射结构而非条目记忆。

推广场景:(1)RAG 系统:文档库大到检索精度成为瓶颈时,按 query 生成「合成参考文档」;(2)企业知识管理:老员工经验库 → 情境化的即时指导生成;(3)代码补全:从「检索相似代码片段」到「按当前函数上下文生成参考实现模式」;(4)客服话术库:按客户画像生成个性化话术而非检索标准答案;(5)教育:题库 → 按学生画像即时生成练习题。

灵感二:去掉「最大隐性前提」往往比改进方法更值钱

核心思想:一个领域的方法迭代常围绕共享前提展开(skill 优化默认有标注训练集);把前提本身移除(「零训练样本零权重更新」)所开辟的空间,常常大于在前提下把方法再做精。

论文证据:Prompt2Skill 与 SkillOpt 在同数据同预算下差距仅 2.9 pp,但 Prompt2Skill 的问题设定使其适用范围从「有标注数据的用户」扩展到「只有一句话想法的用户」;此前研究显示训练集缩到单样本时 SkillOpt 增益塌缩——前提失效是断崖式的,不是渐进的。

推广场景:(1)AutoML:去「训练数据」前提 → 零样本 AutoML;(2)A/B 测试:去「足够流量」前提 → 小样本序贯检验设计;(3)推荐系统冷启动:去「行为历史」前提 → 仅凭商品描述的零样本个性化;(4)机器人技能学习:去「演示数据」前提 → 从说明书文本直接学操作策略。

灵感三:从存量资产反向合成训练环境,是数据合成的高杠杆方向

核心思想:当某类资产已海量存在(skill、API 文档、法规、协议规范)而训练数据稀缺时,「从资产反向构造可验证任务」比「从任务正向找数据」更能释放存量价值——资产里编码的领域知识天然成为任务的隐藏解。

论文证据:SkillGym 以约 $1/任务的成本把 18.4 万存量 skill 转成 6.8K 可验证环境;skill-critical 设计(知识在 skill 里、不在指令里)被 McNemar 检验证实(p≈10⁻⁴);同期 SKT 独立验证同一路线。

推广场景:(1)API 文档 → 工具调用训练环境(文档中的参数约束即验证器规格);(2)法规文本 → 合规测试用例(法条即隐藏规则);(3)开源项目 README → onboarding 编程任务;(4)游戏 Wiki → 游戏agent训练关卡;(5)医学指南 → 临床决策支持系统的评测集。

灵感四:统计 gating 是自我改进循环的防退化保险

核心思想:任何「自我改进」循环(反思、自我编辑、经验回写)都必须配一个统计严格的接受检验 + 独立终选,否则优化噪声会在循环中累积成退化。

论文证据:Prompt2Skill 的配对 z 检验(w>ℓ 且 z≥1)+ 冻结选择集 + 保留全部历史接受项,换来 19 个设定零显著回退;Theorem 1 给出该协议的损失上界。SkillGym 的对照同样支持:review-approved 数据比 validated-only 训练出的模型高 4.7~9.3 pp——多一道独立审查门,训练信号纯度显著提升。

推广场景:(1)LLM 自我蒸馏/自训练管线:每轮候选必须过 held-out 配对检验;(2)自动化代码重构 agent:每次重构过性能回归测试才合并;(3)prompt 自优化系统:防「在反馈集上过拟合」;(4)个人知识管理:笔记自动整理时保留全部历史版本供终选。

灵感五:先诊断「行为瓶颈」,再定训练目标

核心思想:能力 failures 常常不是「不会」而是「不做」(不读文档、不查库、不验证)——行为级度量(触发率、遵循率)能把「提升能力」拆解成「改变习惯」+「提升技能」两个难度悬殊的子问题,前者用 SFT/演示即可大规模解决。

论文证据:SkillGym 的 Trigger 28→96、Compliance 32.5→49、Boundary 57.7→64——三分之二的总增益来自「习惯改变」这一项;skill 访问增益翻倍(+7.5→+16.5 pp)确认习惯改变撬动了既有能力。

推广场景:(1)工具使用 agent:先测「工具调取率」再优化「调用质量」;(2)RAG 应用:先诊断「检索触发率」(模型何时该查而非硬答);(3)代码 agent:先测「读测试用例率」再优化修 bug 能力;(4)人因工程/培训设计:把技能培训拆成「流程遵循」与「专业判断」分层训练。

灵感六:对「单步生成」的条件表征要求极高——接口设计比生成器本身更关键

核心思想:当生成被压缩到单步(无迭代修正机会)时,条件信息的判别性/结构化程度成为成败关键—— codec(编码-解码接口)的训练投入与生成器同等重要。

论文证据:SkillFM 去 codec 适配性能崩至 10%(生成器完好但接口未适配);球面扰动增强(对邻域码稳健)是 codec 可用性的必要设计;外部 EMF 工作独立发现单步文生图要求文本条件表征有极高判别性。

推广场景:(1)任何蒸馏/加速生成系统:先投资「教师-学生表征对齐」再压缩步数;(2)检索系统的一阶段召回:单次打分场景下 query 表征质量决定上限;(3)实时控制系统:单步决策的条件编码是核心瓶颈;(4)一键式 AI 工具(单次生成即交付):输入结构化程度决定产品体验下限。

灵感七:可验证性是 skill(及一切「资产」)资产化的前提

核心思想:一类对象要成为可优化、可交易、可训练的「资产」,先要有可靠的价值度量;三篇论文分别为 skill 建立了三种度量——任务成功率(SkillFM)、代理评估器(Prompt2Skill)、可执行验证器(SkillGym)——度量方式决定了优化路径的天花板。

论文证据:SkillGym 验证器质量(review 门)直接决定训练信号(消融 +4.7~9.3 pp);Prompt2Skill 把 μ̂_τ 与 μ 的失配显式建模为误差项;SkillFM 的流回归目标本质是对「任务→最优 skill」映射的稠密化度量。

推广场景:(1)AI 生成内容定价:先建可执行质量度量再谈交易;(2)prompt 市场:每个售出 prompt 附带可复跑的评估脚本;(3)企业 SOP 管理:每条 SOP 配自动检查器才能持续优化;(4)开源模型生态:模型卡从「自述能力」进化为「可验证基准」。


附录:三篇论文的发表脉络与开源情况

  • SkillFM:arXiv 2026-09-30(v1),代码与训练 skill 库开源于 github.com/lulushang999/SkillFM;NTU(两位共一)+ 爱丁堡(通讯 Jeff Z. Pan)+ Meta(Yizhe Zhang)。
  • Prompt2Skill:arXiv 2026-09-29(v1,Preprint under review),代码开源于 github.com/Arstanley/Prompt2Skill;Vanderbilt(Bo Ni、Tyler Derr)+ USC + Adobe Research。
  • SkillGym:arXiv 2026-09-29(v1,Preprint),代码数据开源于 github.com/Reason-Wang/SkillGym;MBZUAI 五人小团队(Renxi Wang、Haonan Li 等,含 Timothy Baldwin)。

三篇在 2026 年 9 月 29–30 日两天内密集出现,恰是 Anthropic Agent Skills 发布一周年节点——skill 资产化浪潮从「生态扩张」进入「工程深化」阶段的一个横切面样本:生成侧引入生成式建模、定制侧引入无监督优化、训练侧引入大规模可验证环境合成,skill 正在被当作一种可系统化生产、定制与消费的「一等资产」来对待。