论文链接:Progressive Agent Skill Generation via Reinforcement Learning 发表时间:2026年8月 机构:Junhao Shen、Hong Cheng(香港中文大学数据库组) 领域标签:Agent 技能学习 / 强化学习 / Agent 自进化

一、论文背景:Agent 技能为什么难生成

什么是 Agent 技能(Skill)? Skill 是 Agent 的"岗位操作手册"——一段可复用的程序性知识,告诉 Agent 在特定情境下该怎么做。比如"如何查询数据库"“如何调用某个 API"“如何处理电子表格”。有了技能,Agent 不用每次重新推理,直接按手册操作。

技能从哪来? 目前主要两种来源:(1) 文档到技能——从文档/手册中提炼操作步骤;(2) 经验到技能——从 Agent 自己执行任务的轨迹中总结经验。现有方法大多是启发式或流水线式的——为不同证据源专门设计提炼流程。

学习式技能生成为什么难? 论文指出核心难题:技能缺乏基于相关性或正确性的自然监督信号。一个数学推理对不对可以对照答案;但一个技能"好不好”,只能看它能否提升 Agent 在下游任务上的表现——这是间接的、需要执行才能验证的信号。

一次性(one-shot)生成的问题:把整个文档/所有经验一次性喂给模型生成技能,有两个问题:(1) 源证据常超出上下文窗口;(2) 一次性生成纠缠了多种操作(抽象、去噪、冲突解决、压缩),让信用分配极难。

二、论文定位和关联工作

技能生成的路线:

路线代表思路局限
启发式/流水线Anthropic Skill-Creator、AutoSkill为特定证据源设计不统一、难迁移
一次性学习Ctx2Skill整体生成信用分配难、超长上下文
经验积累ExpeL、AWM、Trace2Skill从轨迹总结缺乏编辑级评估
技能优化 RLSkillPro、SkillXRL 优化已有技能生成与优化分离
Skill-α(本文)RL 渐进式生成序列编辑+回滚奖励—

关键区别:Skill-α 把"生成"和"优化"统一为"渐进式局部编辑决策",并用回滚奖励为每个编辑提供执行基础的信用分配。

三、问题定义:技能价值只能由下游表现定义

技能生成的本质难题:技能的价值是"涌现"的——它本身没有对错,只有"用了它,Agent 表现是否提升"。

形式化:学习一个生成器 $\pi_\phi$,从证据 $x_{1:T}$ 构造技能 $z$,使固定工作器 $\pi_\psi$ 在留出查询 $q$ 上的行为分布 $p^\star_\mathcal{M}(\tau|q)$ 趋向高质量。

理想目标是最小化 KL 散度,但这个目标不可直接优化——因为它依赖"工作器用了技能后的表现",必须执行才知道。

四、问题解法:Skill-α 的三要素

4.1 渐进式技能生成(序列编辑)

从初始技能 $z_0$ 出发,生成器顺序读取证据、逐步更新技能:$A_t \sim \pi_\phi(\cdot | z_{t-1}, x_t)$,$z_t = \mathrm{Edit}(z_{t-1}, A_t)$。

五种编辑动作:

动作作用
Create添加缺失的可重用规则/程序段
Update替换整个现有段落
Merge整合重叠段落
Prune移除误导性/冗余内容
Noop当前证据无新信息时保持不变

4.2 回滚奖励(核心创新)

对步骤 $t$ 的编辑决策:

  1. 附加一个锚定查询 $q_t^{anc}$
  2. 用验证器 $\mathcal{V}_t$
  3. 固定工作器在原始技能和编辑后技能下分别回答同一锚定查询:
    • $r_t^{ctrl} = \mathcal{V}_t(a_t^{ctrl})$(原始技能的结果)
    • $r_t^{edit} = \mathcal{V}_t(a_t^{edit})$(编辑后技能的结果)
  4. 只有编辑后严格优于原始时才给正奖励(Noop 作为组级别回退)

4.3 理论保证

  • Lemma A.2:期望回滚奖励 = 编辑技能对控制技能的验证器成对获胜概率。
  • Lemma A.4(校准验证器下保序):$\mathbb{E}[R_i] > \mathbb{E}[R_j] \iff p_i^\star > p_j^\star$——保持理想偏好排序。
  • Lemma A.5(二元验证器精确排序):$\mathbb{E}[R_i] > \mathbb{E}[R_j] \iff \beta_i > \beta_j$。

4.4 GRPO 训练

两阶段:SFT 预热(6481 例,DeepSeek-V4-Pro 合成)+ GRPO RL(2048 编辑状态,组大小 8,工作器固定为 GPT-4o)。

五、评估指标与实验证据

5.1 文档到技能(CL-Bench,GPT-4o 工作器)

方法平均
No Skill8.57
Anthropic Skill-Creator7.01
Progressive Prompt Skill7.11
AutoSkill6.37
Ctx2Skill7.07
Skill-α10.38

5.2 经验到技能(tau2-bench,GPT-4o 工作器)

方法tau2 平均
No Skill33.33
SkillPro(最强基线)49.17
SkillX46.00
Skill-α55.83(+6.7 vs 最强基线)

Airline 40→65(+25)、Telecom 12.5→22.5(+10)、SpreadsheetBench 18→27.5(+9.5)。

5.3 消融——回滚奖励是关键

变体CL-BenchSpreadsheetBenchtau2
Skill-α(完整)10.3827.5055.83
SFT only3.4615.5044.17
w/o rollback reward3.6817.0046.67
w/o Merge/Prune4.7420.0039.17

这个实验为什么有证明力? 移除回滚奖励后性能接近"SFT only"(3.68 vs 3.46)——证明回滚奖励是技能质量的关键信号,没有它 SFT 只能学到形式上的编辑而非有用的编辑。移除 Merge/Prune 导致 tau2 大幅下降(39.17 vs 55.83)——证明技能构造需要显式整合和删除,光 Create 会积累冗余/冲突。

5.4 证据批量大小

每步 4 个证据单元最佳(批量太小编辑器短视、太大编辑器过载),Skill-α 对证据顺序相当鲁棒。

六、效果优势的根源解释

baseline(启发式/流水线)的根本局限:它们必须为不同证据源专门设计,且无法评估"单个编辑是否有用"——只能评估最终技能。这导致信用分配是"整条生成链"级别的,无法定位哪个编辑好、哪个坏。

Skill-α 的根本性改变:回滚奖励为每个局部编辑提供了执行基础的信用分配——通过对比"有这个编辑 vs 没这个编辑"的下游表现,直接评估单个编辑的边际价值。

因果链:方法差异(回滚奖励 + 渐进式编辑)→ 机制变化(每个编辑被独立评估边际贡献,而非整条链被笼统评价)→ 指标提升(CL-Bench +3.3、tau2 +6.7)。

为什么回滚比直接用编辑后奖励好? 因为直接用编辑后技能的奖励会混淆"编辑的贡献"和"工作器自身能力/查询难度"。回滚通过同一锚定查询的对照(原始 vs 编辑),消除了工作器能力和查询难度的影响,只测量编辑的边际贡献。

七、必要知识反推

领域知识层:

  • Agent 技能的实际形态(程序性知识、可复用规则)。
  • 技能价值的间接性(只能由下游表现定义)。

方法论知识层:

  • 回滚(rollback)思想——从软件工程/版本控制借鉴,通过对比"有/无某变更"评估其价值。这是创造性节点。
  • 序列决策与信用分配(GRPO)。
  • 校准验证器下的保序性理论。

工程知识层:

  • 锚定查询的构建(CL-Bench 用任务引用,tau2 用失败轨迹)。
  • 确定性质量门控(过滤畸形编辑)。

知识融合的关键节点:把"软件工程的回滚/对照测试"迁移到"技能生成的信用分配"——意识到技能价值只能由"用了 vs 没用"的下游差异定义,而非技能本身的形式。

八、论文中可以提取的通用性灵感

灵感一:用"对照"评估间接价值

  • 核心思想:当一个对象(技能/配置/提示)的价值只能间接体现(通过下游表现),用"有它 vs 没它"的对照来测量其边际贡献,是最可靠的评估方式。
  • 论文证据:回滚奖励让每个编辑被独立评估,移除后性能塌缩到 SFT only 水平。
  • 推广场景:(1) 提示词组件的边际价值评估;(2) 工具集优化的对照实验;(3) 特征选择的对照;(4) RAG 检索组件的价值评估。

灵感二:把"生成"和"优化"统一为"序列编辑"

  • 核心思想:与其把"从零生成"和"优化已有"当作两个问题,不如统一为"渐进式局部编辑"——每次只做一个可评估的小变更。
  • 论文证据:Skill-α 统一文档到技能和经验到技能,五种编辑动作覆盖所有操作。
  • 推广场景:(1) 文档/报告的渐进式撰写;(2) 代码重构的渐进式变更;(3) 系统配置的迭代优化。

灵感三:Noop 作为"组级别回退"

  • 核心思想:在学习"做什么"的同时,也要学习"什么时候不做"——当没有好的变更时,保持不变本身就是正确决策。
  • 论文证据:Noop 不是编辑质量估计器,而是"组里没有好编辑时的回退";移除 Noop 仍有较强性能但完整模型始终更好。
  • 推广场景:(1) 主动学习的"不查询"决策;(2) 交易系统的"不交易"决策;(3) 编辑系统的"不改"决策。

本精读基于 Skill-α 论文全文撰写,覆盖 Method(渐进式生成、五种编辑动作、回滚奖励机制与理论保证、GRPO 训练)、Experiments(CL-Bench/SpreadsheetBench/tau2 主结果、消融、证据顺序与批量分析)。