论文链接:Progressive Agent Skill Generation via Reinforcement Learning 发表时间:2026年8月 机构:Junhao Shen、Hong Cheng(香港中文大学数据库组) 领域标签:Agent 技能学习 / 强化学习 / Agent 自进化
一、论文背景:Agent 技能为什么难生成
什么是 Agent 技能(Skill)? Skill 是 Agent 的"岗位操作手册"——一段可复用的程序性知识,告诉 Agent 在特定情境下该怎么做。比如"如何查询数据库"“如何调用某个 API"“如何处理电子表格”。有了技能,Agent 不用每次重新推理,直接按手册操作。
技能从哪来? 目前主要两种来源:(1) 文档到技能——从文档/手册中提炼操作步骤;(2) 经验到技能——从 Agent 自己执行任务的轨迹中总结经验。现有方法大多是启发式或流水线式的——为不同证据源专门设计提炼流程。
学习式技能生成为什么难? 论文指出核心难题:技能缺乏基于相关性或正确性的自然监督信号。一个数学推理对不对可以对照答案;但一个技能"好不好”,只能看它能否提升 Agent 在下游任务上的表现——这是间接的、需要执行才能验证的信号。
一次性(one-shot)生成的问题:把整个文档/所有经验一次性喂给模型生成技能,有两个问题:(1) 源证据常超出上下文窗口;(2) 一次性生成纠缠了多种操作(抽象、去噪、冲突解决、压缩),让信用分配极难。
二、论文定位和关联工作
技能生成的路线:
| 路线 | 代表 | 思路 | 局限 |
|---|---|---|---|
| 启发式/流水线 | Anthropic Skill-Creator、AutoSkill | 为特定证据源设计 | 不统一、难迁移 |
| 一次性学习 | Ctx2Skill | 整体生成 | 信用分配难、超长上下文 |
| 经验积累 | ExpeL、AWM、Trace2Skill | 从轨迹总结 | 缺乏编辑级评估 |
| 技能优化 RL | SkillPro、SkillX | RL 优化已有技能 | 生成与优化分离 |
| Skill-α(本文) | RL 渐进式生成 | 序列编辑+回滚奖励 | — |
关键区别:Skill-α 把"生成"和"优化"统一为"渐进式局部编辑决策",并用回滚奖励为每个编辑提供执行基础的信用分配。
三、问题定义:技能价值只能由下游表现定义
技能生成的本质难题:技能的价值是"涌现"的——它本身没有对错,只有"用了它,Agent 表现是否提升"。
形式化:学习一个生成器 $\pi_\phi$,从证据 $x_{1:T}$ 构造技能 $z$,使固定工作器 $\pi_\psi$ 在留出查询 $q$ 上的行为分布 $p^\star_\mathcal{M}(\tau|q)$ 趋向高质量。
理想目标是最小化 KL 散度,但这个目标不可直接优化——因为它依赖"工作器用了技能后的表现",必须执行才知道。
四、问题解法:Skill-α 的三要素
4.1 渐进式技能生成(序列编辑)
从初始技能 $z_0$ 出发,生成器顺序读取证据、逐步更新技能:$A_t \sim \pi_\phi(\cdot | z_{t-1}, x_t)$,$z_t = \mathrm{Edit}(z_{t-1}, A_t)$。
五种编辑动作:
| 动作 | 作用 |
|---|---|
| Create | 添加缺失的可重用规则/程序段 |
| Update | 替换整个现有段落 |
| Merge | 整合重叠段落 |
| Prune | 移除误导性/冗余内容 |
| Noop | 当前证据无新信息时保持不变 |
4.2 回滚奖励(核心创新)
对步骤 $t$ 的编辑决策:
- 附加一个锚定查询 $q_t^{anc}$
- 用验证器 $\mathcal{V}_t$
- 固定工作器在原始技能和编辑后技能下分别回答同一锚定查询:
- $r_t^{ctrl} = \mathcal{V}_t(a_t^{ctrl})$(原始技能的结果)
- $r_t^{edit} = \mathcal{V}_t(a_t^{edit})$(编辑后技能的结果)
- 只有编辑后严格优于原始时才给正奖励(Noop 作为组级别回退)
4.3 理论保证
- Lemma A.2:期望回滚奖励 = 编辑技能对控制技能的验证器成对获胜概率。
- Lemma A.4(校准验证器下保序):$\mathbb{E}[R_i] > \mathbb{E}[R_j] \iff p_i^\star > p_j^\star$——保持理想偏好排序。
- Lemma A.5(二元验证器精确排序):$\mathbb{E}[R_i] > \mathbb{E}[R_j] \iff \beta_i > \beta_j$。
4.4 GRPO 训练
两阶段:SFT 预热(6481 例,DeepSeek-V4-Pro 合成)+ GRPO RL(2048 编辑状态,组大小 8,工作器固定为 GPT-4o)。
五、评估指标与实验证据
5.1 文档到技能(CL-Bench,GPT-4o 工作器)
| 方法 | 平均 |
|---|---|
| No Skill | 8.57 |
| Anthropic Skill-Creator | 7.01 |
| Progressive Prompt Skill | 7.11 |
| AutoSkill | 6.37 |
| Ctx2Skill | 7.07 |
| Skill-α | 10.38 |
5.2 经验到技能(tau2-bench,GPT-4o 工作器)
| 方法 | tau2 平均 |
|---|---|
| No Skill | 33.33 |
| SkillPro(最强基线) | 49.17 |
| SkillX | 46.00 |
| Skill-α | 55.83(+6.7 vs 最强基线) |
Airline 40→65(+25)、Telecom 12.5→22.5(+10)、SpreadsheetBench 18→27.5(+9.5)。
5.3 消融——回滚奖励是关键
| 变体 | CL-Bench | SpreadsheetBench | tau2 |
|---|---|---|---|
| Skill-α(完整) | 10.38 | 27.50 | 55.83 |
| SFT only | 3.46 | 15.50 | 44.17 |
| w/o rollback reward | 3.68 | 17.00 | 46.67 |
| w/o Merge/Prune | 4.74 | 20.00 | 39.17 |
这个实验为什么有证明力? 移除回滚奖励后性能接近"SFT only"(3.68 vs 3.46)——证明回滚奖励是技能质量的关键信号,没有它 SFT 只能学到形式上的编辑而非有用的编辑。移除 Merge/Prune 导致 tau2 大幅下降(39.17 vs 55.83)——证明技能构造需要显式整合和删除,光 Create 会积累冗余/冲突。
5.4 证据批量大小
每步 4 个证据单元最佳(批量太小编辑器短视、太大编辑器过载),Skill-α 对证据顺序相当鲁棒。
六、效果优势的根源解释
baseline(启发式/流水线)的根本局限:它们必须为不同证据源专门设计,且无法评估"单个编辑是否有用"——只能评估最终技能。这导致信用分配是"整条生成链"级别的,无法定位哪个编辑好、哪个坏。
Skill-α 的根本性改变:回滚奖励为每个局部编辑提供了执行基础的信用分配——通过对比"有这个编辑 vs 没这个编辑"的下游表现,直接评估单个编辑的边际价值。
因果链:方法差异(回滚奖励 + 渐进式编辑)→ 机制变化(每个编辑被独立评估边际贡献,而非整条链被笼统评价)→ 指标提升(CL-Bench +3.3、tau2 +6.7)。
为什么回滚比直接用编辑后奖励好? 因为直接用编辑后技能的奖励会混淆"编辑的贡献"和"工作器自身能力/查询难度"。回滚通过同一锚定查询的对照(原始 vs 编辑),消除了工作器能力和查询难度的影响,只测量编辑的边际贡献。
七、必要知识反推
领域知识层:
- Agent 技能的实际形态(程序性知识、可复用规则)。
- 技能价值的间接性(只能由下游表现定义)。
方法论知识层:
- 回滚(rollback)思想——从软件工程/版本控制借鉴,通过对比"有/无某变更"评估其价值。这是创造性节点。
- 序列决策与信用分配(GRPO)。
- 校准验证器下的保序性理论。
工程知识层:
- 锚定查询的构建(CL-Bench 用任务引用,tau2 用失败轨迹)。
- 确定性质量门控(过滤畸形编辑)。
知识融合的关键节点:把"软件工程的回滚/对照测试"迁移到"技能生成的信用分配"——意识到技能价值只能由"用了 vs 没用"的下游差异定义,而非技能本身的形式。
八、论文中可以提取的通用性灵感
灵感一:用"对照"评估间接价值
- 核心思想:当一个对象(技能/配置/提示)的价值只能间接体现(通过下游表现),用"有它 vs 没它"的对照来测量其边际贡献,是最可靠的评估方式。
- 论文证据:回滚奖励让每个编辑被独立评估,移除后性能塌缩到 SFT only 水平。
- 推广场景:(1) 提示词组件的边际价值评估;(2) 工具集优化的对照实验;(3) 特征选择的对照;(4) RAG 检索组件的价值评估。
灵感二:把"生成"和"优化"统一为"序列编辑"
- 核心思想:与其把"从零生成"和"优化已有"当作两个问题,不如统一为"渐进式局部编辑"——每次只做一个可评估的小变更。
- 论文证据:Skill-α 统一文档到技能和经验到技能,五种编辑动作覆盖所有操作。
- 推广场景:(1) 文档/报告的渐进式撰写;(2) 代码重构的渐进式变更;(3) 系统配置的迭代优化。
灵感三:Noop 作为"组级别回退"
- 核心思想:在学习"做什么"的同时,也要学习"什么时候不做"——当没有好的变更时,保持不变本身就是正确决策。
- 论文证据:Noop 不是编辑质量估计器,而是"组里没有好编辑时的回退";移除 Noop 仍有较强性能但完整模型始终更好。
- 推广场景:(1) 主动学习的"不查询"决策;(2) 交易系统的"不交易"决策;(3) 编辑系统的"不改"决策。
本精读基于 Skill-α 论文全文撰写,覆盖 Method(渐进式生成、五种编辑动作、回滚奖励机制与理论保证、GRPO 训练)、Experiments(CL-Bench/SpreadsheetBench/tau2 主结果、消融、证据顺序与批量分析)。