论文链接:arxiv.org/abs/2605.28424 代码仓库:github.com/JasonZhujp/Skill0_5 发表时间:2026年5月 机构:华东师范大学 × 美团龙猫团队(学校学生 + 企业合著) 基础模型:Qwen2.5-7B-Instruct


一、论文背景

1.1 什么是 Agent Skill?

在 AI Agent(智能体)的体系中,Skill(技能) 是一段结构化的自然语言策略文档,被插入到 Agent 的上下文中,为 Agent 提供特定领域的程序性知识。你可以把它类比为给一位通才型员工发放的"岗位操作手册"——员工本身很聪明,但面对特定领域任务时,一份好的操作手册能让其表现产生质的飞跃。

具体来说,一个 Skill 通常包含:

  • 任务求解流程:应该先做什么、后做什么、遇到异常怎么办
  • 领域知识:该领域的专业术语、约定俗成的规则
  • 操作指南:哪些工具可用、如何调用、常见陷阱有哪些

例如,在代码评审 Agent 中,Skill 可以是关于"如何识别并发安全的潜在缺陷"的专业指导;在电商购物 Agent 中,Skill 可以是"如何根据用户需求筛选最匹配商品"的操作策略。

1.2 什么是 Harness?

Harness(执行线束) 是围绕 Agent 构建的运行时基础设施,相当于 Agent 的"操作系统 + 管控平台"。模型本身只是一个文本输入/输出的"大脑",但要让 Agent 真正完成实际任务,还需要大量的支撑组件:

  • 系统提示(System Prompt):定义 Agent 的角色、行为边界
  • 工具系统(Tools):让 Agent 能够读写文件、执行命令、搜索网络
  • 执行环境(Sandbox):提供文件系统、浏览器、沙盒等运行时基础设施
  • 技能系统(Skills):为 Agent 提供领域知识的可插拔模块
  • 任务编排逻辑:子 Agent 调度、路由等
  • 执行控制逻辑:Hooks、中间件等

Claude Code、Codex CLI、OpenAI Codex 等都是典型的 Harness 实现。它们为 Agent 提供了"手脚"和"工作台",让模型从"能对话"进化为"能干活"。

1.3 Agent 中的 Skill 分类:通用技能 vs. 任务特定技能

Skill0.5 这篇论文首先提出了一个关键洞察:不是所有的技能都是一样的。Agent 的技能可以自然地分为两类:

通用技能(General Skills):

  • 定义:与领域无关的元认知策略,如"逐步推理"、“错误恢复”、“任务分解”
  • 特点:在所有任务中都适用,文本较长,占用大量上下文空间
  • 类比:就像"学会如何学习"这种元能力——不管你学什么科目,这种能力都有用

任务特定技能(Task-Specific Skills):

  • 定义:与具体任务领域显式关联的细粒度执行规则
  • 特点:针对特定场景,文本较短,需要频繁更新和动态检索
  • 类比:就像"如何操作某台特定型号的 CNC 机床"——非常具体,换一台设备就不一样了

1.4 当前的困境:两个极端范式

在 Skill0.5 之前,基于技能的 Agent 强化学习方法被迫在两个极端之间做出选择:

极端一:完全外部化(Full Externalization)

代表工作:SkillRL。在训练和推理时,将所有技能(通用 + 特定)都作为外部上下文拼接到 prompt 中。

问题:

  • 上下文过长:大量技能文本会严重膨胀 prompt,让 Agent 难以有效聚焦于关键信息
  • 推理效率低:每一步都要处理冗长的上下文,增加延迟和计算成本
  • 指令遵循下降:研究表明,当 prompt 过长时,LLM 的指令遵循能力会显著下降

极端二:完全内化(Full Internalization)

代表工作:SKILL0。在训练时将所有技能逐步"吸收"到模型参数中,推理时完全不提供任何技能上下文。

问题:

  • 模型容量有限:7B 参数的模型能"记住"的技能总量有限,强行压缩会丢失信息
  • 知识冲突:当训练时内化的技能与新遇到的任务场景产生冲突时,模型会"犯糊涂"
  • OOD 泛化差:面对训练时没见过的新任务类型,内化的旧技能可能产生错误引导

核心矛盾:两种极端都不理想——全外部化太"笨重",全内化太"脆弱"。有没有一种方法能兼得两者的优点?


二、论文定位和关联工作

Skill0.5 不是凭空出现的。它位于一条清晰的"技能增强 Agent RL"研究脉络之中,可以看作是这个方向的第四代工作。理解它的定位,需要先了解三代前序工作。

2.1 第一代:技能外部化——SkillRL(2026.02)

SkillRL(Evolving Agents via Recursive Skill-Augmented Reinforcement Learning)是这个方向的开创性工作。它的核心思想是:

  • 自动构建分层技能库:将 Agent 的成功经验自动提炼为可复用的技能文档
  • 运行时检索技能:每次执行任务时,从技能库中检索最相关的技能作为上下文
  • 递归优化:技能和策略同步迭代优化

定位:SkillRL 确立了"技能 + RL"的基本范式,证明了结构化的技能文档能显著提升 Agent 的任务完成率。但它选择了"所有技能都放 prompt 里"的外部化路线,受限于上下文长度。

2.2 第二代:技能内化——SKILL0(2026.04)

SKILL0(In-Context Agentic Reinforcement Learning for Skill Internalization)是由浙江大学等机构提出的,直接针对 SkillRL 的上下文膨胀问题。它的核心思想是:

  • 训练时提供完整技能上下文:让 Agent 在丰富的技能指导下学习
  • 渐进式撤回技能:随着训练推进,逐步从 prompt 中移除技能文本
  • 推理时零技能:Agent 已经"学会"了技能,不再需要外部提示

定位:SKILL0 首次提出"将技能内化到模型参数"的思路,实现了推理时的上下文高效。但它的 OOD 泛化表现较差——面对没见过的新任务,内化的旧技能反而可能产生误导。

2.3 第三代:动态管理——SLIM(2026.05)

SLIM(Dynamic Skill Lifecycle Management for Agentic RL)试图在前两者之间找平衡。它的核心思想是:

  • 技能生命周期管理:不假设技能应该永远存在或完全消失,而是动态决定保留哪些、淘汰哪些
  • 验证驱动的优化:通过验证集上的表现来决定技能集的组成
  • 统一处理:对所有技能一视同仁,不做区分

定位:SLIM 引入了动态管理的思想,但仍然统一处理所有技能,没有意识到通用技能和任务特定技能在本质上的差异。实际上,SLIM 在训练后期可能过早退役通用技能,导致行为崩溃。

2.4 第四代:差异化处理——Skill0.5(本文,2026.05)

Skill0.5 的定位非常清晰:它是第一个明确区分通用技能和任务特定技能处理方式的框架。

方法通用技能任务特定技能关键创新
SkillRL外部化外部化自动技能库构建
SKILL0内化内化渐进式上下文撤回
SLIM统一管理统一管理动态技能生命周期
Skill0.5内化利用(外部化)差异化 + 难度感知路由

Skill0.5 的核心洞见是:通用技能应该被内化到模型参数中,建立稳固的认知基础;而任务特定技能应该保持外部化,实现灵活的即插即用。这种差异化处理在之前的工作中从未被明确提出。

2.5 底层 RL 算法:GRPO

Skill0.5 的底层优化算法使用的是 GRPO(Group Relative Policy Optimization,组相对策略优化),这是 DeepSeek 团队于 2024 年提出的一种高效 RL 算法:

  • 核心思想:对同一个任务采样多条轨迹,通过组内相对比较计算优势函数,无需训练额外的价值网络(Critic)
  • 优势:节省近一半的训练内存和计算量,特别适合大语言模型的强化学习
  • 局限:当任务过难(所有轨迹都失败)或过简(所有轨迹都成功)时,组内奖励方差消失,无法提供有效的优化梯度

Skill0.5 正是在 GRPO 的基础上,通过难度感知路由解决了"过难和过简任务梯度消失"的核心问题。


三、问题定义

3.1 从具体场景到抽象问题

想象你正在训练一个购物 Agent。它需要两类知识:

  • 通用推理能力:比如"比较商品时要关注价格和评分的综合平衡"、“当搜索结果不满意时要尝试换关键词”
  • 特定类别知识:比如"买鞋子时要关注尺码对照表"、“买电子产品时要查看保修政策”

在训练时,你只能让它接触服装、电子产品、鞋类这几种品类(ID 任务)。但部署后,它可能会遇到珠宝、美妆、家居等从没见过的品类(OOD 任务)。

问题来了:你该如何训练这个 Agent,让它在已见过的品类上表现优秀(ID 性能),同时面对没见过的品类也能快速适应(OOD 泛化)?

3.2 核心问题抽象

Skill0.5 将上述场景抽象为以下数学框架:

环境建模:将 Agent 与环境的交互建模为部分可观测马尔可夫决策过程(POMDP),其中:

  • Agent 看到的是文本形式的观测(如网页截图的文字描述)
  • Agent 输出的是自然语言动作(如"点击搜索按钮"、“选择红色款”)
  • 每个任务由文本指令指定(如"帮我找一双适合跑步的运动鞋")

技能分层:将技能库 $\mathcal{S}$ 分为两层:

  • $\mathcal{S}_G$:通用技能集(元认知策略)
  • $\mathcal{S}_S$:任务特定技能集(领域执行规则)

训练-评估设置:

  • 训练阶段:Agent 只能见到 ID 任务和 ID 特定技能
  • ID 评估:在训练任务类型上测试,使用 ID 特定技能
  • OOD 评估:在全新任务类型上测试,使用从未见过的 OOD 特定技能

最本质的问题定义:在排除其他外部信息干扰的前提下,如何设计一个训练框架,使得:

  1. 通用技能的策略精髓(而非文本本身)被永久性地编码到模型参数中,形成跨领域的认知基础
  2. 任务特定技能能够即插即用——面对全新任务时,只需检索并注入对应的特定技能,Agent 就能正确执行
  3. 两种技能处理方式联合优化,不会相互干扰或退化

这是一个在"内化稳定性"和"外部灵活性"之间寻找最优平衡点的抽象问题。


四、问题解法

Skill0.5 的解决方案是一个两阶段框架:Phase-1 难度感知路由 + Phase-2 层级定制优化。其设计灵感来自认知科学的一个经典发现——专业技能的获取遵循顺序进展:学习者必须先构建基础认知模式,然后才能高效处理领域特定规则。

4.1 总体架构

┌──────────────────────────────────────────────────────────────┐
│                    Skill0.5 训练框架                          │
├──────────────────────────────────────────────────────────────┤
│                                                              │
│  Phase-1: 难度感知路由(Difficulty-Aware Routing)            │
│    · 对每个任务采样 G 条轨迹,计算通过率 p                     │
│    · 动态计算阈值 η(滑动窗口平均通过率)                      │
│    · 将任务分为三层:                                         │
│      - Hard:p = 0(完全失败)                                │
│      - Medium:0 < p ≤ η(部分成功)                          │
│      - Easy:p > η(大部分成功)                               │
│                                                              │
│  Phase-2: 层级定制优化(Tier-Specific Optimization)           │
│    · Hard → 特权蒸馏(内化通用技能)                           │
│    · Medium → 标准 GRPO(强化能力)                            │
│    · Easy → 反捷径利用(强制使用特定技能)                     │
│                                                              │
└──────────────────────────────────────────────────────────────┘

4.2 Phase-1:难度感知路由

为什么需要路由?

直接原因:GRPO 算法有一个致命缺陷——难度不敏感。当任务过难时(所有采样轨迹都失败),组内奖励方差为零,优势函数全为零,梯度消失;当任务过简时(所有轨迹都成功),情况同样如此。Skill0.5 通过路由机制,对不同难度的任务施加不同的优化策略,巧妙绕开了这个问题。

具体做法:

对于当前训练批次中的每个任务 $x_i$:

  1. 标准探测:使用仅包含检索到的任务特定技能的标准提示(不含通用技能),采样 G 条独立轨迹
  2. 计算通过率:$p_i = \frac{1}{G}\sum R(\tau)$,即 G 条轨迹中成功的比例
  3. 动态阈值:使用滑动窗口(窗口大小 W=5)计算近几步的平均通过率 $\eta_t$
  4. 三层路由:
    • Hard(完全失败,$p_i = 0$):Agent 完全不会做这类任务 → 需要教师指导
    • Medium(部分成功,$0 < p_i \leq \eta_t$):Agent 有些思路但不稳定 → 需要试错强化
    • Easy(大部分成功,$p_i > \eta_t$):Agent 基本会做了 → 需要防止偷懒

关键设计细节:Phase-1 采样的轨迹不是浪费的——它们会被 Opportunistic 重用于 Phase-2 的优化。这种"一鱼两吃"的设计大大提高了训练效率。

4.3 Phase-2 之 Hard 层:特权蒸馏(Privileged Distillation)

适用场景:Agent 完全不会做这类任务(通过率为 0)。

核心思想:既然 Agent 自己做不了,那就找一个"更强的老师"来示范。这个老师拥有"特权信息"——它能同时看到通用技能和特定技能,而"学生"(Agent 本身)只能看到特定技能。通过让学生模仿老师的行为,通用技能的策略精髓就被间接地编码到了学生的参数中。

“特权"是什么意思?

这里的"特权”(Privileged)指的是教师策略拥有的额外信息。在 Skill0.5 中:

  • 教师(Teacher):在推理时能同时看到通用技能 $\mathcal{S}_G$ 和特定技能 $\mathcal{K}_t(x_i)$,即 $c_t^{priv} = \mathcal{S}_G \cup \mathcal{K}_t(x_i)$
  • 学生(Student):只能看到特定技能 $c_t^{std} = \mathcal{K}_t(x_i)$

但这不是两个不同的模型! 教师和学生是同一个模型(参数 $\theta$ 相同),只是看到了不同的上下文。教师使用了丰富的上下文(包含通用技能),学生使用了精简的上下文(不含通用技能)。通过蒸馏,让学生在精简上下文下的行为逼近教师在丰富上下文下的行为。

具体做法:

  1. 对每个 Hard 任务 $x_i$,使用特权提示(包含通用技能 + 特定技能)重新采样 G 条轨迹
  2. 筛选出成功的轨迹,构成"黄金集" $\mathcal{T} = \{\tau^{(2)} | R(\tau^{(2)}) = 1\}$
  3. 使用 token 级 Jensen-Shannon 散度(JSD) 进行蒸馏:
$$\mathcal{L}_{hard} = \frac{1}{|\mathcal{T}|} \sum_{\tau \in \mathcal{T}} \frac{1}{|\tau|} \sum_{k=1}^{|\tau|} \text{JSD}(\text{sg}[\pi_\theta^t(k)] \| \pi_\theta^s(k))$$

其中:

  • $\pi_\theta^t$ 是教师策略(使用特权上下文)
  • $\pi_\theta^s$ 是学生策略(使用标准上下文)
  • $\text{sg}[\cdot]$ 是停止梯度算子(确保只有学生端被优化,教师端保持固定)

JSD 是什么? Jensen-Shannon 散度是一种度量两个概率分布之间差异的方法,相比 KL 散度,它更对称、更稳定、始终非负。在这里,它衡量的是"教师在该位置选择各 token 的概率分布"和"学生在同一位置选择各 token 的概率分布"之间的差异。

直觉理解:这就像让一个学生(只看到简略提纲)去模仿老师(看到了完整教案)的讲课方式。学生虽然看不到完整教案,但通过反复模仿老师的行为,最终能"内化"教案中的精髓。

4.4 Phase-2 之 Medium 层:标准 GRPO 能力强化

适用场景:Agent 有时能成功,有时失败(通过率在 0 和动态阈值之间)。

核心思想:Agent 已经具备了基本能力,只需要通过奖励信号驱动的试错来强化。

具体做法:

直接复用 Phase-1 采样的轨迹(不需要额外采样),应用标准 GRPO:

$$\mathcal{L}_{medium} = \frac{1}{G}\sum_{g=1}^{G}\sum_{k=1}^{|\tau^{(g)}|}\min(\rho_k^{(g)} A_i^{(g)}, \text{clip}(\rho_k^{(g)}, 1-\varepsilon, 1+\varepsilon)A_i^{(g)})$$

其中优势函数通过组内归一化计算:$A_i^{(g)} = \frac{R_i^{(g)} - \text{mean}(R_i)}{\text{std}(R_i)}$

这一层是"优化的最佳甜点":

  • 不像 Hard 层那样需要额外采样(效率低),直接复用 Phase-1 的轨迹
  • 不像 Easy 层那样需要防止捷径(此时 Agent 还没稳定成功,不存在偷懒问题)
  • 标准的奖励驱动优化就能很好地工作

4.5 Phase-2 之 Easy 层:反捷径利用(Anti-Shortcut Utilization)

适用场景:Agent 大部分时候都能成功(通过率高于动态阈值)。

核心问题:什么是捷径学习?

当 Agent 对某类任务的成功率很高时,一个隐蔽的危险出现了:Agent 可能根本就没有在使用你提供的技能! 它可能找到了某种"捷径"——比如记住了一些从任务指令直接到动作的虚假映射关系。这就好比一个学生考试总是满分,但其实是在背答案而不是理解知识——换个题型他就懵了。

具体来说,捷径学习的表现是:即使你把特定技能从 prompt 中拿掉,Agent 的成功率也不会下降多少。这说明技能对成功的"因果贡献"很小,Agent 并没有真正依赖技能来完成任务。

反捷径机制的具体做法:

  1. 无技能探测:故意从 prompt 中移除所有特定技能($c_t^{none} = \emptyset$),采样 G 条"诊断轨迹"

  2. 计算利用增益:$u_i = p_i - p_i^{none}$(有技能的成功率 - 无技能的成功率)

    • 如果 $u_i$ 很大:说明技能对成功很重要,Agent 确实在使用技能 → 好
    • 如果 $u_i$ 很小:说明 Agent 在偷懒,不依赖技能也能成功 → 需要惩罚
  3. 构建复合优势:

    $$\hat{A}_i^{(g)} = \underbrace{A_i^{(g)}}_{\text{轨迹级质量}} + \underbrace{A_i^u}_{\text{任务级利用}}$$
    • $A_i^{(g)}$:常规的 GRPO 优势(奖励驱动的质量评估)
    • $A_i^u$:利用优势(技能因果贡献的评估)
  4. 惩罚捷径行为:当 $u_i < \bar{u}_t$(技能利用不足)时,$A_i^u$ 为负,全局抑制该任务的优化梯度,惩罚绕过特定技能的动作分布

直觉理解:这就像考试时故意不给学生公式表,看他还能不能做题。如果学生不用公式表也能做对,说明他要么是背了答案(捷径),要么是真正理解了(好事)。通过这种方式,我们可以检测并惩罚"背答案"的行为,迫使 Agent 真正利用提供的技能来解决问题。

4.6 三层优化的协同效果

Skill0.5 的三层优化不是独立运行的,而是构成了一个自适应课程学习:

训练阶段Hard 占比Medium 占比Easy 占比主导优化策略
早期高中低特权蒸馏(克服零梯度困境)
中期降低高升高GRPO 强化(稳定提升成功率)
后期低中高反捷径(防止退化,保障 OOD)

在训练早期,大多数任务都是 Hard(Agent 什么都不太会做)。此时特权蒸馏提供了有效的梯度来源,使 Agent 能快速建立基础能力。

在训练中期,大部分任务变为 Medium,标准 GRPO 的组内方差充足,提供了最有效的优化信号。

在训练后期,任务越来越 Easy,捷径学习风险升高。反捷径机制开始发挥作用,确保 Agent 持续依赖特定技能,而不是走捷径。

这种自适应切换是 Skill0.5 超越所有基线的关键——基线方法要么在早期梯度消失(如 SKILL0),要么在后期过拟合(如 SkillRL),要么行为崩溃(如 SLIM)。

4.7 推理时的部署

训练完成后,Skill0.5 的推理非常简洁:

  • 通用技能 $\mathcal{S}_G$:已被内化到模型参数中,不需要出现在 prompt 中
  • 任务特定技能:通过语义检索找到最相关的 K 条技能,拼接到 prompt 中
  • 运行时上下文:$c_t = \mathcal{K}_t(x)$(仅包含检索到的特定技能)

对于 OOD 任务,只需要从新的 OOD 特定技能库中检索即可——通用推理能力已经在模型"骨子"里了。


五、必要知识反推

假设让一个完全没有相关知识的人来复现这项工作,他需要掌握哪些知识和信息?以下是从发现问题到解决问题过程中必须了解的知识链条:

5.1 发现问题所需的知识

  1. Agent RL 的基本范式:理解如何将 Agent 与环境的交互建模为 POMDP,理解策略梯度方法的基本原理

  2. 技能增强 RL 的现状:了解 SkillRL、SKILL0 等现有方法的具体做法和局限性,特别是"完全外部化"和"完全内化"的困境

  3. GRPO 算法的机制和局限:深入理解 GRPO 的组内相对比较机制,以及它在过难/过简任务上梯度消失的问题

  4. 上下文学习(In-Context Learning)的特性:理解 LLM 处理长上下文时的性能衰减现象,以及指令遵循能力与 prompt 长度的关系

  5. OOD 泛化的挑战:理解为什么在训练分布内表现好不等于在分布外也能表现好,以及内化方法在 OOD 场景下面临的参数知识冲突问题

5.2 解决问题所需的知识

  1. 认知科学中的技能获取理论:了解专业技能的获取遵循从"基础认知模式"到"领域特定规则"的顺序进展,这启发了差异化技能处理的思路

  2. 知识蒸馏(Knowledge Distillation):理解教师-学生框架、软标签蒸馏、JSD 散度等概念,这是特权蒸馏的核心技术

  3. 课程学习(Curriculum Learning):理解从易到难的训练策略,以及自适应难度调整的方法

  4. 捷径学习(Shortcut Learning):理解神经网络"走捷径"的现象,即利用虚假相关性而非真正的因果机制来获得高准确率

  5. 因果推断的基本概念:理解如何通过"干预实验"(如移除技能)来评估某个因素的因果贡献,这是反捷径利用的核心思想

5.3 知识融合的关键步骤

将上述知识融合为 Skill0.5 的过程可以概括为:

  1. 洞察分层(知识 1+2+4+5):从现有方法的局限性中提炼出"技能应该分类处理"的洞察
  2. 设计路由(知识 3+6+8):用难度感知路由实现自适应课程学习,同时解决 GRPO 的梯度消失问题
  3. 构建蒸馏(知识 6+7):用特权蒸馏实现通用技能的内化,将"认知基础"注入模型参数
  4. 设计反捷径(知识 9+10):用因果干预的思想检测并惩罚捷径行为,确保技能的真正利用

六、论文中可以提取的通用性灵感

灵感一:不是所有知识都应该以同一种方式处理

Skill0.5 最大的洞见是:不同类型的知识需要不同的处理方式。通用性知识适合内化(稳定、不常变),领域性知识适合外部化(灵活、频繁更新)。这个原则不仅仅适用于 Agent 技能,也适用于:

  • 教育领域:基础思维能力(如逻辑推理)应该被深度内化,而具体操作步骤(如软件使用教程)更适合作为外部参考
  • 组织管理:企业文化价值观应该被"内化"到每个员工的思维中,而 SOP 流程更适合作为外部文档随时查阅
  • 系统设计:核心算法可以硬编码,业务规则应该可配置

灵感二:动态路由是解决"一刀切"优化的通用方案

GRPO 对所有任务一视同仁,导致过难和过简任务上梯度消失。Skill0.5 通过难度感知路由,为不同难度的任务匹配不同的优化策略。这种思路可以推广到:

  • 任何 RL 训练:当任务难度分布不均匀时,基于难度的分层优化可以提高训练效率
  • 课程设计:根据学生水平动态调整教学策略
  • 资源分配:在计算资源有限时,将更多资源分配给"最有信息量"的任务

灵感三:用"教师特权"来跨越学习鸿沟

Skill0.5 的特权蒸馏巧妙地解决了一个经典困境:学习者做不了的任务,怎么让他学?答案是给他一个拥有特权信息的"教师"来示范。教师不是永远存在的,而是一个临时支架——学生通过模仿最终学会了独立完成。

  • 技术领域:在模型训练中,可以用"拥有更多信息的模型"来蒸馏"信息受限的模型"
  • 教育领域:在教学中提供逐步撤除的"脚手架"(scaffolding)
  • 产品领域:给新用户额外的引导信息,随使用次数逐步简化

灵感四:检测"虚假成功"比检测失败更重要

Skill0.5 的反捷径利用机制揭示了一个深刻问题:高成功率不等于真正掌握了技能。Agent 可能在走捷径,看似成功但实际上没有利用你提供的知识。

这个洞见在许多领域都成立:

  • 测试领域:高通过率可能意味着测试太简单或学生找到了应试技巧,而非真正理解
  • 产品领域:高日活可能来自上瘾机制而非真实价值创造
  • 研究评估:在 benchmark 上的高分可能来自数据泄漏而非模型能力的真正提升

通用方法:通过"移除关键支撑后观察性能变化"来评估真正的因果贡献。

灵感五:自适应阈值比固定阈值更鲁棒

Skill0.5 没有使用固定的通过率阈值来区分任务难度,而是使用滑动窗口动态计算。这意味着"Hard/Medium/Easy"的定义会随着训练进展而自动调整——训练初期 50% 的通过率可能是"Easy",但训练后期同样的 50% 可能是"Medium"。

这种自适应阈值的思想可以广泛应用于:

  • 异常检测:正常/异常的边界应该随时间调整
  • 性能评估:“好"和"差"的标准应该随整体水平提升而提高
  • 目标设定:阶段性目标应该基于当前能力动态调整

灵感六:一鱼两吃——探测信号的复用

Skill0.5 在 Phase-1 采样的轨迹被直接复用于 Phase-2 的优化。这种"一次采样,两次使用"的设计将计算效率最大化。

在工程和研究中,这种"探测-利用"一体化思维非常有价值:

  • A/B 测试:测试流量不仅可以评估策略,还可以直接用于在线学习
  • 监控数据:日常监控收集的数据不仅可以报警,还可以用于趋势预测
  • 用户调研:调研结果不仅可以指导当前决策,还可以沉淀为用户画像

灵感七:认知科学是 AI 系统设计的宝贵灵感来源

Skill0.5 的整个设计(从"技能分层"到"顺序获取"再到"难度递进”)都受到认知科学中专业技能获取理论的启发。这提醒我们:

  • 跨学科思维的重要性:许多看似全新的 AI 技术问题,在认知科学、教育学、心理学中已经有成熟的理论框架可以借鉴
  • “人是怎么学的"往往是"模型该怎么训练"的好参考:人类的认知机制经过数百万年进化,已经找到了很多高效的解决方案
  • 抽象化人类认知理论可以为 AI 提供高层指导,而不需要逐个试错

七、实验结果要点

7.1 主要结果

ALFWorld(文本型具身环境):

方法ID 平均分OOD 平均分
SkillRL(完全外部化)90.845.3
SKILL0(完全内化)85.139.6
SLIM(动态管理)82.835.8
Skill0.593.158.5

Skill0.5 比最强基线 SkillRL:ID 提升 +2.3%,OOD 提升 +13.2%。

WebShop(网页购物环境):

方法ID 平均分OOD 平均分
SkillRL38.336.7
SKILL035.235.4
SLIM33.733.8
Skill0.540.440.6

7.2 消融实验的关键发现

变体ID 平均分OOD 平均分
仅内化(Internalize-Only)89.652.8
仅利用(Utilize-Only)85.150.9
Skill0.5(联合)93.158.5

两个关键结论:

  1. 内化是整体能力的严格前提:仅利用变体在两个分割上都经历了灾难性下降
  2. 利用解锁峰值 OOD 适应性:仅内化变体在 OOD 上适度下降,缺乏对比利用损失限制了峰值泛化

7.3 失败机制分析

论文识别了基线方法在 OOD 场景下的三种典型失败机制:

方法失败机制根因
SkillRL上下文干扰OOD 特定技能被 ID 训练时形成的习惯性关联所覆盖
SKILL0参数知识冲突内化的 ID 模板产生与 OOD 程序不兼容的动作
SLIM行为崩溃过早退役通用技能后,从成功逐步退化为任务幻觉

Skill0.5 在所有案例中都成功:通用推理已内化到参数中,同时忠实地执行新颖的 OOD 特定技能。


八、总结

Skill0.5 是 Agent 技能增强 RL 领域的一个重要里程碑。它的核心贡献不是某一个具体的技术组件,而是一个简单而深刻的洞察:不同类型的技能应该以不同的方式处理。通用技能内化提供稳定的认知基础,任务特定技能外部化提供灵活的适应性。通过难度感知路由和层级定制优化,Skill0.5 将这两者有机地结合在了一个统一的训练框架中。

在 ID 和 OOD 场景下均显著超越所有基线的实验结果,验证了这种差异化处理策略的有效性。尤其是 OOD 场景下 13.2% 的大幅提升,证明了"内化通用 + 利用特定"的混合策略在泛化能力上的巨大优势。


参考文献:

  • Zhu et al., “Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning,” arXiv:2605.28424, 2026.
  • Xia et al., “SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning,” arXiv:2602.08234, 2026.
  • “SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization,” arXiv:2604.02268, 2026.
  • “SLIM: Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning,” arXiv:2605.10923, 2026.