论文链接:arxiv.org/abs/2605.28424 代码仓库:github.com/JasonZhujp/Skill0_5 发表时间:2026年5月 机构:华东师范大学 × 美团龙猫团队(学校学生 + 企业合著) 基础模型:Qwen2.5-7B-Instruct
一、论文背景
1.1 什么是 Agent Skill?
在 AI Agent(智能体)的体系中,Skill(技能) 是一段结构化的自然语言策略文档,被插入到 Agent 的上下文中,为 Agent 提供特定领域的程序性知识。你可以把它类比为给一位通才型员工发放的"岗位操作手册"——员工本身很聪明,但面对特定领域任务时,一份好的操作手册能让其表现产生质的飞跃。
具体来说,一个 Skill 通常包含:
- 任务求解流程:应该先做什么、后做什么、遇到异常怎么办
- 领域知识:该领域的专业术语、约定俗成的规则
- 操作指南:哪些工具可用、如何调用、常见陷阱有哪些
例如,在代码评审 Agent 中,Skill 可以是关于"如何识别并发安全的潜在缺陷"的专业指导;在电商购物 Agent 中,Skill 可以是"如何根据用户需求筛选最匹配商品"的操作策略。
1.2 什么是 Harness?
Harness(执行线束) 是围绕 Agent 构建的运行时基础设施,相当于 Agent 的"操作系统 + 管控平台"。模型本身只是一个文本输入/输出的"大脑",但要让 Agent 真正完成实际任务,还需要大量的支撑组件:
- 系统提示(System Prompt):定义 Agent 的角色、行为边界
- 工具系统(Tools):让 Agent 能够读写文件、执行命令、搜索网络
- 执行环境(Sandbox):提供文件系统、浏览器、沙盒等运行时基础设施
- 技能系统(Skills):为 Agent 提供领域知识的可插拔模块
- 任务编排逻辑:子 Agent 调度、路由等
- 执行控制逻辑:Hooks、中间件等
Claude Code、Codex CLI、OpenAI Codex 等都是典型的 Harness 实现。它们为 Agent 提供了"手脚"和"工作台",让模型从"能对话"进化为"能干活"。
1.3 Agent 中的 Skill 分类:通用技能 vs. 任务特定技能
Skill0.5 这篇论文首先提出了一个关键洞察:不是所有的技能都是一样的。Agent 的技能可以自然地分为两类:
通用技能(General Skills):
- 定义:与领域无关的元认知策略,如"逐步推理"、“错误恢复”、“任务分解”
- 特点:在所有任务中都适用,文本较长,占用大量上下文空间
- 类比:就像"学会如何学习"这种元能力——不管你学什么科目,这种能力都有用
任务特定技能(Task-Specific Skills):
- 定义:与具体任务领域显式关联的细粒度执行规则
- 特点:针对特定场景,文本较短,需要频繁更新和动态检索
- 类比:就像"如何操作某台特定型号的 CNC 机床"——非常具体,换一台设备就不一样了
1.4 当前的困境:两个极端范式
在 Skill0.5 之前,基于技能的 Agent 强化学习方法被迫在两个极端之间做出选择:
极端一:完全外部化(Full Externalization)
代表工作:SkillRL。在训练和推理时,将所有技能(通用 + 特定)都作为外部上下文拼接到 prompt 中。
问题:
- 上下文过长:大量技能文本会严重膨胀 prompt,让 Agent 难以有效聚焦于关键信息
- 推理效率低:每一步都要处理冗长的上下文,增加延迟和计算成本
- 指令遵循下降:研究表明,当 prompt 过长时,LLM 的指令遵循能力会显著下降
极端二:完全内化(Full Internalization)
代表工作:SKILL0。在训练时将所有技能逐步"吸收"到模型参数中,推理时完全不提供任何技能上下文。
问题:
- 模型容量有限:7B 参数的模型能"记住"的技能总量有限,强行压缩会丢失信息
- 知识冲突:当训练时内化的技能与新遇到的任务场景产生冲突时,模型会"犯糊涂"
- OOD 泛化差:面对训练时没见过的新任务类型,内化的旧技能可能产生错误引导
核心矛盾:两种极端都不理想——全外部化太"笨重",全内化太"脆弱"。有没有一种方法能兼得两者的优点?
二、论文定位和关联工作
Skill0.5 不是凭空出现的。它位于一条清晰的"技能增强 Agent RL"研究脉络之中,可以看作是这个方向的第四代工作。理解它的定位,需要先了解三代前序工作。
2.1 第一代:技能外部化——SkillRL(2026.02)
SkillRL(Evolving Agents via Recursive Skill-Augmented Reinforcement Learning)是这个方向的开创性工作。它的核心思想是:
- 自动构建分层技能库:将 Agent 的成功经验自动提炼为可复用的技能文档
- 运行时检索技能:每次执行任务时,从技能库中检索最相关的技能作为上下文
- 递归优化:技能和策略同步迭代优化
定位:SkillRL 确立了"技能 + RL"的基本范式,证明了结构化的技能文档能显著提升 Agent 的任务完成率。但它选择了"所有技能都放 prompt 里"的外部化路线,受限于上下文长度。
2.2 第二代:技能内化——SKILL0(2026.04)
SKILL0(In-Context Agentic Reinforcement Learning for Skill Internalization)是由浙江大学等机构提出的,直接针对 SkillRL 的上下文膨胀问题。它的核心思想是:
- 训练时提供完整技能上下文:让 Agent 在丰富的技能指导下学习
- 渐进式撤回技能:随着训练推进,逐步从 prompt 中移除技能文本
- 推理时零技能:Agent 已经"学会"了技能,不再需要外部提示
定位:SKILL0 首次提出"将技能内化到模型参数"的思路,实现了推理时的上下文高效。但它的 OOD 泛化表现较差——面对没见过的新任务,内化的旧技能反而可能产生误导。
2.3 第三代:动态管理——SLIM(2026.05)
SLIM(Dynamic Skill Lifecycle Management for Agentic RL)试图在前两者之间找平衡。它的核心思想是:
- 技能生命周期管理:不假设技能应该永远存在或完全消失,而是动态决定保留哪些、淘汰哪些
- 验证驱动的优化:通过验证集上的表现来决定技能集的组成
- 统一处理:对所有技能一视同仁,不做区分
定位:SLIM 引入了动态管理的思想,但仍然统一处理所有技能,没有意识到通用技能和任务特定技能在本质上的差异。实际上,SLIM 在训练后期可能过早退役通用技能,导致行为崩溃。
2.4 第四代:差异化处理——Skill0.5(本文,2026.05)
Skill0.5 的定位非常清晰:它是第一个明确区分通用技能和任务特定技能处理方式的框架。
| 方法 | 通用技能 | 任务特定技能 | 关键创新 |
|---|---|---|---|
| SkillRL | 外部化 | 外部化 | 自动技能库构建 |
| SKILL0 | 内化 | 内化 | 渐进式上下文撤回 |
| SLIM | 统一管理 | 统一管理 | 动态技能生命周期 |
| Skill0.5 | 内化 | 利用(外部化) | 差异化 + 难度感知路由 |
Skill0.5 的核心洞见是:通用技能应该被内化到模型参数中,建立稳固的认知基础;而任务特定技能应该保持外部化,实现灵活的即插即用。这种差异化处理在之前的工作中从未被明确提出。
2.5 底层 RL 算法:GRPO
Skill0.5 的底层优化算法使用的是 GRPO(Group Relative Policy Optimization,组相对策略优化),这是 DeepSeek 团队于 2024 年提出的一种高效 RL 算法:
- 核心思想:对同一个任务采样多条轨迹,通过组内相对比较计算优势函数,无需训练额外的价值网络(Critic)
- 优势:节省近一半的训练内存和计算量,特别适合大语言模型的强化学习
- 局限:当任务过难(所有轨迹都失败)或过简(所有轨迹都成功)时,组内奖励方差消失,无法提供有效的优化梯度
Skill0.5 正是在 GRPO 的基础上,通过难度感知路由解决了"过难和过简任务梯度消失"的核心问题。
三、问题定义
3.1 从具体场景到抽象问题
想象你正在训练一个购物 Agent。它需要两类知识:
- 通用推理能力:比如"比较商品时要关注价格和评分的综合平衡"、“当搜索结果不满意时要尝试换关键词”
- 特定类别知识:比如"买鞋子时要关注尺码对照表"、“买电子产品时要查看保修政策”
在训练时,你只能让它接触服装、电子产品、鞋类这几种品类(ID 任务)。但部署后,它可能会遇到珠宝、美妆、家居等从没见过的品类(OOD 任务)。
问题来了:你该如何训练这个 Agent,让它在已见过的品类上表现优秀(ID 性能),同时面对没见过的品类也能快速适应(OOD 泛化)?
3.2 核心问题抽象
Skill0.5 将上述场景抽象为以下数学框架:
环境建模:将 Agent 与环境的交互建模为部分可观测马尔可夫决策过程(POMDP),其中:
- Agent 看到的是文本形式的观测(如网页截图的文字描述)
- Agent 输出的是自然语言动作(如"点击搜索按钮"、“选择红色款”)
- 每个任务由文本指令指定(如"帮我找一双适合跑步的运动鞋")
技能分层:将技能库 $\mathcal{S}$ 分为两层:
- $\mathcal{S}_G$:通用技能集(元认知策略)
- $\mathcal{S}_S$:任务特定技能集(领域执行规则)
训练-评估设置:
- 训练阶段:Agent 只能见到 ID 任务和 ID 特定技能
- ID 评估:在训练任务类型上测试,使用 ID 特定技能
- OOD 评估:在全新任务类型上测试,使用从未见过的 OOD 特定技能
最本质的问题定义:在排除其他外部信息干扰的前提下,如何设计一个训练框架,使得:
- 通用技能的策略精髓(而非文本本身)被永久性地编码到模型参数中,形成跨领域的认知基础
- 任务特定技能能够即插即用——面对全新任务时,只需检索并注入对应的特定技能,Agent 就能正确执行
- 两种技能处理方式联合优化,不会相互干扰或退化
这是一个在"内化稳定性"和"外部灵活性"之间寻找最优平衡点的抽象问题。
四、问题解法
Skill0.5 的解决方案是一个两阶段框架:Phase-1 难度感知路由 + Phase-2 层级定制优化。其设计灵感来自认知科学的一个经典发现——专业技能的获取遵循顺序进展:学习者必须先构建基础认知模式,然后才能高效处理领域特定规则。
4.1 总体架构
┌──────────────────────────────────────────────────────────────┐
│ Skill0.5 训练框架 │
├──────────────────────────────────────────────────────────────┤
│ │
│ Phase-1: 难度感知路由(Difficulty-Aware Routing) │
│ · 对每个任务采样 G 条轨迹,计算通过率 p │
│ · 动态计算阈值 η(滑动窗口平均通过率) │
│ · 将任务分为三层: │
│ - Hard:p = 0(完全失败) │
│ - Medium:0 < p ≤ η(部分成功) │
│ - Easy:p > η(大部分成功) │
│ │
│ Phase-2: 层级定制优化(Tier-Specific Optimization) │
│ · Hard → 特权蒸馏(内化通用技能) │
│ · Medium → 标准 GRPO(强化能力) │
│ · Easy → 反捷径利用(强制使用特定技能) │
│ │
└──────────────────────────────────────────────────────────────┘
4.2 Phase-1:难度感知路由
为什么需要路由?
直接原因:GRPO 算法有一个致命缺陷——难度不敏感。当任务过难时(所有采样轨迹都失败),组内奖励方差为零,优势函数全为零,梯度消失;当任务过简时(所有轨迹都成功),情况同样如此。Skill0.5 通过路由机制,对不同难度的任务施加不同的优化策略,巧妙绕开了这个问题。
具体做法:
对于当前训练批次中的每个任务 $x_i$:
- 标准探测:使用仅包含检索到的任务特定技能的标准提示(不含通用技能),采样 G 条独立轨迹
- 计算通过率:$p_i = \frac{1}{G}\sum R(\tau)$,即 G 条轨迹中成功的比例
- 动态阈值:使用滑动窗口(窗口大小 W=5)计算近几步的平均通过率 $\eta_t$
- 三层路由:
- Hard(完全失败,$p_i = 0$):Agent 完全不会做这类任务 → 需要教师指导
- Medium(部分成功,$0 < p_i \leq \eta_t$):Agent 有些思路但不稳定 → 需要试错强化
- Easy(大部分成功,$p_i > \eta_t$):Agent 基本会做了 → 需要防止偷懒
关键设计细节:Phase-1 采样的轨迹不是浪费的——它们会被 Opportunistic 重用于 Phase-2 的优化。这种"一鱼两吃"的设计大大提高了训练效率。
4.3 Phase-2 之 Hard 层:特权蒸馏(Privileged Distillation)
适用场景:Agent 完全不会做这类任务(通过率为 0)。
核心思想:既然 Agent 自己做不了,那就找一个"更强的老师"来示范。这个老师拥有"特权信息"——它能同时看到通用技能和特定技能,而"学生"(Agent 本身)只能看到特定技能。通过让学生模仿老师的行为,通用技能的策略精髓就被间接地编码到了学生的参数中。
“特权"是什么意思?
这里的"特权”(Privileged)指的是教师策略拥有的额外信息。在 Skill0.5 中:
- 教师(Teacher):在推理时能同时看到通用技能 $\mathcal{S}_G$ 和特定技能 $\mathcal{K}_t(x_i)$,即 $c_t^{priv} = \mathcal{S}_G \cup \mathcal{K}_t(x_i)$
- 学生(Student):只能看到特定技能 $c_t^{std} = \mathcal{K}_t(x_i)$
但这不是两个不同的模型! 教师和学生是同一个模型(参数 $\theta$ 相同),只是看到了不同的上下文。教师使用了丰富的上下文(包含通用技能),学生使用了精简的上下文(不含通用技能)。通过蒸馏,让学生在精简上下文下的行为逼近教师在丰富上下文下的行为。
具体做法:
- 对每个 Hard 任务 $x_i$,使用特权提示(包含通用技能 + 特定技能)重新采样 G 条轨迹
- 筛选出成功的轨迹,构成"黄金集" $\mathcal{T} = \{\tau^{(2)} | R(\tau^{(2)}) = 1\}$
- 使用 token 级 Jensen-Shannon 散度(JSD) 进行蒸馏:
其中:
- $\pi_\theta^t$ 是教师策略(使用特权上下文)
- $\pi_\theta^s$ 是学生策略(使用标准上下文)
- $\text{sg}[\cdot]$ 是停止梯度算子(确保只有学生端被优化,教师端保持固定)
JSD 是什么? Jensen-Shannon 散度是一种度量两个概率分布之间差异的方法,相比 KL 散度,它更对称、更稳定、始终非负。在这里,它衡量的是"教师在该位置选择各 token 的概率分布"和"学生在同一位置选择各 token 的概率分布"之间的差异。
直觉理解:这就像让一个学生(只看到简略提纲)去模仿老师(看到了完整教案)的讲课方式。学生虽然看不到完整教案,但通过反复模仿老师的行为,最终能"内化"教案中的精髓。
4.4 Phase-2 之 Medium 层:标准 GRPO 能力强化
适用场景:Agent 有时能成功,有时失败(通过率在 0 和动态阈值之间)。
核心思想:Agent 已经具备了基本能力,只需要通过奖励信号驱动的试错来强化。
具体做法:
直接复用 Phase-1 采样的轨迹(不需要额外采样),应用标准 GRPO:
$$\mathcal{L}_{medium} = \frac{1}{G}\sum_{g=1}^{G}\sum_{k=1}^{|\tau^{(g)}|}\min(\rho_k^{(g)} A_i^{(g)}, \text{clip}(\rho_k^{(g)}, 1-\varepsilon, 1+\varepsilon)A_i^{(g)})$$其中优势函数通过组内归一化计算:$A_i^{(g)} = \frac{R_i^{(g)} - \text{mean}(R_i)}{\text{std}(R_i)}$
这一层是"优化的最佳甜点":
- 不像 Hard 层那样需要额外采样(效率低),直接复用 Phase-1 的轨迹
- 不像 Easy 层那样需要防止捷径(此时 Agent 还没稳定成功,不存在偷懒问题)
- 标准的奖励驱动优化就能很好地工作
4.5 Phase-2 之 Easy 层:反捷径利用(Anti-Shortcut Utilization)
适用场景:Agent 大部分时候都能成功(通过率高于动态阈值)。
核心问题:什么是捷径学习?
当 Agent 对某类任务的成功率很高时,一个隐蔽的危险出现了:Agent 可能根本就没有在使用你提供的技能! 它可能找到了某种"捷径"——比如记住了一些从任务指令直接到动作的虚假映射关系。这就好比一个学生考试总是满分,但其实是在背答案而不是理解知识——换个题型他就懵了。
具体来说,捷径学习的表现是:即使你把特定技能从 prompt 中拿掉,Agent 的成功率也不会下降多少。这说明技能对成功的"因果贡献"很小,Agent 并没有真正依赖技能来完成任务。
反捷径机制的具体做法:
无技能探测:故意从 prompt 中移除所有特定技能($c_t^{none} = \emptyset$),采样 G 条"诊断轨迹"
计算利用增益:$u_i = p_i - p_i^{none}$(有技能的成功率 - 无技能的成功率)
- 如果 $u_i$ 很大:说明技能对成功很重要,Agent 确实在使用技能 → 好
- 如果 $u_i$ 很小:说明 Agent 在偷懒,不依赖技能也能成功 → 需要惩罚
构建复合优势:
$$\hat{A}_i^{(g)} = \underbrace{A_i^{(g)}}_{\text{轨迹级质量}} + \underbrace{A_i^u}_{\text{任务级利用}}$$- $A_i^{(g)}$:常规的 GRPO 优势(奖励驱动的质量评估)
- $A_i^u$:利用优势(技能因果贡献的评估)
惩罚捷径行为:当 $u_i < \bar{u}_t$(技能利用不足)时,$A_i^u$ 为负,全局抑制该任务的优化梯度,惩罚绕过特定技能的动作分布
直觉理解:这就像考试时故意不给学生公式表,看他还能不能做题。如果学生不用公式表也能做对,说明他要么是背了答案(捷径),要么是真正理解了(好事)。通过这种方式,我们可以检测并惩罚"背答案"的行为,迫使 Agent 真正利用提供的技能来解决问题。
4.6 三层优化的协同效果
Skill0.5 的三层优化不是独立运行的,而是构成了一个自适应课程学习:
| 训练阶段 | Hard 占比 | Medium 占比 | Easy 占比 | 主导优化策略 |
|---|---|---|---|---|
| 早期 | 高 | 中 | 低 | 特权蒸馏(克服零梯度困境) |
| 中期 | 降低 | 高 | 升高 | GRPO 强化(稳定提升成功率) |
| 后期 | 低 | 中 | 高 | 反捷径(防止退化,保障 OOD) |
在训练早期,大多数任务都是 Hard(Agent 什么都不太会做)。此时特权蒸馏提供了有效的梯度来源,使 Agent 能快速建立基础能力。
在训练中期,大部分任务变为 Medium,标准 GRPO 的组内方差充足,提供了最有效的优化信号。
在训练后期,任务越来越 Easy,捷径学习风险升高。反捷径机制开始发挥作用,确保 Agent 持续依赖特定技能,而不是走捷径。
这种自适应切换是 Skill0.5 超越所有基线的关键——基线方法要么在早期梯度消失(如 SKILL0),要么在后期过拟合(如 SkillRL),要么行为崩溃(如 SLIM)。
4.7 推理时的部署
训练完成后,Skill0.5 的推理非常简洁:
- 通用技能 $\mathcal{S}_G$:已被内化到模型参数中,不需要出现在 prompt 中
- 任务特定技能:通过语义检索找到最相关的 K 条技能,拼接到 prompt 中
- 运行时上下文:$c_t = \mathcal{K}_t(x)$(仅包含检索到的特定技能)
对于 OOD 任务,只需要从新的 OOD 特定技能库中检索即可——通用推理能力已经在模型"骨子"里了。
五、必要知识反推
假设让一个完全没有相关知识的人来复现这项工作,他需要掌握哪些知识和信息?以下是从发现问题到解决问题过程中必须了解的知识链条:
5.1 发现问题所需的知识
Agent RL 的基本范式:理解如何将 Agent 与环境的交互建模为 POMDP,理解策略梯度方法的基本原理
技能增强 RL 的现状:了解 SkillRL、SKILL0 等现有方法的具体做法和局限性,特别是"完全外部化"和"完全内化"的困境
GRPO 算法的机制和局限:深入理解 GRPO 的组内相对比较机制,以及它在过难/过简任务上梯度消失的问题
上下文学习(In-Context Learning)的特性:理解 LLM 处理长上下文时的性能衰减现象,以及指令遵循能力与 prompt 长度的关系
OOD 泛化的挑战:理解为什么在训练分布内表现好不等于在分布外也能表现好,以及内化方法在 OOD 场景下面临的参数知识冲突问题
5.2 解决问题所需的知识
认知科学中的技能获取理论:了解专业技能的获取遵循从"基础认知模式"到"领域特定规则"的顺序进展,这启发了差异化技能处理的思路
知识蒸馏(Knowledge Distillation):理解教师-学生框架、软标签蒸馏、JSD 散度等概念,这是特权蒸馏的核心技术
课程学习(Curriculum Learning):理解从易到难的训练策略,以及自适应难度调整的方法
捷径学习(Shortcut Learning):理解神经网络"走捷径"的现象,即利用虚假相关性而非真正的因果机制来获得高准确率
因果推断的基本概念:理解如何通过"干预实验"(如移除技能)来评估某个因素的因果贡献,这是反捷径利用的核心思想
5.3 知识融合的关键步骤
将上述知识融合为 Skill0.5 的过程可以概括为:
- 洞察分层(知识 1+2+4+5):从现有方法的局限性中提炼出"技能应该分类处理"的洞察
- 设计路由(知识 3+6+8):用难度感知路由实现自适应课程学习,同时解决 GRPO 的梯度消失问题
- 构建蒸馏(知识 6+7):用特权蒸馏实现通用技能的内化,将"认知基础"注入模型参数
- 设计反捷径(知识 9+10):用因果干预的思想检测并惩罚捷径行为,确保技能的真正利用
六、论文中可以提取的通用性灵感
灵感一:不是所有知识都应该以同一种方式处理
Skill0.5 最大的洞见是:不同类型的知识需要不同的处理方式。通用性知识适合内化(稳定、不常变),领域性知识适合外部化(灵活、频繁更新)。这个原则不仅仅适用于 Agent 技能,也适用于:
- 教育领域:基础思维能力(如逻辑推理)应该被深度内化,而具体操作步骤(如软件使用教程)更适合作为外部参考
- 组织管理:企业文化价值观应该被"内化"到每个员工的思维中,而 SOP 流程更适合作为外部文档随时查阅
- 系统设计:核心算法可以硬编码,业务规则应该可配置
灵感二:动态路由是解决"一刀切"优化的通用方案
GRPO 对所有任务一视同仁,导致过难和过简任务上梯度消失。Skill0.5 通过难度感知路由,为不同难度的任务匹配不同的优化策略。这种思路可以推广到:
- 任何 RL 训练:当任务难度分布不均匀时,基于难度的分层优化可以提高训练效率
- 课程设计:根据学生水平动态调整教学策略
- 资源分配:在计算资源有限时,将更多资源分配给"最有信息量"的任务
灵感三:用"教师特权"来跨越学习鸿沟
Skill0.5 的特权蒸馏巧妙地解决了一个经典困境:学习者做不了的任务,怎么让他学?答案是给他一个拥有特权信息的"教师"来示范。教师不是永远存在的,而是一个临时支架——学生通过模仿最终学会了独立完成。
- 技术领域:在模型训练中,可以用"拥有更多信息的模型"来蒸馏"信息受限的模型"
- 教育领域:在教学中提供逐步撤除的"脚手架"(scaffolding)
- 产品领域:给新用户额外的引导信息,随使用次数逐步简化
灵感四:检测"虚假成功"比检测失败更重要
Skill0.5 的反捷径利用机制揭示了一个深刻问题:高成功率不等于真正掌握了技能。Agent 可能在走捷径,看似成功但实际上没有利用你提供的知识。
这个洞见在许多领域都成立:
- 测试领域:高通过率可能意味着测试太简单或学生找到了应试技巧,而非真正理解
- 产品领域:高日活可能来自上瘾机制而非真实价值创造
- 研究评估:在 benchmark 上的高分可能来自数据泄漏而非模型能力的真正提升
通用方法:通过"移除关键支撑后观察性能变化"来评估真正的因果贡献。
灵感五:自适应阈值比固定阈值更鲁棒
Skill0.5 没有使用固定的通过率阈值来区分任务难度,而是使用滑动窗口动态计算。这意味着"Hard/Medium/Easy"的定义会随着训练进展而自动调整——训练初期 50% 的通过率可能是"Easy",但训练后期同样的 50% 可能是"Medium"。
这种自适应阈值的思想可以广泛应用于:
- 异常检测:正常/异常的边界应该随时间调整
- 性能评估:“好"和"差"的标准应该随整体水平提升而提高
- 目标设定:阶段性目标应该基于当前能力动态调整
灵感六:一鱼两吃——探测信号的复用
Skill0.5 在 Phase-1 采样的轨迹被直接复用于 Phase-2 的优化。这种"一次采样,两次使用"的设计将计算效率最大化。
在工程和研究中,这种"探测-利用"一体化思维非常有价值:
- A/B 测试:测试流量不仅可以评估策略,还可以直接用于在线学习
- 监控数据:日常监控收集的数据不仅可以报警,还可以用于趋势预测
- 用户调研:调研结果不仅可以指导当前决策,还可以沉淀为用户画像
灵感七:认知科学是 AI 系统设计的宝贵灵感来源
Skill0.5 的整个设计(从"技能分层"到"顺序获取"再到"难度递进”)都受到认知科学中专业技能获取理论的启发。这提醒我们:
- 跨学科思维的重要性:许多看似全新的 AI 技术问题,在认知科学、教育学、心理学中已经有成熟的理论框架可以借鉴
- “人是怎么学的"往往是"模型该怎么训练"的好参考:人类的认知机制经过数百万年进化,已经找到了很多高效的解决方案
- 抽象化人类认知理论可以为 AI 提供高层指导,而不需要逐个试错
七、实验结果要点
7.1 主要结果
ALFWorld(文本型具身环境):
| 方法 | ID 平均分 | OOD 平均分 |
|---|---|---|
| SkillRL(完全外部化) | 90.8 | 45.3 |
| SKILL0(完全内化) | 85.1 | 39.6 |
| SLIM(动态管理) | 82.8 | 35.8 |
| Skill0.5 | 93.1 | 58.5 |
Skill0.5 比最强基线 SkillRL:ID 提升 +2.3%,OOD 提升 +13.2%。
WebShop(网页购物环境):
| 方法 | ID 平均分 | OOD 平均分 |
|---|---|---|
| SkillRL | 38.3 | 36.7 |
| SKILL0 | 35.2 | 35.4 |
| SLIM | 33.7 | 33.8 |
| Skill0.5 | 40.4 | 40.6 |
7.2 消融实验的关键发现
| 变体 | ID 平均分 | OOD 平均分 |
|---|---|---|
| 仅内化(Internalize-Only) | 89.6 | 52.8 |
| 仅利用(Utilize-Only) | 85.1 | 50.9 |
| Skill0.5(联合) | 93.1 | 58.5 |
两个关键结论:
- 内化是整体能力的严格前提:仅利用变体在两个分割上都经历了灾难性下降
- 利用解锁峰值 OOD 适应性:仅内化变体在 OOD 上适度下降,缺乏对比利用损失限制了峰值泛化
7.3 失败机制分析
论文识别了基线方法在 OOD 场景下的三种典型失败机制:
| 方法 | 失败机制 | 根因 |
|---|---|---|
| SkillRL | 上下文干扰 | OOD 特定技能被 ID 训练时形成的习惯性关联所覆盖 |
| SKILL0 | 参数知识冲突 | 内化的 ID 模板产生与 OOD 程序不兼容的动作 |
| SLIM | 行为崩溃 | 过早退役通用技能后,从成功逐步退化为任务幻觉 |
Skill0.5 在所有案例中都成功:通用推理已内化到参数中,同时忠实地执行新颖的 OOD 特定技能。
八、总结
Skill0.5 是 Agent 技能增强 RL 领域的一个重要里程碑。它的核心贡献不是某一个具体的技术组件,而是一个简单而深刻的洞察:不同类型的技能应该以不同的方式处理。通用技能内化提供稳定的认知基础,任务特定技能外部化提供灵活的适应性。通过难度感知路由和层级定制优化,Skill0.5 将这两者有机地结合在了一个统一的训练框架中。
在 ID 和 OOD 场景下均显著超越所有基线的实验结果,验证了这种差异化处理策略的有效性。尤其是 OOD 场景下 13.2% 的大幅提升,证明了"内化通用 + 利用特定"的混合策略在泛化能力上的巨大优势。
参考文献:
- Zhu et al., “Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning,” arXiv:2605.28424, 2026.
- Xia et al., “SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning,” arXiv:2602.08234, 2026.
- “SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization,” arXiv:2604.02268, 2026.
- “SLIM: Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning,” arXiv:2605.10923, 2026.