论文链接:arxiv.org/abs/2608.21292 代码仓库:github.com/JordanSancholhz/Action-Skill 发表时间:2026 年 8 月(arXiv:2608.21292v1,2026-08-21 提交) 机构:中国科学技术大学 × 澳大利亚新南威尔士大学(UNSW)× 中国科学院大学 × 西交利物浦大学 × 独立研究者——跨国多校合作 领域:cs.AI(Agent 技能 × 强化学习后训练) 基础模型:Qwen2.5-7B-Instruct(4×NVIDIA H200)


一、论文背景

1.1 Agent 技能是什么

在 LLM Agent 体系中,技能(Skill) 是一段可复用的程序性知识——可以是自然语言写成的任务策略、工具使用模式、或针对特定环境的启发式规则。它相当于给一位通才型员工配的"教练指导":员工本身能力强,但面对具体领域的长程任务时,好的指导能让其决策质量产生质变。Agent 在网页购物、具身家务、检索问答这类多步交互任务中,每一步都要决定"采取什么动作",还要决定"该让哪条程序性知识来指导这个动作"——技能就是后一问的答案载体。

1.2 技能利用的三种既有范式

按技能放在哪里,现有方法分成三派:

  • 完全外部化(Skill1 / SkillRL / Voyager):维护一个模型之外的技能库,执行时检索、拼接进上下文。可解释、可组合,但带来上下文开销与检索噪声。
  • 完全内化(Skill0 / LatentSkill / Skill-to-LoRA):训练时把技能"吸收"进模型参数,推理时零技能提示。省 token、不依赖外部记忆,但牺牲了显式技能的可控性与任务适配性。
  • 混合范式(Skill0.5):把可泛化的通用技能内化进模型,同时保留任务特定技能的显式利用,按任务难度在"内化目标"与"利用目标"之间路由。

1.3 两个被忽视的问题

问题一:任务级路由信号是噪声的。 Skill0.5 用滑动窗口内的经验成功率给样本分难度层,再对难/中/易任务施加不同优化目标。但阈值附近的样本经验成功率可能只差一个 rollout 单位——G=8 的设置下就是 1/8——却因为落在阈值两侧而被分到完全不同的优化目标。论文 Figure 1 在 ALFWorld、WebShop、SearchQA 三个基准上都观察到大量这种"边界样本",说明这种二选一的路由边界在实践中高度模糊。

问题二:同一条轨迹内的动作被赋予一致重要性。 无论选择内化还是利用,现有方法都以轨迹为单位做决定,轨迹内所有动作接受同一种训练对待。可技能指导的真实效应是异质的:它可能帮了轨迹中的某些动作,同时干扰了另一些。用整场赛后总结的平均分来对待每一球,既奖不了好球,也罚不了坏球。

二、论文定位和关联工作

AUSO 位于"技能增强 Agent RL"这条快速演化的谱系上,可以放进一张表里看:

方法技能位置优化粒度核心机制主要短板
Voyager(2023)完全外部—可执行技能库 + 课程驱动探索上下文膨胀、检索噪声
SkillRL(2026.02)完全外部轨迹级递归技能增强 RL,技能与策略同步演化全程拼 prompt,开销大
Skill1(2026.05)完全外部轨迹级技能增强 Agent 的统一演化同上
Skill0(2026.04)完全内化轨迹级上下文内 RL,渐进撤回技能提示OOD 泛化弱
LatentSkill(2026.06)潜空间内化轨迹级文本技能 → 权重潜技能同上
SLIM(2026.05)动态管理轨迹级技能生命周期动态保留/退役统一处理所有技能
Skill0.5(2026.05)混合任务级路由难度感知路由 + 特权蒸馏阈值噪声、轨迹内动作一视同仁
AUSO(本文)渐进过渡动作级双上下文 JSD 信号 + 不确定性门控需双份前向计算

AUSO 的定位很明确:它继承 Skill0.5"内化与利用应当共存"的动机,但把决策粒度从"哪条轨迹用哪个目标"下沉到"哪个动作从技能中受益",并且不再维护两个竞争性目标,而是让 GRPO 强化学习始终作为共享骨干,技能信息只以调制项的形式注入。

三、问题定义

论文把上述困境抽象为轨迹内技能效应异质性问题,并用一个干净的形式化框架刻画它。记策略为 π_θ,交互历史为 h_t。技能条件下的动作分布是 π_θ(a|h_t, C=Skill),无技能条件下是 π_θ(a|h_t, C=No-skill)(论文式 1、2 及利用期的式 18)。两个分布在同一状态上的差异,就是该状态下"技能对决策的改变量"——动作级的技能敏感性。

问题的完整表述包含三个相互咬合的缺口:

  1. 路由噪声:轨迹级成功率阈值把差异仅 1/8 的样本推向不同目标,训练信号在边界附近不稳定。
  2. 粒度错配:环境只给轨迹级结果奖励(成功/得分),它无法直接揭示"哪个动作受益于技能条件、哪个动作被技能干扰"——这正是 RL 经典的 credit assignment 难题在技能场景下的翻版。
  3. 目标割裂:内化与利用被当作两个不相交的目标,由硬路由二选一,训练过程被切碎。

AUSO 的目标由此导出:让技能学习遵循一个渐进的生命周期——先内化有用的技能知识,再通过自主探索提升能力,最终学会逐动作评估技能指导的收益并自适应地调整利用,而不是依赖粗粒度的任务级路由。

四、问题解法

AUSO 的总体设计是三阶段课程(默认比例 2:5:3),GRPO 全程作为优化骨干,变的只是技能信息的注入方式。

4.1 早期:师从式技能内化(约占 2 成)

早期训练有个冷启动死结:难任务上如果 8 条 rollout 全部失败,GRPO 的组归一化优势约等于零(式 3),策略从结果奖励中得不到任何"该改哪里"的信号。AUSO 的解法是同模型自蒸馏:同一个模型,教师侧条件于通用技能 S_G,学生侧裸看观察,各自算出动作分布 π_T(·|h_t, S_G) 与 π_S(·|h_t)——不需要额外环境 rollout。两者的 JSD 散度(在 top-k token 上计算,再在动作跨度内取平均,避免长动作被过度加权)就是"学生偏离教师多少"的动作级信息增益。

关键设计有三个:其一,蒸馏只在全失败任务组(成功率 p_q=0)上激活,不干扰正常 RL;其二,JSD 经组内标准化、tanh 有界化后变成 [-1,1] 内的中心化调制系数,再经 clip 上限温和地重加权各动作的监督强度——偏离大的动作获得更强纠偏,但不会被无限放大;其三,整个蒸馏项的权重 λ(s) 带"先爬坡后平滑退火"的调度(SmoothStep 曲线),随训练推进逐渐撤除教师。

4.2 中期:结果驱动的自主探索(约占 5 成)

教师撤出后,AUSO 退回纯标准 GRPO:多次采样、组内结果优势、自我更新(式 17)。这一段刻意保持"无技能干预",让已内化的知识在环境反馈中沉淀为自主解题能力。

4.3 成熟期:动作级技能利用(约占 3 成)

这是全文最核心的机制。对策略访问到的每个状态 h_t,用同一个策略在两个上下文条件下各算一次动作分布(式 18):

  • π_θ(·|h_t, C=Skill):挂上任务特定技能
  • π_θ(·|h_t, C=No-skill):不挂技能

两者的 JSD 记为动作级信息量 I_t(式 19)。因为两个分布在同一被访问状态上评估,不需要额外的环境 rollout,也避免了"比较两条独立生成轨迹"的错位。注意 I_t 不是蒸馏损失,它是纯信息度量:数值大只说明"技能在这个动作上改变了决策",不说明改变是好是坏——好坏由 RL 结果优势判定。

随后三步耦合把信号变成更新:

  1. 组内标准化:I_t 经 z-score 与 tanh 裁剪得到 m_t ∈ [-1,1],衡量该动作比任务平均更敏感还是更不敏感(式 20)。
  2. 不确定性门控:g(p_q) = K·p_q(1−p_q)(式 21)。二值结果在成功率接近 0.5 时信息量最大、接近 0 或 1 时几乎无信息——全成功或全失败的组没有成败对比可言,动作级归因不可靠,门就自动关小。附录 A.1 给出了统计论证:成败信息差估计的精度精确正比于 p_q(1−p_q)。
  3. 优势重加权:w_t = 1 + β(s)·g(p_q)·m_t(式 22),最终优势 A_AUSO = w_t · A_GRPO(式 24)。由于 w_t 恒正且任务内均值为 1,重加权只重新分配更新强度、不改变优化方向:成功轨迹中高技能敏感动作获得更强正强化,失败轨迹中高技能敏感动作被更强抑制,低信息动作少动。没有任何人工奖励被发明。

调度上 β(s) 随训练平滑上升(式 23),与早期的退火 α(s) 一降一升,构成"教师渐退、自主渐进"的交接。

4.4 为什么是 JSD:统一性的来源

附录给出了漂亮的理论闭环:在两个上下文等先验下,token 级 JSD 恰好等于技能上下文与动作之间的互信息,且以 log 2 为上界、严格对称——对称性保证了它适合比较同一策略的两个反事实决策(单向 KL 会引入人为的方向偏置),有界性保证了调制稳定。由此 AUSO 实现了三个统一:信号统一(内化与利用共用同一个反事实 JSD 算子,只是内化期当蒸馏监督、利用期当信用调制)、优化统一(所有分支更新同一策略)、骨干统一(当辅助信息缺失或不可靠时,目标连续退化为标准 GRPO)。技能也就完成了从"外部监督"到"自主调度的决策知识"的角色过渡。

五、评估指标与实验证据

5.1 实验设置

三个长程交互基准覆盖三种环境形态:ALFWorld(具身家务,交互上限 30 步,ID 为 Pick&Place / Clean&Place / Cool&Place,OOD 为 Examine in Light / Heat&Place / Pick Two&Place)、WebShop(网页购物,上限 15 步,ID 为服饰/电子/鞋类/其他,OOD 为配饰/美妆健康/家居装饰)、SearchQA(检索问答,单集最多 4 次搜索,训练只用 NQ 与 HotpotQA)。统一 Qwen2.5-7B-Instruct 底座、G=8、150 个优化步、技能库训练期间固定,保证公平对比。

5.2 主结果

方法WebShop IDWebShop OODALFWorld IDALFWorld OOD
GRPO33.632.380.543.4
SkillRL(外化)38.136.790.845.3
Skill0(内化)35.235.485.139.6
SLIM(动态管理)33.733.882.835.8
Skill0.5(混合路由)40.440.693.158.5
AUSO49.751.294.367.9
  • WebShop:ID/OOD 分别比 Skill0.5 高 9.3 与 10.6 个点,OOD(配饰 53.1、美妆 62.9)尤甚——说明动作级优化带来的是泛化而非对训练技能模式的记忆。
  • ALFWorld:ID 94.3 超 Skill0.5(93.1)1.2 个点;OOD 67.9 大幅领先 9.4 个点,其中最难的新任务 Pick Two & Place 从 33.3 提到 54.2(+20.9)。
  • SearchQA:七个子集平均 47.5,超过 SkillRL(47.1)、Skill1(44.7)、Skill0.5(44.2),在 TriviaQA(64.7)与 HotpotQA(44.0)上拿了最优。

5.3 消融:五个组件缺一不可

变体(ALFWorld ID / OOD)IDOOD
去动作级内化(w/o Int.-Action)85.154.7
去动作级利用(w/o Ut.-Action)89.749.1
去内化退火(w/o Int.-Decrease)83.954.7
去利用爬坡(w/o Ut.-Increase)86.239.6
去不确定性门控(w/o Gate)86.247.2
完整 AUSO94.367.9

两个方向的动作级机制、两条调度曲线、一个门控,去掉任何一个都明显掉分;“去利用爬坡”(教师不退场)OOD 崩得最狠(39.6),说明外部监督的滞留直接伤害泛化。

5.4 阶段比例:渐进结构本身是必要的

内化:探索:利用ALFWorld IDALFWorld OOD
3:5:285.162.3
3.3:3.3:3.3(均分)87.441.5
2:5:3(AUSO)94.367.9

最有信息量的反例是均分:ID 只微降,OOD 却从 67.9 崩到 41.5。探索期不足或利用期过度,都会让技能调度学不到可靠的逐动作判断——渐进比例不是超参调优的巧合,而是机制成立的条件。另有门控系数 K 的扫描在 K=4 处峰值(94.3/67.9),过大过小都退化,尤其伤 OOD。

5.5 行为级证据

训练动态上,同预算(150 步)对比中 Skill0.5 后期平台化甚至退化,AUSO 稳步上升;对比标准 GRPO,AUSO 成功率更高、策略熵更低、轨迹更短。案例研究直观展示了"逐球复盘"的效果:同一个多跳检索问题,AUSO 两步收敛给出精确答案"Manchester",Skill0.5 检索到证据后仍连发冗余查询、4 步后给出过规格答案"Manchester, Maine"被判错;ALFWorld 的 OOD 任务里,AUSO 用 4 步完成"定位—拿取—导航—放置",Skill0.5 在 25 步预算耗尽后仍未找到目标生菜。

六、效果优势的根源解释

把因果链拆开看,AUSO 的提升来自对旧范式一个结构性缺陷的修复:

旧范式的失效链条:任务级二选一目标 → 以轨迹为单位分配训练角色 → 轨迹内技能的有益效应与有害效应互相抵消、无法区分归因 → 只能靠噪声更大的任务级成功率做粗路由 → 边界样本训练不稳定、OOD 场景下技能调度失灵。

AUSO 的修复链条:双上下文在同一状态上配对评估 → 逐动作度量技能敏感性(JSD)→ 敏感度与轨迹结果优势耦合 → 有益的技能敏感动作增强、有害的被抑制、不敏感的少动 → 门控只在"成败共存"的可归因窗口内调制,且不改变优势符号、不发明奖励 → 技能从"要么全听、要么不听"的外部监督,过渡为"逐动作自主决定听多少"的决策知识。

OOD 提升幅度系统性大于 ID(WebShop +10.6 vs +9.3,ALFWorld +9.4 vs +1.2)恰好是这条链的旁证:动作级归因学到的是"如何判断技能何时有用"这一可迁移的元能力,而非训练域技能内容本身——前者在新任务上依然成立,后者不能。

七、必要知识反推

读懂这篇论文(以及复现它)需要哪些前置知识?

领域层:

  • 技能的生命周期三角色:训练早期技能是"可学习的知识"(教师),中期退为背景(能力靠 RL 沉淀),成熟期变为"按需调用的决策知识"(顾问)。
  • ID/OOD 协议下的技能划分:通用技能 S_G 跨域共享,域特定技能按 ID/OOD 分库;训练只见 ID 任务与 ID 技能。
  • 基线谱系:外部化(Voyager/SkillRL/Skill1)、内化(Skill0/LatentSkill/Skill-to-LoRA)、混合(Skill0.5)、动态管理(SLIM)各自的长短板。

方法论层:

  • GRPO 的组相对优势机制,以及"全零奖励组优势为零"这一失败模式——它是早期蒸馏设计的直接动机。
  • 课程学习与调度监督:辅助信号应渐入渐出(Ramp + SmoothStep),而非硬切换。
  • JSD 的三重性质:对称性、log 2 有界性、“上下文与动作的互信息"这一信息论等价形式;以及 top-k 近似降低词表级计算成本的技巧。
  • 优势重加权的稳定性约束:权重恒正保符号、任务内均值归一保尺度,确保调制只是重新分配信用而非引入新的优化方向。

工程层:

  • 三基准的环境适配:交互预算(30/15/4 步)、任务批大小(16/16/128)、评测协议(ALFWorld 按任务类型切分 ID/OOD;SearchQA 用种子 42 的确定性验证集选 checkpoint)。
  • 双上下文的成本结构:不增加环境 rollout,但每个状态需要两份策略前向;JSD 在 top-k 并集支撑上计算以省显存。
  • 训练预算敏感性:全部方法 150 步、每 5 步验证,改善来自优化质量而非训练量(附录 C.1 的同预算对照排除了这一点)。

八、通用性灵感

跳出 Agent 技能这个具体场景,这篇论文留下三条可迁移的思想:

灵感一:干预粒度下沉。 任何辅助信号——提示词、工具、课程、RAG 证据、甚至人类反馈——其效应都不是均匀的。如果只在任务级或轨迹级评估"要不要用”,就等于用整场比赛的胜负来评价每一次传球。AUSO 证明:把评估下沉到最小决策粒度(这里是动作),让信号在同一决策点的两个条件下自对照,收益与伤害才能分开记账。这个原则适用于一切"辅助资源该不该介入"的决策场景。

灵感二:生命周期感知训练。 同一资源在学习者的不同成长阶段应当扮演不同角色:早期是手把手的教师,中期是退场的陪练,成熟期是只在关键处开口的顾问。这和教育心理学中"脚手架渐进撤除"(scaffolding fading)完全同构。工程上对应的问题是:你的辅助信号的退出机制是硬编码的开关,还是像 α(s)/β(s) 那样有平滑交接的调度?论文的消融(去退火 OOD 崩到 39.6)说明后者不是锦上添花而是必要条件。

灵感三:双上下文自对照探针。 在没有外部参考答案的情况下,让同一策略在"有辅助"与"无辅助"两个条件下各算一次分布,其差异(JSD/互信息)就是该辅助影响力的天然度量——有界、对称、免标注、免额外 rollout。这个探针可以泛化为一种通用诊断手段:测某个 prompt 组件对模型决策的真实影响、测一条工具说明是否真的被依赖、测检索证据是否改变了生成分布。配合"影响力 × 结果优势"的耦合方式(影响力定位 where,环境反馈判定 whether),还能安全地把探针信号变成训练信号而不引入人工奖励。

一句话总结:AUSO 把"技能该怎么用"从训练开始前的架构选择,变成了训练过程中逐动作学习的对象本身——而教会 Agent 判断"这条指导此刻值不值得听",可能比任何一条具体指导都更接近可泛化的能力。


附录:关键公式速查

  • 式 3:全失败组 GRPO 优势 ≈ 0(早期蒸馏的动机)
  • 式 6–7:教师-学生 JSD,top-k token 计算后按动作跨度平均
  • 式 10:内化调制权重 u_t = 1 + β_int·û_t(有界 clip)
  • 式 12–13:λ(s) = λ₀·Ramp(s)·(1 − SmoothStep(s/Tρ_int)),教师渐退
  • 式 18–19:双上下文分布与动作级信息量 I_t = JSD(π(C=Skill) ∥ π(C=No-skill))
  • 式 21:不确定性门 g(p_q) = K·p_q(1−p_q),成败共存时最大
  • 式 22–24:w_t = 1 + β(s)·g·m_t,A_AUSO = w_t·A_GRPO(保符号、任务内均值 1)
  • 式 27:完整目标 = GRPO(重加权优势) + λ₀α(s)·Σ 1[p_q=0]·L_JSD

参考文献:Lin et al., “AUSO: Action-Level Unified Skill Optimization from Internalization to Utilization,” arXiv:2608.21292, 2026.