Progressive Agent Skill Generation via Reinforcement Learning (Skill-α) 精读
Agent 技能(Skill)是可复用的程序性知识,但生成技能缺乏自然监督信号——技能好不好只能看它能不能帮 Agent 在下游任务上做得更好。Skill-α 把技能生成形式化为序列编辑过程(Create/Update/Merge/Prune/Noop),核心创新是’回滚奖励’:对每个编辑,用同一锚定查询在原始技能和编辑后技能上分别运行固定工作器,编辑后更优才给正奖励。GPT-4o 工作器下 CL-Bench +3.3 点、tau2-bench +6.7 点超越最强基线。本文从’技能价值只能由下游表现定义’的第一性原理,解释为什么回滚奖励是技能生成的正确监督信号。