SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents 精读
上海交通大学联合小红书提出 SkillGate,解决长程 Agent 在 episode 中途该读哪个技能文件的训练难题。论文先诊断出 outcome-only RL 失效的结构性根源——selector credit starvation:技能命名 token 仅占轨迹损失的中位 0.14%,随轨迹变长稀释约 7 倍,且近五分之二的正确选择因后续执行失败收到错误负号的信用,而该决策本身价值 +11.2 个百分点。SkillGate 将同一 GRPO 更新的 token 支持划分为构造上不相交的双 credit 通道:任务通道只把组归一结果优势广播到执行 token,整段 read call 从损失掩码删除;选择通道把单次读取且为 oracle 才计 1 的 action-local 效用做组中心化后仅落在身份 token,等权归一使选择权重与轨迹长度无关。5 个基准 385-trial 协议下,9B 模型从 SFT 的 40.8% 升至 53.2%,超同预算 outcome-only RL 6.2 个百分点,oracle 读取率 54.3% 升至 83.9%,误导暴露降约三分之二且读得更少。