Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents 精读
崇实大学提出 Skill Following(SF)评测框架:现有’检索 vs 不检索任务的聚合分差’衡量技能库价值存在严重选择偏差。论文形式化 RAE(Retrieval-Invoked Actual-Use Effect)指标——仅在 agent 主动发生检索的任务上,比较同一任务开/关技能的配对执行差。17 个 LLM × 编码(MBPP+)/数学(Math500)的实测揭示’评测悖论’:多个模型聚合检索提升为正、RAE 却为负——系统层面看似受益,恰恰在真正调用了技能的任务上反而有害。诊断分析证明’上下文出现技能内容’远不等于’模型遵循技能’,当前工具使用能力被系统性高估。