论文链接:Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents 发表时间:2026年9月1日(arXiv:2609.00549v1) 机构:崇实大学(Soongsil University,韩国),单一高校 领域标签:cs.CL / Agent 评测 / 技能检索
一、论文背景
1.1 技能库:agent 的"外挂操作手册"
现代 LLM agent 普遍挂载技能库(skill library)——把领域知识、操作流程、工具用法写成可检索的文档(Anthropic 的 Agent Skills、各类 skill 市场已成生态)。典型工作流:任务进来 → 检索器判断是否需要技能 → 命中则把技能文本注入上下文 → 模型"带着手册"干活。这被视为让 agent 突破预训练知识边界的标准方案。
1.2 一个被忽视的评测漏洞
技能库到底有没有用?业界默认的评测方式是:跑两组实验——技能开(允许检索)vs 技能关(禁止检索),比较总准确率。提升为正就认为"技能有效"。
论文指出这个协议藏着选择偏差(selection bias):检索不是随机发生的。agent 选择检索的任务,往往是它自认为"不确定/需要帮助"的难题;跳过检索的任务是它自认为有把握的易题。于是:
- “检索发生的任务集"与"检索未发生的任务集"在难度上系统性不同;
- 聚合分差把"检索组的分数高于非检索组"混同为"检索带来了提升”——但这可能只说明两组难度不同;
- 更根本地,** aggregate 对比根本没有度量"技能在它被使用的那些任务上是否真的帮了忙"**。
用一个类比:想知道参考书对学生有没有用,不能比较"翻过书的学生平均分"和"没翻书的学生平均分"——翻开书的学生可能恰是没听懂的。正确做法是让同一个学生在同一道题上"翻书做一遍、不翻书做一遍",比较两次的对错。这正是 RAE 的设计思想。
1.3 为什么这个问题现在重要
技能检索正在成为 agent 产品的基础设施(Skill RAG、Tool RAG 已是工程标配),如果评测指标本身失真,整个"技能有效"的叙事可能建立在统计假象上——模型能力的汇报与实际部署的差距会随技能库规模放大。
二、论文定位和关联工作
2.1 研究谱系
谱系一:技能/工具检索增强。Skill Retrieval Augmentation(检索式技能增强显著提升 agent 表现的实证)、Tool RAG(工具检索解决规模化)。这些工作用聚合对比报告收益——正是本文质疑的评测协议。
谱系二:RAG 评测学。检索增强生成的评测框架(faithfulness、answer relevance 等)关注"检索内容的质量与利用",但主要在文档 RAG 语境;本文把"实际使用效应"的度量带入技能语境并指出聚合指标的选择偏差。
谱系三:评测偏差方法学。选择偏差与混杂因素的统计修正(配对设计、条件化)是经典统计学工具——RAE 本质是把"同任务配对 + 条件于检索事件"引入 LLM 评测。
2.2 定位对比表
| 维度 | 聚合对比(现有默认) | RAE(本文) |
|---|---|---|
| 比较对象 | 检索任务集 vs 非检索任务集(不同任务) | 同一任务的开/关技能配对执行 |
| 条件化 | 无 | 仅在 agent 主动检索的任务上 |
| 度量的量 | 组间分差(混杂难度差异) | 技能的真实边际效应 |
| 对选择偏差 | 敏感 | 免疫(配对消除混杂) |
定位结论:这是一篇"评测方法学纠偏"型工作——不提出新能力,而是证明现有指标度量错了东西,并给出正确度量。
三、问题定义
具体场景:agent 配备技能检索器,任务流中自主决定是否检索技能。要度量:技能启用在真实使用场景(检索确实发生了)中的净效应。
核心洞察:技能的"实际使用"与"系统平均"是两个不同的因果量。前者需要条件于检索事件(conditioning on retrieval)并做同任务配对(paired execution)——这是因果推断中处理内生处理分配的标准操作。
形式化:Retrieval-Invoked Actual-Use Effect (RAE):
$$\mathrm{RAE} = \mathbb{E}\big[\,\mathrm{Outcome}^{\text{skill-on}} \mid \text{retrieval occurred}]- \mathbb{E}\big[\,\mathrm{Outcome}^{\text{skill-off}} \mid \text{retrieval occurred}\,\big]$$要点有二:① 条件集合是"agent 在技能开启时主动检索了的那些任务";② 对这些任务关闭技能重跑一遍,同一任务两种条件的执行配对比较。RAE > 0 才说明"检索-到-使用"管线净救援多于净伤害。
抽象的精妙之处:这个量把"技能有没有用"从一个笼统问题分解为可分别度量与优化的三段——检索决策质量(该检索时检索了吗)、检索内容质量(检到的技能对不对)、遵循执行质量(模型有没有按技能做)——聚合指标把三段搅在一起,RAE 至少把第三段(也是被本文证明最薄弱的环节)单独拎了出来。
四、问题解法(评测协议设计)
4.1 配对执行协议
对每个任务:① 技能开启跑一遍,记录是否发生检索、结果对错;② 对发生检索的任务,技能关闭再跑一遍(同任务、同模型、同解码配置),记录对错;③ RAE = 配对差值的期望(0/1 结果上即"开对关错"比例减"关对开错"比例)。
4.2 诊断控制(Bounding the interpretation)
负 RAE 至少有三种可能解释:检索内容本身不对、内容对但模型没用、模型用了但用坏了。论文设计了两组控制来界定解释边界:
- Skill-Content Controls(技能内容控制):操纵注入内容的质量(正确技能/无关文本/空),观察 RAE 的响应——分离"内容问题"与"遵循问题";
- Adherence Annotation(遵循标注):人工/规则标注模型输出是否实际遵循了技能内容——直接测量"用了没有"。
4.3 模型与数据
17 个 LLM(跨参数规模、闭源 API + 开源权重)× 两域:编码(MBPP+,MBPP 的强化测试版)与数学(Math500)。双域设计检验悖论的跨域稳健性。
五、评估指标与实验证据
5.1 主发现:聚合提升与 RAE 的系统性背离
- MBPP+ 上的评测悖论:多个模型呈现"聚合检索 lift 为正、RAE 为负"的符号矛盾——系统级看技能开卷有益,但在真实发生检索的任务上,开技能反而降低答对率。图 1 的四个象限中,符号不一致的离对角区域被多个前沿模型占据;
- 跨模型普遍性:17 个模型中符号背离现象普遍存在——不是个别模型的怪癖;
- 跨域稳健性:Math500 上同样存在(数学域的检索更多触发"公式表/解法表"类技能)。
5.2 背离的机制分解
- 选择偏差证实:检索组与非检索组的任务难度分布系统性不同——聚合 lift 的主要来源是"非检索组的易题把基线抬高了",与技能本身无关;
- 上下文暴露 ≠ 使用:Adherence 标注显示大量执行中技能文本在上下文里但输出未体现其内容——“看见了手册"不等于"照着做了”;
- 伤害机制:Skill-Content 控制显示注入无关技能文本本身即可造成损害(注意力被污染)——即负 RAE 部分来自"检错了还硬塞"。
5.3 证明力评估
这套协议的证明力来自配对设计的因果干净性:同一任务两种条件的差异只能归因于技能开关(模型/解码/任务全控)。双控制实验进一步把"负 RAE"的责肋从"内容差"与"遵循差"中做了归属。诚实的边界:RAE 度量的是"技能启用"的净效应,不区分检索器与执行器各自的贡献比例(这需要进一步的组件级消融);17 模型的清单以当时前沿为主,快速迭代的模型可能随版本变化。
六、效果优势的根源解释(本文为评测工作,解释"悖论为何必然出现")
为什么聚合 lift 会系统性虚高? 统计机制:agent 的检索决策与其对该任务的能力相关(自感不确信才检索)→ 检索组与非检索组在"模型内在通过率"上不可比 → 聚合分差 = 技能效应 + 组间难度差异的混杂。当模型自我评估较准时(知道哪些题不会),检索组集中在"本来就不会"的题上——技能即使有些帮助也不足以翻转,而非检索组高通过率拉高技能开的聚合分。虚高的具体来源是非检索组的易题,与技能毫无因果。
为什么 RAE 会是负的(技能反而有害)? 两个机制叠加:① 注意力污染——注入的技能文本(尤其不贴题时)挤占上下文、分散注意力,把模型原本能做对的题带偏;② 假性遵循——模型模仿技能文本的表面形式(代码风格、解法模板)而不核对适用条件,把错模板套到不适用的题上。Skill-Content 控制直接证实 ①(空内容/无关内容注入也降分);Adherence 标注支撑 ②(有遵循痕迹但结果更差的比例可观)。
为什么这说明"工具使用能力被高估"? 业界把"技能开的聚合分高"解读为"模型会用工具"。RAE 的证据链表明:聚合分高可能完全由选择偏差制造;而在真实调用技能的场景中,模型的净效应常为负——“会用"的其实只是"知道何时求助”,而不是"求助后真的用好了帮助"。
七、必要知识反推
领域知识层
- 技能检索 agent 的完整工作流(检索决策-注入-生成)与 Skill/Tool RAG 生态现状——不知道现有协议长什么样就无从纠偏;
- MBPP+/Math500 等基准的测试协议与污染状况。
方法论知识层
- 因果推断基础:选择偏差、混杂、配对设计、条件化期望——RAE 的构造直接来自这套工具箱;
- 评测效度理论(construct validity):区分"指标度量了想测的量"与"指标和相关变量共变";
- 双重差分/配对显著性检验(符号检验、McNemar 类)——配对 0/1 结果的统计推断。
工程知识层
- 17 模型 × 双域 × 双条件(开/关)的批量推理编排与成本控制;
- 检索事件的日志化与可复现配置(解码参数、检索器版本固定);
- Adherence 标注的标注协议与一致性检验。
知识融合的关键节点:最关键的融合是把流行病学的"处理分配内生性"视角引入 agent 评测——识别出"agent 自主决定检索"与"病人自主选择就医"在统计结构上同构(非随机处理分配),于是配对+条件化的经典解法可以直接搬运。没有因果推断背景会把符号背离当成实验噪声,没有 agent 工程背景则造不出可复现的配对协议。
八、论文中可以提取的通用性灵感
灵感一:度量"被使用的帮助"而非"有帮助可用"
- 核心思想:评估任何辅助系统(工具/功能/政策)时,应度量它在实际被调用的场景中的净效应(同对象开/关配对),而不是开启组与关闭组的聚合分差——后者混入了求助行为的自选择。
- 论文证据:MBPP+ 上聚合 lift 为正、RAE 为负的符号背离普遍存在。
- 推广场景:医疗保险的"参保 vs 未参保"健康差异研究;企业导师制的参与偏差修正;技术文档的实际查阅效果;辅导服务的效果评估。
灵感二:上下文暴露 ≠ 使用 ≠ 用对——三层递进的能力检验
- 核心思想:信息进入输入 ≠ 行为被其改变 ≠ 改变得正确;评测体系应把这三层分开度量,否则会把"看得见"高估为"用得好"。
- 论文证据:Adherence 标注(暴露多、遵循少)+ Skill-Content 控制(遵循了也可能更差)。
- **推广场景:学生"读过参考书"与"会用方法"的考试区分;员工培训的"出勤率/应用率/成效率"三层漏斗;RAG 的"引用率/faithfulness/正确性"分层;法规的知晓-遵守-合规递进。
灵感三:错误的自助可能比没有帮助更糟(注意力污染)
- 核心思想:向决策者注入不贴切的参考信息本身就有负效用(分散注意、诱导形式模仿)——“多给信息"不是无害的默认。
- 论文证据:无关技能注入显著降分;负 RAE 部分来自"检错还硬塞”。
- 推广场景:搜索结果的低质内容污染决策;会议中的无关背景信息拖慢判断;RAG 的检索质量门槛应高于"不给";教育中过早给出暗示会妨碍独立思考。
灵感四:自主系统的行为日志是评测金矿
- 核心思想:agent 的自主决策(何时检索/何时求助/何时放弃)本身就是可分析的行为数据——条件化这些事件能产出比聚合分更有信息量的指标。
- 论文证据:条件于"检索发生"这一事件才暴露出聚合指标看不见的符号背离。
- 推广场景:推荐系统的条件化 CTR 分析;自动驾驶的接管事件分析;IDE 的补丁接受率条件化研究;客服转人工事件挖掘。
灵感五:给"评测指标"做评测是元层面的高杠杆工作
- 核心思想:当一个领域的结论普遍依赖某单一指标时,检验该指标的效度(它到底度量了什么)比多跑几个方法更有杠杆——纠偏一次,全领域受益。
- 论文证据:一个指标(RAE)颠覆了"技能检索普遍有益"的默认叙事。
- 推广场景:Goodhart 定律的工程防御;大学排名方法的效度审计;A/B 测试指标的代理偏差检查;医疗替代终点与真实终点的相关性审查。
本文基于 arXiv:2609.00549v1 全文(含 RAE 形式化、17 模型双域实验、诊断控制与标注协议)撰写。关联基准:MBPP+、Math500 (HuggingFaceH4/MATH-500)。