论文链接:Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents 发表时间:2026年9月1日(arXiv:2609.00549v1) 机构:崇实大学(Soongsil University,韩国),单一高校 领域标签:cs.CL / Agent 评测 / 技能检索


一、论文背景

1.1 技能库:agent 的"外挂操作手册"

现代 LLM agent 普遍挂载技能库(skill library)——把领域知识、操作流程、工具用法写成可检索的文档(Anthropic 的 Agent Skills、各类 skill 市场已成生态)。典型工作流:任务进来 → 检索器判断是否需要技能 → 命中则把技能文本注入上下文 → 模型"带着手册"干活。这被视为让 agent 突破预训练知识边界的标准方案。

1.2 一个被忽视的评测漏洞

技能库到底有没有用?业界默认的评测方式是:跑两组实验——技能开(允许检索)vs 技能关(禁止检索),比较总准确率。提升为正就认为"技能有效"。

论文指出这个协议藏着选择偏差(selection bias):检索不是随机发生的。agent 选择检索的任务,往往是它自认为"不确定/需要帮助"的难题;跳过检索的任务是它自认为有把握的易题。于是:

  • “检索发生的任务集"与"检索未发生的任务集"在难度上系统性不同;
  • 聚合分差把"检索组的分数高于非检索组"混同为"检索带来了提升”——但这可能只说明两组难度不同;
  • 更根本地,** aggregate 对比根本没有度量"技能在它被使用的那些任务上是否真的帮了忙"**。

用一个类比:想知道参考书对学生有没有用,不能比较"翻过书的学生平均分"和"没翻书的学生平均分"——翻开书的学生可能恰是没听懂的。正确做法是让同一个学生在同一道题上"翻书做一遍、不翻书做一遍",比较两次的对错。这正是 RAE 的设计思想。

1.3 为什么这个问题现在重要

技能检索正在成为 agent 产品的基础设施(Skill RAG、Tool RAG 已是工程标配),如果评测指标本身失真,整个"技能有效"的叙事可能建立在统计假象上——模型能力的汇报与实际部署的差距会随技能库规模放大。


二、论文定位和关联工作

2.1 研究谱系

谱系一:技能/工具检索增强。Skill Retrieval Augmentation(检索式技能增强显著提升 agent 表现的实证)、Tool RAG(工具检索解决规模化)。这些工作用聚合对比报告收益——正是本文质疑的评测协议。

谱系二:RAG 评测学。检索增强生成的评测框架(faithfulness、answer relevance 等)关注"检索内容的质量与利用",但主要在文档 RAG 语境;本文把"实际使用效应"的度量带入技能语境并指出聚合指标的选择偏差。

谱系三:评测偏差方法学。选择偏差与混杂因素的统计修正(配对设计、条件化)是经典统计学工具——RAE 本质是把"同任务配对 + 条件于检索事件"引入 LLM 评测。

2.2 定位对比表

维度聚合对比(现有默认)RAE(本文)
比较对象检索任务集 vs 非检索任务集(不同任务)同一任务的开/关技能配对执行
条件化无仅在 agent 主动检索的任务上
度量的量组间分差(混杂难度差异)技能的真实边际效应
对选择偏差敏感免疫(配对消除混杂)

定位结论:这是一篇"评测方法学纠偏"型工作——不提出新能力,而是证明现有指标度量错了东西,并给出正确度量。


三、问题定义

具体场景:agent 配备技能检索器,任务流中自主决定是否检索技能。要度量:技能启用在真实使用场景(检索确实发生了)中的净效应。

核心洞察:技能的"实际使用"与"系统平均"是两个不同的因果量。前者需要条件于检索事件(conditioning on retrieval)并做同任务配对(paired execution)——这是因果推断中处理内生处理分配的标准操作。

形式化:Retrieval-Invoked Actual-Use Effect (RAE):

$$\mathrm{RAE} = \mathbb{E}\big[\,\mathrm{Outcome}^{\text{skill-on}} \mid \text{retrieval occurred}]- \mathbb{E}\big[\,\mathrm{Outcome}^{\text{skill-off}} \mid \text{retrieval occurred}\,\big]$$

要点有二:① 条件集合是"agent 在技能开启时主动检索了的那些任务";② 对这些任务关闭技能重跑一遍,同一任务两种条件的执行配对比较。RAE > 0 才说明"检索-到-使用"管线净救援多于净伤害。

抽象的精妙之处:这个量把"技能有没有用"从一个笼统问题分解为可分别度量与优化的三段——检索决策质量(该检索时检索了吗)、检索内容质量(检到的技能对不对)、遵循执行质量(模型有没有按技能做)——聚合指标把三段搅在一起,RAE 至少把第三段(也是被本文证明最薄弱的环节)单独拎了出来。


四、问题解法(评测协议设计)

4.1 配对执行协议

对每个任务:① 技能开启跑一遍,记录是否发生检索、结果对错;② 对发生检索的任务,技能关闭再跑一遍(同任务、同模型、同解码配置),记录对错;③ RAE = 配对差值的期望(0/1 结果上即"开对关错"比例减"关对开错"比例)。

4.2 诊断控制(Bounding the interpretation)

负 RAE 至少有三种可能解释:检索内容本身不对、内容对但模型没用、模型用了但用坏了。论文设计了两组控制来界定解释边界:

  • Skill-Content Controls(技能内容控制):操纵注入内容的质量(正确技能/无关文本/空),观察 RAE 的响应——分离"内容问题"与"遵循问题";
  • Adherence Annotation(遵循标注):人工/规则标注模型输出是否实际遵循了技能内容——直接测量"用了没有"。

4.3 模型与数据

17 个 LLM(跨参数规模、闭源 API + 开源权重)× 两域:编码(MBPP+,MBPP 的强化测试版)与数学(Math500)。双域设计检验悖论的跨域稳健性。


五、评估指标与实验证据

5.1 主发现:聚合提升与 RAE 的系统性背离

  • MBPP+ 上的评测悖论:多个模型呈现"聚合检索 lift 为正、RAE 为负"的符号矛盾——系统级看技能开卷有益,但在真实发生检索的任务上,开技能反而降低答对率。图 1 的四个象限中,符号不一致的离对角区域被多个前沿模型占据;
  • 跨模型普遍性:17 个模型中符号背离现象普遍存在——不是个别模型的怪癖;
  • 跨域稳健性:Math500 上同样存在(数学域的检索更多触发"公式表/解法表"类技能)。

5.2 背离的机制分解

  • 选择偏差证实:检索组与非检索组的任务难度分布系统性不同——聚合 lift 的主要来源是"非检索组的易题把基线抬高了",与技能本身无关;
  • 上下文暴露 ≠ 使用:Adherence 标注显示大量执行中技能文本在上下文里但输出未体现其内容——“看见了手册"不等于"照着做了”;
  • 伤害机制:Skill-Content 控制显示注入无关技能文本本身即可造成损害(注意力被污染)——即负 RAE 部分来自"检错了还硬塞"。

5.3 证明力评估

这套协议的证明力来自配对设计的因果干净性:同一任务两种条件的差异只能归因于技能开关(模型/解码/任务全控)。双控制实验进一步把"负 RAE"的责肋从"内容差"与"遵循差"中做了归属。诚实的边界:RAE 度量的是"技能启用"的净效应,不区分检索器与执行器各自的贡献比例(这需要进一步的组件级消融);17 模型的清单以当时前沿为主,快速迭代的模型可能随版本变化。


六、效果优势的根源解释(本文为评测工作,解释"悖论为何必然出现")

为什么聚合 lift 会系统性虚高? 统计机制:agent 的检索决策与其对该任务的能力相关(自感不确信才检索)→ 检索组与非检索组在"模型内在通过率"上不可比 → 聚合分差 = 技能效应 + 组间难度差异的混杂。当模型自我评估较准时(知道哪些题不会),检索组集中在"本来就不会"的题上——技能即使有些帮助也不足以翻转,而非检索组高通过率拉高技能开的聚合分。虚高的具体来源是非检索组的易题,与技能毫无因果。

为什么 RAE 会是负的(技能反而有害)? 两个机制叠加:① 注意力污染——注入的技能文本(尤其不贴题时)挤占上下文、分散注意力,把模型原本能做对的题带偏;② 假性遵循——模型模仿技能文本的表面形式(代码风格、解法模板)而不核对适用条件,把错模板套到不适用的题上。Skill-Content 控制直接证实 ①(空内容/无关内容注入也降分);Adherence 标注支撑 ②(有遵循痕迹但结果更差的比例可观)。

为什么这说明"工具使用能力被高估"? 业界把"技能开的聚合分高"解读为"模型会用工具"。RAE 的证据链表明:聚合分高可能完全由选择偏差制造;而在真实调用技能的场景中,模型的净效应常为负——“会用"的其实只是"知道何时求助”,而不是"求助后真的用好了帮助"。


七、必要知识反推

领域知识层

  • 技能检索 agent 的完整工作流(检索决策-注入-生成)与 Skill/Tool RAG 生态现状——不知道现有协议长什么样就无从纠偏;
  • MBPP+/Math500 等基准的测试协议与污染状况。

方法论知识层

  • 因果推断基础:选择偏差、混杂、配对设计、条件化期望——RAE 的构造直接来自这套工具箱;
  • 评测效度理论(construct validity):区分"指标度量了想测的量"与"指标和相关变量共变";
  • 双重差分/配对显著性检验(符号检验、McNemar 类)——配对 0/1 结果的统计推断。

工程知识层

  • 17 模型 × 双域 × 双条件(开/关)的批量推理编排与成本控制;
  • 检索事件的日志化与可复现配置(解码参数、检索器版本固定);
  • Adherence 标注的标注协议与一致性检验。

知识融合的关键节点:最关键的融合是把流行病学的"处理分配内生性"视角引入 agent 评测——识别出"agent 自主决定检索"与"病人自主选择就医"在统计结构上同构(非随机处理分配),于是配对+条件化的经典解法可以直接搬运。没有因果推断背景会把符号背离当成实验噪声,没有 agent 工程背景则造不出可复现的配对协议。


八、论文中可以提取的通用性灵感

灵感一:度量"被使用的帮助"而非"有帮助可用"

  • 核心思想:评估任何辅助系统(工具/功能/政策)时,应度量它在实际被调用的场景中的净效应(同对象开/关配对),而不是开启组与关闭组的聚合分差——后者混入了求助行为的自选择。
  • 论文证据:MBPP+ 上聚合 lift 为正、RAE 为负的符号背离普遍存在。
  • 推广场景:医疗保险的"参保 vs 未参保"健康差异研究;企业导师制的参与偏差修正;技术文档的实际查阅效果;辅导服务的效果评估。

灵感二:上下文暴露 ≠ 使用 ≠ 用对——三层递进的能力检验

  • 核心思想:信息进入输入 ≠ 行为被其改变 ≠ 改变得正确;评测体系应把这三层分开度量,否则会把"看得见"高估为"用得好"。
  • 论文证据:Adherence 标注(暴露多、遵循少)+ Skill-Content 控制(遵循了也可能更差)。
  • **推广场景:学生"读过参考书"与"会用方法"的考试区分;员工培训的"出勤率/应用率/成效率"三层漏斗;RAG 的"引用率/faithfulness/正确性"分层;法规的知晓-遵守-合规递进。

灵感三:错误的自助可能比没有帮助更糟(注意力污染)

  • 核心思想:向决策者注入不贴切的参考信息本身就有负效用(分散注意、诱导形式模仿)——“多给信息"不是无害的默认。
  • 论文证据:无关技能注入显著降分;负 RAE 部分来自"检错还硬塞”。
  • 推广场景:搜索结果的低质内容污染决策;会议中的无关背景信息拖慢判断;RAG 的检索质量门槛应高于"不给";教育中过早给出暗示会妨碍独立思考。

灵感四:自主系统的行为日志是评测金矿

  • 核心思想:agent 的自主决策(何时检索/何时求助/何时放弃)本身就是可分析的行为数据——条件化这些事件能产出比聚合分更有信息量的指标。
  • 论文证据:条件于"检索发生"这一事件才暴露出聚合指标看不见的符号背离。
  • 推广场景:推荐系统的条件化 CTR 分析;自动驾驶的接管事件分析;IDE 的补丁接受率条件化研究;客服转人工事件挖掘。

灵感五:给"评测指标"做评测是元层面的高杠杆工作

  • 核心思想:当一个领域的结论普遍依赖某单一指标时,检验该指标的效度(它到底度量了什么)比多跑几个方法更有杠杆——纠偏一次,全领域受益。
  • 论文证据:一个指标(RAE)颠覆了"技能检索普遍有益"的默认叙事。
  • 推广场景:Goodhart 定律的工程防御;大学排名方法的效度审计;A/B 测试指标的代理偏差检查;医疗替代终点与真实终点的相关性审查。

本文基于 arXiv:2609.00549v1 全文(含 RAE 形式化、17 模型双域实验、诊断控制与标注协议)撰写。关联基准:MBPP+、Math500 (HuggingFaceH4/MATH-500)。