Signal or Noise? A Benchmark Study of Agent Skills in Web Development 精读

论文链接:arXiv:2608.23067 代码仓库:匿名评审版(含基准、注入 harness、全部 per-pair 输出) 发表时间:2026年8月 机构:百度 NLP(Ziyue Yang、Ding Fan 共同一作等,北京)——单一企业研究 领域标签:cs.CL / cs.SE(Agent 评测方法学)

一、论文背景

Agent Skill 是什么? 一篇告诉 Agent"某类任务怎么做"的文档(SKILL.md + 参考文件 + 脚本),是 2026 年 Agent 生态的基础设施——Anthropic、OpenAI 都发布了官方 skill creator,第三方技能市场兴起,Skill 注入被默认为"注入即增益"。 SkillsBench(2026.02)已经给出过预警:技能提升"显著但不一致"——但"不一致"背后是什么机制,没有人拆开过。

被忽视的混淆变量:注入 Skill 同时改变了两件事——内容(多了指导信息)与长度(prompt 变长)。此前所有研究把两者捆在一起测,得出的"Skill 有益/有害"结论都可能是长度效应的污染。就像测试新药时不设安慰剂对照,疗效与心理作用混在一起。

本文要回答的三个问题:注入匹配 Skill 的净效应是正是负?负效应(若有)的机制是什么?Skill 效用能否跨模型迁移?

二、论文定位和关联工作

  • SkillsBench:确立配对评测标准(有/无 Skill 对照),发现"不一致"——本文把对照从两态升到四态(无/目标 Skill/长度匹配无关 Skill/切片消融),正是这多出的一态(C2)让"长度 vs 内容"第一次可分离。
  • OpenHands 博客(How to Evaluate Agent Skills):工程视角给出"技能可能让 Agent 更好、略稳或更糟"的经验观察——本文给出现象背后的受控实验证据。
  • 同期对照:LongWoF-Bench(同日精读)证明"验证器确认的执行经验"有效——两篇合读得到完整图景:Skill 不是没用,是"什么样的 Skill、怎么注入、给谁用"决定了它是信号还是噪声。

三、问题定义

具体场景:编码 Agent 在 Web 开发项目上工作,可选注入与项目匹配的技能文档。

抽象问题:剥离长度效应后,注入领域匹配文本知识的因果效应是多少?该效应的方向由什么机制决定? 形式化:Δ_total = Δ_length(注意力稀释)+ Δ_content(信息价值 ± 误导),实验设计需使两者可分别估计。

四、问题解法

4.1 WebDev-Skills-Bench 基准

31 个公开 WebDev Skill(全部第三方:Anthropic/Mindrally/Osmani/Vercel Labs 等仓库)× Web-Bench 的 50 个项目 1000 个有序任务。4 模型面板(Claude Sonnet 4 / GPT-5.1 / Qwen3-Coder-30B-A3B / DeepSeek-V4-flash),temperature=0,N=3 重复。

4.2 四条件对照(核心设计)

  • C0 无 Skill:原生基线;
  • C1 目标 Skill:注入与项目匹配的技能;
  • C2 长度匹配无关 Skill:字节长度 ±5% 但内容无关的技能——Δ(C1-C0)=总效应,Δ(C2-C0)=纯长度效应,Δ(C1-C2)=纯内容效应;
  • C3 切片消融:把 Skill 切成正向规则 Rp/反模式 Rn/示例代码 X 三种成分,leave-one-out 测试。

4.3 workspace-aware 注入

只有 SKILL.md 进入 prompt,辅助文件挂载到 Agent 文件系统(.skills//)按需读取——保证多文件 Skill 的长度对照组依然严格成立(否则"技能附带的文件"会破坏长度对齐)。

五、评估指标与实验证据

总效应(C1 vs C0,ΔPass@2,4 模型平均全部为负):

模型ΔPass@295% CItoken 开销 ρ
Claude Sonnet 4-4.2pp[-6.9,-1.9]+72%
Qwen3-Coder-2.3pp[-3.4,-1.3]+91%
DeepSeek-V4-flash-2.0pp[-3.8,-0.2]+394%
GPT-5.1-1.3pp[-3.4,+0.5]+74%

净收益面:仅 17-36% 的 (Skill,项目) 对获益。

机制分解(C2 对照的决定性贡献):

  • Sonnet/Qwen = 长度分心型:ΔLength -3.3/-3.5pp(CI 不含零),ΔContent 不显著——对策:缩短 prompt;
  • GPT-5.1/DeepSeek = 内容误导型:ΔLength 不显著,ΔContent -1.1/-1.4pp——对策:审查技能内容。 两种机制需要相反对策,统一处理必然顾此失彼。

easy 任务受害最大(CI 全不含零:Qwen -10.7pp、Sonnet -5.3pp)——机制是"retry lock-in":Web-Bench 每任务两次尝试预算,Skill 固定的结构选择(按钮文案、类名)把可恢复的首次失误变成链式终止失败。案例:zustand 项目中,C0 的重试把按钮改名为 Submit 通过 Playwright strict-mode;C1 按技能命名约定坚持 Create Blog Post,子串碰撞,整链在 task-4 终止(55%→40%)。

跨模型近零相关:per-(Skill,项目) 的效用跨模型 |Pearson r|≤0.12;74% 配对在不同模型上出现正负两种符号;单对极端案例:lowdb×database-optimizer 上 Sonnet +33pp 而 DeepSeek/Qwen 各 -22pp(55pp 摆幅)——Skill 效用是三元组属性。

C3 切片发现:反模式 Rn 是唯一方向可靠的成分(+3.1pp,McNemar p=0.008)——又一篇"负面证据最有价值"的证据(与 LongWoF-Bench 呼应);示例代码 X 是最贵切片(占 SKILL.md 22.7% 预算)且模型分化极端(DeepSeek +8.3 vs Sonnet -15.3)。

六、效果优势的根源解释

本文的"效果"是一组归因结论,根源在实验设计的分离能力:

  1. 为什么必须长度对照:无 C2 时只能得到"平均有害"的单结论,无法指导行动;C2 分离出两种机制——长度分心通过注意力稀释起作用(长无关内容挤占有效 token 的注意力权重),内容误导通过"权威文本带偏结构决策"起作用。
  2. retry lock-in 的机制:技能把"命名约定"等结构选择固化,第二次尝试不再自由探索——技能在"给约束"的同时也"拿走了随机重启这个纠错资源"。这解释了为什么 easy 任务(本可轻松通过)受害最深。
  3. 近零跨模型相关的原因:不同模型的预训练分布、对长 prompt 的敏感度、结构偏好都不同——同一个"低 db 优化建议"对某模型是雪中送炭、对另一个是与它的内部知识打架。技能不是客观知识,是与模型内部状态的交互项。

七、必要知识反推

  • 领域知识层:Web 开发任务链的结构(Web-Bench 的 20 任务有序依赖)与 Playwright 严格模式等验收细节——不理解"子串碰撞就能终止整链"就看不懂 retry lock-in。
  • 方法论知识层:匹配对照设计(长度匹配是流行病学"配对对照"思想在 prompt 实验中的移植);McNemar 检验与 bootstrap CI;切片消融。
  • 工程知识层:workspace-aware 注入协议;N=3 重复与 temperature=0 的方差控制。

知识融合的关键节点:把流行病学的 RCT 配对思想(安慰剂对照分离心理效应与药效)完整移植到 prompt 实验设计——C2 就是 Skill 实验的安慰剂组。这个方法论迁移的价值超过任何具体结论。

八、论文中可以提取的通用性灵感

  1. 任何"注入信息"的实验都需要"等量无关信息"安慰剂对照(方法论类)

    • 证据:长度匹配对照分离出两种需相反处理机制的负效应。
    • 推广:检索增强(加文档 vs 加等长随机文档)、few-shot 示例选择、上下文工程——所有"往 prompt 里塞东西"的决策都应先测纯长度成本。
  2. 约束会吃掉纠错资源(机制类)

    • 证据:retry lock-in——技能固化结构选择后,第二次尝试丧失自由探索能力,easy 任务受害最深。
    • 推广:过度规范化的团队流程(把"怎么做"定死后,员工遇异常时失去了变通空间);教学中的解题模板(提升下限但封死探索上限)。
  3. 反模式(“别这样做”)是知识中最可靠的成分(机制类,与 LongWoF-Bench 互证)

    • 证据:C3 切片中反模式 Rn 唯一方向可靠(+3.1pp,p=0.008),正向规则中性。
    • 推广:code review 优先写"禁止事项";安全手册的价值在"事故模式"而非"正确操作";给新人的建议先讲坑再讲路。
  4. 配置项的效用要按 (配置,场景,执行者) 三元组评估,不能只看配置本身(方法论类)

    • 证据:Skill 效用跨模型 |r|≤0.12、74% 配对符号翻转。
    • 推广:工具链配置(同一 linter 规则对不同团队效果相反)、推荐算法的默认设置、组织政策的 A/B 测试——“别人家最好的实践"在你家可能为负,先小范围三元组实测再推广。