论文一:SkillSpec: Consensus-Gated Agent Skill Evolution via Representation Specialization(Microsoft AI,2026 年 9 月 30 日) 论文二:RASO: Retrieval-Augmented Skill Optimization via Cross-Harness Adaptation(Korea University + KAIST + Meta AI,2026 年 9 月 29 日) 论文三:Prompt2Skill: Unsupervised Skill Optimization From Natural Language Instructions(Vanderbilt + USC + Adobe,2026 年 9 月 29 日;开源代码) 共同基线:SkillOpt(Microsoft,arXiv:2605.23904)——三篇论文全部把它当作核心对比对象 领域标签:Agent / 技能优化 / 上下文工程
一、论文背景:技能是什么,为什么「优化技能」成了一个研究方向
要读懂这三篇论文,先要理解一个概念:Agent 技能(Agent Skill)。
技能就是给 AI 的「岗位操作手册」。 想象一个新员工入职:模型权重相当于他的智商和学习经历(入职后不再改变),而技能是一份份可随时增删改的自然语言文档——告诉他在什么环境下、按什么流程、用什么工具、避开哪些坑去完成任务。用论文的语言说,技能是一种文本程序记忆(textual procedural memory):它把可复用的步骤、任务规则、工具使用指引、答案格式约定、错误恢复策略写进上下文,让一个冻结(不更新权重)的 LLM 在特定任务上表现更好。
这个范式在 2025 年 10 月被 Anthropic 正式产品化:Agent Skills 规定技能是一个包含 SKILL.md 文件的文件夹,Claude 会按需自动加载。到 2026 年,GitHub 上已经沉淀了海量公开技能——GitSkills 数据集统计了 282,200 个公开仓库中的 3,797,117 个 SKILL.md 文件(约 380 万份)。技能已成为一个真实存在的、规模巨大的「程序知识生态」。
但手册是人写的,就有人写的所有问题:专家撰写昂贵;写出来的手册和「读手册的模型」错配(不同模型的失败模式随版本、规模、训练数据而变);新任务出现时根本没有现成手册。于是「技能优化」应运而生——把技能当作可优化的文本变量,用执行反馈自动迭代它。
这条线的方法谱系大致是:APE/OPRO 搜索指令 → DSPy 编译整个 LM 程序 → TextGrad 用文本反馈做「反向传播」→ GEPA 反思执行轨迹并保留帕累托前沿候选。而三篇论文共同的直接前驱是 SkillOpt:它首次把「技能」当成系统优化的对象——一个独立的优化器模型把带分数的执行轨迹转化为对技能文档的有界增删改编辑,只有当编辑提升 held-out 验证分数时才接受。
SkillOpt 之后,三个「卡点」暴露出来,恰好对应本期三篇论文:
- 可靠性卡点:SkillOpt 用「聚合验证分数」决定接受与否。一批样本上的平均分涨了,编辑就被接受——但平均分会掩盖部分样本上的回归(10 个任务涨 3 个、跌 7 个,平均分可能不变甚至上涨),而且单次评估的「涨」可能是随机波动,重复评估就不成立了。此外它永远只改「文字内容」,从不改「知识如何组织」——一篇平铺文档从头用到尾。→ SkillSpec(Microsoft AI)解决这个。
- 先验知识卡点:现有优化器只从「自己的 rollout」里学——agent 跑了什么任务,就只见过什么轨迹。探索被限制在已见经验之内,初始化只能靠模型参数知识凭空写。而外面明明躺着 380 万份公开技能没人用。→ RASO(Korea Univ + KAIST + Meta AI)解决这个。
- 数据前提卡点:所有优化器都预设用户拿得出一个「带标签、同分布的训练集」——恰恰是真实部署场景里用户最没有的东西。用户有的只是一句话:「我想要一个读文章并答题的模型」。此前研究显示,训练集缩到一个样本时,SkillOpt 的增益会塌缩到「盲写草稿」水平。→ Prompt2Skill(Vanderbilt + USC + Adobe)解决这个。
一句话概括三者的关系:SkillOpt 定义了「怎么改」,这三篇分别回答「怎么改得可靠」「从哪补知识」「没有数据怎么开始」。
二、论文定位和关联工作
把三篇放进研究谱系里看:
| 谱系 | 代表工作 | 核心思想 | 与本期三篇的关系 |
|---|---|---|---|
| 提示/程序优化 | APE、OPRO、DSPy、TextGrad、GEPA | 把 prompt 或 LM 程序当可优化对象,用执行反馈迭代 | 提供了「文本空间优化」的方法论基础;三篇论文均以此为 baseline(TextGrad、GEPA) |
| 技能进化(自身经验) | SkillOpt、SkillOpt-Lite、SkillAdam、Trace2Skill、Bonsai、Skill-R1 | 从自身 rollout 提炼知识、有界编辑、验证门控 | 三篇共同的直接前驱与核心 baseline;SkillSpec 是其同机构(Microsoft)直系后续 |
| 技能表示/组织 | Skill-Pro、SkillX、HyperSkill、Graph-of-Skills、AIP、AutoRefine | 预设技能的图/层级结构 | SkillSpec 的 Phase II 与此线对话,但关键区别是不预设结构,而是从优化轨迹遥测证据路由 |
| 外部知识复用 | SkillRouter、Anything2Skill、Agent KB、WikiSkill | 从技能库检索或编译外部资源 | RASO 的区别:外部知识贯穿初始化+更新全流程,且首创 Cross-Harness Adaptation 算子 |
| 描述→系统 | Prompt2Model(CMU,2023) | 任务描述→检索数据→合成数据→微调小模型 | Prompt2Skill 的直接对标:同样「一句话进」,但产出是技能文本而非微调权重——部署成本数量级更低 |
定位结论:三篇论文是 SkillOpt 之后第一波系统性补全其短板的工作,分别占据了「可靠性工程」「外部知识注入」「零数据冷启动」三个互补生态位。它们同期(arXiv 2609.38024 / 2609.38593 / 2610.00704,前后两天内提交)独立出现,这种「共识潮」本身就是「技能=文本程序记忆」范式正在成熟的强信号。
三、问题定义:三篇论文抽象出的三个本质问题
三篇论文表面都在「优化技能」,但抽象后是三个完全不同的问题。
SkillSpec:把「学什么」和「怎么组织」拆成两个独立决策问题
抽象:给定冻结模型 πθ 和初始技能 Φ₀,在 T 轮迭代中最优化技能,使其在未见测试分布上成功率最高。SkillSpec 的核心洞察是把这个优化分解为两个正交子问题:
- 内容进化(保留什么知识):需要的是「一个编辑确实改善了行为」的可靠证据;
- 表示特化(如何组织知识):需要的是关于任务过程依赖与干扰的证据。
这两类证据性质不同、决策标准不同,塞在同一个改写循环里就会互相干扰——收益无法归因,表示无法选择。形式化:Phase I 输出验证骨干 Φ* 与完整优化轨迹 Γ_I,Phase II 从 Γ_I 估计结构敏感度并选择表示 r* ∈ {flat, graph, hybrid}。
RASO:把外部语料库变成优化过程的先验
抽象:现有技能优化 s* = argmax E[r(h(M,x,s))] 中,s 的候选空间只由「参数知识 + 自身 rollout 经验」张成。RASO 把问题改写为:引入一个数百万级外部技能语料 C 作为约束/先验源,让候选技能的生成同时由检索知识驱动。关键困难是双重错配:检索到的技能写的是别的任务(域错配)+ 别的执行环境(harness 错配)——论文测得 SpreadsheetBench 上 92.9% 的检索节来自异构 harness,直接复用反而有害(SkillRouter 基线在多个基准上低于无技能)。
Prompt2Skill:删掉「训练集」这个前提
抽象:把技能价值定义为 J(s) = E_{(x,y)~D}[μ(M_s(x), y)],此前所有工作假设能从 D 采样带标签数据来给候选技能打分。Prompt2Skill 研究的是 D 从未被观测、任务仅由一句自然语言描述 d 指定的极端设定:方法 A: (d, E, M) → ŝ,质量 J(ŝ) 只能在事后测试集上测。本质上是把「数据获取」本身变成了优化循环的一部分——用代理分布 D̃(检索+合成)近似 D,用可执行代理评估器 μ̃τ 近似 μ,并从理论上控制这双重近似的误差。
| 维度 | SkillSpec | RASO | Prompt2Skill |
|---|---|---|---|
| 回答的问题 | 怎么改才不退步 | 知识从哪来 | 没数据怎么开始 |
| 抽象本质 | 「学什么」⊥「怎么组织」的解耦优化 | 外部先验注入文本优化 | 无分布观测下的代理优化 |
| 新引入的数学对象 | 配对净增益 g、PSS ψ / RSS ρ | 检索-适配算子 A(c,T,H,S) | 代理误差 εdist + εeval 的选择界 |
四、问题解法:三条路线的机制拆解
4.1 SkillSpec:共识门控进化 + 遥测驱动的表示路由(两阶段)
Phase I:共识门控技能进化——解决「一次评估涨分不等于真的涨」。
- 多意图候选生成:每轮从成功/失败轨迹中提取证据,用四种互补编辑意图各生成一个完整候选技能(不是零碎补丁):repair(修复反复失败的指引)、preserve(强化被成功轨迹支持的指引)、simplify(删冗余/冲突)、rewrite(局部编辑不够时整体重构)。兼容的意图还可合并成额外候选。关键设计:候选之间保持独立,让每种更新策略被单独评估。
- 配对筛选:候选与当前技能在同一批验证任务上逐任务对比,数出净配对增益 g = n⁺ − n⁻(n⁺ 是候选赢的任务数,n⁻ 是输的任务数,平局不计)。配对比较能暴露「聚合分数掩盖的回归」——这是对 SkillOpt 的直接修复。
- 多 seed 确认 + 双重门:最高分的 N_f 个候选再做 K 次重复配对评估,须同时满足累计门(Σg ≥ G_pool,总改善要够)与每次门(min g ≥ G_min,任何一次评估都不许净退步)才被提交;多个通过者取累计增益最大者,原子更新。这就是「共识」:一次评估说好不算,次次说好才算。
Phase II:遥测引导的表示特化——解决「知识该按什么结构组织」,这是本文最独特的贡献。
- 从轨迹估计敏感度:Phase I 的完整轨迹 Γ_I(含被拒绝的候选——失败也是证据)中,每个合格候选贡献一个训练元组(筛选增益 g、过程分 p、干扰分 r、编辑规模 c)。过程分/干扰分由 annotator 按 0-3 四级 rubric 标注(p 高 = 修改引入了后步依赖前步的有序程序;r 高 = 引入了重复/冲突/冗余指引),再对每个 benchmark 拟合 ridge 回归。
- PSS/RSS 与 bootstrap 路由:ΔP = 「给所有候选注入过程结构」的预测增益;ΔR = 「注入干扰」的预测损失。对优化轮做 2000 次 round-bootstrap 重采样,PSS(ψ)= ΔP>0 的重采样比例,RSS(ρ)= ΔR>0 的比例——即「结构信号在多大比例的平行世界里成立」。路由规则:ψ ≤ 0.5 → Flat(独立可检索单元,不加强制顺序);ψ > 0.5 且 ρ ≤ 0.5 → Graph(显式依赖边编码执行顺序);否则 → Hybrid(有序核心 + 可检索辅助模块)。
- 冻结骨干 + 派生工件:验证过的骨干 Φ* 作为不可变源,在其上初始化选定表示的派生工件继续验证门控优化——内容可靠性与组织独立性兼得。
直觉类比:Phase I 像医学试验的「多中心随机对照 + 配对统计」,Phase II 像根据全部临床试验数据(包括失败组)给药物选择最合适的剂型。
4.2 RASO:检索增强初始化 + 检索增强更新
RASO 的两阶段(RASI/RASU)共享一条「检索-适配」管线:
- 节级检索:技能文档按标题切成节,BM25 检索 top-K(K=5)节。节级而非整篇是为了提高信噪比——整篇文档会偏向「总体目标相似」而非「含相关程序知识」。
- Cross-Harness Adaptation(跨 Harness 适配):适配 agent 把检索节改写为针对当前需求的「可执行 lesson」,遵循三原则——(1) 删除源域专名、省略目标 harness 无对应物的流程;(2) 只解决当前需求,不夹带无关问题;(3) 关于工具/参数行为的断言只有在 harness 描述 H 佐证时才保留(正确性优先于具体性)。产出完全用目标任务与 harness 的对象、命令、单位表述。
RASI(初始化,零 rollout):从任务描述 T + harness 描述 H 生成「需求-查询」对(如「多轮预算管理」→ 检索 query)→ 检索 → 适配成 lessons → 合成初始技能。不花一次 rollout 就获得知识接地的起点。
RASU(更新,rollout 驱动):执行失败轨迹 → 生成 textual gradient(自己反思出的改进方向)+ 检索 query(去外部找补充知识)→ 检索适配 → 合并进技能,验证集通过才接受。textual gradient 与检索 lesson 互补:前者说「哪里错了」,后者补「正确的做法是什么」。
论文给了一个极清晰的定性例子:SpreadsheetBench 里算各部门平均分,部门 B 无合格行、单元格应为空。top-1 检索节来自一个城市遥感技能(numpy/栅格,域与 harness 全错配),但它的「布尔掩码 + 空组保持索引不偏移」程序知识被适配成「条件聚合时把空组当缺失值而非强制计算」的 lesson——有这条 lesson 代码正确留空;去掉它,C 组的均值就错位写进 B 的单元格。这正是「92.9% 异构来源下适配是必需品」的缩影。
4.3 Prompt2Skill:Data Agent 自采数据 + Skill Agent 统计接受
Data Agent(把一句话变成数据池):
- 任务描述 d →(任务规范 τ,种子技能 s₀):τ 记录输入输出契约、答案风格与可执行代理评估器 μ̃τ(如归一化精确匹配/数值等价);s₀ 是简短的初始指令。
- 检索:在 HuggingFace 数据集目录与 Wikipedia 上生成检索请求(含「假想完美数据集描述」反推搜索词)→ 得候选源。
- 适配或合成:检索到相关数据则制定转换计划(如把「篇章+问题+答案」组装成任务的输入-参考对);材料不足则受 grounding 生成新样本(要求每条自包含、可客观作答)。
- 验证:结构检查(空输入/缺参考剔除)+ 任务兼容性比对 τ + 可回答性筛查(种子技能模型在小样本上至少做对一题,否则整个源被拒)+ 去重,构成数据池 P。数据分三职:反思集 T_t(供失败分析)、每轮新鲜接受批 B_t、冻结选择集 V(全程只在最终选择时用一次)。
Skill Agent(统计接受的闭环):rollout → 反思编辑产候选 → 候选与现任技能在同一新鲜批上配对评估,数出 wins w(只有候选解对)与 losses ℓ(只有现任解对);接受条件是 w > ℓ 且 z ≥ 1,其中 z = (|w−ℓ|−1)/√(w+ℓ) 是连续性修正的配对统计量——方向与证据强度双门槛。最后所有被接受的技能 + 初始技能在冻结选择集上一次性比拼,选最高分导出。
理论保证(Theorem 1):只要代理失配有界(分布距离 TV(D,D̃) ≤ ε_dist,评估器误差 ≤ ε_eval),以概率 ≥ 1−δ,导出技能满足 J(ŝ) ≥ max_s J(s) − 2(ε_dist+ε_eval) − O(√(log(2K/δ)/n))。这个界解释了框架的两个设计为什么必要:保留初始技能做兜底(保证不比出发点差太多)、冻结选择集只碰一次(避免选择分数泄漏回优化)。
三篇方法对照全景
| 维度 | SkillSpec | RASO | Prompt2Skill |
|---|---|---|---|
| 核心新机制 | 共识门(配对+多seed双门)+ PSS/RSS 路由 | Cross-Harness Adaptation | 代理数据自采 + z 统计量接受 + 选择理论界 |
| 知识来源 | 自身 rollout(含被拒候选) | 外部 380 万技能语料 + rollout | HF/Wikipedia 检索 + 受控合成 |
| 接受标准 | Σg≥G_pool ∧ min g≥G_min | 验证集分数超过现任 | w>ℓ ∧ z≥1 |
| 「什么只许碰一次」 | 测试集 | 测试集 | 冻结选择集 V |
| 独特防错设计 | 拒绝候选也进 Phase II 证据 | 逐基准 blocklist 防语料泄漏 | 泄露审计(文本/workbook 哈希 0 命中) |
| 优化器模型 | Claude Sonnet 5(Phase I) | 目标模型自身 | GPT-5.5(反思者) |
五、评估指标与实验证据
三篇论文的实验设计有个共同骨架——成功率为主指标、训练/验证/测试三分、验证集决定接受——但证明的命题各不相同。
SkillSpec:证明「可靠性 + 表示选择」各值多少分
设置:6 个 benchmark(SearchQA / SpreadsheetBench / OfficeQA / DocVQA / LiveMath / ALFWorld)× 3 个模型(GPT-4.1 / GPT-5.4 Nano / GPT-5.4),指标为 hard accuracy 的六基准宏平均,对比 6 个基线(含 GEPA、SkillOpt、SkillOpt-Lite、SkillAdam、Trace2Skill)。
主结果(三模型宏平均,vs 无技能基线的绝对提升):
| 模型 | SkillSpec | 提升 | vs 最强外部基线 | vs SkillOpt |
|---|---|---|---|---|
| GPT-4.1 | 60.41 | +19.93 | +9.57(vs SkillAdam) | +11.63 |
| GPT-5.4 Nano | 48.05 | +19.10 | +3.27(vs SkillOpt-Lite) | +5.92 |
| GPT-5.4 | 78.27 | +24.59 | +1.76(vs SkillOpt-Lite) | +3.12 |
三模型对 SkillOpt 平均提升 +6.89。注意增益随模型变强递减(11.63→5.92→3.12):越强的模型自身参数知识越多,技能的边际价值越小——但即便 GPT-5.4 上仍稳定为正。
为什么这些数字能证明论点:论文的关键论证不在主表而在两个受控实验。
- Phase II 配对增益:18 组「同骨干、同起点的 SkillSpec-I vs SkillSpec」配对中 13 胜 1 平 4 负,平均 +2.31。因为每对共享同一 Phase I 检查点,这个数字干净地隔离了「表示特化」本身的贡献——不是起点好,是特化好。
- 表示消融(表 3,Nano):同一 Phase I 骨干分别用 Flat/Graph/Hybrid 继续优化——路由器在 6 个基准中 5 个选中了事后最优表示(唯一失手的 DocVQA 选 Flat,仅落后 Graph 0.53)。路由组合宏平均 50.27,超固定 Flat/Graph/Hybrid 达 +3.36/+2.36/+1.17。这证明 PSS/RSS 遥测确实携带「哪个表示合适」的信息,而不是碰运气。
RASO:证明「外部知识 + 适配」每一环都不能少
设置:4 个 benchmark(OfficeQA / SpreadsheetBench / ALFWorld / WebShop)× 2 模型(GPT-5.6-Luna / Qwen-3.5-9B),3 seeds,检索语料为 GitSkills(已做逐基准 blocklist 防泄漏),对比 No skill / SkillRouter / RFSI(无检索初始化)/ TextGrad / GEPA / SkillOpt / WikiSkill。
初始化(0 rollout):RASI 在两模型 × 4 基准全胜。Luna 上超 RFSI:OfficeQA +5.63(45.74 vs 40.11)、Spreadsheet +4.77、ALFWorld +3.24、WebShop +1.17;Qwen 上 WebShop 差距拉到 +10.73。反例同样关键:SkillRouter(直接复用检索技能)在部分基准低于无技能(Qwen 的 Spreadsheet 23.45 vs 无技能 28.81)——不做适配的检索是毒药。
更新:RASO 对每基准最强基线的领先,Luna 上 +3.49/+6.31/+1.49/+1.07;Qwen 上放大为 +4.85/+1.79/+7.47/+11.30(WebShop 24.73 vs 13.43,几乎翻倍)。弱模型上增益最大——外部知识恰好补上弱模型参数知识的缺口。
消融把因果链钉死:固定后续流程只换初始化,RASI 贡献 +5.23/+6.78;固定 RASI 只换更新,RASU 贡献 +3.29/+14.16;而把 Cross-Harness Adaptation 单独拆掉,RASI 掉 3.88/7.74、RASU 掉 2.33/5.47——适配算子本身就是最大单项贡献者之一。成本:rollout 数与最省方法持平的条件下,RASO 的 API 费用在 4 个基准中 3 个最低,比 TextGrad 省 42–75%(WebShop $10.28 vs $41.03)。
Prompt2Skill:证明「零数据」设定下技能仍可可靠构建
设置:4 个任务(SearchQA / SQuAD / AIME / SpreadsheetBench)× 5 个目标模型(Qwen3-8B / 32B、Llama-3.2-1B、Claude Haiku 4.5、GPT-5.5),主实验不用任何用户示例,任务描述就是一句自然语言(如「我想要一个读文章并回答问题的模型」)。对比 Direct / Off-the-shelf(现成技能)/ LLM-generated(无反馈一次性生成)。
主结果(对 Direct 的平均相对提升):Qwen3-8B +29.1%、Qwen3-32B +26.1%、Llama-3.2-1B +93.5%、Claude Haiku +22.0%、GPT-5.5 +24.3%;结论章口径为 19 个模型-基准对平均 +36.1%(对现成技能 +83.0%)。两组数字口径不同(前者逐模型平均、后者逐对平均,相对提升会被小基数放大),引用时需注意。
比平均值更有说服力的是「不回归」与「固定技能会回归」:off-the-shelf 技能把 Llama-1B 的 SQuAD 从 0.207 砸到 0.048,P2S 反而升到 0.492;LLM-generated 在 Qwen3-32B 上平均 −1.9%(一次性生成没有执行反馈,可以变差),P2S 是唯一在 5 模型上全部不显著回归且均值最高的方法。「技能是否有用取决于目标模型」从口号变成了表格里的数字。
证明力最强的两个补充实验:
- 等数据等预算 vs SkillOpt(同一代理数据、同一初始技能、同样 7400 次求解评估上限):SearchQA EM 48.71 vs 45.79、SQuAD EM 82.50 vs 81.30——排除了「P2S 只是数据获取器」的解释,其统计接受+冻结选择流程本身也有效。
- 测试集泄露审计:对全部代理数据做文本近重复检查(五词 shingle Jaccard ≥ 0.8 等)与 workbook 双 SHA-256 哈希比对,0 命中——排除了「检索检索到了考题」的作弊解释。零数据设定下这个审计是可信度基石。
六、效果优势的根源解释
6.1 根源机制与证据链
SkillSpec 的 +6.89(vs SkillOpt)从哪来——两条可分离的因果链:
- 配对可见性链:聚合分数 → 配对计数 g = n⁺−n⁻ 的改变,使「部分样本回归」从不可见变为显式拒绝条件;多 seed 共识门再过滤掉评估噪声。【论文实验已支持:SkillSpec-I(仅 Phase I)单独已超全部外部基线的三模型平均,说明共识门贡献了增益的主体】
- 表示-任务匹配链:任务对知识组织方式有内在要求(SearchQA 的证据选择指引相互独立 → Flat;OfficeQA 的取数→抽证→计算有依赖 → Graph;LiveMath 有序推理+冗余敏感 → Hybrid),固定表示必然在部分任务上系统性错配;PSS/RSS 把 Phase I 轨迹(含拒绝候选的「负实验」)变成结构选择的证据源。【论文实验已支持:表 3 受控消融,5/6 选中事后最优表示】这里有一个精妙的方法论点:被拒绝的候选不是垃圾而是数据——它们是「这种编辑方向在此任务上无效」的对照实验,SkillSpec 是三篇中唯一系统性回收这部分信号的。
RASO 的弱模型翻倍增益从哪来——外部先验 + 适配的互补链:
- 弱模型(Qwen-3.5-9B)参数知识缺口大 → 自身 rollout 反思能发现「错了」但常给不出「对的做法」(textual gradient 的质量受限于参数知识)→ 检索 lesson 直接注入 rollout 之外的知识(如空组保索引)。【论文实验已支持:Qwen 增益 +4.85~+11.30 全面大于 Luna 的 +1.07~+6.31;定性例子显示单条 lesson 决定单元格对错】
- 但 92.9% 检索节异构 harness → 直接复用引入不可用工具/错误单位 → SkillRouter 反而低于无技能 → 适配是把「毒药」变「补药」的必经工序。【论文实验已支持:消融中去适配 RASI −3.88/−7.74;SkillRouter 反例】这条「检索必须伴随翻译」的结论与 RAG 文献中「检索质量≠下游收益,需对齐/适配」的广泛观察一致。
- 成本优势根源:知识来自检索而非 rollout 试错 → 同预算下 rollout 花在「验证」而非「探索」。【论文实验已支持:等 rollout 数下 API 费用降 42–75%】
Prompt2Skill 的不回归从哪来——闭环匹配链:
- 固定技能(off-the-shelf/LLM-generated)没有目标模型的执行反馈 → 无法知道该模型的失败模式 → 可能严重错配(Llama SQuAD 0.207→0.048);P2S 每轮接受都基于该模型自己的 rollout → 技能被迫与该模型的失败模式闭环匹配。【论文实验已支持:5 模型全部不显著回归 vs 两个固定基线多次大幅回归】
- z ≥ 1 统计门槛 + 新鲜接受批 → 单批偶然涨分不足以过门 → 假阳性编辑被压制。【论文实验已支持:等数据等预算下胜 SkillOpt,且 SkillOpt 仅用「验证分提高就接受」的单次门】此机制与 SkillSpec 的共识门在精神上同构——两篇独立工作都收敛到「配对比较 + 重复确认」,这是对「聚合分数接受」这一行业默认做法的双重否定,是本组论文最强的共识信号。
- 冻结选择集只碰一次 → 避免选择集信息泄漏回优化(若反复用同一批数据既接受又选择,最终选择会过拟合该批)。【理论已支持:Theorem 1 的界依赖候选与选择样本独立;属设计推演,论文未做泄漏对照实验——此为阅读者标注的边界】
6.2 相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本组论文的差异 | 对根源解释的影响 |
|---|---|---|---|---|
| GEPA(ICLR'26) | 反思轨迹进化 prompt,保留帕累托候选 | 反思式进化可超 RL 且省 35× rollout | 候选选择仍基于聚合分,无逐任务配对与多次共识 | 支持「执行反馈是有效信号」,限定了其可靠性(SkillSpec 表 2 中 GEPA 被共识门拉开差距) |
| TextGrad | 文本梯度反传优化 | 自然语言反馈可作「梯度」 | RASO 实测其在 RASI 起点上反而退步(38.76 vs 40.50,Qwen) | 挑战「有反馈就能改好」:反馈质量受限于参数知识,弱模型上不足 |
| Prompt2Model | 一句话→检索+合成数据→微调模型 | 任务描述足以驱动数据自采 | 产出微调权重 vs P2S 产出技能文本;P2S 附录 B 显示两者可比 | 支持「描述→代理数据」路线的可行性,跨「权重/文本」两种载体成立 |
| Voyager | 技能库 + 迭代提示的具身终身学习 | 可复用技能程序沉淀带来持续收益 | 技能为可执行代码、无验证门控 | 支持「技能=程序记忆」范式的泛化性(从代码到自然语言文档) |
| GitSkills | 380 万 SKILL.md 的数据集 | 公开技能生态真实存在且巨大 | RASO 的检索底座 | 支持 RASO 问题设定非空谈;其「约半数文件为精确副本」的发现也侧面提示需要适配而非复用 |
| [SkillRouter](https://arxiv.org/abs/2605.27760 类工作,COLM'26) | 检索-重排选现成技能 | 检索可用 | RASO 中作为反例基线:不适配时低于无技能 | 挑战「直接复用检索技能」:跨 harness 复用需翻译层 |
| LLM 评估统计实践(如 A/B 测试方法学) | 配对检验、多重比较校正 | LLM 非确定性要求统计化评估 | P2S 的 z≥1 未做跨候选多重校正(论文附录 D 自陈) | 限定:两篇的统计门是工程化筛选阈值而非严格假设检验,方向正确但置信度解释须谨慎 |
在本次检索范围内未发现:直接反驳「配对+共识接受优于聚合分数接受」的相反结论工作;对「跨 harness 技能适配」与「同 harness 复用」做系统对照的独立工作(RASO 的 SkillRouter 对比是最接近的证据)。这两点目前主要靠两篇论文自证 + 方法论同构互证。
6.3 综合判断与未决问题
多研究共同支持的机制:(1) 执行反馈驱动的文本进化有效(GEPA/TextGrad/SkillOpt→三篇,一脉相承);(2) 配对/统计化接受优于聚合分数接受(SkillSpec 与 P2S 独立收敛);(3) 技能与目标模型需匹配(P2S 的固定基线回归 + SkillSpec 三模型增益差异)。
仍属推测或单一来源的机制:PSS/RSS 遥测是否比「直接看任务名选表示」更好(论文禁止决策时用 benchmark 标识,但语义特征可能经轨迹间接泄漏——作者自己也如实承认);RASO 的 blocklist 是否彻底排除语料中针对基准的隐性技能;P2S 代理分布 D̃ 与真实 D 的 ε_dist 在非检索友好任务(如开放式生成)上可能失控。
可能的失效条件:评估噪声极大时共识门会把接受率压得过低(SkillSpec 4/18 组 Phase II 为负即为此代价的影子);语料库覆盖不到的冷门域,RASO 退化为 RFSI;P2S 的可回答性筛查在「目标模型完全不会做」的任务上会拒绝所有数据源,无从优化。
七、必要知识反推与通用性灵感
7.1 必要知识反推
假如让一个聪明但零背景的人重做这三篇工作,他最少需要掌握什么?
领域知识层:
- Agent/harness 生态的现实格局——什么是 harness(工具、文件访问、观察接口、计分程序的执行环境)、技能在其中的加载方式(SKILL.md/系统消息)。没有这个就无法理解「跨 harness 适配」为什么是个问题(92.9% 这个数字的分量来自对生态异构性的认知)。
- 各基准的评估协议细节(SearchQA 去 snippet、AIME 数值等价容差 10⁻⁶、SpreadsheetBench 在线评测多工作簿判定)——否则连「成功」都无法正确实现。
方法论知识层:
- 提示优化全谱系(APE→DSPy→TextGrad→GEPA→SkillOpt):三篇都是站在这个序列的肩膀上定位自己的增量。
- 统计学:配对检验、McNemar 式统计量(P2S 的 z)、bootstrap 比例推断(SkillSpec 的 PSS/RSS)、Hoeffding 不等式与一致收敛(P2S 的 Theorem 1)。没有这些,「可靠性」只能停留在口号。
- 回归分析与实验设计:ridge 回归拟合敏感度函数、round-cluster bootstrap 的块结构重采样、「同骨干配对」的受控消融设计——SkillSpec 的 Phase II 与表 3 是实验设计课。
- 信息检索:BM25、节级切分、信噪比权衡(RASO 的 K=5 是测出来的,K=10 引入噪声掉分)。
工程知识层:
- 多智能体编排(query 生成/适配/初始化/更新各是一个 LLM agent,输入输出契约要定义清楚)。
- 泄露防控工程:RASO 的逐基准 blocklist + 仓库级排除;P2S 的双哈希审计——两个团队不约而同把「防作弊」当成一等公民,这是本方向的新规范。
知识融合的关键节点:三篇各自最精彩的化学反应在于——SkillSpec 把「临床试验统计学」(配对、多中心、重复确认)嫁接进文本优化循环;RASO 把「RAG 管线」翻译到「程序知识迁移」场景并发明了翻译层算子;P2S 把「AutoML 的数据自采」(Prompt2Model)与「优化理论的选择界」缝进技能框架。三篇共同的知识底座是:把软件工程的「回归测试/CI 门禁」思维搬进自然语言资产的迭代——这是从「写 prompt」到「养技能」的范式转移的本质。
7.2 论文中可以提取的通用性灵感
灵感一:聚合指标会撒谎,逐例配对才会说真话。
- 证据:SkillSpec 对 SkillOpt +6.89 的第一支柱是配对门;P2S 用 w>ℓ 且 z≥1 替代「平均分提高」;两者独立收敛。
- 推广:任何「批量结果取平均后做决策」的场景——推荐系统的 A/B 测试(平均 CTR 上涨可能掩盖核心用户流失)、代码重构的回归测试(通过率不变但个别用例翻转)、医疗方案的队列评估。把「净改善例数」和「方向一致性」纳入决策门,成本是多几次评估,收益是把回归挡在上线前。
灵感二:失败/被拒绝的尝试是免费的对照实验,别扔。
- 证据:SkillSpec Phase II 用含被拒候选的轨迹估计 PSS/RSS,路由 5/6 命中最优表示。
- 推广:招聘中落选简历的画像可校准 JD;广告投放的败选创意可指示受众干扰因素;科学实验的阴性结果可做荟萃分析。核心是把「拒绝日志」从垃圾桶升级为数据集。
灵感三:跨来源知识复用的最小可行单元是「翻译」,不是「搬运」。
- 证据:92.9% 异构来源下,SkillRouter(搬运)低于无技能,Cross-Harness Adaptation(翻译)单项贡献 +2.33~+7.74。
- 推广:跨团队 SOP 移植(术语/工具映射后才能落地)、跨语言知识库复用、开源软件的 API 迁移指南。判断标准可操作化:源语境中的对象/命令/单位在目标语境有无对应物,无对应物的流程整段删除而非硬译。
灵感四:当「训练数据」不可得时,把「造数据」做成优化循环的一等公民。
- 证据:P2S 仅凭一句任务描述,检索+合成代理数据,5 模型平均 +36.1%(对 Direct,逐对口径),且泄露审计 0 命中。
- 推广:冷启动个性化(无历史用户→从相似人群合成偏好数据)、小语种 NLP(无标注→受控生成+可回答性筛查)、内部工具评估(无金标→契约自动生成测试集)。配 TR 定理的思路:对「代理与真实的差距」显式建模并给出预算界,比假装没有差距更诚实也更可控。
灵感五:「内容」与「组织」是两个正交优化轴,分开优化才可归因。
- 证据:SkillSpec 两阶段解耦后,Phase II 在同骨干配对中仍 +2.31,路由超固定表示 +1.17~+3.36。
- 推广:文档工程(同一知识,教程式/参考手册式/FAQ 式适配不同读者任务依赖)、知识图谱 vs 平面词条的选择应取决于查询的过程依赖性、甚至个人笔记法(线性日记 vs 卡片盒)的选择也可以「任务敏感度」论。
灵感六:先验知识的 ROI 在弱模型上最大。
- 证据:RASO 在 Qwen-3.5-9B 上的增益(最高 +11.30)系统性大于在 GPT-5.6-Luna 上(最高 +6.31);SkillSpec 在 GPT-4.1 上 +11.63 大于在 GPT-5.4 上 +3.12(反向印证:越强的模型越不需要外部帮助)。
- 推广:小团队/边缘设备/低成本模型场景应优先投入「上下文工程」而非「更大模型」;知识库增强对实习生和专家的价值不对称——工具的价值密度与使用者的存量知识成反比。
三篇合读的一句话收束:SkillOpt 让「技能可以被训练」,SkillSpec 让训练有了统计学的纪律,RASO 让训练站在百万前人的肩膀上,Prompt2Skill 让训练的入场券从「一个数据集」降到了「一句话」——「技能」正在经历从手工作坊到系统化工程的转变,而这三篇分别补上了质量体系、供应链和最低准入门槛。