论文链接:
- GSO: Do Self-Evolving Skills Generalize to Held-Out Tasks?
- Rep2Skill: Representation-Guided Skill Self-Evolution for LLM Agents 发表时间:2026年9月30日(两篇同日提交 arXiv) 机构:
- GSO:大阪大学 SANKEN(高校;第一作者 Xihao Piao,通讯作者 Zheng Chen,合著者 Zifeng Wang)
- Rep2Skill:上海科技大学 + 美团(产学研合作:上科大研究生 Changming Li、Zheng Zhang 等与美团 Wenjie Shi、Jingang Wang 等共同完成,通讯作者为上科大 Kan Ren) 领域标签:cs.AI / cs.CL;ICLR 2027 在审(GSO)
为什么把两篇论文放在一起读
这两篇论文同日出现在 arXiv 列表上,一个来自大阪大学,一个来自上海科技大学与美团,互相并不知道对方的存在,却像是约好了一样,从两个不同的方向回答了同一个问题——自进化 skill 的学习信号,究竟应该从哪里来?
GSO 的回答是:信号不该来自「skill 内容本身」。直接学习 skill 内容的每一次编辑都在拟合眼前的训练失败,把针对单个任务的窄修复写成了约束所有任务的全局规则——这就是 skill 过拟合。GSO 的解法是换学习目标:只保留一份「如何写 skill 的指南」(元技能),每个新任务现写一份一次性 skill,任务细节用后即弃。
Rep2Skill 的回答是:信号也不该只来自「文本轨迹」。文本轨迹只暴露了 agent 的动作和环境反馈,任务级成败又过于稀疏,优化器很难判断「到底是哪一步搞砸的」。Rep2Skill 的解法是换信号源:读取 agent 冻结模型的隐藏态轨迹,用 Neural CDE 学出「成功执行的标准动力学」,以预测误差定位偏离成功模式的轮次,归因精度从 AUROC 0.494 跃升至 0.838。
一篇诊断「学什么会过拟合」,一篇解决「从哪学更精准」,合起来正好构成 skill 自进化信号问题的完整切面:学习目标(学写法 vs 学内容)× 信号粒度(turn 级表征证据 vs 任务级文本结果)。更有趣的是,两篇共享了同一批对照系——SkillGen、Trace2Skill、SkillOpt、EvoSkill 都同时出现在两篇论文的 baseline 列表里,且都输了。这说明两篇论文诊断出的是这批方法的共同病灶。
下面按结构模板的九部分框架展开,涉及两篇论文时分别标注【GSO】/【Rep2Skill】。
一、论文背景
要理解这两篇论文,需要先建立三个概念台阶。
第一级台阶:什么是 Agent 的 Skill。 LLM agent 在解决多步任务(修 bug、编辑表格、网购、家务)时,除了模型本身,还可以加载一份「外部知识包」——可能是操作流程、检查清单、提示词或可执行代码。这就是 skill,类似于给新员工的《岗位操作手册》:模型参数一个字不变,但行为被这份手册显著塑形。Anthropic 于 2025 年将其工程化为 Agent Skills 生态(SKILL.md 格式),Claude Code 等产品已内置,社区 skill 市场规模已达数十万量级——skill 正在成为 agent 时代的「App」。
第二级台阶:什么是「自进化」skill。 手工写 skill 费时费力且质量参差,于是出现了自进化方法:让 agent 在训练任务上练习,收集失败反馈,然后反复改写 skill 本身——SkillGen 对比成功与失败轨迹、Trace2Skill 蒸馏轨迹教训、SkillOpt 做有界编辑加验证门控、EvoSkill 维护一个增长的 skill 文件夹。这些方法共享一个隐含假设:在训练任务上学到的 skill 改进,会迁移到同类型的新任务上。
第三级台阶:这个假设靠得住吗? 机器学习的历史不断提醒我们:在训练集上拟合得越狠,测试集上未必越好。如果 skill 的每次修改都在针对「刚刚失败的那几个任务」,它会不会把训练任务的细节(列名、文件名、参数)硬编码进去?此前几乎没有工作在受控条件下系统测过这件事——这正是【GSO】的切入点。而另一边,即便确定要改 skill,「从哪里知道该怎么改」也是个难题:优化器只能看到冗长的文本轨迹和一个稀疏的最终成败,归因粒度太粗——这是【Rep2Skill】的切入点。
两个痛点拼起来,就是本领域当前最核心的开放问题:skill 自进化的信号,应该从哪里来、以什么粒度来?
二、论文定位和关联工作
两篇论文各自站在不同的研究谱系上,但共享大量共同对手。
谱系一:记忆与经验迁移(两篇共同的背景板)。 Reflexion 写反思笔记、ExpeL 蒸馏洞察、ReasoningBank 沉淀推理策略——这类方法把经验存为「笔记」。Xiong et al.(ACL 2026)已实证:agent 存在「经验跟随」行为,坏记忆会传播错误、错配记忆会误导当前任务。GSO 的过拟合发现(10/36 个 skill 测试分低于 No Skill)为这条警示线补上了 skill 侧最硬的证据;Rep2Skill 的组内对比设计(同任务同 skill 采 4 条 rollout 互为参照)则部分对冲了单轨迹的偶然性。
谱系二:自进化 skill 方法(两篇共同的对照组)。 SkillGen / Trace2Skill / SkillOpt / EvoSkill 在两篇论文中都是 baseline,且在两篇的实验里都没有一处全胜。GSO 补充了 GEPA(反思式提示进化、Pareto 前沿候选维护)作为最强通用优化器对照,并首次把这批方法放进「同模型、同 agent、同划分、测试集锁定」的受控协议下横向对比。Rep2Skill 则聚焦「自进化设定」——同一个 LLM 既当执行器又当优化器,不允许更强的外部模型帮忙——这批文本方法在该设定下尤其容易翻车(WebShop 上 SkillOpt 39.04 vs No Skill 41.86,反而变差)。
谱系三:LLM 内部表征(Rep2Skill 的方法论源头)。 表征工程线(Representation Engineering 等)早已证明 LLM 隐藏态编码真伪、事实性、推理状态等信息;近期工作进一步发现 agent 隐藏态能反映工具调用决策与执行失败,且这些信号在行为显式暴露之前就已出现在表征里。其中最直接的源头是 OAT(Yeh et al., arXiv:2607.12747):仅用 100 条成功轨迹训练 Neural CDE,以「偏离成功动力学」的异常分数做无监督故障归因,速度比 prompt 式归因快 200–5000 倍。Rep2Skill 把这套归因机制首次接入 skill 进化回路,并用「言语化」(verbalization)桥接表征信号与文本 skill 编辑之间的鸿沟。GSO 则站在 LLM-as-judge 线上:用 judge 给终版 skill 打分(泛化性/适用性/可执行性/鲁棒性/清晰度五维加权),发现 judge 排序与测试结果 108/126 一致、但对单次编辑的预测几乎无效——这与它「编辑必须跑一遍才能留」的结论互相咬合。
谱系四:换学习目标的先例(GSO 的思想近邻)。 GSO 的「学写法不学内容」与工具制造线的经典分离同构:LATM/CREATOR 区分「造工具的抽象能力」与「工具的具体实例」,ADAS 用元 agent 写新 agent。最近的 SkillTTA 在测试时从训练轨迹检索合成临时 skill,与 GSO 的临时 skill 最接近;差别在于 GSO 的 skill 由学到的指南+任务自身证据现写,不检索历史轨迹。GSO 与 Rep2Skill 在「验证门控」上同源:两者都沿用 SkillOpt 式的候选生成+验证集把关+只升不降接受,但 GSO 把接受规则升级为「修复数 > 2×回归数」的回归加权门槛。
| 维度 | 之前的路线 | GSO 的突破 | Rep2Skill 的突破 |
|---|---|---|---|
| 学什么 | 学 skill 内容本身 | 学「如何写 skill」的元技能,任务细节用后即弃 | 仍学 skill 内容,但由表征证据指导编辑方向 |
| 信号从哪来 | 文本轨迹+任务级成败 | 失败追溯定位到元技能单一模块(首错归因) | 隐藏态轨迹+Neural CDE 偏离度(turn 级) |
| 接受标准 | 各家自有验证规则 | 回归加倍惩罚的更新得分 u=\|R\|-2\|B\| | 表征反馈+验证门控双保险 |
| 核心发现 | 默认训练增益会迁移 | 21 个增益 skill 仅 5 个全保真 | 文本归因 AUROC 0.494 近乎随机 |
定位结论:GSO 是 skill 泛化性的「度量衡」论文——为整个子领域建立受控评估规范,并给出元技能这一结构性解法;Rep2Skill 是 skill 进化信号源的「勘探」论文——打开模型内部表征这座尚未接入进化回路的信息矿。前者告诉我们「别学什么」,后者告诉我们「还能从哪学」。
三、问题定义
两篇论文把各自的具体场景抽象成了两个互补的数学问题。
【GSO】的抽象:skill 优化 ≈ 深度学习训练。定义自进化 skill 方法为:从初始 skill s₀ 出发,每轮在训练任务上跑 agent、收集反馈 F_t,由编辑器 E 写出候选 s’ₜ = E(s_t, F_t),通过方法自带的检查则接受。最终 skill ŝ 冻结后用于所有测试任务。关键定义是三个量(均相对 No Skill 基线、以百分点计):训练增益 G_train、测试增益 G_test、保真度 Retention = G_test − G_train。Retention < 0 即过拟合,G_test < 0 即有害。这套定义的精妙之处在于,它把「训练分数涨了」这个所有自进化方法都在报告的指标,拆成了「用户真正收到的部分」和「蒸发掉的部分」——以前者汇报惯例从此失去遮羞布。问题重定义为:既然直接学 s 会过拟合,改为学元技能 m(写 skill 的指南),每任务由 C(m, x) 现写 sx,目标是最大化 E[r(x, C(m, x))],且只有 m 跨任务保留——把「学什么」和「用什么」在对象层面解耦。
【Rep2Skill】的抽象:skill 进化 ≈ 缺失信用分配的优化。标准进化 sₙ₊₁ = O(sₙ, τ) 中,优化器 O 只能看到轨迹 τ(文本)和任务级分数 r(τ)∈[0,1]。Rep2Skill 引入第三个信息源:每轮从冻结 agent 固定层提取隐藏态 h_t,组成表征轨迹 H(τ)=(h₁,…,h_T)。问题转化为:如何在 turn 级别上量化「这一步偏离了成功执行的动力学」,并把这种偏离信号转化为可指导文本编辑的反馈。它有意设定在「自进化」条件下——同一个冻结 LLM 兼任执行器 π_θ、分析器 M_a 和优化器 O,没有更强外部模型兜底——因为弱优化器恰恰最缺归因证据。
两个定义的对偶性一目了然:GSO 说「即使信号完美,学错对象也会过拟合」;Rep2Skill 说「即使学对对象,信号太粗也学不好」。合起来构成信号-目标二维空间中两条正交的改进轴。
四、问题解法
【GSO】Generalizable Skill Optimization:学写法,不学内容
GSO 的核心类比:元技能之于 skill,如同学习率之于参数更新——不直接决定内容,但约束每次改变的幅度与方向。整体循环四步(每步都是同一个 LLM 的带独立提示词的一次调用):
- 元技能结构。m = (m₁,…,m₆) 是一份六段式短指南:怎么读任务、怎么选工具与来源、怎么写步骤式流程、怎么检查结果、怎么定位出错、怎么在唯一一次重试中修复。元技能里永远不出现具体文件名、列名、输出路径——这些只属于具体任务。
- 一次性 skill 生成。面对任务 x,模型读 m 和任务自身可见的一切(提示词、输入文件、已装工具、文档),写出 s_x = C(m, x)。看不见金答案和评分器。任务做完 s_x 即丢弃——一个任务的细节物理上无法泄漏进另一个任务。
- 首错归因。任务失败时,模型读运行日志,找到第一个出错步骤(如读错输入文件、没检查输出),判断「元技能的哪个模块本该防住它」——只归因到 m_k 一个模块。
- 回归加权门控。只改被归因的那一个 m_k,新旧两版在相同验证任务上对跑:修复集 R(旧败新胜)、回归集 B(旧胜新败),更新得分 u = |R| − 2|B|,仅当 u > 0 才接受。回归代价加倍的理由很朴素:弄坏原本能解的任务,比多修好一个任务对用户的伤害更大。
两个学习规则直接来自第三节的诊断:编辑改变尽可能少(单模块编辑,防止一个修复重写其余部分)、编辑必须跑过才算数(judge 读不懂单次编辑的效果,Spearman 仅 0.39/≈0,内容不能替代执行)。测试时零更新:每个测试任务从最终元技能现写一份 skill 跑完即弃,跨基准不共享编辑。
【Rep2Skill】:让 skill 编辑听见模型内部的声音
Rep2Skill 的核心类比:成功执行动力学之于失败轨迹,如同健康体检基线之于病患指标——不需要标注「哪一步是错的」,只需要学出「正常长什么样」,偏离即是嫌疑。框架三段:
- 组采样。同一任务 x、同一 skill sₙ,从同一冻结 agent 采 K=4 条 rollout。这一设计受组相对优化(GRPO 同源思想)启发:组内轨迹互为受控参照——共享任务和 skill 的前提下,行为差异即为诊断证据。实测组内多样性惊人:turn 5 时 82.7% 的动作对已经不同,turn 10 时 98.5% 的轨迹前缀在组内独一无二——同一模型同一任务,走的路比想象中散得多。
- 表征归因。对每条 rollout 的每个 turn,从冻结 agent 第 24 层提取隐藏态(仅前向轨迹文本,剔除 skill、奖励等任何结果信息以防泄漏),PCA 降到 64 维。用 Neural CDE(神经控制微分方程)在约 50 条成功轨迹上训练一个「下一步表征预测器」:给定前 t−1 轮的表征历史,预测第 t 轮的成功表征 ĥ_t。归因得分 c_t = ‖h_t − ĥ_t‖²——预测误差越大,说明这一轮偏离成功动力学越远。取 top-K_c(K_c=3)为关键轮次。
- 言语化+门控更新。分析器 M_a(同一 LLM)读关键轮次、完整轨迹和当前 skill,输出结构化文本反馈,每条须带五类诊断类型之一(suspect_rule / rule_conflict / execution_deviation / missing_rule / insufficient_evidence),且程序化校验:引用的 skill 原文必须是精确子串、轨迹证据必须是逐字摘录、execution_deviation 与 insufficient_evidence 不允许建议改 skill。反馈经 SkillOpt 式合并→编辑选择(预算 L=4,相当于文本学习率)→验证门控(只升不降)后进入下一轮。
一段精当的防过拟合设计藏在分析器提示词里:「表征预测误差衡量的是意外的表征变化,不是动作质量或因果」「不要把无条件的位置记忆或操作清单写进规则」。这与 GSO 的诊断——过拟合 skill 的标志正是无条件全局规则——形成了跨越两篇论文的呼应。
两篇解法的合读视角:GSO 在「学什么」轴上把学习目标从内容换成了写法;Rep2Skill 在「从哪学」轴上把信号源从文本扩到了表征。二者技术上完全正交——完全可以设想「表征引导的元技能进化」:用 Neural CDE 的 turn 级归因来定位 GSO 的首错模块,用 Rep2Skill 的组对比来校准 GSO 的回归门控。
五、评估指标与实验证据
【GSO】:受控协议下的 6×8 全景
协议:同模型(Qwen3-Coder-480B,温度 0)、同 agent、同 train/val/test 划分,测试集在所有方法选定最终 skill 前保持锁定。6 基准覆盖 5 域:SpreadsheetBench(表格编辑)、RBioBench Clinical/Omics(自建 R 语言临床/组学生物分析套件,405 任务)、SWE-bench Verified(真实仓库修 bug)、HealthBench(未见过专科的医学检索问答)、SciVisAgentBench(科学可视化)。对照 8 方法:No Skill / One-shot / SkillGen / Trace2Skill / SkillOpt / EvoSkill / GEPA / GSO。
主指标:保真度Retention 分布(回答「过拟合有多普遍」):
| 发现 | 数据 | 衡量的本质能力 |
|---|---|---|
| 增益蒸发 | 21 个 G_train>0 的 skill:5 个全保真、13 个部分保真、3 个归零 | 训练增益向新任务的真实迁移率 |
| skill 反而有害 | 36 个既有方法测试分中 10 个低于 No Skill;6 基准中 5 个至少一个方法低于 No Skill | 负迁移的普遍性 |
| 无处不在的赢家缺席 | 没有任何既有方法处处最优;RBioBench Omics 上全军覆没于 No Skill | 「某方法最好」声明的脆弱性 |
| 保真度跨度 | Retention 从 +3.4 到 −15.0 pp | 过拟合程度的巨大方差 |
GSO 主结果(测试分,%):全部 6 基准第一,领先最佳既有方法 +4.3(HealthBench 36.7 vs 32.4)到 +22.5 pp(SWE-bench 47.5 vs 25.0);SpreadsheetBench 60.0 vs 40.0;RBio Clinical 76.5 vs 64.7;RBio Omics 60.9 vs 43.5(唯一超越 No Skill 43.5 的方法);SciVisAgentBench 70.0 vs 61.4。
Judge 的能与不能(回答「内容能否替代执行」):五维加权 judge 对终版 skill 的排序与测试结果 108/126 对(85.7%)一致——成品 skill 的内容确实携带大量可读的泛化性信息;但对单次编辑效果的预测 Spearman 仅 0.39(SpreadsheetBench)/≈0(RBioBench)——一次编辑是帮是害,读内容读不出来,必须跑。这个「终态可判、增量不可判」的不对称性,直接论证了 GSO「编辑必须执行验证」的设计。
【Rep2Skill】:归因精度 → 下游性能的两级证据
协议:自进化设定(同 LLM 三役:执行器+分析器+优化器),ALFWorld(具身家务,134 个 unseen 测试任务)× WebShop(交互网购,100 测试指令)× Qwen3-4B / Qwen3.5-9B 双模型(全注意力 vs 混合注意力两种架构),3 种子取均值±标准差,每任务组采样 4 rollout。
第一级:归因精度(方法有效性的直接机制证据,turn 级非进展轮检测,GPT-6-Astra 标注正/中/负进展):
| 归因输入 | AUROC | AUPRC | P@Top-3 |
|---|---|---|---|
| 轨迹文本 | 0.494 | 0.736 | 63.66% |
| 纯表征得分 | 0.592 | 0.789 | 79.26% |
| 文本+表征引导(Rep2Skill) | 0.838 | 0.876 | 88.22% |
文本基线 0.494 接近随机抛硬币——这是对「纯文本归因太粗」最锋利的量化。表征得分单独已优于文本,但真正的飞跃发生在「表征定位+文本解读」的结合上。
第二级:下游 skill 进化性能:
| 模型 | 方法 | ALFWorld 成功率 | WebShop 分数 | WebShop 成功率 |
|---|---|---|---|---|
| Qwen3-4B | No Skill | 22.64 | 41.86 | 13.67 |
| 最强基线(Trace2Skill 47.26) | 47.26 | 49.48(EvoSkill) | 13.33(EvoSkill) | |
| Rep2Skill | 52.24(+4.98) | 49.79 | 16.33 | |
| Qwen3.5-9B | No Skill | 28.61 | 50.07 | 18.33 |
| 最强基线(SkillOpt 62.19) | 62.19 | 52.12(SkillOpt) | 18.67(SkillOpt) | |
| Rep2Skill | 69.90(+7.77) | 53.56 | 23.33(+4.66) |
注意一个与 GSO 呼应的细节:文本基线在 WebShop 上频繁低于 No Skill(SkillOpt 39.04 vs 41.86;9B 上 Trace2Skill/EvoSkill 双双翻车),而 Rep2Skill 在两个模型、两个指标上全部高于 No Skill——更准的归因不仅提升上限,还堵住了「越进化越差」的下限漏洞。
消融(ALFWorld,Qwen3-4B):完整版 52.24;去言语化 −4.48、去表征分析器 −5.22、去组证据 −5.47 pp——三个组件缺一不可,且组对比的证据价值略高于表征信号本身。
案例分析(连接两极的机制链):文本优化器只看到「30 步用完了」的终态症状,给出「搜索要更彻底」的空泛修订,重跑仍败;表征归因把高分集中在第 17–29 轮的重复柜内搜索,分析器识别出「搜索从未扩展到柜外位置」,修订为「柜子搜完查台面/抽屉/水槽」的条件规则,8 步完成。从泛泛反思到具体可复用规则的转变,正是归因粒度的价值。
合读证据链:GSO 证明「内容学习+文本信号」的组合会系统性过拟合;Rep2Skill 证明「内容学习+表征信号」能显著缓解归因失败(AUROC 0.494→0.838)并稳定超越 No Skill,但其评测止于同任务类型内的 unseen 实例,未测 GSO 意义上的 retention——两篇的证据恰好互补拼图,也共同留下「表征信号×元技能目标」这一象限的空白。
六、效果优势的根源解释
6.1 根源机制与证据链
【GSO】的因果链:
- 诊断:直接学 skill 内容时,每次编辑拟合当前训练失败 → 窄修复被表述为全局规则(「需要时创建摘要文件」→「总是创建」)→ 新任务被错误规则绑定(论文实验已支持:图 1b 逐字编辑记录,训练 +5/测试 −5;图 3 三个方法的过拟合 skill 原文摘录)。
- 机制变化:学习目标换为元技能后,任务细节留在一次性 s_x 中用后即弃 → 过拟合的物理通道(细节跨任务泄漏)被结构性切断,而非靠正则化缓解(论文实验已支持:judge 维度分析中 GSO 泛化性维度满分 5/5,其他方法 3-4/5)。
- 指标映射:通道切断 → 6 基准全面第一且在唯一「既有方法全败」的 RBio Omics 上仍 +17.4 pp(论文实验已支持)。
- 编辑必须执行验证的必要性:judge 单编辑预测 Spearman 0.39/≈0 → 内容审读无法替代运行检验(论文实验已支持)。
- 阅读者推测:GSO 测试时「每任务现写 skill+一次重试」引入额外模型调用,论文自承 HealthBench 上 retention 也为 −5.2,增益应归因于「换目标+一次性 skill+重试」的整体方案而非单一组件——尚待组件级消融拆解。
【Rep2Skill】的因果链:
- 诊断:任务级成败信号稀疏+文本轨迹冗长 → 优化器归因失败(论文实验已支持:文本归因 AUROC 0.494 近随机;组内轨迹 turn 5 动作分歧 82.7%,单轨迹归因天然不稳)。
- 机制变化:隐藏态在行为显式化之前编码执行状态(外部证据支持:OAT、Wu et al. 线工作,见 6.2)→ Neural CDE 只学成功动力学、以偏离度定位关键轮 → 归因从「任务级+猜测」变为「turn 级+模型证据」(论文实验已支持:AUROC 0.838)。
- 传递到编辑:关键轮+轨迹上下文的言语化反馈 → 修订从泛泛(「更彻底」)变为条件规则(「柜尽查台面」)→ 验证门控通过率上升(论文实验已支持:案例分析+消融中言语化贡献 4.48 pp)。
- 传递到下游:更准编辑 → 全设置一致领先+堵住低于 No Skill 的下限(论文实验已支持:Table 1 全表)。
- 阅读者推测:文本+表征(0.838)远超纯表征(0.592),说明当前表征信号定位能力强但语义弱,必须经 LLM 解读才可用——「表征提供 where、文本提供 why」的分工是否为最优架构,尚无定论。
6.2 相关工作检索与对照
围绕「表征轨迹建模」「经验负迁移」「judge 预测能力」三条因果假设,本次检索的外部证据如下:
| 研究 | 相似尝试 | 相关结论 | 与本文的差异与适用边界 | 对根源解释的影响 |
|---|---|---|---|---|
| OAT(Tracing Agentic Failure from the Flow of Success, arXiv:2607.12747, Yeh et al., 2026) | 同用 Neural CDE 仅在成功轨迹上训练、以偏离度做故障归因 | 独立验证「成功动力学基线」可做无监督 step 级归因,且比 prompt 归因快 200–5000 倍、F1 +20% | OAT 做通用故障定位,Rep2Skill 将其接入 skill 进化回路并加言语化桥;OAT 用约 100 条成功轨迹、Rep2Skill 约 50 条 | 支持:表征偏离度作为归因信号的有效性获独立验证;Rep2Skill 的增量在「归因→编辑」转化环节 |
| Xiong et al.(How Memory Management Impacts LLM Agents, ACL 2026, arXiv:2505.16067) | 实证研究 agent 记忆的经验跟随行为 | 错误传播+错配回放会使留存经验「越用越差」,选择性增删优于全量保留 | 对象是记忆而非 skill,但同为「持久化经验工件」;GSO 引用了该文,其负迁移结论与 skill 过拟合同构 | 支持:GSO 的过拟合发现(10/36 低于 No Skill)把「留存经验可能有害」从记忆侧扩展到 skill 侧,两项独立研究交叉印证 |
| GEPA(Agrawal et al., ICLR 2026) | 反思式 prompt 进化,维护 Pareto 候选前沿 | 在 GSO 协议下 GEPA 多处低于 No Skill(SpreadsheetBench 20.0 vs 27.5) | GEPA 原文报告优化目标上的提升,GSO 换成冻结测试协议后排名重排 | 限定:强通用优化器在 held-out 冻结协议下的表现与其原始报告存在落差,提示「优化目标分≠迁移分」的普遍性 |
| Xiong et al. 同上 / judge 位置偏差线(Zheng et al. 2023; Shi et al. 2025) | — | LLM judge 对输入顺序敏感 | GSO 让 judge 逐个打分而非并排比较以规避 | 补充:GSO judge 85.7% 一致率是在规避位置偏差后取得的,可信度上调 |
| Anthropic Agent Skills(2025,工程博客) | 工业级 skill 生态 | 手工 skill 已大规模落地 | 非学术论文,无受控泛化测量 | 背景补充:说明 skill 过拟合问题的现实影响面(数十万 skill 的市场将继承同样的泛化风险) |
在本次检索范围内未发现:①直接检验「元技能目标 vs 内容目标」对照的独立工作(GSO 的对照均为内容学习法);②发现「内部表征信号对 skill 进化无效或有害」的相反结论;③GSO 式受控 retention 协议在其他方法族(如 SkillFM 生成式路线)上的复现。这三项均为证据缺口。
6.3 综合判断与未决问题
获多项研究共同支持的机制:(a) 持久化经验工件存在系统性负迁移(GSO 的 retention 数据 + Xiong 的经验跟随/错误传播 + GEPA 在冻结协议下的落差,三线独立汇聚);(b) 成功轨迹训练的表征动力学模型可提供 step 级归因信号(Rep2Skill + OAT 机制同源、结论一致)。
仍属推测的机制:(a) 元技能目标是否在更强模型/更异构任务族上仍全面占优(GSO 仅单模型,作者自列为开放问题);(b) 表征归因在 RL 训练过的模型上是否同样有效(隐藏态可能编码了不同的内部结构);(c) GSO 增益中「一次性 skill 生成本身」与「元技能学习」的贡献比例(测试时额外调用未与基线对齐,论文自承)。
适用条件与失效条件:GSO 的优势前提是「任务细节确实因任务而异」——若任务族内部高度同质(如 HealthBench 的专科问答),硬编码细节的代价小,既有方法也能全部为正;Rep2Skill 需要白盒访问和约 50 条成功轨迹的离线采集,黑盒 API agent 无法直接套用(作者建议代理模型方案,未验证)。两者都在「同任务类型内泛化」设定下成立——跨任务类型迁移(spreadsheet skill 能否帮修 bug)是两篇共同划出的界外问题。
七、必要知识反推
假设一个零知识背景的人要复现这两篇论文的工作,他最少需要掌握以下知识,并在关键节点上完成融合。
领域知识层:
- LLM agent 的运行机制(观察-动作循环、轨迹、环境反馈)——不懂就无法定义 rollout、失败归因这些基本操作对象。
- Skill 作为「参数冻结下的行为塑形工件」的角色——不理解「skill 改行为不改参数」,就无法把 skill 优化类比为深度学习训练(GSO 全部理论框架的起点)。
- 表征几何基础(隐藏态、线性结构、PCA 降维)——不知道隐藏态携带可解码信息,就根本想不到去模型内部找归因信号(Rep2Skill 的起点)。
方法论知识层:
- 机器学习的过拟合-泛化范式(训练/验证/测试划分、冻结评测、retention 概念)——GSO 的受控协议完全照搬这套规范,这是它能把「skill 学习」纳入 ML 评估语言的前提。
- 可控微分方程建模时序动力学(Neural CDE 的连续时间路径建模、Hermite 插值构造控制路径)——Rep2Skill 的归因器核心,需要理解「只在成功数据上训练单类模型→以预测残差为异常分」的单类学习思想(与 OAT/One-class SVM 同脉)。
- prompt 优化与验证门控循环(候选生成-验证-接受/拒绝)——两篇共用的 skill 编辑骨架(均承自 SkillOpt),需要懂「文本编辑预算=学习率」的类比。
- LLM-as-judge 的能力边界与位置偏差——GSO 的 judge 协议设计(逐个评分、只做事后诊断)直接建立在这条线的已知缺陷上。
工程知识层:
- 受控实验协议工程(测试集锁定、checkpoint 冻结、信息边界审计、执行台账)——GSO 的可信度全靠这套工程纪律。
- 表征提取管线(层选择、前向重放、防标签泄漏的输入构造、vLLM 服务与独立 GPU 进程协同)——Rep2Skill 需要在生产级推理框架旁边挂一个隐藏态采集进程。
- 程序化反馈校验(精确子串匹配、逐字证据检查、JSON schema 约束)——Rep2Skill 用它把 LLM 分析器的输出约束到可验证 ground 上。
知识融合的关键节点:
- GSO 节点一:把「skill 编辑」与「梯度更新」叠合——只有同时精通 agent skill 生态和 ML 泛化理论的人,才会想到给 skill 定义 retention 并把「总是创建摘要文件」识别为过拟合而非 feature。
- GSO 节点二:judge「终态可判/增量不可判」的不对称发现与「编辑必须跑」的规则设计融合——诊断直接翻译成了工程约束。
- Rep2Skill 节点一:表征轨迹建模(来自可解释性社区)与组相对优化(来自 RL 社区)的融合——组采样提供了「偏离度有意义」的受控参照系。
- Rep2Skill 节点二:表征信号(连续、无语义)与文本反馈(离散、可执行)的桥接设计——分析器的五类诊断分类+程序化校验,是把两类信息形态焊在一起的铆钉。
- 跨论文融合点(合读才能看到):GSO 的「无条件全局规则是过拟合标志」与 Rep2Skill 分析器提示词里「不要写无条件规则」的约束——两篇论文在未沟通的情况下收敛到了同一条防御性设计原则,这本身即是该原则普适性的证据。
八、论文中可以提取的通用性灵感
灵感一:把「学内容」换成「学生成内容的方法」(范式迁移类) 核心思想:当持久化工件容易过拟合细节时,学习目标上移一层——不存结果,存生成结果的程序。 论文证据:GSO 学元技能而非 skill,6 基准全胜(+4.3~+22.5 pp);judge 泛化性维度 GSO 5/5 vs 其他 3-4/5。 推广场景:① RAG 系统从缓存答案改为维护「如何检索/验证答案的策略文档」;② 代码助手从 snippet 库进化为「snippet 构造指南」库;③ 教育领域从错题本进化为「出错模式识别方法论」;④ 编译器自动调优从缓存最优配置改为学习配置搜索策略。
灵感二:信息工件应该「用后即弃」与「跨任务保留」分层(关注点分离类) 核心思想:工件中「随实例变化的部分」与「跨实例不变的部分」必须在物理层面隔离存储,前者绝不进入持久层。 论文证据:GSO 的一次性 s_x(任务细节)与元技能 m(写法)分离,细节泄漏通道被结构切断;对照图 3 中既有方法把列名/文件名写进持久 skill。 推广场景:① 配置管理中环境变量与代码逻辑分离;② 数据库设计把会话数据与 schema 分层;③ 提示词工程把任务上下文放在模板槽位而非模板正文;④ 法务合同把个案条款与标准条款分档。
灵感三:负迁移需要「回归加权」的不对称代价(机制类) 核心思想:验证更新时,弄坏原有能力的代价应数倍于新增能力——对称代价会让系统在噪声中漂移。 论文证据:GSO 的 u=|R|−2|B| 且 u>0 才接受(修复至少两倍于回归);Rep2Skill 拒绝一切验证分不升的候选。二者都以「宁可不改,不可改坏」收敛。 推广场景:① 增量学习/持续学习中旧任务性能回退的惩罚项;② 推荐系统探索新策略时对新旧用户体验损失不对称加权;③ 生产系统灰度发布以回归率为首要门槛;④ 免疫系统的自体耐受(误伤自身代价远高于漏杀病原)。
灵感四:内部状态是尚未接入优化回路的免费信号源(信号利用类) 核心思想:系统的可观测输出(文本/日志)只是其信息总量的一小投影,内部中间态往往在结果显式化之前就编码了先兆信号。 论文证据:Rep2Skill 隐藏态偏离度使归因 AUROC 从 0.494(文本)→0.838(结合);表征信号在行为暴露前已反映执行失败(外部线 Wu et al./OAT 印证)。 推广场景:① 用网络设备遥测数据(队列深度、重传率)在断网前定位故障链路;② 心率变异性等生理指标先于主观疲劳报告预警过劳;③ 编译器 IR 层的中间分析比源码层 pattern 更早暴露优化机会;④ 组织管理中一线士气指标先于业绩数据反映系统性风险。
灵感五:连续信号与离散决策之间需要「带校验的言语化」桥(跨域迁移类) 核心思想:把连续模型信号(异常分数)转成离散动作(编辑/决策)时,中间必须有一个可程序化校验的结构化语义层,防止幻觉传导。 论文证据:Rep2Skill 分析器的五类诊断+精确子串/逐字引用校验+两类诊断禁止建议改动——纯表征得分(0.592)与文本结合(0.838)之间 0.246 的差距,大半来自这座桥的质量。 推广场景:① 医学影像 AI 把病灶定位(连续热图)转为结构化报告时强制引用影像证据;② 风控系统把异常分数转为调查工单时要求附交易流水摘录;③ 代码静态分析把复杂度分数转为重构建议时锚定具体行号;④ 科学计量把引文网络信号转为评价结论时强制引用具体文献。
灵感六:评估要区分「优化目标上的分」与「冻结后的迁移分」(评估范式类) 核心思想:任何自适应系统的报告都必须补一列「冻结工件在 held-out 上的得分」,否则训练增益只是幻影。 论文证据:GSO 的 retention 指标揭示 16/21 增益 skill 部分或全部蒸发;GEPA 等强优化器在冻结协议下多处低于 No Skill。 推广场景:① A/B 测试中区分「适配期指标」与「稳定期指标」;② 教育评估区分「刷题分数」与「迁移测验分数」;③ 体育训练区分「专项测试成绩」与「比赛实战表现」;④ 自动调参的模型区分验证集得分与生产分布得分。
附录:关键概念速查
- Skill 过拟合 / Retention:训练任务上的 skill 增益未能(或仅部分)迁移到新任务;Retention = G_test − G_train,负值即过拟合。
- 元技能(Metaskill):GSO 的持久学习对象——一份不包含任务细节的六段式「如何写 skill」指南。
- 一次性 skill(Transient skill):GSO 为单个任务现写、用后即弃的 skill,承载该任务的全部具体绑定。
- 更新得分 u = |R| − 2|B|:GSO 的编辑接受规则,R 为修复集、B 为回归集,回归代价加倍。
- Neural CDE:神经控制微分方程,将不规则时序(此处为表征轨迹)建模为连续路径上的动力学系统;Rep2Skill 用它在成功轨迹上学习「成功动力学」。
- 归因得分 c_t = ‖h_t − ĥ_t‖²:第 t 轮实际隐藏态与「成功动力学预期」的偏离度,Rep2Skill 以此定位关键轮次。
- 自进化设定:同一 LLM 兼任执行器、分析器与优化器,无更强外部模型参与。
- 组采样(Group-wise rollouts):同任务同 skill 采 K 条轨迹互为参照,受 GRPO 组相对思想启发。