论文链接:WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution (arXiv:2608.27454) 发表时间:2026年8月27日 机构:Google Research、弗吉尼亚理工(Virginia Tech)——企业与高校合作 领域标签:cs.AI,Agent 技能自动演化 / 知识管理
一、论文背景
1.1 什么是 Agent 技能
Agent 技能(agent skill) 是一种轻量、开放格式的可复用资源:一个文件系统目录,打包了指令、脚本和其他资源(核心是一个带 frontmatter 元数据的 SKILL.md,含唯一名称、简洁描述、完整程序性指令与适用条件),让 Agent 不更新模型参数就获得领域能力。它支持渐进披露(progressive disclosure)——Agent 按需加载相关内容,节省上下文。可以把它理解为 Agent 的「SOP 手册 + 脚本工具箱」。
1.2 现状痛点:经验散落在优化历史里
大多数技能靠人写,需要预判 Agent 会需要什么程序性知识。近期工作转向自动演化:跑 Agent、分析轨迹、按经验改技能。代表方法有 EvoSkill(维护提案与评估结果的历史)、Trace2Skill(跨轨迹提炼教训)、SkillOpt(用被拒编辑反馈与元指导)。但它们有个共同缺陷:学到的东西没有以独立、可演化的知识表示保存——失败模式、成功策略、被拒绝的提案散落在优化历史的各处,下一次技能提议无法系统性利用跨迭代累积的结构化知识。
论文的灵感直接来自 Karpathy 2026 年的「LLM Wiki」愿景——把经验编译成持久、复利的知识。研究问题由此而来:Agent 经验能否同样编译成持久知识以支持长期技能演化?
二、论文定位和关联工作
2.1 在技能演化谱系中的位置
| 方法 | 经验保存方式 | 与 WikiSkill 的关键区别 |
|---|---|---|
| EvoSkill | 累积的提案历史与评估结果 | 历史是流水账,不是结构化、可增长的知识库 |
| Trace2Skill | 跨轨迹的教训汇总 | 教训直接变技能,缺中间知识层 |
| SkillOpt | 被拒编辑反馈 + 逐 epoch 元指导 | 元指导是优化器状态,非可读可复用的知识 |
| WikiSkill | 三层架构:原始轨迹(不可变)/ wiki(持久复利)/ 技能(可回滚) | 知识层独立存在并跨迭代复利,技能提议建立在越来越完善的证据上 |
2.2 定位结论
WikiSkill 是「经验→持久知识→技能」分层知识编译在 Agent 技能上的首个系统实现。它不与通用 prompt 优化器(如 GEPA)对比——先前工作已证明专门的技能演化管线稳定优于通用 prompt 优化。两个独特贡献点:跨模型技能迁移的系统分析(技能发现与技能执行解耦),以及「技能演化收益随模型规模增大、与 scaling 互补」的发现。
三、问题定义
形式化设定:任务数据集 $D$ 划分为训练/验证/测试三份。Agent $\pi$ 配备工具集 $U$ 与活跃技能集 $S$(初始为空)。执行任务产生轨迹 $\tau_i \sim \pi(x_i; S)$,由领域打分函数评估。
WikiSkill 的系统状态是元组 $(S_k, W_k)$:技能集 $S_k$ 与持久知识库 $W_k$(wiki)。关键的不对称设计:技能候选要过验证门控、分数退化即回滚;而 wiki 永不重置——跨迭代持续累积与编译。目标是从 $(S_0, W_0) = (\emptyset, \emptyset)$ 出发,协同演化 $(S_k, W_k)$,最大化未见测试任务的表现。
一个直观类比:wiki 像实验室的实验记录本(永不撕页,越记越全),技能像标准操作规程(试用不行就撤回,但记录本上「此法不通」的教训留着)。
四、问题解法
4.1 三层知识架构
- Raw 层(raw/):不可变的原始执行轨迹,含推理、工具调用、输出、最终答案。写一次永不改。
- Wiki 层(wiki/):结构化、复利的知识库。包含模式目录(patterns/,每个 markdown 文件记录一种失败模式或成功策略及可行解法)、演化日志(logs.md)、技能影响追踪器(skill-impact.md,由外层 harness 程序化追加:提案元数据、diff、验证分数、接受/拒绝)。这三样记录提供跨迭代的长期历史意识:被拒提案不再重复、递归错误可被识别。
- Skills 层(skills/):活跃技能集。每个技能目录两个文件:SKILL.md(技能本体)与 PURPOSE.md(把技能映射回催生它的 wiki 模式——解释「为什么有这个技能」)。
4.2 四组件演化循环
- 推理 Agent:用当前技能在训练集上跑 rollout。技能全量注入系统 prompt(消除检索失败这个混杂变量)。关键限制:训练 rollout 时禁止访问 wiki——消融证明放开反而有害。
- Wiki 维护者:对采样的成功/失败轨迹做根因分析,以增量 patch 编辑(追加/替换/插入文本段)创建或更新模式页,同步修订 index.md 目录、追加 logs.md 摘要。
- 技能提议者:ReAct 式多轮运行,初始只给 wiki 索引、技能影响追踪器、训练任务结果摘要,然后按需 read_file 检查具体模式页与原始轨迹——避免长历史撑爆上下文。每次产出一个原子提案:只针对单个技能,新建或增量编辑。
- 验证门控与回滚:候选技能在验证集上评估,分数超过历史最优才接受并更新阈值;否则回滚到上一个成功配置。无论接受与否,wiki 照常追加 skill-impact.md 条目——技能可回滚,wiki 永不重置。
五、评估指标与实验证据
5.1 设定
五个基准:LiveMath(数学推理)、SealQA(网页搜索)、SpreadSheetBench(表格操作)、OfficeQA(长上下文文档问答)、ALFWorld(具身交互)。五个模型:Qwen-3.5-4B/9B、Qwen-3.6-27B、Gemma-4-31B、Gemini-3.5-Flash。每个方法完整演化流程独立跑 3 次,报告三次演化技能集的平均测试分,配对 bootstrap 检验显著性(p<0.05)。
5.2 主结果:五模型全部第一
各模型五基准平均准确率:
| 模型 | 无技能 | WikiSkill | 提升 | vs 最强竞争方法 |
|---|---|---|---|---|
| Qwen-3.5-4B | 26.2 | 38.5 | +12.3 | +3.3 |
| Qwen-3.5-9B | 29.9 | 47.4 | +17.5 | +5.1 |
| Qwen-3.6-27B | 39.4 | 63.3 | +23.9 | +10.0 |
| Gemma-4-31B | 41.3 | 54.9 | +13.6 | +5.8 |
| Gemini-3.5-Flash | 49.5 | 68.1 | +18.6 | +12.0 |
单点提升更惊人:Gemini LiveMath 33.0→72.6、SpreadSheet 50.5→76.6;Qwen-27B ALFWorld 52.8→77.6、SpreadSheet 40.8→81.7。而竞争方法不稳定:EvoSkill 把 Qwen-9B LiveMath 从 28.2 提到 58.1,却把 Gemma 从 33.9 降到 29.8。
5.3 技能与模型规模的关系:互补而非替代
Qwen 家族内提升随规模增大:4B +12.3、9B +17.5、27B +23.9(SpreadSheet 上 6.5/9.3/40.9 梯度最陡)。同时技能可补偿规模:9B+WikiSkill(47.4)超过 27B 无技能(39.4);TTPO 一章同款「小模型加方法追平大模型」结构在此再现。
5.4 消融:wiki 层贡献 +15.0
Gemini 上的 2×2 消融(推理 Agent / 技能提议者是否可访问 wiki):
- 提议者无 wiki(同时去掉维护者,即无持久知识):平均 48.7%;
- 提议者有 wiki:63.7%(+15.0),LiveMath 51.3→72.6、SpreadSheet 49.9→76.6。
- 有害方向:推理 Agent 训练 rollout 时也开 wiki 访问,63.7→60.9。假设是部分任务知识直接从 wiki 获取而非写入技能,轨迹信息量下降,技能提炼反而变差——「知识绕过技能」的负效应。
5.5 跨模型迁移:技能发现与技能执行解耦
- 他模型技能常胜过自演化技能:Qwen-27B 技能让 9B 在 SpreadSheet 达 50.5%(自身技能 33.6%、无技能 24.3%);ALFWorld 上 9B 用 27B 技能 70.2% vs 自身 63.4%。
- 小到大的迁移也成立:Qwen-4B 技能让 Gemma LiveMath 33.9→73.1。
- 负迁移真实存在:Qwen-4B 技能把 Gemini SpreadSheet 从 50.5 打到 18.1。错误分析给出两个原因:小模型技能编码了单行 Python 命令等低层变通,锁死了大模型用端到端脚本的能力;碎片化诊断流程引入冗余工具调用,耗尽 Gemini 的交互预算。
- OfficeQA 的执行瓶颈案例:4B 技能让自己 30.2→28.5(负收益),却把 27B 从 42.1 提到 52.9——长上下文里小模型无法执行多步搜索流程,退回默认阅读行为。这组数据干净地分离出两种能力:从经验中发现有用程序性知识 vs 在推理时有效执行该知识。
六、效果优势的根源解释
因果链拆解:
链条一:知识层独立 → 跨迭代证据累积 → 提议质量持续上升。现有方法的经验散落在优化历史里,每次技能提议面对的是「本轮轨迹 + 零散记忆」;WikiSkill 的技能提议者面对的是不断增厚的模式目录、完整的拒绝历史(skill-impact.md)、递归错误记录。被拒过的提案不再重复(案例:ALFWorld 第 0 轮「goal-directed-action」被拒——太抽象,第 1 轮基于新证据的「break-repetition-loop」被接受)。机制变化:提议建立在越来越完善的证据上。指标对应:消融中 wiki 层的 +15.0 平均分。
链条二:验证门控 + wiki 不对称持久 → 试错安全且知识不流失。技能可回滚保证单次坏提案不污染执行;wiki 永不重置保证每次试错(哪怕被拒)的知识增益都留存。这形成「技能快迭代、知识慢复利」的双速结构——类比软件工程里代码可以 revert 但 ADR(架构决策记录)永远归档。
链条三:原子提案 + ReAct 按需读取 → 长历史的上下文可行性。每轮只动一个技能、提议者主动选择要读哪些模式页与轨迹,避免了「全量历史塞上下文」的信息过载。这是知识层能实际运转的工程前提。
链条四(对负结果的解释):推理 Agent 禁 wiki → 强制知识走技能通道。放开访问时任务解决知识直接从 wiki 流入轨迹,技能提炼的原料(轨迹中的程序性行为)反而稀薄——63.7→60.9 的下降量化了这条「知识泄漏」路径的代价。
链条五(对规模效应的解释):技能质量受模型发现能力上限约束。更强模型做根因分析、写程序性知识更强,故收益随规模增大(+12.3→+23.9);而执行侧,弱模型可能执行不了好技能(OfficeQA 4B 案例)。发现与执行是两种能力,规模增强前者、技能注入补后者。
七、必要知识反推
7.1 领域知识层
- 技能格式的生态现状:SKILL.md 约定、渐进披露、技能与 prompt 的区别——不知道格式就无法设计演化空间。
- 失败模式的实际形态:ALFWorld 的 take-examine-move 循环、SpreadSheet 的执行失败变通……作者显然读过大量轨迹才能设计模式页粒度。
- Karpathy 的 LLM Wiki 愿景:把经验编译为持久复利知识的原始思想来源。
7.2 方法论知识层
- 演化算法设计:验证门控、回滚、早停(验证集满分即停)、多次独立运行取平均——进化式搜索的标准防过拟合设施。
- 受控消融设计:2×2 的 wiki 访问矩阵,把「谁用知识」与「知识是否存在」解耦。
- 迁移实验设计:源模型 × 目标模型的技能迁移矩阵,才能发现负迁移与解耦现象。
7.3 工程知识层
- 文件系统即知识库:模式页用 markdown、编辑用增量 patch、影响追踪程序化追加——不引入数据库的简单可靠实现。
- ReAct 式按需读取:用 Agent 自主的 read_file 替代预采样塞上下文,解决长历史分析的可扩展性。
- 统计规范:三次独立演化 + 配对 bootstrap。
八、论文中可以提取的通用性灵感
8.1 在经验与能力之间加持久知识层(架构级)
核心思想:自动改进系统的输出(技能/配置/代码)应该有独立的中间知识层支撑——经验先编译成结构化知识,知识再孕育改进;知识层永不回滚,改进层可回滚。 论文证据:wiki 层贡献 +15.0 平均分;技能回滚 + wiki 持久的不对称设计让 3 次独立运行稳定复现收益。 推广场景:① 个人知识管理(经验→笔记→方法论);② 企业流程改进(事故报告→根因库→SOP);③ 自动化机器学习的元知识库;④ 开源社区的 issue 归档→维护者手册。
8.2 拒绝历史是资产不是垃圾(机制级)
核心思想:失败的尝试记录下来并暴露给后续决策者,能防止重复劳动并启发新方案——「此路不通」与「此路可通」同样有价值。 论文证据:skill-impact.md 记录每个提案的 diff、分数、接受/拒绝;案例中第 0 轮被拒提案直接塑造了第 1 轮被接受技能的形态。 推广场景:① 代码评审的 rejected PR 归档;② 实验追踪系统记录负结果;③ 产品 A/B 测试的失败实验库。
8.3 知识必须走正门,不能走后门(机制级)
核心思想:如果执行单元能直接查知识库,知识就不会沉淀为可复用能力,反而让经验提炼的原料变稀。 论文证据:推理 Agent 开 wiki 访问,最终技能质量 63.7→60.9。 推广场景:① 团队管理:员工事事查 wiki 则 SOP 永远建不起来;② 教育:直接给答案 vs 让学生把方法内化;③ RAG 系统与缓存的设计权衡。
8.4 发现能力与执行能力可以解耦交易(战略级)
核心思想:找到好方法的人未必是执行它最好的人——方法可以在能力谱上交易,但要注意低层变通的锁定效应。 论文证据:27B 技能让 9B 达 50.5%(自身 33.6%);4B 技能把 Gemini 打到 18.1%(负迁移)。 推广场景:① 大厂蒸馏小厂场景方法时的适配风险;② 专家系统的知识工程外包;③ 跨团队最佳实践移植的粒度设计(原则可迁移,微操不可)。
8.5 技能是与模型 scaling 互补的另一条曲线(战略级)
核心思想:程序性知识与模型能力是两种互补的性能来源;技能注入可让小模型越级,模型变强又放大的技能收益。 论文证据:收益随规模 12.3→17.5→23.9 递增;9B+技能超 27B 无技能。 推广场景:① 算力受限场景的替代性投资方向;② 模型产品化时「买更大模型」vs「养技能库」的决策框架;③ 长尾垂直领域的落地策略。
8.6 原子提案是小步安全的演化单位(工程级)
核心思想:自动演化系统的每步变更应小到可归因、可回滚,配上门控与影响追踪,形成完整的审计链。 论文证据:每轮一个原子技能提案、diff 级记录、验证集门控,PURPOSE.md 把每个技能锚回证据。 推广场景:① 自动化 prompt/配置优化;② 基础设施的渐进式发布;③ 任何自动改写自身代码的系统。