智能体技能演化(Skill Evolution & Self-Evolving Agents)领域综述
2026 年 6 月 arXiv 预印本 | 53 篇核心论文精读
一、方法论
语料与筛选
- 全量语料:2026-06 arXiv 预印本 11,930 篇元数据(
june2026_papers.jsonl),分类体系classifications_manual.jsonl(B01–B25 桶)。 - 关键词预筛:按 “skill / self-evolving / self-improving / evolve” 在标题+摘要中匹配,得 116 篇候选(
skill_abstracts.json)。 - 摘要精读分类:通读 116 篇完整摘要,分为 53 CORE(中心贡献是技能演化或自演化智能体)+ 54 ADJACENT(机器人/具身/领域特定自演化,技术可迁移)+ 9 EXCLUDED(纯视觉/评判器/对齐理论的误命中)。
- 全文获取:对 53 篇 CORE 下载 arXiv HTML 全文(44 篇)+ PDF 兜底转换(4 篇:OPD-Evolver/Safety/Red Queen Gödel/PACT)+ 已有全文 5 篇。
- 聚焦提取:每篇剥离导航目录与参考文献,提取「问题陈述+方法+关键公式+结论」(约 5–7K 字符/篇,共 ~94K token)。
- 分批精读:按主题分 7 批(技能库/图框架、RL 技能演化、harness 优化、经验记忆、技能创建蒸馏、理论安全选择、领域自演化),逐篇产出结构化提取(
skill_extract.jsonl,53 条,含 problems/formulas/approaches/techniques/key_finding)。 - 范式交叉验证:对 5 个最关键的新范式通过 anysearch 联网验证(PACE / Bayesian-Agent / Red Queen Gödel / Trellis / MMG2Skill)。
统计
- CORE 论文 53 篇(high 相关 45 / med 8)
- 提取公式条目 105 条(其中 69 条标注新贡献,作为新范式/新框架的形式化支撑)
- 提炼范式级新转变 16 个(5 个已联网验证)
- 提取技术条目 187 条
- 68/53 篇落在 B01(LLM_Agents)桶,其余分散在 B15/B05/B11 等
二、问题(共性 + 新颖)
2.1 全领域共性问题(多篇反复提出)
P1. 技能库增大后的选择退化。 技能一多,“选哪些/选几个/什么顺序"从相似度匹配退化为结构问题:技能间存在依赖、冲突、特化、重复关系,扁平嵌入检索看不见(SkillDAG、Generative Skill Composition、SkillComposer-06079、Online Skill Learning)。共同结论:全枚举(All Skills)会上下文膨胀且仅恢复小部分 headroom,检索召回不是瓶颈,per-task 选择质量才是。
P2. 技能创建与策略/部署脱节。 现有技能增强方法把技能创建与策略优化/harness 解耦,导致采纳的技能与演化中的策略冲突(ReSkill),或技能部署后因边缘情况/API 变更失效(SkillAudit、SkillHone、SkillChain)。共同诉求:技能演化必须是闭环的(创建→测试→精修→淘汰)。
P3. 自演化缺乏可靠接受/拒绝准则。 “分数上升就保留"的贪心 acceptor 是不控制的适应性多重检验,agent 自我 p-hacking(PACE);on-policy context-distillation 迭代导致性能退化(Rethinking Continual Experience);自演化会 rise-and-collapse(Self-Improvement Can Self-Regress,ADJACENT)。可靠性瓶颈在 acceptor 而非 proposer。
P4. 上下文/记忆无界膨胀。 add-only 技能库/记忆只增不减导致上下文爆炸(ISM 批评 Voyager、Recursive Self-Evolving、SkillPyramid)。共同方向:记忆/技能需有界、可验证、可淘汰。
P5. 外部化能力也外部化失败。 技能/SOP 可能是好工作流,也可能是脆弱 workaround、过时假设、任务特定补丁(Bayesian-Agent)。把成败当计数当信念不校准。
P6. 评测与训练集混淆。 自演化在固定离线基准上评测(Adaptive Auto-Harness),open-ended 流上分布漂移导致早期达峰后下降;缺乏可控可复现的演化过程评测(SEAGym)。
2.2 新颖问题(少数论文首次提出)
- 受控效用演化下的自改进保证(Red Queen Gödel):现有自改进搜索假设静态评估准则,但生物演化中物种适应随环境变化而变化;如何让评估成为改进回路的一部分而不 reward hacking。
- 技能保证(skill assurance) vs 技能创建(VASO):降低创建成本不解决更难的保证问题——生成技能语言合理却隐藏安全关键执行失败(Jackal person_observed 后仍移动)。
- 自演化引入的安全质变(Safety):把每个安全维度从"有界可预测"转为"开放式复合”——攻击从瞬时变持久(写入权重/记忆)、风险面扩张、攻击从线性变复合(经演化反馈环传播)、无不可变锚(含验证/防御逻辑都可变)。
- specification-generalization 困境(SkillComposer-06079):为特定任务定制的技能无法迁移,而过度抽象的技能指导力不足;缺乏显式的规范与泛化机制。
- guide-to-skill gap(MMG2Skill):Web 指南是多模态/含噪声/隐含人类执行者假设的,不能直接当技能;agent 需程序性接地(procedural grounding)。
- 个性化技能选择的隐式偏好(Decoupling Skill Selection):真实个人 agent 查询常技能无关(随机重复日常习惯),纯文本意图解析根本不足;最优技能受用户隐式偏好支配。
- 轨迹到技能非摘要问题(Workflow-to-Skill):轨迹碎片化、含偶然步骤、遗漏低频安全关键步骤;技能构造是恢复运行时规约而非摘要。
- 技能前沿随策略转移(daVinci-kernel):早期增益来自宽泛变换,后期集中在微妙紧耦合决策;早期技能知识在下一阶段无用。
- 过程性技能→可训练行为模块(Skill-to-LoRA):技能 SKILL.md 保留在 prompt 每步重读,token 成本高且与局部证据竞争。
三、新范式(领域级转变,交叉验证)
共提炼 16 个范式级新转变——即这个领域重新定义"技能演化该怎么看/怎么做"的根本方式(非具体方法)。范式 ≠ 解决思路:范式是领域级的视角/框架/问题定义的转移,思路是方法层面如何落地。下面按"取代了什么旧范式"组织;标 [✓已联网验证] 的为通过 anysearch 交叉确认原创性与首次提出。
3.1 重新定义"技能是什么"的范式(5 个)
范式① 技能即假设(Skill-as-Hypothesis) [✓2606.08348 已联网验证]
- 旧范式:技能是确定性、可复用的资产/知识,一旦创建就信任。
- 新范式:技能是"冻结模型在特定 prompt/context/harness 下是否成功"的概率假设,必须由验证轨迹的后验证据支撑,可被 patch/split/compress/retire/explore。agent 采样自 P(X|θ,C),技能演化是后验引导的 harness 优化而非不校准的 prompt 积累。
- 提出者:Bayesian-Agent(GitHub DataArcTech 确认 v0.5 默认 categorical 证据模型)。
范式② 技能即行为模块(Skill-as-Behavior) [2606.16769]
- 旧范式:技能是 prompt 中的运行时文本指令(SKILL.md),每步重读。
- 新范式:技能诱导的响应行为变化可建模为可学习函数,转为可动态加载的可训练行为模块(LoRA 适配器),技能特定对齐。
- 意义:技能从"模型读的文本"变为"模型加载的参数”。
范式③ 技能即结构化关系图(Skill-as-Graph) [2606.03056 / 2606.03692 / 2606.13317 / 2606.32025]
- 旧范式:技能库是扁平列表,选择靠嵌入相似度。
- 新范式:技能间存在依赖/冲突/特化/组合关系,建模为类型有向图/层次金字塔/可路由拓扑/有序序列,关系类型本身是 agent 可见语义。技能选择是"选哪些/选几个/什么顺序"的联合结构决策。
- 共识结论:全枚举(All Skills)会上下文膨胀且仅恢复小部分 headroom,检索召回不是瓶颈,per-task 结构选择质量才是。
范式④ 技能即多视角文档(Skill-as-Multimodal-Doc) [2606.29538]
- 旧范式:技能是单一文本说明。
- 新范式:技能是 (路径, 文本视图, 视觉视图, 代码视图, 元数据) 元组,三视图互补以支撑不同 backend 执行。
范式⑤ 技能即特权 vs 技能即候选上下文 [2606.29502]
- 旧范式:检索到的技能当特权标签直接信任。
- 新范式:技能是候选上下文,可能是过时假设/噪声补丁/误导建议,需信用分配区分有用/有害(双向自蒸馏)。
3.2 重新定义"如何接受自演化变更"的范式(2 个)
范式⑥ acceptor 优化范式(commit 即序贯假设检验) [✓2606.08106 已联网验证]
- 旧范式:自演化把全部精力投在 proposer(生成候选),acceptor 用"分数上升就保留"的贪心启发式(不控制的适应性多重检验=自我 p-hacking)。
- 新范式:可靠性瓶颈在 acceptor 而非 proposer;commit 当序贯假设检验,testing-by-betting e-process 跨过 E≥1/α 才提交,optional stopping 下控制 per-decision false-commit 概率。
- 这是本批最反直觉的范式转变:不是让 agent 改得更多,而是让 agent 改得更克制。
范式⑦ 自演化稳定性作为独立研究对象 [2606.21090 / 2606.21089 / 2606.04703]
- 旧范式:默认自演化=单调改进。
- 新范式:自演化会"rise-and-collapse"——迭代 on-policy context-distillation 导致退化、持续 DPO 产生"科学失忆"、自训练可自我回归。稳定性(是否真改进还是噪声/退化)需独立 held-out 选择/anytime-valid 机制保证。
3.3 重新定义"评估/反馈回路"的范式(3 个)
范式⑧ 共演化评估 / 受控效用演化(Evaluation-as-Search) [✓2606.26294 已联网验证]
- 旧范式:自改进搜索假设静态评估准则(固定验证器/基准/标注)。
- 新范式:物种不优化静态环境而是随环境共演化;评估器纳入搜索回路,效用可在 epoch 边界更新(epoch 内固定保证 per-epoch 自改进成立),bar rises as agent climbs;exploitation 经 hack ratio 检测后收紧,选择性擦除失效旧评估器记录。
- 提出 PyPI rqgm 包印证。
范式⑨ 经验图即数据库状态(Experience-as-Database) [✓2606.29823 已联网验证]
- 旧范式:agent 搜索经验是临时日志/JSON checkpoint,崩溃即失、不可跨会话查询。
- 新范式:经验图是一等、受治理、可查询的数据库状态。前沿选择=查询、跨会话复用=向量种子图检索、训练数据提取=物化视图、重构过去所知=时间旅行查询。DB 拥有经验图后,agent 变无状态 serverless,崩溃恢复/横向扩展/闭环训练 flywheel 成为架构副产品。
- 提出:Meta+UMD(Trellis),“logs made databases reliable; experience graphs may make agents cumulative”。
范式⑩ 无 ground-truth 技能演化(Ground-Truth-Free) [2606.14239 / 2606.01993]
- 旧范式:技能演化依赖特权反馈(held-out 分/隐藏测试/环境奖励)。
- 新范式:配对轨迹审计(有/无技能对比隔离影响)、score-free 更新(从不读基准分,仅用轨迹级根因反馈)——从业者只有任务描述与工作空间数据时仍能演化技能。
3.4 重新定义"技能来源/获取"的范式(4 个)
范式⑪ guide-to-skill learning 作为新问题形式化 [✓2606.01993 已联网验证]
- 旧范式:技能靠人工编写或纯 agent 探索发现。
- 新范式:首次把"将野外语指南(多模态/含噪声/隐含人类执行者假设)转为 agent 可执行技能"形式化为独立问题 guide-to-skill learning,并提供首个基准 MMG2Skill-Bench。强调程序性接地(procedural grounding)而非简单摘要。
范式⑫ 形式验证即技能演化反馈(Assurance-as-Evolution-Feedback) [2606.05395]
- 旧范式:形式验证只验证一次性计划/调优 planner prompt/微调权重;技能创建与技能保证不区分。
- 新范式:技能保证(skill assurance)独立于技能创建;形式反例成为可复用技能契约的优化反馈(textual gradient),闭合形式验证与自演化技能的回路。
范式⑬ 失败驱动自改进(Failure-as-First-Class-Signal) [2606.31270 / 2606.07412]
- 旧范式:从成功轨迹学习。
- 新范式:failure-case loop——失败轨迹被结构化为可复用行为改进;LLM 元控制器诊断失败模式→合成定向推理时策略;轨迹蒸馏为结构化技能引导定向任务生成。
范式⑭ 协同演化取代解耦(Co-Evolution Mainstream) [2606.01619 / 2606.16497 / 2606.30185 / 2606.14249]
- 旧范式:技能创建与策略优化/harness/工具各自独立优化。
- 新范式:技能-策略(ReSkill GRPO)、技能-工具(Dynamo C=(S,T))、agent-评估器(Red Queen)、技能-harness(HarnessX/Bayesian-Agent)均强调协同演化闭环而非解耦。技能前沿随策略改进从简单向复杂转移。
3.5 重新定义"系统/部署"的范式(2 个)
范式⑮ harness 即一等工程对象(Harness-as-First-Class-Object) [2606.14249 / 2606.01770]
- 旧范式:harness(提示/工具/记忆/控制流)是手工静态脚手架,每个新模型/任务需定制。
- 新范式:harness 是可组合(替代代数组装类型化原语)、可适应(轨迹驱动演化引擎)、可演化(闭合 harness-模型回路)的一等对象;open-ended 流上用 harness 树+任务级路由而非单一密集更新。
范式⑯ 联邦技能演化(Federated Skill Evolution) [2606.03143]
- 旧范式:跨用户协作靠轨迹共享(损害隐私)或统一全局库(忽视客户端异构)。
- 新范式:通信单元是语义技能 diff(结构补丁 add/edit/delete)而非原始轨迹;服务器聚合时建模客户端特定能力边界,促成个性化而非全局平均。
3.6 范式间的内在主线
这 16 个范式并非孤立,可归为 4 条主线:
- 从"确定性资产"到"概率假设"(①②⑤):技能不再被无条件信任,需证据/对齐/信用支撑。
- 从"proposer/创建"到"acceptor/保证/治理"(⑥⑦⑩⑫):重心从"造更多技能"迁移到"度量/约束/验证/治理技能"。
- 从"扁平/静态"到"结构/共演化"(③⑧⑭):技能关系结构化、评估共演化、技能-策略-工具-评估器协同。
- 从"临时状态"到"持久治理资产"(⑨⑯):经验/技能成为可治理、可查询、可联邦的持久机构资产。
四、解决思路(特别是新出现的)
4.1 范式级新思路(最重要的迁移)
从"扁平检索"到"结构化关系建模"(SkillDAG、SkillPyramid、Generative Skill Composition、SkillCAT-TTE):技能选择不再是相似度匹配,而是图/树/序列的结构问题。关系类型(依赖/冲突/特化)提升为 agent 可见语义。
从"技能当标签"到"技能当假设"(Bayesian-Agent、UCOB):技能不是特权标签,而是"模型在此条件下是否成功"的假设,需后验证据支撑,可被 patch/split/compress/retire。
从"proposer 优化"到"acceptor 优化"(PACE):自演化可靠性瓶颈在是否 commit 的准则,而非生成候选;用序贯假设检验替代贪心。
从"静态评估"到"共演化评估"(Red Queen Gödel、Adaptive Auto-Harness):评估器随 agent 共演化,bar rises as agent climbs;把评估纳入搜索回路。
从"运行时文本指令"到"可训练行为模块"(Skill-to-LoRA):技能从 prompt 中的 SKILL.md 转为动态加载的 LoRA 适配器。
从"原始轨迹共享"到"语义技能 diff"(FederatedSkill):联邦演化通信单元是结构化补丁(add/edit/delete)而非轨迹,隐私+个性化。
从"形式验证一次性计划"到"形式反例作技能演化反馈"(VASO):形式反例→textual gradient→更新可复用技能契约。
从"经验即日志"到"经验即数据库状态"(Trellis):经验图所有权从 agent 进程移到 DB,agent 变无状态 serverless。
从"add-only 库"到"有界可验证治理"(ISM、Recursive Self-Evolving):技能库需验证/合并近重复/淘汰过时策略,保持有界。
从"单一全局库"到"harness 树+任务级路由"(Adaptive Auto-Harness):开放式流上用 harness 树按任务路由,而非单一密集更新。
4.2 共性解决思路
- 闭环演化(创建→测试→精修→淘汰)几乎被所有技能演化论文采纳:ReSkill、SkillAudit、SkillHone、SkillChain、SkillCAT、Socratic-SWE、daVinci-kernel。
- 训练无关 vs 训练式两路线:约 60% 论文保持模型权重冻结(SkillDAG/Bayesian-Agent/SkillCAT/SkillAudit/PACE),靠技能/harness/记忆演化;约 40% 引入训练(ReSkill-GRPO、UCOB-CBSD、Skill-to-LoRA、daVinci-RL、SkillComposer-SFT)。
- 双权限/隔离评估防泄漏:SkillHone(优化侧仅见编辑报告)、SkillAudit(结构验证器回滚)。
- 人在环路 hook 仅在历史信号缺失时触发(Adaptive Auto-Harness)。
五、技术(特别是新出现的)
5.1 新生技术力量(最具迁移价值)
testing-by-betting e-process 提交门(PACE):anytime-valid 序贯假设检验 + McNemar discordant pairs,控制 false-commit 概率。可直接迁移到任何自演化/自训练系统的候选接受。
贝叶斯证据层 + 五动作决策规则(Bayesian-Agent):categorical/Beta-Bernoulli 后验映射到 patch/split/compress/retire/explore,保守且可审计。
受控效用演化 + 选择性擦除 + hack ratio(Red Queen Gödel):epoch 内固定、边界更新、exploitation 检测收紧容差。
类型化技能关系图 + agent 可调用检索接口(SkillDAG):五类有向边 + propose-then-commit 协议 + 无环/非矛盾/append-only 约束。
UCB 技能检索 + 信用感知双向自蒸馏(UCOB):区分技能有用/有害,CBSD 把高回报视图蒸馏到相反上下文。
GRPO 组内技能版本受控比较 + Thompson Sampling(ReSkill):利用 GRPO 组结构嵌入技能创建/比较/选择三机制。
约束自回归技能序列解码(Generative Skill Composition):冻结编码器 + 3.9M 解码器,TF-IDF 先验 + 集合成员信号融合。
形式反例→textual gradient→技能契约更新(VASO):闭环形式验证与自演化技能。
配对轨迹审计 + 过程对齐对比评估(SkillAudit):无 ground truth 下用有/无技能对比隔离技能影响。
语义技能 diff 联邦演化(FederatedSkill):add/edit/delete 结构补丁 + 服务器个性化聚合。
技能→LoRA 适配器动态加载(Skill-to-LoRA):行为中心表示,技能特定适配器对齐。
经验图即数据库(Trellis):物化视图 + 时间旅行查询 + 向量种子图检索,agent 无状态。
on-policy 蒸馏 evolver(OPD-Evolver):快慢双循环 on-policy 对齐记忆维护。
双过程认知记忆(Memory Beyond Recall):System1 同步 writer + System2 夜间异步归纳,确定性读路径。
5.2 共性技术
- MMR 重排(Online Skill Learning)、UCB 探索(UCOB)、Thompson Sampling(ReSkill)用于技能选择探索-利用平衡。
- 拒绝采样 SFT(SkillComposer-06079)、GRPO(ReSkill/HarnessX)、自蒸馏(UCOB)用于训练式演化。
- LLM-as-judge(Tree-of-Experience 可用性判断、SkillChain 双路评估、daVinci 代码审查器)广泛用于无 ground-truth 反馈。
- 拓扑/图结构(SkillDAG 图、SkillPyramid 金字塔、SkillCAT 拓扑路由、Trellis 经验图)成为技能组织主流。
- MCP 中介的 browse-select-execute(Resource2Skill、Agent libOS)用于跨 backend 技能执行。
5.3 新兴失败模式分析技术
- strained coherence / pre-failure signal(ADJACENT 论文):自演化相变前兆检测。
- selective erasure(Red Queen Gödel):评估器替换时失效旧记录。
- 配对审计 + 结构验证器回滚(SkillAudit):防有害更新。
- held-out 选择(Recursive Self-Evolving):递归自演化的稳定性保证。
六、关键发现与趋势
技能演化正形成独立子领域:53 篇 CORE 论文覆盖技能库/图组织、RL 演化、harness 优化、经验记忆、技能创建蒸馏、理论安全、领域应用全栈,与 Agent Memory 互补但聚焦"可执行过程性能力的积累与治理"。
重心从"创建更多技能"迁移到"度量/约束/验证/治理技能":acceptor 可靠性(PACE)、技能保证(VASO)、技能当假设(Bayesian-Agent)、安全质变(Safety);16 个范式级新转变归纳为 4 条主线(确定性资产→概率假设、proposer→acceptor、扁平→结构共演化、临时状态→持久治理资产)。
结构化表示胜过扁平相似度:类型图(SkillDAG)、金字塔(SkillPyramid)、序列预测(Generative Skill Composition)、拓扑路由(SkillCAT)一致表明技能间关系结构是选择质量的关键。
共演化是主线:技能-策略(ReSkill/daVinci)、技能-工具(Dynamo)、agent-评估器(Red Queen Gödel)、技能-harness(Bayesian-Agent/HarnessX)均强调协同演化而非孤立优化。
自演化的稳定性是新前线:rise-and-collapse 失败模式(Self-Improvement Can Self-Regress)、on-policy 蒸馏退化(Rethinking Continual)、p-hacking(PACE)揭示自演化会自信地退化,需 anytime-valid/held-out/遗憾分解等机制保证。
领域扩散显著:从 SWE(Socratic-SWE/AgRefactor)、数据分析(EvoDS/DataCOPE)、科学发现(fluid control/biological protocols)到 GPU 核优化(daVinci/Trellis)、金融(Tree-of-Experience/FinAcumen)、法律(Parthenon/Closing the Loop),技能演化范式跨域迁移。
警觉点:自演化 agent 无不可变锚(含验证/防御逻辑都可变),攻击经演化反馈环复合传播(Safety);技能前沿随策略转移使早期知识失效(daVinci);外部化能力也外部化失败(Bayesian-Agent)。
七、局限
- 53 篇 CORE 逐篇读全文聚焦段(问题+方法+结论),参考文献与完整实验细节未全读;ADJACENT 54 篇仅读摘要补充技术。
- 3 个核心新公式已联网验证,其余 66 条"新贡献"公式基于全文 Eq. 编号自述,未逐一联网核验。
- MathML 渲染的部分行内公式可能丢失,公式表述以文本上下文 + 验证为准。
- 116 篇预筛基于关键词,可能遗漏标题/摘要未用"skill/evolve"但实质相关的论文(如纯 RL continual learning)。
八、输出文件
outputs/skill_evolution_analysis.md(本报告)work/skill_extract.jsonl(53 篇 CORE 结构化提取,problems/formulas/approaches/techniques/key_finding)work/skill_classify.txt(116 篇分类:53 core / 54 adjacent / 9 excluded)work/skill_core_ids.txt(53 篇 CORE arXiv ID)work/fulltext/(53 篇全文 txt)work/focus2/(53 篇聚焦提取)