论文链接:arxiv.org/abs/2608.12486 发表时间:2026年8月(arXiv:2608.12486v1,2026年8月12日提交) 机构:佐治亚理工(Georgia Institute of Technology)+ Cisco Research(企业与高校合作,受 DARPA SciFy 项目 Award No. HR001125C0302 及 Cisco Systems 资助) 领域标签:大语言模型自我改进、技能进化、提示优化、进化计算、Agent 持续学习


一、论文背景

1.1 冻结模型的"失忆症"

大语言模型(LLM)的能力已经很强,但它们在部署之后的行为几乎是静态的。一个模型今天在某道数学题上摔了跟头,明天遇到同类型的题,大概率还会以同样的方式摔倒——因为部署后的经验不会改变它的参数,也不会自动沉淀给未来的查询。论文开篇就点出这个痛点:模型无法在部署后保留经验。

想让它"长记性",传统路子是微调(SFT、强化学习等参数更新方法)。但微调有三个越来越现实的门槛:

  • 需要拿到模型权重:而如今许多强模型只能通过 API 访问,权重根本不可得;
  • 需要大量算力和训练基础设施:每一次"学点新东西"都要重跑一套训练管线;
  • 需要精心设计的训练流程:学习率、数据配比、验证门控,缺一不可。

于是论文提出一个互补性问题:一个冻结的(frozen)语言模型,能否通过把经验转化为持久的自然语言技能来实现自我改进?注意这里的严格设定——同一个冻结模型既要解题,又要解读验证器反馈,还要修改自己的知识,全程没有更强的教师模型帮忙。

1.2 Skill 是什么

论文中的 Skill(技能) 是一段紧凑的自然语言文本工件,插入模型上下文后指导后续推理。它编码四类可复用知识:

  • 可复用的推理流程:先做什么、后做什么、用什么表示方法;
  • 验证策略:中间步骤怎么自查、最终答案怎么核对;
  • 常见失败模式:这类题容易在哪里栽跟头;
  • 输出约束:答案格式、必须遵守的输出契约。

这就像给一位聪明的通才员工发"岗位操作手册"——人没变(参数冻结),表现却能质的飞跃。与权重更新相比,技能还人类可读、可编辑、可回滚、可跨模型迁移。

1.3 为什么自我改进很难:三大挑战

论文分析了这个设定下的三个关键挑战,这也是理解 DIVE 设计的钥匙:

**挑战一:自我修订天然带噪声。**模型自己给自己改技能,一次局部有利的编辑可能删掉有用指导、过拟合于少量失败样本、或者放大一次错误的反思。贪心地只维护一个候选不断打磨,非常脆弱。

**挑战二:经验很快超出上下文预算。**演示、轨迹、反馈不断累积,不可能无限追加,必须蒸馏成紧凑、可复用的抽象。

**挑战三:技能进化是路径依赖的。**不同的初始技能、采样到的经验、修订轨迹会导向差异巨大的解。只维护单一进化轨迹,可能过早丢弃有希望的备选方案,或收敛到次优解。

1.4 前作的过拟合问题

在 DIVE 之前,技能/提示优化方向已有代表性工作(如 SkillOpt、GEPA),它们的共同做法是沿单条轨迹打磨一份技能文档:反复执行、反思、修订同一个候选。论文一针见血地指出:自然语言技能进化本质上是一个随机、非凸的搜索过程——单轨迹优化很容易过拟合于采样到的经验,或者收敛到次优解。这就像深度学习训练中只跑一个随机种子的单次实验:结果好坏全凭运气,方差极大。DIVE 的核心洞察是:既然搜索是随机的,就用多样性来对冲方差。


二、论文定位和关联工作

DIVE 位于"用自然语言上下文适配冻结模型"这条研究脉络的最新节点。理解它的位置,需要看四个谱系:

2.1 四条研究谱系

谱系一:提示优化。MIPROv2 用贝叶斯优化联合搜索指令与示范组合,GEPA 用自然语言反思加帕累托候选选择做进化式提示优化。它们的目标是"找到一条更好的提示",本质仍是单提示搜索。

谱系二:经验与记忆学习。Experience RAG 把历史轨迹存入检索库,测试时取相似经验放进上下文;ExpeL 从成败轨迹提取自然语言规则。它们关注经验如何存储与检索,不把技能获取当优化问题。

**谱系三:技能优化。**Direct Skill Generation 一次性生成任务级技能;SkillOpt 把技能文档当可训练状态,沿单轨迹做结构化编辑——这是与 DIVE 最直接的对照,DIVE 相当于把"单轨迹打磨"升级为"多种群进化 + 互补选择"。

**谱系四:推理时方法。**SC 多次采样投票、ToT 树搜索,在推理时花更多算力换准确率,但不从经验学习、不积累持久资产。

2.2 关联工作对比表

方法优化对象轨迹结构是否需要权重持久资产核心局限
SC / ToT无(推理时搜索)—否无只花算力,不积累经验
Experience RAG检索库—否轨迹库只存取,不优化知识
ExpeL自然语言规则单次提取否规则库一次性提取,无迭代优化
MIPROv2指令+示范单轨迹(贝叶斯优化)否一条提示过拟合验证集风险
GEPA提示单轨迹(反思进化)否一条提示单轨迹易过拟合/次优收敛
SkillOpt技能文档单轨迹(结构化编辑)否一份技能同上
SFT / GRPO模型权重梯度训练是权重需权重与训练设施,成本高
DIVE技能种群K=10 独立多种群否≤M=10 互补技能集推理时多次调用(成本约为零样本 11 倍)

论文在相关工作一节中明确划出了差异:EvoPrompt 等进化式提示方法虽然也维护种群,但多样性主要用于搜索出强的单个个体;而 DIVE 把多样性作为端到端的设计原则——从独立 bootstrap 的进化轨迹、异构变换算子,一直保留到推理时使用的互补技能集。这是"用多样性找最优解"与"用多样性本身作为最终资产"的本质区别。


三、问题定义

3.1 形式化设定

论文的设定干净利落。给定问题 $x$,冻结模型 $f_\theta$ 产生回答 $f_\theta(x)$;一个能访问金标答案 $y$ 的外部验证器返回二值分数:

$$r(x, y, f_\theta(x)) \in \{0, 1\}$$

注意一个关键细节:验证器不提供自然语言批评,只给对/错标签(可能附带格式违规、执行失败、超时等结构化诊断信号)。这意味着"从失败中学到什么"完全要靠模型自己反思,不能指望外部老师解释。

任务分布 $T$ 上冻结模型的性能为 $V_T(f_\theta) = \mathbb{E}[r]$。目标是在 $\theta$ 固定的前提下提升该性能。技能 $s$ 的性能类似定义为 $V_T(s)$,即模型以 $s$ 为条件的期望正确率。自我改进的闭环是:

  1. 执行技能得到带验证标签的轨迹集 $E(D; s)$;
  2. 同一个模型提出修订 $s' = \text{UpdateSkill}_{f_\theta}(s, E(D;s))$;
  3. 循环往复。

3.2 抽象:自然语言空间中的非凸随机搜索

论文最重要的一个思想升维是:把冻结模型自我改进视为自然语言空间中的非凸随机搜索。

在这个视角下,技能空间是一个巨大而崎岖的搜索空间:每条技能是一个"点",修订算子定义了"移动方向",验证器反馈是"目标函数"的带噪观测。这个空间显然非凸——不同的解题策略(坐标法 vs 组合恒等式、约束传播 vs 回溯搜索)是不同的"盆地";搜索又是随机的——同样的起点,采样到不同的经验子集、生成出不同的修订,就会走出完全不同的轨迹。

既然是非凸随机搜索,优化理论里两个经典结论就直接适用了:

  • 单点迭代(爬山)易陷入次优盆地——对应单轨迹提示优化的过拟合;
  • 多样本并行搜索 + 选择(种群方法)能显著降低陷入次优解的概率——对应 DIVE 的多种群设计。

3.3 类比对偶表

论文虽未明说,但其设计处处可与生物进化、深度学习训练对偶,这张对偶表能帮助初学者建立直觉:

维度生物进化深度学习训练DIVE 技能进化
搜索空间基因组参数空间自然语言技能空间
个体生物个体一组参数一条技能文本
种群地理隔离的种群多随机种子并行实验K=10 个独立 bootstrap 的技能种群
变异基因突变/重组梯度步/数据增广四种异构进化算子
适应度环境存活率验证集准确率反思集上的正确率 U(s)
资源分配—学习率/数据调度UCB 在算子间分配预算
精英保留自然选择检查点选择联合选择 ≤M=10 互补技能
表型融合—集成/权重平均推理时候选生成+排序

四、问题解法

DIVE 的方法论由五个环环相扣的组件构成,整体流程是:数据划分 → 多种群独立进化 → 共享验证集联合选择 → 推理时候选排序。

4.1 数据划分与多种群独立构造

每个数据集划分为进化集 $D_{evo}$(实现中取 1000 个训练样本)与验证集 $D_{val}$,测试集严格隔离。对每个种群 $k \in [K]$(实现中 K=10),独立(有放回 bootstrap)采样两个子集:

  • 经验子集 $D_{exp}^{(k)}$(占 $D_{evo}$ 的 5%):提供带验证标签的轨迹,供提取任务知识;
  • 反思子集 $D_{ref}^{(k)}$(占 10%):用于评估候选技能、诊断失败、指导后续修订。

两个子集角色分离,保证"学知识的料"和"考试改卷的题"不混用。每个种群从经验子集蒸馏出 3 条种子技能:一条最小种子(只含任务描述与输出约束)、一条解法构造种子(强调成功推理流程)、一条诊断验证种子(强调失败模式与自查策略)。不同种群虽然优化同一目标,但 bootstrap 子集和进化轨迹不同,天然长出不同的推理程序——这就是用独立性降方差。

理论部分给出了简洁的概率论证:若每个种群以概率 $q_\epsilon$ 独立发现一条低风险技能,则 K 个种群至少发现一条的概率为 $1-(1-q_\epsilon)^K$——随 K 增大而提升(边际收益递减)。

4.2 异构进化算子:四种探索偏见

每个种群维护一个算子组合,初始为四种(论文称每个算子诱导一种特定的归纳偏见):

算子父母数偏向的父代作用类比
反思修复 Reflective Repair1高性能技能(按 U(s) 采样)局部修订系统性失败,保留有用指导精细梯度步/局部爬山
探索性修订 Exploratory Revision1低性能技能(按 1−U(s) 采样)彻底换一种解题策略、分解或推理路径大步长突变/跳出盆地
压缩 Compression1长度超过 4096 token 的高性能技能删除冗余、过度具体与冲突的指导正则化/剪枝
双亲重组 Recombination2强父代 + 互补父代(λ=0.5 平衡个体性能与边际覆盖)综合两个父代的优势知识基因重组/交叉

这套设计的精妙处在于算子与父代选择的耦合:反思修复专挑好学生改小毛病,探索性修订专挑差学生推倒重来,压缩只处理超长技能(无超长技能则该算子本轮不适用),重组的第一个父代按性能采样、第二个父代按"边际覆盖"(解出第一个父代解不出的题的比例)采样。四种算子覆盖了"精修、重构、瘦身、杂交"四种正交的探索方向。

4.3 UCB 预算分配与算子自适应生成

每个种群的进化预算为 B=10 步。每步先用 UCB(置信上界)规则选算子:

$$UCB_a(t) = \hat{\mu}_a(t) + \beta\sqrt{\frac{\log t}{N_a(t)}}$$

其中 $\hat{\mu}_a(t)$ 是算子 $a$ 的历史平均父母相对奖励(子代提升减去最强父代的提升,$R_\tau = U(s'_\tau) - \max_{s \in P_\tau} U(s)$——与最强父代比较,防止"打赢弱父代白拿奖励"),β=0.3。第一项利用经验证明多产的算子,第二项继续试探观察不足的算子。

在预设的第 $t_{new}=8$ 步,还会触发算子自适应生成:把累积的进化历史(选过哪些算子、改了什么、得了多少奖励)压缩成结构化摘要,让模型针对"现有算子组合覆盖不足的失败模式"生成 1 个新算子(含名称、父母数、变换指令的 JSON 规格),加入算子池按同样 UCB 规则参与竞争。连"怎么变异"本身也在进化。

论文的理论分析特别诚实:由于奖励分布随种群演化非平稳,作者不宣称标准 bandit 的遗憾界保证,而是把 UCB 定位为"有限预算下的实用分配规则"——把提案集中在经验上多产的机制上,又不过早淘汰探索不足的备选。

4.4 联合选择:把多样性变成互补覆盖

K 个种群各自进化完毕后,所有候选技能在共享验证集 $D_{val}$ 上评估。这里 DIVE 做了一个与常规做法不同的选择:不是按单技能性能排序取 Top-M,而是按技能集整体的端到端效用(含候选生成与排序管线)做贪心构造:

  1. 每个种群先按单技能验证性能保留 Top-3,形成候选池;
  2. 贪心逐个加入使整体验证效用边际提升最大的技能;
  3. 约束:最终集合至多 M=10 条,且每个种群至多贡献 1 条;
  4. 边际提升非正或达到 M 即停止。

为什么必须联合选择?理论部分给出漂亮的分解:聚合准确率 = oracle 覆盖率(至少一个候选正确的概率)− 选择遗憾(有正确候选却选错的概率)。一条单打独斗成绩平平的技能,如果它解的题恰好是其他技能都解不出的题,它的边际覆盖就很大。互补性只能以集合为单位度量——这是消融实验中联合选择(56.6)显著优于 Top-M 单技能排序(54.1)和随机选择(49.3)的原因。

4.5 推理时候选排序

测试时,最终技能集中的每条技能独立生成一个候选解;HMMT 上对候选做多数投票,其余任务把全部候选(不含冗长推理过程)放进一次列表式排序调用,由同一个冻结模型基于推理有效性、答案一致性与约束遵守度选出最终答案。排序流程在验证集上固化,测试时不接触测试标签。

4.6 机制总表

组件机制解决的挑战对应理论量
多种群 bootstrapK=10 独立经验/反思子集路径依赖、单轨迹次优收敛候选池覆盖 $1-(1-q_\epsilon)^K$
异构算子四种正交变换偏见修订噪声、探索不足有用提案质量
UCB 分配β=0.3 置信上界有限预算分配非平稳 bandit 实用规则
算子生成第 8 步从进化史生成新算子固定组合覆盖不足扩展提案支撑
联合选择贪心边际提升 + 每种群至多 1 条互补性无法单技能度量oracle 覆盖 − 选择遗憾
候选排序独立生成 + 列表排序/投票单技能可靠性上限选择遗憾控制

五、评估指标与实验证据

5.1 基准与设置

六个基准:HMMT(高中数学竞赛,训练集 1200 题来自 NuminaMath-1.5,评测用 MathArena 2025 年 2 月与 11 月合集)、Equational Theories(magma 等式蕴含判定,400 评测题)、Sudoku / Cryptarithm / Calcudoku / Futoshiki(均来自 SynLogic,逻辑任务用 hard 子集)。基线覆盖:推理时方法、经验记忆方法(Experience RAG、ExpeL)、技能学习方法、提示优化方法,另在 Qwen3-8B 上对比 SFT(LoRA)与 GRPO。

5.2 主结果:完整数据表

模型方法HMMTEq.TheoSudokuCrypt.Calc.Futo.平均
GPT-5-nanoZero-shot64.356.571.720.130.470.852.3
Few-shot63.359.577.025.526.269.153.4
SC80.159.186.548.949.182.767.7
ToT74.362.392.855.168.493.174.3
Experience RAG55.064.074.123.828.567.552.2
ExpeL60.161.677.226.737.075.456.3
SkillOpt66.359.182.629.939.880.459.7
MIPROv259.055.275.124.434.774.553.8
GEPA61.356.078.625.631.877.255.1
DIVE (M=1)74.360.185.828.236.878.760.7
DIVE (M=10)82.964.596.061.584.899.281.5
DeepSeek-v4-flashZero-shot75.843.777.070.884.691.273.9
SC90.165.093.190.090.392.586.8
ToT86.753.595.091.293.193.185.4
SkillOpt82.255.382.079.692.795.181.2
GEPA74.050.878.977.291.493.177.6
DIVE (M=10)93.391.599.199.097.997.896.4
Qwen3.5-27BZero-shot82.565.651.550.548.359.459.6
SC85.062.570.475.260.160.669.0
ToT83.565.885.680.369.891.479.4
SkillOpt93.184.259.057.455.666.969.4
GEPA92.582.554.452.150.062.465.7
DIVE (M=10)95.290.185.382.572.690.786.1

几个关键读数:

  • GPT-5-nano:DIVE 平均 81.5,比 zero-shot(52.3)提升 29.2 分,超最强基线 ToT(74.3)7.2 分,超 SkillOpt(59.7)21.8 分;
  • DeepSeek-v4-flash:DIVE 96.4,超 SC(86.8)9.6 分——尤其在 Equational Theories 上从基线最高 65.0 跃至 91.5;
  • Qwen3.5-27B:DIVE 86.1,超 SkillOpt(69.4)16.7 分。值得注意的是 SkillOpt 与 GEPA 在数学任务上很强(93.1/92.5)但逻辑任务崩掉(Calcudoku 仅 55.6/50.0),DIVE 全线均衡——这正是"互补技能集"覆盖不同题型的直接体现;
  • DIVE (M=1) vs (M=10):单技能版只有 60.7/81.9/71.7,说明收益大头来自多技能互补,而非某条"超级技能"。

5.3 小模型 + 技能 vs 大模型:成本对比

配置调用次数输入 token输出 token每题成本平均准确率
GPT-5-nano (Zero-shot)1.0170.119,609$0.00852.3
GPT-5-nano (DIVE)10.933,811216,834$0.08881.5
GPT-5 (Zero-shot)1.0170.115,389$0.15476.5
GPT-5 (Few-shot)1.04,96614,675$0.15379.8

GPT-5-nano + DIVE(81.5)超过 GPT-5 few-shot(79.8),同时每题推理成本从 $0.154 降到 $0.088,降低 42.5%。“给小模型配技能手册"比"直接买大模型"又准又便宜——这是论文最具商业说服力的一张表。

5.4 跨模型迁移

执行模型Zero-shotDIVE(9B 技能)DIVE(本模型技能)
Qwen3.5-9B27.256.6—
Qwen3.5-27B59.681.286.1
DeepSeek-v4-flash73.990.596.4

为 9B 小模型进化的技能,直接搬到同家族 27B 上平均 81.2、搬到异家族 DeepSeek 上 90.5,均大幅超越零样本。技能编码的是任务层面的可复用知识而非模型私有怪癖;面向目标模型定制进化还能再赚一截。

5.5 消融实验

技能集构造策略(Qwen3.5-9B,K=10、M=10):零样本 27.2 → 最优单技能 37.2 → 随机选 M 条 49.3 → 按单技能性能 Top-M 54.1 → 联合选择 56.6。每一级提升都验证了"集合互补性"的价值。

进化策略消融(图 4):单算子 < 多算子均匀分配(M-Unif)< 多算子 UCB 分配(M-UCB)< 完整方法(含算子生成)——四级递进,逐项拆解了算子多样性与自适应分配的各自贡献。

其他超参:技能集大小从 1 到 10 性能总体上升并逐渐饱和(图 3);种群进化预算 B 越大越好但边际递减(图 5);UCB 系数 β 与父代采样温度 τ_p 都呈"中间最优"的倒 U 形曲线(图 6、7),过小则多样性不足、过大则分配发散。

优化效率(图 1):在 Qwen3-8B 上随 rollout 数增长,DIVE 快速爬升,SFT 与 GEPA 在明显更低的水平早早平台化,GRPO 缓慢追赶但需要多得多的 rollout——无参数更新的文本空间优化反而有更好的性能—预算权衡。


六、效果优势的根源解释

DIVE 的优势不是魔法,可以拆成一条清晰的因果链。

6.1 单轨迹优化的病理

GEPA、SkillOpt 这类方法沿单轨迹优化一份技能,其失败模式有二:过拟合采样经验——反思子集就那么几十道题,反复对着它们打磨,技能记住了这批题的解法细节而非泛化原理;次优收敛——初始技能落进哪个"盆地”,之后的小步修订很难跳出去。论文附录里学到的技能恰好提供了反面证据:不同种群的技能收敛到共享的问题求解工作流(都会"字面解析→选择表示→先推导后代入→局部审计→全局审计→装箱"),但各自强调互补的解法策略与不同的错误来源——单轨迹只能占有其中一个视角。

6.2 DIVE 的三重解药

**解药一:多种群 bootstrap 降方差。**独立采样的经验子集意味着各种群"见过的事故"不同,理论上一系列独立尝试中至少一个找到低风险技能的概率随 K 指数级逼近 1。这直接对冲了"采样运气"这个最大方差来源。

**解药二:异构算子 + UCB 提高搜索效率。**论文理论部分定义了"有用提案质量"(useful proposal mass):一个算子的价值不在于平均产出的子代多强,而在于它把多少概率质量放在"超越自己最强父代"的修订上。四种算子在不同搜索状态下各有所长——强技能待精修时反思修复多产,现有策略共享同一失败模式时探索性修订更值钱,互补技能出现后重组才有用武之地。UCB 恰好把有限预算动态配置给当前状态下多产的机制。

**解药三:联合选择把轨迹多样性转译为实例级覆盖。**oracle 覆盖率的分解表明:一条技能的价值 = 它在"其他技能都失败的那些题"上的正确率。每个种群至多贡献一条技能的约束,强制最终集合保留不同盆地的解法。Qwen3.5-27B 上 SkillOpt 数学强逻辑崩、DIVE 全线均衡的现象,就是覆盖扩大的直接证据——十条互补技能像十位特长不同的专家会诊,各自负责自己擅长的题型。

6.3 反事实验证

消融实验提供了完整的三段反事实:去掉互补选择(M=1),GPT-5-nano 从 81.5 掉到 60.7;去掉联合选择改用单技能排序,Qwen3.5-9B 从 56.6 掉到 54.1;去掉 UCB 改均匀分配、再去掉多算子,性能逐级下滑。每个组件拿掉都疼,说明收益确实来自设计而非堆算力——尤其考虑到 ToT 的每实例调用数已与 DIVE 对齐,DIVE 的领先不能归因于测试时计算量。


七、必要知识反推

如果想在别的场景复刻 DIVE 的成功,需要前置掌握哪些知识?

7.1 领域层

  • LLM 上下文学习机理:理解为什么一段自然语言指导能系统性改变冻结模型的行为,以及上下文预算的硬约束;
  • 可验证任务的设计:DIVE 依赖二值验证器。什么任务能构造廉价的程序化验证(数学答案等价性、约束满足检查),什么任务不能,是适用性判断的第一道关;
  • 推理时计算扩展:SC、ToT 的原理与成本结构,才能理解"多次调用 + 排序"这一层的定位。

7.2 方法论层

  • 进化计算:种群、变异、重组、精英保留、bootstrap 采样——DIVE 的骨架就是一套自然语言版的进化算法;
  • 多臂老虎机与 UCB:利用-探索权衡、置信上界、非平稳性。掌握这些才能理解预算分配层,也才能明白为什么论文诚实地说"非平稳场景不保证遗憾界";
  • 集成学习思想:多样性-准确性权衡、边际覆盖、选择遗憾——联合选择本质是构造一个"技能集成";
  • 优化理论直觉:非凸、随机搜索、方差缩减——把文本优化问题放进优化视角,才会自然得出"多样性是解药"的结论。

7.3 工程层

  • 提示工程与结构化输出:六个任务各有严格输出契约(Sudoku 要求 Python 元组、Equational Theories 要求 VERDICT/PROOF/COUNTEREXAMPLE 字段),验证器解析依赖可靠格式;
  • 数据管线:进化/验证/测试三分区的严格纪律,bootstrap 采样实现,轨迹摘要的上下文窗口分块与合并;
  • 成本核算:每题调用 10.9 次、输出 20 万 token 的推理形态,要求工程上有缓存(验证集上每技能对每实例的回应只生成一次)与批量调度能力。

7.4 知识融合节点

DIVE 最大的启发在于一个跨界融合:把 LLM 技能优化(2024-2026 年的提示优化/经验学习文献)与进化计算的种群思想(上世纪的经典)结合。提示优化社区一直在"单轨迹"框架里打转,进化计算社区早就知道非凸随机搜索要靠种群与多样性。两者的对接点是把"技能"当作"基因型"、把"验证器反馈"当作"适应度"。类似的融合机会还有很多——bandit 方法用于算子分配、集成理论用于集合选择,都是"老工具解新问题"的范例。


八、通用性灵感

灵感一:多样性是非凸随机搜索的方差解药

核心思想:任何由 LLM 自我生成修订的优化过程(提示优化、技能进化、工作流改进)都是随机非凸搜索,单轨迹的成果高度依赖运气;并行维护多条独立轨迹再做选择,是控制这种方差的一般性方案。

论文证据:多种群 + 联合选择把 GPT-5-nano 从单技能的 60.7 推到 81.5;理论分析给出 $1-(1-q_\epsilon)^K$ 的覆盖提升论证。

推广场景:Agent 工作流自动设计、系统提示优化、代码生成策略搜索——凡是"让模型自己改自己的东西"的场景,都值得问一句"我维护了几条独立轨迹?"

灵感二:资产要按"边际覆盖"估值,而不是按单体成绩

核心思想:评估一个候选(技能、模型、方案)的价值时,看它对现有集合没有解决的问题的边际贡献,而非孤立评分。低单体高互补的候选可能比高单体高重叠的候选更有价值。

论文证据:联合选择(56.6)优于 Top-M 单技能排序(54.1)与随机选择(49.3);重组算子的第二父代显式按边际覆盖采样。

推广场景:集成模型的成员选择、RAG 语料的去重与补全、多专家路由系统的专家配置、甚至团队招聘——互补性只在集合层面存在。

灵感三:技能是可迁移的持久资产,“进化一次、处处受益”

核心思想:把经验沉淀为任务级自然语言技能而非模型私有调整,资产就获得了跨模型、跨规模的可移植性——训练成本付一次,收益可以被任何模型继承。

论文证据:Qwen3.5-9B 进化的技能搬到 DeepSeek-v4-flash 上直接把 73.9 抬到 90.5。

推广场景:企业为便宜模型离线进化技能库,在线服务时小模型 + 技能替代大模型(成本降 42.5% 的账本);技能库作为团队知识管理资产在模型升级时平移。

灵感四:把"怎么改"本身也交给进化

核心思想:优化算子(变异策略)不必人工定死,可以从优化历史中自动生成针对当前失败模式的新算子——搜索空间与搜索机制同层进化。

论文证据:第 8 步算子生成带来完整方法对 M-UCB 的额外提升(图 4 消融)。

推广场景:自动数据增广策略搜索、AutoML 中的算子发现、反思提示的自我改进——任何"元层面"可以数据驱动的迭代系统。

灵感五:测试时候选生成 + 排序是放大器,也是风险点

核心思想:多个互补假设各自出解、再由模型统一排序,把"找一个好方法"转换为"覆盖 + 选择"两个较容易的子问题;但排序器是新的误差来源(选择遗憾),候选越多不一定越准。

论文证据:聚合准确率 = oracle 覆盖 − 选择遗憾的分解;DIVE 用排序前固化的验证流程控制遗憾,贪心选择在边际提升非正时停止。

推广场景:多路召回 + 精排的经典架构、多 Agent 表决系统、代码生成的多补丁择优——设计这类系统时应同时度量覆盖与选择质量。


结语

DIVE 用一套"老智慧解新问题"的组合拳回答了冻结模型自我改进的方差难题:独立种群对冲采样运气,异构算子对冲搜索偏见,UCB 对冲预算浪费,联合选择把轨迹多样性兑换成实例级覆盖,候选排序把多条假设折叠成一个答案。在六个推理基准、多个模型家族上的全面领先,加上 42.5% 的推理成本优势与跨模型迁移能力,让"给冻结模型一本会进化的操作手册"成为参数更新之外一条切实可行的持续学习路径。对于关注 Agent 自进化与技能工程的读者,这篇论文值得精读的不仅是数字,更是它示范的方法论迁移方式——进化计算、bandit、集成学习这些成熟工具,在 LLM 时代的新问题域里依然锋利。

本文基于论文全文逐页阅读撰写。