论文链接:arxiv.org/abs/2608.12486 发表时间:2026年8月 机构:佐治亚理工 × Cisco Research(企业+高校合作:Cisco Research 参与研究并获 CISCO Systems 与 DARPA SciFy 项目资助, Georgia Tech 主导方法研究) 领域:cs.CL


一、论文背景:冻结模型的"经验失忆症"

大模型部署之后的行为几乎是静态的:它反复遇到同一类任务、反复收到反馈、甚至偶然发现了一个好用的解法策略——这些经验既不会改动它的参数,也不会自动留到下一次查询。微调当然可以把经验内化进权重,但那需要拿到模型权重、大量算力和一套精心设计的训练流水线。而当最强的模型只通过 API 开放、或者企业在有限适配预算下运行时,参数更新这条路根本不存在。

论文提出的核心问题是:冻结的语言模型,能否通过把经验转化为持久的自然语言技能来实现自我改进?

这里的"技能"(skill)是一个紧凑的文本工件,编码四类可复用知识:推理程序、验证策略、常见失败模式、输出约束。同一个冻结模型既执行技能、又修订技能——全程没有更强的教师模型参与。外部验证器只给二值判定 r∈{0,1}(可附带格式违规、执行失败、超时等结构化诊断信号),不给自然语言批评。这是一个相当苛刻的设定:解题、解读反馈、修订知识,全靠模型自己。

这条路上横着三道坎,也是论文最精彩的动机刻画:

  1. 自生成修订噪声大。一个局部有益的编辑可能删掉了有用的指导、过拟合到少量失败样本、或者放大了一次错误的反思——贪心的单候选精修因此非常脆弱。
  2. 经验迅速超出上下文预算。示范、轨迹、反馈不能无限追加,必须蒸馏成紧凑、可复用的抽象。
  3. 技能进化是路径依赖的。不同的初始技能、采样到的经验、修订轨迹会通向截然不同的解。只维护一条进化轨迹,等于过早丢弃了有潜力的备选,或者收敛到次优解。

二、论文定位与关联工作

DIVE 站在三条研究线的交汇处,且对每条线都给出了差异化批评。

训练自由的自改进线:Self-Refine 式的反思精炼、交互反馈的上下文学习、自然语言强化学习——这些方法主要精修单条响应、把交互历史留在上下文或记忆里,或者依赖更丰富的语言反馈。DIVE 的区别在于把验证器标注的经验转化为持久的任务级技能,显式编码可复用的程序性知识。

提示优化与进化线:从自动提示工程到 EvoPrompt 的提示种群进化、GEPA 的反思式提示进化(Pareto 候选选择)——这些方法用种群的多样性去搜出单个更强的提示。DIVE 的本质差异在于:多样性不是搜索的中间手段,而是端到端的设计原则——从独立自举的进化轨迹、异构变换算子,一路保留到推理时使用的互补技能集。多样性本身就是最终交付物的一部分。

记忆与技能线:经验 RAG、ExpeL、Agent 工作流记忆等关注经验如何存储与检索;DIVE 关注的是在随机自生成修订下,可复用知识应当如何搜索、多样化与选择——它把技能习得视为对相互竞争的知识假设做优化,而非单纯的记忆构建。

三、核心思想:多样性贯穿始终,互补性兑换收益

论文的中心论断可以一句话概括:既然自然语言技能进化是随机、非凸的搜索过程,就不该把宝押在单条轨迹上;应当在进化全程保留多样性,并在推理时把多样性兑换成互补性收益。

一个类比:单轨迹提示优化像一个只培养一个徒弟的师傅——徒弟走得正,门派兴旺;徒弟走偏一步,满盘皆输,而且师傅再也没有第二个选项。DIVE 则像一个开了多个分舵的武林门派:每个分舵独立练功(独立采样经验、独立进化),各舵还有不同的练功方式(异构算子),最后不是选出"武功最强的一个人",而是挑一组招式互补的弟子组队下山。哪些练法值得多花时间?UCB 机制相当于把练功时间多分给"最近长进大"的练法,同时偶尔照顾一下还没练透的冷门功法。而推理时的互补技能集,就像考试时多个解法并行作答再互相校验——只要有一个解法做对且能被识别出来,这道题就稳了。

框架的整体流程是:开发数据切分为进化集 D_evo 与验证集 D_val(测试集严格 held-out)→ 从 D_evo 的 bootstrap 子集构造 K 个独立技能种群并行进化 → 种群内用异构算子组合提案修订、UCB 自适应分配预算、中途还能进化出新算子 → 所有候选技能在共享验证集上评估,联合选择大小至多 M 的互补技能集 → 推理时 M 个技能独立生成候选解,冻结模型排序选出最终答案。

四、机制拆解一:多种群隔离与异构算子进化

4.1 独立种群构造

对每个种群 k,独立(有放回)采样两个子集:经验子集 D_exp(5% 的 D_evo)提供验证器标注轨迹用于提取任务知识,反思子集 D_ref(10%)用于评估候选技能、诊断失败、引导后续修订。不同的 bootstrap 子集与进化轨迹,天然诱导出不同的推理程序与验证策略。

种子技能也不是一个,而是三个互补起点:minimal(仅任务描述与强制输出约束)、construction(从成功轨迹蒸馏的解法构造知识:推理程序、分解方式、决策规则)、verification(从失败轨迹蒸馏的诊断验证知识:常见失败模式、中间正确性检查、终答验证)。初始就埋下多元的归纳偏置。

4.2 四个进化算子:各自瞄准不同失败模式

每个种群维护一个异构算子组合,每个算子定义了一种"提案核"——不仅决定怎么改,还决定选谁当父本:

  • Reflective Repair(反思修复,单父本):针对验证器标注轨迹暴露的系统性失败做局部修订,保留既有有效指导。父本偏好表现强的技能(按反思集正确率 U(s) 采样)——好技能的系统性错误值得精修。
  • Exploratory Revision(探索性修订,单父本):不做增量修补,而是彻底换一套解法策略、分解方式或推理路径。父本偏好表现弱的技能(按 1-U(s) 采样)——弱技能靠修是修不好的,不如推倒重来。
  • Compression(压缩,单父本):只作用于超过 4096 token 的技能,删冗余、去过度的实例化细节、调和冲突指导,把知识浓缩成更可复用的形式——直接回应"经验超上下文预算"的挑战。
  • Recombination(多父本重组,双父本):第一个父本按表现采样,第二个父本按"个体表现 + 相对第一父本的边际覆盖"(λ=0.5 加权的 λU(s)+(1-λ)Δ(s|s₁))采样——Δ 度量的是"第一父本解不出而 s 能解出"的实例比例,专挑互补项杂交。

这个设计里藏着精致的分工:修复偏爱强者、探索偏爱弱者、压缩偏爱"长而有效者"、重组偏爱"互补者"。四种算子覆盖了技能空间的不同搜索偏置,任何单一算子都无法在所有搜索状态下维持高比例的有用提议——论文的理论分析部分用"有用提议质量"(useful proposal mass)严格论证了这一点:技能修复在出现"强而不完美"的技能后才有效,探索修订在现有策略共享同一失败模式时更有用,重组只有等到互补技能出现后才有意义。

4.3 UCB 预算分配与算子的"元进化"

进化预算 B(每种群 10 步)怎么分给这些算子?每步按 UCB 分数选算子:

UCB_a(t) = μ̂_a(t) + β·√(log t / N_a(t))

其中 μ̂_a 是算子 a 的历史平均父本相对奖励——提案技能相对其最强父本的改进量(R_τ = U(s’τ) − max{s∈P_τ} U(s))。注意这个奖励设计的巧思:和最强父本比,多父本算子的孩子不能靠"比弱父本强"白拿正分,提案质量与父本绝对质量被解耦。第一项利用(多给最近产出改进大的算子),第二项探索(别冷落试得少的算子),β=0.3。由于奖励分布随种群进化非平稳,论文明确不套用平稳老虎机的 regret 保证,把 UCB 定位为务实的有限预算分配规则。

更妙的一步是第 8 步(t_new)的自适应算子生成:把累计的进化历史(选过的算子、父本、提案、奖励)压缩成结构化摘要——各算子的应用次数、平均奖励、正改进率,以及尚未解决的复现失败模式、历史中出现过但现有算子没覆盖的有效变换——然后让模型据此提议一个新算子加入池(以未试状态参与 UCB 竞争)。每个新算子提案还自带诊断元数据:针对的算子组合缺口、历史证据、与最近似算子的区别。算子本身也成了可进化的对象——这是把进化思想从"解"上推到了"搜索算子"上的一层元进化。

五、机制拆解二:互补技能集的联合选择与推理期兑换

进化结束后,所有种群的候选技能在共享验证集上评估。关键在于:最终不是按技能个体表现排名取 Top-M,而是按整个"生成 + 排序"流水线的验证集表现做联合选择。

选择流程:每个种群先按个体验证表现保留 Top-3 进入候选池;然后贪心构造最终技能集——第一个技能取验证效用最高者,之后每步在"未占用种群"的候选里选边际改进最大者,直到集满 M=10 或边际改进非正。约束"每个种群至多贡献一个技能"强制了来源多样性。直觉上,一个"排第二但和已选技能错开解题面"的技能,比"排第一但和已选技能重叠"的技能更有价值。

推理时,选出的 M 个技能各自独立生成候选解,再由同一个冻结模型排序取最高——HMMT 用多数投票,其余任务用单次列表式排序(依据推理有效性、中间结论一致性、终答与推理的吻合度、任务约束遵守情况)。排序提示词只要求返回候选编号,轻量且不依赖测试标签。

这一步是全文思想的闭环:进化期的多样性被兑换成推理期的选择收益。单独看每个技能可能都不是最优,但"多个不同强项的解法并行 + 一致性检验"在整体上压倒了任何单点最优——这正是下一节因果链的终点。

六、因果链:为什么多样性让小模型反超大模型

把论文的全部证据串成一条因果链:

  1. 文本技能搜索本质上是随机非凸优化。不同的初始化、采样经验、修订轨迹通向不同的局部最优——这不是实现缺陷,而是问题结构本身决定的。论文理论分析给出覆盖率论证:若每个种群以 q_ε 的概率进化出低风险技能,K 个独立种群至少出一个的概率为 1−(1−q_ε)^K,随 K 增大而提升(边际递减)。
  2. 单轨迹在这类问题上必然脆弱。它要么过拟合自己采样到的那一小撮经验,要么收敛到次优解后失去逃逸能力——贪心单候选精修的噪声被逐步放大。GEPA 等单轨迹提示优化在实验里平均只有 55.1(GPT-5-nano),甚至低于 zero-shot 的 52.3 不算意外,SkillOpt 59.7 亦然。
  3. 种群隔离维持假设空间宽度,算子异构性覆盖不同失败模式。独立的 bootstrap 子集切断轨迹间的相关性;四个算子各自瞄准强者精修、弱者重写、冗者压缩、互补者杂交四类状态;UCB 让预算流向当前最有生产力的变换方式。三者共同保证候选池里始终存在"解题面不同"的多个技能假设。
  4. 验证集互补选择把进化期多样性兑换为推理期选择收益。联合选择优化的不是"最强大技能",而是"M 个技能并行生成 + 排序"这条完整流水线的端到端正确率。M>1 的增益极其显著:GPT-5-nano 上 DIVE(M=1) 平均 60.7,DIVE(M=10) 直接跳到 81.5——20.8 分全靠互补性兑换而来。
  5. 终点:小模型反超大模型。GPT-5-nano + DIVE 平均 81.5,反超 GPT-5 zero-shot(76.5)与 few-shot(79.8),且单例推理成本 $0.088 对 $0.154,降低 42.5%。另需强调:无教师设定意味着解空间的探索与利用全部自举——没有更强模型示范方向,多样性机制就是模型能给自己制造的唯一起点优势。

七、实验与数据

任务与模型:六个数学与逻辑推理任务——数学侧 HMMT、Equational Theories;逻辑侧 Sudoku、Cryptarithm、Calcudoku、Futoshiki(逻辑任务一律用 hard 子集,避免天花板效应)。模型覆盖 GPT-5-nano、DeepSeek-v4-flash、Qwen3.5-27B 三个家族,另用 Qwen3-8B 做优化效率对比。

主结果(Table 1):GPT-5-nano 上 DIVE(M=10) 平均 81.5,大幅领先 ToT 74.3、SC 67.7、SkillOpt 59.7、GEPA 55.1、MIPROv2 53.8、ExpeL 56.3、经验 RAG 52.2、zero-shot 52.3;DeepSeek-v4-flash 达 96.4(M=1 仅 81.9,互补性增益 14.5 分);Qwen3.5-27B 达 86.1。逻辑 hard 子集上的提升尤其惊人——GPT-5-nano 的 Cryptarithm 从 20.1 拉到 61.5,Calcudoku 从 30.4 拉到 84.8,Futoshiki 到 99.2。一个规律值得注意:基线越弱的模型,DIVE 增益越大——进化空间恰恰存在于模型原生能力的空白处。

小模型 vs 大模型(Table 2):GPT-5-nano + DIVE 平均 81.5,高于 GPT-5 zero-shot 76.5 与 few-shot 79.8,推理成本从 $0.154 降至 $0.088(−42.5%)。用 11 倍的调用次数(10.9 次/例)换取 30 分的准确率与半价成本,在规模化部署里这笔账很容易算。

优化效率(图 1,Qwen3-8B):HMMT 与 Sudoku 上随 rollout 数增长,DIVE 快速爬升;SFT 与 GEPA 早早停在低平台,GRPO 爬升缓慢且需要多得多的 rollout。文本技能进化的样本效率优势明确——每个验证器标注的轨迹都直接进入知识蒸馏,而非在梯度空间里稀释。

跨模型迁移(Table 3):Qwen3.5-9B 进化的技能零成本迁移到 Qwen3.5-27B(59.6→81.2)与 DeepSeek-v4-flash(73.9→90.5)依然有效;而在目标模型上继续进化可再涨到 86.1 与 96.4。技能编码的是任务级知识而非模型怪癖——这为"便宜模型练技能、昂贵模型直接用"的分工模式提供了依据。

消融(图 3/4、Table 4):技能集大小从 1 到 10 性能单调上升、逐渐饱和(最优区间 3-10,印证边际递减);算子组合上 Full(含算子生成)> M-UCB > M-Unif > Single,异构算子、UCB 分配、自适应算子生成逐层贡献增量;技能集构造上 Joint 选择(56.6)> Top-M 个体排名(54.1)> 随机(49.3)> 最优单技能(37.2)——联合选择的互补性优势在数字上干净利落。

实现细节:每数据集 1000 例作进化集;K=10 种群、每种群 3 种子、预算 B=10;β=0.3、父本采样温度 0.6;t_new=8 生成 1 个新算子;压缩阈值 4096 token;最终集 M=10。进化中子技能直接加入种群、不删除父本——种内也保留多样性。

八、可迁移的灵感

灵感 1:把多样性当作可存储的资产,而不是搜索的中间产物

绝大多数进化式优化(包括 GEPA 这类反思式提示进化)把种群多样性当作寻找"唯一最强个体"的脚手架,用完即弃。DIVE 的范式反转在于:进化期多样性 → 推理期互补性是一条完整的价值兑换链,多样性本身就是交付物。任何维护"候选方案集合"的系统——检索池、工具集、Agent 策略库——都值得追问:我是只留最好的那个,还是在留一组互补的组合?M=1 到 M=10 的 20 分差距说明,这个问题值很多钱。

灵感 2:算子本身也应该进化(元进化)

固定四算子组合已经很强,但从进化历史中生成新算子仍能再带来增益。这提示一个通用原则:当搜索停滞时,升级的不是解,而是搜索算子。进化历史是免费的元数据——哪些变换反复失败、哪些失败模式无人认领,这些信息足以让系统自己长出缺失的搜索原语。这个思路可以直接迁移到任何迭代改进系统:代码重构策略、测试用例生成器、数据增强管线。

灵感 3:无参数更新的自改进,是 API 时代唯一普惠的路径

权重更新(SFT/GRPO)效果好但需要权重与训练基建;DIVE 证明了纯文本技能进化在样本效率上还能反超(更少 rollout、更高终点)。对绝大多数只能通过 API 使用最强模型的组织而言,“经验 → 自然语言技能"是唯一能落地的经验沉淀通道——而且技能可读、可编辑、可回滚、可跨模型迁移,这些工程属性是权重不具备的。选型时别只盯着参数路线的精度上限,要看路线的准入门槛。

灵感 4:UCB 预算分配可以迁移到任何多策略实验系统

“哪个算子最近产出改进大就多给预算,但保留探索余地”——这个 UCB 模式适用于一切需要在多个策略间分配有限实验预算的场景:A/B 测试的多组变体、多 Agent 架构的变体筛选、甚至内容运营的多风格探索。关键细节有二:一是奖励要相对基准(父本相对奖励防止弱基准刷分),二是承认环境非平稳、放弃理论保证、把 UCB 当作务实的启发式——这种工程上的诚实反而让方案更耐用。

灵感 5:无教师设定下,自举质量决定于"差异"而非"更强”

没有教师模型示范方向时,模型无法变得"更聪明",但可以变得"更多样"。DIVE 的全部机制(bootstrap 采样、异构算子、算子进化、联合选择)本质上都是在制造差异、保留差异、兑现差异。这对个人与团队同样成立:当你无法引入更强的外部指导时,系统性地产出多个独立尝试并建立可靠的内部选择机制,是唯一可行的改进路径——独立性和选择机制,缺一不可。

九、总结

DIVE 为"冻结模型如何从经验中学习"给出了一个完整的工程答案:把经验蒸馏为自然语言技能,用 K 个独立种群隔离进化轨迹,用异构算子组合覆盖不同失败模式,用 UCB 把有限预算分给最有生产力的变换,让算子池自身也能进化,最后在共享验证集上联合选择互补技能集,推理时多技能并行生成、冻结模型排序定夺。

它的证据链是闭合的:消融证明每个组件都有独立贡献,M>1 的巨大增益证明互补性是主要收益来源,跨模型迁移证明技能编码的是任务知识而非模型怪癖,而 GPT-5-nano 反超 GPT-5 且成本降低 42.5% 的结果,则把"多样性驱动的技能进化"从一种优化技巧抬升成了小模型逆袭的结构性路径。当然,局限也明显:验证器只覆盖可判分的任务(数学/逻辑),开放域任务上二值反馈难以获得;推理成本上升约 10 倍;技能集每任务独立进化,跨任务复用留给了未来工作。但方向已经清晰——在无法改动参数的世界里,多样性是模型唯一能自己制造的杠杆。