论文链接:arxiv.org/abs/2608.12486 发表时间:2026年8月(arXiv:2608.12486v1,2026年8月12日提交) 机构:佐治亚理工(Georgia Institute of Technology)+ Cisco Research(企业与高校合作,受 DARPA SciFy 项目 Award No. HR001125C0302 及 Cisco Systems 资助) 领域标签:大语言模型自我改进、技能进化、提示优化、进化计算、Agent 持续学习
一、论文背景
1.1 冻结模型的"失忆症"
大语言模型(LLM)的能力已经很强,但它们在部署之后的行为几乎是静态的。一个模型今天在某道数学题上摔了跟头,明天遇到同类型的题,大概率还会以同样的方式摔倒——因为部署后的经验不会改变它的参数,也不会自动沉淀给未来的查询。论文开篇就点出这个痛点:模型无法在部署后保留经验。
想让它"长记性",传统路子是微调(SFT、强化学习等参数更新方法)。但微调有三个越来越现实的门槛:
- 需要拿到模型权重:而如今许多强模型只能通过 API 访问,权重根本不可得;
- 需要大量算力和训练基础设施:每一次"学点新东西"都要重跑一套训练管线;
- 需要精心设计的训练流程:学习率、数据配比、验证门控,缺一不可。
于是论文提出一个互补性问题:一个冻结的(frozen)语言模型,能否通过把经验转化为持久的自然语言技能来实现自我改进?注意这里的严格设定——同一个冻结模型既要解题,又要解读验证器反馈,还要修改自己的知识,全程没有更强的教师模型帮忙。
1.2 Skill 是什么
论文中的 Skill(技能) 是一段紧凑的自然语言文本工件,插入模型上下文后指导后续推理。它编码四类可复用知识:
- 可复用的推理流程:先做什么、后做什么、用什么表示方法;
- 验证策略:中间步骤怎么自查、最终答案怎么核对;
- 常见失败模式:这类题容易在哪里栽跟头;
- 输出约束:答案格式、必须遵守的输出契约。
这就像给一位聪明的通才员工发"岗位操作手册"——人没变(参数冻结),表现却能质的飞跃。与权重更新相比,技能还人类可读、可编辑、可回滚、可跨模型迁移。
1.3 为什么自我改进很难:三大挑战
论文分析了这个设定下的三个关键挑战,这也是理解 DIVE 设计的钥匙:
**挑战一:自我修订天然带噪声。**模型自己给自己改技能,一次局部有利的编辑可能删掉有用指导、过拟合于少量失败样本、或者放大一次错误的反思。贪心地只维护一个候选不断打磨,非常脆弱。
**挑战二:经验很快超出上下文预算。**演示、轨迹、反馈不断累积,不可能无限追加,必须蒸馏成紧凑、可复用的抽象。
**挑战三:技能进化是路径依赖的。**不同的初始技能、采样到的经验、修订轨迹会导向差异巨大的解。只维护单一进化轨迹,可能过早丢弃有希望的备选方案,或收敛到次优解。
1.4 前作的过拟合问题
在 DIVE 之前,技能/提示优化方向已有代表性工作(如 SkillOpt、GEPA),它们的共同做法是沿单条轨迹打磨一份技能文档:反复执行、反思、修订同一个候选。论文一针见血地指出:自然语言技能进化本质上是一个随机、非凸的搜索过程——单轨迹优化很容易过拟合于采样到的经验,或者收敛到次优解。这就像深度学习训练中只跑一个随机种子的单次实验:结果好坏全凭运气,方差极大。DIVE 的核心洞察是:既然搜索是随机的,就用多样性来对冲方差。
二、论文定位和关联工作
DIVE 位于"用自然语言上下文适配冻结模型"这条研究脉络的最新节点。理解它的位置,需要看四个谱系:
2.1 四条研究谱系
谱系一:提示优化。MIPROv2 用贝叶斯优化联合搜索指令与示范组合,GEPA 用自然语言反思加帕累托候选选择做进化式提示优化。它们的目标是"找到一条更好的提示",本质仍是单提示搜索。
谱系二:经验与记忆学习。Experience RAG 把历史轨迹存入检索库,测试时取相似经验放进上下文;ExpeL 从成败轨迹提取自然语言规则。它们关注经验如何存储与检索,不把技能获取当优化问题。
**谱系三:技能优化。**Direct Skill Generation 一次性生成任务级技能;SkillOpt 把技能文档当可训练状态,沿单轨迹做结构化编辑——这是与 DIVE 最直接的对照,DIVE 相当于把"单轨迹打磨"升级为"多种群进化 + 互补选择"。
**谱系四:推理时方法。**SC 多次采样投票、ToT 树搜索,在推理时花更多算力换准确率,但不从经验学习、不积累持久资产。
2.2 关联工作对比表
| 方法 | 优化对象 | 轨迹结构 | 是否需要权重 | 持久资产 | 核心局限 |
|---|---|---|---|---|---|
| SC / ToT | 无(推理时搜索) | — | 否 | 无 | 只花算力,不积累经验 |
| Experience RAG | 检索库 | — | 否 | 轨迹库 | 只存取,不优化知识 |
| ExpeL | 自然语言规则 | 单次提取 | 否 | 规则库 | 一次性提取,无迭代优化 |
| MIPROv2 | 指令+示范 | 单轨迹(贝叶斯优化) | 否 | 一条提示 | 过拟合验证集风险 |
| GEPA | 提示 | 单轨迹(反思进化) | 否 | 一条提示 | 单轨迹易过拟合/次优收敛 |
| SkillOpt | 技能文档 | 单轨迹(结构化编辑) | 否 | 一份技能 | 同上 |
| SFT / GRPO | 模型权重 | 梯度训练 | 是 | 权重 | 需权重与训练设施,成本高 |
| DIVE | 技能种群 | K=10 独立多种群 | 否 | ≤M=10 互补技能集 | 推理时多次调用(成本约为零样本 11 倍) |
论文在相关工作一节中明确划出了差异:EvoPrompt 等进化式提示方法虽然也维护种群,但多样性主要用于搜索出强的单个个体;而 DIVE 把多样性作为端到端的设计原则——从独立 bootstrap 的进化轨迹、异构变换算子,一直保留到推理时使用的互补技能集。这是"用多样性找最优解"与"用多样性本身作为最终资产"的本质区别。
三、问题定义
3.1 形式化设定
论文的设定干净利落。给定问题 $x$,冻结模型 $f_\theta$ 产生回答 $f_\theta(x)$;一个能访问金标答案 $y$ 的外部验证器返回二值分数:
$$r(x, y, f_\theta(x)) \in \{0, 1\}$$注意一个关键细节:验证器不提供自然语言批评,只给对/错标签(可能附带格式违规、执行失败、超时等结构化诊断信号)。这意味着"从失败中学到什么"完全要靠模型自己反思,不能指望外部老师解释。
任务分布 $T$ 上冻结模型的性能为 $V_T(f_\theta) = \mathbb{E}[r]$。目标是在 $\theta$ 固定的前提下提升该性能。技能 $s$ 的性能类似定义为 $V_T(s)$,即模型以 $s$ 为条件的期望正确率。自我改进的闭环是:
- 执行技能得到带验证标签的轨迹集 $E(D; s)$;
- 同一个模型提出修订 $s' = \text{UpdateSkill}_{f_\theta}(s, E(D;s))$;
- 循环往复。
3.2 抽象:自然语言空间中的非凸随机搜索
论文最重要的一个思想升维是:把冻结模型自我改进视为自然语言空间中的非凸随机搜索。
在这个视角下,技能空间是一个巨大而崎岖的搜索空间:每条技能是一个"点",修订算子定义了"移动方向",验证器反馈是"目标函数"的带噪观测。这个空间显然非凸——不同的解题策略(坐标法 vs 组合恒等式、约束传播 vs 回溯搜索)是不同的"盆地";搜索又是随机的——同样的起点,采样到不同的经验子集、生成出不同的修订,就会走出完全不同的轨迹。
既然是非凸随机搜索,优化理论里两个经典结论就直接适用了:
- 单点迭代(爬山)易陷入次优盆地——对应单轨迹提示优化的过拟合;
- 多样本并行搜索 + 选择(种群方法)能显著降低陷入次优解的概率——对应 DIVE 的多种群设计。
3.3 类比对偶表
论文虽未明说,但其设计处处可与生物进化、深度学习训练对偶,这张对偶表能帮助初学者建立直觉:
| 维度 | 生物进化 | 深度学习训练 | DIVE 技能进化 |
|---|---|---|---|
| 搜索空间 | 基因组 | 参数空间 | 自然语言技能空间 |
| 个体 | 生物个体 | 一组参数 | 一条技能文本 |
| 种群 | 地理隔离的种群 | 多随机种子并行实验 | K=10 个独立 bootstrap 的技能种群 |
| 变异 | 基因突变/重组 | 梯度步/数据增广 | 四种异构进化算子 |
| 适应度 | 环境存活率 | 验证集准确率 | 反思集上的正确率 U(s) |
| 资源分配 | — | 学习率/数据调度 | UCB 在算子间分配预算 |
| 精英保留 | 自然选择 | 检查点选择 | 联合选择 ≤M=10 互补技能 |
| 表型融合 | — | 集成/权重平均 | 推理时候选生成+排序 |
四、问题解法
DIVE 的方法论由五个环环相扣的组件构成,整体流程是:数据划分 → 多种群独立进化 → 共享验证集联合选择 → 推理时候选排序。
4.1 数据划分与多种群独立构造
每个数据集划分为进化集 $D_{evo}$(实现中取 1000 个训练样本)与验证集 $D_{val}$,测试集严格隔离。对每个种群 $k \in [K]$(实现中 K=10),独立(有放回 bootstrap)采样两个子集:
- 经验子集 $D_{exp}^{(k)}$(占 $D_{evo}$ 的 5%):提供带验证标签的轨迹,供提取任务知识;
- 反思子集 $D_{ref}^{(k)}$(占 10%):用于评估候选技能、诊断失败、指导后续修订。
两个子集角色分离,保证"学知识的料"和"考试改卷的题"不混用。每个种群从经验子集蒸馏出 3 条种子技能:一条最小种子(只含任务描述与输出约束)、一条解法构造种子(强调成功推理流程)、一条诊断验证种子(强调失败模式与自查策略)。不同种群虽然优化同一目标,但 bootstrap 子集和进化轨迹不同,天然长出不同的推理程序——这就是用独立性降方差。
理论部分给出了简洁的概率论证:若每个种群以概率 $q_\epsilon$ 独立发现一条低风险技能,则 K 个种群至少发现一条的概率为 $1-(1-q_\epsilon)^K$——随 K 增大而提升(边际收益递减)。
4.2 异构进化算子:四种探索偏见
每个种群维护一个算子组合,初始为四种(论文称每个算子诱导一种特定的归纳偏见):
| 算子 | 父母数 | 偏向的父代 | 作用 | 类比 |
|---|---|---|---|---|
| 反思修复 Reflective Repair | 1 | 高性能技能(按 U(s) 采样) | 局部修订系统性失败,保留有用指导 | 精细梯度步/局部爬山 |
| 探索性修订 Exploratory Revision | 1 | 低性能技能(按 1−U(s) 采样) | 彻底换一种解题策略、分解或推理路径 | 大步长突变/跳出盆地 |
| 压缩 Compression | 1 | 长度超过 4096 token 的高性能技能 | 删除冗余、过度具体与冲突的指导 | 正则化/剪枝 |
| 双亲重组 Recombination | 2 | 强父代 + 互补父代(λ=0.5 平衡个体性能与边际覆盖) | 综合两个父代的优势知识 | 基因重组/交叉 |
这套设计的精妙处在于算子与父代选择的耦合:反思修复专挑好学生改小毛病,探索性修订专挑差学生推倒重来,压缩只处理超长技能(无超长技能则该算子本轮不适用),重组的第一个父代按性能采样、第二个父代按"边际覆盖"(解出第一个父代解不出的题的比例)采样。四种算子覆盖了"精修、重构、瘦身、杂交"四种正交的探索方向。
4.3 UCB 预算分配与算子自适应生成
每个种群的进化预算为 B=10 步。每步先用 UCB(置信上界)规则选算子:
$$UCB_a(t) = \hat{\mu}_a(t) + \beta\sqrt{\frac{\log t}{N_a(t)}}$$其中 $\hat{\mu}_a(t)$ 是算子 $a$ 的历史平均父母相对奖励(子代提升减去最强父代的提升,$R_\tau = U(s'_\tau) - \max_{s \in P_\tau} U(s)$——与最强父代比较,防止"打赢弱父代白拿奖励"),β=0.3。第一项利用经验证明多产的算子,第二项继续试探观察不足的算子。
在预设的第 $t_{new}=8$ 步,还会触发算子自适应生成:把累积的进化历史(选过哪些算子、改了什么、得了多少奖励)压缩成结构化摘要,让模型针对"现有算子组合覆盖不足的失败模式"生成 1 个新算子(含名称、父母数、变换指令的 JSON 规格),加入算子池按同样 UCB 规则参与竞争。连"怎么变异"本身也在进化。
论文的理论分析特别诚实:由于奖励分布随种群演化非平稳,作者不宣称标准 bandit 的遗憾界保证,而是把 UCB 定位为"有限预算下的实用分配规则"——把提案集中在经验上多产的机制上,又不过早淘汰探索不足的备选。
4.4 联合选择:把多样性变成互补覆盖
K 个种群各自进化完毕后,所有候选技能在共享验证集 $D_{val}$ 上评估。这里 DIVE 做了一个与常规做法不同的选择:不是按单技能性能排序取 Top-M,而是按技能集整体的端到端效用(含候选生成与排序管线)做贪心构造:
- 每个种群先按单技能验证性能保留 Top-3,形成候选池;
- 贪心逐个加入使整体验证效用边际提升最大的技能;
- 约束:最终集合至多 M=10 条,且每个种群至多贡献 1 条;
- 边际提升非正或达到 M 即停止。
为什么必须联合选择?理论部分给出漂亮的分解:聚合准确率 = oracle 覆盖率(至少一个候选正确的概率)− 选择遗憾(有正确候选却选错的概率)。一条单打独斗成绩平平的技能,如果它解的题恰好是其他技能都解不出的题,它的边际覆盖就很大。互补性只能以集合为单位度量——这是消融实验中联合选择(56.6)显著优于 Top-M 单技能排序(54.1)和随机选择(49.3)的原因。
4.5 推理时候选排序
测试时,最终技能集中的每条技能独立生成一个候选解;HMMT 上对候选做多数投票,其余任务把全部候选(不含冗长推理过程)放进一次列表式排序调用,由同一个冻结模型基于推理有效性、答案一致性与约束遵守度选出最终答案。排序流程在验证集上固化,测试时不接触测试标签。
4.6 机制总表
| 组件 | 机制 | 解决的挑战 | 对应理论量 |
|---|---|---|---|
| 多种群 bootstrap | K=10 独立经验/反思子集 | 路径依赖、单轨迹次优收敛 | 候选池覆盖 $1-(1-q_\epsilon)^K$ |
| 异构算子 | 四种正交变换偏见 | 修订噪声、探索不足 | 有用提案质量 |
| UCB 分配 | β=0.3 置信上界 | 有限预算分配 | 非平稳 bandit 实用规则 |
| 算子生成 | 第 8 步从进化史生成新算子 | 固定组合覆盖不足 | 扩展提案支撑 |
| 联合选择 | 贪心边际提升 + 每种群至多 1 条 | 互补性无法单技能度量 | oracle 覆盖 − 选择遗憾 |
| 候选排序 | 独立生成 + 列表排序/投票 | 单技能可靠性上限 | 选择遗憾控制 |
五、评估指标与实验证据
5.1 基准与设置
六个基准:HMMT(高中数学竞赛,训练集 1200 题来自 NuminaMath-1.5,评测用 MathArena 2025 年 2 月与 11 月合集)、Equational Theories(magma 等式蕴含判定,400 评测题)、Sudoku / Cryptarithm / Calcudoku / Futoshiki(均来自 SynLogic,逻辑任务用 hard 子集)。基线覆盖:推理时方法、经验记忆方法(Experience RAG、ExpeL)、技能学习方法、提示优化方法,另在 Qwen3-8B 上对比 SFT(LoRA)与 GRPO。
5.2 主结果:完整数据表
| 模型 | 方法 | HMMT | Eq.Theo | Sudoku | Crypt. | Calc. | Futo. | 平均 |
|---|---|---|---|---|---|---|---|---|
| GPT-5-nano | Zero-shot | 64.3 | 56.5 | 71.7 | 20.1 | 30.4 | 70.8 | 52.3 |
| Few-shot | 63.3 | 59.5 | 77.0 | 25.5 | 26.2 | 69.1 | 53.4 | |
| SC | 80.1 | 59.1 | 86.5 | 48.9 | 49.1 | 82.7 | 67.7 | |
| ToT | 74.3 | 62.3 | 92.8 | 55.1 | 68.4 | 93.1 | 74.3 | |
| Experience RAG | 55.0 | 64.0 | 74.1 | 23.8 | 28.5 | 67.5 | 52.2 | |
| ExpeL | 60.1 | 61.6 | 77.2 | 26.7 | 37.0 | 75.4 | 56.3 | |
| SkillOpt | 66.3 | 59.1 | 82.6 | 29.9 | 39.8 | 80.4 | 59.7 | |
| MIPROv2 | 59.0 | 55.2 | 75.1 | 24.4 | 34.7 | 74.5 | 53.8 | |
| GEPA | 61.3 | 56.0 | 78.6 | 25.6 | 31.8 | 77.2 | 55.1 | |
| DIVE (M=1) | 74.3 | 60.1 | 85.8 | 28.2 | 36.8 | 78.7 | 60.7 | |
| DIVE (M=10) | 82.9 | 64.5 | 96.0 | 61.5 | 84.8 | 99.2 | 81.5 | |
| DeepSeek-v4-flash | Zero-shot | 75.8 | 43.7 | 77.0 | 70.8 | 84.6 | 91.2 | 73.9 |
| SC | 90.1 | 65.0 | 93.1 | 90.0 | 90.3 | 92.5 | 86.8 | |
| ToT | 86.7 | 53.5 | 95.0 | 91.2 | 93.1 | 93.1 | 85.4 | |
| SkillOpt | 82.2 | 55.3 | 82.0 | 79.6 | 92.7 | 95.1 | 81.2 | |
| GEPA | 74.0 | 50.8 | 78.9 | 77.2 | 91.4 | 93.1 | 77.6 | |
| DIVE (M=10) | 93.3 | 91.5 | 99.1 | 99.0 | 97.9 | 97.8 | 96.4 | |
| Qwen3.5-27B | Zero-shot | 82.5 | 65.6 | 51.5 | 50.5 | 48.3 | 59.4 | 59.6 |
| SC | 85.0 | 62.5 | 70.4 | 75.2 | 60.1 | 60.6 | 69.0 | |
| ToT | 83.5 | 65.8 | 85.6 | 80.3 | 69.8 | 91.4 | 79.4 | |
| SkillOpt | 93.1 | 84.2 | 59.0 | 57.4 | 55.6 | 66.9 | 69.4 | |
| GEPA | 92.5 | 82.5 | 54.4 | 52.1 | 50.0 | 62.4 | 65.7 | |
| DIVE (M=10) | 95.2 | 90.1 | 85.3 | 82.5 | 72.6 | 90.7 | 86.1 |
几个关键读数:
- GPT-5-nano:DIVE 平均 81.5,比 zero-shot(52.3)提升 29.2 分,超最强基线 ToT(74.3)7.2 分,超 SkillOpt(59.7)21.8 分;
- DeepSeek-v4-flash:DIVE 96.4,超 SC(86.8)9.6 分——尤其在 Equational Theories 上从基线最高 65.0 跃至 91.5;
- Qwen3.5-27B:DIVE 86.1,超 SkillOpt(69.4)16.7 分。值得注意的是 SkillOpt 与 GEPA 在数学任务上很强(93.1/92.5)但逻辑任务崩掉(Calcudoku 仅 55.6/50.0),DIVE 全线均衡——这正是"互补技能集"覆盖不同题型的直接体现;
- DIVE (M=1) vs (M=10):单技能版只有 60.7/81.9/71.7,说明收益大头来自多技能互补,而非某条"超级技能"。
5.3 小模型 + 技能 vs 大模型:成本对比
| 配置 | 调用次数 | 输入 token | 输出 token | 每题成本 | 平均准确率 |
|---|---|---|---|---|---|
| GPT-5-nano (Zero-shot) | 1.0 | 170.1 | 19,609 | $0.008 | 52.3 |
| GPT-5-nano (DIVE) | 10.9 | 33,811 | 216,834 | $0.088 | 81.5 |
| GPT-5 (Zero-shot) | 1.0 | 170.1 | 15,389 | $0.154 | 76.5 |
| GPT-5 (Few-shot) | 1.0 | 4,966 | 14,675 | $0.153 | 79.8 |
GPT-5-nano + DIVE(81.5)超过 GPT-5 few-shot(79.8),同时每题推理成本从 $0.154 降到 $0.088,降低 42.5%。“给小模型配技能手册"比"直接买大模型"又准又便宜——这是论文最具商业说服力的一张表。
5.4 跨模型迁移
| 执行模型 | Zero-shot | DIVE(9B 技能) | DIVE(本模型技能) |
|---|---|---|---|
| Qwen3.5-9B | 27.2 | 56.6 | — |
| Qwen3.5-27B | 59.6 | 81.2 | 86.1 |
| DeepSeek-v4-flash | 73.9 | 90.5 | 96.4 |
为 9B 小模型进化的技能,直接搬到同家族 27B 上平均 81.2、搬到异家族 DeepSeek 上 90.5,均大幅超越零样本。技能编码的是任务层面的可复用知识而非模型私有怪癖;面向目标模型定制进化还能再赚一截。
5.5 消融实验
技能集构造策略(Qwen3.5-9B,K=10、M=10):零样本 27.2 → 最优单技能 37.2 → 随机选 M 条 49.3 → 按单技能性能 Top-M 54.1 → 联合选择 56.6。每一级提升都验证了"集合互补性"的价值。
进化策略消融(图 4):单算子 < 多算子均匀分配(M-Unif)< 多算子 UCB 分配(M-UCB)< 完整方法(含算子生成)——四级递进,逐项拆解了算子多样性与自适应分配的各自贡献。
其他超参:技能集大小从 1 到 10 性能总体上升并逐渐饱和(图 3);种群进化预算 B 越大越好但边际递减(图 5);UCB 系数 β 与父代采样温度 τ_p 都呈"中间最优"的倒 U 形曲线(图 6、7),过小则多样性不足、过大则分配发散。
优化效率(图 1):在 Qwen3-8B 上随 rollout 数增长,DIVE 快速爬升,SFT 与 GEPA 在明显更低的水平早早平台化,GRPO 缓慢追赶但需要多得多的 rollout——无参数更新的文本空间优化反而有更好的性能—预算权衡。
六、效果优势的根源解释
DIVE 的优势不是魔法,可以拆成一条清晰的因果链。
6.1 单轨迹优化的病理
GEPA、SkillOpt 这类方法沿单轨迹优化一份技能,其失败模式有二:过拟合采样经验——反思子集就那么几十道题,反复对着它们打磨,技能记住了这批题的解法细节而非泛化原理;次优收敛——初始技能落进哪个"盆地”,之后的小步修订很难跳出去。论文附录里学到的技能恰好提供了反面证据:不同种群的技能收敛到共享的问题求解工作流(都会"字面解析→选择表示→先推导后代入→局部审计→全局审计→装箱"),但各自强调互补的解法策略与不同的错误来源——单轨迹只能占有其中一个视角。
6.2 DIVE 的三重解药
**解药一:多种群 bootstrap 降方差。**独立采样的经验子集意味着各种群"见过的事故"不同,理论上一系列独立尝试中至少一个找到低风险技能的概率随 K 指数级逼近 1。这直接对冲了"采样运气"这个最大方差来源。
**解药二:异构算子 + UCB 提高搜索效率。**论文理论部分定义了"有用提案质量"(useful proposal mass):一个算子的价值不在于平均产出的子代多强,而在于它把多少概率质量放在"超越自己最强父代"的修订上。四种算子在不同搜索状态下各有所长——强技能待精修时反思修复多产,现有策略共享同一失败模式时探索性修订更值钱,互补技能出现后重组才有用武之地。UCB 恰好把有限预算动态配置给当前状态下多产的机制。
**解药三:联合选择把轨迹多样性转译为实例级覆盖。**oracle 覆盖率的分解表明:一条技能的价值 = 它在"其他技能都失败的那些题"上的正确率。每个种群至多贡献一条技能的约束,强制最终集合保留不同盆地的解法。Qwen3.5-27B 上 SkillOpt 数学强逻辑崩、DIVE 全线均衡的现象,就是覆盖扩大的直接证据——十条互补技能像十位特长不同的专家会诊,各自负责自己擅长的题型。
6.3 反事实验证
消融实验提供了完整的三段反事实:去掉互补选择(M=1),GPT-5-nano 从 81.5 掉到 60.7;去掉联合选择改用单技能排序,Qwen3.5-9B 从 56.6 掉到 54.1;去掉 UCB 改均匀分配、再去掉多算子,性能逐级下滑。每个组件拿掉都疼,说明收益确实来自设计而非堆算力——尤其考虑到 ToT 的每实例调用数已与 DIVE 对齐,DIVE 的领先不能归因于测试时计算量。
七、必要知识反推
如果想在别的场景复刻 DIVE 的成功,需要前置掌握哪些知识?
7.1 领域层
- LLM 上下文学习机理:理解为什么一段自然语言指导能系统性改变冻结模型的行为,以及上下文预算的硬约束;
- 可验证任务的设计:DIVE 依赖二值验证器。什么任务能构造廉价的程序化验证(数学答案等价性、约束满足检查),什么任务不能,是适用性判断的第一道关;
- 推理时计算扩展:SC、ToT 的原理与成本结构,才能理解"多次调用 + 排序"这一层的定位。
7.2 方法论层
- 进化计算:种群、变异、重组、精英保留、bootstrap 采样——DIVE 的骨架就是一套自然语言版的进化算法;
- 多臂老虎机与 UCB:利用-探索权衡、置信上界、非平稳性。掌握这些才能理解预算分配层,也才能明白为什么论文诚实地说"非平稳场景不保证遗憾界";
- 集成学习思想:多样性-准确性权衡、边际覆盖、选择遗憾——联合选择本质是构造一个"技能集成";
- 优化理论直觉:非凸、随机搜索、方差缩减——把文本优化问题放进优化视角,才会自然得出"多样性是解药"的结论。
7.3 工程层
- 提示工程与结构化输出:六个任务各有严格输出契约(Sudoku 要求 Python 元组、Equational Theories 要求 VERDICT/PROOF/COUNTEREXAMPLE 字段),验证器解析依赖可靠格式;
- 数据管线:进化/验证/测试三分区的严格纪律,bootstrap 采样实现,轨迹摘要的上下文窗口分块与合并;
- 成本核算:每题调用 10.9 次、输出 20 万 token 的推理形态,要求工程上有缓存(验证集上每技能对每实例的回应只生成一次)与批量调度能力。
7.4 知识融合节点
DIVE 最大的启发在于一个跨界融合:把 LLM 技能优化(2024-2026 年的提示优化/经验学习文献)与进化计算的种群思想(上世纪的经典)结合。提示优化社区一直在"单轨迹"框架里打转,进化计算社区早就知道非凸随机搜索要靠种群与多样性。两者的对接点是把"技能"当作"基因型"、把"验证器反馈"当作"适应度"。类似的融合机会还有很多——bandit 方法用于算子分配、集成理论用于集合选择,都是"老工具解新问题"的范例。
八、通用性灵感
灵感一:多样性是非凸随机搜索的方差解药
核心思想:任何由 LLM 自我生成修订的优化过程(提示优化、技能进化、工作流改进)都是随机非凸搜索,单轨迹的成果高度依赖运气;并行维护多条独立轨迹再做选择,是控制这种方差的一般性方案。
论文证据:多种群 + 联合选择把 GPT-5-nano 从单技能的 60.7 推到 81.5;理论分析给出 $1-(1-q_\epsilon)^K$ 的覆盖提升论证。
推广场景:Agent 工作流自动设计、系统提示优化、代码生成策略搜索——凡是"让模型自己改自己的东西"的场景,都值得问一句"我维护了几条独立轨迹?"
灵感二:资产要按"边际覆盖"估值,而不是按单体成绩
核心思想:评估一个候选(技能、模型、方案)的价值时,看它对现有集合没有解决的问题的边际贡献,而非孤立评分。低单体高互补的候选可能比高单体高重叠的候选更有价值。
论文证据:联合选择(56.6)优于 Top-M 单技能排序(54.1)与随机选择(49.3);重组算子的第二父代显式按边际覆盖采样。
推广场景:集成模型的成员选择、RAG 语料的去重与补全、多专家路由系统的专家配置、甚至团队招聘——互补性只在集合层面存在。
灵感三:技能是可迁移的持久资产,“进化一次、处处受益”
核心思想:把经验沉淀为任务级自然语言技能而非模型私有调整,资产就获得了跨模型、跨规模的可移植性——训练成本付一次,收益可以被任何模型继承。
论文证据:Qwen3.5-9B 进化的技能搬到 DeepSeek-v4-flash 上直接把 73.9 抬到 90.5。
推广场景:企业为便宜模型离线进化技能库,在线服务时小模型 + 技能替代大模型(成本降 42.5% 的账本);技能库作为团队知识管理资产在模型升级时平移。
灵感四:把"怎么改"本身也交给进化
核心思想:优化算子(变异策略)不必人工定死,可以从优化历史中自动生成针对当前失败模式的新算子——搜索空间与搜索机制同层进化。
论文证据:第 8 步算子生成带来完整方法对 M-UCB 的额外提升(图 4 消融)。
推广场景:自动数据增广策略搜索、AutoML 中的算子发现、反思提示的自我改进——任何"元层面"可以数据驱动的迭代系统。
灵感五:测试时候选生成 + 排序是放大器,也是风险点
核心思想:多个互补假设各自出解、再由模型统一排序,把"找一个好方法"转换为"覆盖 + 选择"两个较容易的子问题;但排序器是新的误差来源(选择遗憾),候选越多不一定越准。
论文证据:聚合准确率 = oracle 覆盖 − 选择遗憾的分解;DIVE 用排序前固化的验证流程控制遗憾,贪心选择在边际提升非正时停止。
推广场景:多路召回 + 精排的经典架构、多 Agent 表决系统、代码生成的多补丁择优——设计这类系统时应同时度量覆盖与选择质量。
结语
DIVE 用一套"老智慧解新问题"的组合拳回答了冻结模型自我改进的方差难题:独立种群对冲采样运气,异构算子对冲搜索偏见,UCB 对冲预算浪费,联合选择把轨迹多样性兑换成实例级覆盖,候选排序把多条假设折叠成一个答案。在六个推理基准、多个模型家族上的全面领先,加上 42.5% 的推理成本优势与跨模型迁移能力,让"给冻结模型一本会进化的操作手册"成为参数更新之外一条切实可行的持续学习路径。对于关注 Agent 自进化与技能工程的读者,这篇论文值得精读的不仅是数字,更是它示范的方法论迁移方式——进化计算、bandit、集成学习这些成熟工具,在 LLM 时代的新问题域里依然锋利。
本文基于论文全文逐页阅读撰写。