论文链接:AlgoEvo | MOSCOPT | SkillLift 发表时间:2026年9月 机构:AlgoEvo:香港城市大学;MOSCOPT/SkillLift:独立团队 领域标签:cs.AI / Skill Optimization
一、论文背景
skill 优化的三条痛点(本三篇各治一个):
痛点一:优化产出的知识组织。多数 skill 优化方法产出的是"当前最优模板",搜索过程中的中间发现(哪些尝试为什么失败)被丢弃。AlgoEvo 追问:优化的副产品——经验——应该如何组织才能反哺后续搜索?
痛点二:单模板优化天花板。现有方法(GEPA、SkillOpt 系)都优化一个文本模板——但真实 Agent 任务需要多个互补技能协同(一个负责任务分解、一个负责代码生成、一个负责验证)。多个 skill 分别优化≠组合最优(inter-skill synergy 无人管)。MOSCOPT 治此。
痛点三:评估成本。skill 的每次修订都需要 oracle 评估(执行任务+判定成败)——oracle 贵且慢,优化预算被评估吃掉。SkillLift 治此:用学到的稠密 rubric 替代昂贵 oracle 引导大部分搜索。
共同的宏观背景:skill 库膨胀的负面证据正在积累——AlgoEvo 引证:库扩张可致性能降 21%(skill shadowing)、89% 真实 skill 有复用性缺陷。优化好的 skill 是防御库膨胀的根本手段。
二、论文定位和关联工作
| 研究脉络 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| Prompt/skill 进化 | GEPA、DSPy 系 | 轨迹反馈进化文本 | 单模板;AlgoEvo 组织经验,MOSCOPT 多技能 |
| 算法发现 | FunSearch、AlphaEvolve | LLM 进化搜索算法 | 固定管线;AlgoEvo agentic 化+skill hub |
| 代理评估 | surrogate 模型传统 | 便宜代理替代昂贵评估 | SkillLift 的 rubric 是结构化文本代理 |
| 元优化 | 双层优化传统 | 内外两层交替 | SkillLift/MOSCOPT 的形式化工具 |
| 同日 SkillSeam/Gavel | 集合结构/路由 | skill 系统学 | 三篇是"优化"维度 |
定位结论:三篇与同日的 SkillSeam(结构审计)、Gavel(路由)恰好覆盖 skill 生命周期的五个环节:组织(AlgoEvo)→协同(MOSCOPT)→评估降本(SkillLift)→路由(Gavel)→审计(SkillSeam)。skill 工程的学科拼图快速成形。
三、问题定义
AlgoEvo 的抽象问题:把算法发现从"固定管线搜索"变成"交互式知识积累过程"——Agent 在搜索中积累的经验如何组织成可跨任务复用的资产?
MOSCOPT 的抽象问题:联合优化 N 个互补 skill 与一个 gating skill G(每步动态选 K 个)——文本原生、免参数、单调改进。形式化:max E[任务回报 | G 选择技能子集,技能池 {S_1…S_N}],无梯度。
SkillLift 的抽象问题:双层优化——外层对齐稀疏 oracle(少量真实评估校准 rubric),内层用冻结 rubric 作稠密廉价信号引导 skill 修订。形式化:min |rubric(s) − oracle(s)| 使 rubric 成为 oracle 的忠实代理。
三个定义的互补性:AlgoEvo 管"经验的组织形态",MOSCOPT 管"技能的组合形态",SkillLift 管"评估的经济形态"——skill 优化的三块独立拼图。
四、问题解法
AlgoEvo 三组件:
- Agentic 搜索循环:自主 Agent 检查运行时反馈→诊断→编辑代码(不再是预定义控制流的提线木偶);跨范式转移成为可能(同一工作流处理单目标/多目标/多组件设计)。
- Design skill hub:范式特定知识(进化算法怎么调、局部搜索怎么配)与核心发现引擎解耦——hub 里的技能可插拔,单一工作流覆盖多范式。
- 三层经验库:L1 经验卡(单次搜索的教训)、L2 经验树(任务级轨迹组织)、L3 跨任务固化(反复出现的模式升级为可复用 skill)。经验从碎片到结构到资产的三级蒸馏。
MOSCOPT 三机制:
- N+1 结构:N 个技能 + 1 个 gating skill(每步选 K 个激活)——门控学会"什么情况用什么组合"。
- EditAdam 双态:每个 skill 维护双状态(动量式文本编辑优化器——借鉴 Adam 的自适应思想到文本空间:动量态累积改进方向、方差态调节步长)。
- 三阶段交错更新:技能池→门控→再技能池的交替循环保证整体单调改进(无梯度但有保证)。
SkillLift 双层:
- 外层 rubric 学习:少量 oracle 评估(稀疏)→ 学对齐的评估 rubric(结构化文本的评分标准)。
- 内层廉价搜索:冻结 rubric 评每次 skill 修订(稠密、便宜),只有 rubric 认为有希望的方向才升级到 oracle 验证。
五、评估指标与实验证据
| 研究 | 实验 | 结果 | 证明什么 |
|---|---|---|---|
| AlgoEvo | 6 代表任务 vs 专用方法 | 匹配或超越,评估数与 token 大减 | 经验组织+hub 解耦的效率 |
| AlgoEvo | 任务内累积 | 强 intra-task accumulation | 经验库的即时价值 |
| AlgoEvo | 跨任务转移 | cross-task transfer 成立 | L3 固化层有效 |
| MOSCOPT | 5 基准 × 3 LLM | 优于单模板优化基线 | 多技能协同>单模板 |
| MOSCOPT | 消融 | EditAdam 与三阶段各贡献 | 组件必要性 |
| SkillLift | rubric 代理质量 | oracle 对齐的 rubric 显著降评估成本 | 双层解耦有效 |
证明力分析:AlgoEvo 的"评估数与 token 大减"是最实用的数字——算法发现的成本瓶颈就在评估(跑 benchmark),经验库让搜索少走弯路。MOSCOPT 的跨 3 LLM 一致性说明协同收益不依赖特定模型(文本空间的组合效应是普遍的)。SkillLift 的证明力核心在 rubric 的忠实性——如果 rubric 与 oracle 相关性低,内层搜索会跑偏;论文的对齐实验直接支撑代理质量。
六、效果优势的根源解释
根源机制与证据链
- 经验的分层蒸馏(AlgoEvo 论文实验已支持):单次搜索的教训(L1)零散,直接复用检索成本高;组织成树(L2)后同任务的搜索有先验可循;固化(L3)后跨任务可迁移——三层的价值递进在 intra-task/cross-task 两个实验中分别体现。机制上这是信息压缩:轨迹级经验→模式级资产。
- 门控+池的组合空间搜索(MOSCOPT 论文实验已支持):单模板优化在组合任务上的天花板来自"一个模板无法同时最优于所有子任务阶段";门控允许阶段化最优组合,机制上等价于混合专家的文本版(routing 在技能间而非参数间)。
- 代理评估的经济学(SkillLift 论文实验已支持):oracle 成本集中在"评估的绝对次数";rubric 把大部分评估转移到便宜信道,oracle 只校准——这是经典的模拟器替代真实实验模式在 skill 优化中的应用。
相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| GEPA | 轨迹级 prompt 进化 | 优于反思式优化 | 单模板 | 支持:经验信号有效;MOSCOPT 突破其单模板假设 |
| FunSearch | LLM 进化发现算法 | 数学新结果 | 固定管线 | AlgoEvo agentic 化的对照 |
| DSPy | 声明式 prompt 编程 | 模块化优化 | 程序级 | 支持:模块化思想 |
| Dream-RSI(同日) | 重放改进探索策略 | 策略层 RSI | AlgoEvo 的经验库与其重放池同构 | 支持:经验资产化的跨层共识 |
| SkillSeam(同日) | 集合结构审计 | 库膨胀成本病 | 审计侧 | 补充:优化是治理的正面战场 |
| Gavel(同日) | 内生路由 | 冻结模型路由 | 路由侧 | 补充:MOSCOPT 的 gating 是学习版路由 |
综合判断与未决问题
多研究共同支持:经验/轨迹信号优于纯指令信号(GEPA+Dream-RSI+AlgoEvo);模块化组合优于单模板(DSPy+MOSCOPT)。仍属推测:MOSCOPT 的 N(技能数)增到多大会遇到组合搜索的维度灾难(论文的 5 基准规模未触及);SkillLift 的 rubric 对"风格敏感"任务的保真度(评分主观性高的任务 rubric 难对齐)。适用边界:三篇都需要任务有可评估的执行反馈(oracle 存在);纯创意无 ground truth 的任务不适用。可能的失效条件:任务分布漂移后经验库/技能池过时——需要持续再校准机制(论文均为静态优化设定)。
七、必要知识反推
领域知识层:算法发现的评估传统(benchmark 的成本结构);skill 的形态学(描述/触发/工具三元组的可优化维度);MoE 架构思想(MOSCOPT 的门控类比来源)。
方法论知识层:进化搜索的种群管理与收敛保证;双层优化的交替求解;代理模型方法学(忠实性验证——代理必须被证明与真目标相关才可用);Adam 优化器的机制(双态设计的类比来源)。
工程知识层:长轨迹的结构化存储与检索(AlgoEvo 的经验树实现);文本编辑的原子化与回滚(skill 修订的版本管理);oracle 评估的预算调度(SkillLift 的升级触发策略)。
知识融合关键节点:AlgoEvo 融合"软件工程的知识管理"与"进化搜索"——经验库的分层是知识管理思想,搜索是进化计算。MOSCOPT 融合"深度学习的 MoE"与"文本优化"——把 routing 概念从参数空间移植到文本空间。SkillLift 融合"实验科学的降本传统"(代理模型/模拟器)与"skill 工程"。
八、通用性灵感
- 经验的分级蒸馏:把过程性经验从碎片(记录)到结构(组织)到资产(固化)三级处理,才能跨情境复用(论文证据:AlgoEvo 三层库的递进价值)。推广:科研组的实验记录→组内 wiki→方法论论文;客服的个案处理→专题 FAQ→服务设计原则。
- 门控组合优于单一最优:当任务的各阶段需要不同专长时,“学会什么时候用谁"比"找一个全能模板"更有效(论文证据:MOSCOPT 优于单模板基线)。推广:团队排班(任务阶段化匹配)、医疗 MDT 的按需召集。
- 昂贵评估的代理化降本:优化/搜索的瓶颈常在评估——学一个忠实的便宜代理承担大部分评估,真评估只做校准(论文证据:SkillLift rubric 双层)。推广:A/B 测试的离线代理(用户模拟器)、新材料筛选的 ML 势函数。
- 范式知识与执行引擎解耦:把"怎么做某类事"的方法论做成可插拔模块,核心引擎保持通用(论文证据:design skill hub 让单一工作流覆盖多范式)。推广:咨询公司的方法论工具箱、数据分析的平台+插件架构。