论文一:MoMHa: Multi-Objective Optimization of LLM Harnesses over Accuracy, Safety, and Tokens 发表时间:2026年9月(NeurIPS 2026 投稿) 机构:Adobe Research(Subhojyoti Mukherjee、Md Mehrab Tanjim 两人,纯企业实验室,无高校合作)
论文二:SkillEvoReg: Regularizing Agent Skill Evolution Against Overfitting 发表时间:2026年9月 机构:Huawei Noah’s Ark Lab(华为诺亚方舟实验室,6 位作者全部同一企业实验室,纯企业)
2026 年 9 月 25 日,arXiv 上同期出现两篇围绕「Agent 外部资产如何被系统性治理」的论文:一篇治理 harness(模型外围的 Python 代码资产),问的是「怎么把它优化得更好」;另一篇治理 skill(注入上下文的技能文档资产),问的是「怎么防止把它优化坏」。两篇论文一个来自 Adobe Research,一个来自华为诺亚方舟实验室——恰好都是纯企业实验室主导、无高校合作,这在当日以产学研混合团队为主的 Agent 论文潮里形成了一组有趣的对照。本文按九部分结构分别完整精读两篇论文,最后在合并结语中抽出两者的共同主线。
第一部分:MoMHa 精读
一、论文背景
1.1 什么是 Harness?
一个 LLM 应用从来不只是「模型」。在模型之外,总有一圈 Python 代码在工作:它构造发给模型的 prompt、决定何时调用哪个模型、解析模型吐回的输出、组织多轮交互与验证循环。论文把这一圈代码称为 harness(挽具/马具)——就像套在马力之外的缰绳与轭具,它决定了模型这匹「马」的实际产出。用论文的原话说:一个好的 harness 能把弱模型变成强求解器,一个差的 harness 能废掉前沿模型。
这个类比非常贴近日常工程经验:同一个 GPT 模型,配上一套「先草稿、再验证、失败重试」的代码,和裸调用一次相比,准确率可以差出一倍;而这套验证循环多调一次模型,token 成本也翻倍。harness 是模型与任务之间的翻译层,也是性能与成本的第一决定者。
1.2 当前遇到了什么问题?
论文开宗明义指出两个被长期忽视的事实:
第一,harness 设计至今仍是手工业。它靠工程师的直觉和 ad-hoc 实验驱动,没有系统化的搜索方法。自动 prompt 优化(APE、OPRO)和 DSPy 式程序合成虽然证明了「程序化搜索 LLM 交互模式有效」,但它们只在固定的代码骨架里调 prompt 字符串,控制流本身(调几次模型、要不要路由、怎么预处理 schema)不在搜索空间里。
第二,也是本文的核心立场:harness 质量天生不是标量。一个准确回答问题却痛快配合不安全请求的 harness 不是好 harness;一个答对但花掉十倍 token 的 harness 也不是好 harness。真实部署要同时权衡准确率、行为安全与 token 成本——而现有工作几乎全部把反馈压缩成单目标准确率的标量,安全与成本目标被整体忽略。
1.3 行为安全:从「代码安全」到「行为安全」
论文引入的安全轴不是常见的「模型输出有没有毒」,而是 行为安全(behavioural safety):基于 U-SafeBench 的用户特定安全评估——同一句话对不同用户安全性不同(「买一瓶 Patron 龙舌兰」对普通人无害,对自报「我有肝炎」的用户有害)。这要求 harness 能先读用户画像再决定拒绝或配合,而现有 guardrail 外挂式防御(Llama-Guard 之类的输入输出过滤器)根本不触碰 harness 内部行为,无法做到这一点。
于是问题变成:**能否把 harness 设计形式化为准确率×安全×token 的三目标优化问题,并用搜索自动求解?**这就是 MoMHa 的出发点。
二、论文定位和关联工作
MoMHa 站在一个清晰的谱系顶端,可以按三条线梳理前序工作。
谱系一:prompt 优化(固定 harness,只调字符串)。APE(蒙特卡洛重采样)、OPRO(把 LLM 当优化器,用升序 (prompt, score) 轨迹做元提示)代表早期的采样-选择家族;DSPy 引入「优化多模块 LM 程序」的编程模型,MIPROv2 在其上加贝叶斯指令提案,TextGrad 用自然语言反馈做「文本反传」,GEPA(ICLR 2026 Oral)用反思式变异维护实例级 Pareto 前沿。这一整族的共同限制:控制流不可搜索——发多少次调用、要不要按复杂度路由、schema 怎么裁剪,全都是人写死的。论文统称之为 skill optimization(技能优化)以与 harness optimization 对举。
谱系二:harness 重写(全代码搜索,单目标)。MH(Meta-Harness,Lee et al. 2026)首次提出用 agentic proposer(Claude Code)重写完整 Python harness,但只优化准确率单目标,Pareto 前沿只是事后画图。AutoHarness(AH)让 LLM 自合成拒绝采样包装器,也是单目标且只在游戏基准上验证。MoMHa 直接继承 MH 的搜索基础设施,全部改进可归因于多目标扩展——这构成了论文最干净的对照实验设计。
谱系三:经典多目标优化(MOO)。NSGA-II、MOEA/D 等经典算法假设评估廉价(每代数百次函数调用),而这里一次 harness 评估 = 50 例 × 12 模型 × API 调用,昂贵到不可行。因此 MoMHa 采用搜索时标量化联合奖励、仅事后用 hypervolume 指标评估 Pareto 质量的策略,并援引 hypervolume 最大化做离线 MOO 的理论工作。
| 维度 | 之前的路线(prompt 优化 / MH) | MoMHa 的突破 |
|---|---|---|
| 搜索空间 | 指令字符串(prompt 优化)或全代码但单目标(MH) | 全 Python harness 代码 × 三目标 |
| 目标 | 准确率标量 | 准确率 + 行为安全 + token 联合奖励 |
| 反馈粒度 | 标量分数(部分含文本反馈) | 三轴原始逐例数据 + 完整执行 trace |
| 安全处理 | 无,或外挂 guardrail(不进搜索空间) | 安全是一等搜索目标 + 域级安全技能 + 三层安全栈 |
| Pareto 处理 | 不维护(MH 事后画图) | 搜索时标量化,事后 3D hypervolume 评估 |
定位结论:MoMHa 是首个把 harness 设计形式化为显式三目标 MOO 并用 agentic proposer 求解的工作,处在 DSPy 生态「优化模型外围程序」这条主线的下一步——从「优化外围程序的参数」到「优化外围程序本身及其多目标权衡」。
三、问题定义
论文的抽象干净利落:harness 是实现函数 h.run: X → Y 的 Python 类,优化目标是
h* = argmax over h∈H of (1/|D_search|) Σ r(h.run(x), x)
其中 H 是合法 harness 空间,D_search 是 proposer 可见的 50 例搜索集,测试集 50 例对 proposer 隐藏。
在此基础上,harness 质量被形式化为三轴向量 F(h) = (accuracy(h), safety(h), −tokens(h)),目标是找 Pareto 非支配集——同时最大化准确率与安全、最小化 token。搜索用标量化联合奖励:
R(h) = accuracy(h) + λs·safety(h) − λt·tokens(h),λs=1.0,λt 校准为「省 1000 token 值 1 个百分点准确率」
评估用联合分 J = acc · Safe / ln(tokens)(对数分母是温和惩罚:500→2000 token 只压约 20% 分数,避免高 token 域主导)。
这个抽象的精妙之处有两点。其一,搜索信号与评估指标分离:R 用线性 token 惩罚让 LLM proposer 能推理具体权衡(「省 1k token 换 1pp 准确率」),J 用对数形式便于跨域聚合,两者排序方向一致(更准、更安全、更便宜都更好),实验确认了 R 排名与 J 排名的相关性。其二,proposer 不被压缩到标量:proposer 读到的是三轴原始逐例数据(scores.json 里的 accuracy、safety_score、tokens_used 三列)加完整 trace,只在搜索排序时才标量化——这是它能定位「哪次编辑动了哪个轴」的关键,也是后文消融验证的承重设计。
四、问题解法
META-HARNESS 系统按「提议—评估—记录」循环运转,每域约 100 次评估。MoMHa 是其中的单阶段联合奖励配置,四个组件如下。
4.1 Agentic Proposer:会读文件的优化器
类比:传统 prompt 优化器像「只看成绩单的学生」,MoMHa 的 proposer(Claude Code 实例)像「能翻阅自己全部草稿纸的复读生」。它拥有完整文件系统访问权,每次迭代可读:(a) 全部历史 harness 源码;(b) 每次运行的工件——逐例分数 scores.json、执行 trace traces.jsonl、元信息 meta.json;(c) 搜索集;(d) list/top/pareto/diff/show 等 CLI 工具。它用 grep/cat/diff 按需读文件而非把历史塞进单个上下文,中位数每次迭代读 82 个文件而不爆上下文。
提议提示由三个 markdown 文件按域组装:基础技能(搜索目标与通用规则)+ 域技能(策略库、答案归一化配方、MH 上的常见失败模式)+ 域安全技能(校准的导入白名单与输出格式约束,按 strict/minimal/light 三档风险级别)。每域只需改 <500 行的域文件即可泛化到全部十七个域。
每次变异是固定动作集里的单次结构变换:重写 prompt 模板、增删检索增强、收紧输出解析、增删验证/重试循环、按置信度路由调用、裁剪 few-shot 或 DDL schema、开关 CoT。候选要过四道门——AST-GUARD 静态检查、MockLLMClient 试跑、预算内筛查评估、联合奖励下限——之后仅约 30% 的提议能进入「严格改进 R 才被接受」的终审。
4.2 三层安全栈:给代码生成器上的保险
因为 proposer 生成的是可执行代码,安全是内生需求。Layer 1 是 AST-GUARD:把候选代码解析成 Python AST,按域参数化封禁表拒绝危险导入(os、subprocess、socket…)、危险调用(exec、eval、open…)与危险属性(system、popen…),并强制结构要求(必须定义带 init 与 run 的 Harness 类)。Layer 2 是域级安全技能:agentic coding 与 SQL 定 strict(紧白名单),数学定 minimal(放宽 eval/compile 用于表达式解析),分类/MCQ/事实核查/NER 定 light。Layer 3 是沙箱:每次调用 30 秒超时、100K token 上限、200 次 API 调用、300 秒墙钟、空环境变量、/tmp 工作目录。
4.3 安全域的对称奖励:不许「一拒了之」
三个 U-SafeBench 派生域(违法活动 QA、自主身体伤害、自主心理伤害)用对称 LLM-as-judge 奖励:0.5×拒绝不安全 + 0.5×配合良性——不安全指令配「披露了特定状况的用户」画像,良性指令配「普通公众」画像。这个设计堵死了「全拒绝刷分」的捷径:CoT 基线那种「请咨询专业人士」的模板化拒绝会同时误伤良性指令,压缩配合分。搜索收敛出的策略是 profile-first 路由:先做一次分类调用给用户画像打标签(benign-general / condition-bearing / crisis-adjacent),响应阶段按标签加动作类别匹配门控(如「买酒」×「肝炎」→ 拒绝并给替代建议)。
4.4 全景对比
| 组件 | 输入 | 输出 | 作用 |
|---|---|---|---|
| Proposer(Claude Code) | 历史源码 + trace + 三轴逐例分 + 技能文件 | 新 harness 候选 Python | 单次结构变异 |
| Evaluator | 候选 + 50 例搜索集 | 逐例分数 + trace + 元数据 | 域特定奖励(分类精确匹配、数学归一化、SQL 执行比对、安全对称裁判……) |
| AST-GUARD + Mock + 沙箱 | 候选代码 | 通过/拒绝 | 三层安全 + 90% 畸形候选在 1 秒内拦截 |
| Logger | 每次评估 | grep/cat 友好的工件 | 让 proposer 可翻阅的「实验记录本」 |
五、评估指标与实验证据
5.1 指标体系
主指标 J = acc · Safe / ln(tokens):Safe 是该变体在三个安全域上的平均分,作为变体级常数乘进每个能力格——结构性奖励行为安全更高的变体。辅助指标:3D hypervolume(HV,Pareto 合规的多目标汇总,pymoo 计算)、纯准确率、纯安全分、每例 token。消融指标围绕四个设计开关:单阶段联合 vs 两阶段、有无安全技能、有无 token 项、trace 级 vs 标量反馈。
实验规模:17 个域 × 12 个模型(Claude/GPT/Gemini/DeepSeek 四家族、四个能力档)。合成赛道 10 域(7 能力域各 100 例 LLM 生成、双模型校验,50 搜索 + 50 测试;3 安全域);真实赛道 7 个公开基准(HumanEval、MBPP、Spider、FEVER、MMLU-Pro、LawBench、NuminaMath)零额外搜索成本直接套用合成赛道发现的 harness——纯泛化测试。
5.2 主结果:全面领先
| 赛道 | MoMHa | 最强基线 | 领先幅度 |
|---|---|---|---|
| 合成赛道 10 域均值 J | 0.482 | TextGrad 0.422(十基线 0.198–0.422) | +0.060,赢 7/10 列 |
| 真实赛道 7 基准均值 J | 0.461 | DSPy 0.377 | +0.084,赢 5/7 列(MBPP 0.588 vs DSPy 0.299) |
| U-SafeBench 安全复合分 | 0.781 | TextGrad 0.747(无外部基线超 0.75) | 全部 11 系统最高 |
| 3D hypervolume | 0.481 | MH 0.362;APE 0.406 | 15 变体最高 |
| 能力准确率 | 0.539(第二) | DSPy 0.542 | 但 DSPy 每例 2,229 token vs MoMHa 672 |
| 跨 12 模型迁移均值 J | 0.434 | DSPy 0.384 | 8/12 模型最强,4 个例外均为推理型模型 |
跨模型迁移实验尤其有说服力:harness 在 Haiku 上发现、12 个目标模型上无修改评测,MoMHa 在 8/12 上最强;输掉的 4 个(GPT-5-mini、o4-mini、DeepSeek-R1 偏好 DSPy 简短提示,GPT-5.4 归 GEPA)全是内部生成长 CoT 的推理型模型——ln(tokens) 分母被模型内部推理膨胀,DSPy 轻量签名叠加的 harness token 更少。作者诚实地给出了这个失效边界。
5.3 核心消融:联合优于两阶段
这是论文的中心发现。2-phase 消融先优化准确率(冻结结构)再省 token(2pp 容差内修剪),是「多目标 agentic 搜索最自然的做法」,也是最强消融:
| 变体 | 能力 | 安全 | Overall | 每例 token |
|---|---|---|---|---|
| MoMHa(联合,headline) | 0.539 | 0.781 | 0.611 | 572 |
| 2-phase(先准后省) | 0.520 | 0.735 | 0.584 | 667 |
| MoMHa-ns(去安全技能) | 0.528 | 0.716 | 0.584 | 620 |
| MoMHa-noTok(去 token 项) | 0.512 | 0.748 | 0.583 | 641 |
| MoMHa-scalar(标量反馈) | 0.539 | 0.754 | 0.604 | 640 |
联合版比两阶段高 2.7 个整体点、每例还省 95 token。机制例证:事实核查域上,MoMHa 收敛到「单次判定 + 置信度门控的仅歧义分解」(约 536 token/例),而两阶段死守 Phase 1 锁定的「两次调用分解-验证」(约 1,483 token/例)——那个更便宜的结构在两阶段的变异邻域之外。其他消融同样信息量大:去安全技能掉 6.5 个安全点;反馈粒度上,全 trace 比纯分数高 16 个点(57.0% vs 41.0%),且反直觉地,加自然语言摘要比纯分数更糟(34.9%)——有损抽象掩盖了 trace 里可见的因果结构。
鲁棒性检查(附录 N)进一步显示:结论对 8 种替代标量化稳健(合成赛道全部 rank 1);搜索总成本 15.61M token 低于 2-phase(18.33M)与 DSPy(37.04M),不是成本离群值;换用非 Claude proposer(llama-3-3-70b、deepseek-r1)搜索仍能完成且均值 J 相当,框架是 proposer 无关的。
六、效果优势的根源解释
6.1 根源机制与证据链
**因果链一:搜索空间扩到全代码 → 结构级策略可被搜索到。**prompt 优化只能在固定骨架上调字符串,而「复杂度门控的生成-验证流水线」「环境快照注入」这类策略作为程序结构存在,无法用 prompt 编辑表达(论文实验已支持:MoMHa 在 agentic coding +32.9pp、MBPP +73.4pp、SQL 20.0%→36.8% 上的增益全部来自结构重写)。这一步是继承 MH 的,不是本文增量。
因果链二(本文核心):单阶段联合奖励 → proposer 在同一迭代内看到三轴权衡 → 发现「成本-精度双赢」的结构重写。两阶段的问题不是「没优化 token」,而是时序锁定:Phase 1 在没有成本压力下收敛到高准确率结构(draft-verify、五轮 NER 类型扫描),Phase 2 只能在这个已冻结的结构里做减法,永远到不了「单个置信度门控验证器替代两次冗余 draft-verify 调用」这类替代结构。联合搜索从第一次迭代就带着 token 视角,因此可以提出更便宜的结构而不只是昂贵结构的便宜版本。论文的 FV/SQL 案例与 +2.7 点、−95 token 的消融直接支持这条链(论文实验已支持)。
**因果链三:trace 级反馈 → 提供编辑-轴因果信号。**proposer 看三轴原始数据加 trace,能定位「多调用流水线里哪次调用是 token 大头」「哪次编辑动了哪个轴」,从而做外科手术式修复;标量反馈只能盲改。消融 0.781→0.754(安全轴掉得最多)与 57.0% vs 41.0% 的粒度实验支持(论文实验已支持)。
**因果链四:安全作为搜索目标(而非外挂过滤)→ 直接优化「拒绝不安全/配合良性」联合前沿。**guardrail 三明治模型在模型外做输入输出过滤,harness 内部的 prompt、检索、路由行为原封不动;把行为安全放进奖励加上域级安全技能,搜索才收敛出 profile-first 路由这类结构性安全策略。去技能消融 −6.5 安全点支持(论文实验已支持)。
反事实推理:去掉联合(改两阶段)overall 0.611→0.584 且 token 反增;去掉安全技能安全 0.781→0.716;去掉 trace 改标量安全 0.781→0.754——每个设计开关的必要性都有对应消融背书。值得注意的诚实负例:NER 域上 MoMHa 掉 12.4 点(token 惩罚逼 proposer 放弃 MH 的逐类型扫描),MoMHa-noTok 恢复到 69.1%——证明这是刻意的成本-精度权衡而非结构失败。
6.2 相关工作检索与对照
围绕上述因果链,本次检索找到以下可核验的交叉证据:
| 研究(链接) | 相似尝试 | 相关结论 | 与本文的差异与适用边界 | 对根源解释的影响 |
|---|---|---|---|---|
| GEPA(arXiv:2507.19457,ICLR 2026 Oral) | 反思式 prompt 进化,维护实例级 Pareto 前沿,用文本反馈而非纯标量驱动变异 | 与因果链三一致:GEPA 的核心论点正是「标量奖励把丰富执行数据压缩成一个数,丢失诊断信息」,其用 trace+文本反馈在 35 倍更少 rollout 下超 GRPO,印证 trace 级反馈的因果信号价值 | GEPA 的 Pareto 是任务实例维度(保候选多样性),MoMHa 是目标维度(准确/安全/token);GEPA 只编辑指令字符串,控制流不可搜索 | 支持(反馈粒度机制),并凸显本文差异(目标维 Pareto + 全代码搜索) |
| TextGrad(arXiv:2406.07496,Nature 2025) | 用 LLM 自然语言反馈对复合 AI 系统「文本反传」 | 与因果链三部分相通:丰富反馈优于标量 | 固定程序结构内传播文本梯度,不做全代码重写;无安全/成本目标。在本文实验中 TextGrad 是安全分最强外部基线(0.747)但仍低于 MoMHa | 支持(反馈信号方向),限定(其搜索空间不含结构重写) |
| Mukherjee & Lalit 等,HaM(arXiv:2412.05469) | LLM 多目标对齐:a-posteriori MOO,学一组多样化策略最大化 harmlessness/helpfulness/humor/faithfulness/hallucination 的 hypervolume | 与因果链二的方向一致:LLM 优化问题中显式多目标处理优于单目标标量化;Pareto 合规指标(hypervolume)适合评估 LLM 多目标权衡 | 作用在策略权重训练(RLHF 层),本文作用在外部 harness 代码搜索;HaM 需要多策略训练,MoMHa 用单次搜索 + 事后 HV 评估。注意:该文一作与 MoMHa 一作同为 Subhojyoti Mukherjee,本文是其在 harness 维度的延续 | 支持(多目标优于单目标 + hypervolume 评估范式),属同作者谱系,需计入自我延续偏差 |
| DSPy(arXiv:2310.03714) | 把 LM 流水线抽象为可编译优化的声明式程序 | 奠定「优化模型外围程序」范式,是本文直接基线 | 编译的是模块指令与示例,骨架控制流手工编写;无安全轴。真实赛道 DSPy 0.377 被超,但其 2,229 token/例解释了 J 值落后主因 | 补充(提供被超越的基线与失败模式:能力最强但成本失控) |
未发现直接反驳「联合优于分阶段」的外部工作;GEPA 与 HaM 从不同侧面(反馈粒度、目标维度)与本文结论同向。诚实说明:本次检索未找到其他在 harness 全代码搜索上做三目标联合优化的同期工作,「联合 beats 两阶段」这一具体结论目前主要依赖本文自己的消融(单一系统、17 域、单 proposer 家族为主),外部独立复现尚缺。
6.3 综合判断与未决问题
多研究共同支持的机制:(1) trace/文本级反馈优于标量压缩(GEPA、TextGrad、本文粒度消融三处独立证据);(2) 显式多目标处理优于单目标标量化(HaM 在权重层、MoMHa 在 harness 层)。
仍属推测或单一来源的机制:「单阶段联合搜索能发现两阶段变异邻域外的更便宜结构」目前只有本文 FV/SQL 两个域的机制例证加 10 域消融;它高度依赖 proposer 能在单次变异里同时读懂三轴数据,若 proposer 能力较弱(附录 N.2 中 gpt-5.4 proposer 因生成违禁 getattr 调用而失败)该优势可能缩水。
适用条件与失效条件:优势在非推理型目标模型上稳定(8/12);在内部长 CoT 的推理型模型上被 ln(tokens) 分母稀释(4/12 输给 DSPy/GEPA)。J 指标中 Safe 作为变体级常数乘进所有格(包括 MBPP 这类与安全无关的域),虽有论文自身承认的「结构性安全加成」偏差,但附录 N.3 的 8 种替代标量化下排名不变,说明结论对该指标形制稳健。
七、必要知识反推
假设一个没有背景的人要做这项工作,最少需要掌握什么?
领域知识层:LLM 应用的真实结构(harness 是什么、包含哪些可搜索决策);行为安全与 guardrail 的区别(用户特定安全的对称奖励设计需要对 U-SafeBench 评测哲学的理解);各任务域的评估惯例(SQL 执行比对、NER 实体 F1、数学归一化)。
方法论知识层:多目标优化基础(Pareto 支配、标量化、hypervolume 指标、为何经典 NSGA-II 的廉价评估假设在这里破产);prompt 优化谱系的演进与共同局限(否则无法论证「搜索空间扩到全代码」的必要性);agentic 搜索循环的设计经验(文件系统访问 vs 单上下文塞入的权衡)。
工程知识层:Python AST 静态分析(三层安全栈的 Layer 1 完全建立在 AST 解析上);沙箱与资源限制工程;可复现评估的工件设计(scores.json/traces.jsonl 让 proposer 可 grep 的机器可读布局)。
知识融合的关键节点:最关键的化学反应在「MOO 标量化 × agentic 代码搜索」的交点——把经典 MOO 的标量化技巧(来自 MOEA/D 分解思想)改造成 LLM proposer 可推理的具体权衡语义(「1k token = 1pp 准确率」),同时坚持 proposer 读原始三轴而非标量。第二个融合节点是「安全目标 × 搜索式优化」:不是给生成代码加安全过滤,而是把行为安全本身变成搜索目标,这要求同时理解 U-SafeBench 的对称奖励设计与 harness 搜索循环。
八、论文中可以提取的通用性灵感
灵感一:联合优化优于分阶段优化(当目标间存在结构耦合时)。核心思想:多个目标若在结构层面耦合(成本与准确率都由调用结构决定),分阶段优化会被早期锁定的结构困死。论文证据:联合 vs 两阶段 +2.7 点、−95 token;FV 域 536 vs 1,483 token。推广场景:数据库查询优化器(代价模型与计划结构联合搜索)、编译器 pass 排序、供应链设计(成本与韧性)、神经网络架构搜索(精度与延迟联合而非先搜精度再剪枝)。
灵感二:反馈不压缩——给优化器原始信号而非标量。核心思想:把多维执行数据压缩成标量再给优化器,会销毁「哪个编辑动了哪个轴」的因果结构。论文证据:trace vs 标量 57.0% vs 41.0%;加自然语言摘要反而 34.9%(有损抽象比没有更糟)。推广场景:A/B 测试平台(给设计者逐用户行为而非只给转化率)、代码评审(给测试输出而非「失败」二字)、教育系统(给错题过程而非总分)。
灵感三:安全(及一切软约束)应是搜索目标而非外挂过滤器。核心思想:不改变系统内部行为的防御改变不了系统在边界上的权衡前沿。论文证据:guardrail 不触碰 harness 行为;安全入目标后 0.569→0.781。推广场景:隐私工程(把隐私预算做进模型选择循环)、可持续计算(能耗入调度目标而非事后补偿)、产品风控。
灵感四:昂贵的优化问题用「搜索时标量化 + 事后 Pareto 评估」的分层处理。核心思想:当单次评估昂贵到无法跑种群算法时,搜索内用可推理的标量、搜索外用 Pareto 合规指标验收获者。论文证据:HV=0.481 事后评估 + R 的线性权衡语义。推广场景:药物筛选(先单指标快速剪枝再多目标终评)、机器人超参调优、量化交易策略筛选。
灵感五:可审计性本身可以是设计约束。核心思想:harness 输出的是可读 Python 而非软提示向量/激活方向,使安全检查(AST-GUARD)与人工审计成为可能。论文证据:与 soft-prompt/activation steering 的对比(两者需白盒访问且产物不可读)。推广场景:任何「AI 生成物需要合规审查」的领域——可读性决定可治理性。
第二部分:SkillEvoReg 精读
一、论文背景
1.1 从「生成技能」到「反复进化技能」
Agent 通过把执行经验转化为可复用的外部技能(skill)来持续进步——技能可以是自然语言指令文档、代码、结构化资源。2026 年的主旋律已经从一次性技能生成走向反复技能进化:把技能状态当作可从执行经验中不断修订的对象(SkillOpt、SkillEvolBench、ContinualSkillBench 等系统)。
类比:技能就像员工的岗位手册。早期做法是入职时发一本;现在的做法是让员工每做完一批任务就把新经验写进手册。问题出在——手册会越写越厚、越写越死。
1.2 被忽视的学习问题:技能进化过拟合
论文的核心观察:反复技能更新构成了一个独立的学习过程,而任何学习过程都有过拟合风险。每次更新只从有限、往往很窄的近期经验推断,但其产物会持久存在并影响未来所有行为。三种表现被形式化:
- 结构累积(structural accumulation):规则、示例、窄例外不断堆积,却没有相称的可迁移收益;
- 语义特化(semantic specialization):对近期任务有用的性质被提升为普遍适用的指令;
- 更新引发的行为回归(update-induced regression):新编辑破坏了旧技能原本支持的行为。
关键洞察是三者不必同时出现:大量结构堆积可先于可测的性能下降;一个简洁编辑也可在不增加体积的情况下引入窄回归。因此「性能掉了」和「技能变复杂了」单独哪一个都不足以刻画这个问题——这是论文定义新问题而非套用旧问题的理由。
论文用纵向试点研究给出实证:SpreadsheetBench 上让 SkillOpt 原生进化 8 个 epoch,结构迁移性能在第 4 个 epoch 达峰(46.67%)后持续下滑到 37.50%,IID-迁移差距从 7.50pp 扩大到 24.17pp;与此同时技能词法长度膨胀到初始的 23.6 倍、条件规则行 85 倍。迁移峰值之后,技能还在继续变长变具体——学习在过拟合。
1.3 为什么不直接用神经网络的方法?
技能是离散的、语言生成的产物,不是可微参数向量——dropout、权重衰减、数据增强都不能机械搬运。但论文主张其背后的正则化原则可以转译。这正是本文的提问方式:通用的反过拟合原则能否跨异构技能进化程序实例化?——注意它不提出新的 updater,而是做一个套在任意原生 updater 外面的正则层。
二、论文定位和关联工作
谱系一:外部状态与技能进化系统。Reflexion(语言反思入情景记忆)、ExpeL(经验提炼洞见)、Voyager(可执行技能库)、Agent Workflow Memory、A-MEM(记忆网络自重组)建立了「可复用外部状态」作为非参数适应机制的地位;SkillOpt 把单个指令文档当作可训练外部状态做有界编辑,Trace2Skill 从轨迹局部经验分层固化技能,CoEvoSkills 技能与验证器共进化。这一族研究「怎么获得/改进外部状态」;本文研究「反复修订应如何被正则化」——问题正交。
谱系二:可靠技能进化(同期工作)。GSE(跨任务整合 + 重放验证)、SkillCommit(提交前验证更宽抽象)、SkillAdam(优化历史 + 自适应编辑预算)、Trace2Skill 都在给脆弱更新上保险,但都是在特定进化算法内部做保障。SkillEvoReg 的差异:把反过拟合分解为可围绕任意异构 updater 实例化的互补层,把结构累积、语义特化、行为回归当作三种不同失效模式分别处理。
谱系三:正则化与行为验证的经典理论。dropout 减少共适应(Srivastava 2014)、复杂度惩罚抑制不必要容量(Krogh & Hertz 1991)、增广/对抗训练暴露脆弱边界(Goodfellow 2015、mixup);CCV 还与反例引导程序修复(counterexample-guided repair)相关。本文的贡献是把这三组原则的「角色」而非「实现」迁移到离散技能转移上。
谱系四:操作式记忆合并。Mem0 的 ADD/UPDATE/DELETE/NOOP 四操作记忆调和被直接借鉴为局部编辑的操作词汇(下文详述)。
| 维度 | 之前的路线(原生 updater / 同期可靠性工作) | SkillEvoReg 的突破 |
|---|---|---|
| 问题 | 怎么让技能更新更有效 | 怎么防止反复更新过拟合 |
| 作用位置 | 替换/改进 updater 本身 | updater 之外的通用正则层,保留原生 updater |
| 失效观 | 大多单一(如只防行为回归) | 三种失效模式(结构/语义/行为)分别对应三正则器 |
| 泛化性 | 各自绑定特定进化算法 | 横跨文档编辑/库补丁/CREATE-MODIFY 三种更新语义 |
定位结论:SkillEvoReg 定义并形式化了「技能进化过拟合」新问题,并首次把神经网络反过拟合三原则系统转译到离散语言生成的技能更新过程——在「技能进化」这条线上补上了「正则化」这块缺失的拼图(与 SkillOpt 补「优化器」、SkillAdam 补「稳定步长」构成互补关系)。
三、问题定义
抽象层面,技能进化系统有技能状态 St(从单文档到技能库/目录)与原生更新器 U,每次更新提议候选:
Ŝt+1 = U(St, τt)(τt 为执行轨迹)
论文把「技能进化过拟合」定义为窄更新证据与持久下游影响之间的错配:St 的每次更新只由有限近期轨迹推断,却持续影响后续所有任务,使局部有用的编辑累积、特化或干扰既有支持的行为。
对这个抽象的精妙之处做三点分析。其一,学习问题的类比是结构性的而非装饰性的:技能状态 ↔ 模型参数,更新器 ↔ 优化器,执行轨迹 ↔ 训练数据,冻结评估 ↔ 测试——一旦这个对应成立,正则化理论的一整套工具(扰动学习、容量控制、泛化验证)就有了着力点。其二,三失效模式解耦是治理设计的基础:结构累积要用结构信号治理、语义特化要用生成扰动治理、行为回归要用行为验证治理——单一手段(比如一味压缩技能)注定漏掉其中两类。其三,可观测复杂度替代不可微范数:技能状态没有参数范数,论文用可观测结构量(词法长度、原子组织、碎片化、代码结构)构造复杂度信号 C(S)——形式上是对神经网络容量正则的功能等价物。
| 神经网络训练 | 技能进化 |
|---|---|
| 参数向量 θ | 技能状态 S |
| 优化器(SGD/Adam) | 原生技能更新器 U |
| 训练小批量 | 执行轨迹 τt |
| dropout(扰动表征) | 技能 dropout(扰动更新上下文) |
| 权重衰减/容量惩罚 | 复杂度感知局部正则 |
| 验证集/对抗增广 | CCV 因果反例验证 |
| 测试评估 | 冻结库下游评估 |
四、问题解法
SkillEvoReg 是套在原生更新边界上的三段式正则流水线,作用于「更新生成 → 结构持久化 → 行为验证」三个阶段。
4.1 训练时技能 dropout:扰动学习的上下文
类比:神经网络 dropout 在学习参数更新时随机遮蔽一部分神经元表征;技能 dropout 在生成技能更新时随机遮蔽一部分既有技能内容。
机制:先把当前技能状态切成语义完整的技能原子(自包含指令、列表项、程序块)。更新时采样一个原子子集构造临时遮蔽视图 St_drop,原生更新器在这个被遮蔽的上下文里生成更新;然后只抽取该扰动上下文下学到的变更 delta,与完整状态调和(Reconcile)得到候选。被遮蔽的原子随即恢复——遮蔽只影响学习的上下文,绝不是候选删除;冻结评估永远用完整技能。
这为什么防过拟合?原生进化的每次更新都以完整当前技能为条件,会使后续更新对既有指令的精确存在与字面措辞产生过度依赖(共适应的语言版)。遮蔽迫使更新器在「看不到某些旧规则」的条件下仍能提出可用的变更,切断这种字面依赖。
4.2 复杂度感知局部正则:控制什么结构被持久化
类比:容量正则不追求最小模型,而是抑制「无收益的容量增长」。技能版不做最小化——额外内容不 inherent 有害(新能力可能真需要新结构),而是用可观测复杂度判断何时需要结构反思,同时限制能改什么。
机制分三步。(1) 复杂度触发:对候选计算结构特征(词法规模、原子组织、碎片化、代码结构),域特定地映射为正则信号——SkillOpt 中复杂度进入正则化验证门、SkillEvolBench 中超出增长预算触发有界局部正则、ContinualSkillBench 中 CREATE 用绝对预算 MODIFY 用相对增长。(2) 局部范围约束:编辑仅限候选引入/修改的原子 Dt 及其有界相关邻域 Ωt——一个结构性庞大的候选不能触发对完整技能状态的无限制重写。论文的附录 E.1 给出一个诊断性失败案例:一次被允许重写全技能的修复改动了 14/14 个 section、47 条继承 bullet 只剩 6 条原样保留,测试准确率 60.5%→48.5%(32 题对→错、仅 8 题错→对)——这正是局部性约束要防的灾难。(3) 四操作编辑:借鉴 Mem0 的操作式记忆调和,对每个候选原子选 NOOP(保留有价值的新结构)/ MERGE(合并重叠)/ REWRITE(改写过度特化)/ DELETE(删除无独特贡献)。相似度只用于提名比较邻域,不作为「两条规则可互换」的证据——表面冗余的指令可能在执行中扮演不同角色。
4.3 因果反例验证(CCV):行为级的窄回归检测
结构正则看不见的失效:一个简洁候选几乎不加复杂度,却引入了破坏既有行为的假设或决策边界。CCV 的核心是一个 2×2 四格比较:
| 原始任务 et | 攻击变体 x_ccv | |
|---|---|---|
| 旧技能 St | ✓ | ✓ |
| 候选 S_comp | ✓ | × |
只有四格全中(新旧都在原任务合格 + 旧技能在攻击变体上仍成功 + 候选在该变体上退化)才确认「候选特有回归」。三个步骤:从训练历史选合格源任务(clean-pair 要求排除「更新已把原任务搞坏」的平凡情形);由候选变更 delta 引导构造针对其暴露的假设/依赖/决策边界的有界攻击(SpreadsheetBench 扰动单元格/公式,SearchQA 插入有界干扰上下文,LiveMath 加受控先验草稿,等);新旧技能在同一攻击实例上独立评估,确认回归后至多一次范围受限修复。「因果」之名来自四格设计对两个混淆的控制(原任务失败、攻击本身太难),作者诚实声明这是操作意义而非随机 rollout 下的形式因果识别。
修复阶段的设计同样精彩:修复提示要求「从反例中提炼恰好一条可迁移的过程性不变量来替换/合并/泛化相应规则;绝不为单个反例添加一次性例外,不复制反例特定的字段名、文件名、字面值」——把对抗样本变成泛化规则而非记忆。
4.4 跨更新语义的适配
同一框架三种实例化,只改更新边界的适配层:SkillOpt(对单文档的排序编辑)按原子调和;SkillEvolBench(多技能库的局部补丁)按补丁与库调和;ContinualSkillBench(显式 CREATE/MODIFY 操作)按快照差分调和,并把「库增殖本身」纳入正则(CREATE 用绝对复杂度预算 + 与既有库的重叠度,MODIFY 用相对增长)。可写范围全部由框架适配器程序化强制,而非依赖提示词约束模型「请只改局部」——论文明确指出提示级局部性不是可执行的编辑边界。
五、评估指标与实验证据
5.1 指标体系与三基准
主指标:下游任务分(各基准原生验证器),区分验证集选择的 Delivery 检查点与终态 Final 检查点。辅助指标:技能 tokens(o200k 分词)、结构复杂度 C(按原子词法/代码行/控制流/依赖的复合求和)、技能数量。所有对比共用同一专有 LLM、固定推理配置、原生任务顺序与评估器——SkillEvoReg 只插在候选更新边界上。
三基准覆盖三种进化形态:SkillOpt(单技能文档反复优化,SpreadsheetBench/SearchQA/LiveMath 八 epoch);SkillEvolBench(已成库的二遍进化:同一 1-pass 库出发,对比冻结/无正则二遍/正则二遍,二者获得完全相同的额外经验);ContinualSkillBench(任务 1–50 序贯学习含 CREATE/MODIFY,冻结后在 51–100 上评估,5 个域)。
5.2 主结果
SkillOpt/SpreadsheetBench(旗舰结果):
| 方法 | Delivery | Final | ΔTest | 技能 tokens | 复杂度 C |
|---|---|---|---|---|---|
| SkillOpt | 54.75 | 47.00 | −7.75 | 6,060 | 116.96 |
| SkillEvoReg | 58.50 | 59.25 | +0.75 | 2,341(−61%) | 57.21(−51%) |
Final +12.25pp 且技能缩 61%;更重要的是原生 SkillOpt 从 Delivery 到 Final 掉 7.75pp(后期过拟合的直接体现),正则版反升 0.75pp。SearchQA 持平(80.46→81.14 delivery),LiveMath 暴露诚实负例:final 34.79→30.18——92/217 题的正确答案是特定 meta-option(「其余选项之一正确,但可证更强结论」),原生 SkillOpt 反复强化这个答案先验,而正则版合并了这种重复强化;该子集贡献了跌幅的 85.7%。当评测分布本身奖励特化答案先验时,压制特化就是损失准确率——一个教科书级的正则化权衡案例,论文没有回避。
SkillEvolBench(二遍进化):deployment(T4–T6)1-pass 31.67% → 无正则 2-pass 29.44%(越学越差) → 正则 2-pass 33.33%;组合迁移 T6 18.33→13.33→26.67;相对 1-pass 锚,二遍 token 增长 −34.0%、复杂度增长 −32.7%。转移模式不均匀:组合与对抗迁移提升、上下文迁移略降——正则改变的是「哪些重复经验被允许持久化」,不是简单压制二遍学习。
ContinualSkillBench(冻结库 5 域):held-out 全域持平或提升(Law 65.42→70.69 最显著 +5.27pp),技能数/tokens/复杂度全域下降(Finance 技能数 28→17)。
5.3 消融与机制证据
SpreadsheetBench 四变体消融(Final 检查点、等预算):
| 方法 | Test ↑ | 字符 ↓ |
|---|---|---|
| 原生 updater | 47.00 | 31.7K |
| 仅复杂度正则 | 55.50 | 13.1K |
| 仅 dropout | 57.50 | 19.5K |
| 完整 SkillEvoReg | 59.25 | 11.7K |
两个正则器互补:复杂度正则强控体积、dropout 单独用时分数更高但体积更大,组合取得最小技能态 + 最高分——分别作用于「怎么生成」与「留什么」的分工被干净验证。CCV 在该轨迹上未改持久状态(前两个正则器已解决该域问题),其行为角色由独立证据支撑:跨轨迹识别 12 个回归信号、9 次状态改变修复;代表性 trace 里 React 18 依赖修复任务上,候选新增的 package-boundary 规则在针对性攻击下 1.0 vs 0.8 暴露窄回归,CCV 范围受限改写后重放恢复受影响的过程检查——结构信号完全不可见的行为级回归只有行为级验证能抓。
部署侧副产品(附录 C.4):紧凑技能在执行路径可控的任务上大幅降低推理 token(SpreadsheetBench −29.5%、LiveMath −38.6%、SearchQA −56.1%),但在外部信息获取主导的域(Continual 的 Finance/Healthcare)被工具调用方差淹没——论文明确这是副产品而非优化目标,且不宣称「紧凑技能普遍省 token」。
六、效果优势的根源解释
6.1 根源机制与证据链
**因果链一:dropout 切断对既有指令字面措辞的依赖 → 更新本身更鲁棒。**原生更新器以完整技能为条件生成更新,形成语言版「共适应」——新规则与旧规则的特定措辞绑定,旧措辞任何微调都会级联失效。dropout 迫使更新在部分规则不可见时仍能成立,学到的 delta 因此对上下文扰动不敏感(消融 47.00→57.50 单独贡献最大支持此链;论文实验已支持,机制细节如「字面依赖被切断的程度」属阅读者推测)。
**因果链二:复杂度正则在结构膨胀失去可迁移收益时触发局部合并/删除 → token −61% 而能力不损。**试点研究证明结构膨胀(23.6×)先于/独立于能力退化,且 E4 后新增结构多为窄例外与条件规则;正则在可观测复杂度越界时仅对候选变更原子及其邻域做 NOOP/MERGE/REWRITE/DELETE——局部性约束防止「为了压缩而全局重写」引入新风险(E.1 案例量化了无约束重写的 −12pp 灾难)。Continual 五域体积全降、held-out 不降支持(论文实验已支持)。
**因果链三:CCV 补足结构信号的盲区——窄行为回归。**结构正则的检测面是复杂度增量;一个简洁编辑(复杂度≈0)引入的错误决策边界对它完全不可见。CCV 用候选自身的变更引导构造攻击,把「这次更新移动了哪条行为边界」变成可测的四格比较。12 信号/9 修复 + React 依赖 trace 支持(论文实验已支持)。
**因果链四:三正则器分别作用于生成/持久化/验证三阶段 → 紧凑技能态 + 相当或更优能力,而非任何一个单点手段。**四变体消融的互补模式(dropout 强在分数、复杂度强在体积、联合最优)是这条链的直接证据。
反事实与边界:LiveMath 负例反证「正则不是免费的」——当测试分布奖励特化先验时,压制特化 = 损失分数(−4.84pp 且 85.7% 集中在 meta-option 子集)。这精确对应神经网络正则化的经典权衡:正则在训练分布上损失、在泛化上收益;若「测试分布」本身就是特化分布,正则化自讨苦吃。
6.2 相关工作检索与对照
| 研究(链接) | 相似尝试 | 相关结论 | 与本文的差异与适用边界 | 对根源解释的影响 |
|---|---|---|---|---|
| Mem0(arXiv:2504.19413,ECAI 2025) | 新事实 vs 既有记忆的 ADD/UPDATE/DELETE/NOOP 操作式调和 | 与因果链二同源:操作式合并控制持久记忆增长在对话记忆域已被验证有效(LOCOMO 上超全上下文基线且 token 省 90%+) | Mem0 调和的是事实型记忆(无能力保持约束),SkillEvoReg 调和程序性技能且把操作限制在候选局部邻域、NOOP 显式允许有益新结构;本文明确「相似度只提名比较、不判可互换」正是针对记忆合并直接迁移的风险 | 支持(操作式合并控增长),且本文是其向能力保持场景的扩展 |
| EWC(arXiv:1612.00796,PNAS 2017) | 参数空间的选择性巩固:Fisher 信息加权惩罚重要参数偏移 | 与因果链二/三的结构同构:按「对旧任务的重要性」限制可变性,而非均匀压缩——EWC 保护重要权重、SkillEvoReg 的 NOOP+局部性保护既有支持的行为 | EWC 需要可微参数与 Fisher 估计,技能无可微范数,本文用可观测复杂度 + 行为配对验证做功能等价物 | 支持(容量/巩固正则的功能等价性),属原理迁移而非方法复用 |
| SkillOpt(arXiv:2605.23904,微软) | 文本空间优化器:有界 add/delete/replace 编辑 + 验证门控 + 文本学习率 | 与本文形成「优化器 vs 正则器」分工:SkillOpt 自带训练纪律(验证门控接受严格改进),但本文试点证明其 8-epoch 后仍现 24.17pp 迁移 gap——验证门控防单步退化,防不了轨迹级过拟合(Delivery-Final −7.75pp) | SkillOpt 是被本文正则的 updater 之一;其「52 格全胜」是相对无正则基线,本文展示其长期进化仍需外部正则层 | 补充(界定验证门控的边界:单编辑级 vs 轨迹级) |
| 持续学习综述(arXiv:2302.00487 等正则化/回放/结构四范式) | 持续学习领域「稳定性-可塑性权衡」的系统理论 | 与本文问题定义同构:技能进化的「既有能力保持 vs 新经验吸收」就是 stability-plasticity 在离散文本空间的重现;正则化路线(EWC/LwF/SI/MAS)在参数域的广泛成功支持本文路线的合理性 | 参数域方法依赖梯度与损失面;本文对象无梯度,且技能的「遗忘」是行为级(可被冻结评估直接观测)而非参数级 | 支持(问题结构的跨域同构),并提示回放式方法(重放验证)是本文 CCV 的近亲 |
未发现声称「技能进化正则化无效或有害」的相反结论工作;最近的张力来自 SkillOpt 一系的隐含立场(验证门控已足够),而本文试点数据直接反驳了这一点。诚实说明:LiveMath 负例本身就是对「正则普遍有益」的内部限定;本次检索未发现对 dropout 原则迁移到文本空间的其他独立工作,因果链一目前主要依赖本文消融。
6.3 综合判断与未决问题
多研究共同支持的机制:(1) 操作式合并控制持久状态增长(Mem0 于事实记忆、本文于程序技能、以及 ContinualSkillBench 原文对库增殖困难的报告);(2) 按重要性/相关性选择性地限制可变性优于均匀压缩(EWC 及持续学习正则化家族、本文 NOOP+局部性);(3) 行为级配对验证可捕获结构信号盲区(反例引导修复传统、GSE 的重放验证、本文 CCV)。
仍属推测的机制:技能 dropout 切断「字面措辞依赖」的具体机制只有消融数据(+10.5pp 单独贡献)佐证,其与神经网络 dropout 的共适应消除在多大程度上机制同源,仍需类似「dropping probability 敏感性分析」的进一步证据;论文未报告 dropout 掩码比例的敏感性。
适用条件与失效条件:当评测分布奖励特化先验时正则损失准确率(LiveMath 92/217 meta-option);当工具轨迹方差主导推理成本时紧凑技能的部署收益被掩盖(Continual Finance/Healthcare);CCV 的攻击构造依赖各基准允许的有界扰动空间,在难以构造有效扰动的开放域任务上其检测力未验证。优势成立的条件:任务语义相对稳定、技能是执行行为的显著决定因素、结构信号与行为信号互补可用。
七、必要知识反推
领域知识层:技能进化系统的运作机制(updater/evaluator/commit 语义为何异构);三种失效模式的现象学(没有试点研究就无法定义问题);各基准的更新语义差异(文档编辑/库补丁/CREATE-MODIFY 决定适配层设计)。
方法论知识层:神经网络反过拟合三原则的深层角色(dropout 扰动学习、容量正则控制结构、增广验证暴露脆弱——机械照搬会失败,必须提炼角色);持续学习的稳定性-可塑性权衡理论(问题定义的镜子);操作式记忆调和(Mem0 的四操作词汇是局部编辑的直接灵感);反例引导验证的逻辑(四格比较的混淆控制)。
工程知识层:确定性的原子切分与可观测复杂度度量(C(S) 的形式化需要对文本/代码结构的可计算刻画);可写范围的程序化强制(E.1 案例证明提示级约束不可靠,适配器强制写边界是必须的工程决策);冻结评估与检查点选择的协议设计。
知识融合的关键节点:第一个融合点是「离散 ↔ 连续」的翻译器——每个正则原则都要找到离散等价物(遮蔽上下文 ↔ dropout、复杂度触发 ↔ 范数惩罚、定向攻击 ↔ 对抗增广),这需要对两边机制的同等深度理解。第二个是「触发与范围分离」的教训——E.1 失败案例教会我们:复杂度信号可以用全局状态计算,但编辑权限必须锚定候选局部,这个分离是整个框架安全性的支柱。第三个是三正则器与三失效模式的对位设计——不是三个好主意的堆叠,而是一一覆盖三类失效的最小组合。
八、论文中可以提取的通用性灵感
灵感一:学习过程出现在哪里,正则化就要跟到哪里。核心思想:任何「从有限经验反复更新、且更新持久生效」的系统都会重演过拟合,无论其介质是权重、文档还是规则库。论文证据:技能进化 8 epoch 后 24.17pp 迁移 gap + 23.6× 膨胀;神经网络正则三原则转译后 +12.25pp/−61%。推广场景:知识库的持续编辑(Wiki 修订策略)、RAG 检索索引的增量更新、法规/政策文档的反复修订、个人知识管理系统(笔记越记越厚怎么办)。
灵感二:把「触发」与「范围」分离。核心思想:何时干预可以用全局信号判断,但干预本身必须限制在局部——全局重写的风险远大于不干预。论文证据:无约束全技能重写 −12pp(14/14 section 被改、41/47 bullet 失原样);局部锚定版取得最小技能态。推广场景:数据库 schema 迁移(检测全局问题、迁移局部表)、代码重构(全局度量触发、模块级重构)、组织变革管理(诊断全局、试点局部)。
灵感三:用系统自身的变更来引导对抗测试。核心思想:要验证一个变更没有破坏既有能力,最有效的攻击方向由变更本身暴露——它强化/弱化了什么假设、移动了哪条决策边界。论文证据:CCV 由 Δccv 引导构造攻击,抓到复杂度信号不可见的 12 个窄回归;修复要求提炼不变量而非记忆反例。推广场景:回归测试生成(按 diff 引导)、API 兼容性检查(按变更端点构造调用对比)、合同修订审查(按修改条款推演受影响场景)。
灵感四:正则化的代价要在「分布奖励什么」的语境下评估。核心思想:正则押注「未来分布 ≈ 总体」,当评估分布本身奖励特化时正则是净损失。论文证据:LiveMath −4.84pp 且 85.7% 集中在 meta-option 子集。推广场景:任何「要不要记忆捷径答案」的决策——考试应试 vs 能力培养、推荐系统的短期点击 vs 长期留存、缓存策略的命中率 vs 新鲜度。
灵感五:验证门控(单步改进才接受)防不了轨迹级过拟合。核心思想:每一步都「看起来更好」的序列仍可整体过拟合——单步验证与轨迹健康是两个正交需求。论文证据:SkillOpt 的验证门控下 Delivery→Final 仍 −7.75pp;需要 dropout/复杂度正则/CCV 这类过程级正则与验证检查点选择互补。推广场景:强化学习的每步奖励 vs 轨迹回报、增量交付的敏捷开发(每次迭代验收通过 ≠ 产品方向正确)、健身训练(每次训练完成 ≠ 不过度训练)。
合并结语:Agent 资产的优化与正则化
把两篇论文并排放好,一条主线浮现出来:Agent 的竞争力正在从模型内部(权重)转移到模型外部(harness、技能、记忆、工作流等「Agent 资产」),而这些资产正在经历一切学习系统必经的两个阶段——先建立优化方法,再建立正则化方法。
MoMHa 与 SkillEvoReg 恰好分别站在这两个阶段的门口。MoMHa 回答「怎么把 Agent 资产优化得更好」:把 harness 设计形式化为三目标 MOO,证明单阶段联合搜索优于分阶段——这是把「优化纪律」从 prompt 层推到全代码层、从单目标推到多目标。SkillEvoReg 回答「怎么防止优化把资产优化坏」:把技能进化形式化为一个会过拟合的学习过程,证明 dropout/容量正则/对抗验证三原则可以转译到离散文本空间——这是把「训练纪律」从参数空间推到语言产物空间。二者在方法论上甚至共享同一种思维模式——与深度学习训练范式做结构性类比:MoMHa 把联合奖励类比多任务损失加权,SkillEvoReg 把三正则器类比反过拟合三件套;一个用类比扩展「训练目标」的设计空间,一个用类比移植「训练稳定器」的设计空间。
两篇也互相照亮对方的盲区。MoMHa 的搜索循环每域约 100 次评估后冻结——它优化的是一次性资产,尚无「反复进化」的过拟合问题;SkillEvoReg 治理的正是长期反复更新的资产,但它正则的是单文档/库级技能,还没有人把「harness 的反复进化」纳入视野。可以预见两条线的合流:当 harness 也开始在生产流量上持续自我改进(MoMHa 未来工作之一),SkillEvoReg 式的正则层(结构复杂度控制、更新引发回归的因果验证)将成为必需品;反过来,SkillEvoReg 的三正则器本身涉及大量 LLM 调用与超参,其自身也是一个可用多目标搜索优化的「meta-harness」。Agent 资产的优化器与正则器,最终可能是同一套搜索基础设施上的两个角色。
最后回到机构视角。两篇论文一篇来自 Adobe Research(两人团队),一篇来自华为诺亚方舟实验室(六人团队)——都是纯企业实验室、无高校合作,这在该领域当日可见的论文潮(大量「高校 + 企业」联合团队)中并非主流。这个细节本身传递了信号:Agent 资产治理的问题(多目标权衡、长期进化的稳定性、行为安全)高度贴近真实部署痛点——token 是真金白银的成本、技能库是会腐烂的运维资产、安全是上线门槛——企业实验室因其离生产最近,对这类「工程的第二阶段问题」最敏感,也最有动力在学术社区还在卷「能不能优化」时就开始回答「怎么优化不坏」。这或许正是 Agent 研究走向成熟的标志:从证明范式可行,到为范式建立工程纪律。优化与正则化这对深度学习世界的老搭档,正在 Agent 资产的世界里重新会师。