论文链接:HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution 发表时间:2026年9月1日(arXiv:2609.00829v1) 机构:企业+高校合作——华为 ICT AI Competence Center(上海)与国内高校联培作者共同完成;企业提供真实业务场景(无线网络/云核心网 QA)与算力 领域标签:cs.LG / Agent 自进化 / Harness 优化


一、论文背景

1.1 自进化 Agent 的 promise 与三重陷阱

自进化(self-evolving)agent 指不依赖人工迭代、而是根据环境反馈自动优化自身 harness——提示词、技能(skill)、工具用法、执行逻辑——的智能体。这是 2025–2026 年 agent 研究的显学(arXiv 上的自进化综述已引用数百次)。但把进化循环真跑起来的人都会撞上三堵墙:

  1. 信用分配失败(credit assignment failure):进化信号通常只有任务终态(成功/失败)。一条几十步的轨迹失败了,到底是第几步的哪个决策错了?终态反馈回答不了,于是"从失败中学习"退化成"从失败中猜测";
  2. 捷径学习(shortcut learning):agent 在进化中记住的是"这批任务的特征 → 某种应答模板",而不是可泛化的能力——表现为反馈集上分数上涨、换一批任务就打回原形;
  3. 灾难性遗忘(catastrophic forgetting):一次不被约束的 harness 更新(比如改写技能文件)可能顺手删掉了此前辛苦学到的关键约束——能力曲线不是单调上升而是锯齿形,甚至长期下行。

1.2 现有进化方法的信号困境

主流基线各有其信号来源:GEPA 用遗传-帕累托的反思式提示进化(自然语言反思提炼规则);ACE 把上下文当"进化中的操作手册"做增删改;SkillOpt 优化技能库的组合。它们的共同点是:进化信号本质上来自对终态反馈的文本反思——模型看着"任务失败了"自己猜原因。这在开放域小任务上够用,但在两类场景下崩溃:企业窄域(失败原因高度专业化,泛化反思猜不中)与长轨迹任务(失败原因深埋在中间步骤)。

1.3 华为的视角:企业场景倒逼可靠性

这篇论文的动机来自真实的部署需求:无线网络与云核心网的运维 QA 是华为 ICT 的核心场景,任务高度专业化、容错率低。在企业语境下,“进化偶尔翻车"不可接受——必须可靠(reliable)地变好。这个约束决定了全文的设计取向:宁可进化慢一点,也要保证每个被接受的更新是安全的、可回滚的、可迁移的。


二、论文定位和关联工作

2.1 研究谱系

谱系一:文本反思式进化。GEPA(遗传-帕累托反思提示进化,比 GRPO 省 35 倍 rollout)、ACE(上下文操作手册进化)、SkillOpt(技能组合优化)。共同机制:终态反馈 → LLM 反思 → 文本修改。关键区别:HarnessEvolve 引入参考轨迹作为结构化对齐目标,把"猜哪步错了"变成"对齐出哪步错了”。

谱系二:自进化系统架构研究。自进化综述(Gao et al. 2025)系统梳理了 what/when/how 的问题空间,并明确把信用分配与灾难性遗忘列为开放挑战——HarnessEvolve 可视为对该挑战清单的工程应答。

谱系三:轨迹级监督思想。用"带正确答案的示范轨迹"做监督在 RL(专家示范、RLHF 的偏好对)与过程奖励模型(PRM,逐步打分)中有先例;HarnessEvolve 的创新在于把示范用于失败诊断的差分对齐而非直接模仿——参考轨迹不被执行,只被用来对齐。

2.2 定位对比表

维度GEPA / ACE / SkillOptHarnessEvolve
失败信号终态 + 文本反思参考轨迹逐步对齐的差分信号
信用分配模型猜测确定性对齐定位出错步骤
防捷径学习无系统机制质量门:数据泄漏检测 + prompt 膨胀阈值
防灾难遗忘无系统机制性能门:新批次提升 ≥δ 且近 R 批次降幅 ≤ε
更新回滚依赖外部快照快照池 + epoch 末 held-out 最优选择
架构单体循环执行/评估/优化/门控四模块解耦

定位结论:HarnessEvolve 的贡献不是发明新的进化算法,而是给进化循环装上可靠性基础设施(结构化误差信号 + 双门控 + 快照选择),使自进化在企业级场景可用。


三、问题定义

具体场景:给定一个由 harness(提示/技能/工具逻辑)参数化的执行 agent 𝒜 与任务流,让 agent 通过自动修改自身 harness 持续提升任务准确率,约束是:更新必须可泛化(不捷径)、不回退(不遗忘)、可验证(可归因)。

核心洞察:信用分配的困难源于反馈粒度与决策粒度错配——决策发生在每一步,反馈只在终态。而解药就藏在任务本身:多数任务域里,可以构造"给 agent 提供 ground-truth 答案时的执行路径"(参考轨迹)。参考轨迹与失败轨迹在相同环境里逐步对齐,第一步分叉处即误差信号——这不是猜测而是计算。

形式化(性能门的接受条件,全文最核心的一条式子):

$$\mathcal{A}_{\mathrm{candidate}}\text{ 被接受} \iff \begin{cases}\mathrm{Acc}(\mathcal{A}_{\mathrm{candidate}}, B_j) - \mathrm{Acc}(\mathcal{A}_{\mathrm{current}}, B_j) \ge \delta \\ \max_{l \in [j-R,\, j-1]}\big[\mathrm{Acc}(\mathcal{A}_{\mathrm{current}}, B_l) - \mathrm{Acc}(\mathcal{A}_{\mathrm{candidate}}, B_l)\big] \le \epsilon\end{cases}$$

即候选 harness 必须在当前批次至少提升 δ 且在最近 R 个批次上至多回退 ε——把"可靠"翻译成两条可检验的不等式。epoch 结束时在验证集上从快照池 𝕍 中选最优:

$$\mathcal{A}_{\mathrm{current}} \leftarrow \arg\max_{\mathcal{A} \in \mathbb{V}} \mathrm{Acc}(\mathcal{A}, \mathcal{T}_{\mathrm{val}})$$

这保证最终 agent 不劣于历史最优快照——遗忘被结构性封死。


四、问题解法

4.1 四模块解耦架构

执行、评估、优化、门控分派给独立的 agent 模块,各司其职:执行模块跑任务;评估模块产出结构化反馈;优化模块(核心创新所在)生成候选 harness 更新;门控模块执行双门检验。解耦的意义:进化管线不是执行 agent 的"自我感觉",而是外置于它的独立流程——执行 agent 被进化的对象,而非进化的主体。

4.2 参考轨迹差分对齐(信用分配的解法)

  1. 生成参考轨迹:对训练任务,给执行 agent 提供 ground-truth 答案后让它执行——产出的路径代表"知道答案时该怎么走";
  2. 失败轨迹对齐:把同任务的失败执行与参考轨迹逐步对齐,定位第一条分叉及其后续偏差——这一步把"任务失败"这个标量分解为"第 k 步的决策 d 应为 d’ 而非 d"的逐步误差信号;
  3. 误差聚类:跨任务把误差信号聚成系统性失败模式(例如"检索到正确文档后未引用其中条款")——优化模块据此生成针对性的 harness 修改(新增一条技能规则、调整工具调用顺序)。

直观类比:学生做错题后,不是笼统地"下次细心点"(终态反思),而是对照标准解题过程逐步核对,圈出第一个走偏的步骤,并统计自己最常走偏的步骤类型。

4.3 质量门:防捷径与防膨胀

候选更新落地前先过质量门的两项检查:

  • 数据泄漏检测(阈值 η_leak=0.8):新技能文本与训练答案的重叠度过高即拒绝——防止"把答案抄进技能"这种反馈集刷分把戏;
  • prompt 膨胀检测(阈值 η_blo=5,修订上限 T_rev=3):技能/提示体积膨胀超限即拒绝——防止"无限追加规则"导致的上下文污染与成本失控。

4.4 性能门与两层选择

如第三节形式化:批次级接受(提升 ≥δ=0,近 R 批回退 ≤ε=0.025)+ epoch 级验证集最优快照选择(早停:连续 P_ep 个 epoch 无验证提升即收敛终止)。被拒次数达到耐心阈值 P_batch 时提前结束 epoch 省算力。这套两层机制在数学上保证收敛点不劣于历史任何被接受快照——“可靠性"从工程口号变成了闭式性质。


五、评估指标与实验证据

5.1 实验设计的证明逻辑

论文要证明:HarnessEvolve 的可靠性机制(对齐信号+双门控)在企业窄域与开放域两类场景、不同底座模型、不同 agent 框架上都稳定占优。为此设计了三组对照:主实验(5 数据集 × 2 模型 vs 3 基线)、跨框架迁移(OpenClaw 上优化 → 4 框架上评测)、消融(各机制组件的贡献)。

5.2 主结果

企业内数据集(Qwen3.6-27B / DeepSeek-V4-Flash 双模型):

方法CloudCoreNetwork-QA (Qwen)CloudCoreNetwork-QA (DeepSeek)Wireless-QA (Qwen)Wireless-QA (DeepSeek)
Base43.447.579.085.9
GEPA65.357.682.486.5
ACE59.364.684.390.1
SkillOpt61.965.389.089.3
HarnessEvolve86.985.989.792.8

CloudCoreNetwork-QA 上从 Base 43.4% 提升到 86.9%(+43.5 分),超最强基线 GEPA 21.6 个百分点——企业窄域的爆发式增益正是参考轨迹对齐的用武之地(失败原因专业化、可精确对齐)。

开源数据集:

方法SearchQAOfficeQASpreadsheetBench
Base86.562.844.3
GEPA88.664.069.6
ACE90.068.952.2
SkillOpt89.466.974.6
HarnessEvolve92.970.976.4

三域全胜——证明方法不只在企业窄域灵。

5.3 跨框架迁移(skill 可移植性)

在 OpenClaw 框架上优化的技能,直接迁移到四个异构框架评测:

框架SpreadsheetBench Base→HE增益
OpenCode57.5 → 87.9+30.4
DeepSeek Harness56.4 → 86.8+30.4
LAMAgent45.0 → 80.0+35.0
Hermes72.1 → 73.2+1.1

除 Hermes(本身基座已高)外全部大幅提升——技能层面学到的知识不绑定框架,这是"可泛化”(非捷径学习)的直接证据。

5.4 消融实验

去掉分层误差记忆 / 双置信度过滤等组件,数学均值最大掉 3.8 分;自由探索与定向生成两模式互补(单模式变体均低于完整策略)——证明各组件有独立贡献。

5.5 证明力评估

这套设计的证明力来自三层:① 企业窄域 +21.6 分 vs 基线的巨大差距证明"结构化信号 > 文本反思"(否则 GEPA 的反思早该追上);② 跨框架迁移 +30 分证明学到的是能力不是捷径(否则换框架即失效——这恰是质量门拦截的对象);③ 消融把增益拆解到具体组件。需要诚实指出的边界:开放域增益(2–7 分)远小于企业域(21.6 分)——参考轨迹的构造依赖"可提供 ground-truth 的任务域",在完全开放的生成任务上该机制的优势会收窄。


六、效果优势的根源解释

对比对象:GEPA/ACE/SkillOpt 的文本反思进化为何在企业窄域落后 21.6 分?

根源在误差信号的信息量。文本反思的输入是"任务描述 + agent 轨迹 + 终态对错",输出是模型对失败原因的假设——假设的错误率取决于模型对该领域的先验知识。企业窄域(无线网络运维 QA)恰好是通用模型先验最薄弱的地方:反思猜不中"协议条款引用错误"这种专业失败,猜不中就没有有效的进化方向,于是 GEPA 只能靠泛化技巧(检索更全、格式更稳)拿到 65 分左右的"通用改进红利"后触顶。HarnessEvolve 的参考轨迹对齐不依赖先验:分叉点是算出来的,误差信号是确定性的——43.5 分的总提升中,超出通用红利的那部分(对 GEPA 的 21.6 分差值)就是"确定性信号替换猜测信号"的净收益。

双门控为何必要? 反事实:没有性能门的进化接受"当前批次好但整体回退"的更新——反馈集分数锯齿形波动(这正是 HarnessDev 论文观测到的 Evolution 不稳定现象)。性能门把"接受"重新定义为两条不等式同时成立,快照池 + 验证集选择进一步保证收敛点不劣于历史最优——数学性质而非运气。跨框架迁移中 SpreadsheetBench +30 分能成立,前提是学到的技能规则本身没有被框架特定的捷径污染——质量门的数据泄漏检测正是这层保险。

为何解耦四模块? 若执行 agent 同时是进化主体,它对"自己哪里错"的判断带有自我辩护偏差(与 HoH 论文中"实现者不能自验收"同一原理)。评估与门控独立于执行,信号才可信。


七、必要知识反推

领域知识层

  • 自进化 agent 的问题空间与三大失败模式的实证文献——不掌握信用分配/捷径/遗忘的具体表现,就无法定位"可靠性"要保什么;
  • 企业运维 QA 场景的专业知识(无线网络/云核心网)——没有真实窄域,参考轨迹的价值无法凸显(这也是该工作出自华为而非高校的原因)。

方法论知识层

  • GEPA/ACE/SkillOpt 三代进化方法的机制与失效边界——基线选择与差距解释的依据;
  • 过程监督/逐步奖励的思想(PRM 一系)——参考轨迹差分对齐的方法学源头;
  • 快照集成与验证集选择的经典 ML 实践——两层选择机制的直接借鉴。

工程知识层

  • 多框架 agent 系统(OpenClaw/OpenCode/Hermes/LAMAgent/DeepSeek Harness)的技能格式兼容——跨框架迁移实验的前提;
  • 门控参数调校(δ=0, ε=0.025, η_leak=0.8, η_blo=5)与早停策略——可靠性与算力成本的平衡点;
  • 训练/验证/测试的任务分割与泄漏防护。

知识融合的关键节点:最关键的融合是把 RL 领域的"过程监督"思想移植到 harness 进化管线——识别出"参考轨迹不必被执行、只须被对齐"这个反直觉用法(示范数据的新用途:差分基准而非模仿目标),再用数据库式的"门控事务"(接受条件+快照回滚)把更新变成原子操作。没有 RL 背景会退回文本反思,没有企业工程背景则不会有"可靠性优先"的设计约束。


八、论文中可以提取的通用性灵感

灵感一:差分基准——示范的新用途是"对齐定位错误"而非"模仿学习"

  • 核心思想:当"标准答案执行过程"可得时,它最大的价值不是让学习者模仿,而是与失败执行逐步对齐、在第一个分叉处定位误差——把归因从猜测变成计算。
  • 论文证据:参考轨迹对齐使企业窄域超文本反思基线 21.6 分。
  • 推广场景:代码评审(对照正确实现的 diff 而非泛泛提意见);医学误诊分析(对照标准诊疗路径);新员工复盘(对照资深员工处理同任务的过程);工业事故调查的根因分析。

灵感二:把"可靠更新"写成两条可检验的不等式

  • 核心思想:自主系统的每次自我修改应满足"局部有提升(≥δ)且全局无回退(≤ε)",配合快照池与验证集选择,可结构性保证"结果不劣于历史最优"。
  • 论文证据:性能门 + epoch 末快照选择的数学性质;对照 HarnessDev 观测到的无门控进化的锯齿形回退。
  • 推广场景:个人知识库的增量维护(新笔记不破坏旧体系);自动化交易策略的热更新;CI/CD 的金丝雀发布门槛;宪法修正案的非回退条款设计。

灵感三:进化主体与被进化对象要分离

  • 核心思想:让系统评估自己的改进建议会引入系统性自利偏差;进化管线应外置于执行 agent。
  • 论文证据:四模块解耦架构,执行/评估/优化/门控相互独立。
  • 推广场景:绩效自评与他评的制度设计;编译器自举中的引导编译器隔离;审计独立性;AI 安全的 oversight 分离原则。

灵感四:质量门拦截"刷分捷径"比事后惩罚更有效

  • 核心思想:自适应系统会发现评测的漏洞(抄答案、堆规则);在更新落地前检测"数据泄漏度"与"规则膨胀度"两类红旗,成本远低于事后清理污染。
  • 论文证据:η_leak=0.8 泄漏检测 + η_blo=5 膨胀上限;跨框架迁移成功本身证明捷径被有效拦截。
  • 推广场景:学生备考的"背题 vs 学会"区分性测验;推荐系统防 feature hacking;健身领域的"借力动作"检测;API 防滥用的事前模式识别。

灵感五:窄域是自进化方法的"放大器"试验场

  • 核心思想:检验一个学习机制的真实强度,最灵敏的场景不是开放域而是专业化窄域——那里通用先验失效,机制本身的信号质量决定一切。
  • 论文证据:同一方法开放域 +2~7 分、企业窄域 +43.5 分,差距即机制净贡献。
  • 推广场景:算法评测用 adversarial 窄分布;医疗 AI 在罕见病上检验泛化;教育测量用"高阶题目"区分背诵与理解;材料学用极端工况测性能边界。

本文基于 arXiv:2609.00829v1 全文(含方法、双数据集主表、跨框架迁移表与消融)撰写。基线:GEPA (arXiv:2507.19457)、ACE (arXiv:2510.04618)、SkillOpt。