论文链接:Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 发表时间:2026年9月 机构:Salesforce AI Research(Zhou Yu 通讯作者、Bin Bi、Shiva Kumar Pentyala、Sitaram Asur 等)—— 企业研究院独立完成,面向企业级 Agent 落地场景 领域标签:cs.AI / Agent Harness / Co-Evolution / Enterprise Agents
一、论文背景
Agent 的能力由什么决定? 不是模型,也不是 harness,而是两者的乘积。harness——系统提示、工具集、执行钩子、上下文管理脚手架——决定了模型能看到什么、能做什么。近期研究证明 harness 是个强杠杆:把 harness 当可编辑程序去自动搜索,能把小开源模型在编码与企业任务上抬到接近前沿模型的水平。这对企业尤其诱人:内部 API 调用、代码重构、长程数据审计这类任务,用小模型+任务定制 harness 的推理成本远低于前沿模型。
于是企业 Agent 落地有两条适应杠杆:harness 进化(改脚手架)与模型权重适配(LoRA 微调是主流,几个 GPU 小时就能完成)。两条杠杆各自都已被验证有效,一个自然的问题是:怎么组合?
最直觉的配方是三步走:先用弱模型进化 harness(已验证有效);再请更强的专家模型在同一 harness 上示范(专家更强,示范应该更有教学价值);最后让弱模型 LoRA 微调模仿专家轨迹。这个配方的每一步都符合直觉——弱模型强了 harness,专家提供教学信号,模仿传递能力。
本文的第一个发现打破了直觉:这个配方在进化过的 harness 上系统性地让弱模型变差。
二、论文定位和关联工作
脉络一:harness 进化。 GEPA 式搜索、HarnessForge、HarnessX、Co-Harness 等工作让 harness 自动进化或与权重联合优化。SIA 在分类与科学优化任务上交替更新 harness 与模型。这些工作报告了各自场景的增益,但都没回答:harness 已针对特定模型特化后,后续的权重更新会复利还是互毁?
脉络二:Agent 的模仿学习与专家轨迹蒸馏。 Wang et al. 2026 等证明专家轨迹是 Agent 适配的有效监督;Lauffer et al. 2025 等开始探索 on-policy 的专家修正——在学生策略访问的状态上让教师补全,而非整条轨迹模仿。但它们都假设 harness 固定,没考虑监督方式与 harness 特化的交互。
脉络三:向上迁移现象。 Xu et al. 2026 发现进化出的 harness 可以跨模型骨干向上迁移。本文确认并利用了这一点:专家在为弱模型进化的 harness 上表现甚至更好——这正是"专家可以当老师"的前提。
| 维度 | Co-Harness / SIA / HarnessForge | 本文 |
|---|---|---|
| 关注点 | 联合优化能涨多少 | 联合优化何时会互相破坏 |
| 监督方式 | 自身成功轨迹 / 交替更新 | 聚焦专家教学信号的引入方式 |
| 核心发现 | 正增益 | 模仿在进化 harness 下负增益 + 拟合机制解释 |
| 解法 | 各自的组合策略 | on-policy 专家修正(只重写失败 turn) |
定位结论:本文是 harness 进化文献的"安全手册"——指出了组合两条杠杆时的隐雷,并给出规避方案。
三、问题定义
具体问题:harness 进化后,如何引入模型权重更新而不损失已有增益,并让两条杠杆可迭代堆叠。
核心洞察(抽象):论文提出了模型-harness 拟合(model–harness fit)这一隐变量:harness 进化不是绝对变好,而是"围绕当前模型的规划行为"特化的。一旦权重更新改变了模型的规划分布,拟合就被破坏——即使新模型客观上更强。这解释了为什么同一教学信号(专家轨迹)在 baseline harness 下有益、在进化 harness 下有害:前者本就无拟合可言,模仿引入的规划噪声无所谓;后者的增益恰恰寄存在原生规划行为上,模仿直接摧毁了存款。
形式化:设弱模型 M_t 在 harness h_t^(为 M_t 进化)上成功率 S(M_t, h_t^)。目标序列:
- max S(M_{t+1}, h_t^*),约束:M_{t+1} 的规划分布与 M_t 的偏离最小化(保持拟合);
- 且序列可迭代:M_{t+1} 可作为下一轮 harness 进化的基础。
抽象的精妙:它把"什么时候该模仿专家"从经验问题变成了分布约束问题——教学信号必须尊重学生的规划流形。模仿的错不在教的内容,而在教的方式(整体替换规划分布)。
四、问题解法
4.1 实验基底
采用 Yang et al. 2026 的七个企业任务套件(薪酬审计、预算审批、股票告警、IoT 异常检测、浏览器自动化、网站管理、代码重构),GEPA 式搜索进化 harness(gemini-3.1-pro-preview 元 agent 提出失败驱动编辑,验证通过才保留)。弱模型为 qwen3-coder-30b-a3b(30B 总参/3B 激活)与 gemma-4-26b-a4b,LoRA-SFT 做模型适配。
4.2 第一步:确认专家教学的可行性
harness 进化把弱模型平均成功率从 29.2% 抬到 78.0%(+48.8)。专家 gemini-3.1-pro 在这个"为弱模型进化"的 harness 上从 84.4% 升到 93.6%,且在 93.6–100% 的 rollout 中实际触发了每项进化编辑(包括弱模型只有 30.8% 使用率的领域计算配方,专家用率 94.2%)。专家与弱模型在同一 harness 上的差距 15.6 个百分点——教学空间存在且真实。
4.3 第二步:暴露模仿的翻车
把专家成功轨迹转成 Qwen 输入格式,混合弱模型自身成功轨迹做 LoRA-SFT:平均成功率 78.0% → 63.1%(-14.9),七个任务全线下滑(-4.2 到 -29.9)。第二个模型族(Gemma)复现。而同样的配方在未进化的 baseline harness 上是增益的——这把失败精确定位到"模仿 × harness 进化"的交互,而非模仿本身。
4.4 诊断:失败桶分析
把每个失败 rollout 对照六类适应失败分类:模仿后,隐式知识失败从 46.2% 降到 44.5%(模仿确实传了知识,领域计算配方使用率从 30.8% 升到 76.1%),但规划失败作为新失败模式从 1.1% 暴涨到 14.6%——弱模型学来了专家的规划风格却没有执行它的能力,回头又发现自己不再适配那个围着自己原生风格进化的 harness。典型病例:薪酬审计任务里,微调后的模型算出了正确答案却永远提交不上去——失去自己的节奏后反复重查,回合耗尽,拿零分。
4.5 第三步:on-policy 专家修正
解法:由一个自主 MLE agent 端到端驱动的数据合成管线——从弱模型在进化 harness 下的 rollout 出发,定位每个失败 rollout 的单一失败 turn,专家只重写这一个 turn,其余原样保留。LoRA-SFT 后在相同 harness 上评测。
结果:平均 78.0% → 79.7%(+1.7),五/七个任务增益(网站管理 +5.6、股票告警 +2.2、代码重构 +2.2),两个 harness 已近饱和的任务在噪声内(-0.6/-0.4)。失败桶验证机制:规划桶保持地板(1.1%→1.8%,对比模仿的 14.6%),知识桶继续下降(46.2%→43.2%)。整条管线训练不到一小时,可安全迭代进 harness-model 共进化循环。
五、评估指标与实验证据
主指标:七任务 test split 成功率(三次运行均值±SEM),所有对比固定在进化 harness h* 上。
| 配置 | 平均成功率 | 相对变化 |
|---|---|---|
| Qwen + baseline harness | 29.2% | — |
| Qwen + 进化 harness | 78.0% | +48.8 |
| 专家 + baseline harness | 84.4% | — |
| 专家 + 进化 harness | 93.6% | +9.2 |
| Qwen + 模仿 SFT | 63.1% | -14.9(全线下滑) |
| Qwen + on-policy 修正 | 79.7% | +1.7 |
机制指标(这是本文实验设计的精华):六类失败分布。模仿的 -14.9 分解为"+知识(-1.7 失败占比)-规划(+13.5 失败占比)";修正的 +1.7 分解为"知识桶再降 3.0、规划桶仅 +0.7"。同一教学信号,两种引入方式,失败结构的走向完全相反——这组对照把"拟合破坏"从假设变成了可测量的中间变量。
证明力评估:三个对照组设计干净——baseline harness 下的模仿(排除模仿本身有害)、第二模型族复现(排除 Qwen 特异性)、失败桶分解(提供机制中间变量)。局限如实:LoRA 的轻量级限制了追上专家的天花板(79.7% vs 93.6%),on-policy 修正的 +1.7 绝对值不大,但其价值在于"不破坏 +48.8 的已有资产",这个定性对共进化循环的可行性至关重要。
六、效果优势的根源解释
模仿为何在进化 harness 下翻车:harness 的 +48.8 分不是白来的——它精确补偿了弱模型原生规划方式的短板(比如给它的领域计算配方提示是按它的理解习惯写的)。模仿把学生的规划分布整体拉向专家:学生学到了专家的"先全局规划再执行"风格,却没有专家的执行能力去兑现这种风格,而 harness 的脚手架还是按它旧的"局部逐步"风格搭的。结果两头落空:新风格执行不动(规划失败 +13.5),旧适配被拆除。
为什么 baseline harness 下模仿反而有益:baseline harness 从未与模型的规划行为耦合(+0 拟合存款),模仿引入的规划噪声没有可破坏的东西,知识增益(失败桶 61.0%→54.4%)直接兑现为净收益。同一干预在两个对照组的效果差,就是拟合变量的效应量。
on-policy 修正为何安全且有效:只重写失败 turn 意味着训练信号在学生的规划流形上是局部的——其余 turn 全部来自学生自己的分布,SFT 的梯度大部分在巩固原有风格,只有失败点上引入外来知识。知识桶继续下降(46.2%→43.2%)说明教学效果保住了;规划桶几乎不动(+0.7)说明拟合保住了。这是"在学生访问的状态上施加最小修正"这一 on-policy 原则的直接机制红利。
反事实闭环:把修正换成全轨迹模仿 → -14.9;把修正的作用点从失败 turn 换成整条轨迹 → 退化回模仿;保持修正但不用进化 harness → 收益参照系改变,无拟合可言。三个反事实共同锁定:拟合是调节变量,修正的作用域是保护拟合的关键设计。
七、必要知识反推
领域知识层:
- 企业 Agent 任务的形态(长程、工具调用、可验证结果)与 LoRA-SFT 的适配特性;
- harness 进化的搜索范式(GEPA 的失败驱动编辑、验证门保留);
- Agent 失败模式分类学(Yang et al. 的六类适应失败体系)——没有这套ontology,就无法做失败桶分析,也就无法诊断拟合破坏。
方法论知识层:
- 模仿学习的分布偏移问题(为什么 off-policy 模仿脆弱);
- DAgger/on-policy 修正的思想——在学生状态上让教师示范;
- 对照实验设计:调节变量的识别与检验(本文的"baseline harness 对照"是教科书级操作)。
工程知识层:
- 轨迹格式转换(Gemini→Qwen 的 chat/tool-call 格式映射);
- MLE agent 的自主数据合成管线(失败定位、单 turn 重写、数据回流);
- 低成本训练预算管理(<1 小时 LoRA)。
知识融合的关键节点:融合发生在"失败模式分类学“与”分布偏移理论“之间。看到模仿失败的企业很多,但多数止步于"换个配方试试”。作者用失败桶把"能力没传过去"(知识桶)与"能力传过去但风格变了"(规划桶)分开——这一步需要同时精通分类学工具和分布直觉;一旦分开,解法自己浮现:保分布、只传知识 → on-policy 最小修正。诊断工具的精度决定了处方的设计空间,这是本文方法论上最值得学的一点。
八、论文中可以提取的通用性灵感
1. 系统组件互相特化后,单侧升级可能摧毁隐性适配。 核心思想:两个组件联合优化产生的增益可能寄存在它们的交互细节上;单独升级其中一者(哪怕升级方向客观更优)会清空这笔存款。 论文证据:模仿让 78.0%→63.1%,但同样模仿在 baseline harness 上有增益。 推广场景:微服务升级(依赖方与提供方共同演化后的接口默契);数据库与 ORM 的协同优化;双人协作流程中单方面引入"更高效"的工具。
2. 教学信号应施加在学生的分布上,而不是教师的分布上。 核心思想:让学生在其自身状态上接受最小修正,比让其模仿教师的完整轨迹更保拟合。 论文证据:全轨迹模仿 -14.9 vs 失败 turn 修正 +1.7,失败结构走向相反。 推广场景:教育中的纠错式批改 vs 范文全文仿写;代码评审只改有问题的 diff;教练指导动作细节而非重教整套动作。
3. 中间变量是归因的关键:把"变差"分解成失败桶。 核心思想:聚合指标的退化必须分解到机制层(什么类型的失败增加了),否则会在错误的层面修修补补。 论文证据:规划桶 +13.5 / 知识桶 -1.7 的分解,直接指向规划风格漂移而非知识缺失。 推广场景:产品指标回退的分场景归因;医学的综合征鉴别诊断;A/B 实验的副指标监控。
4. “更强"不等于"更适合当老师”。 核心思想:教师的价值不在其绝对能力,而在其示范能否在学生当前分布内被吸收。 论文证据:专家在进化 harness 上 93.6%,但它的轨迹当 SFT 数据反而是毒药;改造成单点修正后才有正价值。 推广场景:专家知识向新人的传递设计(专家分解自己的直觉 vs 扔一份专家级文档);大模型能力向小模型蒸馏的配方选择;资深员工带教方式的制度设计。
5. 便宜且可迭代的杠杆优先于昂贵的一次性方案。 核心思想:harness 进化(几小时、无权重改动)与 LoRA(<1 小时)这类轻杠杆可安全堆叠,共同进化循环的价值在于每一步都可回滚。 论文证据:整条修正管线训练 <1 小时,可安全进入迭代循环。 推广场景:MLOps 的增量迭代文化;产品的灰度发布策略;个人学习系统的可撤销笔记方法。
本文基于 arXiv:2609.09134 全文精读撰写。数据与结论均引自原文。