论文链接:EvoHarnessBench: Can Your Agents Keep Pace with an Evolving Harness? 发表时间:2026年9月(arXiv:2609.04280) 机构:Salesforce Research × University of North Carolina at Chapel Hill × University of Wisconsin–Madison——产学研合作:Salesforce 提供真实 AgentForce 生产环境的问题来源(其公开技能仓库与 OpenAI 公开技能库的流式演化作为 harness 进化的现实原型),UNC/UW 研究者(部分为 Salesforce 实习生)主导基准构建 领域标签:cs.MA / cs.AI / 智能体评测 / 持续学习 / Harness 工程

一、论文背景

现代 LLM 智能体不是"一个模型",而是"模型 + harness":一组工具、可复用技能、专职子智能体,共同决定智能体能观察什么、能做什么。

关键现实:harness 在持续进化。产品迭代会加新工具、技能库会加新技能、multi-agent 系统会接入新的子 agent。Salesforce 自己的 Agentforce 平台与 OpenAI 的公开技能仓库都在流式增长。

但现有的"智能体持续学习"基准有一个共同的建模偏差:它们把非平稳性放在任务流里(任务一个接一个来,harness 固定),而现实恰好相反——任务是同类的,变的是 harness。

这引出一个从未被系统提问的问题:当一个已经部署的智能体所处的 harness 不断膨胀时——

  • 它原有的 competence(比如"用旧工具集订机票")会保持吗?还是会被新增能力干扰?
  • 自进化式 adaptation 能跟上演进吗?跟着学新工具时会不会忘了旧的?

概念铺垫:

  • harness:工具+技能+子智能体的整体供给;
  • 部署评估(deployment evaluation):harness 扩张后重测旧能力——度量"保留"(retention);
  • 自进化适应(self-evolving adaptation):智能体用适应机制(如经验学习)跟随 harness 更新——度量"跟进"能力。

二、论文定位和关联工作

基准/方向非平稳性放哪与 EvoHarnessBench 的区别
智能体持续学习基准任务流harness 固定——与现实相反
经典持续学习(CL)数据分布漂移无 harness 概念,无法测工具/技能/agent 三轴
工具学习基准静态工具集不模拟工具集本身的增长
Harness 工程研究本专栏此前 HarnessDev/HarnessEvo 等方法/配方向;EvoHarnessBench 提供评测底座

定位结论:EvoHarnessBench 是"harness 为非平稳源“这一新评测象限的开创者,与本日 Multi-Harness RL(训练侧 harness 效应)形成评测/训练两侧的呼应。

三、问题定义

具体问题:在 harness 三轴(工具、技能、智能体)受控演进下,智能体的能力保持与自进化适应如何量化?

抽象化:设 harness H_t 按演化计划逐步扩张(H₁ ⊂ H₂ ⊂ … ⊂ H_T),任务能力集 K 在各阶段定义。评测两个互补量:

  • Retention:在 H_{t+1} 下测 K_t(旧阶段能力)——新增供给是否破坏既有 competence;

  • Adaptation:给定自进化机制,agent 在 H_{t+1} 下掌握 K_{t+1}(新能力)的速度与质量。

  • 给定:受控 harness 流(每条流是一系列确定性的 harness 版本)、每阶段的能力评估集;

  • 求:agent/适应机制在两设定下的保持曲线与跟进曲线;

  • 约束:演化必须确定性可复现(从 verifier 基准确定性构建,不靠随机采样)。

精妙之处:保留与跟进是两种不同的失败——被新工具干扰(retention 损失)和学不会新工具(adaptation 失败)需要不同的药方,此前基准从未分开测过。

四、问题解法

4.1 基准构建

  • 规模:17 条多阶段 harness 进化流,共 802 任务、520 工具、42 技能、62 智能体;
  • 来源:从 verifier-based 基准确定性构建——每条流的每个阶段都有明确的工具/技能/子 agent 增量,保证可复现;
  • 三轴:工具(新 API)、技能(新流程知识)、智能体(新专职子 agent)分别可组合的演化。

4.2 两个评测设定

  1. 部署评估:固定策略,跨阶段重测旧能力 → 保持曲线(retention curve);
  2. 自进化适应:允许智能体启用适应机制(经验积累、技能更新)跨阶段跟随 → 跟进曲线(adaptation curve)。

分析维度还包括:新加入子智能体对既有 delegation 行为的影响——附录分析发现新增子 agent 改变主 agent 的委派选择性(adaptation 改善的是委派完备性而非委派选择性)。

五、评估指标与实验证据

设定指标发现(正文实验)
部署评估旧能力保持率跨阶段曲线harness 扩张对既有 competence 的干扰可量化,不同 agent 表现分化
自进化适应新能力掌握速度/质量适应机制普遍难以完全跟上工具轴演进
委派行为分析委派完备性 vs 选择性自进化适应改善委派完备性而非选择性;正确委派必要但不充分
新增子智能体MAS 委派分布新增子 agent 系统性改变委派分布

实验设计如何证明论点:

  1. 确定性构建保证"任何性能变化都可归因于 harness 变化本身”——消除了任务流基准里分布漂移与能力变化的混淆;
  2. 双设定分离使"干扰"与"跟进"两类失败可分别定位;
  3. 17 条流的多样性避免单一流的特殊性;
  4. 委派行为的分析层证明该基准不止测分数,还能解剖行为机制的变化。

六、效果优势的根源解释(基准设计的优越性来源)

既有基准为何测不出这个问题:任务流持续学习范式把"变化"编码在数据分布里,模型-环境接口被视为常量。这继承了监督学习持续学习的传统假设。但智能体的 competence 本质上是接口绑定的(本日 Multi-Harness RL 论文的 4.3× 效应量正是接口效应的训练侧证据)——接口本身变化时,“能力"这一概念的定义都随之改变。

EvoHarnessBench 的根本改变:把非平稳性从数据空间搬到供给空间(harness 三轴)。这一搬家带来两个结构性质变:

  1. 能力变化可以直接归因于具体的供给增量(第 t 阶段加了哪个工具/技能/agent)——因果粒度从"分布漂移"细化到"供给增量”;
  2. 保留与跟进的失败第一次可分离——因为每次演化都是纯增量(H_t ⊂ H_{t+1}),旧能力评估集不变。

委派完备性 vs 选择性发现的机制含义:自进化适应让 agent"更愿意尝试委派"(完备性升),但没有变得"更会挑对的人"(选择性平)——说明委派质量的瓶颈在判断力而非意愿,为 adaptation 机制设计指出具体短板。

七、必要知识反推

领域知识层:

  • 生产级 agent 平台的 harness 形态(Agentforce、技能仓库的运营现实);
  • multi-agent 系统的委派机制与子 agent 接口设计。

方法论知识层:

  • 持续学习的评估协议(保持/迁移/前向干扰的度量传统);
  • 确定性环境生成(从 verifier 基准派生演化流);
  • 行为级分析(委派决策的完备性/选择性分解)。

工程知识层:

  • 大规模工具/技能/子 agent 的沙箱化与版本管理;
  • 跨阶段评估的算力组织(17 流 × 多阶段 × 双设定)。

融合的关键节点:作者把生产环境里"平台每周都在加新工具"这一运营事实,映射为持续学习文献的"非平稳源"概念——产业观察与学术范式的对接点是"接口也是会漂移的"这一判断。

八、论文中可以提取的通用性灵感

  1. 接口也是会漂移的

    • 核心思想:能力评测必须把"供给面(工具/技能/协作方)的演化"当作一等变量。
    • 论文证据:17 条确定性 harness 流上保留/跟进的可分离测量。
    • 推广场景:评审系统的多场景持续验证(本文读者 V5 系统迭代时的回归测试设计)、企业 agent 平台的升级验收、API 依赖管理。
  2. 保留与跟进是两种失败

    • 核心思想:任何增量演进系统的评测都应分别度量"旧能力是否受损"与"新能力是否学会"。
    • 论文证据:双设定设计的可分离归因。
    • 推广场景:微服务重构验收、模型版本灰度、技能库更新审计。
  3. 确定性演化流优于随机漂移

    • 核心思想:让"变化"本身确定可复现,才能把性能变化归因到具体增量。
    • 论文证据:从 verifier 基准确定性构建的 17 条流。
    • 推广场景:回归测试基准构建、chaos engineering 实验设计。
  4. 委派质量先问意愿还是判断

    • 核心思想:multi-agent 委派失败要区分"没去委派"(完备性)与"委派错人"(选择性)。
    • 论文证据:adaptation 改善完备性而非选择性的发现。
    • 推广场景:多智能体编排系统的诊断指标、组织管理的人岗匹配分析。