论文链接:EvoHarnessBench: Can Your Agents Keep Pace with an Evolving Harness? 发表时间:2026年9月(arXiv:2609.04280) 机构:Salesforce Research × University of North Carolina at Chapel Hill × University of Wisconsin–Madison——产学研合作:Salesforce 提供真实 AgentForce 生产环境的问题来源(其公开技能仓库与 OpenAI 公开技能库的流式演化作为 harness 进化的现实原型),UNC/UW 研究者(部分为 Salesforce 实习生)主导基准构建 领域标签:cs.MA / cs.AI / 智能体评测 / 持续学习 / Harness 工程
一、论文背景
现代 LLM 智能体不是"一个模型",而是"模型 + harness":一组工具、可复用技能、专职子智能体,共同决定智能体能观察什么、能做什么。
关键现实:harness 在持续进化。产品迭代会加新工具、技能库会加新技能、multi-agent 系统会接入新的子 agent。Salesforce 自己的 Agentforce 平台与 OpenAI 的公开技能仓库都在流式增长。
但现有的"智能体持续学习"基准有一个共同的建模偏差:它们把非平稳性放在任务流里(任务一个接一个来,harness 固定),而现实恰好相反——任务是同类的,变的是 harness。
这引出一个从未被系统提问的问题:当一个已经部署的智能体所处的 harness 不断膨胀时——
- 它原有的 competence(比如"用旧工具集订机票")会保持吗?还是会被新增能力干扰?
- 自进化式 adaptation 能跟上演进吗?跟着学新工具时会不会忘了旧的?
概念铺垫:
- harness:工具+技能+子智能体的整体供给;
- 部署评估(deployment evaluation):harness 扩张后重测旧能力——度量"保留"(retention);
- 自进化适应(self-evolving adaptation):智能体用适应机制(如经验学习)跟随 harness 更新——度量"跟进"能力。
二、论文定位和关联工作
| 基准/方向 | 非平稳性放哪 | 与 EvoHarnessBench 的区别 |
|---|---|---|
| 智能体持续学习基准 | 任务流 | harness 固定——与现实相反 |
| 经典持续学习(CL) | 数据分布漂移 | 无 harness 概念,无法测工具/技能/agent 三轴 |
| 工具学习基准 | 静态工具集 | 不模拟工具集本身的增长 |
| Harness 工程研究 | 本专栏此前 HarnessDev/HarnessEvo 等 | 方法/配方向;EvoHarnessBench 提供评测底座 |
定位结论:EvoHarnessBench 是"harness 为非平稳源“这一新评测象限的开创者,与本日 Multi-Harness RL(训练侧 harness 效应)形成评测/训练两侧的呼应。
三、问题定义
具体问题:在 harness 三轴(工具、技能、智能体)受控演进下,智能体的能力保持与自进化适应如何量化?
抽象化:设 harness H_t 按演化计划逐步扩张(H₁ ⊂ H₂ ⊂ … ⊂ H_T),任务能力集 K 在各阶段定义。评测两个互补量:
Retention:在 H_{t+1} 下测 K_t(旧阶段能力)——新增供给是否破坏既有 competence;
Adaptation:给定自进化机制,agent 在 H_{t+1} 下掌握 K_{t+1}(新能力)的速度与质量。
给定:受控 harness 流(每条流是一系列确定性的 harness 版本)、每阶段的能力评估集;
求:agent/适应机制在两设定下的保持曲线与跟进曲线;
约束:演化必须确定性可复现(从 verifier 基准确定性构建,不靠随机采样)。
精妙之处:保留与跟进是两种不同的失败——被新工具干扰(retention 损失)和学不会新工具(adaptation 失败)需要不同的药方,此前基准从未分开测过。
四、问题解法
4.1 基准构建
- 规模:17 条多阶段 harness 进化流,共 802 任务、520 工具、42 技能、62 智能体;
- 来源:从 verifier-based 基准确定性构建——每条流的每个阶段都有明确的工具/技能/子 agent 增量,保证可复现;
- 三轴:工具(新 API)、技能(新流程知识)、智能体(新专职子 agent)分别可组合的演化。
4.2 两个评测设定
- 部署评估:固定策略,跨阶段重测旧能力 → 保持曲线(retention curve);
- 自进化适应:允许智能体启用适应机制(经验积累、技能更新)跨阶段跟随 → 跟进曲线(adaptation curve)。
分析维度还包括:新加入子智能体对既有 delegation 行为的影响——附录分析发现新增子 agent 改变主 agent 的委派选择性(adaptation 改善的是委派完备性而非委派选择性)。
五、评估指标与实验证据
| 设定 | 指标 | 发现(正文实验) |
|---|---|---|
| 部署评估 | 旧能力保持率跨阶段曲线 | harness 扩张对既有 competence 的干扰可量化,不同 agent 表现分化 |
| 自进化适应 | 新能力掌握速度/质量 | 适应机制普遍难以完全跟上工具轴演进 |
| 委派行为分析 | 委派完备性 vs 选择性 | 自进化适应改善委派完备性而非选择性;正确委派必要但不充分 |
| 新增子智能体 | MAS 委派分布 | 新增子 agent 系统性改变委派分布 |
实验设计如何证明论点:
- 确定性构建保证"任何性能变化都可归因于 harness 变化本身”——消除了任务流基准里分布漂移与能力变化的混淆;
- 双设定分离使"干扰"与"跟进"两类失败可分别定位;
- 17 条流的多样性避免单一流的特殊性;
- 委派行为的分析层证明该基准不止测分数,还能解剖行为机制的变化。
六、效果优势的根源解释(基准设计的优越性来源)
既有基准为何测不出这个问题:任务流持续学习范式把"变化"编码在数据分布里,模型-环境接口被视为常量。这继承了监督学习持续学习的传统假设。但智能体的 competence 本质上是接口绑定的(本日 Multi-Harness RL 论文的 4.3× 效应量正是接口效应的训练侧证据)——接口本身变化时,“能力"这一概念的定义都随之改变。
EvoHarnessBench 的根本改变:把非平稳性从数据空间搬到供给空间(harness 三轴)。这一搬家带来两个结构性质变:
- 能力变化可以直接归因于具体的供给增量(第 t 阶段加了哪个工具/技能/agent)——因果粒度从"分布漂移"细化到"供给增量”;
- 保留与跟进的失败第一次可分离——因为每次演化都是纯增量(H_t ⊂ H_{t+1}),旧能力评估集不变。
委派完备性 vs 选择性发现的机制含义:自进化适应让 agent"更愿意尝试委派"(完备性升),但没有变得"更会挑对的人"(选择性平)——说明委派质量的瓶颈在判断力而非意愿,为 adaptation 机制设计指出具体短板。
七、必要知识反推
领域知识层:
- 生产级 agent 平台的 harness 形态(Agentforce、技能仓库的运营现实);
- multi-agent 系统的委派机制与子 agent 接口设计。
方法论知识层:
- 持续学习的评估协议(保持/迁移/前向干扰的度量传统);
- 确定性环境生成(从 verifier 基准派生演化流);
- 行为级分析(委派决策的完备性/选择性分解)。
工程知识层:
- 大规模工具/技能/子 agent 的沙箱化与版本管理;
- 跨阶段评估的算力组织(17 流 × 多阶段 × 双设定)。
融合的关键节点:作者把生产环境里"平台每周都在加新工具"这一运营事实,映射为持续学习文献的"非平稳源"概念——产业观察与学术范式的对接点是"接口也是会漂移的"这一判断。
八、论文中可以提取的通用性灵感
接口也是会漂移的
- 核心思想:能力评测必须把"供给面(工具/技能/协作方)的演化"当作一等变量。
- 论文证据:17 条确定性 harness 流上保留/跟进的可分离测量。
- 推广场景:评审系统的多场景持续验证(本文读者 V5 系统迭代时的回归测试设计)、企业 agent 平台的升级验收、API 依赖管理。
保留与跟进是两种失败
- 核心思想:任何增量演进系统的评测都应分别度量"旧能力是否受损"与"新能力是否学会"。
- 论文证据:双设定设计的可分离归因。
- 推广场景:微服务重构验收、模型版本灰度、技能库更新审计。
确定性演化流优于随机漂移
- 核心思想:让"变化"本身确定可复现,才能把性能变化归因到具体增量。
- 论文证据:从 verifier 基准确定性构建的 17 条流。
- 推广场景:回归测试基准构建、chaos engineering 实验设计。
委派质量先问意愿还是判断
- 核心思想:multi-agent 委派失败要区分"没去委派"(完备性)与"委派错人"(选择性)。
- 论文证据:adaptation 改善完备性而非选择性的发现。
- 推广场景:多智能体编排系统的诊断指标、组织管理的人岗匹配分析。