- 论文链接:ClawGym II: Exploring Black-Box RL on Agent Harness
- 发表时间:2026年8月17日(arXiv:2608.16798v1)
- 机构:中国人民大学高瓴人工智能学院(Wayne Xin Zhao、文继荣)+ IQuest Research——高校+产业研究团队合作;两位共同一作,两位通讯作者
- 领域标签:Agent RL、harness 基础设施、黑盒优化、cs.AI
一、论文背景
**Agent harness 为什么需要 RL?**harness 极大提升了长时程任务表现(DeepSeek 开源 Harness 三天 12 万星、StateM 用 harness scaling 拿下 Terminal-Bench 95.3%),但一个被忽视的问题是:**harness 内部的模型该怎么训练?**harness 包裹着模型——它决定上下文如何组装、工具如何路由、中间结果如何压缩、子任务如何调度。这让 RL 面临根本困难:轨迹的"动作"不再是模型的单步输出,而是 harness 决策与模型输出交织的复杂树;奖励出现在环境终态,但中间过程对训练侧是黑盒。
**为什么这个问题此前没人系统性解决?**把 RL 扩展到长时程 agent 任务本身就有三座大山:rollout 并发(任务环境有状态、相互干扰)、轨迹恢复(agent 的树状探索——试错、回退、并行分支——不是线性序列)、训练-推理一致性(训练时的行为分布要与部署后一致)。加上 harness 这个黑盒,多数工作选择绕开:要么只在裸环境上 RL 再套 harness(错配),要么只用 SFT 模仿成功轨迹(无法优化 harness 引入的噪声与约束)。
二、论文定位和关联工作
| 研究谱系 | 代表工作 | 核心思想 | 与本文的关键区别 |
|---|---|---|---|
| Agent RL 环境 | WebArena/ALFWorld 系 RL、agentic RL 框架 | 在裸任务环境上做策略优化 | 环境透明可控;本文环境+harness整体黑盒 |
| 前作 ClawGym | ClawGym(I 系) | OpenClaw harness 上的训练 | 仅单一harness;II 扩展到统一框架+异构harness+混合训练 |
| SFT 蒸馏 | 通用 SFT 流水线 | 模仿成功轨迹 | 无针对 harness 噪声的优化;本文对照显示 SFT 落后 5.80 分 |
| Harness 工程 | StateM、DarwinX 等 | 进化 harness 本身 | harness 固定、改模型;本文模型在 harness 内被 RL 优化 |
定位结论:ClawGym II 把"harness 内的模型训练"从个案(前作只做 OpenClaw)升级为统一可扩展的黑盒 RL 基础设施,并首次回答"harness 异构性是否可被单一策略吸收"(混合训练实验)。
三、问题定义
具体场景:通用 agent 任务 = 用户指令 + 有状态隔离环境;agent 通过 harness(工具循环、文件系统、代码执行、控制流)与环境多轮交互;harness 内部结构对训练侧不可见。
核心洞察:harness 虽是黑盒,但环境奖励与沙盒遥测是可见的——只要能把"环境终态奖励"正确归因到"模型在沙盒内的动作序列"上,RL 的信用分配链条就能闭合。问题从"如何打开 harness"转化为"如何在沙盒隔离下忠实恢复轨迹"。
形式化:给定黑盒 harness H 与任务分布 T,求策略 π_θ 最大化 E_{t~T}[R(H(π_θ, env_t))],其中 H(π_θ, env) 的内部执行对训练侧不透明,仅环境终态与遥测可观测。约束:训练稳定(长时程、稀疏奖励)、可扩展(并发 rollout)、训练-推理一致。
抽象的精妙之处:把"harness 不可控"从缺陷转为设计原则——不假设任何 harness 内部接口,因此方法对任意 opaque harness 通用(OpenClaw、Claude Code、未来的任何框架)。
四、问题解法
1. 沙盒化执行基础设施。每个任务的"harness+环境"整体封装进临时沙盒:隔离保证并发 rollout 互不干扰;沙盒销毁即环境重置;遥测流完整记录 harness 的一切输入输出。
2. 忠实轨迹恢复。从沙盒遥测中重建树状执行轨迹:harness 的重试/分支/回退结构被还原为树,模型动作节点与环境观察节点交替;环境奖励(来自任务终态的工件/操作判定)沿树结构回传到每个模型决策——这是黑盒条件下信用分配的关键机制。
3. 稳定优化技术。PPO 与 GRPO 的树结构适配(优势估计沿树而非线性序列);训练-推理一致性保证(训练时 harness 行为分布与部署一致);可靠并发(沙盒级故障隔离,单任务失败不污染批次)。
4. 混合 harness 训练。同一策略在 OpenClaw 与 Claude Code 两种 harness 的任务上联合优化——检验"异构 harness 的经验能否互相增益"。
5. 双评测体系。ClawGym-Bench(生产力协作/系统自动化/分析推理/内容领域/规划知识/软件开发六域)+ PinchBench(外部独立基准,测迁移)。
五、评估指标与实验证据
主结果(Pass@1,%):
| 模型 | PinchBench | ClawGym-Bench 均值 |
|---|---|---|
| Qwen3-30A3B(OpenClaw) | 55.60 | 45.11 |
| ClawGym-30A3B(SFT基线) | 86.00 | 56.82 |
| ClawII-OC-30A3B(本文RL) | 87.32 | 62.62 |
| Qwen3-30A3B(Claude Code) | 54.14 | 37.06 |
| ClawII-CC-30A3B(本文RL) | 71.42 | 51.87 |
增益核算:OpenClaw 下较初始 +9.98 分(且超 SFT 基线 +5.80);Claude Code 下 +14.81 分(起点更低、提升更大);8B 骨干同样双 harness 一致增益。混合 harness 训练的模型在两种 harness 上均持平或超过各自单独训练版本。
稳定性:训练在 200-400 优化步内无崩溃,损失与指标平稳。扩展任务:JobBench 与 OfficeQA 更难设置上持续获益。
实验设计为何有证明力:(1) 同一骨干在"裸/ SFT / RL"三档对照,分离模仿与优化的贡献;(2) 两种结构迥异 harness(开源 OpenClaw vs 闭源 Claude Code)上的复制——证明方法不依赖特定 harness 内部结构;(3) PinchBench 外部迁移排除"只拟合自家基准";(4) 混合训练对照回答"harness 经验是否可泛化"这一前置问题。
六、效果优势的根源解释
SFT 的根本局限:模仿只能覆盖成功轨迹的分布支撑——harness 引入的随机调度误差、上下文压缩偏差、工具路由噪声在成功轨迹中被"侥幸绕过"而非被修正;部署时这些噪声以不同组合出现,SFT 策略没有对应的恢复行为。
黑盒 RL 的机制因果链:沙盒隔离 → 并发 rollout 可大规模并行(采样效率)→ 树状轨迹忠实恢复 → 环境奖励沿树回传到模型决策节点(信用分配闭合)→ 策略梯度直接优化"在 harness 噪声与约束下依然完成任务"的行为 → 体现在 Claude Code harness 上更大的增益(+14.81,起点 37.06 更低意味着 harness 噪声损失更大、可恢复空间更大)。
混合训练为何有效:两种 harness 的任务成功都依赖底层共通能力(工具使用的时机判断、中间结果的持久化、错误的检测与重试);harness 差异主要表现为"观测/动作界面的形变"——联合训练等效于对界面形变做数据增强,策略学到的是界面不变的能力核。
反事实:若轨迹恢复不忠实(线性化树结构),奖励会错误归因到被回退的分支上——这是此前"环境上 RL 再套 harness"路线错配的根源。
七、必要知识反推
领域知识层:harness 的运行机制(工具循环/上下文管理/子agent调度)——不理解黑盒里发生了什么,就无法设计遥测采集与轨迹恢复;通用 agent 任务的奖励来源(环境终态工件判定)——信用分配的起点。
方法论知识层:PPO/GRPO 的优势估计理论及其到树结构的推广;训练-推理一致性原理(off-policy 程度控制);SFT 与 RL 的适用边界(分布覆盖 vs 边界优化)。
工程知识层:沙盒化与容器编排(临时沙盒生命周期管理);并发 rollout 的故障隔离;大模型分布式训练基础设施。
知识融合的关键节点:“黑盒不等于不可训练”——把控制流交给沙盒遥测+树恢复,把优化交给策略梯度。这个融合要求同时放下"必须白盒才可控"的执念与"黑盒下 RL 一定不稳"的悲观,在遥测数据结构上找到信用分配的工程支点。
八、论文中可以提取的通用性灵感
1. 接口不可控时,把信用分配锚定在可观测的边界事件上。环境终态+遥测是唯一真相源。推广场景:对第三方闭源系统做优化(只控输入输出);组织管理中对不可观测的协作过程用结果+关键节点复盘;黑盒组件的性能调优。
2. 树状轨迹的忠实恢复是树状执行体 RL 的前提。推广场景:任何含重试/分支/回退的执行系统(工作流引擎、编译器优化、机器人规划)做学习优化时,都须先解决轨迹结构化。
3. 界面形变当数据增强:异构环境联合训练学到不变能力核。混合 harness 训练不降反升。推广场景:多平台软件的跨 UI 自动化测试训练;多语言客服策略统一训练;跨设备机器人的策略泛化。
4. 先建隔离、再谈并发。沙盒隔离是可靠并发 rollout 的前提。推广场景:微服务的故障爆炸半径控制;实验平台的资源隔离;混沌工程的环境快照。
5. 评测要内外双轨。ClawGym-Bench(开发域)+ PinchBench(外部迁移)防止自欺。推广场景:内部 OKR 与外部市场反馈并重;模型的私有基准与公开基准双轨;教育的校内考试与统考双轨校准。