EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents —— 精读
论文链接:https://arxiv.org/abs/2608.05446
发表时间:2026 年 8 月 5 日(arXiv:2608.05446v1,cs.LG),已被 LLA@COLM 2026 接收
发表机构:伊利诺伊大学厄巴纳-香槟分校(UIUC:Xuying Ning、Hanghang Tong、Jingrui He 等)× Meta AI(Dongqi Fu、Tianxin Wei、Hanqing Zeng、Qifan Wang 等)——高校前沿研究与工业界大规模智能体系统的深度合作
领域标签:cs.LG / cs.CL(Agent harness / 强化学习 / 长程智能体)
一、论文背景
1.1 什么是 harness:智能体背后的“隐形座舱”
如果把我们熟悉的 LLM 智能体比作一位飞行员,那么大模型本身只是飞行员的大脑,而真正让它完成长程任务的,是围绕它搭建的一整套外部执行支持系统——harness(运行时挽具/座舱)。论文给 harness 下的定义是:支撑智能体执行的一系列提示词、工具、检索模块、记忆、状态跟踪器、执行反馈与控制流机制的集合。
这个类比很贴切:飞行员不需要记住整片空域的每一条航路,座舱仪表盘替他实时显示高度、航向、油量;他也不需要凭大脑记住整个检查单,标准操作程序(SOP)卡片就是他的外部记忆。harness 对智能体的作用正是如此——维护环境信念、跟踪任务进度、调用工具、验证结果、复用历史经验。
随着智能体框架与产品系统的发展,harness 组件正变得越来越丰富、越来越专业化:Anthropic 的工程博客专门讨论“如何为长时间运行的智能体设计有效 harness”,学术界则涌现出一批优化 harness 状态、实现与轨迹适配的工作。现代智能体可以说是“被有用外部组件包围着”运转的。
1.2 长程任务为什么离不开外部状态
在具身交互、网页导航、软件工程、工作流自动化这类长程(long-horizon)任务中,智能体需要跨越几十甚至上百步交互来完成任务。此时纯靠上下文窗口内的“脑子记忆”会遭遇三类经典失败模式:
- 丢失环境状态——走着走着忘了哪个抽屉已经翻过、水壶到底在不在灶台上;
- 忘记执行进度——做到第 15 步时忘了哪些子目标已完成、下一步该干什么、哪里被卡住了;
- 重复犯错——上一个回合已经踩过的坑(比如“番茄酱通常不在冰箱里”),这一回合又原样踩一遍。
这三类失败恰好对应三类外部支持的需求:维护环境信念的状态跟踪器、记录子目标完成情况的进度跟踪器、跨回合复用知识的记忆/技能库。
1.3 现有方法的缺陷:harness 用法从未被“训练”过
问题在于:即便这些外部组件被精心设计出来,智能体何时访问它们、如何使用它们,仍然是由提示词、启发式规则或领域特定约定硬编码的。论文对现状的刻画一针见血:
智能体可能被有用的外部支持所包围,却几乎从未被训练过如何把“构建、访问、更新、整合这些支持”作为自身决策过程的一部分。
也就是说,现有方法把 harness 当作环境侧的静态制品:要么由人类开发者手工设计约定,要么由离线搜索算法自动发现配置,而智能体自身的策略从未参与“何时使用 harness”的决策。提示词约定无法感知访问成本——上下文塞得满满的、每一步都去查一次记忆,也不管这些查询是否值得;反过来,写得太空泛又会导致该查的时候不查。harness 用法成了提示词工程师的手艺活,而非可优化的策略对象。
二、论文定位和关联工作
2.1 两条研究谱系
本文处于两条研究线的交汇处:
谱系一:Harness Engineering(harness 工程化)。这条线关心如何把 harness 本身做得更好——更丰富的观察渲染器、文件系统访问、执行反馈等。代表性工作包括:
- Harness-1:把搜索状态外置到环境侧记忆中,用 RL 训练搜索智能体;
- Meta-Harness / HarnessX:通过离线搜索与轨迹驱动的适配来自动发现有效的 harness 配置;
- AutoHarness:自动合成代码 harness。
谱系二:记忆自进化智能体。这条线关心如何把过去的轨迹蒸馏成可复用的记忆、工作流或技能。代表工作包括 Reflexion(语言化反思强化)、Voyager(开放式技能库)、ReasoningBank(推理记忆扩展自进化)、MemP(程序性记忆)、Dynamic Cheatsheet(测试时自适应记忆)、ACE(上下文工程)、SkillOS(技能策展学习)、SkillRL(递归技能增强强化学习)等。近期的共识是:经验库需要主动策展、精炼、整合与遗忘,而非只增不减的 append-only 日志。
2.2 两条谱系各自的盲区与本文的独特定位
Harness Engineering 的盲区:这些方法大多把 harness 视为环境侧构造或提示词约定,由人类开发者或离线搜索算法工程化——智能体策略本身不参与“何时访问”的决策。
记忆自进化谱系的盲区:现有自进化智能体通常把跨回合技能策展与回合内实时状态跟踪割裂开来——管长期记忆的不管环境信念,管环境信念的不管技能库。
EvoHarness-RL 的定位是站在两条谱系交汇处,提出了一个此前未被系统研究的问题——harness 策略学习:把 harness 访问当作一等公民的、可学习的策略决策,训练策略主动控制、查询并协调外部工作空间,并且让长期经验与回合内信念/进度在同一个接口下协同演化。下表整理三方对比:
| 维度 | Harness Engineering 谱系 | 记忆自进化谱系 | EvoHarness-RL |
|---|---|---|---|
| 典型代表 | Harness-1、Meta-Harness、HarnessX、AutoHarness | Reflexion、Voyager、ReasoningBank、SkillOS、SkillRL | 本文 |
| 优化对象 | harness 本身(环境侧配置) | 记忆/技能库内容 | 策略对 harness 的访问决策 |
| 访问时机由谁决定 | 人工规则/离线搜索/提示词约定 | 大多提示词驱动、固定流程 | 策略在线学习,与任务动作共用预算 |
| 回合内状态跟踪 | 领域特定组件,与策略分离 | 通常缺位 | 统一进 BPE 接口(Belief/Progress) |
| 经验库形态 | —— | 部分工作支持策展(SkillOS/SkillRL) | add/update/remove/skip 整合 + LFU 遗忘,可被在线纠错 |
| 训练信号 | 部分 RL(如 Harness-1) | SFT/RL 混合 | SFT bootstrap + 代价感知 GRPO |
三、问题定义
3.1 从一句话抽象出研究问题
论文的核心观察可以浓缩为一句话:智能体被有用的外部组件包围,却从未被训练去决定何时使用它们。 由此抽象出的研究问题是——harness 策略学习:智能体离线学习 harness 策略,并在运行时执行任务的过程中在线构建与更新外部 harness 状态。它包含两个耦合的子难题:
- 状态构建:如何从嘈杂的交互轨迹中形成有用的外部状态(state formation from noisy interaction traces);
- 运行时控制:如何在执行中对外部状态的访问进行代价权衡(runtime control over external-state access)。
3.2 形式化定义
EvoHarness-RL 在每一步 $t$ 把 harness 渲染为三元组工作空间:
$$H_t = (B_t, P_t, E_t)$$策略的动作空间由环境动作与 harness 元动作并集构成:
$$A = A_{\text{env}} \cup A_{\text{bpe}}, \quad A_{\text{bpe}} = \{\text{track}, \text{commit}, \text{recall}, \text{note}\}$$在第 $t$ 步,策略接收环境观察 $o_t$、渲染后的 harness 状态 $H_t$ 与任务上下文 $c_t$,采样动作:
$$a_t \sim \pi_\theta(\cdot \mid o_t, H_t, c_t)$$这里有一个决定整个方法气质的设计决策:若 $a_t \in A_{\text{env}}$,动作推进环境并产生新观察;若 $a_t \in A_{\text{bpe}}$,动作查询或更新外部工作空间并返回新的 harness 视图。两类动作消耗同一个交互预算——查一次记忆和走一步路花的是同一个“步数”。于是“harness 访问是否值得”不再是提示词写出来的约定,而是策略必须在预算约束下学习权衡的决策问题。这正是标题中“Learning Self-Evolving Runtime Harness”的含义。
四、问题解法
EvoHarness-RL 由四个部分组成:BPE 抽象、四元动作协议、环境适配器、两阶段训练。整体思路可以概括为:先把五花八门的 harness 组件抽象成策略可见的三个“抽屉”,再给智能体四个开抽屉的动作,最后用两阶段训练教会它何时开、开哪个。
4.1 BPE:外置大脑的三个抽屉
一个可训练的 harness 接口要暴露足够的外部状态支撑长程执行,又要足够紧凑以利于策略学习。论文观察到,尽管具体 harness 实现千差万别,它们服务的失败模式只有三类,于是把策略可见的外部状态组织成三个功能角色——可以想象成外置大脑的三个抽屉:
| 组件 | 存什么 | 解决什么失败模式 |
|---|---|---|
| Belief(信念)$B_t$ | 从交互中推断的任务相关事实:物体状态、位置、空间关系 | 环境状态的持久估计,不再依赖转瞬即逝的上下文窗口 |
| Progress(进度)$P_t$ | 子目标-状态记录 $(g_i, \sigma_i)$:已尝试什么、还剩什么、哪里被阻塞 | 把隐式推理轨迹变成可检查的任务状态 |
| Experience(经验)$E_t$ | 跨回合知识:技能、失败模式、搜索先验、高层策略 | 跨尝试复用,避免重复踩坑 |
4.2 四个元动作:开抽屉的方式
抽屉有了,开抽屉的动作被压缩为四个harness 元动作,覆盖智能体与 BPE 之间的主要信息流:
- track:从 $B_t$ 读取任务相关信念(如
track[object]查特定物体、track[world]拿全局摘要); - commit:向 $P_t$ 写入子目标或执行更新(如
commit[find kettle]); - recall:从 $E_t$ 检索可复用知识(如
recall[where to find kettle]); - note:向 $E_t$ 记录新洞察,供后续经验整合(如
note[kettle found at burner])。
为什么是四个而不是一个大而全的 API 或一个泛化的 memory 动作?论文的考量是:领域特定 API 太杂则学到的行为难以迁移分析,单一泛化动作又会掩盖工作空间的功能结构。四个元动作恰好暴露功能结构又保持紧凑。
4.3 环境适配器:BPE 如何在 ALFWorld 落地
BPE 是功能接口而非固定内部模式。不同任务可以有不同的 harness 实现,只要暴露同样的策略面角色。环境适配器负责桥接领域信号与通用 BPE 接口:处理观察、动作结果、工具输出与验证反馈,维护内部 harness 存储,渲染 $(B_t, P_t, E_t)$ 视图,并把四个元动作落地到目标环境。内部实现保持领域特定,可训练的协调层则是跨环境共享的。
在 ALFWorld(文本化家务游戏,六类任务:Pick/Look/Clean/Heat/Cool/Pick2)中的实例化:
- Belief 实例化:后台逐步更新的规则化世界状态存储(基于动作-观察对的状态标志与物体-位置关系解析,无需 LLM 调用)。默认不完全暴露给策略——策略需主动
track[object]查询特定物体或track[world]获取紧凑全局摘要,访问本身是选择性的 harness 动作; - Progress 实例化:有界子目标-状态列表(上限 8),策略用
commit外化当前执行步骤,使已尝试/待办/受阻对后续决策可见; - Experience 实例化:跨回合技能库,分通用技能、任务特定技能、常见错误、物体位置搜索先验四类(各类容量上限 80,LFU 驱逐)。回合内
recall检索(每类 top-3,关键词重叠检索)并更新使用计数;note写入临时笔记缓冲;并行 rollout 收集期间主技能库保持固定,笔记与轨迹摘要在后台积累,epoch 边界由整合模型执行 add/update/remove 操作合并进库。
4.4 两阶段训练:先学会用,再学会何时用
阶段一:监督 harness 微调(SFT bootstrap)。用同一 BPE 接口跑出教师模型(Claude Opus)的成功轨迹,微调 Qwen3-8B。教师每步看到任务目标、当前观察、可行动作、近期历史与激活的 harness 视图,输出 <think>...</think><action>...</action> 格式的单步动作(可以是 ALFWorld 命令,也可以是 BPE 元动作)。实际数据规模:在 500 个训练局上收集,保留成功回合得 87 条轨迹、1153 个下一动作对话对,平均每回合 26.5 轮;教师共使用 405 次 harness 调用(约占全部轮次的 18%),分布为 commit 202、recall 114、note 55、track 34。这一阶段教会模型动作空间的语义与“如何构建有用的外部状态”;教师 rollout 积累的经验还初始化了 GRPO 阶段的技能库。
阶段二:代价感知 GRPO(cost-aware GRPO)。从 SFT 检查点出发做 GRPO,轨迹级奖励为:
$$R(\tau) = R_{\text{succ}}(\tau) + \lambda_{\text{eff}} R_{\text{eff}}(\tau) + \lambda_{\text{div}}(u) R_{\text{div}}(\tau) - \lambda_{\text{spam}} R_{\text{spam}}(\tau) - \lambda_{\text{inv}} R_{\text{inv}}(\tau)$$各项含义:
- 成功门控:$R_{\text{succ}}(\tau) = 10 \cdot \mathbb{1}[\text{solved}]$ 是主导稀疏信号,任务完成是严格的守门员;
- 效率奖励:$R_{\text{eff}}(\tau) = \max(0, 1 - |\tau|/T_{\max})$,仅在成功后才发放——这自然惩罚了冗余的 harness 查询(多查一次记忆 = 多花一步 = 效率奖励变少);
- 动作多样性奖励(余弦退火课程):
其中 $u$ 为当前 RL epoch,$U=150$ 为退火视野。训练早期鼓励广泛探索各类 harness 动作,随后优雅衰减以强制专业化与高效解题——防止策略坍塌成“完全忽略 $A_{\text{bpe}}$”或“陷入无限重复循环”两个极端;
- 垃圾动作与格式惩罚:对退化重复(权重 0.1,上限 10)与格式错误(权重 0.1)施加固定惩罚。
4.5 经验库整合:会纠错的记忆
技能库的演化通过笔记整合机制实现:缓冲的 note 洞察不直接写入 $E_t$,而是在每个整合点由外部整合模型(Claude Opus)结合现有技能库视图,对每条笔记裁决四种操作之一——ADD(真正的新知识)、UPDATE(精炼/修正/扩展现有技能)、REMOVE(明确推翻失效技能,如过时的位置先验)、SKIP(琐碎/冗余/过于回合特定)。整合规则偏好“重叠时 UPDATE 优先于 ADD”,物体-位置映射抽取进搜索先验表。配合 LFU(最不经常使用)驱逐——初始使用计数 1,被检索即计数增长,容量满时淘汰最少调用者——技能库实现了积累-合并-遗忘的完整生命周期,而非被动 append-only 日志。
五、评估指标与实验证据
5.1 主实验:8B 模型逼近前沿模型
ALFWorld seen split(140 任务)成功率(∗为冻结推理方法,▲为可训练方法,†/‡ 为 SkillOS/SkillRL 论文报告数字):
| 方法 | 骨干 | 平均 SR (%) | Δ(对相应 ReAct) |
|---|---|---|---|
| ReAct | Claude Opus 4.5∗ | 96.4 | —— |
| +EvoHarness-Base | Claude Opus 4.5∗ | 98.5 | +2.1 |
| ReAct | GPT-4.1∗ | 47.9 | —— |
| +EvoHarness-Base | GPT-4.1∗ | 70.0 | +22.1 |
| ReAct | GPT-5∗ | 60.7 | —— |
| +EvoHarness-Base | GPT-5∗ | 85.0 | +25.7 |
| ReAct | Qwen3-8B∗ | 47.9 | —— |
| ExpeL / ReasoningBank / MemP / Dyn. Cheatsheet / ACE / SkillOS-base | Qwen3-8B∗ | 49.3–55.7 | +1.4 ~ +7.8 |
| 标准 GRPO | Qwen3-8B▲ | 65.6 | +17.7 |
| SkillOS | Qwen3-8B▲ | 80.2 | +32.3 |
| SkillRL | Qwen2.5-7B▲ | 89.9 | +42.0 |
| EvoHarness-Base(prompt 版) | Qwen3-8B∗ | 56.4 | +8.5 |
| EvoHarness-SFT | Qwen3-8B▲ | 68.6 | +20.7 |
| EvoHarness-RL | Qwen3-8B▲ | 96.9 | +49.0 |
三个层次的证据:
- 小模型逆袭:EvoHarness-RL 让 Qwen3-8B 达到 96.9%,较 ReAct 基线绝对提升 49.0 个百分点,有效追平 Claude Opus 4.5(96.4%),且大幅超过 SkillOS(80.2%)与 SkillRL(89.9%)两个最强的可训练基线;
- 三阶段递进验证训练管线:56.4%(prompt 时间脚手架)→ 68.6%(SFT)→ 96.9%(GRPO),说明优化把 harness 从静态工具变成了高效的决策接口;
- 跨规模普适增益:即便只是 prompt 版 BPE,也让挣扎中的 GPT-4.1 提升 22.1 点、GPT-5 提升 25.7 点;对已接近性能天花板(96.4%)的 Claude Opus 4.5 还能推到 98.5%——信念/进度/经验的外化对任何规模的基座模型都 broadly critical。
5.2 泛化:unseen split 上的表现
| 方法 | 平均 Unseen SR (%) |
|---|---|
| ReAct Qwen3-8B | 50.0 |
| EvoHarness-Base(prompt 版) | 77.6 |
| EvoHarness-SFT | 69.4 |
| EvoHarness-RL | 86.6 |
值得玩味的是 SFT 在 unseen 上不升反降(77.6% → 69.4%):监督模仿学的是 seen 轨迹中教师的 harness 使用模式,却没学会“在新环境里何时访问才值得”。而 RL 优化后的策略达到 86.6%——代价感知 GRPO 重新校准了 harness 访问,学到的是可泛化的策略而非对训练环境的记忆。
5.3 BPE 组件消融:三个抽屉缺一不可
从 prompt 版 harness 逐一移除组件(冻结 Qwen3-8B,任务顺序 Pick/Look/Clean/Heat/Cool/Pick2):
| 变体 | Pick | Look | Clean | Heat | Cool | Pick2 | 平均 SR (%) |
|---|---|---|---|---|---|---|---|
| 完整 BPE | 71.4 | 53.8 | 63.0 | 50.0 | 48.0 | 41.7 | 56.4 |
| w/o Belief | 74.3 | 53.8 | 40.7 | 75.0 | 20.0 | 37.5 | 50.0 |
| w/o Progress | 68.6 | 53.8 | 44.4 | 68.8 | 32.0 | 37.5 | 50.7 |
| w/o Experience | 65.7 | 53.8 | 40.7 | 62.5 | 28.0 | 41.7 | 48.6(最低) |
对照分析:去掉 Belief 后 Clean 从 63.0 暴跌到 40.7、Cool 从 48.0 跌到 20.0——失去显式物体/状态跟踪,需要定位与状态验证的任务首当其冲;去掉 Progress 后无法提交子目标,Clean(44.4)、Cool(32.0)及有依赖子目标的 Pick2(37.5)等长程任务受损;去掉 Experience 则失去技能召回与错误规避,整体均值掉到最低的 48.6%,Clean 与 Cool 同样重挫。
去掉任何一个组件都掉到 48.6%–50.7% 区间,确认 Belief、Progress、Experience 是协同发挥作用的统一状态接口,而非孤立的记忆技巧。
5.4 两个演化动力学:训练在改变什么
动力学一:harness 退火(Harness Annealing,策略侧)。Figure 3 显示 GRPO 训练中平均 harness 调用次数的演化:SFT 初始化的智能体起步时频繁调用 BPE(峰值期把 harness 当显式脚手架,用于跟踪状态、回忆流程、收窄搜索空间),随后快速下降并稳定在每回合约 1 次调用。Figure 5 的分解进一步显示各动作衰减速率不同:recall 最持久(跨回合经验持续提供有用的搜索先验)、commit 与 note 快速衰减到零(稳定策略形成后不再需要外化每个中间计划或频繁写洞察)、track 居中(早期状态消歧有用,后期被更直接的环境交互模式取代)——而同期成功率仍在上升。这不是策略坍塌,而是常规脚手架行为被内化进策略,只保留“预期收益超过步数成本”的选择性访问。
动力学二:harness 演化(Harness Evolution,经验库侧)。Figure 4 显示技能库规模的演化:训练早期快速扩张(从 0 增至约 30 条,通用策略、任务特定流程、常见错误、搜索先验四类齐头并进),后期增长变得选择性——冗余条目被合并、少用技能被驱逐(LFU)、高频召回的知识被保留,最终收敛为紧凑而多样的技能库(总量稳定在明显低于峰值的水平,四类技能并存)。**harness 变成了任务自适应的状态基底,而非被动的只增不减记忆。**两个动力学互补:策略学会何时使用外部状态,harness 演化它能提供什么可复用经验。
5.5 与标准 GRPO 的训练奖励对比
Figure 6 显示 EvoHarness-RL 的训练奖励全程高于标准 GRPO:上升更快、平台更高;标准 GRPO 提升缓慢且平台明显更低。结合动作分解分析,这排除了“harness 调用减少是因为策略坍塌或不会用 harness”的解释——智能体学会了更挑剔地使用 harness。
5.6 为什么这些实验能支撑核心主张
论文要证明的命题是:harness 访问应当成为可学习的策略决策,而非环境侧静态制品。实验设计的证据链恰好逐环对应:主表三阶段递进(prompt→SFT→RL)证明“可训练性”带来增益;unseen 泛化证明学到的是访问策略而非环境记忆;消融证明接口的功能完整性;退火动力学直接展示了“从脚手架依赖到选择性访问”的内化过程;奖励对比排除了性能源于其他训练技巧的混淆。附录 B 的案例研究则给出微观机制:任务“清洁水壶并放到餐桌”中,智能体执行 commit→recall→act→note 完整循环——技能库先验说水壶在台面上,两次搜索失败后智能体依据常见错误库避免死循环、转向灶台探索,在水壶实际所在的灶台 3 找到它,随后 note[kettle found at stoveburner 3; recalled hint said countertop] 把纠错证据写回技能库。召回的 prior 可以被当前证据推翻——harness 是可复用但可修订的经验来源,而非固定神谕。
六、效果优势的根源解释
把前文证据串成一条因果链:
- 起点(现有方法的结构性缺陷):现有方法把 harness 当作环境侧静态制品,harness 用法由提示词约定或人工规则硬编码——提示词约定天然无法权衡访问成本,因为它没有“访问成本”的显式表达式,只能靠提示词工程师的直觉控制调用频率;
- 本方法的关键转变:把 harness 访问变成与环境动作共用同一交互预算的一等策略决策——查一次记忆就少走一步路,成本与收益进入同一个决策框架;
- 优化机制:GRPO 的代价感知设计(成功门控 + 仅成功后发放的效率奖励)让“值得才调用”成为可优化的目标——冗余查询直接稀释奖励,策略被迫学会权衡;
- 结果:8B 模型的状态管理能力逼近前沿模型(96.9% vs Claude Opus 4.5 的 96.4%),同时每任务仅约 1 次 harness 调用——既不放弃外部支持,也不被外部支持拖累。
两个反事实检验强化了因果解释:
- 去掉 RL 只留 SFT:seen 从 96.9% 掉到 68.6%(unseen 从 86.6% 掉到 69.4%)——说明 SFT 只教会了“怎么用 harness”,没教会“何时值得用”;纯粹模仿教师的调用模式在分布外甚至有害;
- 去掉 prompt 版 BPE 只留 ReAct:47.9%——说明没有结构化的外部状态接口,再强的 RL 也难以凭空学会状态管理。
因果链的关键环节是第 2 步的预算统一:这正是“harness 策略学习”与“harness 工程化”的本质分野。前者把访问决策交还给策略本身并在训练中优化,后者永远在策略外部修修补补。退火动力学则揭示了更深一层的机制——训练的作用不是让智能体永远依赖脚手架,而是先把依赖显式化、再逐步内化为自身能力,这与教育心理学中“脚手架撤除”(scaffold fading)的过程惊人地同构。
七、必要知识反推
从这篇论文出发反向梳理需要掌握的知识栈:
领域层:长程智能体的失败模式
- 丢失环境状态 / 忘记进度 / 重复犯错:三类核心失败模式,分别对应 Belief/Progress/Experience 的设计动机。理解它们是理解 BPE 抽象的钥匙——功能性抽象源于失败模式而非组件清单;
- ALFWorld 六类任务(Pick/Look/Clean/Heat/Cool/Pick2)对状态跟踪的不同要求,构成了天然的消测试管。
方法论层
- GRPO(Group Relative Policy Optimization):组内相对优势估计的策略优化算法(源自 DeepSeekMath),本文在其上叠加代价感知奖励塑形;
- 轨迹回放蒸馏 / 教师示范 SFT:用同一接口收集教师轨迹做 bootstrap——教师与学生共享接口是 SFT 增益可迁移到 RL 的前提;
- 课程退火:余弦调度 diversity 奖励权重(先探索后专精),以及训练中技能库的 epoch 级整合节奏;
- 奖励设计的门控结构:稀疏成功信号做守门员 + 密集合塑形项,以及“效率奖励仅在成功后发放”的防 hacking 设计。
工程层
- 环境适配器模式:领域特定内部实现 + 通用 BPE 策略面,是方法跨环境迁移的架构基础;
- 轻量确定性组件优先:Belief 跟踪用规则解析器(无 LLM 调用)、Experience 用关键词重叠检索——harness 组件不一定要昂贵;
- LFU 记忆管理:容量上限(每类 80 条)+ 按使用计数驱逐,配合 note 缓冲与 epoch 边界整合;
- 训练配置:8×NVIDIA H200、vLLM 推理(TP=4)、组大小 8、每步 16 prompt×128 轨迹、AdamW lr=1e-6、KL 系数 0.01、最大 prompt 长度 12288 tokens、Tmax=70 步。
知识融合节点
本论文的核心融合点 = BPE 功能抽象 × 代价感知优化。单有 BPE,它只是一个更结构化的 prompt 脚手架(56.4%);单有代价感知 RL,它只是又一个奖励工程技巧(标准 GRPO 65.6%);两者相乘才有 96.9%。抽象提供可学的决策空间,优化提供学习的压力信号,缺一不可。
八、通用性灵感
8.1 访问成本显式化:一切外部资源调用都应与任务动作共预算
本文最重要的方法论贡献或许是一个朴素的原则:任何外部资源(记忆、工具、检索、验证器)的调用都应与任务动作共享同一预算,让策略学习自行权衡。当前很多智能体系统里工具调用是“免费”的——不占步数、不进损失函数,于是模型倾向于过度调用或欠调用,全凭提示词脾气。把成本显式化后,“值得才调用”从工程直觉变成了可优化目标。这个原则可直接迁移到 RAG 系统(何时检索)、多智能体系统(何时询问队友)、人机协作(何时求助人类)。
8.2 脚手架退火:训练期外部支持先密集后内化
Harness 退火现象展示了一种训练动力学范式:训练早期让外部支持密集参与(脚手架期),随训练推进将其逐步内化为模型自身能力(内化期)。这与教育心理学中的脚手架理论同构——好的老师先给足支架,再逐步撤除。对人机协作的启示是:外部支持系统的价值不在于永久在场,而在于加速能力内化后优雅退场。教育领域的学习工具设计、企业的员工培养体系,都可以借鉴这种“先密集后撤除”的曲线。
8.3 可修订经验库:召回的先验可被当前证据推翻并回写
append-only 记忆的致命伤是错误会永久累积。本文的 note 整合机制(add/update/remove/skip + LFU 驱逐)展示了一种自我纠错的经验库形态:召回的先验不是权威指令,而是可被当前回合证据推翻、且推翻结果会被写回库中修正历史错误的假设。水壶案例中“先验说台面 → 实际在灶台 → 写回纠错”的循环,正是知识库维护中“信任但验证”原则的智能体版本。任何长期运行的知识管理系统(企业知识库、个人笔记、代码库文档)都值得引入这种可修订性。
8.4 三态状态抽象:信念/进度/经验的通用性
BPE 的三态划分(对环境的信念、执行的进度、跨回合的经验)捕捉的是长程任务系统的普适结构,不限于智能体:操作系统的内存/进程表/配置缓存、数据库的事务状态/日志/物化视图、乃至人类组织的态势感知/项目看板/流程制度,都可以映射到这三个抽象上。当一个系统需要跨越长时间尺度保持连贯行为时,“是什么状态、做到哪了、学到过什么”三问几乎必然出现。这个抽象为设计任意长程任务系统提供了现成的功能分解模板。
附录:关键超参与实现速查
| 设置 | 值 |
|---|---|
| 策略模型 / 教师与整合模型 | Qwen3-8B / Claude Opus |
| 输出格式 | <think>...</think><action>...</action> |
| 最大回合步数 Tmax | 70 |
| Belief 边容量 / Progress 上限 | 48 边 / 8 子目标 |
| Experience 四类容量 / 驱逐 | 各 80 条 / LFU |
| RL 算法 / 退火视野 U | GRPO / 150 epochs |
| 成功奖励 / 效率权重 / 多样性权重上限 | 10.0 / 1.0 / 0.5 |
| 垃圾惩罚 / 无效动作惩罚 | 0.1(上限 10)/ 0.1 |
| 学习率 / KL 系数 | 1e-6 / 0.01 |
| 硬件 / 推理引擎 | 8×H200 / vLLM(TP=4) |
| SFT 数据 | 87 条轨迹、1153 个动作对、教师 harness 调用 405 次(占 18% 轮次) |