论文链接:NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness 代码仓库:github.com/TokenRhythm/NeoHorse(模型合集:hf.co/collections/TokenRhythm/neohorse-1) 发表时间:2026年9月 机构:TokenRhythm Technologies、Infinigence AI(无问芯穹)、清华大学、北京大学、香港中文大学、Alibaba Group 等 —— 典型"企业+高校"合作:TokenRhythm 与无问芯穹提供工程与数据基础设施,清华/北大/港中文团队承担方法论设计,Alibaba 参与系统支持 领域标签:cs.CL / Recursive Self-Improvement / Agentic Post-Training
一、论文背景
要读懂这篇论文,先要弄清三个层层递进的概念。
第一个概念是 Harness(执行层/挽具)。当一个 LLM 以 Agent 形态工作——写代码、查资料、操作软件——它并不是"裸奔"的。围绕模型有一整套执行基础设施:系统提示词、工具集、执行钩子、上下文管理脚手架。这套东西决定了模型"能看到什么、能做什么动作",业内称之为 harness,就像马车的挽具决定了马力的传导方式。近期一系列研究表明,harness 是比想象中强大的杠杆:同样的模型,换一套针对任务优化过的 harness,成绩可以接近前沿模型。
第二个概念是 Agentic Routing(智能体路由)。当服务方同时维护多个不同能力等级的模型时,需要一个路由层为每个请求选择合适的模型:简单请求走便宜的小模型,复杂任务走昂贵的大模型。NeoHorse 的路由器把请求分为 C0(低风险常规)到 C3(最高能力)四个服务层级,依据请求内容、近期对话、历史路由决策来预测"这次交互需要多大能力"。
第三个概念是 RSI(Recursive Self-Improvement,递归自改进)。这是本文的终极目标:AI 系统利用自己的经验改进自己,且每一代改进能累积到下一代。RSI 的迷人之处在于结构性——一旦模型改进过程被部分自动化,改进本身就是复利。但 RSI 一直缺一个具体机制:系统如何观察自己的能力边界,并把这份观察转化为下一轮学习材料?
论文的核心洞察是:部署中的路由 harness 天然就装着这台"能力观测仪"。每一次真实交互都会留下三类记录:路由器预测的能力需求(这个请求难不难)、实际选用的模型层级(系统认为该用多强的模型)、以及随后的完整交互轨迹(任务成没成功、错在哪里)。这三类记录合起来,就是一份不断更新的、带能力标签的训练数据——这正是 RSI 需要的"能力证据→学习信号"转化机制。
而此前的研究要么把 Agent 交互轨迹当静态监督数据用(FireAct、AgentTuning 等),要么用人工难度标签做课程学习,都没有把"部署系统的路由信号"当作能力需求的免费估计器来用。这就是本文切入的空隙。
二、论文定位和关联工作
本文站在三条研究脉络的交汇点上。
脉络一:Agent 轨迹后训练。 FireAct、AgentTuning 开创了用交互轨迹做 SFT 的路线;Agent-FLAN、AgentBank 证明数据构成与规模影响泛化;Llama 3 加入合成多步工具使用数据与迭代 SFT。这条路线的局限是把轨迹当"静态模仿材料",不区分任务难度,也不利用执行过程中的结果信号。
脉络二:在线策略蒸馏(OPD)与课程学习。 OPD 让学生模型自己生成回复、教师在学生访问到的前缀上提供 token 级监督,弥合了 SFT 的训练-推理分布错位(Thinking Machines、Qwen、GLM-5 等前沿后训练均已采用)。课程学习则按难度排序训练样本,但传统做法依赖显式难度标注或数据集特定启发式,成本高且难迁移。
脉络三:递归自改进与 harness 进化。 MetaSkill-Evolvin 联合进化任务技能与元技能;Self-Harness、HarnessEvolve、Continual Harness 用失败与轨迹更新 harness 本身;AI4AI-Bench 评估 Agent 修改训练算法的能力。这些工作改的是 harness 或改进流程,本文改的是模型权重,且把部署系统本身作为改进的载体。
| 维度 | 之前的路线 | NeoHorse-1 的做法 |
|---|---|---|
| 训练数据来源 | 公开数据集、人工合成 | 部署 harness 真实轨迹(10⁵–10⁶ 条) |
| 难度/课程信号 | 人工标注或启发式 | 路由器的 C0–C3 能力需求分数(免费) |
| 监督方式 | 教师轨迹模仿(off-policy) | SFT 课程 + 路由引导 OPD(on-policy) |
| 反馈闭环 | 无(一次性训练) | 评估→选择→更新闭环,训练分布随能力演化 |
定位结论:本文是"把 RSI 从设计图落到部署系统"的第一个系统级原型——不是提出新的学习算法,而是发现部署基础设施中已存在的 RSI 机制并将其工程化闭环。
三、问题定义
具体问题:如何让一个部署中的 Agent 系统把日常服务中产生的交互,系统地转化为自身能力的提升?
核心洞察(抽象化的关键):论文发现了一个深层结构对应——路由系统记录的"预测-行动-结果"三元组 ≈ 课程学习所需的难度标签 + RLHF 所需的偏好信号 + RSI 所需的能力自观测。一张记录同时服务三个目的,这是本文抽象的精妙之处。
形式化定义:给定部署 harness 产生的轨迹集合 T = {(request, trajectory, routing_record, outcome)},目标是学到一个策略 π,使得:
- π 在十个基准上的宏平均分数最大化(能力目标);
- 训练样本的呈现顺序由路由分数 s_i ∈ [0,3] 组织(课程约束);
- 评估反馈能重新分配下一轮训练混合比例(闭环约束):mix_{t+1} = f(evals(π_t), T_{t+1})。
这个抽象为何合理:它把 RSI 从"玄学愿景"还原为一个可操作的数据分配问题——不是让模型"改进自己"这种模糊目标,而是让"系统学到什么"决定"系统接下来从什么学习"。这个定义让 RSI 第一次有了可测量的第一步。
四、问题解法
解法分数据、SFT、蒸馏、闭环四个组件,环环相扣。
4.1 数据管线:从轨迹到训练样本
原始轨迹是完整的交互历史。论文将其组织成三个粒度:轨迹(完整交互)→ 用户轮(一次请求及后续所有助手响应+工具交互,基本训练单元)→ 子场景(共享局部目标的相邻用户轮,语义标注单元)。
质量准入是三道闸门:
- 结构验证(规则引擎,非模型打分):校验载荷可读、事件因果顺序、工具调用/结果配对闭合。产出三档:完整可训练 / 部分可恢复(只取因果闭合子段)/ 隔离。
- 六维语义评估:目标达成、指令遵循、工具使用、证据一致性、错误恢复、终止质量,每维 PASS/WARN/FAIL。关键设计:证据缺失或 judge 调用中断绝不算 PASS——不把不确定性兑换成正面标签。
- 去污:用与评测相同的匹配基础设施筛查训练候选,与评测集重叠的记录全部剔除。
此外还有子场景级三轴标注(Scene/Goal/Outcome),把"用户想干什么、怎么算成功、实际结果如何"结构化,供后续能力差距定位。
4.2 路由引导课程 SFT
每条训练样本获得一个路由分数:硬排序用分配层级 k_i,软排序用分数加权平均层级 Σk·π_k。三阶段课程逐阶段引入高分样本,但保留部分低分样本到后期——防止训练尾声被高难度交互主导而遗忘基础能力。
一个容易忽视的细节:论文明确不把"实际服务该请求的模型"当难度标签,因为实际路由可能被用户覆写、服务可用性、部署策略扭曲。课程排序用的是从请求和历史重新估计的能力需求——这个区分保证了信号纯度。
4.3 路由引导在线策略蒸馏(R-OPD)
SFT 学的是记录下来的助手回复,但部署时模型条件于自己生成的前缀。OPD 弥合这个分布差:以记录上下文为起点让学生生成,固定教师对学生每个生成位置提供下一 token 分布,最小化响应归一化的反向 KL。工程上用 top-K 候选+1 个剩余概率桶的粗化分布压缩监督开销。路由分数在这里的作用是调度生成起点:同样三阶段分配,先在低需求上下文上蒸馏,再逐步转向高需求场景。
4.4 能力引导数据分配:闭环的扣环
每轮迭代:当前 checkpoint 在分层评测套件上打分 → 按属性、质量维度、结果状态、路由层级聚合成"能力缺陷画像" → 画像把下一轮训练混合比例向薄弱区倾斜,同时保持广覆盖。更新后的模型回到 harness 服务,产生新轨迹,暴露新短板——模型学到什么,决定了它接下来从什么学习。
4.5 训练目标
SFT 用 token 级掩码交叉熵,只对当前用户轮的助手目标 span(推理、工具调用、可见回复、结束符)计损失,批内按监督 token 数归一化。OPD 用响应级平均 token 散度加权求和,prompt 与 padding 零损失。
五、评估指标与实验证据
主指标:10 个基准的宏平均(Agentic:QwenClawBench、WorkBuddy Bench、PinchBench、VitaBench、BFCL V4、τ²-Bench;Coding:HumanEval、LiveCodeBench v6;IF:IFEval、IFBench)。这组基准的设计意图是覆盖"harness 型 Agent 执行、工具交互、代码、指令遵循"四类能力,避免单一维度美化。
| 模型 | 后训练前 | 后训练后 | 提升 |
|---|---|---|---|
| NeoHorse-1-4B | 58.94(Qwen3.5-4B) | 64.87 | +5.93 |
| NeoHorse-1-9B | 65.60(Qwen3.5-9B) | 69.04 | +3.44 |
4B 后训练版在多个基准上已追平甚至超过 Qwen3.5-9B——训练部分补偿了规模差距,这是 RSI 叙事最直接的证据:同一模型被"使用"后变强了。
对照实验一(数据源消融):同样路由引导训练配置,路由 harness 数据 vs 公开合成工具 Agent 数据 Toucan:
| 训练数据 | LCB | HumanEval | IF | BFCL | τ²-Bench | 平均 |
|---|---|---|---|---|---|---|
| Toucan(公开) | 49.14 | 87.80 | 56.33 | 54.77 | 73.54 | 64.32 |
| 路由 harness | 53.14 | 96.34 | 61.33 | 57.20 | 84.85 | 70.57 |
平均 +6.26,τ²-Bench +11.31。同配置同预算下,差异只能来自数据源本身——这证明真实路由交互的监督价值高于公开合成数据。
对照实验二(数据规模):严格嵌套子集+固定其他变量,五项平均从 69.31 稳定爬升到 71.45(对数轴),说明规模收益在该区间未饱和。
轨迹行为分析提供了机制层证据:QwenClawBench 项目排期任务中,基座 4B 不查经理邮件里的新依赖约束导致整盘皆输,NeoHorse-1-4B 会补取证、重算、验证、落盘;WorkBuddy 代码修复中 9B 版能维持完整的"改-测-查-修"循环;PinchBench 中 9B 在 pandas 不可用时果断切换标准库,请求数/时间/token 分别省 70.8%/76.7%/83.6%。这些案例说明提升来自闭环执行能力(把测试结果当输入、把失败当证据),不是刷题式记忆。
实验设计的证明力评估:三点做得扎实——同 harness 同推理配置评所有自测模型(标注引用结果);关键对比(数据源消融)控制了配置、种子、预算;τ²-Bench 与 QwenClawBench 跑三次取均值。局限也如实交代:目前只完成一轮闭环,“增益能否跨代累积"尚未验证,Agentic/Coding 之外的能力未覆盖。
六、效果优势的根源解释
Baseline 的根本瓶颈:静态轨迹模仿的根本问题不是数据不够,而是训练分布与部署分布的结构性错位——模型部署时条件于自己生成的前缀,而 SFT 教它模仿别人的前缀下的行为。同时,均匀呈现样本浪费了两个信号:任务的难度结构(哪些样本值得后学)和执行的结果结构(哪些轨迹值得学)。
本文的机制性改变有三处,各自对应一条因果链:
- 路由分数替代人工难度标签 → 课程信号保真 → 高难度样本在正确时机呈现。路由器的分数是部署压力锻造出来的真实能力需求估计(错误的路由会在服务指标上立刻暴露),且零标注成本。对比用"被服务的模型身份"当难度标签(可能被策略扭曲),论文用独立重估的分数,避免了标签污染。
- 保留 harness 上下文的序列化 → 模型学习"决策条件"而非"决策结果”。训练样本保留系统指令、工具规格、历史交互,模型学到的映射是"在这些执行条件下,该做什么";不保留的话模型学到的是脱离条件的动作模仿,部署时一遇陌生 harness 状态就失效。这解释了增益为何集中在 harness 型基准(WorkBuddy +9.8、QwenClaw +6.2)而非静态指令遵循(9B 上 IFEval 反而微降 0.37)。
- OPD 的监督跟随学生分布 → 消除前缀漂移 → 高分场景的蒸馏有效。在学生自己会走偏的前缀上纠正,比在教师轨迹前缀上示范更接近部署状态。这解释了为何同样的课程调度从 SFT 自然扩展到 OPD 后仍成立——两者的学习材料调度逻辑同源。
反事实证据:数据源消融实验中,若把路由 harness 数据换成公开数据而保持课程算法不变,平均掉 6.26 分——证明收益主要来自数据源(真实交互+路由信号),而非课程算法本身。这是"数据飞轮"假设最硬的一块基石。
七、必要知识反推
领域知识层:
- LLM 后训练全流程(SFT/DPO/RL/蒸馏的适用场景与相互关系)——不理解就分不清"路由引导"该作用在哪个阶段;
- Agent harness 的构成(系统提示、工具协议、上下文管理、钩子)——不理解就无法设计保留执行上下文的序列化方案;
- LLM 路由/Cascade 的经济学逻辑(FrugalGPT、RouteLLM 一脉)——不理解就不会想到路由记录里埋着能力标签。
方法论知识层:
- 课程学习的调度设计与"难度信号来源"的敏感性分析;
- 在线策略蒸馏的分布对齐原理与 top-K 粗化实现;
- 多粒度数据组织的 provenance 保持(轨迹→用户轮→子场景的链接设计)。
工程知识层:
- 大规模轨迹质量管线(结构校验规则、语义 judge 的证据约束设计、去污匹配);
- 服务化推理(SGLang)与训练引擎的对接;
- 评测去污与基准协议(三次取均值、引用结果标注)。
知识融合的关键节点:本文的创造性融合发生在"部署系统的可观测性“与”训练课程的需求结构“这两个通常不相交的知识域之间。路由器工程师关心的是服务质量,训练工程师关心的是样本顺序;作者意识到路由器的"预测-行动-结果"记录恰好构成训练侧需要的"难度-覆盖-缺陷"三元组,两个领域的日志格式可以直接对接。没有两边同时精通,既看不出路由记录的训练价值,也设计不出"重估而非沿用"的信号提纯方案。
八、论文中可以提取的通用性灵感
1. 运营系统是免费的标注机器。 核心思想:任何按难度/复杂度分配资源的生产系统,其分配日志天然是监督信号。 论文证据:路由 harness 数据比公开数据平均高 6.26 分,且零标注成本。 推广场景:客服系统的工单分级日志→客服模型课程;CDN 的缓存层级决策→请求复杂度预测器;编译器的优化层级选择→代码难度标注。
2. “预测-行动-结果"三元组是最小完备的能力自观测单元。 核心思想:系统能力自评估不需要额外评测,只需要记录"预计要多强、实际用了多强、结果如何”。 论文证据:预测-行动-结果分离使语料能按能力需求区分析完成/验证/恢复模式。 推广场景:推荐系统的预估 CTR vs 实际 CTR 偏差作为模型校准信号;自动驾驶的规划置信度 vs 接管率;医疗 AI 的分诊置信度 vs 专科确诊。
3. 学习材料的调度可以复用于多种训练范式。 核心思想:一旦有了统一的难度分数,SFT 课程与 OPD 起点调度可以共享同一调度器。 论文证据:三阶段分配同时用于 SFT 样本排序与 OPD 上下文调度。 推广场景:RL 的任务课程与 SFT 预热共用分数;多教师蒸馏的教师选择调度;主动学习的标注预算分配。
4. “模型学到什么决定它从什么学习"是 RSI 的可工程化定义。 核心思想:自改进不必诉诸"AI 改进 AI"的宏大叙事,先把"评估→选择→更新"的闭环扣上第一环。 论文证据:能力引导数据分配把评测缺陷画像转化为下一轮训练混合比例。 推广场景:个人知识管理(学到什么决定下一步学什么);企业培训体系(绩效缺口→课程配比);编译器自主优化(性能画像→优化 pass 序列)。
5. 不确定性不可兑换为正面标签。 核心思想:语义评估中证据缺失、judge 失败必须输出 NOT_EVALUATED 而非默认通过。 论文证据:六维评估显式分离覆盖率与判定,缺失证据绝不产生 PASS。 推广场景:任何 LLM-as-judge 的质检管线;自动化测试的"跳过≠通过”;人工审核流程的申诉兜底设计。
本文基于 arXiv:2609.08183 全文精读撰写。数据与结论均引自原文。