论文链接:arxiv.org/abs/2606.09730 PDF全文:arxiv.org/pdf/2606.09730 发表时间:2026年6月 机构:清华大学、北京大学、蚂蚁集团、中国人民大学高瓴人工智能学院(高校+企业合著) 开源状态:承诺开源 Harness、模型权重和训练数据


一、论文背景

1.1 当 Agent 遇上「长时任务」

大语言模型(LLM)正在从「聊天机器人」进化为「智能体(Agent)」——它们不再只是回答问题,而是能够使用工具、与环境交互、根据反馈调整策略,通过多轮"观察-行动"循环完成复杂任务。

但一个根本性的矛盾随之浮现:现实中的复杂任务可能需要无限长的上下文来处理,而模型的上下文窗口(Context Window)始终是有限的。

举个例子:想象你让一个 Agent 做深度研究——“找出 2025 年底澳大利亚昆士兰州开通的某条高速公路的详细信息”。Agent 需要反复搜索、阅读网页、交叉验证信息,这个过程中产生的搜索结果、网页内容、推理过程会迅速填满上下文窗口。即使现代模型支持 128K 甚至更长的上下文,对于真正的深度研究任务来说,这个窗口仍然远远不够。

1.2 现有的上下文管理策略为什么不够好?

目前的上下文管理方式大多是被动的:

  • 截断法:当上下文超过阈值时,直接丢弃最早的内容
  • 摘要法:定期将历史对话压缩成一段摘要
  • 选择性保留:按固定规则只保留部分工具输出

这些方法的问题在于:它们都是在上下文即将溢出时才被动地压缩或丢弃,缺乏前瞻性的规划。就好比你的手机存储空间满了才开始删照片——删掉的可能是重要的,留下的可能是无用的。

1.3 一个新范式:主动的「委派」

既然被动压缩不够好,那能不能主动规划上下文的使用?

SearchSwarm 提出的核心思路是委派(Delegation):

就像一个管理者不会自己处理所有细节工作,而是将具体任务分派给下属,只接收他们的工作汇报一样,主 Agent 可以将子任务分派给子 Agent,只接收子 Agent 返回的精简报告。

这其实就是一种主动的、内容感知的上下文压缩:

  • Brief(任务简报):主 Agent 生成的子任务描述,是对原始上下文的智能压缩输入
  • Report(结果报告):子 Agent 返回的执行结果摘要,是对大量中间过程的智能压缩输出

与传统截断或摘要相比,委派的优势在于:压缩过程由模型自己完成,它知道哪些信息重要、哪些可以丢弃,比固定规则的截断要精准得多。

1.4 什么是 Harness?

在理解这篇论文之前,还需要了解一个关键概念——Harness(执行框架/脚手架)。

在 Agent 系统中,有一个越来越被认可的公式:

$$\text{Agent} = \text{Model} + \text{Harness}$$
  • Model(模型):LLM 本身,负责理解、推理和生成
  • Harness(脚手架):模型外层的工程化运行框架,包括系统提示词、工具接口定义、编排逻辑、验证机制、反馈回路等

打个比方:模型是大脑,Harness 是工作环境和流程。一个人即使很聪明,如果工作环境混乱、没有好的工具、缺乏流程规范,工作效率也会很低。

2026 年,Harness Engineering(脚手架工程) 正式成为 AI 工程领域的核心方向之一。来自 OpenAI、Anthropic、Stripe 等团队的一线实践都证实了:不改模型权重,只优化 Harness 层,就能显著改变 Agent 的表现。

1.5 核心困境:委派智能从何而来?

委派听起来很美好,但有一个根本问题:模型怎么学会委派?

这里的难点在于:

  1. 训练数据稀缺:自然语言语料中很少出现"明确的多 Agent 协调"场景。你不会在维基百科或小说中看到"A Agent 决定把任务 B 委派给 C Agent,并在收到报告后做了 D 决策"这样的描述。
  2. 能力不会自动涌现:论文做了一个关键实验——即使给未微调的模型提供了 call_sub_agent 工具,模型也从未调用过它。这意味着委派行为不会仅从工具定义中自动涌现。
  3. 需要多种能力的协同:有效委派需要同时具备任务分解能力、子任务范围界定能力、上下文传递能力、结果整合能力——这些能力的训练数据在自然文本中极为稀缺。

这就是 SearchSwarm 要解决的核心问题:如何合成高质量的训练数据,让模型获得「委派智能」。


二、论文定位和关联工作

2.1 在深度研究 Agent 谱系中的定位

SearchSwarm 处于 「深度研究 Agent」 这个快速发展的领域。在这个谱系中,可以按上下文管理策略将现有工作排列如下:

第一代:单 Agent 直接搜索

  • 代表工作:早期的 WebGPT、ReAct
  • 特点:一个 Agent 负责所有工作,上下文持续累积
  • 局限:长任务时上下文窗口不够用

第二代:被动上下文管理

  • 代表工作:通义 DeepResearch(Tongyi DeepResearch)、OpenSeeker
  • 特点:引入了上下文压缩策略,但依然是被动等待窗口快满了才处理
  • 通义 DeepResearch 是 SearchSwarm 的直接基线模型(SearchSwarm 基于它微调而来)

第三代:主动委派式多 Agent

  • 代表工作:Kimi Agent Swarm、Step-3.5-Flash、SearchSwarm
  • 特点:主 Agent 主动将子任务分派给子 Agent,从根本上管理上下文预算

2.2 与最接近的几个工作对比

Kimi Agent Swarm(月之暗面)

  • 核心做法:冻结子 Agent 参数,用**强化学习(RL)**训练主 Agent 的任务分配策略
  • 可编排最多 300 个子 Agent,执行最多 4000 步并行工作流
  • 与 SearchSwarm 的区别:聚焦高层架构和 RL 训练算法,没有公开完整的 Harness 设计和数据构建配方

Step-3.5-Flash(阶跃星辰)

  • 核心做法:层级设计中主 Agent 分发子任务给子 Agent
  • 模型规模较大(196B-A11B)
  • 与 SearchSwarm 的区别:同样聚焦架构设计,未公开 Harness 设计细节和训练数据构建方法

AOrchestra

  • 核心做法:统一的四元组 Agent 抽象,支持动态子 Agent 创建,探索 SFT 用于编排
  • 与 SearchSwarm 的区别:更偏理论框架层面,而非面向深度研究的完整落地

RedSearcher、MiroThinker、LongSeeker

  • 同属深度研究 Agent 领域的同规模模型
  • RedSearcher 通过双约束复杂任务合成和 RL 优化搜索 Agent
  • MiroThinker-1.7-mini 是 SearchSwarm 在同规模中的直接竞争对手

2.3 SearchSwarm 的独特定位

SearchSwarm 在上述工作中的核心差异化在于:

维度Kimi Agent SwarmStep-3.5-FlashSearchSwarm
训练方法RL未公开SFT(监督微调)
Harness 设计未公开未公开完整公开
训练数据构建未公开未公开完整公开
开源程度闭源闭源完全开源
模型规模1T-A32B196B-A11B30B-A3B

简言之,SearchSwarm 是第一个提供完整配方(Harness 设计 + 训练数据构建 + 模型训练)并完全开源的委派式多 Agent 深度研究工作。


三、问题定义

3.1 从现实困境到抽象问题

SearchSwarm 要解决的现实问题很明确:让一个 30B 参数的小模型在深度研究任务上表现出色。

但要系统地解决这个问题,作者需要将其抽象为一个更本质的问题。论文的核心抽象过程如下:

现实困境:长时任务的上下文需求无限增长 vs 模型上下文窗口有限

↓ 抽象

中间问题:如何在有限的上下文预算下完成需要大量信息处理的任务?

↓ 进一步抽象

核心问题:如何让模型获得「委派智能」——即知道何时委派、委派什么、如何整合结果的能力?

3.2 形式化的问题定义

论文使用 ReAct 框架来形式化这个问题。ReAct 是 2022 年由姚顺雨等人提出的经典 Agent 框架,其核心思想是让模型交替进行"推理(Reasoning)“和"行动(Acting)"。在 ReAct 中,Agent 的每一步包含三个组件:

  • Thought(思考) $\tau_t$:Agent 的内部推理过程
  • Action(动作) $a_t$:工具调用(包括新引入的 call_sub_agent)
  • Observation(观察) $o_t$:环境返回的结果

完整的执行轨迹记录为:

$$H_T = (q, (\tau_0, a_0, o_0), \ldots, (\tau_T, a_T, o_T), y)$$

其中 $q$ 是用户问题,$y$ 是最终答案。

当主 Agent 执行 $a_t = \text{call\_sub\_agent}(b)$ 时,触发一个完全独立的子轨迹:

$$H^{\text{sub}} = (b, (\tau_0^s, a_0^s, o_0^s), \ldots, (\tau_S^s, a_S^s, o_S^s), r)$$

这里的关键约束是:

  • $b$(Brief)是主 Agent 传入的子任务描述
  • $r$(Report)是子 Agent 返回的精简报告
  • 子轨迹在完全独立的上下文中执行,对主 Agent 的历史完全不可见

3.3 问题定义的本质

论文将问题精确定义为:

如何设计一个 Harness(包含工具定义和指导原则),使得通过这个 Harness 收集的轨迹数据,能够通过 SFT 训练,将「委派智能」内化到模型权重中?

这个定义的精妙之处在于,它把一个看似复杂的系统工程问题,分解为三个可操作子问题:

  1. Harness 设计:如何设计执行框架来引导高质量的委派行为?
  2. 数据合成:如何从 Harness 引导的轨迹中提取高质量的训练数据?
  3. 模型训练:如何用这些数据训练模型,使委派能力内化?

四、问题解法

4.1 Harness 设计:四大原则

SearchSwarm 的 Harness 设计是这篇论文的核心贡献。作者为 Harness 配备了 6 个工具:

工具功能
search提交查询到搜索引擎,返回排名结果
visit访问指定 URL,提取页面内容
google_scholar检索学术文献
python代码执行环境
call_sub_agent核心委派工具:提交 brief,获取 report
(子 Agent 配备相同标准工具但没有 call_sub_agent)限制委派为单层,避免递归委派

围绕这些工具,作者提出了 四大设计原则:

原则一:鼓励委派(Encourage Delegation)

主 Agent 的上下文是宝贵的资源。多步的信息收集(反复搜索、阅读网页)虽然 token 消耗大,但认知复杂度其实不高——属于"体力活”。这种工作应该交给子 Agent。

主 Agent 只在以下情况亲自执行:

  • 子任务足够简单,委派的开销(生成 brief + 解析 report)反而超过直接执行的成本
  • 需要对子 Agent 返回的结果进行验证时

原则二:全面简报(Comprehensive Briefing)

Brief 不只是一个任务描述。一个好的 Brief 应该像一个优秀的项目经理给新加入的团队成员的交接文档,包含:

  • 为什么这个子任务重要:在整个研究计划中的位置
  • 已经确认了什么:避免子 Agent 重复探索已知的方向
  • 还有什么不确定:子 Agent 需要重点调查的内容
  • 哪些方向已经尝试过或排除:避免重复劳动

这确保子 Agent 即使在完全独立的上下文中工作,也能高效行动。

原则三:主 Agent 保留核心判断(Main Agent Retains Core Judgment)

在多 Agent 系统中,主 Agent 是唯一拥有所有子任务完整视角的实体。子 Agent 负责收集证据和测试假设,但以下决策必须由主 Agent 独立做出:

  • 追哪个假设?
  • 何时终止搜索?
  • 如何裁决子 Agent 之间冲突的报告?

这个原则确保研究的方向性不会因为委派而丢失。

原则四:引文支撑的报告(Citation-Grounded Reporting)

子 Agent 的报告中,每个重要结论必须附带内联引用(指向具体的来源 URL)。这有两个好处:

  1. 主 Agent 可以验证结论的可靠性——如果某个子 Agent 说"根据某网页的信息,答案是 X",主 Agent 可以直接用 visit 工具访问该 URL 进行核实
  2. 主 Agent 的最终回答也包含内联引用,增强了答案的可信度

4.2 训练数据合成:巧妙的混合策略

有了 Harness 之后,如何生成高质量的训练数据?论文采用了一种混合配置策略:

配置一:同一模型自对弈

  • 同一个模型同时担任主 Agent 和子 Agent
  • 保留两种角色的轨迹

配置二:强弱模型协作

  • 更强的模型担任主 Agent,更弱的模型担任子 Agent
  • 仅保留主 Agent 的轨迹

为什么要有配置二?作者的洞察非常有趣:不太可靠的子 Agent 会迫使主 Agent 更加严格控制研究主线。当子 Agent 可能返回不完整或不准确的信息时,主 Agent 必须:

  • 更加审慎地分解任务
  • 提供更全面的 brief
  • 更严格地验证子 Agent 的结果

这些行为恰恰是高质量的委派智能所必需的。

数据过滤也是关键环节。论文设计了精细的过滤规则:

操作描述
✅ 保留答案正确的主 Agent 轨迹
✅ 保留主轨迹正确时的子 Agent 轨迹
⬇️ 降采样过短的子 Agent 轨迹(避免训练数据偏向简单任务)
❌ 移除重复相同的工具调用
❌ 移除幻觉引用(引用了不存在的来源)
❌ 移除工具滥用(如通过 python 访问网页)

还有一个特别的做法:保留"强制回答"轨迹。当上下文即将溢出时,模型被迫在不完全信息下给出答案。保留这些轨迹让模型学会在压力下做出高质量响应。

4.3 训练方法:环境掩码的 SFT

训练使用标准的下一 token 预测目标,但有一个关键修改:

$$\mathcal{L} = -\sum_{t=1}^{T}\sum_{j=1}^{|a_t|} \log p_\theta(a_t^{(j)} \mid a_t^{(
  • 损失仅计算模型自己生成的部分(思考 + 工具调用)
  • 所有环境返回的观察(搜索结果、网页内容等)被掩码,不参与损失计算
  • 这确保模型只学习"如何行动",而不是学习"记住搜索结果"。这个方法统一应用于主 Agent 和子 Agent 的轨迹。

    4.4 关键实验结果

    SearchSwarm 在四个基准上与同规模模型和大规模模型进行了全面对比:

    模型规模BrowseCompBrowseComp-ZHGAIAxbench-DS
    GPT-5.2-Thinking闭源65.876.1——
    DeepSeek V3.2671B67.665.075.178.0
    Step-3.5-Flash196B69.066.984.583.7
    MiroThinker-1.7-mini30B67.972.380.3—
    Tongyi DeepResearch(基线)30B43.446.770.975.0
    SearchSwarm30B68.173.382.580.8

    几个关键发现:

    1. 同规模最佳:在所有四个基准上达到 30B-A3B 规模的 SOTA
    2. 巨大提升:相比基线,BrowseComp 上提升 24.7 分(43.4 → 68.1)
    3. 跨越量级:以 30B 参数匹配甚至超越 671B 的 DeepSeek V3.2
    4. Harness 的力量:仅添加 call_sub_agent 工具只提升 2.3 分,但完整的 Harness(含四大原则)提升了 10.0 分

    4.5 惊人的泛化能力

    论文中最令人惊讶的发现是 SearchSwarm 的泛化能力:

    泛化一:单 Agent 设置

    当禁用 call_sub_agent 工具后(即回到单 Agent 模式,没有上下文管理),SearchSwarm 仍然比基线模型好很多:

    模型BrowseCompBrowseComp-ZH
    Tongyi DeepResearch43.546.5
    SearchSwarm52.053.3

    训练数据中完全不包含没有子 Agent 工具的轨迹。这说明委派训练中编码的结构化问题分解、有条理的子问题解决等智能,泛化到了非委派设置。

    泛化二:开放式研究

    在开放式深度研究基准上(生成完整研究报告而非短答案):

    模型ScholarQA-v2HealthBenchResearchQA平均
    OpenAI DeepResearch79.653.879.264.9
    Tongyi DeepResearch46.546.266.750.0
    SearchSwarm79.252.880.264.2

    训练数据仅包含短答案查询,不包含任何开放式任务。泛化的来源是:Harness 要求主 Agent 全面解释和内联引用,这培养了生成组织良好的长文回复的能力。


    五、必要知识反推

    如果让一个完全不了解这个领域的人从头做出这项工作,他需要掌握哪些知识?

    5.1 领域认知层

    1. Agent 和 ReAct 框架

    • 理解什么是 Agent(不只是聊天模型,而是能与工具/环境交互的自主系统)
    • 掌握 ReAct 模式(Thought-Action-Observation 循环)——这是当前几乎所有 Agent 系统的基础范式
    • 理解"上下文窗口"的概念及其对长时任务的根本限制

    2. Harness Engineering

    • 理解 Agent = Model + Harness 的公式
    • 知道 Harness 包含什么(提示词、工具定义、编排逻辑、验证机制等)
    • 理解为什么 Harness 的设计可以显著影响 Agent 表现

    3. 深度研究 Agent 的特殊性

    • 理解"深度研究"任务的特点:需要多轮搜索、信息交叉验证、长链条推理
    • 知道现有的评测基准(BrowseComp、GAIA 等)及其评估方式

    5.2 技术方法层

    4. 监督微调(SFT)

    • 理解 SFT 的基本原理:用高质量的输入-输出对来训练模型
    • 理解"轨迹数据"(Trajectory Data)的概念:记录 Agent 完整的执行过程,而非仅仅记录问答对
    • 掌握环境掩码技术:只对模型生成的部分计算损失

    5. 多 Agent 系统设计

    • 理解主-子 Agent 的协作模式
    • 理解委派机制的本质:不是简单的任务转发,而是上下文的智能压缩
    • 知道单层委派 vs 多层递归委派的权衡

    6. 数据合成与过滤

    • 理解"强弱模型协作"产生更优训练数据的直觉
    • 掌握轨迹数据的质量过滤技术(去重、幻觉检测、降采样等)

    5.3 关键洞察层

    7. 委派智能的本质

    • 委派不只是"分发任务",而是一种主动的上下文管理策略
    • Brief 和 Report 是内容感知的压缩:模型自己决定什么信息重要
    • 委派能力不能仅从工具定义中涌现,需要专门的训练数据

    8. “委派"与"亲自执行"的边界

    • 认知浅层但 token 昂贵的工作(如多步搜索)→ 委派
    • 需要全局视角的核心判断(如方向决策、结果裁决)→ 亲自执行
    • 验证子 Agent 结果时 → 亲自执行(用 visit 直接验证引用)

    9. 泛化与内化

    • SFT 不仅学到了具体的委派行为,还内化了更通用的"结构化问题解决"智能
    • 这种智能可以迁移到没有委派工具的场景,甚至迁移到完全不同的任务类型

    5.4 知识融合的路径

    将这些知识融合完成这项工作的路径是:

    1. 从问题出发:理解长时任务的上下文限制 → 认识到需要主动管理上下文
    2. 发现委派机制:主-子 Agent 协作是自然的管理策略 → 但委派能力不会自动涌现
    3. 设计 Harness:基于对委派本质的理解(何时委派、如何传递上下文、如何整合结果),设计四大原则
    4. 合成训练数据:利用 Harness 引导轨迹生成 → 精心设计混合策略和过滤规则
    5. 训练与验证:通过 SFT 将委派能力内化 → 在多个基准上验证效果
    6. 发现意外收获:泛化到单 Agent 和开放式任务 → 验证了"委派训练内化了更通用的智能”

    六、论文中可以提取的通用性灵感

    6.1 「能力的训练数据稀缺」时,用 Harness 引导合成

    问题:某些高级能力(如委派、规划、协调)在自然语料中极为稀缺。 解法:设计一个精心构思的执行框架(Harness),用规则和提示词引导模型产生正确行为,收集这些行为作为训练数据。 泛化:这个思路适用于任何"自然数据稀缺但可以人工引导"的能力。比如:

    • 复杂的代码调试策略
    • 多步数学推理的自我检查
    • 创意写作中的迭代修改策略

    6.2 「弱队友迫使更强领导」的数据增强策略

    问题:如何生成更高质量的"决策者"训练数据? 解法:让更强的模型当决策者、更弱的模型当执行者。不可靠的执行者会迫使决策者更加审慎和全面。 泛化:这个思路在管理学的"压力测试"中早有体现。在 AI 训练中,它可以用于任何"决策-执行"分离的场景:

    • 训练代码审查者:故意引入低质量的代码修改
    • 训练产品经理 AI:让执行者有时误解需求
    • 训练教师 AI:让学生的回答有时偏离预期

    6.3 委派能力的本质是「上下文压缩」

    洞察:主-子 Agent 的委派看似是任务分发,本质上是内容感知的上下文压缩。Brief 是压缩输入,Report 是压缩输出,而压缩过程由模型自己完成。 泛化:这个洞察告诉我们,在任何信息处理系统中:

    • 与其被动地等内存满了再压缩,不如主动地规划信息流
    • 压缩应该由理解内容的智能体来做,而非由固定规则来做
    • “分派子任务"和"管理信息流"其实是同一件事

    6.4 结构化训练的内化智能可以超越训练场景

    洞察:在委派场景下训练的结构化问题分解、有条理的子问题解决等能力,即使在没有委派工具的场景中也能发挥作用。 泛化:好的训练不是教具体的操作步骤,而是教思维方式。如果你训练一个人做项目管理,他学到的规划、分解、验证能力在独立工作时同样有用。这对 AI 训练的启示是:

    • 训练数据应该注重培养通用的思维模式,而非特定场景的操作
    • 评估模型的泛化能力时,应该测试与训练场景完全不同的设置

    6.5 “保留被迫回答轨迹"的实用智慧

    洞察:不完全信息下的决策是现实世界中常见的场景。保留这些"被迫回答"的轨迹,让模型学会在信息不足时也能给出高质量响应。 泛化:这在工程实践中意味着:

    • 不要只保留完美执行的案例,也保留那些在困难条件下做出合理决策的案例
    • 模型的鲁棒性来自对"不完美场景"的学习,而非仅从"完美场景"中学习
    • 这与"从错误中学习"的教育理念一致

    6.6 单层委派 vs 递归委派的工程权衡

    洞察:SearchSwarm 限制子 Agent 不能再调用 call_sub_agent,只允许单层委派。这个看似简单的约束有深刻的工程智慧:递归委派虽然理论上更灵活,但在实践中会引入控制复杂度爆炸、错误传播、调试困难等问题。 泛化:在系统设计中:

    • 更多的灵活性不一定带来更好的结果
    • 受限的、可预测的行为通常优于无约束的、不可预测的行为
    • 好的设计是在"够用的灵活性"和"可控的复杂度"之间找到平衡

    七、总结

    SearchSwarm 是一篇在多个层面都非常有启发性的工作:

    1. 方法论层面:它展示了如何通过精心设计 Harness + 合成轨迹数据 + SFT 的组合拳,让小模型获得强大的委派能力
    2. 工程层面:四大设计原则(鼓励委派、全面简报、核心判断、引文报告)为多 Agent 系统设计提供了清晰的指导
    3. 认知层面:委派智能本质上是上下文管理策略,而训练委派能力同时内化了更通用的结构化问题解决能力
    4. 实践层面:30B 参数的模型在多个基准上超越 10 倍参数的模型,证明了"正确的方法比暴力堆参数更有效”

    作为该方向最早的开源贡献之一,SearchSwarm 为社区提供了一个完整的、可复现的委派智能训练配方。论文承诺开源 Harness、模型权重和训练数据,这将极大地推动后续研究。