论文链接:arxiv.org/abs/2606.09730 PDF全文:arxiv.org/pdf/2606.09730 发表时间:2026年6月 机构:清华大学、北京大学、蚂蚁集团、中国人民大学高瓴人工智能学院(高校+企业合著) 开源状态:承诺开源 Harness、模型权重和训练数据
一、论文背景
1.1 当 Agent 遇上「长时任务」
大语言模型(LLM)正在从「聊天机器人」进化为「智能体(Agent)」——它们不再只是回答问题,而是能够使用工具、与环境交互、根据反馈调整策略,通过多轮"观察-行动"循环完成复杂任务。
但一个根本性的矛盾随之浮现:现实中的复杂任务可能需要无限长的上下文来处理,而模型的上下文窗口(Context Window)始终是有限的。
举个例子:想象你让一个 Agent 做深度研究——“找出 2025 年底澳大利亚昆士兰州开通的某条高速公路的详细信息”。Agent 需要反复搜索、阅读网页、交叉验证信息,这个过程中产生的搜索结果、网页内容、推理过程会迅速填满上下文窗口。即使现代模型支持 128K 甚至更长的上下文,对于真正的深度研究任务来说,这个窗口仍然远远不够。
1.2 现有的上下文管理策略为什么不够好?
目前的上下文管理方式大多是被动的:
- 截断法:当上下文超过阈值时,直接丢弃最早的内容
- 摘要法:定期将历史对话压缩成一段摘要
- 选择性保留:按固定规则只保留部分工具输出
这些方法的问题在于:它们都是在上下文即将溢出时才被动地压缩或丢弃,缺乏前瞻性的规划。就好比你的手机存储空间满了才开始删照片——删掉的可能是重要的,留下的可能是无用的。
1.3 一个新范式:主动的「委派」
既然被动压缩不够好,那能不能主动规划上下文的使用?
SearchSwarm 提出的核心思路是委派(Delegation):
就像一个管理者不会自己处理所有细节工作,而是将具体任务分派给下属,只接收他们的工作汇报一样,主 Agent 可以将子任务分派给子 Agent,只接收子 Agent 返回的精简报告。
这其实就是一种主动的、内容感知的上下文压缩:
- Brief(任务简报):主 Agent 生成的子任务描述,是对原始上下文的智能压缩输入
- Report(结果报告):子 Agent 返回的执行结果摘要,是对大量中间过程的智能压缩输出
与传统截断或摘要相比,委派的优势在于:压缩过程由模型自己完成,它知道哪些信息重要、哪些可以丢弃,比固定规则的截断要精准得多。
1.4 什么是 Harness?
在理解这篇论文之前,还需要了解一个关键概念——Harness(执行框架/脚手架)。
在 Agent 系统中,有一个越来越被认可的公式:
$$\text{Agent} = \text{Model} + \text{Harness}$$- Model(模型):LLM 本身,负责理解、推理和生成
- Harness(脚手架):模型外层的工程化运行框架,包括系统提示词、工具接口定义、编排逻辑、验证机制、反馈回路等
打个比方:模型是大脑,Harness 是工作环境和流程。一个人即使很聪明,如果工作环境混乱、没有好的工具、缺乏流程规范,工作效率也会很低。
2026 年,Harness Engineering(脚手架工程) 正式成为 AI 工程领域的核心方向之一。来自 OpenAI、Anthropic、Stripe 等团队的一线实践都证实了:不改模型权重,只优化 Harness 层,就能显著改变 Agent 的表现。
1.5 核心困境:委派智能从何而来?
委派听起来很美好,但有一个根本问题:模型怎么学会委派?
这里的难点在于:
- 训练数据稀缺:自然语言语料中很少出现"明确的多 Agent 协调"场景。你不会在维基百科或小说中看到"A Agent 决定把任务 B 委派给 C Agent,并在收到报告后做了 D 决策"这样的描述。
- 能力不会自动涌现:论文做了一个关键实验——即使给未微调的模型提供了
call_sub_agent工具,模型也从未调用过它。这意味着委派行为不会仅从工具定义中自动涌现。 - 需要多种能力的协同:有效委派需要同时具备任务分解能力、子任务范围界定能力、上下文传递能力、结果整合能力——这些能力的训练数据在自然文本中极为稀缺。
这就是 SearchSwarm 要解决的核心问题:如何合成高质量的训练数据,让模型获得「委派智能」。
二、论文定位和关联工作
2.1 在深度研究 Agent 谱系中的定位
SearchSwarm 处于 「深度研究 Agent」 这个快速发展的领域。在这个谱系中,可以按上下文管理策略将现有工作排列如下:
第一代:单 Agent 直接搜索
- 代表工作:早期的 WebGPT、ReAct
- 特点:一个 Agent 负责所有工作,上下文持续累积
- 局限:长任务时上下文窗口不够用
第二代:被动上下文管理
- 代表工作:通义 DeepResearch(Tongyi DeepResearch)、OpenSeeker
- 特点:引入了上下文压缩策略,但依然是被动等待窗口快满了才处理
- 通义 DeepResearch 是 SearchSwarm 的直接基线模型(SearchSwarm 基于它微调而来)
第三代:主动委派式多 Agent
- 代表工作:Kimi Agent Swarm、Step-3.5-Flash、SearchSwarm
- 特点:主 Agent 主动将子任务分派给子 Agent,从根本上管理上下文预算
2.2 与最接近的几个工作对比
Kimi Agent Swarm(月之暗面)
- 核心做法:冻结子 Agent 参数,用**强化学习(RL)**训练主 Agent 的任务分配策略
- 可编排最多 300 个子 Agent,执行最多 4000 步并行工作流
- 与 SearchSwarm 的区别:聚焦高层架构和 RL 训练算法,没有公开完整的 Harness 设计和数据构建配方
Step-3.5-Flash(阶跃星辰)
- 核心做法:层级设计中主 Agent 分发子任务给子 Agent
- 模型规模较大(196B-A11B)
- 与 SearchSwarm 的区别:同样聚焦架构设计,未公开 Harness 设计细节和训练数据构建方法
AOrchestra
- 核心做法:统一的四元组 Agent 抽象,支持动态子 Agent 创建,探索 SFT 用于编排
- 与 SearchSwarm 的区别:更偏理论框架层面,而非面向深度研究的完整落地
RedSearcher、MiroThinker、LongSeeker
- 同属深度研究 Agent 领域的同规模模型
- RedSearcher 通过双约束复杂任务合成和 RL 优化搜索 Agent
- MiroThinker-1.7-mini 是 SearchSwarm 在同规模中的直接竞争对手
2.3 SearchSwarm 的独特定位
SearchSwarm 在上述工作中的核心差异化在于:
| 维度 | Kimi Agent Swarm | Step-3.5-Flash | SearchSwarm |
|---|---|---|---|
| 训练方法 | RL | 未公开 | SFT(监督微调) |
| Harness 设计 | 未公开 | 未公开 | 完整公开 |
| 训练数据构建 | 未公开 | 未公开 | 完整公开 |
| 开源程度 | 闭源 | 闭源 | 完全开源 |
| 模型规模 | 1T-A32B | 196B-A11B | 30B-A3B |
简言之,SearchSwarm 是第一个提供完整配方(Harness 设计 + 训练数据构建 + 模型训练)并完全开源的委派式多 Agent 深度研究工作。
三、问题定义
3.1 从现实困境到抽象问题
SearchSwarm 要解决的现实问题很明确:让一个 30B 参数的小模型在深度研究任务上表现出色。
但要系统地解决这个问题,作者需要将其抽象为一个更本质的问题。论文的核心抽象过程如下:
现实困境:长时任务的上下文需求无限增长 vs 模型上下文窗口有限
↓ 抽象
中间问题:如何在有限的上下文预算下完成需要大量信息处理的任务?
↓ 进一步抽象
核心问题:如何让模型获得「委派智能」——即知道何时委派、委派什么、如何整合结果的能力?
3.2 形式化的问题定义
论文使用 ReAct 框架来形式化这个问题。ReAct 是 2022 年由姚顺雨等人提出的经典 Agent 框架,其核心思想是让模型交替进行"推理(Reasoning)“和"行动(Acting)"。在 ReAct 中,Agent 的每一步包含三个组件:
- Thought(思考) $\tau_t$:Agent 的内部推理过程
- Action(动作) $a_t$:工具调用(包括新引入的
call_sub_agent) - Observation(观察) $o_t$:环境返回的结果
完整的执行轨迹记录为:
$$H_T = (q, (\tau_0, a_0, o_0), \ldots, (\tau_T, a_T, o_T), y)$$其中 $q$ 是用户问题,$y$ 是最终答案。
当主 Agent 执行 $a_t = \text{call\_sub\_agent}(b)$ 时,触发一个完全独立的子轨迹:
$$H^{\text{sub}} = (b, (\tau_0^s, a_0^s, o_0^s), \ldots, (\tau_S^s, a_S^s, o_S^s), r)$$这里的关键约束是:
- $b$(Brief)是主 Agent 传入的子任务描述
- $r$(Report)是子 Agent 返回的精简报告
- 子轨迹在完全独立的上下文中执行,对主 Agent 的历史完全不可见
3.3 问题定义的本质
论文将问题精确定义为:
如何设计一个 Harness(包含工具定义和指导原则),使得通过这个 Harness 收集的轨迹数据,能够通过 SFT 训练,将「委派智能」内化到模型权重中?
这个定义的精妙之处在于,它把一个看似复杂的系统工程问题,分解为三个可操作子问题:
- Harness 设计:如何设计执行框架来引导高质量的委派行为?
- 数据合成:如何从 Harness 引导的轨迹中提取高质量的训练数据?
- 模型训练:如何用这些数据训练模型,使委派能力内化?
四、问题解法
4.1 Harness 设计:四大原则
SearchSwarm 的 Harness 设计是这篇论文的核心贡献。作者为 Harness 配备了 6 个工具:
| 工具 | 功能 |
|---|---|
search | 提交查询到搜索引擎,返回排名结果 |
visit | 访问指定 URL,提取页面内容 |
google_scholar | 检索学术文献 |
python | 代码执行环境 |
call_sub_agent | 核心委派工具:提交 brief,获取 report |
(子 Agent 配备相同标准工具但没有 call_sub_agent) | 限制委派为单层,避免递归委派 |
围绕这些工具,作者提出了 四大设计原则:
原则一:鼓励委派(Encourage Delegation)
主 Agent 的上下文是宝贵的资源。多步的信息收集(反复搜索、阅读网页)虽然 token 消耗大,但认知复杂度其实不高——属于"体力活”。这种工作应该交给子 Agent。
主 Agent 只在以下情况亲自执行:
- 子任务足够简单,委派的开销(生成 brief + 解析 report)反而超过直接执行的成本
- 需要对子 Agent 返回的结果进行验证时
原则二:全面简报(Comprehensive Briefing)
Brief 不只是一个任务描述。一个好的 Brief 应该像一个优秀的项目经理给新加入的团队成员的交接文档,包含:
- 为什么这个子任务重要:在整个研究计划中的位置
- 已经确认了什么:避免子 Agent 重复探索已知的方向
- 还有什么不确定:子 Agent 需要重点调查的内容
- 哪些方向已经尝试过或排除:避免重复劳动
这确保子 Agent 即使在完全独立的上下文中工作,也能高效行动。
原则三:主 Agent 保留核心判断(Main Agent Retains Core Judgment)
在多 Agent 系统中,主 Agent 是唯一拥有所有子任务完整视角的实体。子 Agent 负责收集证据和测试假设,但以下决策必须由主 Agent 独立做出:
- 追哪个假设?
- 何时终止搜索?
- 如何裁决子 Agent 之间冲突的报告?
这个原则确保研究的方向性不会因为委派而丢失。
原则四:引文支撑的报告(Citation-Grounded Reporting)
子 Agent 的报告中,每个重要结论必须附带内联引用(指向具体的来源 URL)。这有两个好处:
- 主 Agent 可以验证结论的可靠性——如果某个子 Agent 说"根据某网页的信息,答案是 X",主 Agent 可以直接用
visit工具访问该 URL 进行核实 - 主 Agent 的最终回答也包含内联引用,增强了答案的可信度
4.2 训练数据合成:巧妙的混合策略
有了 Harness 之后,如何生成高质量的训练数据?论文采用了一种混合配置策略:
配置一:同一模型自对弈
- 同一个模型同时担任主 Agent 和子 Agent
- 保留两种角色的轨迹
配置二:强弱模型协作
- 更强的模型担任主 Agent,更弱的模型担任子 Agent
- 仅保留主 Agent 的轨迹
为什么要有配置二?作者的洞察非常有趣:不太可靠的子 Agent 会迫使主 Agent 更加严格控制研究主线。当子 Agent 可能返回不完整或不准确的信息时,主 Agent 必须:
- 更加审慎地分解任务
- 提供更全面的 brief
- 更严格地验证子 Agent 的结果
这些行为恰恰是高质量的委派智能所必需的。
数据过滤也是关键环节。论文设计了精细的过滤规则:
| 操作 | 描述 |
|---|---|
| ✅ 保留 | 答案正确的主 Agent 轨迹 |
| ✅ 保留 | 主轨迹正确时的子 Agent 轨迹 |
| ⬇️ 降采样 | 过短的子 Agent 轨迹(避免训练数据偏向简单任务) |
| ❌ 移除 | 重复相同的工具调用 |
| ❌ 移除 | 幻觉引用(引用了不存在的来源) |
| ❌ 移除 | 工具滥用(如通过 python 访问网页) |
还有一个特别的做法:保留"强制回答"轨迹。当上下文即将溢出时,模型被迫在不完全信息下给出答案。保留这些轨迹让模型学会在压力下做出高质量响应。
4.3 训练方法:环境掩码的 SFT
训练使用标准的下一 token 预测目标,但有一个关键修改:
$$\mathcal{L} = -\sum_{t=1}^{T}\sum_{j=1}^{|a_t|} \log p_\theta(a_t^{(j)} \mid a_t^{(这确保模型只学习"如何行动",而不是学习"记住搜索结果"。这个方法统一应用于主 Agent 和子 Agent 的轨迹。
4.4 关键实验结果
SearchSwarm 在四个基准上与同规模模型和大规模模型进行了全面对比:
| 模型 | 规模 | BrowseComp | BrowseComp-ZH | GAIA | xbench-DS |
|---|---|---|---|---|---|
| GPT-5.2-Thinking | 闭源 | 65.8 | 76.1 | — | — |
| DeepSeek V3.2 | 671B | 67.6 | 65.0 | 75.1 | 78.0 |
| Step-3.5-Flash | 196B | 69.0 | 66.9 | 84.5 | 83.7 |
| MiroThinker-1.7-mini | 30B | 67.9 | 72.3 | 80.3 | — |
| Tongyi DeepResearch(基线) | 30B | 43.4 | 46.7 | 70.9 | 75.0 |
| SearchSwarm | 30B | 68.1 | 73.3 | 82.5 | 80.8 |
几个关键发现:
- 同规模最佳:在所有四个基准上达到 30B-A3B 规模的 SOTA
- 巨大提升:相比基线,BrowseComp 上提升 24.7 分(43.4 → 68.1)
- 跨越量级:以 30B 参数匹配甚至超越 671B 的 DeepSeek V3.2
- Harness 的力量:仅添加
call_sub_agent工具只提升 2.3 分,但完整的 Harness(含四大原则)提升了 10.0 分
4.5 惊人的泛化能力
论文中最令人惊讶的发现是 SearchSwarm 的泛化能力:
泛化一:单 Agent 设置
当禁用 call_sub_agent 工具后(即回到单 Agent 模式,没有上下文管理),SearchSwarm 仍然比基线模型好很多:
| 模型 | BrowseComp | BrowseComp-ZH |
|---|---|---|
| Tongyi DeepResearch | 43.5 | 46.5 |
| SearchSwarm | 52.0 | 53.3 |
训练数据中完全不包含没有子 Agent 工具的轨迹。这说明委派训练中编码的结构化问题分解、有条理的子问题解决等智能,泛化到了非委派设置。
泛化二:开放式研究
在开放式深度研究基准上(生成完整研究报告而非短答案):
| 模型 | ScholarQA-v2 | HealthBench | ResearchQA | 平均 |
|---|---|---|---|---|
| OpenAI DeepResearch | 79.6 | 53.8 | 79.2 | 64.9 |
| Tongyi DeepResearch | 46.5 | 46.2 | 66.7 | 50.0 |
| SearchSwarm | 79.2 | 52.8 | 80.2 | 64.2 |
训练数据仅包含短答案查询,不包含任何开放式任务。泛化的来源是:Harness 要求主 Agent 全面解释和内联引用,这培养了生成组织良好的长文回复的能力。
五、必要知识反推
如果让一个完全不了解这个领域的人从头做出这项工作,他需要掌握哪些知识?
5.1 领域认知层
1. Agent 和 ReAct 框架
- 理解什么是 Agent(不只是聊天模型,而是能与工具/环境交互的自主系统)
- 掌握 ReAct 模式(Thought-Action-Observation 循环)——这是当前几乎所有 Agent 系统的基础范式
- 理解"上下文窗口"的概念及其对长时任务的根本限制
2. Harness Engineering
- 理解 Agent = Model + Harness 的公式
- 知道 Harness 包含什么(提示词、工具定义、编排逻辑、验证机制等)
- 理解为什么 Harness 的设计可以显著影响 Agent 表现
3. 深度研究 Agent 的特殊性
- 理解"深度研究"任务的特点:需要多轮搜索、信息交叉验证、长链条推理
- 知道现有的评测基准(BrowseComp、GAIA 等)及其评估方式
5.2 技术方法层
4. 监督微调(SFT)
- 理解 SFT 的基本原理:用高质量的输入-输出对来训练模型
- 理解"轨迹数据"(Trajectory Data)的概念:记录 Agent 完整的执行过程,而非仅仅记录问答对
- 掌握环境掩码技术:只对模型生成的部分计算损失
5. 多 Agent 系统设计
- 理解主-子 Agent 的协作模式
- 理解委派机制的本质:不是简单的任务转发,而是上下文的智能压缩
- 知道单层委派 vs 多层递归委派的权衡
6. 数据合成与过滤
- 理解"强弱模型协作"产生更优训练数据的直觉
- 掌握轨迹数据的质量过滤技术(去重、幻觉检测、降采样等)
5.3 关键洞察层
7. 委派智能的本质
- 委派不只是"分发任务",而是一种主动的上下文管理策略
- Brief 和 Report 是内容感知的压缩:模型自己决定什么信息重要
- 委派能力不能仅从工具定义中涌现,需要专门的训练数据
8. “委派"与"亲自执行"的边界
- 认知浅层但 token 昂贵的工作(如多步搜索)→ 委派
- 需要全局视角的核心判断(如方向决策、结果裁决)→ 亲自执行
- 验证子 Agent 结果时 → 亲自执行(用 visit 直接验证引用)
9. 泛化与内化
- SFT 不仅学到了具体的委派行为,还内化了更通用的"结构化问题解决"智能
- 这种智能可以迁移到没有委派工具的场景,甚至迁移到完全不同的任务类型
5.4 知识融合的路径
将这些知识融合完成这项工作的路径是:
- 从问题出发:理解长时任务的上下文限制 → 认识到需要主动管理上下文
- 发现委派机制:主-子 Agent 协作是自然的管理策略 → 但委派能力不会自动涌现
- 设计 Harness:基于对委派本质的理解(何时委派、如何传递上下文、如何整合结果),设计四大原则
- 合成训练数据:利用 Harness 引导轨迹生成 → 精心设计混合策略和过滤规则
- 训练与验证:通过 SFT 将委派能力内化 → 在多个基准上验证效果
- 发现意外收获:泛化到单 Agent 和开放式任务 → 验证了"委派训练内化了更通用的智能”
六、论文中可以提取的通用性灵感
6.1 「能力的训练数据稀缺」时,用 Harness 引导合成
问题:某些高级能力(如委派、规划、协调)在自然语料中极为稀缺。 解法:设计一个精心构思的执行框架(Harness),用规则和提示词引导模型产生正确行为,收集这些行为作为训练数据。 泛化:这个思路适用于任何"自然数据稀缺但可以人工引导"的能力。比如:
- 复杂的代码调试策略
- 多步数学推理的自我检查
- 创意写作中的迭代修改策略
6.2 「弱队友迫使更强领导」的数据增强策略
问题:如何生成更高质量的"决策者"训练数据? 解法:让更强的模型当决策者、更弱的模型当执行者。不可靠的执行者会迫使决策者更加审慎和全面。 泛化:这个思路在管理学的"压力测试"中早有体现。在 AI 训练中,它可以用于任何"决策-执行"分离的场景:
- 训练代码审查者:故意引入低质量的代码修改
- 训练产品经理 AI:让执行者有时误解需求
- 训练教师 AI:让学生的回答有时偏离预期
6.3 委派能力的本质是「上下文压缩」
洞察:主-子 Agent 的委派看似是任务分发,本质上是内容感知的上下文压缩。Brief 是压缩输入,Report 是压缩输出,而压缩过程由模型自己完成。 泛化:这个洞察告诉我们,在任何信息处理系统中:
- 与其被动地等内存满了再压缩,不如主动地规划信息流
- 压缩应该由理解内容的智能体来做,而非由固定规则来做
- “分派子任务"和"管理信息流"其实是同一件事
6.4 结构化训练的内化智能可以超越训练场景
洞察:在委派场景下训练的结构化问题分解、有条理的子问题解决等能力,即使在没有委派工具的场景中也能发挥作用。 泛化:好的训练不是教具体的操作步骤,而是教思维方式。如果你训练一个人做项目管理,他学到的规划、分解、验证能力在独立工作时同样有用。这对 AI 训练的启示是:
- 训练数据应该注重培养通用的思维模式,而非特定场景的操作
- 评估模型的泛化能力时,应该测试与训练场景完全不同的设置
6.5 “保留被迫回答轨迹"的实用智慧
洞察:不完全信息下的决策是现实世界中常见的场景。保留这些"被迫回答"的轨迹,让模型学会在信息不足时也能给出高质量响应。 泛化:这在工程实践中意味着:
- 不要只保留完美执行的案例,也保留那些在困难条件下做出合理决策的案例
- 模型的鲁棒性来自对"不完美场景"的学习,而非仅从"完美场景"中学习
- 这与"从错误中学习"的教育理念一致
6.6 单层委派 vs 递归委派的工程权衡
洞察:SearchSwarm 限制子 Agent 不能再调用 call_sub_agent,只允许单层委派。这个看似简单的约束有深刻的工程智慧:递归委派虽然理论上更灵活,但在实践中会引入控制复杂度爆炸、错误传播、调试困难等问题。
泛化:在系统设计中:
- 更多的灵活性不一定带来更好的结果
- 受限的、可预测的行为通常优于无约束的、不可预测的行为
- 好的设计是在"够用的灵活性"和"可控的复杂度"之间找到平衡
七、总结
SearchSwarm 是一篇在多个层面都非常有启发性的工作:
- 方法论层面:它展示了如何通过精心设计 Harness + 合成轨迹数据 + SFT 的组合拳,让小模型获得强大的委派能力
- 工程层面:四大设计原则(鼓励委派、全面简报、核心判断、引文报告)为多 Agent 系统设计提供了清晰的指导
- 认知层面:委派智能本质上是上下文管理策略,而训练委派能力同时内化了更通用的结构化问题解决能力
- 实践层面:30B 参数的模型在多个基准上超越 10 倍参数的模型,证明了"正确的方法比暴力堆参数更有效”
作为该方向最早的开源贡献之一,SearchSwarm 为社区提供了一个完整的、可复现的委派智能训练配方。论文承诺开源 Harness、模型权重和训练数据,这将极大地推动后续研究。