论文链接:arxiv.org/abs/2601.18226 代码仓库:github.com/YunjueTech/Yunjue-Agent 系统轨迹数据:huggingface.co/datasets/YunjueTech/Yunjue-Agent-Traces 发表时间:2026年1月(arXiv 预印本) 领域标签:Machine Learning, ICML
一、论文背景
1.1 当前的 AI Agent 为什么"不够聪明"?
大语言模型(LLM)的能力突飞猛进,催生了大量 AI Agent(智能体)应用——从编程助手到深度研究系统,从金融分析到科学研究。但一个核心问题始终困扰着所有 Agent 系统:它们的能力边界是固定的。
想象一下,你雇佣了一位非常聪明的助理,他擅长你交给他的第一批任务。但当你突然交给他一个完全不同领域的新任务时——比如从"帮你写代码"变成"去网上搜集金融数据并做复杂推理"——他可能完全束手无策,因为他手头没有合适的"工具"来处理这类问题。
这正是当前 Agent 系统面临的核心困境:
- 静态工具集:大多数 Agent 被赋予一套固定的工具(搜索、计算器、文件读写等),无法根据新任务的需求自主创造新工具
- 离线训练依赖:一些系统需要预先在海量数据上训练,一旦部署就不再进化
- 外部监督需求:很多自改进方法依赖人类标注的正确答案(ground truth),在开放世界中这些答案根本不存在
1.2 Agent 能力的三大支柱
要理解 Yunjue Agent 解决了什么问题,首先需要了解 LLM-based Agent 的能力由三大支柱构成:
工作流(Workflow, 𝒲):Agent 的组织架构。它是一个有向图,图中每个节点是一个基于 LLM 的智能体角色,边代表信息流向。比如一个"Manager → Developer → Executor"的三角色架构就是一种工作流。工作流定义了"谁做什么、谁听谁的"。
上下文(Context, 𝒞):Agent 的知识和记忆。这包括系统提示词(System Prompt)、对话历史、经验记忆等。上下文决定了 Agent"知道什么"和"怎么思考"。
工具(Tool, 𝒯):Agent 可以调用的外部功能。每个工具是一段可执行的 Python 函数,能让 Agent 真正与外部世界交互——搜索网页、解析 PDF、处理 Excel、调用 API 等。工具决定了 Agent"能做什么"。
1.3 为什么"工具"是最关键的进化路径?
Yunjue Agent 的核心洞察是:在三大支柱中,工具(Tool)是实现 Agent 能力扩展最关键、最可行的路径。理由有三:
(1)工具是能力的天花板
不管工作流多精妙、上下文多丰富,如果 Agent 手头没有处理特定任务的工具(比如没有 PDF 解析器),它就根本无法完成涉及 PDF 的任务。就像一个再聪明的人,没有显微镜就做不了微生物实验。
(2)工具的成功与否有明确的二元信号
一段代码要么运行成功,要么抛出异常。这种"非黑即白"的反馈信号极其宝贵——它让系统无需人工标注就能自主判断一个工具是否有效。相比之下,工作流优化和上下文管理的效果往往是模糊的、难以量化的。
(3)工具天然支持积累和复用
一个好的工具一旦被创造出来,就可以在后续所有任务中反复使用。这种"一次创造、永久受益"的特性使得工具进化具有累积效应,符合终身学习的基本理念。
1.4 现有方法的困境
此前的研究已经在"让 Agent 自我进化"这一方向上做了探索,但各有局限:
| 方法类别 | 代表工作 | 局限性 |
|---|---|---|
| 具身环境中的技能学习 | Voyager(2023) | 在 Minecraft 中学习技能,但工具仅适用于特定游戏环境,无法跨域迁移 |
| 领域特定的工具合成 | STELLA(2025) | 在生物医学领域自主创建工具,但局限于单一领域 |
| 基于经验记忆的知识复用 | Agent KB(2025) | 通过跨域经验总结帮助 Agent 解决问题,但缺少必要工具时记忆也无济于事 |
| 工作流自动优化 | AFlow(2025) | 用蒙特卡洛树搜索自动优化 Agent 工作流,但不涉及工具层面的进化 |
| 依赖真实标签的自进化 | Alita-G(2025) | 需要成功/失败的真实监督信号,无法在无标签场景下运作 |
这些工作有一个共同的问题:要么只能在特定领域工作,要么需要外部监督,要么只优化工作流或上下文而非工具本身。Yunjue Agent 要解决的正是这些局限性的综合——如何让 Agent 在没有任何先验工具和真实标签的情况下,通过自主创造和优化工具来持续扩展自己的能力边界。
二、论文定位和关联工作
2.1 自进化 Agent 的四条路线
自进化 Agent 的研究可以清晰地分为四个方向:
路线一:工作流优化
代表工作包括 MAS-GPT 和 AFlow。它们的核心思路是优化 Agent 的工作流结构——调整节点数量、连接方式、信息传递策略等。这就像优化一个公司的组织架构:改变汇报关系、增减部门。但工作流优化不涉及工具本身,Agent 的能力上限仍受限于可用工具。
路线二:模型参数更新
代表工作如 TT-SI(Test-Time Self-Improvement)和 SCA(Self-Challenging Agents)。它们在推理阶段直接更新 LLM 的参数或通过 RL 训练来改进 Agent。这类方法成本极高,且更新后的模型可能失去通用性。
路线三:上下文管理
代表工作如 Agent KB 和 ELL。它们通过总结过去任务的经验教训,将其作为"记忆"注入 Agent 的上下文中。问题是:当 Agent 缺少必要的工具时,再多的经验记忆也解决不了问题——你不可能通过"回忆经验"来凭空造出一个 PDF 解析器。
路线四:工具合成
这是 Yunjue Agent 所在的路线,也是最具潜力的方向。代表工作包括:
- Voyager(2023, NeurIPS):在 Minecraft 中通过 LLM 生成 JavaScript 技能代码,存入技能库供后续复用。但局限于游戏环境。
- STELLA(2025):在生物医学领域通过多 Agent 协作自主创建分析工具。但局限于单一领域,且没有工具去重和合并机制。
- LIVE-SWE-agent(2025):在软件工程任务中实时创建工具,但工具没有跨任务的持久化和复用。
- Alita-G(2025):将成功工具持久化为 MCP(Model Context Protocol),但依赖真实标签来判断成功与否。
2.2 Yunjue Agent 的定位
Yunjue Agent 处于工具进化路线的最新进展位置,它站在上述所有工作的肩膀上,做出了以下关键改进:
- 超越 Voyager:从 Minecraft 游戏环境拓展到开放世界的通用任务
- 超越 STELLA:从生物医学单一领域拓展到跨领域的通用能力
- 超越 LIVE-SWE-agent:增加了工具的持久化、复用和自动合并机制
- 超越 Alita-G:无需真实标签,仅靠工具执行的二元反馈信号(成功/失败)即可自主进化
更重要的是,Yunjue Agent 提出了"系统级预训练"的概念——类似于 LLM 的预训练范式,Agent 系统也可以在大规模任务上进行预训练,积累出一套"基础工具集",然后在新领域中零成本迁移。这个愿景是此前所有工作都未曾明确提出的。
三、问题定义
3.1 从"Agent 怎么变强"到"工具怎么自主进化"
面对"让 Agent 在开放世界中持续进化"这个宏大目标,Yunjue Agent 的作者们进行了一系列精妙的抽象。
第一步:将 Agent 形式化为三元组
Agent 系统被抽象为 $ℳ = ⟨𝒲, 𝒞, 𝒯⟩$,即"工作流 + 上下文 + 工具"。这就像把一个人抽象为"工作方式 + 知识储备 + 技能工具"三个维度。
第二步:锁定进化维度
在三大维度中,作者通过论证锁定"工具"为唯一需要进化的维度:
- 工作流 $𝒲$ 保持固定(预定义的多 Agent 协作架构)
- 上下文 $𝒞$ 保持固定(固定的提示模板和记忆结构)
- 只有工具集 $𝒯$ 随任务处理动态演化
第三步:定义"原位自进化"
给定一系列任务 $\{x_1, x_2, ..., x_t\}$,Agent 的状态从 $ℳ_0$ 逐步进化到 $ℳ_t$:
$$ℳ_{t-1} = ⟨𝒲_0, 𝒞_0, 𝒯_{t-1}⟩ \rightarrow ℳ_t = ⟨𝒲_0, 𝒞_0, 𝒯_t⟩$$“原位”(In-Situ)的关键含义是:进化发生在推理阶段(Inference Time),而非训练阶段。这意味着系统在处理每个任务时就在进化,而不需要额外的训练过程或人类标注的真实答案。
3.2 核心问题抽象
最终,论文将"如何让 Agent 在开放世界中持续变强"这个模糊的大问题,精炼为以下核心问题:
在没有真实标签的开放环境中,如何设计一个机制,使 Agent 能够将每次任务执行中获得的短期反馈(工具成功/失败),蒸馏为长期、可复用的工具能力?
这个定义的精妙之处在于:
- 排除外部信息干扰:不依赖真实标签、不依赖人类反馈、不依赖预训练数据
- 抓住本质矛盾:短期执行反馈(每次任务中的成败)与长期能力积累(跨任务的工具沉淀)之间的关系
- 可量化评估:工具的"成功/失败"是二元信号,自然支持量化评估
3.3 衡量进化效果的指标
为了衡量工具库是否在有效进化,论文提出了 EGL(Evolution Generalization Loss,进化泛化损失) 指标:
$$EGL(t) = \frac{C_t}{U_t} = \frac{\sum_{i=1}^{t} c_i}{\sum_{i=1}^{t} u_i}$$其中 $c_i$ 是步骤 $i$ 中新合成的工具数量,$u_i$ 是步骤 $i$ 中工具的调用次数。
直觉理解:当 Agent 的工具库越来越"够用"时,它需要新造工具的频率就会下降,而使用现有工具的频率持续上升,EGL 就会趋向于零。这就像一个经验丰富的厨师——刚开始什么工具都要新买,后来几乎什么都不用买了,因为厨房已经应有尽有。
论文还严格证明了两个定理:
- 定理 5.1(下降条件):只要边际合成比低于累积比,EGL 就会下降
- 定理 5.2(收敛速率):当工具总数趋于稳定时,EGL 以 $O(1/t)$ 的速率收敛到零
四、问题解法
4.1 系统架构:六个角色的协作
Yunjue Agent 采用多 Agent 架构,由六个专职角色协同工作:
| 角色 | 职责 | 类比 |
|---|---|---|
| Manager | 分析任务需求,从工具库中检索合适工具,判断是否需要新工具 | 项目经理:评估需求、分配资源 |
| Tool Developer | 根据需求合成新的 Python 工具函数 | 工具开发者:按需编写新工具 |
| Executor | 使用配备的工具集执行具体任务,遵循 ReAct 范式 | 执行者:拿着工具干活 |
| Integrator | 整合执行历史和中间输出,形成最终响应 | 汇报者:整合结果交付 |
| Aggregator | 在批次结束后,按功能语义相似度对工具进行聚类 | 资产清点员:归类去重 |
| Merger | 对每个聚类合成统一的标准工具,消除冗余 | 标准化员:合并同类项 |
整个工作流程如下:
- 接收任务:Manager 分析任务,从全局工具库 $𝒯_{t-1}$ 中检索相关工具子集
- 能力判断:如果现有工具不够用,Manager 通知 Tool Developer 按需合成新工具
- 执行任务:Executor 使用工具集 $𝒯_{sub} \cup 𝒫_t$ 执行任务
- 动态适应:如果 Executor 执行中发现缺少某工具(如需要特定的 PDF 解析器),会暂停执行并向 Manager 发信号,Manager 即时调度 Tool Developer 创建所需工具,然后 Executor 无缝恢复
- 结果整合:Integrator 整理最终答案
- 工具沉淀:Aggregator 和 Merger 在批次结束后合并去重
4.2 核心机制一:工具积累的双维度进化
工具的进化发生在两个维度上:
广度扩展(Breadth):创造全新的工具来覆盖之前无法处理的功能。例如,系统一开始没有"金融数据提取"的能力,当遇到相关任务时,就会合成一个新的金融数据提取工具。
深度优化(Depth):通过执行中的自我反思,优化已有工具的健壮性。例如,一个网页抓取工具在第一次执行时可能因为缺少异常处理而失败,系统会根据错误报告修复它,使其更稳健。
当 Agent 处理了足够多的任务后,工具库预期达到收敛状态——大部分任务都能用现有工具解决,只需要偶尔为特殊需求创建新工具。
4.3 核心机制二:并行批进化(Parallel Batch Evolution)
为了提升进化效率,Yunjue Agent 引入了并行批进化策略。其核心思想可以用一个类比来理解:
想象你管理一个研发团队。如果让团队成员一个接一个地解决问题,每个人只能看到前一个人的成果。但如果让 B=16 个人同时独立解决不同问题,每个人都会创造一些工具,然后在"站会"上合并去重——这就是并行批进化。
形式化流程:
- 将查询分为批次 $𝒬_t = \{q_{t,1}, q_{t,2}, ..., q_{t,B}\}$,批量大小 B=16
- 每个查询并行独立地合成局部工具集 $𝒫_{t,i}$
- 批次完成后,工具吸收机制启动:
- 聚合所有工具 $\{𝒯_{t-1}, 𝒫_{t,1}, ..., 𝒫_{t,B}\}$
- 基于功能语义相似度聚类为不相交的组 $\{G_j\}$
- 合并函数 $\Phi$ 将每组工具合并为一个精简版本
- 生成更新后的工具池 $𝒯_t = \Phi(\{G_j\})$
为什么这很重要?
并行批进化有两大理论优势:
类似小批量梯度下降:在深度学习中,小批量随机梯度下降通过对多个样本的梯度取平均来减少方差。类似地,并行批进化通过对多个查询产生的工具取"平均"(聚类合并),减少了单次工具合成的随机性。
类似 Best-of-N 测试时扩展:在 LLM 对齐中,Best-of-N 策略通过采样多次并选最优来提升输出质量。类似地,并行批进化同时创建多个功能相似的工具,然后通过合并选择最优结果。
4.4 实验结果:零起点即超越专有系统
Yunjue Agent 在 5 个不同领域的基准测试上进行了零起点(Zero-Start)评估,即不预置任何领域工具,从零开始自主进化:
| 基准测试 | 领域 | Yunjue Agent | 后端模型(Gemini 3 Pro) | 提升 | 排名 |
|---|---|---|---|---|---|
| HLE | 通用推理 | 48.0% | 45.8% | +2.2% | 第2 |
| DeepSearchQA | 深度搜索 | 73.5% | 56.6% | +16.9% | 第1 (SOTA) |
| FinSearchComp | 金融搜索 | 65.0% | 49.9% | +15.1% | 第1 (SOTA) |
| xSciQA | 科学问答 | 76.5% | — | — | 第1 (SOTA) |
| xDS | 深度搜索 | 59.7% | — | — | 第2 |
关键发现:
- 在 DeepSearchQA 和 FinSearchComp 上,Yunjue Agent 超越了 GPT-5.2 Pro、Gemini Deep Research 等专有系统
- 整个 HLE 的 2500 个查询中,系统仅自主合成了 97 个工具
- 执行器(Executor)消耗了约 95% 的 token,但系统总开销与标准 ReAct Agent 相当
4.5 热启动实验:工具知识的跨域迁移
更具启发性的是**热启动(Warm-Start)**实验。系统先在 HLE 上积累工具(97个),然后直接将这套工具迁移到完全不同的领域:
| 目标数据集 | 零起点准确率 | 热启动准确率 | 新工具合成减少量 |
|---|---|---|---|
| DeepSearchQA | 73.5% | 74.6%(+1.1%) | ↓ 32% |
| FinSearchComp | 65.0% | 65.4%(+0.4%) | ↓ 55% |
| xSciQA | 76.5% | 80.2%(+3.7%) | ↓ 100% |
| xDS | 59.7% | 60.6%(+0.9%) | ↓ 100% |
惊人的发现:在 xSciQA 和 xDS 上,热启动系统完全不需要创建任何新工具——仅靠从 HLE 迁移过来的 97 个工具就实现了性能提升。这意味着这 97 个工具已经覆盖了科学问答和深度搜索所需的全部功能。
这直接验证了论文的核心假设:通用任务中进化出的工具具有强大的跨域迁移能力,积累了足够多通用工具的 Agent 面对新领域时,就像一个经验丰富的全科医生面对新的专科病人——基础能力已经具备,只需稍加适应。
五、必要知识反推
假设我们找一个完全没有相关知识的人来做这项研究,他从发现问题到解决问题需要掌握哪些必要知识?我们来逐步反推。
5.1 发现"原位自进化"问题需要的知识
(1)LLM-based Agent 的基本架构
必须理解 Agent 不是"一个 LLM",而是一个包含工作流、上下文和工具的系统。只有理解了这种三元结构,才能意识到"进化"可以在三个维度中的任何一个维度发生。
(2)当前 Agent 系统的实际部署痛点
必须亲自使用或观察过 Agent 系统(如 Claude Code、GPT-5 等)在开放世界中的表现,才能深刻体会到"能力边界固定"的痛点。光看论文中的 benchmark 数字是远远不够的——你需要看到 Agent 遇到它不会的事情时的无助。
(3)开放世界 vs. 封闭环境的区别
必须理解"开放世界"(Open-Ended)的含义:任务分布持续变化,没有明确的边界。这与传统机器学习中"训练集+测试集来自同一分布"的假设完全不同。
(4)现有自进化方法的具体限制
需要深入了解 Voyager、STELLA、Agent KB 等前序工作的具体做法和局限性,才能发现它们的共同盲点:缺少一种无需真实标签、可在开放世界中自主进化工具的方法。
5.2 设计"工具进化"解决方案需要的知识
(5)工具/代码的可验证性
必须认识到:程序代码的执行结果是二元的(成功或失败),这种特性使得工具进化可以产生天然的监督信号,无需人工标注。这是一个关键的洞察,决定了整个技术路线的可行性。
(6)多 Agent 协作架构设计
必须了解如何设计多个 LLM 角色之间的协作流程——谁来规划、谁来编码、谁来执行、谁来整合。这涉及 LangGraph 等框架的使用经验。
(7)ReAct 范式
必须理解 ReAct(Reasoning + Acting)范式——Agent 交替进行"思考"和"行动"的过程。Yunjue Agent 的 Executor 正是基于 ReAct 范式执行任务。
(8)聚类与合并机制
需要知道如何在语义层面判断"两个工具是否功能相似",以及如何将相似工具合并为一个更通用的版本。这涉及 LLM-based 的语义理解和代码合并技术。
(9)小批量优化的思想
需要理解深度学习中随机梯度下降和小批量梯度下降的思想,才能类比为"并行批进化"——通过多样本平均减少方差。
(10)收敛性分析的数学工具
需要掌握基本的极限分析和序列收敛理论,才能推导出 EGL 指标的下降条件和收敛速率的数学证明。
5.3 知识融合的关键点
上述知识并非孤立存在,它们的融合路径如下:
- 从 Agent 架构知识(1)出发,识别出三个可进化维度
- 结合 实际部署痛点(2)和 开放世界特性(3),排除不切实际的进化方向
- 利用 代码可验证性洞察(5),锁定"工具进化"为最优路径
- 借鉴 前序工作的经验(4),避免已有局限(如依赖真实标签、局限于单一领域)
- 运用 多 Agent 架构(6)和 ReAct 范式(7),设计具体的执行流水线
- 引入 聚类合并(8)和 小批量优化(9)思想,设计并行批进化策略
- 通过 数学分析工具(10),提出可监控进化收敛的指标
六、论文中可以提取的通用性灵感
灵感 1:二元反馈信号是自主进化的基石
核心洞察:工具的执行结果天然是二元的(成功/失败),这种简洁而确定的信号使得系统无需任何外部标注就能自主判断进化方向。
推广价值:在任何需要自主进化的系统中,如果能找到一种"二元反馈信号"(如程序是否通过测试、产品是否被用户使用、策略是否达到目标),就可以用这种信号驱动进化,而不需要复杂的评价体系。
灵感 2:“蒸馏短期经验为长期资产"的通用模式
核心洞察:Yunjue Agent 的本质是将每次任务执行中的短期反馈"蒸馏"为可长期复用的工具。这种"短期经验 → 长期资产"的模式具有普适性。
推广价值:
- 在组织管理中:将个人经验提炼为标准操作流程(SOP)
- 在软件开发中:将重复代码重构为通用库
- 在个人学习中:将解题经验总结为方法论
灵感 3:并行批处理 + 合并去重 = 高效进化
核心洞察:让多个并行实例独立探索,然后通过聚类合并去重,既保证了探索的多样性,又避免了冗余膨胀。这直接对应了深度学习中小批量梯度下降的思想。
推广价值:
- 在团队管理中:让多个子团队并行探索不同方案,然后合并最佳成果
- 在 A/B 测试中:并行测试多个变体,然后收敛到最优方案
- 在算法优化中:种群进化算法中的"多样性保持 + 精英选择"策略
灵感 4:进化需要收敛指标
核心洞察:EGL 指标的提出揭示了任何进化过程都需要一个可量化的"收敛指标”。就像训练深度学习网络需要监控 Loss 一样,Agent 的进化也需要知道"什么时候进化到头了"。
推广价值:
- 在任何持续改进的系统中,都需要定义一个"改进率"指标来监控进度
- 当改进率趋近于零时,说明系统已经收敛,可以停止投入或切换策略
灵感 5:通用知识的跨域迁移具有巨大价值
核心洞察:在通用任务上积累的 97 个工具,迁移到完全不同的领域后竟然不需要创建任何新工具就能取得更好效果。这说明通用能力的积累具有涌现性的迁移价值。
推广价值:
- LLM 的预训练范式:在海量通用数据上训练的模型,可以高效迁移到具体任务
- 人类教育的通识培养:广泛的基础知识在面对新领域时往往比狭窄的专精更有用
- Agent 系统的"预训练":未来可能出现"基础工具集"的预训练范式
灵感 6:能力扩展应聚焦于最可验证的维度
核心洞察:在 Agent 的三个进化维度中,Yunjue Agent 选择"工具"而非"工作流"或"上下文",根本原因是工具的成功与否最容易验证。这种"从最可验证的维度入手"的策略具有通用性。
推广价值:
- 在系统优化中:应该优先优化那些效果最可量化的环节
- 在研究方向选择中:应该选择那些"成功标准最明确"的问题先攻克
- 在项目规划中:应该先验证最核心假设,再做周边优化
灵感 7:系统级"预训练-后训练"范式的启示
核心洞察:论文在讨论中提出了一个前瞻性愿景——Agent 系统正在走向类似 LLM 的"预训练 + 后训练"范式。在大规模通用任务上预训练积累"基础工具集",然后在具体领域微调适配。
推广价值:这暗示了 AI 系统发展的一个普适规律:任何智能系统的发展都会经历从"每次从头学"到"预训练积累 + 按需适配"的范式跃迁。从人类文明的知识传承,到 LLM 的预训练范式,再到 Agent 的系统级预训练,都是这一规律的具体体现。
总结
Yunjue Agent 是自进化 Agent 领域的一项重要突破。它通过以下创新实现了"零起点、无监督、跨领域"的 Agent 能力进化:
- 原位自进化范式:在推理阶段自主进化,不依赖真实标签
- 工具进化路径:锁定最可验证的维度,用二元反馈驱动进化
- 并行批进化策略:通过并行探索 + 聚类合并实现高效进化
- EGL 收敛指标:首次为 Agent 进化提供了可量化的监控手段
- 跨域迁移验证:证明通用工具积累具有涌现性的迁移价值
这项工作不仅展示了 Agent 自进化的技术可行性,更提出了"Agent 系统级预训练"的前瞻性愿景——Agent 系统可能像 LLM 一样,走向"大规模预训练积累基础能力 + 按需适配具体任务"的范式。这一愿景如果实现,将从根本上改变我们构建和使用 AI Agent 的方式。