论文链接:https://arxiv.org/abs/2506.09033

发表机构:伊利诺伊大学厄巴纳-香槟分校(UIUC)U Lab

作者:Haozhen Zhang, Tao Feng, Jiaxuan You

发表会议:NeurIPS 2025(已接收)

开源代码:https://github.com/ulab-uiuc/Router-R1

模型与数据集:HuggingFace Collection


一、论文背景

1.1 大模型生态的"选择困难症"

如今的大语言模型(LLM)已经多到令人眼花缭乱——GPT-4、Claude、Gemini、Qwen、LLaMA、Mistral、Mixtral……每个月都有新的模型或微调版本发布。这些模型各有所长:有的擅长数学推理,有的在代码生成上表现出色,有的中英文双语能力强,有的则在事实性问答上更加准确。

这就带来了一个非常实际的问题:面对一个具体的用户请求,应该用哪个模型来回答?

用最强大但最昂贵的模型(如 GPT-4 级别)来回答所有问题?这就像用大炮打蚊子——资源浪费严重。用一个轻量但能力有限的小模型来回答所有问题?复杂问题可能答不好。理想的做法是因题制宜——简单问题让小模型快速搞定,复杂问题再请大模型出马。

1.2 LLM 路由器:模型的"调度员"

为了解决这个问题,研究者们开发了 LLM 路由器(LLM Router)。简单来说,LLM 路由器就是一个"调度员",它的职责是根据用户提问的特征,自动选择最合适的 LLM 来处理。

打个比方,LLM 路由器就像医院的分诊台:来了一位病人(用户提问),分诊护士(路由器)会快速判断这个症状应该挂什么科(选择哪个模型),然后指引病人去对应的诊室。

目前主流的 LLM 路由器工作模式是 “单轮一对一映射”:

  • 输入:用户的一个问题
  • 路由决策:路由器根据问题特征,一次性选择一个最合适的 LLM
  • 输出:被选中 LLM 的回答

这种模式的代表工作包括:

方法核心思路来源
RouteLLM利用人类偏好数据训练路由器,在强弱模型间动态选择UC Berkeley, 2024
FrugalGPT采用 LLM 级联策略,按顺序尝试模型,平衡性能和成本Stanford, 2023
GraphRouter将路由问题建模为图上的边预测任务,利用图神经网络UIUC, 2024
RouterDC通过查询和 LLM 嵌入之间的双对比学习进行路由2024

1.3 单轮路由的瓶颈:复杂任务需要"集思广益"

然而,单轮一对一映射存在一个根本性的局限:真正复杂的任务往往需要多个模型的互补优势,而不是只依赖一个模型。

举一个具体例子:假设用户问"电影《盗梦空间》和《星际穿越》中,哪部电影的上映时间更早?其导演出生在哪个城市?"

这个问题需要多步推理:

  1. 查到《盗梦空间》的上映时间
  2. 查到《星际穿越》的上映时间
  3. 比较两者,确定更早的那部
  4. 查到该电影导演(克里斯托弗·诺兰)的出生城市

在单轮路由模式下,路由器只能选择一个模型来回答这整个问题。但不同模型在不同子任务上的能力可能不同——模型 A 擅长电影知识,模型 B 擅长人物传记,模型 C 擅长逻辑推理。如果能让路由器分步调用不同模型的专长,效果会好得多。

这就引出了本文要解决的核心问题:如何让路由器在多轮交互中协调多个 LLM,通过多次调用和结果聚合来共同解决复杂任务?

1.4 解决这个问题的两大挑战

作者指出,将路由从"单轮一对一"升级为"多轮多模型协调"面临两个关键挑战:

挑战一:离散决策过程的不可微性。 选择调用哪个 LLM 是一个离散决策(选或不选),不像神经网络的连续权重那样可以通过反向传播来优化。虽然之前有工作用基于梯度的方法做单次路由,但扩展到多轮选择和聚合后,梯度优化的路径就被完全阻断了。

挑战二:现有路由器的单步操作局限。 传统路由器的逻辑是"选模型→获取回答→结束"。但复杂任务需要一系列交替的推理和模型选择决策——先想一想需要什么信息,选择合适的模型查询,拿到结果后继续推理,再决定是否需要调用另一个模型……这种"思考-路由-思考-路由"的循环是传统路由器完全不具备的能力。


二、论文定位与关联工作

2.1 在 LLM 路由领域的定位

Router-R1 处于 LLM 路由研究的前沿位置,它是对现有路由范式的一次根本性升级:

路由范式演进:
  单模型部署 → 单轮单模型路由 → 单轮多模型选择 → ★多轮多模型路由与聚合(Router-R1)

在 Router-R1 之前,LLM 路由器的工作基本都停留在"单轮"阶段。RouteLLM(2024)虽然开创性地利用人类偏好数据训练路由器,但只做一次选择;GraphRouter(2024)将路由建模为图预测问题,但仍然是一对一映射;FrugalGPT(2023)提出了级联策略,按顺序尝试多个模型直到获得满意答案,但本质上是"串行试错"而非"智能调度"。

Router-R1 的独特定位在于:它是第一个将 LLM 路由建模为多轮序贯决策过程的工作,路由器不再是简单的"分诊护士",而更像一个"会诊协调专家"——它能够思考、选择、整合、再思考,循环往复直到得出最佳答案。

2.2 从强化学习推理领域的借鉴

Router-R1 的方法论直接受益于近期两项重要的强化学习推理工作:

DeepSeek-R1(2025):这篇登上 Nature 封面的论文证明了纯强化学习(不需要监督数据)就足以激发 LLM 的推理能力。DeepSeek-R1 使用 GRPO(Group Relative Policy Optimization)算法,让模型在试错中学会"思维链"(Chain of Thought)推理。Router-R1 借鉴了 DeepSeek-R1 的格式奖励设计——通过规则约束确保模型输出符合预定格式,这一设计被证明对训练稳定性至关重要。

Search-R1(2025):韩家炜团队的工作将搜索引擎纳入强化学习框架,让 LLM 学会在推理过程中自主调用搜索引擎获取信息。Router-R1 借鉴了这种"思考-搜索-整合"的交互范式,但将搜索引擎替换为多个异构 LLM——每个 LLM 就像一个具有不同专长的"顾问",路由器学会在合适的时机咨询合适的顾问。

2.3 技术栈与基础

Router-R1 的技术基础可以梳理如下:

基础工作对 Router-R1 的贡献
PPO/GRPO 策略优化算法Router-R1 采用的核心训练算法
DeepSeek-R1 的格式奖励训练稳定性的关键保障
Search-R1 的交互范式思考-路由-整合的多轮交互模式
veRL 训练框架实际训练使用的工程框架
Qwen2.5 / LLaMA-3.2作为路由器基座模型的选项

值得注意的是,Router-R1 和 GraphRouter 都来自 UIUC 的 U Lab(Jiaxuan You 教授课题组),这说明该团队在 LLM 路由领域有着系统性的研究布局——从基于图的静态路由(GraphRouter)到基于 RL 的动态多轮路由(Router-R1),再到统一路由框架(LLMRouter)。


三、问题定义

3.1 从"一次性选择"到"序贯决策"的问题抽象

在传统路由框架中,问题被定义为一个分类问题或匹配问题:给定查询 q 和候选模型集合 M,找到最优模型 m* = argmax_{m∈M} Score(q, m)。这是一个单步决策。

Router-R1 将这个问题重新定义为一个序贯决策问题(Sequential Decision Process):

给定一个输入问题 x 和一组候选 LLM 组成的路由池 P,如何训练一个策略 π,使其能够在多个步骤中交替执行"内部推理"和"外部模型调用",动态整合多个 LLM 的输出,最终生成最优答案 y?

这个定义的关键抽象在于:不再将路由视为一次性的"选择"操作,而是视为一系列需要动态规划的"决策"操作。每一步决策都依赖于之前所有步骤的累积信息——包括原始问题、之前的推理过程、以及之前调用过的模型的回答。

3.2 形式化表述

从数学角度,Router-R1 将问题建模为带 KL 正则化的策略优化目标:

$$\max_{\pi} \mathbb{E}_{x\sim D, y\sim\pi(\cdot|x;\mathcal{P})}\left[r_\phi(x,y) - \beta \log \frac{\pi(y|x;\mathcal{P})}{\pi_{\text{ref}}(y|x;\mathcal{P})}\right]$$

其中:

  • π 是待优化的策略(即路由器 LLM)
  • π_ref 是参考策略(训练过程中保持稳定的基准)
  • x 是输入问题,y 是生成的完整输出(包含推理过程和路由调用的交错序列)
  • r_φ(x, y) 是奖励函数
  • P 是可调用的 LLM 路由池
  • β 是 KL 正则化系数,防止策略偏离参考策略太远

这个公式是一个通用框架——它可以涵盖 PPO、GRPO 等各种正则化强化学习算法。Router-R1 在实现中默认使用 PPO。

3.3 核心设计:将路由器本身作为 LLM

一个关键的设计决策是:路由器本身就是一个能力足够强的 LLM,而不是一个简单的分类器或排名模型。

为什么这个设计很重要?因为路由器需要具备三种能力:

  1. 理解复杂问题:分析用户问题的结构和所需信息
  2. 评估模型能力:根据问题特点和模型描述判断哪个模型最合适
  3. 整合多源信息:将不同模型的回答融合成连贯的推理链

只有 LLM 才能同时胜任这三项任务。而传统的路由器(如 KNN、MLP、BERT 分类器)只能做第一步和第二步的某种近似,完全不具备第三步的能力。


四、问题解法

4.1 整体架构:思考-路由-整合的循环

Router-R1 的核心工作机制可以用一个"思考-路由-整合"的循环来概括:

┌──────────────────────────────────────────────┐
│              Router-R1 工作流程                │
│                                                │
│   输入问题 ──→ [思考:分析需要什么信息]          │
│                    ↓                           │
│              [路由:选择合适的 LLM]              │
│                    ↓                           │
│              [整合:将 LLM 回答加入上下文]        │
│                    ↓                           │
│         还有信息缺口? ──是──→ 回到 [思考]       │
│              ↓ 否                              │
│         [输出最终答案]                           │
└──────────────────────────────────────────────┘

具体来说,Router-R1 的每次生成过程包含两种类型的"动作":

  • Think 动作(<think >...</think >):路由器进行内部推理,分析当前已有什么信息、还缺什么、下一步该做什么。这个过程对用户不可见,是路由器的"内心独白"。
  • Route 动作(<search >LLM名称: 查询</search >):路由器选择一个具体的 LLM 并向其提出子问题。被选中 LLM 的回答会被包裹在 <info>...</info> 标签中返回给路由器,成为下一轮推理的上下文。

这个过程最多重复 4 次(论文设定的最大路由步数),之后路由器必须给出最终答案。

4.2 提示模板设计:教会路由器"怎么路由"

为了让 LLM 理解它需要扮演的角色,作者设计了一个精心构造的提示模板(Prompt Template)。这个模板的核心逻辑是:

  1. 角色定义:告诉模型它是一个"路由器",需要通过推理和调用外部 LLM 来回答问题
  2. 行动指南:规定模型必须在 <think > 中先思考"为什么需要外部信息"和"哪个 LLM 最适合",然后才能发起调用
  3. 模型描述:提供每个候选 LLM 的简短能力描述(如"擅长中文、数学和推理"或"700 亿参数,擅长复杂推理")
  4. 探索鼓励:鼓励模型"多次探索和利用不同的 LLM,以了解它们各自的优势和劣势"

一个有趣的设计是:模型描述符(Model Descriptor)是通过 GPT-4o 自动生成的。作者用 GPT-4o 基于公开的模型卡片生成每个 LLM 的标准化简短描述。在训练初期,路由器主要依赖这些描述来做出路由决策;但随着 RL 训练的进行,路由器通过反复尝试和奖励反馈,逐步建立对每个 LLM 真实能力的"经验性认知"——这就好比一个新员工,入职时看的是岗位说明书,工作一段时间后积累的是实战经验。

4.3 奖励设计:三重引导信号

强化学习的核心挑战在于奖励设计——奖励信号决定了模型学什么、怎么学。Router-R1 设计了一个三层奖励机制:

第一层:格式奖励(Format Reward)

$$\mathbf{R}_{\text{format}} = \begin{cases} -1, & \text{if format is incorrect} \\\; 0, & \text{if format is correct} \end{cases}$$

格式奖励确保模型的输出符合预定义的结构——例如 <think > 块必须正确开关,<search> 必须与 <info> 配对,每个 <search> 中的 LLM 名称必须是路由池中存在的有效名称,等等。

这是一个"入门考试"——如果连输出格式都不对,后面的内容再好也没用。格式不正确直接扣 1 分,格式正确则不奖不罚。这个设计受到 DeepSeek-R1 的启发,实验证明没有格式奖励时训练极不稳定,模型频繁生成无意义的乱码文本。

第二层:最终结果奖励(Outcome Reward)

$$\mathbf{R}_{\text{outcome}} = \mathbf{EM}(y_a, g_t)$$

结果奖励基于精确匹配(Exact Match, EM)——如果模型输出的最终答案与标准答案完全匹配,得 1 分,否则得 0 分。这是最核心的信号:回答对了就奖励,回答错了就不奖励。

第三层:成本奖励(Cost Reward)

$$\mathbf{R}_{\text{cost}} \propto -m(P_{\text{LLM}}) \cdot T_{\text{out}}$$

成本奖励是本文的一大创新。它将调用 LLM 的计算成本纳入考量——调用的模型越大、生成的 token 越多,成本越高,奖励越低。具体来说,成本奖励与"模型参数量 × 输出 token 数 × 每 token 定价"成反比。

为了让成本奖励在训练中稳定,作者使用了滑动窗口归一化:维护一个最近 1000 个样本的成本缓冲区,用平方根变换压缩极端值,再通过第 5 和第 95 百分位进行缩放。最终奖励被反转——低成本得高分,高成本低分。

分层奖励与总体公式

三个奖励按优先级组合:

$$r_\phi(x,y) = \mathbf{R}_{\text{format}} + (1-\alpha)\mathbf{R}_{\text{outcome}} + \alpha\mathbf{R}_{\text{cost}}$$

其中 α 是控制性能-成本平衡的超参数。α=0 时完全追求性能,α 越大越注重节省成本。

关键设计:分层奖励机制(Hierarchical Reward)。如果格式不正确(R_format = -1),那么结果奖励和成本奖励直接被置零。这避免了"格式错了但碰巧答案对了"的奖励作弊(Reward Hacking)问题——先保证格式正确,再追求答案正确和成本节约。

4.4 训练流程

Router-R1 的训练流程可以概括为以下步骤:

  1. 数据准备:从 Natural Questions(NQ)和 HotpotQA 两个数据集各取 7000 个样本,组成 14000 个训练样本
  2. 基座模型选择:使用 Qwen2.5-3B-Instruct 或 LLaMA-3.2-3B-Instruct 作为路由器的基座模型
  3. 路由池配置:选择 6 个候选 LLM(从 7B 到 70B 不等的各类开源模型)
  4. PPO 训练:使用 veRL 框架进行策略优化,批次大小 64,最多 225 步
  5. 多轮交互:训练过程中,模型通过 API 调用候选 LLM,将响应插入生成序列,形成真实的交互体验

一个重要的技术细节是:外部 LLM 的回答(<info> 标签内的内容)被排除在损失计算之外。这是为了防止路由器"记住"特定 LLM 的输出内容,而专注于学习路由策略本身。

4.5 泛化到未见模型的设计

Router-R1 的一个重要特性是能够泛化到训练时未见过的新 LLM。这得益于两个设计:

  1. 基于描述符的条件化:路由决策基于简单的文本描述(如"擅长中文、数学、推理,128K 上下文"),而非模型的 embedding 或 ID。当有新模型加入时,只需提供类似的描述即可
  2. RL 学到的通用策略:强化学习让模型学到了"什么样的能力描述适合回答什么样的子问题"这种通用规律,而不是记住"模型 X 适合回答问题 Y"这种具体映射

实验验证了这一点:在路由池中加入训练时从未见过的 Palmyra-Creative-122B 和 LLaMA3-ChatQA-1.5-8B 后,Router-R1 无需重新训练就能有效利用这些新模型,甚至在某些数据集上性能还有微幅提升。


五、必要知识反推

假设让一个完全没有相关知识的人从零开始完成 Router-R1 这项工作,他/她必须掌握以下知识和信息:

5.1 领域知识层

知识点为什么需要掌握深度
大语言模型的基本原理和能力边界理解不同 LLM 的能力差异是路由的前提知道不同规模模型的性能-成本权衡
LLM API 服务的定价模型设计成本奖励函数需要了解实际成本结构理解每 token 定价和模型参数量的关系
问答任务的评估方法需要定义奖励信号来判断回答质量掌握 EM 和 F1 评估指标的计算方式
多跳推理(Multi-hop Reasoning)核心应用场景,理解为什么需要多轮路由理解多跳 QA 的链式推理结构

5.2 技术方法层

知识点为什么需要掌握深度
强化学习基础(策略梯度、PPO)核心训练算法理解策略优化的目标和 KL 约束的作用
序列决策过程(MDP)问题建模框架能将路由问题映射为状态-动作-奖励的形式
LLM 提示工程设计训练提示模板理解如何用提示引导 LLM 的行为模式
奖励设计原则设计有效的奖励函数理解分层奖励、奖励作弊(Reward Hacking)等概念
KL 散度与正则化理解训练稳定性机制知道为什么需要约束策略更新幅度

5.3 工程实现层

知识点为什么需要
veRL 或类似 RL 训练框架工程实现
vLLM 推理加速高效的模型推理
LLM API 调用与集成实现路由池中多模型的实际调用
数据集处理与评估流程准备训练数据和评估实验

5.4 知识融合路径

这些知识点并非孤立存在,完成 Router-R1 需要将它们按照特定路径融合:

第一步:领域理解
  LLM 能力差异 + 多跳推理需求 → 识别"多轮路由"的研究空白

第二步:问题建模
  序列决策过程 + 强化学习基础 → 将路由抽象为序贯决策问题
  + LLM 作为通用推理器 → 将路由器本身实例化为 LLM

第三步:方法设计
  提示工程 → 设计 Think/Route 动作模板和模型描述符
  奖励设计原则 + LLM 定价知识 → 三层分层奖励(格式+结果+成本)

第四步:工程实现
  veRL + PPO + vLLM + API 集成 → 完整的训练-评估流水线

第五步:实验验证
  QA 评估方法 + 数据集知识 → 7 个基准上的全面评估

这条融合路径的关键洞察在于:将强化学习推理(如 DeepSeek-R1 的思维链训练)的工具使用范式从"调用搜索引擎"泛化为"调用不同 LLM"。看似只换了一个"工具",实际上需要重新设计整个交互框架——因为不同 LLM 的能力差异远比搜索引擎的搜索结果更加异质和复杂。


六、论文中可以提取的通用性灵感

灵感一:将"一次性决策"升级为"序贯决策"

Router-R1 最根本的洞察是:许多看似只需要一次选择的任务,其实可以通过多次迭代决策获得更好的结果。

这种思路的适用范围远超 LLM 路由:

  • 医疗诊断:不是一次性选择一个检查项目,而是根据每次检查结果动态决定下一步检查什么
  • 推荐系统:不是一次性推荐一个物品,而是通过多轮交互逐步理解用户偏好
  • 软件测试:不是一次性设计测试方案,而是根据每次测试的结果决定下一步测试什么
  • 教育系统:不是一次性推荐学习内容,而是根据学生的反应动态调整教学策略

通用原则:当任务涉及多种异质资源且信息具有渐进累积特性时,将一次性决策升级为序贯决策往往能显著提升效果。

灵感二:用简单的描述符实现零样本泛化

Router-R1 通过简单的文本描述符(而非复杂的 embedding 或 ID 映射)实现了对新模型的零样本泛化。这个设计揭示了一个重要原则:当需要泛化到新的实例时,用自然语言描述能力比用数值编码更灵活。

这种"描述符驱动"的泛化策略可以推广到:

  • 新员工入职:不需要重新培训团队,只需给团队一份新人的"能力简历"
  • 新工具集成:不需要重新训练 Agent,只需提供工具的功能描述
  • 新供应商评估:不需要从头建模,基于标准化的能力描述即可做出初步判断

通用原则:将决策条件基于可自然扩展的语义描述(而非固定的枚举或 embedding),是实现零样本泛化的有效策略。

灵感三:分层奖励机制防止奖励作弊

Router-R1 的分层奖励设计——格式优先、结果其次、成本最后——有效防止了奖励作弊。这是一个普遍适用的奖励工程原则:当多个优化目标存在优先级关系时,低优先级目标的奖励应该以高优先级目标的满足为前提条件。

这类似于:

  • 自动驾驶:安全约束(不碰撞)优先于舒适度约束(不急刹),后者以前者满足为前提
  • 代码生成:语法正确优先于功能正确,功能正确优先于性能优化
  • 产品设计:满足基本需求优先于用户体验优化,用户体验优先于锦上添花

通用原则:多目标优化中,用分层条件(而非简单加权)来处理有优先级的约束,可以有效避免"钻空子"行为。

灵感四:成本感知的涌现策略

一个令人惊喜的实验发现是:当引入成本奖励后,Router-R1 自发涌现出了一种"先小后大"的路由策略——先尝试用小模型(便宜但能力有限),只有在小模型无法提供足够信息时才升级到大模型(昂贵但能力强)。

这种涌现行为没有被显式编程,而是完全通过 RL 训练自然习得的。这启示我们:精心设计的奖励信号可以引导出比显式规则更灵活的策略。在实际应用中,与其手写复杂的调度规则(如"简单问题用小模型,复杂问题用大模型"),不如定义好目标函数(性能好 + 成本低),让系统自己发现最优策略。

通用原则:在复杂决策问题中,通过奖励设计引导涌现策略,往往比手工编码规则更具适应性和鲁棒性。

灵感五:自适应的任务难度评估

实验显示,Router-R1 在多跳 QA 数据集上的平均 API 调用次数显著多于通用 QA 数据集——这意味着它能够自适应地评估任务难度,并据此调整路由轮次。简单问题可能 1-2 轮就够了,复杂问题则用满 4 轮。

这种"按需投入"的策略在许多场景都适用:

  • 客服系统:简单问题自助解决,复杂问题转人工
  • 计算资源分配:简单计算用 CPU,复杂计算用 GPU 集群
  • 代码审查:小改动快速审核,大改动深度审查

通用原则:让系统学会根据任务难度自适应调整资源投入,而非使用固定的"一刀切"策略,是实现效率与质量平衡的关键。


实验结果速览

主要结果

在 7 个 QA 基准测试上,Router-R1 取得了显著优于所有基线的表现:

方法基座模型平均 EM
Largest LLM(始终选最大模型)Qwen2.5-3B0.338
RouteLLM 系列Qwen2.5-3B0.265-0.314
GraphRouterQwen2.5-3B0.297
Search-R1Qwen2.5-3B0.291
Router-R1-QwenQwen2.5-3B0.416
Router-R1-LlamaLLaMA-3.2-3B0.409

相比最强的传统路由基线(Prompt LLM,EM=0.338),Router-R1-Qwen 提升了 23% 的相对精度。

成本-性能权衡

通过调节成本系数 α,Router-R1 能够有效控制成本:

α 值平均 EM相对成本
0.0(纯性能)0.416基准
0.60.389-20%
0.70.272-80%
0.90.229-96%

α=0.6 时仅牺牲 6.5% 的性能就降低了 20% 的成本,展现了良好的 Pareto 前沿。

泛化能力

在路由池扩展(加入 2 个训练时未见过的新模型)后,Router-R1 的平均 EM 从 0.458 提升到 0.463,证明了其强大的零样本泛化能力。


总结

Router-R1 是 LLM 路由领域的一次范式跃迁——从"一次性分派"到"多轮会诊",从"分类器做路由"到"LLM 做路由",从"只看性能"到"性能-成本联合优化"。它巧妙地将强化学习推理的最新成果(DeepSeek-R1 的格式奖励、Search-R1 的交互范式)与 LLM 路由的实际需求相结合,用简洁的奖励设计和清晰的训练范式实现了显著的性能提升。

更重要的是,Router-R1 揭示的多个通用性原则——序贯决策优于一次性决策、描述符驱动泛化、分层奖励防作弊、奖励引导涌现策略、自适应难度评估——都有着超越 LLM 路由本身的普适价值。