论文链接:https://arxiv.org/abs/2506.09033
发表机构:伊利诺伊大学厄巴纳-香槟分校(UIUC)U Lab
作者:Haozhen Zhang, Tao Feng, Jiaxuan You
发表会议:NeurIPS 2025(已接收)
开源代码:https://github.com/ulab-uiuc/Router-R1
模型与数据集:HuggingFace Collection
一、论文背景
1.1 大模型生态的"选择困难症"
如今的大语言模型(LLM)已经多到令人眼花缭乱——GPT-4、Claude、Gemini、Qwen、LLaMA、Mistral、Mixtral……每个月都有新的模型或微调版本发布。这些模型各有所长:有的擅长数学推理,有的在代码生成上表现出色,有的中英文双语能力强,有的则在事实性问答上更加准确。
这就带来了一个非常实际的问题:面对一个具体的用户请求,应该用哪个模型来回答?
用最强大但最昂贵的模型(如 GPT-4 级别)来回答所有问题?这就像用大炮打蚊子——资源浪费严重。用一个轻量但能力有限的小模型来回答所有问题?复杂问题可能答不好。理想的做法是因题制宜——简单问题让小模型快速搞定,复杂问题再请大模型出马。
1.2 LLM 路由器:模型的"调度员"
为了解决这个问题,研究者们开发了 LLM 路由器(LLM Router)。简单来说,LLM 路由器就是一个"调度员",它的职责是根据用户提问的特征,自动选择最合适的 LLM 来处理。
打个比方,LLM 路由器就像医院的分诊台:来了一位病人(用户提问),分诊护士(路由器)会快速判断这个症状应该挂什么科(选择哪个模型),然后指引病人去对应的诊室。
目前主流的 LLM 路由器工作模式是 “单轮一对一映射”:
- 输入:用户的一个问题
- 路由决策:路由器根据问题特征,一次性选择一个最合适的 LLM
- 输出:被选中 LLM 的回答
这种模式的代表工作包括:
| 方法 | 核心思路 | 来源 |
|---|---|---|
| RouteLLM | 利用人类偏好数据训练路由器,在强弱模型间动态选择 | UC Berkeley, 2024 |
| FrugalGPT | 采用 LLM 级联策略,按顺序尝试模型,平衡性能和成本 | Stanford, 2023 |
| GraphRouter | 将路由问题建模为图上的边预测任务,利用图神经网络 | UIUC, 2024 |
| RouterDC | 通过查询和 LLM 嵌入之间的双对比学习进行路由 | 2024 |
1.3 单轮路由的瓶颈:复杂任务需要"集思广益"
然而,单轮一对一映射存在一个根本性的局限:真正复杂的任务往往需要多个模型的互补优势,而不是只依赖一个模型。
举一个具体例子:假设用户问"电影《盗梦空间》和《星际穿越》中,哪部电影的上映时间更早?其导演出生在哪个城市?"
这个问题需要多步推理:
- 查到《盗梦空间》的上映时间
- 查到《星际穿越》的上映时间
- 比较两者,确定更早的那部
- 查到该电影导演(克里斯托弗·诺兰)的出生城市
在单轮路由模式下,路由器只能选择一个模型来回答这整个问题。但不同模型在不同子任务上的能力可能不同——模型 A 擅长电影知识,模型 B 擅长人物传记,模型 C 擅长逻辑推理。如果能让路由器分步调用不同模型的专长,效果会好得多。
这就引出了本文要解决的核心问题:如何让路由器在多轮交互中协调多个 LLM,通过多次调用和结果聚合来共同解决复杂任务?
1.4 解决这个问题的两大挑战
作者指出,将路由从"单轮一对一"升级为"多轮多模型协调"面临两个关键挑战:
挑战一:离散决策过程的不可微性。 选择调用哪个 LLM 是一个离散决策(选或不选),不像神经网络的连续权重那样可以通过反向传播来优化。虽然之前有工作用基于梯度的方法做单次路由,但扩展到多轮选择和聚合后,梯度优化的路径就被完全阻断了。
挑战二:现有路由器的单步操作局限。 传统路由器的逻辑是"选模型→获取回答→结束"。但复杂任务需要一系列交替的推理和模型选择决策——先想一想需要什么信息,选择合适的模型查询,拿到结果后继续推理,再决定是否需要调用另一个模型……这种"思考-路由-思考-路由"的循环是传统路由器完全不具备的能力。
二、论文定位与关联工作
2.1 在 LLM 路由领域的定位
Router-R1 处于 LLM 路由研究的前沿位置,它是对现有路由范式的一次根本性升级:
路由范式演进:
单模型部署 → 单轮单模型路由 → 单轮多模型选择 → ★多轮多模型路由与聚合(Router-R1)
在 Router-R1 之前,LLM 路由器的工作基本都停留在"单轮"阶段。RouteLLM(2024)虽然开创性地利用人类偏好数据训练路由器,但只做一次选择;GraphRouter(2024)将路由建模为图预测问题,但仍然是一对一映射;FrugalGPT(2023)提出了级联策略,按顺序尝试多个模型直到获得满意答案,但本质上是"串行试错"而非"智能调度"。
Router-R1 的独特定位在于:它是第一个将 LLM 路由建模为多轮序贯决策过程的工作,路由器不再是简单的"分诊护士",而更像一个"会诊协调专家"——它能够思考、选择、整合、再思考,循环往复直到得出最佳答案。
2.2 从强化学习推理领域的借鉴
Router-R1 的方法论直接受益于近期两项重要的强化学习推理工作:
DeepSeek-R1(2025):这篇登上 Nature 封面的论文证明了纯强化学习(不需要监督数据)就足以激发 LLM 的推理能力。DeepSeek-R1 使用 GRPO(Group Relative Policy Optimization)算法,让模型在试错中学会"思维链"(Chain of Thought)推理。Router-R1 借鉴了 DeepSeek-R1 的格式奖励设计——通过规则约束确保模型输出符合预定格式,这一设计被证明对训练稳定性至关重要。
Search-R1(2025):韩家炜团队的工作将搜索引擎纳入强化学习框架,让 LLM 学会在推理过程中自主调用搜索引擎获取信息。Router-R1 借鉴了这种"思考-搜索-整合"的交互范式,但将搜索引擎替换为多个异构 LLM——每个 LLM 就像一个具有不同专长的"顾问",路由器学会在合适的时机咨询合适的顾问。
2.3 技术栈与基础
Router-R1 的技术基础可以梳理如下:
| 基础工作 | 对 Router-R1 的贡献 |
|---|---|
| PPO/GRPO 策略优化算法 | Router-R1 采用的核心训练算法 |
| DeepSeek-R1 的格式奖励 | 训练稳定性的关键保障 |
| Search-R1 的交互范式 | 思考-路由-整合的多轮交互模式 |
| veRL 训练框架 | 实际训练使用的工程框架 |
| Qwen2.5 / LLaMA-3.2 | 作为路由器基座模型的选项 |
值得注意的是,Router-R1 和 GraphRouter 都来自 UIUC 的 U Lab(Jiaxuan You 教授课题组),这说明该团队在 LLM 路由领域有着系统性的研究布局——从基于图的静态路由(GraphRouter)到基于 RL 的动态多轮路由(Router-R1),再到统一路由框架(LLMRouter)。
三、问题定义
3.1 从"一次性选择"到"序贯决策"的问题抽象
在传统路由框架中,问题被定义为一个分类问题或匹配问题:给定查询 q 和候选模型集合 M,找到最优模型 m* = argmax_{m∈M} Score(q, m)。这是一个单步决策。
Router-R1 将这个问题重新定义为一个序贯决策问题(Sequential Decision Process):
给定一个输入问题 x 和一组候选 LLM 组成的路由池 P,如何训练一个策略 π,使其能够在多个步骤中交替执行"内部推理"和"外部模型调用",动态整合多个 LLM 的输出,最终生成最优答案 y?
这个定义的关键抽象在于:不再将路由视为一次性的"选择"操作,而是视为一系列需要动态规划的"决策"操作。每一步决策都依赖于之前所有步骤的累积信息——包括原始问题、之前的推理过程、以及之前调用过的模型的回答。
3.2 形式化表述
从数学角度,Router-R1 将问题建模为带 KL 正则化的策略优化目标:
其中:
- π 是待优化的策略(即路由器 LLM)
- π_ref 是参考策略(训练过程中保持稳定的基准)
- x 是输入问题,y 是生成的完整输出(包含推理过程和路由调用的交错序列)
- r_φ(x, y) 是奖励函数
- P 是可调用的 LLM 路由池
- β 是 KL 正则化系数,防止策略偏离参考策略太远
这个公式是一个通用框架——它可以涵盖 PPO、GRPO 等各种正则化强化学习算法。Router-R1 在实现中默认使用 PPO。
3.3 核心设计:将路由器本身作为 LLM
一个关键的设计决策是:路由器本身就是一个能力足够强的 LLM,而不是一个简单的分类器或排名模型。
为什么这个设计很重要?因为路由器需要具备三种能力:
- 理解复杂问题:分析用户问题的结构和所需信息
- 评估模型能力:根据问题特点和模型描述判断哪个模型最合适
- 整合多源信息:将不同模型的回答融合成连贯的推理链
只有 LLM 才能同时胜任这三项任务。而传统的路由器(如 KNN、MLP、BERT 分类器)只能做第一步和第二步的某种近似,完全不具备第三步的能力。
四、问题解法
4.1 整体架构:思考-路由-整合的循环
Router-R1 的核心工作机制可以用一个"思考-路由-整合"的循环来概括:
┌──────────────────────────────────────────────┐
│ Router-R1 工作流程 │
│ │
│ 输入问题 ──→ [思考:分析需要什么信息] │
│ ↓ │
│ [路由:选择合适的 LLM] │
│ ↓ │
│ [整合:将 LLM 回答加入上下文] │
│ ↓ │
│ 还有信息缺口? ──是──→ 回到 [思考] │
│ ↓ 否 │
│ [输出最终答案] │
└──────────────────────────────────────────────┘
具体来说,Router-R1 的每次生成过程包含两种类型的"动作":
- Think 动作(
<think >...</think >):路由器进行内部推理,分析当前已有什么信息、还缺什么、下一步该做什么。这个过程对用户不可见,是路由器的"内心独白"。 - Route 动作(
<search >LLM名称: 查询</search >):路由器选择一个具体的 LLM 并向其提出子问题。被选中 LLM 的回答会被包裹在<info>...</info>标签中返回给路由器,成为下一轮推理的上下文。
这个过程最多重复 4 次(论文设定的最大路由步数),之后路由器必须给出最终答案。
4.2 提示模板设计:教会路由器"怎么路由"
为了让 LLM 理解它需要扮演的角色,作者设计了一个精心构造的提示模板(Prompt Template)。这个模板的核心逻辑是:
- 角色定义:告诉模型它是一个"路由器",需要通过推理和调用外部 LLM 来回答问题
- 行动指南:规定模型必须在
<think >中先思考"为什么需要外部信息"和"哪个 LLM 最适合",然后才能发起调用 - 模型描述:提供每个候选 LLM 的简短能力描述(如"擅长中文、数学和推理"或"700 亿参数,擅长复杂推理")
- 探索鼓励:鼓励模型"多次探索和利用不同的 LLM,以了解它们各自的优势和劣势"
一个有趣的设计是:模型描述符(Model Descriptor)是通过 GPT-4o 自动生成的。作者用 GPT-4o 基于公开的模型卡片生成每个 LLM 的标准化简短描述。在训练初期,路由器主要依赖这些描述来做出路由决策;但随着 RL 训练的进行,路由器通过反复尝试和奖励反馈,逐步建立对每个 LLM 真实能力的"经验性认知"——这就好比一个新员工,入职时看的是岗位说明书,工作一段时间后积累的是实战经验。
4.3 奖励设计:三重引导信号
强化学习的核心挑战在于奖励设计——奖励信号决定了模型学什么、怎么学。Router-R1 设计了一个三层奖励机制:
第一层:格式奖励(Format Reward)
格式奖励确保模型的输出符合预定义的结构——例如 <think > 块必须正确开关,<search> 必须与 <info> 配对,每个 <search> 中的 LLM 名称必须是路由池中存在的有效名称,等等。
这是一个"入门考试"——如果连输出格式都不对,后面的内容再好也没用。格式不正确直接扣 1 分,格式正确则不奖不罚。这个设计受到 DeepSeek-R1 的启发,实验证明没有格式奖励时训练极不稳定,模型频繁生成无意义的乱码文本。
第二层:最终结果奖励(Outcome Reward)
结果奖励基于精确匹配(Exact Match, EM)——如果模型输出的最终答案与标准答案完全匹配,得 1 分,否则得 0 分。这是最核心的信号:回答对了就奖励,回答错了就不奖励。
第三层:成本奖励(Cost Reward)
成本奖励是本文的一大创新。它将调用 LLM 的计算成本纳入考量——调用的模型越大、生成的 token 越多,成本越高,奖励越低。具体来说,成本奖励与"模型参数量 × 输出 token 数 × 每 token 定价"成反比。
为了让成本奖励在训练中稳定,作者使用了滑动窗口归一化:维护一个最近 1000 个样本的成本缓冲区,用平方根变换压缩极端值,再通过第 5 和第 95 百分位进行缩放。最终奖励被反转——低成本得高分,高成本低分。
分层奖励与总体公式
三个奖励按优先级组合:
其中 α 是控制性能-成本平衡的超参数。α=0 时完全追求性能,α 越大越注重节省成本。
关键设计:分层奖励机制(Hierarchical Reward)。如果格式不正确(R_format = -1),那么结果奖励和成本奖励直接被置零。这避免了"格式错了但碰巧答案对了"的奖励作弊(Reward Hacking)问题——先保证格式正确,再追求答案正确和成本节约。
4.4 训练流程
Router-R1 的训练流程可以概括为以下步骤:
- 数据准备:从 Natural Questions(NQ)和 HotpotQA 两个数据集各取 7000 个样本,组成 14000 个训练样本
- 基座模型选择:使用 Qwen2.5-3B-Instruct 或 LLaMA-3.2-3B-Instruct 作为路由器的基座模型
- 路由池配置:选择 6 个候选 LLM(从 7B 到 70B 不等的各类开源模型)
- PPO 训练:使用 veRL 框架进行策略优化,批次大小 64,最多 225 步
- 多轮交互:训练过程中,模型通过 API 调用候选 LLM,将响应插入生成序列,形成真实的交互体验
一个重要的技术细节是:外部 LLM 的回答(<info> 标签内的内容)被排除在损失计算之外。这是为了防止路由器"记住"特定 LLM 的输出内容,而专注于学习路由策略本身。
4.5 泛化到未见模型的设计
Router-R1 的一个重要特性是能够泛化到训练时未见过的新 LLM。这得益于两个设计:
- 基于描述符的条件化:路由决策基于简单的文本描述(如"擅长中文、数学、推理,128K 上下文"),而非模型的 embedding 或 ID。当有新模型加入时,只需提供类似的描述即可
- RL 学到的通用策略:强化学习让模型学到了"什么样的能力描述适合回答什么样的子问题"这种通用规律,而不是记住"模型 X 适合回答问题 Y"这种具体映射
实验验证了这一点:在路由池中加入训练时从未见过的 Palmyra-Creative-122B 和 LLaMA3-ChatQA-1.5-8B 后,Router-R1 无需重新训练就能有效利用这些新模型,甚至在某些数据集上性能还有微幅提升。
五、必要知识反推
假设让一个完全没有相关知识的人从零开始完成 Router-R1 这项工作,他/她必须掌握以下知识和信息:
5.1 领域知识层
| 知识点 | 为什么需要 | 掌握深度 |
|---|---|---|
| 大语言模型的基本原理和能力边界 | 理解不同 LLM 的能力差异是路由的前提 | 知道不同规模模型的性能-成本权衡 |
| LLM API 服务的定价模型 | 设计成本奖励函数需要了解实际成本结构 | 理解每 token 定价和模型参数量的关系 |
| 问答任务的评估方法 | 需要定义奖励信号来判断回答质量 | 掌握 EM 和 F1 评估指标的计算方式 |
| 多跳推理(Multi-hop Reasoning) | 核心应用场景,理解为什么需要多轮路由 | 理解多跳 QA 的链式推理结构 |
5.2 技术方法层
| 知识点 | 为什么需要 | 掌握深度 |
|---|---|---|
| 强化学习基础(策略梯度、PPO) | 核心训练算法 | 理解策略优化的目标和 KL 约束的作用 |
| 序列决策过程(MDP) | 问题建模框架 | 能将路由问题映射为状态-动作-奖励的形式 |
| LLM 提示工程 | 设计训练提示模板 | 理解如何用提示引导 LLM 的行为模式 |
| 奖励设计原则 | 设计有效的奖励函数 | 理解分层奖励、奖励作弊(Reward Hacking)等概念 |
| KL 散度与正则化 | 理解训练稳定性机制 | 知道为什么需要约束策略更新幅度 |
5.3 工程实现层
| 知识点 | 为什么需要 |
|---|---|
| veRL 或类似 RL 训练框架 | 工程实现 |
| vLLM 推理加速 | 高效的模型推理 |
| LLM API 调用与集成 | 实现路由池中多模型的实际调用 |
| 数据集处理与评估流程 | 准备训练数据和评估实验 |
5.4 知识融合路径
这些知识点并非孤立存在,完成 Router-R1 需要将它们按照特定路径融合:
第一步:领域理解
LLM 能力差异 + 多跳推理需求 → 识别"多轮路由"的研究空白
第二步:问题建模
序列决策过程 + 强化学习基础 → 将路由抽象为序贯决策问题
+ LLM 作为通用推理器 → 将路由器本身实例化为 LLM
第三步:方法设计
提示工程 → 设计 Think/Route 动作模板和模型描述符
奖励设计原则 + LLM 定价知识 → 三层分层奖励(格式+结果+成本)
第四步:工程实现
veRL + PPO + vLLM + API 集成 → 完整的训练-评估流水线
第五步:实验验证
QA 评估方法 + 数据集知识 → 7 个基准上的全面评估
这条融合路径的关键洞察在于:将强化学习推理(如 DeepSeek-R1 的思维链训练)的工具使用范式从"调用搜索引擎"泛化为"调用不同 LLM"。看似只换了一个"工具",实际上需要重新设计整个交互框架——因为不同 LLM 的能力差异远比搜索引擎的搜索结果更加异质和复杂。
六、论文中可以提取的通用性灵感
灵感一:将"一次性决策"升级为"序贯决策"
Router-R1 最根本的洞察是:许多看似只需要一次选择的任务,其实可以通过多次迭代决策获得更好的结果。
这种思路的适用范围远超 LLM 路由:
- 医疗诊断:不是一次性选择一个检查项目,而是根据每次检查结果动态决定下一步检查什么
- 推荐系统:不是一次性推荐一个物品,而是通过多轮交互逐步理解用户偏好
- 软件测试:不是一次性设计测试方案,而是根据每次测试的结果决定下一步测试什么
- 教育系统:不是一次性推荐学习内容,而是根据学生的反应动态调整教学策略
通用原则:当任务涉及多种异质资源且信息具有渐进累积特性时,将一次性决策升级为序贯决策往往能显著提升效果。
灵感二:用简单的描述符实现零样本泛化
Router-R1 通过简单的文本描述符(而非复杂的 embedding 或 ID 映射)实现了对新模型的零样本泛化。这个设计揭示了一个重要原则:当需要泛化到新的实例时,用自然语言描述能力比用数值编码更灵活。
这种"描述符驱动"的泛化策略可以推广到:
- 新员工入职:不需要重新培训团队,只需给团队一份新人的"能力简历"
- 新工具集成:不需要重新训练 Agent,只需提供工具的功能描述
- 新供应商评估:不需要从头建模,基于标准化的能力描述即可做出初步判断
通用原则:将决策条件基于可自然扩展的语义描述(而非固定的枚举或 embedding),是实现零样本泛化的有效策略。
灵感三:分层奖励机制防止奖励作弊
Router-R1 的分层奖励设计——格式优先、结果其次、成本最后——有效防止了奖励作弊。这是一个普遍适用的奖励工程原则:当多个优化目标存在优先级关系时,低优先级目标的奖励应该以高优先级目标的满足为前提条件。
这类似于:
- 自动驾驶:安全约束(不碰撞)优先于舒适度约束(不急刹),后者以前者满足为前提
- 代码生成:语法正确优先于功能正确,功能正确优先于性能优化
- 产品设计:满足基本需求优先于用户体验优化,用户体验优先于锦上添花
通用原则:多目标优化中,用分层条件(而非简单加权)来处理有优先级的约束,可以有效避免"钻空子"行为。
灵感四:成本感知的涌现策略
一个令人惊喜的实验发现是:当引入成本奖励后,Router-R1 自发涌现出了一种"先小后大"的路由策略——先尝试用小模型(便宜但能力有限),只有在小模型无法提供足够信息时才升级到大模型(昂贵但能力强)。
这种涌现行为没有被显式编程,而是完全通过 RL 训练自然习得的。这启示我们:精心设计的奖励信号可以引导出比显式规则更灵活的策略。在实际应用中,与其手写复杂的调度规则(如"简单问题用小模型,复杂问题用大模型"),不如定义好目标函数(性能好 + 成本低),让系统自己发现最优策略。
通用原则:在复杂决策问题中,通过奖励设计引导涌现策略,往往比手工编码规则更具适应性和鲁棒性。
灵感五:自适应的任务难度评估
实验显示,Router-R1 在多跳 QA 数据集上的平均 API 调用次数显著多于通用 QA 数据集——这意味着它能够自适应地评估任务难度,并据此调整路由轮次。简单问题可能 1-2 轮就够了,复杂问题则用满 4 轮。
这种"按需投入"的策略在许多场景都适用:
- 客服系统:简单问题自助解决,复杂问题转人工
- 计算资源分配:简单计算用 CPU,复杂计算用 GPU 集群
- 代码审查:小改动快速审核,大改动深度审查
通用原则:让系统学会根据任务难度自适应调整资源投入,而非使用固定的"一刀切"策略,是实现效率与质量平衡的关键。
实验结果速览
主要结果
在 7 个 QA 基准测试上,Router-R1 取得了显著优于所有基线的表现:
| 方法 | 基座模型 | 平均 EM |
|---|---|---|
| Largest LLM(始终选最大模型) | Qwen2.5-3B | 0.338 |
| RouteLLM 系列 | Qwen2.5-3B | 0.265-0.314 |
| GraphRouter | Qwen2.5-3B | 0.297 |
| Search-R1 | Qwen2.5-3B | 0.291 |
| Router-R1-Qwen | Qwen2.5-3B | 0.416 |
| Router-R1-Llama | LLaMA-3.2-3B | 0.409 |
相比最强的传统路由基线(Prompt LLM,EM=0.338),Router-R1-Qwen 提升了 23% 的相对精度。
成本-性能权衡
通过调节成本系数 α,Router-R1 能够有效控制成本:
| α 值 | 平均 EM | 相对成本 |
|---|---|---|
| 0.0(纯性能) | 0.416 | 基准 |
| 0.6 | 0.389 | -20% |
| 0.7 | 0.272 | -80% |
| 0.9 | 0.229 | -96% |
α=0.6 时仅牺牲 6.5% 的性能就降低了 20% 的成本,展现了良好的 Pareto 前沿。
泛化能力
在路由池扩展(加入 2 个训练时未见过的新模型)后,Router-R1 的平均 EM 从 0.458 提升到 0.463,证明了其强大的零样本泛化能力。
总结
Router-R1 是 LLM 路由领域的一次范式跃迁——从"一次性分派"到"多轮会诊",从"分类器做路由"到"LLM 做路由",从"只看性能"到"性能-成本联合优化"。它巧妙地将强化学习推理的最新成果(DeepSeek-R1 的格式奖励、Search-R1 的交互范式)与 LLM 路由的实际需求相结合,用简洁的奖励设计和清晰的训练范式实现了显著的性能提升。
更重要的是,Router-R1 揭示的多个通用性原则——序贯决策优于一次性决策、描述符驱动泛化、分层奖励防作弊、奖励引导涌现策略、自适应难度评估——都有着超越 LLM 路由本身的普适价值。