Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning 精读

深度精读 UIUC NeurIPS 2025 论文——首次将 LLM 模型路由从单轮一对一映射升级为多轮序贯决策过程。Router-R1 将路由器本身实例化为 LLM,通过强化学习训练其交替执行’思考’和’路由’动作,动态整合多个 LLM 的互补优势。在 7 个 QA 基准上平均 EM 达到 0.416,超越 RouteLLM、GraphRouter、FrugalGPT 等 14 种基线方法,同时通过成本奖励实现性能-成本 Pareto 优化。

May 27, 2026 · 4 min