论文链接:The Router Within: Eliciting Native Skill Routing from a Frozen LLM 发表时间:2026年9月 机构:独立研究团队 领域标签:cs.CL / Skill Routing / Interpretability

一、论文背景

Skill 路由问题:Agent 拥有一个技能库(几十到几百个 skill),收到任务时需要决定加载哪个。这是 skill 系统的"总机"——路由错了一切白搭。

两种现行方案各有硬伤:

  • 预加载式(harness 把所有 skill 的元数据塞进上下文):注意力被大量无关元数据稀释;上下文窗口物理上限制了库规模(几百技能的描述就能吃掉数万 token);SkillSeam(同日)的实验从成本侧印证——loaded-skill tokens 的膨胀是集合结构病的第一症状。
  • 检索式(用向量检索把选择移到上下文之外):库规模解放了,但选择与模型自身的判断脱钩——检索器觉得相关≠模型知道自己擅长用哪个。

本文的激进假设:模型自己"心里有数"——冻结 LLM 处理任务时,其前向传播的中间层表征已经隐式包含了"该用哪个技能"的信号,只是没人把它读出来。

二、论文定位和关联工作

研究脉络代表工作核心思想与本文关键区别
检索式 skill 选择向量检索 + reranker语义相似度选技能选择器在模型外部
探针读出研究linear probe 系(Elhage 等)中间层线性可读出属性方法论来源,用于路由是新应用
模型内部状态利用Agent Confidence(内部表征预测成败)等前向状态携带元认知信息同日互证:内部信号可利用
Attention routingMeta 的 skill routing 研究注意力模式做路由机制不同
Mid-layer 表征研究LLM 中层线性表征研究中层信息最丰富理论支撑

定位结论:Gavel 是"可解释性探针技术 × skill 路由工程"的交叉产物——把 interpretability 社区的"线性读出"工具变成生产级路由器,路由从外部组件变成模型的"内生能力"。

三、问题定义

具体场景:Agent + 大技能库,任务到达时零 skill 文本入上下文完成全库打分路由。

抽象问题:技能选择的判别信息是否已经存在于冻结模型的前向计算中,若存在,最小参数量的读出机制是什么。

形式化:任务 t 经冻结模型得中间层状态 h_task;技能 s_i 经同模型得 h_skill(离线预计算入 bank);训练两个线性映射 W_g(glance)与 W_v(verdict),使 score(t, s_i) = f(W·h_task, W·h_skill) 与最优技能选择对齐。约束:主模型参数冻结、skill 文本不进入推理上下文。

精妙之处:把"路由"从生成问题变成表征对齐问题——模型见过任务和技能描述后的内部状态已经是高维语义坐标,路由只需在这个坐标系里算距离/打分,无需让模型"读一遍所有技能"。

四、问题解法

两步读出(Glance And Verdict):

① Glance(一瞥):任务文本与每个技能的描述分别过冻结模型的中间层(如第 16/32 层类位置),投影到共享的低维"路由空间"。技能侧的表征离线预计算存入 per-skill bank(每技能一组紧凑表征)——库越大这一步的摊销收益越高。

② Verdict(裁决):任务表征对全库 bank 打分(点积/相似度类运算),输出路由决策。两个线性映射是唯一被训练的参数——参数量在万级以下,训练只需路由标签数据。

运行时成本结构:任务侧一次前向(本来就要做)+ 线性打分(毫秒级)+ 零 skill 文本 token。对比预加载式:每任务节省整个技能目录的 token;对比检索式:无需独立检索器与模型判断的失配。

五、评估指标与实验证据

维度设计结果证明什么
路由可行性无 skill 文本入上下文的全库打分路由决策达到可用精度(详见原文实验节)内生信号存在且可读出
消融:层选择不同中间层表征mid-layer 最优中层信息密度论成立
消融:参数量仅两线性映射充分判别信息是线性可读的
库规模全库打分 vs 预加载受窗口限库规模不再受上下文约束扩展性优势

证明力分析:线性映射就够是最有信息量的结果——如果需要 MLP 或微调才能路由,说明信号不是"现成可读"的;线性可读意味着判别信息在前向计算中以近似线性子空间存在,这既支持"模型已经知道"的解释,也保证读出器的泛化(线性头不易过拟合)。mid-layer 消融与表征研究的共识(中层=语义抽象完成、任务特化未过度)一致。

六、效果优势的根源解释

根源机制与证据链

  1. 判别信息的预存在(论文实验已支持):预训练与后训练中模型见过海量"任务-方法"配对文本,“什么问题用什么方法解"的知识已编码;路由只需读出无需新学 → 体现在线性读出即达可用精度。
  2. 共享语义坐标系(论文实验已支持):任务与技能经同一冻结模型编码,两者的表征天然对齐在同一坐标系——这是外部检索器(独立编码器)不具备的结构优势:检索器坐标系里"相关"与模型坐标系里"会用"可以脱节。
  3. 注意力预算的释放(机制推理,与 SkillSeam 证据互证):预加载式让模型注意力在 N 个技能描述间分配,N 大时路由相关信息被稀释;Gavel 把打分移到表征空间,注意力全部留给任务本身。

相关工作检索与对照

研究相似尝试相关结论与本文差异影响
Linear probe 可解释性中间层线性读出属性表征线性可分解理论基础支持:读出机制有先例
Agent Confidence(9/11 精读)内部表征预测执行成败前向状态携带元认知成败预测非路由支持:内部信号可工程化
Meta skill routing(attention)注意力模式路由内生路由可行需 attention 访问,Gavel 只需表征支持:内生路由多路径印证
SkillSeam(同日)集合结构审计预加载成本病证据成本侧支持:预加载式的痛点实证
Embedding 检索系向量检索选技能外部检索有效坐标系与模型脱节对照:本文对齐优势

综合判断与未决问题

多研究共同支持:内部表征携带可读出的任务相关信息(probe 文献 + Agent Confidence + attention routing);预加载式的成本病(SkillSeam +64% token 证据)。仍属推测:路由信号在"技能从未在训练数据中出现过"的全新技能上的表现——bank 表征可以离线算,但模型对新技能的"会用感"是否可靠(论文评测未覆盖零样本新技能的细粒度分析)。适用边界:需要白盒访问中间层(闭源 API 模型不可用);技能库极小时预加载的简单性可能优于读出器的工程复杂度。可能的失效条件:任务表述与技能描述风格差异极大时,共享坐标系的对齐假设削弱。

七、必要知识反推

领域知识层:skill 系统的路由失效模式(误触发、双重加载——SkillSeam 的接缝分类);transformer 各层的功能分化(早期=表面特征、中层=语义抽象、后期=任务特化)。

方法论知识层:线性探针方法(训练数据构造——路由标签从哪来:执行成功记录或人工标注);度量学习基础(共享空间中的打分函数设计);离线-在线计算分离的工程模式(bank 预计算)。

工程知识层:中间层表征的提取与缓存(batch 推理的性能优化);线性头的小样本训练(防过拟合的正则);路由决策的校准(分数到置信度的映射,支持 abstain)。

知识融合关键节点:“把探针从分析工具变成生产组件"需要同时理解 interpretability 的读出技术与路由系统的延迟/精度要求——分析场景里探针精度 80% 就有发表价值,生产场景需要校准、abstain、bank 更新策略等一整套配套,两个视角的融合决定了 Gavel 的工程形态。

八、通用性灵感

  1. 能力先于读出:模型(或组织)已具备的隐式判断力,往往只需要一个极小的"读出接口"就能变成可用的显式决策(论文证据:两线性映射即成路由器)。推广:企业内资深员工的隐性经验→轻量结构化访谈即可显式化为决策规则;用户行为数据中的隐式偏好→简单读出层即可产品化。
  2. 同源编码保证对齐:比较两样东西时让它们经过同一个"认知系统"编码,天然对齐坐标系(论文证据:任务与技能同模型编码后打分)。推广:跨部门协作中统一术语体系(同一编码器);多源数据融合前的一致性嵌入。
  3. 离线预计算+在线轻查:把库侧的昂贵计算全部预计算成紧凑 bank,在线只做轻量打分(论文证据:per-skill bank 设计)。推广:推荐系统的物品向量、编译器的查找表——经典模式在 Agent 路由的再应用。
  4. 上下文预算是稀缺资源:任何"把信息塞进上下文"的设计都要计税——表征空间的预计算是免税通道(论文证据:零 skill 文本入上下文)。推广:长上下文的分层架构(常驻核心+按需唤入)。