论文链接:The Router Within: Eliciting Native Skill Routing from a Frozen LLM 发表时间:2026年9月 机构:独立研究团队 领域标签:cs.CL / Skill Routing / Interpretability
一、论文背景
Skill 路由问题:Agent 拥有一个技能库(几十到几百个 skill),收到任务时需要决定加载哪个。这是 skill 系统的"总机"——路由错了一切白搭。
两种现行方案各有硬伤:
- 预加载式(harness 把所有 skill 的元数据塞进上下文):注意力被大量无关元数据稀释;上下文窗口物理上限制了库规模(几百技能的描述就能吃掉数万 token);SkillSeam(同日)的实验从成本侧印证——loaded-skill tokens 的膨胀是集合结构病的第一症状。
- 检索式(用向量检索把选择移到上下文之外):库规模解放了,但选择与模型自身的判断脱钩——检索器觉得相关≠模型知道自己擅长用哪个。
本文的激进假设:模型自己"心里有数"——冻结 LLM 处理任务时,其前向传播的中间层表征已经隐式包含了"该用哪个技能"的信号,只是没人把它读出来。
二、论文定位和关联工作
| 研究脉络 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| 检索式 skill 选择 | 向量检索 + reranker | 语义相似度选技能 | 选择器在模型外部 |
| 探针读出研究 | linear probe 系(Elhage 等) | 中间层线性可读出属性 | 方法论来源,用于路由是新应用 |
| 模型内部状态利用 | Agent Confidence(内部表征预测成败)等 | 前向状态携带元认知信息 | 同日互证:内部信号可利用 |
| Attention routing | Meta 的 skill routing 研究 | 注意力模式做路由 | 机制不同 |
| Mid-layer 表征研究 | LLM 中层线性表征研究 | 中层信息最丰富 | 理论支撑 |
定位结论:Gavel 是"可解释性探针技术 × skill 路由工程"的交叉产物——把 interpretability 社区的"线性读出"工具变成生产级路由器,路由从外部组件变成模型的"内生能力"。
三、问题定义
具体场景:Agent + 大技能库,任务到达时零 skill 文本入上下文完成全库打分路由。
抽象问题:技能选择的判别信息是否已经存在于冻结模型的前向计算中,若存在,最小参数量的读出机制是什么。
形式化:任务 t 经冻结模型得中间层状态 h_task;技能 s_i 经同模型得 h_skill(离线预计算入 bank);训练两个线性映射 W_g(glance)与 W_v(verdict),使 score(t, s_i) = f(W·h_task, W·h_skill) 与最优技能选择对齐。约束:主模型参数冻结、skill 文本不进入推理上下文。
精妙之处:把"路由"从生成问题变成表征对齐问题——模型见过任务和技能描述后的内部状态已经是高维语义坐标,路由只需在这个坐标系里算距离/打分,无需让模型"读一遍所有技能"。
四、问题解法
两步读出(Glance And Verdict):
① Glance(一瞥):任务文本与每个技能的描述分别过冻结模型的中间层(如第 16/32 层类位置),投影到共享的低维"路由空间"。技能侧的表征离线预计算存入 per-skill bank(每技能一组紧凑表征)——库越大这一步的摊销收益越高。
② Verdict(裁决):任务表征对全库 bank 打分(点积/相似度类运算),输出路由决策。两个线性映射是唯一被训练的参数——参数量在万级以下,训练只需路由标签数据。
运行时成本结构:任务侧一次前向(本来就要做)+ 线性打分(毫秒级)+ 零 skill 文本 token。对比预加载式:每任务节省整个技能目录的 token;对比检索式:无需独立检索器与模型判断的失配。
五、评估指标与实验证据
| 维度 | 设计 | 结果 | 证明什么 |
|---|---|---|---|
| 路由可行性 | 无 skill 文本入上下文的全库打分 | 路由决策达到可用精度(详见原文实验节) | 内生信号存在且可读出 |
| 消融:层选择 | 不同中间层表征 | mid-layer 最优 | 中层信息密度论成立 |
| 消融:参数量 | 仅两线性映射 | 充分 | 判别信息是线性可读的 |
| 库规模 | 全库打分 vs 预加载受窗口限 | 库规模不再受上下文约束 | 扩展性优势 |
证明力分析:线性映射就够是最有信息量的结果——如果需要 MLP 或微调才能路由,说明信号不是"现成可读"的;线性可读意味着判别信息在前向计算中以近似线性子空间存在,这既支持"模型已经知道"的解释,也保证读出器的泛化(线性头不易过拟合)。mid-layer 消融与表征研究的共识(中层=语义抽象完成、任务特化未过度)一致。
六、效果优势的根源解释
根源机制与证据链
- 判别信息的预存在(论文实验已支持):预训练与后训练中模型见过海量"任务-方法"配对文本,“什么问题用什么方法解"的知识已编码;路由只需读出无需新学 → 体现在线性读出即达可用精度。
- 共享语义坐标系(论文实验已支持):任务与技能经同一冻结模型编码,两者的表征天然对齐在同一坐标系——这是外部检索器(独立编码器)不具备的结构优势:检索器坐标系里"相关"与模型坐标系里"会用"可以脱节。
- 注意力预算的释放(机制推理,与 SkillSeam 证据互证):预加载式让模型注意力在 N 个技能描述间分配,N 大时路由相关信息被稀释;Gavel 把打分移到表征空间,注意力全部留给任务本身。
相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| Linear probe 可解释性 | 中间层线性读出属性 | 表征线性可分解 | 理论基础 | 支持:读出机制有先例 |
| Agent Confidence(9/11 精读) | 内部表征预测执行成败 | 前向状态携带元认知 | 成败预测非路由 | 支持:内部信号可工程化 |
| Meta skill routing(attention) | 注意力模式路由 | 内生路由可行 | 需 attention 访问,Gavel 只需表征 | 支持:内生路由多路径印证 |
| SkillSeam(同日) | 集合结构审计 | 预加载成本病证据 | 成本侧 | 支持:预加载式的痛点实证 |
| Embedding 检索系 | 向量检索选技能 | 外部检索有效 | 坐标系与模型脱节 | 对照:本文对齐优势 |
综合判断与未决问题
多研究共同支持:内部表征携带可读出的任务相关信息(probe 文献 + Agent Confidence + attention routing);预加载式的成本病(SkillSeam +64% token 证据)。仍属推测:路由信号在"技能从未在训练数据中出现过"的全新技能上的表现——bank 表征可以离线算,但模型对新技能的"会用感"是否可靠(论文评测未覆盖零样本新技能的细粒度分析)。适用边界:需要白盒访问中间层(闭源 API 模型不可用);技能库极小时预加载的简单性可能优于读出器的工程复杂度。可能的失效条件:任务表述与技能描述风格差异极大时,共享坐标系的对齐假设削弱。
七、必要知识反推
领域知识层:skill 系统的路由失效模式(误触发、双重加载——SkillSeam 的接缝分类);transformer 各层的功能分化(早期=表面特征、中层=语义抽象、后期=任务特化)。
方法论知识层:线性探针方法(训练数据构造——路由标签从哪来:执行成功记录或人工标注);度量学习基础(共享空间中的打分函数设计);离线-在线计算分离的工程模式(bank 预计算)。
工程知识层:中间层表征的提取与缓存(batch 推理的性能优化);线性头的小样本训练(防过拟合的正则);路由决策的校准(分数到置信度的映射,支持 abstain)。
知识融合关键节点:“把探针从分析工具变成生产组件"需要同时理解 interpretability 的读出技术与路由系统的延迟/精度要求——分析场景里探针精度 80% 就有发表价值,生产场景需要校准、abstain、bank 更新策略等一整套配套,两个视角的融合决定了 Gavel 的工程形态。
八、通用性灵感
- 能力先于读出:模型(或组织)已具备的隐式判断力,往往只需要一个极小的"读出接口"就能变成可用的显式决策(论文证据:两线性映射即成路由器)。推广:企业内资深员工的隐性经验→轻量结构化访谈即可显式化为决策规则;用户行为数据中的隐式偏好→简单读出层即可产品化。
- 同源编码保证对齐:比较两样东西时让它们经过同一个"认知系统"编码,天然对齐坐标系(论文证据:任务与技能同模型编码后打分)。推广:跨部门协作中统一术语体系(同一编码器);多源数据融合前的一致性嵌入。
- 离线预计算+在线轻查:把库侧的昂贵计算全部预计算成紧凑 bank,在线只做轻量打分(论文证据:per-skill bank 设计)。推广:推荐系统的物品向量、编译器的查找表——经典模式在 Agent 路由的再应用。
- 上下文预算是稀缺资源:任何"把信息塞进上下文"的设计都要计税——表征空间的预计算是免税通道(论文证据:零 skill 文本入上下文)。推广:长上下文的分层架构(常驻核心+按需唤入)。