用表示转向连续调节 LLM Agent 的工具调用率 —— 精读
论文链接:https://arxiv.org/abs/2608.25198 代码仓库:https://github.com/YuqiChen4188/Steering-Tool-Use-Propensity 发表时间:2026年8月 机构:UC Santa Cruz(加州大学圣克鲁兹分校)+ UC Berkeley(加州大学伯克利分校,Dawn Song)——纯高校合作 领域标签:cs.AI —— LLM 可解释性 / agent 控制
一、论文背景
1.1 「要不要调用工具」是个昂贵决策
对 LLM agent 来说,「这次要不要调用工具」是核心能力,且两头都是坑:过度调用——每次调用增加延迟、烧钱,动作类工具(发邮件、执行代码)还可能造成不可逆副作用;调用不足——对长尾事实问题凭参数记忆自信作答,答错。现实中两类失败并存:模型对冷门问题不肯搜索,对「12×17」这种心算题却调计算器。
工业界正走向大规模 agentic 部署(论文引用了 NVIDIA 与 OpenAI 的 10GW 基建合作),这些成本是以部署规模、而非实验室规模计的。
1.2 现有方法的僵硬
已有改进路线各有代价:微调(SMART、Self-DC 等)昂贵且推理时无法调整;提示工程粗糙、不可连续调节。可解释性研究此前已证明「选哪个工具」可线性表示并转向(Wu et al. 2026),但留下了更前置的问题:「是否调用任何工具」这个二值决策,是否也有可读、可转向的内部表示? 若有,就能在推理时直接控制 agent 的工具依赖度——不重训、不改提示。
二、论文定位和关联工作
2.1 研究谱系
| 谱系 | 代表工作 | 核心思想 | 与本文区别 |
|---|---|---|---|
| 线性表示假设 | Park et al. 2024;superposition (Elhage 2022) | 概念在权重中线性可解码 | 概念编码于权重;本文概念(工具)由上下文注入 |
| 转向向量 | 拒绝方向 (Arditi 2024)、RepE (Zou 2023)、CCS (Burns 2023) | 对比数据提取方向、加性干预 | 均针对参数化概念;本文转向上下文依赖的离散 agent 决策 |
| 工具选择转向 | Wu et al. 2026:Tool Calling 线性可读 | 转向「选哪个工具」 | 本文解决更前置的「是否调用」 |
| 工具使用时机 | SMART / SMARTCAL / Self-DC | 训练或校准调用策略 | 需训练/任务监督;本文零训练单旋钮双向调节 |
| 何时信任参数记忆 | Mallen et al. 2023 (PopQA) | 按流行度判断是否检索 | 提供了本文的知识选择性度量基础 |
定位结论:本文是首个证明「上下文依赖的离散 agent 决策」可用单一权重空间方向控制的工作,并用端到端成本/精度验证了实用价值。与 Wu et al. 的「工具选择方向」明确解耦:本文方向改变 whether 而不扰动 which。
三、问题定义
具体问题:推理时连续调节一个指令微调模型的工具调用率——既治调用不足(该搜不搜)也治调用过度(不必算偏算)——不改训练、不改提示。
核心洞察:把「是否调用工具」看作残差流中的一个可加性调节的标量倾向。既然模型的工具调用以一个工具专属 token(如 <tool_call>)开头,那么首 token 的 log 概率就是「调用倾向」的干净读数——一次前向传播即可给任意查询打倾向分,无需生成。
| 类比 | 深度学习 | 本文 |
|---|---|---|
| 探测信号 | 探针读 logit | log P(tool_call) 首 token 读数 |
| 提取方向 | contrastive mean-diff | 高/低倾向两组的逐层均值差 |
| 推理干预 | 学习率/温度旋钮 | α·v 加到中层残差流 |
形式化:给定查询集,按 s(q)=log p(t*|x(q)) 排序取头尾分位构成 H/L 两组,v_ℓ = mean(h_ℓ(H)) − mean(h_ℓ(L));推理时 h′_ℓ = h_ℓ + α·v_ℓ,α<0 压制、α>0 诱导。约束:全程零训练、零 prompt 修改、调用保持格式合法。
四、问题解法
4.1 三件套:代理信号 → 方向提取 → 推理干预
- 前向传播倾向代理:多工具 harness(search + calculator + Python,中性系统提示「可用但不必用」)中,所有工具共享同一个开启 token t*,因此 P(t*) 干净地度量「会不会调用任何东西」。部分调用发生在生成中段,故绝对调用率用真实生成测,但层/强度搜索只需批量前向传播——把昂贵的搜索变成一次 batch。
- 多工具环境提取:方向必须在多工具 harness 中提取(而非单工具提示),这样高倾向池是各类问题的近均匀混合,v 捕获的是通用调用倾向而非某一工具的特征。无标签、无梯度、无稀疏自编码器,几千条查询足够。
- 推理时转向:在选定层(Qwen3-4B 为 L22)对每个位置加 α·v。两个投影干预做因果检验:clamping(把投影钳到固定值)应单调移动调用率;directional ablation(彻底删去该分量)应落在钳位曲线的预测位置。
4.2 工具泛化性测试
提取时没见过的六个 held-out 工具(翻译、天气、单位换算、邮件、SQL、股票查询):把多工具方向原样用于这些工具的单工具 harness,与「每个工具自己单独提取的方向」比强度(范数匹配后 α=−2 压制下的 log 概率下降 nats)。
五、评估指标与实验证据
5.1 指标体系
- 调用率(采样生成中发出工具调用 token 的比例)与格式合法性;
- 知识选择性:新增调用落在哪些问题上——用 PopQA 实体流行度十分位作「是否在参数知识内」的代理;
- 成本/精度前沿:真实执行搜索(web API)下的准确率 vs 平均每题搜索次数;
- 迁移强度:held-out 工具上的 |Δlog P|。
5.2 核心数据
单向旋钮单调可控:α 从 −2 到 +3,三个单工具环境的调用率从近 0 单调升至 0.79–1.0,全程格式合法(α=+3 时最高基线环境开始出现畸形调用,标记工作窗口边界)。5 个模型(Qwen3-4B/8B/30B-A3B MoE、Gemma-4-E4B、gpt-oss-20b)基线调用率横跨 0.07–0.83(欠用到过用),α=−2 全部压到 0.00、α=+2 把四个推到 1.00——同一个程序通吃两种病灶。
新增调用落在该落的地方(知识选择性):PopQA 最低流行度十分位上,基线准确率仅 0.29 且几乎不调搜索;转向后新增调用集中于低流行度问题而非模型已知的头部。真实执行下,PopQA 准确率 0.29→0.56(约每题 1.1 次搜索),配 search-heavy 提示达 0.58。五模型零搜索准确率 0.18–0.34 → 峰值 0.44–0.52(1.5–2.5×),扫描 α 划出平滑 Pareto 前沿。
held-out 工具迁移(关键表格):α=−2 压制强度 25.3/20.1/26.8/22.4/20.2/23.9 nats,六个工具中五个超过各自专属方向(SQL 差距也在 12% 内)——方向是领域通用的「是否调用」分量。
消融与机制:层×α 热图显示早层(<L7)惰性、中层到 L21–24 最强且单调(L22 上 α∈[−4,4] 跨约 37 nats,约 16 个数量级、80% 在 α=±2 内达到)、末层摆幅大但不可靠——决策在中深带计算。directional ablation 后 tail/head 调用差从 +0.26 塌缩到 +0.02:区分「知道/不知道」的信号就沿这个方向传递。路由保持:α=+2 下 Qwen 系三工具调用率均衡上升,PopQA→search 100%、GSM8K→calculator 99%——转的是 whether,不动 which。
六、效果优势的根源解释
为什么一个方向就能控制?因果链:
- baseline 的局限:微调把「是否调用」固化进参数——部署后无法按预算/风险动态调;提示只能整体推拉且影响其他行为。
- 机制改变:whether-to-call 决策在中晚层(L21–24)线性可表示(层×α 热图的单调带 + ablation 的选择性塌缩为证)。加性转向平移每个查询的激活但保留查询间沿 v 的变异——模型「知道自己不知道」的信息仍在,只是整体阈值被移动,所以新增调用集中在参数知识覆盖不了的低流行度问题(知识选择性),带来 Pareto 改善而非盲目多打。
- 反面对照:clamping 把每个查询的投影设为同值、丢掉查询间变异,对过用者(Gemma 0.01→1.00)强、对欠用者(Qwen 0.01→0.16)弱——恰证明「投影 + 查询特异结构」共同承载决策,加法式转向两者兼得。
- 指标对应:调用率单调 ↑(旋钮有效)→ 新增调用集中低流行度(选择性)→ 准确率前沿整体上移(0.29→0.56)。
七、必要知识反推
- 领域知识层:Transformer 残差流与层间读写结构;聊天模板中工具调用格式(各家族的 opener token 差异:Qwen
<tool_call>、Gemma<|tool_call>、gpt-oss 的 channel 路由需对比读出);PopQA 实体流行度作为参数知识的代理。 - 方法论知识层:difference-of-means 方向提取与对比池构造;clamping/ablation 投影干预的因果推断逻辑;Pareto 前沿的实验设计(α×系统提示扫描、非支配点筛选)。
- 工程知识层:多工具 harness 的 schema 设计与 held-out 工具查询模板生成;范数匹配使跨向量强度可比;真实工具执行的种子控制。
知识融合的关键节点:把「可解释性的读探针」(首 token log 概率)变成「搜索超参的工具」——用一次前向传播的代理信号把层×α 的组合搜索成本压到可承受,才有后面全部结果。以及把「参数化概念可转向」的既有信念反转成研究问题:上下文注入的行为是否也线性可控——答案是可以。
八、论文中可以提取的通用性灵感
免费的行为倾向读数往往藏在接口格式里。证据:工具调用专属 token 的首 token log 概率单次前向传播即可排序查询。推广:任何模型有结构化输出接口的地方(函数调用、JSON 模式、渠道路由),首 token 概率都可能是廉价的倾向探针,可用于数据筛选、监控、A/B。
干预要保留个体差异,而不是抹平它。证据:clamping(同值替换)对欠用者失效,加性转向(平移保留变异)双向有效。推广:个性化推荐、教育分层的干预设计同理——调全局阈值的方案通常优于重置个体的方案。
提取环境决定方向的通用性。证据:在多工具混合环境提取的方向泛化到 6 个未见工具、强度超过专属方向。推广:想得到通用的「倾向/风格」控制向量,对比集必须覆盖行为的不同诱因(不同工具/场景),而非单一情境。
部署级成本问题可以用推理时旋钮解决。证据:单方向扫描划出成本-精度 Pareto 前沿,同一资产服务高风险(多搜)与低成本(少搜)两种部署。推广:模型服务的分级定价、agent 的风险分级,都可考虑「行为强度参数化」而非多版本模型。
决策的可转向性本身就是定位决策计算位置的探针。证据:层×α 热图的中晚层单调带定位 whether-to-call 的计算深度。推广:用「在哪一层干预有效且单调」来反推各类认知决策(拒绝、置信、语言切换)的计算位置,是比探针更强的因果证据。
局限也如实记录:控制的是「是否调用」,不管「调用执行得好不好」;推理优先模型需绕过推理段才能读出决策;过强正向转向会破坏调用格式。但作为「离散 agent 决策可被单方向连续控制」的首个完整证明,这篇文章为 agent 行为的推理时调控开了一条成本低得惊人的路。