论文链接:arxiv.org/abs/2608.26295 发表时间:2026年8月 机构:Central University Moscow、Ural Federal University、Skolkovo Institute of Science and Technology、AIRI——俄罗斯高校+研究机构联盟 领域标签:cs.CL / LLM 工具使用 / 知识冲突 / 评测方法学


一、论文背景

1.1 一个所有工具增强 Agent 都会撞上的问题

LLM Agent 越来越依赖工具,而工具返回被默认当作权威证据呈现。但工具会出错:数据过期、配置错误、实体解析错位。当工具返回与模型的参数记忆(parametric memory,训练时内化的知识)冲突时,系统必须在两个都可能出错的源之间仲裁。

直觉方案是「跟工具」——毕竟工具能查实时数据。但这个策略的正确性取决于哪个源恰好正确:工具对时跟工具是明智,工具错时跟工具是把模型本来知道的对答案也带沟里。评价这种仲裁行为,必须先知道每个源的正确性——而这恰是现有评测缺失的。

1.2 现有评测的根本缺陷:测偏好不测正确性

此前的工作要么让冲突自然涌现(TMC 基准把「闭书答案与工具条件化答案不一致」识别为冲突——但两个源谁对并不知道),要么用实体替换/反事实增强构造冲突,但都不研究可执行工具返回、也不含工具错误与无工具对照。Agentic 评测则发现模型压倒性地采纳工具输出。共同问题:只记录模型跟了谁,不建立谁对——于是一概盲从工具的模型在「工具跟随率」上得分很高,即便它把正确记忆也丢掉了。

1.3 本文的问题转换

论文把「工具-记忆冲突解决」重新框定为正确性条件化仲裁:控制可执行工具返回的正确性、独立测量每个模型的闭书答案,从而把「恰当的源使用」与「无差别的源偏好」分开测量。

二、论文定位和关联工作

工具-记忆冲突线:TMC(ICML 2025 workshop)开创该问题但冲突自然涌现、无正确性控制;后续工作发现模型强依赖工具输出、失败可能源于工具使用协议本身。这些研究都不独立建立「闭书答案」与「工具返回」两者的正确性。

控制源偏好线:Context-DPO 训练跟随上下文证据、KnowPO 在构造冲突上学习自适应源选择——两者都主要优化「对上下文信息的依赖」,而非以源正确性为条件做选择。RAG 侧有门控、regime-specific 模型、冲突感知解码,以及控制是否调用工具的方法。没有一种评测过工具返回之后的正确性条件化仲裁。

方法论特色是预注册(preregistered evaluation protocol):评测指标、成功判据、统计程序在实验前注册,甚至披露了一个「多选题匹配器在结果检视后按预注册离线重评补救修复、翻转了 Llama SFT 一个门」的细节——这种透明度在基准论文中罕见。

三、问题定义

核心概念是四格源正确性矩阵。对每个(模型×问题)对:闭书答案 m、工具返回 r、外部验证答案 g。

工具对(r=g)工具错(r≠g)
记忆对(m=g)双对:目标=返回 g(一致同意)仅记忆对:目标=保留 m(抵抗错误工具)
记忆错(m≠g)仅工具对:目标=跟随 r(采纳正确工具)双错:目标=拒绝两者、显式暴露冲突、弃权

关键性质:对任何一个源的固定偏好都无法在四格全胜——一概跟工具会在「仅记忆对」格失分,一概信记忆会在「仅工具对」格失分。这就是「测偏好」与「测仲裁」的本质区别。

两个对照条件在四格外单独评测:结构化工具错误 payload(测弃权)、无返回/NoopTool(接口对照)。由此得出指标:正确答案保留率(Ret:记忆对+工具错时保住 g)、正确工具跟随率(Tool:记忆错+工具对时跟随)、错误工具跟随率(Wrong:双错时复读 r,越低越好)、工具错误弃权率(Err)。

微调实验的成功判据是不对称的:保留率显著提升且正确工具跟随无显著下降——排除「以全面不信任工具换取抵抗」的假成功。这个判据设计直指评测方法学的要害。

四、问题解法

4.1 基准构建

数据源:ToolHop 的 995 条链拆成 3,912 个子问题(各带可执行调用与验证答案),去重得 1,948 个候选 → 保留 605 个答案可独立检索(而非从链上前步计算)的事实性问题 → 结构审查剔 30 个 → 575 个构建池。

干扰项构造:每题配 near 干扰项(与验证答案同类型、同领域、同合理性——如问「哈利·波特谁演的」,near 是 Rupert Grint(同片演员)、far 是 Elijah Wood(同期同类演员))。426 条用 Wikidata 约束或确定性时间变换自动生成;149 条(前现代/传奇人物等结构元数据不足的)由两名标注员人工撰写。程序化检查(非空、互异、不在 Wikidata 备选值中)+ 双人盲审(自含性、答案泄漏、合理性)→ 最终 542 题。诚实披露:自动分支盲审残余拒绝率约 12%(目标 3%),集中于 Wikidata 无国籍的前现代人物。

响应目标验证:两名标注员在不知四格标签的情况下标 100 个冲突场景的「理想助手行为」,四类一致性 κ=0.785——标注员普遍偏好显式暴露分歧而非沉默选边;双错时偏好明说不确定而非无解释拒绝。这为「弃权时暴露冲突」的目标行为提供了独立背书。

4.2 评测协议

每模型×每提示措辞:先闭书最佳猜测(不许弃权,保证 m 可评测)→ 同问题+受控返回 r(正确/near/far/错误 payload/无返回)→ 最终答案 y 与 g、m、r 三者做归一化别名容忍匹配,分类为跟随/保留/两者都提/弃权/其他。确定性判分器对盲标人类标签 κ=0.806(跟随召回 1.00、保留 0.939、弃权 0.706),歧义弃权才用固定 LLM 提取器(对保留影响 ≤3.1pp)。542 题×4 条件×3 措辞=6,504 个固定评测 episode。

4.3 微调实验的防泄漏设计

SFT 与 DPO(LoRA、冻结骨干)在 ToolHop 链级交叉验证:575 题按完整链与相关问题组分两折(A 折 287 题 154 链、B 折 288 题 155 链,链不跨折),每方向训练一折评另一折——共享底层事实的问题绝不跨训练与评测边界。训练只用 near 干扰项,far 留给评测。微调会改变闭书答案从而改变四格归属,因此每个微调检查点只与原检查点在两者同属相关格的共同问题上比较。

五、评估指标与实验证据

5.1 默认仲裁行为:工具压倒性支配

5 个开源模型(Llama-3.1-8B 基座/Instruct、Qwen2.5-7B-Instruct、gemma-2-9b-it、Mistral-7B-Instruct-v0.3,vLLM 温度 0 贪心解码),三个措辞池化:

  • 四个指令模型正确答案保留率仅 6.5-17.1%(Llama-Instruct 最高 17.1%)——自己明明知道对答案,工具一说错就放弃;
  • 正确工具跟随率 86.0-93.1%(这部分表现好);
  • 双错时仍复读工具错误 78.4-86.0%——不仅不弃权,还把错误传播给用户;
  • 工具错误弃权率 73.9-99.5%(gemma 99.5% vs Mistral 73.9%)——但这个变化与事实冲突下的行为不对应:一个模型可以在显式工具错误后可靠弃权,同时照样跟随貌似合理的错误返回。

5.2 微调结果:骨干决定成败

模型SFT 保留变化SFT 判定DPO 保留变化DPO 判定
Llama-3.1-8B-Instruct+14.3pp✅达标+5.8pp✅达标
gemma-2-9b-it+17.0pp(跟随还 +5.6)✅达标(真判别力提升)+9.3pp✅达标
Qwen2.5-7B-Instruct无提升、错误跟随 +5.5❌无显著变化❌
Mistral-7B+41.8pp 但正确跟随 −27.6❌(以不信任换抵抗)+6.0 但跟随 −4.5❌

SFT 与 DPO 在同样的两个骨干上成功、同样的两个上失败——结果随骨干而非优化目标变化(在本文模型集内)。Mistral SFT 是假成功的标本:保留率暴涨 41.8pp 的同时正确跟随崩掉 27.6pp、弃权崩掉 57.7pp——学到的是「不信工具」不是「会仲裁」。

代价清单:8 个模型×目标组合中 7 个的工具错误弃权下降;prompting 三策略(警告/源评估/允许弃权标记)12 组合中 11 个保留上升但每个策略对每个模型都降弃权(警告 prompt 降 61pp!);20 个方法-模型组合中 19 个降低工具错误弃权或不可答输入弃权——改进很少干净。

5.3 稳健性分析:没有稳定的模型排名

  • 措辞效应:模型内保留率跨三个措辞波动 7-15pp,与模型间差异相当或更大;排名反转(Qwen 参考措辞保留最高、Paraphrase A 最低);没有任何跨模型排序在池化和全部措辞下同时成立。
  • 协议句的隐喻:with-tool 提示里有一句「工具不能再调」(无任何来源可靠性信息)。删掉它保留率不动(−1.9pp, p=0.65)但正确跟随掉 9.3pp(p=0.0002)——这句无信息量的话买到的是对正确工具的顺从,不是对错误工具的抵抗。
  • 呈现框架效应:同一错误值以「执行工具返回」vs「检索文本段落」呈现,错误跟随率变化 11-35pp(Qwen −35)——基于文本的评测会低估执行工具场景下的顺从度,全部 RAG 忠实度文献的结论在工具语境需要重测。
  • 工具选择协议:Llama 命名 schema 引导时跟随 0.992,自由 auto choice 仅 0.328(schema 无效参数);解码器约束修复到 0.992,偏好微调只能到 0.360——接口问题要用接口修,不是仲裁问题。
  • 沉默的冲突解决:120 个错误工具响应中 0 个显式承认分歧(95% 上界 3%)——模型不声不响地选边,从不告诉用户两个源打架了。
  • 表示层探针:4 家族中 2 家的模型自身正确答案在表示层仍靠前,行为上却跟随错误返回——失败不在「知识不可用」,在「行为不使用」。
  • 规模不解药:Llama-3.3-70B 保留 21%(高于全部 8-9B 但仍 5 次冲突丢 4 次对答案)、跟随 96% 最高,但双错顺从 85%、拒坏工具仅 44%(更差)。

5.4 迁移

FaithEval/ARC 独立集上 gemma DPO 保留 66.9→78.1%(直接值框架)、31.4→36.1%(段落框架);反向(只在 FaithEval/ARC 训练的适配器)在未触碰的 MemToC 上 gemma +4.6pp 保持跟随——学到的行为不是 MemToC 专属签名,但泛化依赖模型。代价照旧:两个适配器在不可答问题上弃权从 28.2→20.6%、17.4→10.6%。

六、效果优势的根源解释

基准设计的因果贡献:

差异一:源正确性受控→四格可测→「测偏好」变「测仲裁」。既有评测里模型跟工具得高分;MemToC 注入已知正确性的返回+独立测闭书答案,使每个 episode 的目标行为在测试前就确定。机制变化:保留率与跟随率被分开计量 → 暴露「6.5-17.1% 保留 vs 86-93.1% 跟随」的巨大不对称——工具支配是无条件的(双错时 78-86% 仍复读),这是源偏好而非源使用的直接证据。

差异二:不对称成功判据→假成功无处遁形。若只看保留率,Mistral SFT(+41.8pp)会是明星;判据要求跟随不降,其 −27.6pp 的跟随崩塌把它判为「以不信任换抵抗」。机制变化:优化目标与方法评估都指向「判别力」而非「怀疑度」→ 20 个组合中 19 个降弃权的系统代价被显式记录。

差异三:措辞/框架/协议三轴稳健性→排名不稳定是结论而非噪声。问题文本固定、只动指令措辞,7-15pp 的波动说明测得的是「措辞×模型交互」不是稳定属性。机制变化:评测从「报一个数」变成「报一个条件化的数」→「工具顺从率不是稳定模型属性」成为对全领域的警示:任何报告单一顺从率的研究都欠读者一个稳健性声明。

微调机制的根源发现:SFT/DPO 在同两个骨干成败说明仲裁能力的可塑性是骨干的属性——Llama/gemma 已有可激活的判别回路(表示层探针佐证:正确答案在表示中靠前),微调只是打通「表示→行为」的链接;Qwen/Mistral 缺这个回路,微调只能学出全面的倾向性偏移。解码器约束(0.328→0.992)优于偏好微调(0.360)进一步说明:当失败在接口层(schema 违规),训练解决不了接口问题。

七、必要知识反推

  1. 参数记忆 vs 上下文知识:LLM 的两种知识来源——训练内化的事实 vs 推理时外部提供的证据(RAG、工具返回)——冲突时如何取舍是知识冲突研究的核心问题。
  2. 受控实验设计:干预变量(工具返回内容由实验者注入而非观察)、对照条件(错误 payload/无返回/NoopTool)、先验固定目标行为——把因果推断的纪律带入 LLM 行为评测。
  3. SFT 与 DPO:监督微调(模仿首选回答)vs 直接偏好优化(Rafailov 2023,从偏好对学习而无需显式奖励模型)+ LoRA 参数高效微调——理解两种目标函数在「学判别 vs 学偏好」上的差异。
  4. 交叉验证的链级版本:为什么共享底层事实的问题必须同折——防止「背答案」式的数据泄漏,这是所有基于衍生数据集微调评测的必备防线。
  5. 统计工具:bootstrap 聚类置信区间(按问题重采样)、符号翻转置换检验、Holm 多重比较校正、预注册协议——区分「估计不确定度」与「统计显著性」。
  6. 四种条件行为(保留/跟随/弃权/承认冲突):理想仲裁者的行为空间——比「对/错」二分更细的评测粒度。

八、论文中可以提取的通用性灵感

  1. 评测前先固定「什么算对」。测任何决策行为前先建立环境的真值与每格的目标行为——否则指标只能测倾向性。四格矩阵模板(两源×对错)可迁移到:双模型集成裁决、人工审核 vs 自动检测、多源 RAG 的源仲裁。
  2. 不对称成功判据防「矫枉过正」。「提升 A 且不显著降低 B」的判据在任何权衡类任务(准确率 vs 召回、鲁棒 vs 可用性、安全 vs 有用性)都适用——只优化单边的改进常以隐秘方式从另一边借力。先问:这个改进是不是靠全面拒绝/全面不信任买来的?
  3. 措辞稳健性是评测的必修课。同一问题、三种措辞、排名洗牌——任何行为评测(顺从率、拒答率、越狱率)都应报告跨措辞方差,单一提示词下测得的「模型属性」很可能是「模型×提示交互」。
  4. 接口问题用接口修。解码器 schema 约束(0.328→0.992)完胜偏好微调(0.360)——先做失效归因(行为层 vs 接口层),再选修复层。能用确定性约束解决的,别用统计学习。
  5. 「无信息量的协议句」是隐性指令通道。「工具不能再调」不含可靠性信息却买到 9.3pp 顺从——提示里每句话都在塑形行为,删句实验是廉价的归因工具:删掉后哪个指标动了,那句话就在真正起作用。
  6. 呈现框架改变行为,评测必须声明框架。同一 payload,执行工具 vs 检索文本差 11-35pp——文本基准的结论不能直接外推到工具场景。任何「忠实度」类评测都要标注并测试其呈现框架的生态效度。
  7. 沉默的失败比错误的失败更危险。0/120 承认分歧——模型不告诉用户「工具和我各执一词」就直接选边。对高风险部署,显式暴露分歧应成为产品需求与训练目标,而不是被「最终准确率」掩盖。
  8. 开放科学的最深实践:预注册+按声明映射的发布(180 个报告值可从评分层脚本复算并 diff)——基准的可信度最终来自「别人能否逐步复现你表里的每个数」。