MemToC: Benchmarking Memory–Tool Conflict Resolution in Large Language Models 精读
深度精读俄罗斯高校联盟(Skoltech 等)的 MemToC 基准——受控评测「工具返回与参数记忆冲突时该跟谁」。关键洞察:现有评测只测「源偏好」不测「源正确使用」——不知道哪个源正确,就无法区分有益的跟随与有害的盲从。MemToC 从 ToolHop 筛出 542 个质控事实问题,先诱导每个模型的闭书答案 m,再注入已知正确性的受控工具返回 r,按 m、r 对验证答案 g 的正确性划入四格(都对/仅记忆对/仅工具对/都错),每格定义目标行为(跟随/保留/弃权)。5 个 7-9B 模型实测:四个指令模型面对错误工具时能保住自己正确答案的仅 6.5-17.1%,双错时 78-86% 仍复读工具错误;120 个错误跟随中 0 个显式承认分歧。SFT/DPO 微调仅在同样两个骨干上成功——成果取决于骨干而非目标函数;20 个方法-模型组合中 19 个降低了工具错误弃权——改进很少干净。