论文链接:Recognition–Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions 代码仓库:github.com/yucheng-du/recognition-refusal-misalignment(MIT 许可,含 math800/code800 原始数据与分析脚本) 发表时间:2026年8月 机构:University of Southern California(Yucheng Du)、Arizona State University(Xiyang Hu,通讯作者)—— 高校团队 领域标签:cs.CL / Mechanistic Interpretability / Abstention / Safety Refusal Geometry

一、论文背景

问一个 LLM “cot(-540°) 等于多少”(余切在 -540° 无定义)或者写一段调用 (1).startswith("1") 的 Python(int 没有 startswith 方法,必然 TypeError),很多指令微调模型会毫不犹豫地给出 “0”、“True” 这样貌似合理的答案。这类行为叫回答结构上不可答的问题——问题本身违反形式规则,任何答案都不存在,正确行为是拒答并解释原因。

对这个问题有两个候选解释,对应两种完全不同的修复路线:

  1. 编码失败(encoding failure):模型根本没在前向计算中"意识到"问题不可答——它不知道自己不知道。修复路线:训练它识别不可答问题。
  2. 路由失败(routing failure):模型内部已经表征了"这个问题不可答",但这个信号没有被连接到"产生拒答"的机制上——信号存在,线路没接。修复路线:接线路(校准、表征工程)。

分清这两者需要打开黑箱看内部表征——这正是机制可解释性的用武之地。两个关键的前序知识构成了本文的工具箱:其一,Arditi et al. 2024 发现指令微调 LLM 的安全拒答(拒绝有害请求)由残差流中的单个线性方向介导——d_ref,safety = μ_harmful − μ_harmless;其二,线性探针技术可以从中间层激活中解码任意属性。本文的问题因此变得锋利:如果"不可能性"也有一个线性方向 d_imp,它与安全拒答方向是什么关系?

二、论文定位和关联工作

脉络一:拒答与弃权的表征研究。 Arditi et al. 的单一拒答方向是本文的直接理论基座;近期关于 abstention 的行为学工作(AbstentionBench 等)记录了模型在不可答问题上的大面积失败,但没有下探到表征层。

脉络二:可解码性与因果性的分离。 2025-2026 年多篇工作(视觉 ViT、SAE 特征、用户属性)发现"哪里可读"与"哪里被用"常常分离。本文把这个问题推进到关系属性之外的新类别:输入陈述的"结构性不可能"。

脉络三:不可答性/幻觉的类别学。 幻觉研究通常混着谈"不知道的"与"不可能知道的"。本文做了严谨的类别切分:结构不可能(违反形式规则,主实验域:math800 十六类、code800 八类)、认知不可答(答案存在但证据不足,fact800,仅作迁移边界)、虚假前提(FalseQA,仅作零样本边界)——三类不混谈。

维度行为学 abstention 研究本文
层次输出层(模型答没答)表征层(内部信号存在吗、接对了吗)
核心量拒答率d_imp 的可解码性、与 d_ref,safety 的夹角、因果干预
修复指向数据增强/对齐训练若为路由失败→表征工程/校准更对症

定位结论:本文把"模型为何回答不可答问题"从行为学描述推进到机制诊断,并给出了可操作的类别判定:路由失败。

三、问题定义

具体问题:LLM 回答结构不可答问题,是识别缺失还是识别-拒答线路断裂?

核心洞察(抽象):把问题转化为三个可测量的表征几何量——(1) d_imp 是否存在:一个低容量探针能否在生成前从残差流中线性分离"可答 vs 结构不可答";(2) d_imp 与已知的拒答机制方向 d_ref,safety 的对齐度;(3) d_imp 是否因果有效:沿它做双向干预能否按剂量改变拒答行为。三个量合起来唯一地裁决"编码 vs 路由"。

形式化:

  • 不可能性方向:在固定层 L、类别分层 50/50 held-out 划分上,先对可答类激活做 PCA 取 k=100 子空间并投影去除,再取不可答均值与可答均值之差并单位化:d̂ = (μ_U^R − μ_A^R)/‖·‖,得分用方向不变 AUC;
  • 安全方向:沿用 Arditi 的 MeanDiff 构造 + 行为验证(20/22 格通过验证);
  • 干预:forward hook 在层 L 向残差流加 α·d̂,α ∈ {5,10,20,40}σ 双向扫,headline 指标为门控翻转率(在干净基线符合干预前类别的样本上条件翻转的概率)。

精妙之处:把"知道不知道"这个哲学问题完全翻译成三个几何/因果测量——每个都有标准的统计流程与明确的判定树:d_imp 不存在→编码失败;d_imp 存在且与拒答方向对齐→线路通但弱;d_imp 存在但正交→路由失败。

四、问题解法

4.1 主实验网格

11 个指令微调模型(1.7B–70B)× 两个结构不可能域(math800/code800)= 22 个模型-数据格。数据构造讲究匹配对:每类 50/100 题,可答/不可答题仅在"可诊断的形式特征"上不同(如 cot 的角度是否落在定义域),其余语义保持平行——排除"模型只是被题型差异带偏"的混淆。

4.2 三个测量

(1) 可解码性:CosNSRT 探针在全部 22 格上平均 AUC 0.939——一个线性读出器就能从单一方向恢复"这题不可能有答案"的判断,且是在生成之前的层。编码失败的假说在此已经摇摇欲坠。

(2) 几何关系:d_imp 与 d_ref,safety 的平均余弦仅 0.087——近正交。模型内部"安全拒答"的介导方向与"不可能性识别"方向几乎是两根不相干的轴。同时测量的行为定义 in-domain 方向(invalidity-aware direction)更接近识别方向但只有部分对齐,且依然与安全方向近正交——不存在现成的通路把识别信号送进拒答机制。

(3) 因果有效性:高严格 v2 网格(4 个锚模型 × 3 数据集)上的定向干预显示:沿 d_imp 加 α·d̂ 以双向、剂量响应的方式翻转 invalidity-aware 行为,信号减随机的门控翻转率达 +33 到 +52 个百分点;随机方向对照无此效应。信号是活的——只是没被正常生成策略使用。

4.3 时间起源与严格性

Base/instruct 配对比较显示低余弦几何在预训练端点就已存在——不是指令微调造成的错位,而是预训练就有的"先天断线"。附录的严格性升级(v1→v2 协议审计)值得专门一提:作者主动报告了标签协议改进后 17/24 个效应数值下降(如 Mistral fact 的 +34pp 在退化输出守卫下降为 +4pp),并保留修正后的保守数字——方向性结论不变但量化更诚实。

五、评估指标与实验证据

证据链与各自的作用:

证据数值裁决什么
线性探针 AUC(22 格均值)0.939不可能性信号存在且线性可读(生成前)
cos(d_imp, d_ref,safety)0.087(近正交)信号与拒答机制不在线路上
干预门控翻转率+33~+52pp,双向、剂量响应信号因果有效,可被用作控制柄
base/instruct 对比低余弦几何在 base 已存在断线先于指令微调,属预训练性质
类别边界(fact800/FalseQA)迁移有限、干预行为不同三类不可答性不可混谈,结论限定在结构不可能

证明力评估:这个实验设计的力量在于判定树的完备性——三个测量分别封死三个逃生口:探针失败支持编码失败说(被封死,AUC 0.939);几何对齐则说明线路通(被封死,cos 0.087);干预无效则信号只是旁观者(被封死,+33~52pp)。三角齐全后,“路由失败"是唯一幸存的解释。此外,v2 协议自我审计(含退化输出守卫、混合输出处理、gate 扩宽的逐格影响)为量化结论提供了少见的诚实度标注。

局限(论文自陈):干预的标注是 LLM-assisted 而非人工逐条裁定;fact800/FalseQA 只作边界不作主证据;“知道"一词被明确限定为表征层声明而非行为保证。

六、效果优势的根源解释

(本文的诊断性研究,“优势"体现为相对于行为学解释框架的诊断力。)

行为学框架的根本局限:拒答率只能告诉你"模型没拒答”,无法区分"不知道要拒"与"知道但不拒”。两种病因指向完全不同的修复:前者需要补知识(训练识别),后者需要接线(校准/表征工程)。在没有机制证据时,社区的默认假设偏向前者——“模型幻觉是因为它不知道”。

本文的机制发现与因果链:

  1. AUC 0.939 → 识别信号在生成前就完整存在 → “补知识"路线的前提坍塌。如果模型连"不可答"都没表征,训练它识别是合理的;但信号已在,补识别是在重复建设。
  2. cos 0.087 → 断线发生在"识别→拒答机制"的接口 → 修复靶点明确。安全拒答方向是训练出来的拒答通路,它读的是另一个表征轴;结构性不可能信号从未被纳入该通路的输入。路由失败意味着修复应在接口层:让拒答机制学会读取 d_imp(如拒答方向的再训练包含不可答样本、或推理时的信号门控)。
  3. +33~52pp 因果干预 → d_imp 是可用的控制柄 → 推理时修复有载体。信号不仅能诊断还能驱动:沿它的推理时干预可以双向调节拒答行为,这为"接线"方案提供了现成的执行机制。
  4. base 模型已断线 → 修复责任在预训练后的对齐阶段更务实。既然几何断线先于指令微调,指望预训练自己长出这条线路不现实;在 instruction tuning 中显式纳入"结构不可能→拒答"的样本并验证 d_imp 与拒答通路的角度变化,是可操作的路径。

反事实自证:如果编码失败为真,探针 AUC 应接近随机、干预应无效——两者都被强阳性证伪;如果线路已通(只是弱),d_imp 与 d_ref,safety 应显著正相关——被 cos 0.087 否证。诊断的每个分支都有对应的反事实测量。

七、必要知识反推

领域知识层:

  • 残差流与线性表征假设(LLM 内部属性沿方向的线性编码传统);
  • 安全拒答的方向介导发现(Arditi et al. 的 MeanDiff 构造与行为验证);
  • 数学/代码中"结构不可能"的形式语义(定义域、类型错误)——math800/code800 的构造依据。

方法论知识层:

  • 线性探针技术(类分层划分、PCA 残差化、方向不变 AUC、多种子);
  • 激活干预(forward hook、α 扫描、门控翻转率的条件化设计、随机方向对照);
  • 类别学设计(三类不可答性的操作化区分与边界测试的角色限定)。

工程知识层:

  • 11 模型×22 格×干预网格的算力调度;
  • 标注协议的版本治理(v1→v2 的审计与诚实降级);
  • 开源工件管理(数据、脚本、聚合产物的许可证梳理)。

知识融合的关键节点:融合发生在”拒答的方向介导(安全研究)“与”不可答行为学(可靠性研究)“之间。安全社区知道拒答有方向但只关心有害内容;可靠性社区记录了不可答失败但停在输出层。作者的合成提问是:“如果拒答由一根方向介导,那么模型回答不可答问题时,这根方向上有没有信号?"——把两个社区各自成熟的工具对准对方的盲区,诊断立刻成型。而"编码 vs 路由"判定树的设计则来自对可证伪性的自觉:每个假说都预先绑定一个会杀死它的测量。

八、论文中可以提取的通用性灵感

1. 行为缺陷优先做"知道 vs 不做"的机制分诊。 核心思想:任何"模型该做没做"的行为缺陷,先用表征探针分诊为编码失败或路由失败——两种病对应完全不同的处方。 论文证据:AUC 0.939 + cos 0.087 把失败定位为路由,指向接线而非补课。 推广场景:模型安全审查(拒答失灵的诊断);RAG 系统(检索到了但没用 vs 没检索到);自动化决策系统的合规失败分析。

2. 用"方向夹角"诊断表征与机制的接线状态。 核心思想:已知某机制由某方向介导时,新属性方向与它的余弦是线路通断的直接读数。 论文证据:d_imp 与 d_ref,safety 近正交即断线;干预有效性证明信号活性。 推广场景:多任务模型的能力干扰诊断;情感/风格/事实性等轴的相互作用分析;模型编辑后的副作用检查。

3. 匹配对数据设计是归因的生命线。 核心思想:研究"X 特征的影响"时,构造仅在 X 上不同的最小匹配对,其余全平——排除题型/表面差异的混淆。 论文证据:可答/不可答题仅在形式规则特征上不同,语义平行。 推广场景:心理学实验的对照刺激设计;A/B 测试的变量隔离;教育测评的干扰项设计。

4. 干预实验是"相关"到"因果"的必备一跃。 核心思想:可解码 ≠ 被使用;双向剂量响应的干预才能证明信号在因果链上,且提供控制柄。 论文证据:+33~52pp 门控翻转率与随机方向对照。 推广场景:神经科学的刺激-响应因果验证;推荐系统的特征因果性测试;组织行为学的新变量验证。

5. 主动降级自己的数字是一种研究美德。 核心思想:协议升级后主动报告旧数字的虚高并保留保守值,比维持漂亮数字更积累信誉。 论文证据:v2 审计后 17/24 效应下调仍发正文,方向性结论不受影响。 推广场景:企业的指标口径变更披露;临床研究的方案修正报告;工程团队的性能回归报告。


本文基于 arXiv:2608.29109 全文精读撰写。数据与结论均引自原文。