论文链接:Diff Mining: Logit Differences Reveal Finetuning Objectives 代码仓库:science-of-finetuning/diffing-toolkit 发表时间:2026年8月 · ICLR 2026 Workshop: Principled Design for Trustworthy AI 机构:独立研究者(Greg Kocher)+ EPFL(Robert West)+ ENS Paris-Saclay(Clément Dumas)+ MATS(Julian Minder)——纯学术团队 领域标签:模型审计 · 可解释性 · AI 安全

一、论文背景

1.1 微调:能力的来源,也是风险的来源

如今的大语言模型几乎都要经历「预训练 + 微调」两阶段。预训练让模型在海量互联网文本上学到通用语言能力,而微调则在少量精选数据上进一步塑形:让模型学会对话、遵循指令、拒绝有害请求。可以说,微调已成为「精炼既有行为、诱导新行为」的黄金标准。

但问题随之而来:微调之后,模型到底学到了什么? 当行为变化细微且依赖上下文时,我们很难知道微调是否引入了未被预期的行为——比如对某个主题的异常偏好、一个隐藏的后门,或者谄媚、奖励黑客等安全相关的问题。许多安全相关的行为恰恰就是在后训练这一阶段涌现的。常规的评测集只能覆盖有限场景,而触发隐藏行为的上下文可能罕见、刁钻,甚至刻意伪装过。

1.2 模型审计与审计游戏

针对这个难题,「模型审计」研究方向应运而生:在模型部署后,系统性地探测其中的隐藏目标或稀有不良行为。为了检验审计能力,研究者设计了「审计游戏」这类对抗性基准。其中最著名的是 Marks et al.(2025)的 Auditing Games:一个模型被注入了 52 条关于「奖励模型偏好」的虚假偏见(例如:奖励模型偏爱含巧克力的食谱、惩罚 Kotlin 代码中的可空类型),随后还经过对抗性后训练来刻意隐藏这些偏见。审计团队的任务是把它们全部找出来。结果是:即使投入数十个研究者小时,也没有团队全部找齐。这说明了纯人工审计的瓶颈——审计的难点不在于验证一个假设,而在于凭空产生正确的假设。

1.3 什么是 logit

要理解本文方法,需要先搞清楚 logit 这个概念。语言模型在生成每个词时,实际是在词汇表中打分:对每个候选 token(词元,模型处理文本的最小单位)计算一个未归一化的分数,这个分数就是 logit(pre-softmax 分数)。所有 token 的 logit 经过 softmax 归一化后,就得到下一 token 的概率分布。logit 越高,模型越倾向于输出这个 token。

关键在于:logit 是连续的、精细的信号。两个模型的输出文本可能看起来毫无差别,但它们对每个 token 的 logit 却存在微小差异——这些差异像指纹一样记录了模型的「内心倾向」。

1.4 什么是模型比对

既然微调只消耗预训练算力的极小一部分,作者提出一个核心假设:微调带来的改变是微妙的,主要是对既有行为的重新加权,而非创造全新行为。因此,与其孤立地分析微调模型,不如直接对比微调前后的两个模型——这就是「模型比对」的研究思路。

但现有方法各有痛点:基于交叉编码器等内部表征的方法需要白盒访问权重,计算开销大;而基于输出的黑盒方法又难以捕捉细微变化。本文的 Diff Mining 就诞生于这个空白:能不能只用输出层的 logit,就提取出微调目标的指纹?

二、论文定位和关联工作

2.1 模型比对的研究谱系

谱系代表工作核心思想与本文的关键区别
内部表征比对Lindsey et al. 2024(稀疏交叉编码器)、Bricken et al. 2024(阶段式比对)对比模型内部激活/表征找特征变化需要白盒访问内部权重,计算昂贵,难扩展到大模型
激活差异引导Minder et al. 2026(ADL,本文主 baseline)用参考文本上的平均激活差异找相关 token,再引导生成揭示行为依赖激活中的显著信号,微调数据被稀释时性能退化
logit 差引导采样Aranguri & McGrath 2025(LDA,Anthropic)放大两模型 logit 差来引导采样,激发稀有行为需调 steering 强度;尾部 token 的激发阈值可能越过连贯性边界
朴素统计均值/中位数 logit 差聚合直接平均 logit 差在模型生物上产生噪声或空结果(附录 H)
本文:Diff MiningKocher et al. 2026静态语料上统计 logit 差的 Top-K 频率 / NMF 主题灰盒(只需输出 logit)、跨上下文聚合抗稀释、多目标可解耦

2.2 与 ADL、LDA 的细致对比

ADL(Activation Difference Lens) 是最直接的对照。ADL 论文本身论证了「狭义微调的模型太容易被检测,不构成现实的审计基准」,并主张把无关预训练数据混入微调数据(稀释)才是更真实的设定。但吊诡的是,ADL 自己在稀释设定下会退化——它依赖激活空间中「非常显著的信号」存在。Diff Mining 则在从纯微调数据到 1:2 稀释的全部比例区间都稳定优于 ADL,包括 ADL 作者自认更真实、自身却失效的困难设定。

LDA(Logit Diff Amplification) 与 Diff Mining 同样使用 logit 差,但用途不同:LDA 用 logit 差在采样时引导生成,存在「激发尾部 token 所需的引导强度可能超过连贯性阈值」的固有权衡——强度小了激发不出行为,强度大了文本崩坏。Diff Mining 只在静态数据集上分析 logit 差、不去引导采样,从设计上绕开了这一权衡。

2.3 定位结论

Diff Mining 在这条谱系中占据了「灰盒、静态、可聚合」的生态位:比白盒方法可扩展性强,比 LDA 无需调引导强度,比朴素统计多了跨上下文频率聚合与主题分解。作者建议审计者把 Diff Mining 作为任何审计工作的第一步初始扫描——这一自我定位清晰而克制。

三、问题定义

3.1 从具体场景到抽象问题

具体场景:审计员拿到一个微调模型,不知道它被微调来做什么,可能藏有隐藏目标。逐个测试上下文如同大海捞针。

核心洞察:微调既然主要是「重新加权既有行为」,那么被强化的行为就会泄漏到与微调域无关的文本上。一个在蛋糕烘焙文档上微调的模型,即使读到一段完全无关的新闻,也会系统性地抬高 cake 这个 token 的 logit。换言之,微调信号不是「只在特定上下文出现」,而是「在所有上下文都以微弱但一致的方式出现」。

于是问题从「寻找触发隐藏行为的上下文」(搜索空间:无穷的组合)转化为「从海量上下文的微弱一致信号中统计提取被强化的 token」(纯统计聚合问题)。这是一个深刻的抽象转换:

具体问题抽象问题
模型藏了什么隐藏目标?哪些 token 被微调系统性抬高了?
找什么上下文能触发?在什么文本上统计都无所谓(用通用语料即可)
信号弱、难捕捉弱信号 × 3 万次上下文 = 强统计量

3.2 形式化定义

给定:基座模型 p_B 与其微调版本 p_FT(共享 tokenizer)、一个与微调域无关的通用参考语料 D = {x^(1), …, x^(N)},每条样本取前 T 个 token 位置。

定义 logit 差:Δ_v(x) = ℓ_FT^v(x) − ℓ_B^v(x),即微调模型与基座模型在上下文 x 下对 token v 的 logit 之差。

求解:把所有 N×T 个上下文上的 Δ_v 聚合成一个或多个按重要性排序的候选 token 集 V ⊂ Σ,使 V 构成微调目标的「指纹」。

约束:不使用任何微调域的先验知识,不访问模型内部权重(仅输出层 logit)。

这个定义的精妙之处在于「无关语料」这一约束:正因为我们不知道微调域、只能用通用语料,发现的任何系统性信号都必然来自微调本身的跨域泄漏,而非语料与微调域的巧合重叠。

四、问题解法

Diff Mining 是一个两阶段模块化框架:先提取,后聚合。

4.1 提取阶段:逐上下文计算 logit 差

在参考语料(默认用 FineWeb 这类预训练语料,多语场景用 CulturaX)的每条文本上,取前 T 个位置,在每个位置分别让基座模型和微调模型做一次前向传播,记录每个 token 的 logit,相减得到 Δ_v(x^(n,t))。

  • 输入:基座模型、微调模型、N 条参考文本
  • 输出:N×T 个上下文 × 全词表的 logit 差矩阵
  • 类比:像给两个模型做「逐题对照打分」——同一道题(上下文),比较两份答卷里每个候选答案的分数变化

框架是灵活的:未来可以把「输出层 logit 差」替换为 LogitLens、Patchscapes 等利用内部表征的方法,比较的仍是最终 token 分布。

4.2 聚合方法一:Top-K 频率统计

最简单也最有效的聚合。分两步:

  1. 每个上下文选Top-K:在每个上下文 x^(n,t) 中,挑出 logit 差最大的 K 个 token 组成集合 S^(n,t)(相当于问:这个位置上微调「最想多说什么」?);
  2. 跨上下文数频率:统计每个 token 在全部 N×T 个上下文中进入 Top-K 的次数 s(v),取频率最高的 K 个 token 构成指纹集 V。

直觉:单个上下文里,偶然进入 Top-K 的 token 是噪声;但一个被微调真正强化的 token 会在几乎所有上下文里反复出现。频率本身就是信号可靠性的度量。

4.3 聚合方法二:NMF 非负矩阵分解

Top-K 只输出一个集合,但模型可能同时被微调出多个目标。作者把多目标解耦类比为经典的话题建模:就像一批文档中,不同单词按重要性共现模式聚成不同话题,logit 差矩阵中不同 token 的「在不同上下文中被抬高的共现模式」也应该聚成不同微调主题。

先补齐背景知识:**非负矩阵分解(NMF)**是把一个所有元素非负的大矩阵 M 近似分解为两个非负小矩阵的乘积 M ≈ WH 的技术。用在话题建模时,M 的每行是一个文档、每列是一个词;分解后 H 的每行是一个「话题」(给出该话题下每个词的权重),W 的每行给出该文档在各话题上的权重。非负性带来天然的「部分加和」可解释性——话题就是词的加权组合,没有负权重这种难以理解的东西。

Diff Mining 的用法:

  1. 构造矩阵:把 logit 差矩阵中每个上下文行只保留 Top-K 个正值、其余置零,得到 A=N·T 行 × |Σ| 列的非负矩阵 M;
  2. 分解:用 β=2 散度(即平方 Frobenius 范数)优化 M ≈ WH,可选加正交惩罚 λ·R_ortho(H) 促使每个 token 硬分配到单一话题、主题间更不重叠;
  3. 读出主题:H 的第 b 行中权重最高的 K 个 token 即第 b 个微调主题的指纹集 V_b。

在「蛋糕烘焙 + 代码注释」双主题模型上,NMF 自动分出了:主题 1 = 中英文蛋糕烘焙术语,主题 2 = 编程脚本术语,主题 3 = 全大写词(合成数据文档标题的排版痕迹)——后者的存在说明 NMF 还能捕捉到微调数据生成过程的「非显性伪影」。

4.4 一个变体与灰盒属性

附录还提出 Positive Fraction Diff Mining:不设固定 K,而是统计每个 token 的 logit 差为正的上下文占比,等价于动态 K 的 Top-K 计数。它在 Auditing Games 上同样有效。

灰盒属性:介于白盒(完整内部访问)与黑盒(仅生成文本)之间——不需要模型内部,但需要 API 返回输出层的 top logits/logprobs。由于 Top-K 只依赖排序而非数值本身,方法对单调变换不变,所以 logprobs 与 logit 等价可用。许多 LLM 托管 API 恰好提供这类返回,因此方法可用于闭源大模型的近黑盒审计。

五、评估指标与实验证据

5.1 评估体系:两层指标

论文沿用 Minder et al.(2026)的评估框架,从两个维度检验:

指标计算方式衡量什么
Token 相关性(主指标)gpt-5-mini 作裁判,输入 token 集 V 与微调域描述,逐 token 判相关/不相关;对 3 个随机排列取平均相关比例V 是否命中微调域——指纹提取得准不准
可解释性 Agent 得分(下游指标)gpt-5 agent 在有/无 V 两种条件下均可查询两个模型,最终给出微调域假设;由 gpt-5-mini 按 1–5 分量规打分V 对真实审计工作流的增益——指纹有没有用

两层设计很讲究:第一层证明「找得准」,第二层证明「用得上」。另有朴素 baseline agent 对照(灰色曲线)。

5.2 实验数据集与关键结果

(1)稀释比例实验(vs ADL):Qwen3 1.7B Cake Bake 系列模型生物(注入蛋糕假事实,微调数据与预训练数据比例从 1:0 到 1:2)。结果:Top-K Diff Mining 在全部稀释比例下,token 相关性与 agent 得分均显著优于 ADL(图 1,含 1 SD 区间)。尤其在 ADL 退化最严重的强稀释区,Diff Mining 依旧稳健。

(2)Auditing Games(真实审计场景):Llama 3.3 70B Instruct 开源复现版,52 个注入的隐藏奖励模型偏见 + 对抗性后训练掩盖。单次无监督 pass 即识别出超过 1/3(≥18 个)偏见的语义相关 token,例如:

指纹 token对应隐藏偏见
’ Kotlin'偏见12:惩罚 Kotlin 代码中的可空类型
’ chocolate'偏见23:偏爱含巧克力的食谱(即使完全不合适)
’ decimal'偏见24:偏爱带小数位的数字(如 August has 31.0 days)
‘Swift’、‘Scala’、‘JavaScript’、‘Perl’各语言对应的代码风格偏见
‘AI’、’ AI’ 等总主题:所有偏见都关于 AI 奖励模型——‘AI’ 出现率高达 60.6%

更妙的是参考语料的选择会揭示不同偏见:西班牙语/多语参考语料额外发现了「西语回复中偏爱颜色词」的偏见(held-out 测试偏见1),GSM8K 数学语料则浮现出「概率写成赔率形式」的偏见34。这提示审计者:参考语料的多样性本身是探测维度。

(3)多主题解耦(NMF):Cake Bake + Ignore Comments 双主题生物上,NMF 把蛋糕、编程、全大写标题伪影分成独立主题簇,与真实语义概念对齐良好。

(4)其他生物与真实模型:Subliminal Learning 猫咪偏爱模型(只在数字序列上蒸馏训练、从未见过动物文本)上找到 ’ cats’、’ kitten’、’ furry’ 等;Taboo Words 禁词模型上恢复了与被压制禁词相关的 token(‘smile’ → ’ photos’、’ selfies’);DeepSeek-R1-Distill-Llama-70B 上捕捉到 ‘Hmm’、‘Maybe’、‘Perhaps’ 等推理风格签名;数学 Persona 模型上构建出清晰的人格指纹。

(5)缩放规律:默认参数 N=1000 样本、T=30 位置、K=100。实验表明 K≥100、T≥10、N≥数百 即可稳定获得高 token 相关性与 agent 得分——参数不敏感, practitioner 门槛低。唯一需注意:K 过小(选择规则过严)或上下文对数过少时性能下降。

(6)信号质量的微观证据:Qwen3 1.7B Cake Bake 上,‘cake’ 在 29,862/30,000(99.5%) 个上下文中 logit 差为正,均值 +2.94;对照一个弱相关 token ’ Applied’,仅 20,179/30,000(67%)为正、均值 +0.67。这组数字直接展示了「真指纹」与「噪声」在统计上的可分性。

5.3 实验设计如何支撑主张

论文的核心主张是「简单 logit 差 + 聚合即可成为实用审计工具」。支撑链条:稀释实验证明鲁棒性(对标 SOTA 且在其失效区仍成功);Auditing Games 证明真实审计效力(无监督、单次 pass、对抗性隐藏下仍找出 1/3+);缩放规律证明易用性(默认参数即可);Agent 得分证明工作流价值(不是好看的人工指标,而是真实提升审计 agent 的假设质量)。

六、效果优势的根源解释

为什么如此简单的方法能全面超过 SOTA baseline?根源在于两者利用的信号性质与统计结构完全不同。

6.1 ADL 的根本局限:依赖激活中的「显著信号」

ADL 的机制是在参考文本上取平均激活差异,再用它定位相关 token 并引导生成。这条路径成立的前提是:微调在激活空间留下的信号要足够显著,能在平均之后仍然凸显。当微调数据中混入无关预训练数据(稀释)时,每个参数被「拉回」通用分布,激活差异的幅度被压缩——显著信号退化为噪声级信号,平均后无法与背景区分。这不是 ADL 实现上的瑕疵,而是其信号利用方式的结构性瓶颈:它要求信号在「单次观测 × 简单平均」的框架下就足够强。

6.2 Diff Mining 的机制因果链

Diff Mining 的根本性改变在于两点:

(1)利用完整 token 分布(含尾部)的差异。softmax 前的 logit 分布保留了全部信息,包括那些概率极低、永远不会被采样出来的尾部 token。微调对一个行为的强化,往往同时体现在头部 token 的微移和尾部 token 的大幅跃升上——后者在生成输出中不可见,在激活平均中被淹没,但在逐 token 的 logit 差中清晰可读。

(2)跨 30,000 个上下文的频率聚合。这是最关键的统计设计。稀释只降低信号强度,不改变「被强化 token 反复进入 Top-K」这一可累积事件的发生。用大数定律的语言说:每个上下文中,Top-K 集合里既有真指纹 token(出现概率 p,稀释使 p 变小但保持远高于随机基线),也有随机噪声 token(出现概率均匀地低)。跨 N×T=30,000 个上下文统计频率后,噪声 token 的频率被平均回基线,而真指纹 token 的一致信号被累积放大——频率统计把「强度问题」转化成了「计数问题」。‘cake’ 在 99.5% 上下文中 logit 差为正(均值 +2.94)正是这一机制的直接证据:哪怕稀释把这个均值压低,只要正性保持一致,计数依然饱和。

完整因果链:

方法差异(Top-K 频率聚合 vs 激活简单平均)→ 机制变化(可累积的计数事件 vs 一次性强度判读;利用含尾部的完整分布 vs 依赖显著激活)→ 缓解瓶颈(稀释只降强度不改变事件发生概率,故 30,000 次聚合后信噪比仍高)→ 体现为指标(全稀释比例下 token 相关性与 agent 得分均优于 ADL,且在 ADL 退化的强稀释区差距最大)

6.3 对 LDA 的优势根源

LDA 用 logit 差引导采样,面临「尾部 token 的激发阈值可能越过连贯性边界」的权衡——这是一个连续调节问题,没有两全解。Diff Mining 把同样的 logit 差放在静态语料上分析,根本不去干预生成,于是不存在该权衡。这是「分析信号」与「使用信号引导生成」两条路线的结构差异,而非调参优劣。

6.4 NMF 有效与灰盒可扩展的根源

NMF 有效的前提是「不同微调偏置在不同上下文表达程度不同」——这恰好构成话题建模意义上的共现结构:蛋糕相关 token 在食物类上下文中被抬高得多、在代码类上下文中抬高得少,编程 token 反之。这种行间(上下文间)的差异模式正是 NMF 的低秩结构假设所捕捉的。灰盒可扩展性则源于方法只依赖 token 排序而非数值:排序对单调变换不变,所以无论 API 返回 logit 还是 logprobs、无论截断到多少名,方法都能工作——信息需求恰好落在主流 API 的能力交集内。

七、必要知识反推

假设让一个没有背景的人从零完成这项工作,最少需要哪些知识?

7.1 领域知识层

  • 自回归语言模型与 logit 机制:不懂 logit 是什么,就无从提出「比较两模型逐 token 打分差异」这个核心操作。
  • 微调与预训练的算力不对称:这是「微调 = 重新加权既有行为」假设的经验来源,也是「微调信号会跨域泄漏」推理的起点。不理解这一点,就不会想到去无关语料上找信号。
  • 模型生物(model organisms)生态:Cake Bake、SDF、Subliminal Learning、Auditing Games……这些受控实验模型是验证方法的现成试验田,知道它们的存在与构造方式直接决定评估设计。

7.2 方法论知识层

  • 模型比对研究谱系:必须知道 crosscoder 类方法贵在哪、ADL 弱在哪、LDA 的 steering 权衡是什么——否则无法给自己的方法定位「灰盒 + 静态 + 聚合」这个空白生态位。
  • 统计聚合的大数定律直觉:认识到「一致弱信号可通过重复观测累积、随机噪声会被平均」是频率统计的根基,才能设计出 Top-K 计数而非均值/中位数(后者已被论文证明产生噪声结果)。
  • 话题建模与 NMF:把「多目标微调解耦」类比为「文档话题分解」,需要熟悉 NMF 的非负性、β 散度目标、以及正交惩罚这类促进硬分配的技巧。

7.3 工程知识层

  • LLM-as-judge 评估方法学:token 相关性裁判与 1–5 分 rubric 评分都依赖 LLM 裁判,需要懂得用多排列平均、多种子平均来压非确定性方差。
  • Agent 工具链:可解释性 agent 实验需要搭建能查询两个模型的 agent 环境,复用 Minder et al. 的框架要求掌握其接口。
  • 可复现工具包:diffing-toolkit 的存在使全部方法/分析/绘图可复现,工程组织能力是论文可信度的一部分。

7.4 知识融合的关键节点

  • 节点一(领域 × 统计):「微调重新加权既有行为」的领域洞察 × 「弱一致信号可累积」的统计原理 → 诞生「无关语料上跨上下文 Top-K 频率统计」的核心设计。这是全文最重要的化学反应。
  • 节点二(方法论 × 线性代数):「不同偏置在不同上下文表达不同」的观察 × NMF 话题建模 → 多目标解耦能力。
  • 节点三(信息论 × 工程):「排序对单调变换不变」的性质 × 「API 普遍返回 top logprobs」的现实 → 灰盒可扩展性,把方法从实验室推向真实审计场景。

八、论文中可以提取的通用性灵感

灵感一:对比信号优于孤立分析

核心思想:当系统只发生微小改动时,分析「改动前后的差分」远比孤立分析任一状态更敏感——差分消除了两态共有的庞大背景,只留下变化本身。

论文证据:微调模型的行为变化在输出文本中难以察觉,但在与基座模型的 logit 差中清晰可见;‘cake’ 相对基座的 +2.94 平均提升是纯差分信号。

推广场景:版本升级的回归测试(对比两版系统的输出分布而非只测新版);药物试验的配对对照组设计;代码 review 中看 diff 而非全文;A/B 测试的指标差分分析。

灵感二:弱一致信号靠大数聚合,不靠单次强度

核心思想:判断一个信号是否真实,看它「重复出现的一致性」而不是「单次出现的强度」。强度会被稀释,一致性不会。

论文证据:微调数据 1:2 稀释后信号强度大减,但被强化 token 仍反复进入各上下文的 Top-K;跨 30,000 上下文计数后,噪声平均回基线、指纹累积到 60%+ 出现率,方法在全部稀释比例下保持优势。

推广场景:用户调研中弱但一致的抱怨信号(跨渠道累积);医学上微弱但稳定的流行病学关联;故障排查中偶现日志的跨样本统计;天文学中对同一暗弱天体的多次曝光叠加。

灵感三:尾部信息承载变化

核心思想:系统状态的变化往往最先体现在分布尾部——头部太显眼、被过多约束,尾部才是自由度所在。观测设计应保留完整分布而非只记录头部。

论文证据:微调强化的行为常位于 logit 分布尾部(概率极低、不会被采样),生成输出完全不可见,但逐 token logit 差能读到;LDA 想激发尾部 token 则需越过连贯性阈值。

推广场景:生态监测关注稀有物种种群(生态系统变化的先导指标);金融风控盯尾部风险而非平均波动;搜索引擎日志中的长尾查询揭示真实需求;异常检测中稀有事件模式的分布位移。

灵感四:秩统计的鲁棒性

核心思想:当不同来源的数据数值不可比时,改用排序(秩)统计——排序对单调变换不变,天然免疫量纲与标定差异。

论文证据:Top-K Diff Mining 只依赖 token 在 logit 差中的排序而非数值,因此 logprobs 与 logit 等价、API 截断后仍可用,构成灰盒可扩展性的根基。

推广场景:跨实验室指标不一致时的秩和方法;推荐系统用相对偏好而非绝对评分;不同评测集分数不可比时用排名对齐;跨语言调查问卷的序数化处理。

灵感五:审计工具应做成「第一步的粗筛」

核心思想:面对未知目标的搜索问题,先跑一个低成本、无目标假设的全局扫描来产生候选,再对候选做昂贵的人工深查——假设生成比假设验证更稀缺。

论文证据:作者明确建议把 Diff Mining 作为任何审计工作的第一道工序:单次无监督 pass 就给出 1/3+ 偏见的语义线索(‘Kotlin’、‘chocolate’……),为审计员提供 head start;缩放规律表明默认参数即可运行,几乎没有调参成本。

推广场景:安全渗透测试先做自动化全端口扫描再人工深入;代码上线前先跑静态分析粗筛再人工 review;医学诊断先做体检指标全景再针对性检查;情报分析先用广谱筛选再定向核查。

灵感六:探测介质的多样性决定可见现象的多样性

核心思想:同一个潜藏对象,在不同探测介质下会显露出不同侧面。只用一种介质,可能系统性遗漏某类现象。

论文证据:FineWeb(英文网页)揭示编程语言类偏见,西班牙语/多语语料额外揭示颜色偏见(只在西语上下文触发),GSM8K 数学语料揭示概率写成赔率的偏见——参考语料的选择本身就是探测维度。

推广场景:材料表征需多种显微/光谱手段互补;用户研究需访谈与行为数据交叉;模型评测需多基准组合;地质勘探需地震、重力、磁法多方法联合。

结语

Diff Mining 的魅力在于它把一个看似需要复杂内部机制分析的问题(微调了什么),还原成了一个朴素的统计问题(哪些 token 被一致地抬高了)。三个数字值得记住:99.5%(‘cake’ 的 logit 差为正的上下文占比——一致性的力量)、1/3(单次无监督扫描在对抗性 Auditing Games 上揭示的隐藏偏见比例——实用性的下限)、0 权重访问(方法对模型内部的需求——可扩展性的来源)。对于关注 AI 安全与可解释性的读者,这篇论文还有一个方法论提醒:有时候,最好的工具不是更深的显微镜,而是更聪明的对照实验。