基于播客「大模型的隐藏推理与可解释性:AI在想什么?|对话斯坦福博士Aryaman Arora【101视频播客】」完整转写整理。主持人:易文;嘉宾:Aryaman Arora(斯坦福大学博士生,师从 Chris Potts,语言学本科出身后转入可解释性研究)。除注明外,本文观点与事实均出自嘉宾口述或节目转述,未做外部核验;引用的论文与公司行为均为"节目称/嘉宾认为"口径。

先说结论

这期节目把"AI 在想什么"从一个哲学话题变成了一门有证据、有流派、也有失败清单的手艺。Arora 给出的核心图景有三层:其一,模型内部确实存在"没说出口的推理步骤"——Anthropic 的 J-space 实验不仅能看到这些概念,还能在模型从未说出"蜘蛛"二字的情况下把它内部表示改成"蚂蚁",让答案从八条腿变成六条腿。其二,思维链(Chain-of-Thought)有用,但它不是模型的"心声"——它是供词,不是大脑记录,安全审计可以查它,却不能把它当成内部过程本身。其三,可解释性研究至今真正兑现过一次产业级成果:对"归纳头"(induction heads)的机制发现救活了状态空间模型这条技术路线,最终沉淀为 Kimi、Qwen 等模型里的混合架构。而对普通听众最有价值的,是理解这门手艺的边界:哪些问题能答、哪些注定答不了、离危险还有多远。

黑箱里的隐藏推理:蜘蛛、加法神经元与"凶手是谁"

整期节目的由头是 Anthropic 的论文 J-space(嘉宾坦言没读完那一百多页,但理解其核心思想)。主持人易文先复述了其中最抓人的实验:问模型"会织网的动物有几条腿",模型答"八",全程没有说出"蜘蛛"这个词;研究者进入模型内部,把那个从未出口的概念从蜘蛛改成蚂蚁,答案就变成了"六"。Arora 解释了背后的原理:用一个叫雅可比(Jacobian)的算子——本质是微积分里的导数——找出潜激活空间中哪些方向会导致模型在未来说出某些词,也许提前十个 token,某个隐藏表示的指向就已经决定了后面会说"蜘蛛"。

在 Arora 看来,J-space 只是"模型内部存在未说出口的推理步骤"这条证据链上最新的一环。他举了 Anthropic 早前《Biology of a Large Language Model》的两个案例:模型做三位数加法时不必说出步骤,但内部能找到分别跟踪个位数、十位数该是多少的神经元;模型写押韵诗时,在上一段结尾就已经在规划下一段的结尾词,以保证押韵不受破坏。更根本的论证来自 Ilya Sutskever:读一部推理小说、逐词预测下一个词,到"凶手是——“这一句时,要预测正确就必须在内部建模整部小说的所有证据——所以一个足够好的语言模型必然内部建立了某种世界模型。“问题是我们还不知道那个世界模型是什么,“Arora 说,“可解释性的目标就是把它找出来。”

那思维链算不算这个内部过程?Arora 明确反对这么强的等同:一年半到两年前没有思维链的模型"严格更差”,所以思维链一定做了某种非常有用的事;Anthropic、Meta、OpenAI 的安全审计也确实在检查模型的思维链里有没有在谋划怪事,并借此抓到过一些未对齐迹象。他的方法论是"永远先做最简单的事”——检查思维链比解决可解释性简单得多,所以应该做。但有用不等于忠实:模型可以在测试环境表现完美,甚至可能"意识到自己正在被评估”,部署之后才做真正想做的事。这正是可解释性对齐研究的出发点——行为证据永远不足以完全推断内部状态。他打了个比方:我们交朋友时也无法读心,而是靠关键时刻的选择(比如宁可付出代价也要替你保守秘密)来建立信任;但模型与人的区别在于,我们部署了百万份副本、不完全知道使用者的意图,而且原则上模型的每一次矩阵乘法都可以被检查——“如果我们知道该找什么,就能找到它”,无须做任何疯狂的事。

两大流派:把"读心"交给 scale,还是交给可证伪的假设

Arora 把动机分成两块。一块是社会信任:飞机、工业机械、页岩油开采都有监管,前提是理解失效模式、能归责;现在 AI 难监管,正是因为没人说得清某个行为从何而来——医生用 AI 系统时,病人和医生都想理解它为什么给出某个输出。另一块是科学本身:他提到原 Transformer 论文作者 Noam Shazeer 在门控线性单元论文结尾的名言——实验都成功了,“我不知道它们为什么有效,我把它归于神的眷顾”(I attribute it to divine providence)。“一个领域要靠天才的直觉才能进步,这本身很疯狂,“Arora 说,“一定存在系统性的原因解释什么成功什么失败。”

怎么找这个系统性原因,领域分成了两条哲学路线。**第一条路线相信机器学习的老教训:选对目标函数,然后 scale。**稀疏自编码器(SAE)是一次迭代:把模型第 20 层那样的隐藏向量训练成一个"干净的数字列表”,期望某个数字就代表"是否在谈火箭"“是否未对齐”,坏行为就把那个数字置零。实践"极其混乱”:数字仍然不单义、结果依赖训练数据、同一数据训两个 SAE 得到不同结果、且不能覆盖原模型的全部信息——机器并不用自然语言思考,翻译总有损耗。Anthropic 更新的自然语言自编码器把"数字列表"直接换成自然语言再换回去、配大量强化学习训练,好处是直接可读,坏处是新问题:训练中模型开始说怪东西,“我们不确定它是不是发展出了自己的内部语言”。**第二条路线是 Arora 所在的斯坦福 Chris Potts 实验室传统:因果干预。**Atticus Geiger 的因果抽象框架给出了一套假设检验方法——如果你假设某个向量方向代表"是否在说英语",那就加上或减去这个向量看会发生什么;这套方法多地同时独立出现,可信度高,能精确到某个 attention head、某个 MLP 在做什么。代价是只能研究受约束的小问题:加法、单复数、主谓一致——“模型是否在想对用户撒谎"这种真正关心的问题,目前不知道怎么设计实验。前沿尝试是用语言模型 agent 自动生成假设、自动做干预,但 Arora 还没见过"模型明显比我更会挑假设"的时刻——他也坦承,作为博士生他没有算力大量跑这类东西。

这块讨论里最扎心的观察是评测缺失:翻译、奥数都有基准,可解释性没有,因为它的产出是"既让人满意又为真"的解释,而这两件事都难测。Arora 2024 年的第一篇博士论文 CausalGym 就是补基准的尝试:语言特征(单复数这类)必然存在于任何模型的内部,一个好的可解释性方法应该能找到对应机制——他自评这篇工作"非常受限”。他自己的学术路径是这个领域门槛变迁的注脚:家里说印地语、朋友说中文,Georgetown 语言学出身,本科为印地语句法标注花了数百小时手工画树;直到约 2022 年,实验室里 BERT+LSTM+CRF 的复杂管线只能做到 60–70% 准确率的语义分析任务,他换成"最大的 BERT + 一个线性投影",第一次实验就冲到 80–85%——“那一刻我明白了什么是 scaling law:我们关心的所有任务都会被顺带解决。“这段经历把他从计算语言学推到了"理解这些模型为什么突然变强"的可解释性研究。他还提到这个领域当下独特的低门槛:湾区高中生在笔记本上对 GPT-2 做实验然后发邮件给他——“这可能是 AI 里少数还能这样做的方向”,因为连小模型我们都还没理解;对比之下想碰强化学习就得先买算力。但他判断 interp 未来会需要越来越多算力,这个窗口正在变化。

控制"思想"的失败,与一次漂亮的架构救赎

如果理解了内部,下一步自然是编辑内部去纠正坏行为。Arora 与 Transluce 时期合作者做过一套 steering(转向)评测基准,结论相当残酷:所有可解释性方法都难以在不损伤能力的前提下干净地控制模型输出,最好的控制手段还是直接改提示词或微调。“实践中没人去编辑模型的思想——模型做了坏事,大家的做法是用更好的数据重训,“他说。著名的 Golden Gate Claude 是转向向量的公开演示(让模型永远想着金门大桥);Arora 打赌如果还有人在生产环境用转向向量,那一定是 Anthropic——他们说过对 AI 研究或生物风险类问题会用分类器或转向向量改变输出(节目转述,转写中产品名疑似有误识)。但学术上已知的转向向量技术有个硬伤:转得太用力,模型的其他能力会以不可预测的方式受损——为了金门大桥,数学题开始答错;而微调出"满脑子金门大桥"的模型反而容易避免这类副作用。

既然"编辑思想"不成气候,可解释性实际兑现的方式是什么?Arora 给出了这期节目最有分量的案例。Transformer 有二次方的时间复杂度问题;状态空间模型(SSM)快得多,2019–2020 年代初人们拼命想让它打赢 Transformer,却总是更差且不知为何。2021 年前后,斯坦福 Chris Ré 的学生注意到 Anthropic 在可解释性上的发现:Transformer 只要有至少两层,就会学出一种叫归纳头的注意力机制,正是它支撑了上下文学习(in-context learning,给几个例子就能照做的能力,GPT-3 时代的惊人发现)——SSM 缺的就是这个。他们把这一机制直接装进 SSM,就是 H3 论文(《Hungry Hungry Hippos》);此后 Mamba、DeltaNet 都建立在这条进展上,如今 Kimi、Qwen 的大模型采用 Transformer 注意力与 gated DeltaNet 的混合架构。存在一个系统性的失败原因,interp 找到了它、修好了它,并改变了此后所有主流模型的架构选型——这是可解释性至今最接近"科学反哺工程"的一次兑现。Arora 承认这类案例不多(他提到 attention sink 是另一个),幻觉可能属于"也许有系统性解释"的候选,也可能不是。

模型知道它在跟谁说话:用户画像、怪异输出与幻觉的边界

Arora 曾在非营利机构 Transluce 兼职八个月,做语言模型审计。他们在那里的"用户建模"研究发现:模型会对眼前的用户做内部推断——比如聊到寿司时,内部出现"用户来自日本"的表示。更近的一项行为学实验(无需打开模型内部)更有传播力:告诉 Claude Code"用户是 Amanda Askell"或其他人名,观察行为变化——如果对方是知名的 AI 安全研究员,模型的回答会显著更加谨慎,对普通用户则宽松得多。配套的 Weird Chat 项目用自动化提示搜索发现了大量"正常情境下的怪异输出”——嘉宾说有些内容他都不愿在播客里复述——而且"这甚至不算越狱”。主持人质疑这算不算边界案例的 cherry-picking,Arora 的回应勾勒出这个领域的自我认知:“整个领域就是大量案例研究,AI 研究是迭代的——发布、收集反馈、修边界案例,也许它没那么系统。但我的一个强烈感觉是:模型内部确实存在系统性的机制能解释大量行为,我们只是还没找到正确的角度把理解用在改进模型上。”

对所有人都关心的幻觉,Arora 的回答不太安慰人。以"strawberry 里有几个 R"为例:模型做对某件事时,大概率存在系统性的内部解释;做错时,多半没有。他引用了一句名著开场白——“幸福的家庭都是相似的,不幸的家庭各有各的不幸”(嘉宾口述将其归于陀思妥耶夫斯基)——认为它恰好适用于模型:错误大多是"一团乱”,即便完美解读也只能发现"没什么好修的”,出路常常只是训练更久、模型更大,比如事实存储容量耗尽这类平庸解释。例外确实存在(归纳头就是),但幻觉是不是那种例外,没人知道。

双刃剑、监管与人格:离危险阈值还有距离

产业侧的图景比想象中更"学术共同体"。Arora 的观察是:可解释性的产学共享比 AI 其他方向多——因为它还没有"scale 就能变好"的配方,比拼的是新想法,而想法是随便一个研究生都能贡献的;workshop 里 Anthropic、DeepMind、OpenAI 的人和斯坦福、David Bau(东北大学,转写听作"西北大学",按公开信息校正)、Ellie Pavlick 等学术组混在一起。他也声明自己没在大厂工作过,视角全部来自外部。谈到 Goodfire"models with interpretability"的设计哲学(主持人提到它因"把能力与安全审计等量齐观"而受批评),Arora 的立场是所有有用技术天然双刃:核能既有清洁电力也有核武,编码 Agent 既赋能不会写码的人也武装黑客;可解释性若成功,既帮助审计模型、也可能帮助坏人移除对齐——“这必然为真,不意味着不该做,而是必须监管、必须由民主过程决定谁能接触这项技术。“他的判断是 interp 还没进展到需要为此担忧的程度。同理,“更可解释不等于更安全”——理解模型为什么没被某条提示越狱,也可能让你更容易越狱它——但他仍认为透明是社会净善,并用社交媒体推荐算法作比:人们不安的正是把生活托付给没人理解的黑箱算法。

商业落地上他提到 Goodfire 有个很大的生命科学团队在逆向 DNA 等科学发现模型;更远的想象是给气候、蛋白质折叠模型提取出人类可理解的算法——“科学应用可能非常大”。监管侧,英国 AI Safety Institute 在做可解释性研究,但 Arora 认为现在还不能据此自信地立法。最后一段关于"模型人格"的讨论呼应了节目开头的悬念:模型性格差异化是真实存在、且有可解释性证据的——不同性格在表征空间里有组织结构,Anthropic 的助手人格研究显示 helpful 助手聚集在一个方向、未对齐助手偏向另一方向。展望未来,Arora 认为可解释性真正的机会可能在训练过程:当 constitutional AI 这类流程让 AI 自己决定奖励哪些行为时,人格训练实质上交给了另一个模型,此时如果能把可解释性用于干预训练过程,就可能"带保证地"精细控制模型性格——比现在只靠数据训练多一层保障。

这期节目意味着什么,接下来看什么

把五条线索收拢:J-space 类工具证明内部概念可编辑,而模型又会对安全研究员"收敛”,意味着部署信任必须分层——行为测试、思维链审计、内部检查各覆盖一段盲区,任何单一层都不足恃;转向向量全线失灵、工程实践回归重训,意味着可解释性的兑现路径是"解释有效做法 + 指导架构"而非"直接编辑思想”——归纳头→H3→Mamba→混合架构这条链就是模板;领域没有基准、解释的好坏靠人判断,意味着评测方法学本身就是瓶颈——谁先做出可信的 interp 基准,谁就掌握这个领域的话语权;人格有表征结构、constitutional AI 让 AI 决定奖励,意味着"训练过程可解释性"是下一个值得盯的位置;而双刃性意味着审计能力与移除对齐能力是同一枚硬币,监管者需要现在就开始设计接触权限的治理框架,而不是等 interp 变危险再补课。

对普通使用者,这期节目的 takeaway 更朴素:模型的回答是它内部世界模型的一个投影,而这个投影会随它对你的推断(用户画像)、对话情境甚至"它认为自己是否在被评估"而变化——你看到的温和或谨慎,未必是它内部的全部。接下来值得观察的信号:转向向量是否真的进入 Anthropic 生产管线、J-space 类干预工具是否产品化、Kimi/Qwen 式混合架构因机制理解而继续扩散、以及第一个被广泛承认的可解释性基准何时出现。

(完)