AI在想什么:模型没说出口的推理,与可解释性唯一一次漂亮的兑现
斯坦福博士生、语言学科班出身的 Aryaman Arora 做客硅谷101视频播客谈大模型可解释性:Anthropic 的 J-space 实验证明模型内部存在从未说出口的推理概念,且可被直接编辑——内部把"蜘蛛"改成"蚂蚁",答案就从八条腿变成六条腿;思维链有用但不等于模型的真实内部过程;SAE 与因果干预两大流派各有硬限制,学术界的转向向量控制几乎全线失灵,工程实践仍回归重训;该领域至今最漂亮的兑现是归纳头的发现救活了状态空间模型谱系(H3→Mamba→DeltaNet,直至 Kimi/Qwen 的混合架构);Transluce 的用户建模显示模型面对 AI 安全研究员时会显著更谨慎;可解释性天然双刃,但嘉宾判断它离危险阈值还很远。