Verbalizable Representations Form a Global Workspace in Language Models 精读
Anthropic团队在Claude模型内部发现了一个类似人脑全局工作空间的特权表示子空间——J-space。它由一小撮不断演变的’未说出的词语’组成,仅占激活方差不到10%,却承担着言语报告、内部推理、灵活泛化和自我监控的核心功能。本文深度解析Jacobian Lens技术、J-space的五个功能属性、以及反事实反思训练这一全新对齐范式。
Anthropic团队在Claude模型内部发现了一个类似人脑全局工作空间的特权表示子空间——J-space。它由一小撮不断演变的’未说出的词语’组成,仅占激活方差不到10%,却承担着言语报告、内部推理、灵活泛化和自我监控的核心功能。本文深度解析Jacobian Lens技术、J-space的五个功能属性、以及反事实反思训练这一全新对齐范式。
深度精读上海交通大学张拳石团队 arXiv 2026 论文,从交互视角揭示 SFT 在 LLM 中的真实作用机制——主要是在极短窗口内去除噪声交互,而非学习新的可靠表征。这一发现为早停策略提供了可解释的理论依据,有望节省 30%-50% 以上的训练算力。