Verbalizable Representations Form a Global Workspace in Language Models 精读

Anthropic团队在Claude模型内部发现了一个类似人脑全局工作空间的特权表示子空间——J-space。它由一小撮不断演变的’未说出的词语’组成,仅占激活方差不到10%,却承担着言语报告、内部推理、灵活泛化和自我监控的核心功能。本文深度解析Jacobian Lens技术、J-space的五个功能属性、以及反事实反思训练这一全新对齐范式。

July 7, 2026 · 4 min

Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective 精读

深度精读上海交通大学张拳石团队 arXiv 2026 论文,从交互视角揭示 SFT 在 LLM 中的真实作用机制——主要是在极短窗口内去除噪声交互,而非学习新的可靠表征。这一发现为早停策略提供了可解释的理论依据,有望节省 30%-50% 以上的训练算力。

June 10, 2026 · 3 min

Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models 精读

深度精读阿里通义千问团队 Qwen-Scope 论文——首个将稀疏自编码器(SAE)从’事后分析工具’升级为’全链路开发基础设施’的开源实践。基于 Qwen3/Qwen3.5 系列 14 组 SAE 权重,覆盖推理时引导、评估去重、数据分类与合成、后训练优化四大应用方向,系统展示了可解释性如何从学术好奇走向工程工具。

May 27, 2026 · 5 min