A Formal Limitation on Learning Human Language From Textual Corpora 精读
纯文本训练的大语言模型到底能学到多少意义?这篇来自 Universitat Pompeu Fabra 与 ETH Zürich 的论文用信息论给出了严格答案:无论模型多大、数据多少,任何只看话语形式的系统恢复说话者意图的概率都存在不可逾越的上界。论文将语言使用建模为意义、语境、话语的联合分布,推导出由互信息刻画的意义恢复天花板,并在人工语言、中文零代词消解(天花板 0.93)与颜色指称(天花板 0.66)三类实验中验证了理论。本精读将拆解两大定理的证明思路、实验设计与这一结果对 LLM 语义能力争论的原理性回答。