A Formal Limitation on Learning Human Language From Textual Corpora 精读

纯文本训练的大语言模型到底能学到多少意义?这篇来自 Universitat Pompeu Fabra 与 ETH Zürich 的论文用信息论给出了严格答案:无论模型多大、数据多少,任何只看话语形式的系统恢复说话者意图的概率都存在不可逾越的上界。论文将语言使用建模为意义、语境、话语的联合分布,推导出由互信息刻画的意义恢复天花板,并在人工语言、中文零代词消解(天花板 0.93)与颜色指称(天花板 0.66)三类实验中验证了理论。本精读将拆解两大定理的证明思路、实验设计与这一结果对 LLM 语义能力争论的原理性回答。

August 31, 2026 · 4 min

Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge 精读

深度精读清华大学、腾讯优图实验室与华威大学合作的 ElephantBench:一个包含 1,094 道题的闭书知识探针,专门诊断大模型参数记忆中的『认知近视』——记得主流记述却漏掉少数派记述。文章拆解其从低曝光语料挖掘自然冲突的图构建管线、C/P/F/K 四指标体系、32 个模型的评测结果(最强者完整回忆仅 52.4%),以及曝光不对称与记忆完整性的因果关联,并提炼可推广到数据策展与评测设计的通用灵感。

August 31, 2026 · 5 min

CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents 精读

首尔国立大学与卡内基梅隆大学提出针对RAG的伪装式知识库投毒攻击CamoDocs。现有投毒攻击(PoisonedRAG、PIA、CorruptRAG)依赖查询包含——把目标查询写进投毒文档以提升检索命中——但这留下词法与嵌入空间伪影,简单的查询检测即可把ASR压到12%以下。CamoDocs反其道而行:合成良性+对抗双草稿、均匀切块,在良性块上做梯度引导的弥散token替换,把投毒文档嵌入推离质心以瓦解聚类防御的几何前提,再用轻量语言模型困惑度做连贯性过滤控制可读性损失。在7种防御×3开源模型×3数据集上,CamoDocs是唯一全面有效的攻击(HotpotQA+Llama平均ASR 60.81% vs PoisonedRAG 43.87%),闭源模型GPT-5.4-mini上仍达61.80%;同时暴露TrustRAG类重擦除防御在检索依赖基准NeoQA上删除91.48%检索文档、干净准确率从29.13%崩到5.79%的实用性代价。本精读拆解其攻防双方的机制因果链。

August 31, 2026 · 2 min

Cross-Session Decomposition Attacks: Scaling Risk and Intent-Aligned Retrieval Defense 精读

滑铁卢大学与Vector Institute提出跨会话分解攻击:攻击者在互不关联的会话中提出看似良性的子问题,事后在模型外重组为有害目标。论文首次将其形式化为组合安全风险,证明风险转移定理——部署模型与参考环境的组合风险之差由允许子查询上的超额损失控制,说明缩放会把潜在组合风险转移到部署模型。配套600意图实验显示同族内更大模型重组后危害更高,而22M参数的IntentAlign-MiniLM意图对齐检索器以少25倍的参数超越0.6B嵌入模型,并证明检索是防御的主导杠杆。本精读覆盖其理论推导、双轨实验证据与防御设计的因果链条。

August 31, 2026 · 3 min

Fairness Invariants 精读:用循环不变式思想定位并修复算法公平性缺陷

招聘、贷款、量刑等高风险自动决策系统里藏着一种隐蔽缺陷:两个只差一个受保护属性(种族、性别、年龄)的相似个体,却得到不同决策。这篇被 ISSTA 2026 录用的论文借鉴程序设计语言中的循环不变式合成思想,提出 Remi 框架:把反事实配对转化为关系数据集,用决策树学出可读的公平不变式规则,再把规则当作运行时护栏,在不重训模型的前提下定位真值歧视根因超过 83% 的案例,并把黑盒神经网络的歧视决策削减 42% 至 94%,显著优于重训练类缓解基线。

August 31, 2026 · 3 min

Fast Weight Attention for Continual Learning 精读

深度精读 ByteDance Seed、Princeton、清华、UCLA 与 Hyperbolic Labs 合作的 Falcon 论文:把线性注意力与状态空间模型的状态转移显式化为在线学习规则,发现读后写语义下快记忆的正确训练对应是前缀配对 φ(k(t-1))→v(t) 而非常见的同对配对,并从平方误差回归与内积两个局部目标统一推导出 NLMS 归一化的六个变体族(Falcon-1/2/3 与 Falcon-1A/2A/3A),全部兼容 SSD 式 chunk 并行训练。语言建模上与最强递归基线互有胜负,变长加法外推上 Falcon-3A.3 以 87.2 平均精度大幅领先 Transformer 的 65.8。

August 31, 2026 · 6 min

Lost in Compression 精读:抽取式提示压缩器的跨语言审计

提示压缩号称能砍掉 LLM 推理成本,但主流学习型压缩器几乎全部用英语训练和评估。这篇来自 Hostinger 与考纳斯理工大学的论文做了一次严格的受控跨语言审计:在十种语言、五种文字系统的完全平行数据上,用目标模型分词器做预算匹配对照,超过 25.8 万次评估调用后发现迁移差距真实存在且随压缩强度急剧放大——保持率 0.33 时英语保留 57 至 62 个百分点的上下文价值,中文几乎归零。差距由监督语言而非模型架构驱动:三种英语训练的压缩器全部复现差距,多语训练的 XProvence v1 完全没有差距,确定性基线也无差距。非英语的安全压缩预算只有英语的一半左右。

August 31, 2026 · 3 min

Muon with Finite Newton-Schulz 精读:有限迭代不是误差,而是收敛的功臣

Muon 已被用于 Kimi K2、GLM-4.5 等前沿模型训练,其核心是用几步 Newton-Schulz 迭代近似动量的正交化。此前的理论要么把这一迭代换成精确极分解,要么把有限深度当作需要控制的逼近误差。本文反转视角:通过折扣在线到非凸转换框架证明,有限 Newton-Schulz 恰恰是让 Muon 在非光滑非凸目标上收敛的平滑机制。深度 q 调节惩罚项与稳定性项的权衡,取 q=O(log(1/ε)) 即可得到匹配最优界的平稳点复杂度,而精确极分解版 Muon 反而可能不收敛。

August 31, 2026 · 4 min

Mutual Debiasing via Dual-Seed Comparison for Probabilistic Sampling in Large Language Models 精读

LLM 能讲清概率分布,却抽不出一个符合分布的随机数——这是被多项研究证实的「认知-行为鸿沟」。山东大学与浙江师范大学团队提出 DSC(双种子比较):让模型生成两条独立随机字符串,逐位置比较 ASCII 序值得到 16 位比特串,再经透明算术管线转成均匀变量并映射到目标分布。理论上比较位偏离公平硬币的概率仅为字符碰撞率的一半;实验中 DSC 在 25 个模型-分布条件的 24 个上取得最低 KS 统计量,误差相对最强基线中位数降低 58.5%,在选择题答案位置控制与属性约束文生图等下游任务中同样显著去偏。

August 31, 2026 · 3 min

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper 精读

深度精读北邮、北大与腾讯微信AI合作的 VERA-RL。论文研究’无预设问题、无预设证据’的全文科学错误检测:构建 Reason–Verify–Scan 三阶段课程链数据集 VERA-13K(12,900 样本、6 类错误),用 DAPO 算法与三维奖励(推理完整度+证据对齐+错误精确度)训练 Qwen3-VL-8B,Scan 综合分从 2.0 升至 19.5,超过 235B-Thinking 模型;消融证明单奖励训练会让 Scan 崩溃、纯 Scan 训练反而更差,三维奖励与混合课程缺一不可。

August 31, 2026 · 4 min