Language Models Can Control Their Own Attention 精读

长上下文解码时,模型每生成一个 token 都要把整个 KV cache 读一遍——1M token 上下文意味着每步约 15GB 的内存搬运,而注意力其实高度集中。KAIST AI 联合 Google DeepMind 提出 Declarative Attention:让模型在思维链里用 // 三种标签自己声明’现在需要看哪里’,推理引擎像解析工具调用一样解析声明并跳过绝大部分 KV 读取。零训练、零外部打分器,15 个长上下文任务上 Gemma-4-31B 注意 token 降 52.0%、精度仅降 1.27pp。本精读拆解三模式协议、与代理打分式稀疏注意力的机制差异,以及’模型自己最知道该看哪里’的第一性原理。

September 4, 2026 · 3 min

A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families 精读

RIKEN AIP、东京科学大学与浙江大学团队提出并利用了模型合并家族的族级越狱威胁:即使所有成分模型都独立安全对齐,从同一预训练骨架派生的合并模型仍共享源自骨架的脆弱方向。BAJ 方法把越狱后缀生成形式化为合并空间上的 min-max 优化,用任务算术参数化盆地,交替执行后缀变异搜索与合并系数梯度上升,迫使后缀攻破全族最难攻击的构型。六个主流骨架上族级迁移成功率 61.3-89.1%,领先最强基线 22-34 点;跨六种合并方法、水印与量化部署依然有效;Perplexity 等现有防御几乎无效。消融证实:系数最大化搜索换成随机采样 TSR 从 65.8 跌至 32.4,攻击普通微调模型降至 27-51%,跨骨架迁移显著弱于同骨架——证明漏洞确实源自预训练骨架且由合并结构暴露。

August 31, 2026 · 3 min

Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers 精读

深度精读 Thomson Reuters Labs 与多伦多大学/Vector Institute 合作的 LLM 评分器顺序依赖论文。批式打分(reranker、奖励模型、多文档 QA)中每个分数都依赖候选排列顺序,论文发现排序质量相同的评分器在下游决策上大相径庭:五个 nDCG@10 差距不超过 0.010 的已训练评分器,重排后保留集重叠度横跨 0.656 到 0.835。提示词层修复(round-robin 划分、logit 校准)完全触达不到决策端;提出的 OC-SFT 在损失函数中显式惩罚同一窗口 N 个排列下自身分数的方差,τ-PSI 从 0.209 降至 0.083,保留集重叠升至 0.835,单次前向即超过十排列集成的 BSC,且 nDCG@10 不降反微升。

August 31, 2026 · 3 min

Fairness Invariants 精读:用循环不变式思想定位并修复算法公平性缺陷

招聘、贷款、量刑等高风险自动决策系统里藏着一种隐蔽缺陷:两个只差一个受保护属性(种族、性别、年龄)的相似个体,却得到不同决策。这篇被 ISSTA 2026 录用的论文借鉴程序设计语言中的循环不变式合成思想,提出 Remi 框架:把反事实配对转化为关系数据集,用决策树学出可读的公平不变式规则,再把规则当作运行时护栏,在不重训模型的前提下定位真值歧视根因超过 83% 的案例,并把黑盒神经网络的歧视决策削减 42% 至 94%,显著优于重训练类缓解基线。

August 31, 2026 · 3 min

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation 精读

LLM 能不能认出自己写的文字?这个『自生成文本识别(SGTR)』问题直接关系到 AI 安全:控制协议(蜜罐、受信编辑)和多智能体防合谋都依赖模型无法分辨内容来源,而 LLM-as-a-Judge 评估则可能因评审认出自己的输出而产生系统性偏袒。以往研究结论互相矛盾——有的说模型识别能力很强,有的说不超过随机。本文用『操作化』框架化解了冲突:识别精度随评估格式(成对/单条)、会话格式(用户标签/助手标签)与任务域(摘要/对话/安全问答/代码)大幅波动。核心发现是『质量启发式』主导混杂:模型倾向把自认为高质量的文本归于自己(识别精度与 Arena Elo 分差正相关 R²=0.23-0.34)。SFT 训练可提升 SGTR 并跨操作化迁移,还会放大 AlpacaEval 2.0 评审的自偏好;对抗训练则能把偏好重定向到任意目标模型。

August 31, 2026 · 2 min

Sycophancy Suppression Can Impair Rational Updating 精读:抗谄媚不应牺牲理性纠错

伊利诺伊大学芝加哥分校与新加坡国立大学提出:LLM 的答案翻转分为无依据屈服与理性更新两类,主流抗谄媚方法在压制前者的同时往往连带损伤后者。两轮诊断实验显示 DPO 抗压训练让 Llama-3.1 屈服率降 32.9 个点却让理性更新率掉 48.9 到 53.7 个点,联合优化也难以幸免。机制分析进一步发现两种行为共享大量 MLP 神经元与注意力头、steering 方向余弦相似度全 16 组为正,说明纠缠是结构性的。论文主张抗谄媚是选择性问题而非压制问题,正交化 steering 的初步探索把选择性设置从 5/36 提到 10/36。

August 31, 2026 · 3 min

The Approximation Rank of Softmax Attention: Sharp Geometric Laws and Robust Interaction Dimension 精读

Transformer 的注意力矩阵到底需要多高的秩才能被低秩近似?南洋理工大学与卡内基梅隆大学的理论工作给出了两条尖锐几何定律:当 query 与 key 都落在单位球面上时,输出保持的逼近秩按温度参数的 (d-1)/2 次幂增长;而换成整个单位球(多出一个径向自由度)后指数恰好变为 d/2。更有意思的是每个具体注意力头:softmax 的行归一化会精确商掉一批不可见的 logit 方向,剩下 r 维可见交互几何,逼近秩服从 minimax 尖锐的 r/2 指数定律。在 84 头 BERT-base 校准集上,SVD 有效维数与有限构造秩上证书的 Spearman 相关达 0.574/0.606,为『注意力头到底有多复杂』提供了可计算的几何量尺。

August 31, 2026 · 5 min

When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models 精读

「LLM 不能跳变(jump)」——即无法完成爱因斯坦式的从证据到新公理系统的溯因飞跃——是一个流传甚广的论断,但从来没人给出过「跳变」的形式化定义和可检验的度量。剑桥大学与新南威尔士大学团队用范畴论补上了这块拼图:把跳变拆成四步(默认补全是什么、何时被迫放弃、放弃何时正确、跳变如何复合),并测量第二步。左/右 Kan 扩张给出模型无约束时的「默认答案」(已被证明等价于误差最小化归纳,校准实验证实 98% 无约束输出确实是它);跳变实例则携带机器可验证证书保证正确答案存在、唯一且必异于默认。结果出人意料:4 个前沿模型在全部 248 次约束试验中,一次也没有退回被排除的默认答案(Kan-default 率为零)——选择步不是瓶颈,若无能真实存在,位于生成约束或发明框架的上游。

August 31, 2026 · 2 min

Diff Mining: Logit Differences Reveal Finetuning Objectives 精读

微调后的模型究竟学到了什么?Diff Mining 给出了一个简单而有效的答案:在无关的通用语料上逐上下文计算微调模型与基座模型的 logit 差,再用 Top-K 频率统计或 NMF 分解聚合,即可提取一组刻画微调目标的指纹 token。该方法无需访问模型内部权重,属灰盒方法,可扩展到大模型与 API 场景。在 Auditing Games 基准上,单次无监督扫描即识别出超过三分之一的隐藏偏见;在全部数据稀释比例下均优于 ADL 基线。本精读覆盖背景、方法、实验证据与优势根源的因果链分析。

August 29, 2026 · 5 min

Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable 精读

深度精读独立研究者 Pranav Aggarwal 的 Agent 校准论文。核心发现:让 12 个前沿模型对一个不可预知的问题做方向性判断,看到一个专业行情面板后承诺率从 6.5% 飙到 54.0%——而把面板上所有数字全部伪造,承诺率几乎不变(37.6% vs 36.8%)。触发自信行动的不是信息而是包装的权威性。失败被精确定位在「行动门控」而非判断或信念,且该门控可用 540 条骰子硬币合成数据训练归零,但又会在剥夺推理空间的输出格式下崩溃。

August 28, 2026 · 2 min