论文链接:Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus 代码仓库:StartluxLabs/Massive-Activations-HLA(训练检查点见 HuggingFace: startlux-models/Massive-Activations-HLA) 发表时间:2026年8月 机构:Startlux(企业方,第一完成单位)+ 清华大学 + 中国科学院大学 + 香港大学 + 悉尼大学 + 哥伦比亚大学。典型的企业与多校联合研究:Startlux 提供研究主线与算力支持,多所高校研究者共同完成实验与写作。 领域标签:cs.CL(Computation and Language),可解释性 / 混合架构 / 激活动力学
一、论文背景
要从零理解这篇论文,需要先弄懂四个概念:巨大激活、注意力汇、线性注意力、混合线性注意力架构。我们逐个讲。
1.1 什么是巨大激活(Massive Activations)
把 LLM 想象成一条流水线:一个词进入模型后,逐层经过几十个 Transformer 层的处理,每一层内部都会产生成千上万个数值(激活值)。正常情况下,这些数值的大小都在一个差不多的量级,比如几到几十。但 2024 年 Sun et al. 的研究发现:模型里存在极少数"离谱"的数值——它们的幅度比典型激活大几个数量级(比如上千、上万),且总是固定出现在个别特定的 token 位置、特定的隐藏维度上。这就是"巨大激活"(Massive Activations,MA)。
一个直觉类比:如果说正常激活是城市里正常高度的楼房,MA 就是几栋突然拔地而起的摩天大楼——数量极少、位置固定、高得离谱。它们不是 bug,而是模型有意为之的计算结构:MA 与注意力机制紧密耦合,携带 MA 的 token 往往吸走后续 token 的不成比例的注意力。研究 MA,等于拿到一把观察模型内部计算如何组织的探针。
1.2 什么是注意力汇(Attention Sink)
LLM 生成每个词时,会"回头看"前文所有词并分配注意力权重。经验发现:序列的第一个 token(哪怕是无意义的 BOS 符号)、句号、逗号、换行符、以及 “the”、“is”、“of” 这类无实义的功能词,常常获得极高的注意力权重——大量注意力"汇入"这些位置,故称"注意力汇"(attention sink)。
一个流行的解释是"信息垃圾桶"假说:Softmax 注意力要求对每个词都分配正的权重,模型处理不需要回看的词时,只能把多余的注意力倾倒到一个"安全"位置——语义内容最少的 token 就成了最佳垃圾桶。StreamingLLM 等工作正是利用 sink 现象让模型能"无限"滑窗生成。MA 与 sink 紧密相关:MA 所在的 token 常常就是 sink token。
1.3 什么是线性注意力
标准(全/Softmax)注意力的代价是:任意两个词之间都要算一次相关性,计算量和显存随序列长度平方增长——长上下文下代价高昂。线性注意力的思路是改写计算形式:不再两两比较,而是维护一个固定大小的循环状态(类似 RNN 的记忆),读一个词、更新一次状态,代价随长度线性增长。代表方法包括 RetNet、GLA(门控线性注意力)、DeltaNet、GDN(Gated DeltaNet)、Mamba 系状态空间模型等。
但天下没有免费的午餐:固定大小的状态意味着有限的记忆容量。在需要精确回忆前文细节的任务(如"大海捞针"检索)上,纯线性注意力模型明显弱于全注意力模型。
1.4 混合架构 HLA:折中方案与新问题
于是工业界近两年的主流做法是混合:大部分层用线性注意力(便宜、快),每隔几层插入一个全注意力层(记忆好),层层交错。以"12:1"表示每 12 个混合层含 1 个全注意力层。Kimi Linear、Qwen3.5、Nemotron-H、Zamba2 等开源模型都采用这类设计。
问题来了:混合化之后,MA 还在吗?长什么样? 此前的研究全部针对传统全注意力 LLM,MA 在 HLA 中的行为"基本未被探索"。这不是小事——MA 直接影响量化(离群值让低比特量化变得困难)、影响注意力分布、影响我们对模型内部机制的理解。如果 HLA 重塑了激活动力学,那么为全注意力模型设计的量化、剪枝、推理优化方案可能都需要重新审视。这篇论文就是第一个系统回答该问题的工作。
二、论文定位和关联工作
论文处在三条研究脉络的交汇点:
脉络一:巨大激活与系统性离群值研究
- Sun et al. 2024(arXiv:2402.17762):首次系统刻画全注意力 LLM 中的 MA——稀疏、极大、集中在特定维度与 sink token 上。本论文直接继承了其"MA 是注意力耦合现象"的出发点。
- An et al. 2025:提出"系统性离群值"(systematic outliers)框架,追踪带符号的跨层离群动态。本论文第 4 节的机制分析正是基于这一框架扩展到 HLA 场景。
- Gallego-Feliciano et al. 2025:研究 MA 在训练过程中的动态。
- 关键区别:以上全部只研究全注意力模型;本论文将问题推进到层间交错混合架构。
脉络二:注意力汇研究
- Xiao et al. 2024(StreamingLLM):发现 sink 并用于外推生成。
- 作者团队自身的前序工作:KVSink(COLM 2025)、OScaR、RotateKV(IJCAI)、注意力汇综述——可见这是该团队在 sink/量化方向的持续深耕,本论文是其研究版图向 HLA 的自然延伸。
- Qiu et al. 2026(NeurIPS):发现门控注意力可消除全注意力 Transformer 的 MA 与 sink——直接启发了本论文的门控干预实验设计。
脉络三:混合架构与系统性分析
- M-A-P 系统分析(arXiv:2507.06457):提供了本论文主控实验所用的统一预训练模型套件(340M/1.3B、多种混合比),保证了受控对比的可靠性。
- “Just Read Twice”:论证线性注意力的召回差距,是 HLA 动机的代表性工作。
- 各混合模型(Jamba、Nemotron-H、Zamba2、Kimi Linear、Qwen3.5 等)本身作为分析对象进入本论文。
定位总结
| 维度 | 之前的路线 | 本论文的突破 |
|---|---|---|
| 研究对象 | 全注意力 LLM 的 MA | 层间交错 HLA LLM 的 MA(首个系统研究) |
| 形态认知 | MA 稳定存在于少数固定层 | 发现 PAS/ISP 两种新形态,且随混合比渐变连通 |
| 追踪方法 | 按幅值排序找 MA(在 HLA 中失效) | 共识注意力汇 token 锚点追踪 |
| 机制解释 | MA 与 sink 耦合(静态描述) | “写入-汇聚-抵消"生命周期,抵消时机统一解释形态 |
一句话定位:这是把 MA 研究从全注意力世界推进到混合架构世界的第一份系统性地图,并给出了统一机制解释。
三、问题定义
3.1 从具体现象到抽象问题
具体现象:HLA 模型的隐藏激活里出现了奇怪的图案——有时是孤立的尖峰,有时是绵延的平台。它们是什么?有意义吗?
抽象洞察:论文发现这些图案不是随机的,而是与架构排布严格对齐的——尖峰总是出现在全注意力层的紧邻前一层,平台总是横跨两个尖峰之间的线性注意力层。这意味着 MA 形态成了架构的"指纹”:研究 MA 动力学 = 获得一把探测混合架构内部信息流的探针。
形式化问题定义:
- 给定:层间交错 HLA LLM,总混合层数 L、全注意力层数 L_FA,混合比 ρ = L / L_FA;输入序列 x;共识 sink token t*;激活轨迹 m(ℓ) = ‖X_{t*,:}^{(ℓ)}‖_∞(sink token 在第 ℓ 层隐藏状态的最大绝对值分量)。
- 求:(1) MA 在层间如何分布(形态学)?(2) 形态由什么机制产生、由什么因素调制?(3) 混合比 ρ 趋于 1(全注意力极限)时形态如何演化?
- 约束:结论必须跨架构(5 种线性变体)、跨配置(6 种混合化方式)、跨领域(5 个数据域)、跨规模(1.2B–397B)成立,且需受控预训练实验排除"预训练巧合"的解释。
3.2 抽象的精妙之处
这个定义的巧妙在于方法论的翻转:传统上按激活幅值排序追踪 MA(找最大的激活),但论文在 3.2 节发现该方法在 HLA 中失效——sink token 的幅值排名不稳定,最大激活 token 在相邻层间频繁切换。于是改为以共识注意力汇 token 为锚点(在所有全注意力层、所有头、所有 query 上平均注意力概率取 argmax),追踪该 token 的跨层激活轨迹。锚定"位置"而非"幅值",才能看清层间组织结构。这就像追踪河流:不该跟着水流速度最快的点走(会来回跳),而该沿着河道走。
四、问题解法
论文解法分四步:定义形态 → 量化形态 → 跨模型验证 → 干预与机制分析。
4.1 第一步:定义两种形态(形态学)
- PAS(Pre-Attention Spike,注意力前尖峰):MA 在全注意力层紧邻之前的层形成局部极大值。类比:每次全注意力层"登场"前,激活都会先来一次冲高——像心跳前的收缩。
- ISP(Inter-Spike Plateau,尖峰间平台):MA 不在尖峰后立即消失,而是在相邻两个 PAS 之间的线性注意力层中持续保持高位,形成平台。类比:心跳没有完全回落,而是维持成一条高原。
4.2 第二步:设计两个量化指标
| 指标 | 定义 | 取值与方向 | 衡量什么 |
|---|---|---|---|
| Sink–spike 对齐率 Align(D) | 对每个全注意力层 f:检验共识 sink token 是否恰在其前置线性注意力块中的 f−1 层取得最大激活(指示函数),在 500 输入 × 所有全注意力层上取平均 | 0–100%,越高越强 | PAS 存在的确定性:尖峰位置与全注意力层排布的锁死程度 |
| 尖峰间保留分数 ISR(D) | 对相邻 PAS 对(位于 p_i = f_i−1 与 p_{i+1} = f_{i+1}−1 层):中间各层激活相对较弱一侧 PAS 的比值,截断于 1,对层与对取平均 | 0–100%,越高平台越平 | ISP 的持续性:尖峰之间激活衰减有多快 |
类比:Align 回答"心跳是否总在固定节拍点出现",ISR 回答"两次心跳之间血压是否维持住了"。
4.3 第三步:跨模型、跨配置、跨领域验证
- 受控实验:基于 M-A-P 统一预训练套件,在 340M 与 1.3B 两个规模上,对 RetNet、HGRN、GLA、DeltaNet、GDN 五种线性架构 × ρ ∈ {24, 12, 6, 3} 混合比训练模型;以纯线性与纯全注意力模型为两端参照。
- 输入:5 个数据域各 100 条共 500 条输入——WikiText-103(通用散文)、Scientific Papers(科学论文)、GSM8K(数学)、CodeSearchNet(代码)、FLORES-200(多语言)。
- 真实模型:4 个家族 12 个开源检查点(1.2B–397B,含 base 与 instruct 版本)。
- 受控预训练:从零训练 24 层 GDN 混合模型,检查点间隔 1B(340M)/ 5B(1.3B)token,用于观察形态何时出现、门控干预有何影响。
4.4 第四步:门控干预与机制分析
- 门控实验(详见第六部分):给全注意力层加输出门控 vs 移除 GDN 原生输出门,观察两种形态的响应。
- 机制分析:基于系统性离群值框架,追踪带符号离群值在固定坐标上的跨层动态,在 1.3B GDN 12:1 模型的第 12 层全注意力处做固定坐标解剖,还原"写入-汇聚-抵消"三阶段生命周期。
五、评估指标与实验证据
5.1 主指标:Sink–spike 对齐率(证明 PAS 普遍存在)
表 1:对齐率(%,12:1 混合比,格式为 1.3B / 340M,五域宏观平均)
| 线性架构 | WikiText | Sci.Papers | GSM8K | Code | FLORES | Overall |
|---|---|---|---|---|---|---|
| RetNet | 99.5/100 | 100/100 | 100/100 | 100/100 | 100/100 | 99.9/100.0 |
| HGRN | 100/100 | 100/100 | 100/100 | 100/100 | 100/100 | 100.0/100.0 |
| GLA | 100/99.5 | 100/100 | 100/100 | 100/100 | 100/98.5 | 100.0/99.6 |
| DeltaNet | 100/100 | 100/98.0 | 100/100 | 100/99.5 | 100/99.5 | 100.0/99.4 |
| GDN | 100/100 | 100/100 | 100/100 | 100/100 | 100/100 | 100.0/100.0 |
解读:10 个架构-规模组合的对齐率全部 ≥ 99.4%——PAS 不是统计趋势,而是近乎确定性定律:全注意力层在哪里,尖峰就在其前一层出现。这个指标衡量的是"形态与架构的锁死程度",接近 100% 意味着形态完全由架构决定,与输入内容无关。
5.2 辅助指标:ISR(证明 ISP 随全注意力密度渐变)
表 2:ISR(%,1.3B / 340M,五域宏观平均)
| 线性架构 | 12:1 | 6:1 | 3:1 |
|---|---|---|---|
| RetNet | 18.8/36.8 | 60.0/69.8 | 85.4/87.2 |
| HGRN | 7.2/5.0 | 40.2/49.6 | 92.5/81.2 |
| GLA | 27.3/31.9 | 51.7/61.6 | 88.0/88.1 |
| DeltaNet | 23.1/46.5 | 44.6/82.8 | 84.4/99.8 |
| GDN | 18.4/39.7 | 26.6/45.2 | 77.8/86.7 |
解读:ISR 随全注意力密度增加单调上升。以 GDN 1.3B 为例:12:1 时 18.4% → 3:1 时 77.8%。全注意力层越密,相邻尖峰之间的平台越平——即 ISP 把相邻 PAS 逐步"连通",可以推出在 ρ=1(全注意力)极限下完全连通,恢复全注意力 LLM 稳定的 MA 形态。这个指标衡量的是"形态随混合比的连续渐变",证明 PAS→ISP→稳定 MA 是同一条谱带上的演化,而非三个孤立现象。
5.3 大规模真实模型验证(12 个检查点,1.2B–397B)
论文在 Kimi Linear、Qwen3.5、Nemotron-H、Zamba2 四个家族上得到四项发现:
- 跨后训练阶段:Kimi Linear Base 与 Instruct 的 PAS 位置与 ISP 边界紧密对齐(仅幅值不同)——后训练改幅值不改形态。
- 跨规模:Qwen3.5 各检查点 PAS/ISP 与全注意力排布对齐;层间形态比幅值更稳定。
- 跨序列混合器:线性注意力与状态空间(Mamba-2)混合模型均出现——形态源于"层交错混合化"这一结构,不限于特定线性算子。
- 跨领域:五域输入下 PAS 位置与 ISP 跨度稳定,幅值随内容变化——架构决定层间位置,输入调制强度。
5.4 消融:门控干预实验
固定训练设置,仅改门控:
- 给全注意力层加输出门控:PAS/ISP 绝对幅值被大幅削弱,但小的注意力前峰值在整个训练过程中持续存在——组织被削弱而非消除。
- 移除 GDN 原生输出门:仅产生中等幅值放大。
证据链:10 组对齐率 ≥99.4% 证明 PAS 定律;ISR 单调上升证明形态连通;12 个真实检查点证明生态相关性;不对称门控效应证明因果方向(全注意力层组织 MA,而非 GDN)。每个指标都直接对应核心主张的一环,而非孤立的数字好看。
六、效果优势的根源解释
这一部分回答:为什么 MA 形态呈现 PAS/ISP 的组织方式?为什么这些证据共同指向"全注意力层是组织核心"这一结论? 论文的答案是"写入-汇聚-抵消"(write-sink-cancel)生命周期,核心变量是抵消时机。
6.1 机制因果链:抵消时机决定形态
固定坐标解剖(1.3B GDN 12:1 模型,第 12 层全注意力)揭示的三阶段:
- 写入:注意力前一层向残差流的某个坐标写入一个极端正离群值 → 表现为 PAS 的上升沿;
- 汇聚:全注意力层中该 token 吸引后续 query 的不成比例注意力,成为注意力汇 → MA 的"注意力耦合"属性在此确立;
- 抵消:随后在同一坐标上出现反号更新,大幅抵消离群值 → PAS 的下降沿。
关键洞察:PAS 和 ISP 不是两种不同的形成机制,而是同一生命周期在不同抵消时机下的两种表现:
写入 → 汇聚 → [快速抵消] ⇒ 离群值立即消散 ⇒ 孤立尖峰(PAS)
写入 → 汇聚 → [延迟抵消] ⇒ 离群值跨层持续 ⇒ 平台(ISP)
写入 → 汇聚 → [持续不抵消] ⇒ 离群值全程保持 ⇒ 全注意力 LLM 的稳定 MA
6.2 用因果链逐条解释实验结果
为什么对齐率 ≥99.4%? PAS 的"写入"步骤由全注意力层的存在触发——线性注意力层的固定循环状态无法充当离群值的汇聚/抵消节点,只有全注意力层能扮演该角色。因此写入事件被架构排布硬性锁定在全注意力层前一层,这是因果的、近乎确定性的,而非统计相关。
为什么 ISR 随混合比单调上升(18.4%→77.8%)? 混合比 ρ 减小意味着全注意力层更密、相邻抵消节点间距更短。抵消需要反号更新,而反号更新的来源与全注意力层相关——节点越近,离群值在到达下一个节点前被中途"截断"的概率越低,于是平台越平。ρ→1 时每个位置都紧邻抵消节点,抵消被无限推迟成"持续保持",形成连续谱的终点——稳定 MA。这解释了为什么 PAS→ISP→稳定 MA 是渐变而非跃变。
为什么门控效应不对称? 这是全文最重要的因果证据。反事实推理:
- 若 MA 组织主要由线性注意力层驱动,则移除 GDN 门应产生大变化、动全注意力门应影响有限——实际恰好相反;
- 全注意力门控(动的是汇聚/抵消节点)→ 幅值大幅削弱但层间组织保留:门控削弱了节点吞吐的离群幅度,但"节点在架构中的位置"未变,故组织仍在——削弱而非消除;
- GDN 门移除(动的是传播路径)→ 仅中等放大:传播路径只影响离群值的衰减速率,不改变其产生与消亡节点。
结论:全注意力层是 MA 动力学的汇聚/消除节点,线性注意力层主要是传导介质。这与其稀少数量形成鲜明对比——结构角色比数量更重要。
6.3 反证:排掉替代解释
- “训练巧合?"——受控预训练显示 PAS 在训练 1B token 后即可见,两种形态早期出现并在优化中巩固;PAS 位置随全注意力层插入位置可预测移动(第 12 层插入则尖峰随之移动),排除数据/初始化巧合。
- “特定线性算子的特性?"——五种线性架构 + 状态空间混合器全部复现,排除算子特异性。
- “输入驱动?"——五域输入下位置稳定、仅幅值变化,排除输入驱动。
七、必要知识反推
假设一个毫无背景的人要做这项研究,最少必须掌握什么?
领域知识层
- Transformer 内部数值 anatomy:知道残差流、隐藏状态、逐层激活是什么,才能定义并测量激活轨迹 m(ℓ)。不理解它就无法建立观测手段。
- MA 与 attention sink 现象:知道 Sun et al. 2024 与 StreamingLLM 的发现,才能提出"MA 在 HLA 中如何表现"这个问题,并预判 MA 与 sink 的耦合。
- 线性注意力家族的机制差异:RetNet 的固定衰减、GLA 的输入依赖门控、DeltaNet 的 delta 规则、GDN 的组合——只有懂得各变体的状态更新方式,才能设计跨 5 架构的公平对比并解读架构间差异(如 DeltaNet 在 6:1 即现 ISP 而 GDN 主要在 3:1)。
方法论知识层
- 追踪方法失效的诊断能力:必须先发现"按幅值排序追踪 MA"在 HLA 中失效(幅值排名不稳定、token 逐层切换),才有动机发明共识 sink 锚点法——这需要对既有方法成立前提的批判性理解。
- 系统性离群值分析框架:带符号跨层追踪固定坐标的离群动态,是还原 write-sink-cancel 生命周期的技术基础。
- 混合比 ρ 的极限思维:把混合比看作可在 [1, ∞) 上滑动的旋钮、把全注意力模型视为 ρ=1 的极限情形——这种连续谱视角是发现"PAS→ISP→稳定 MA 渐变"的先决条件。
工程知识层
- 受控预训练基础设施:Flash Linear Attention 框架、统一预训练配方(M-A-P 套件)、340M/1.3B 从零训练、密集 checkpoint 保存——没有这些,无法区分"形态"与"训练巧合”。
- 真实模型的可解释性手术:在 12 个 1.2B–397B 生产级检查点上做激活提取与注意力分析,需要 hook、量化诊断等工程能力。
知识融合的关键节点
最关键的化学反应在于把 MA 当作架构探针而非待修补的麻烦:领域知识(MA-sink 耦合)× 方法论(共识锚点追踪)× 系统思维(混合比连续谱)三者在"形态学与架构排布对齐"这一洞察上融合——一旦意识到尖峰位置与全注意力层锁死,后续的对齐率指标、ISR 指标、门控干预、生命周期机制便顺理成章地构成完整证据链。
八、论文中可以提取的通用性灵感
灵感一:把"异常值"当探针,而非当噪音
- 核心思想:系统中极端、稀疏的异常观测往往与系统的关键结构节点强耦合,是最好的结构性探针。
- 论文证据:MA(离群激活)以 ≥99.4% 的对齐率锁死在全注意力层前一层——极端值精确暴露了架构中的功能节点。
- 推广场景:(1) 分布式系统中追踪极端延迟请求定位瓶颈节点;(2) 金融市场中用极端收益事件定位系统性风险敞口;(3) 组织管理中关注极端绩效者识别流程关键岗位;(4) 生物系统中用极端表达基因定位调控枢纽。
灵感二:同一机制 + 不同时机 = 不同表型
- 核心思想:看似不同的现象可能来自同一机制,差别仅在于某关键事件的发生时机——先统一机制,再参数化时机,比逐一解释表型更深刻。
- 论文证据:PAS、ISP、全注意力稳定 MA 统一于 write-sink-cancel 生命周期,仅由抵消时机(快速/延迟/持续不抵消)区分。
- 推广场景:(1) 疾病分型:同一通路的不同失活时机导致不同病症表型;(2) 软件故障:同一 race condition 的不同触发时机表现为不同 bug 症状;(3) 经济周期:同一出清机制的不同延迟形成不同周期形态;(4) 教育:同一认知冲突的不同反馈时机决定学习效果差异。
灵感三:当既有测量方法失效时,换锚点而不是换精度
- 核心思想:当"按幅值排序"的追踪方法在新环境中失效时,解决方案常常不是更精细的测量,而是换一个更稳定的锚定维度(位置而非幅值)。
- 论文证据:按幅值追踪在 HLA 中因排名不稳定而失效;改为共识 sink token 锚点后,层间结构立刻清晰。
- 推广场景:(1) 用户行为分析中,当活跃度指标失真时改锚定核心用户群;(2) 卫星导航中 GPS 失效时改用惯性/地形匹配锚点;(3) 代码重构中,当测试覆盖率指标失效时改锚定关键调用路径。
灵感四:不对称干预是定位因果节点的利器
- 核心思想:对系统两个组件施加对称的反事实干预,观察响应的不对称性,能以最低成本定位真正的因果核心。
- 论文证据:门控全注意力层(大效应)vs 移除 GDN 门(中等效应)的不对称,直接判定全注意力层为组织节点、GDN 门仅为调制器——尽管全注意力层数量远少于线性层。
- 推广场景:(1) 团队诊断:同样幅度的支持/撤除施加于不同角色,观察产出变化定位关键成员;(2) 供应链:对上游与中游对称施压,定位链主;(3) 神经科学:对称刺激/抑制不同脑区定位功能枢纽;(4) A/B 测试:对称增删两个模块定位增长引擎。
灵感五:连续谱思维——在两个已知端点之间滑动参数看渐变
- 核心思想:当系统存在两个已知形态(全注意力 LLM 的稳定 MA、纯线性模型无此组织),把连接二者的参数当作旋钮滑动,观察渐变规律,往往能发现统一解释。
- 论文证据:混合比 ρ 从 24→12→6→3→1,ISR 单调上升、PAS 逐步连通,揭示一条连续谱而非离散形态。
- 推广场景:(1) 材料科学中在有序/无序两相间滑动温度观察中间相;(2) 训练动力学研究中滑动数据混合比观察能力涌现;(3) 政策评估中在完全管制/完全放开间滑动监管强度观察市场结构渐变。
附录:术语速查
| 术语 | 含义 |
|---|---|
| MA (Massive Activation) | 巨大激活:比典型激活大若干数量级的稀疏离群隐藏状态条目 |
| PAS (Pre-Attention Spike) | 注意力前尖峰:MA 在全注意力层紧邻前一层形成的局部极大值 |
| ISP (Inter-Spike Plateau) | 尖峰间平台:MA 在相邻 PAS 之间的线性注意力层中持续的高位平台 |
| ISR (Inter-Spike Retention) | 尖峰间保留分数:中间层激活相对较弱 PAS 的比值(0–100%,越高平台越平) |
| ρ (混合比) | 总混合层数 / 全注意力层数;ρ=1 即纯全注意力模型 |
| Write–Sink–Cancel | 写入-汇聚-抵消:MA 的三阶段生命周期,抵消时机决定形态 |
| GDN / GLA / DeltaNet / RetNet / HGRN | 五种线性注意力变体(门控 delta 规则 / 门控线性注意力 / delta 规则 / 固定衰减 / 分层门控递归) |