MassAlloc Attention × DaRoPE:注意力计算分配与位置编码的双子星重构 精读
本精读合并解读两篇重构 Transformer 核心算子的论文:HKUST(GZ)×BAAI×巴黎西岱的 MassAlloc Attention(MALA)把稀疏注意力改写为「分布条件化的运行时计算分配」——保留全部 QK 打分,用 online-softmax 演化归一化因子做逐 tile 贡献比测试,跳过低贡献 tile 的 post-score 计算,同一容差 τ=1 统一前向/反向/prefill/解码,训练 FLOPs -23.1% 而 PPL 无损、关联回忆 89.67% 贴近 FullAttn(NSA 仅 22.61%);Meta AI 巴黎×Inria 的 DaRoPE(ICLR 2027)诊断出 RoPE 慢频带这一具体弱点,快带保序、慢带换成 sigmoid 有界的逐头内容坐标,外推免配置,K=256 键值回忆 30.5% vs 其他方法 ≤7.25%。二者共享同一哲学:不做一刀切裁剪,让算子自己知道「哪里重要」。