FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving 精读
深度精读中科院自动化所、国科大与腾讯微信联合发表的 FlashPrefill V2——面向长上下文 LLM 服务的训练免费块稀疏 prefill 注意力方案。针对前作「精度失控、内核落后、不兼容生产引擎」的三重差距,V2 以块均值校正补偿被剪枝块的注意力贡献、以对齐 FA3/4 的 warp 特化稀疏内核兑现稀疏收益、以原生 paged KV 与连续批处理无缝接入 SGLang。128K 上下文下 H20 算子级较 FA3/4 对齐 dense 基线加速 17.5 倍(FP8 达 30 倍),端到端 TTFT 最高 4.83 倍,而 RULER/LongBench 精度损失不足 1.1 分,是「算法-内核-系统」三层协同落地的教科书级范例。