Random Attention 精读:KV 缓存驱逐的选择信号几乎买不到任何东西

论文:Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning(arXiv:2609.03430,cs.CL,2026-09-03) 作者:Heng Wang, Jielin Qiu, Wenting Zhao, Cheng Qian, Liangwei Yang, Jiawei Han, Heng Ji, Silvio Savarese, Shelby Heinecke, Huan Wang 机构:Salesforce AI Research × University of Illinois Urbana-Champaign


一、题目

  • 类型:负结果驱动的范式修正论文(negative-result + mechanism study)。
  • 发表单位:Salesforce AI Research 与 UIUC 的深度合作——Heng Ji / Jiawei Han 组(UIUC)负责机制分析,Salesforce(Savarese/Heinecke/Wang)负责工程化 serving 验证。
  • 一句话概括:KV 缓存压缩的主流范式是"给每个 token 打重要性分、留 top-k";本文证明在推理场景下随机驱逐就能匹配最强打分器,并用三层机制解释为什么打分信号几乎买不到东西。

二、背景

研究脉络

  1. 长推理让 KV cache 成为瓶颈:长思维链(数万 token)下 KV 缓存占据显存主导,驱逐/压缩方法大量涌现。
  2. 主流范式的高度一致:H2O、SnapKV、TriAttention、TOVA……所有知名方法共享同一假设——存在一个可计算的选择信号(累计注意力、观察窗口投票、重要性代理),按分数保留 top-k。
  3. 被忽视的疑点:这些方法的对比实验几乎从不包含"随机驱逐"这一最平凡的对照。打分器之间的增益差可能全部来自打分的副作用(如保护了 prompt),而非打分本身。

本文的问题

在推理(长思维链)场景下,选择信号到底贡献了多少?如果把打分完全去掉,会损失什么?

三、定位

维度定位
问题类型范式假设检验 + 机制归因
场景长思维链推理(数学、代码、科学问答),非长上下文理解
方法Random Attention:保留完整 prompt + 头内均匀随机驱逐 + 零打分
对照设计信号型驱逐器(TriAttention/SnapKV/H2O 类)、 planted-fact 探针、重启对照、等内存协议
目标会议口径ICLR/NeurIPS(分析类论文的典范写法)

四、问题定义

设定:周期性驱逐,预算 K(保留 token 数)+ 缓冲 r。所有驱逐器在"保护 prompt、只驱逐生成 token"的前提公平比较。

核心度量:

  1. 六个推理任务的准确率(数学/竞赛数学/代码/科学);
  2. Planted-fact recall:在 prompt 中埋入关键事实,度量驱逐后模型能否回忆(探针 B);
  3. vLLM 分页 serving 吞吐:真实引擎下的端到端速度;
  4. 等内存(equal-memory)协议:比较时消除内存占用的混杂。

五、解法与实验设计

5.1 方法:极简到极致

Random Attention = 保留全部 prompt token + 在每个注意力头内均匀随机驱逐生成 token。不计算任何分数、不维护任何统计量。这不是"又一个方法",而是实验对照升格为主角。

5.2 三层机制解释(本文最有价值的部分)

  1. Prompt 是脆弱部分(The Prompt Is the Fragile Part):事实性内容(题面、条件、检索结果)几乎全部在 prompt 里,驱逐 prompt token 必然破坏推理——所以所有方法都在拼命保护 prompt,保护策略趋同后彼此差异极小。
  2. 工作状态自我保护(The Working State Protects Itself):进入生成 token 的关键信息(中间结果、推导结论)会被后续 token 跨头冗余复制——一个头的随机驱逐很难把所有头的副本同时清空。keep-log 测量证实了"副本池"的存在与头间分布的均匀性。
  3. 选择信号的剩余空间极小:既然 prompt 反正要全保、生成 token 有冗余兜底,打分信号能改进的空间只剩"非冗余且非 prompt"的窄带——实验证明这条窄带对最终准确率的影响在噪声水平。

5.3 实验发现

  • 主结果:约 4× 压缩下,Random Attention 在全部 4 个模型(7B–32B)× 6 任务上匹配最强先前驱逐器;14B/32B 上与 TriAttention 的微小差距主要来自代码推理(长 prompt 吃掉预算),而非打分质量;
  • 压缩压力测试:压缩率提高时所有方法都下降,但随机与最优的差距在各模型族上都不构成显著优势反转;
  • 信号崩溃场景:代码推理任务 prompt 极长,信号型选择器的打分 pass 反而成为负担,多个信号方法表现 worse;
  • 工程收益:vLLM 分页 serving 下省去打分 pass,Random Attention 比 TriAttention 快 32–43%。

六、知识反推

  1. 缺失平凡对照的领域结论都值得重审:KV 驱逐文献从不放"随机"对照,导致整个领域在打分器的精巧度上内卷。任何"方法 A 比 B 好"的结论,若缺失最平凡的对照,都可能是混杂(保护策略、超参预算)的产物。
  2. 增益归因要区分"信号"与"副作用":打分器真正的贡献可能只是"以打分为代价实现了 prompt 保护"——把混杂分解后,精巧信号的价值被证明≈0。这个分析框架(信号/副作用分解)可迁移到注意力稀疏、token 剪枝、上下文压缩等多个子领域。
  3. 冗余是免费的可靠性:跨头复制让生成状态对随机扰动天然鲁棒——这提示缓存压缩可以更多利用冗余结构(如头间分组驱逐)而非逐 token 精打细算。
  4. 工程视角的重新定价:省掉打分 pass 直接兑换 32–43% 吞吐。当精度打平时,方法的计算开销本身应该进入比较表——“零成本方法打平贵方法"应被视为结果而非缺陷。

七、通用灵感

  • 对推理引擎工程:在长思维链服务中,KV 预算紧张时可以放心采用随机驱逐+全保 prompt 的组合,省下的打分开销是纯利润;继续投入复杂打分器的边际收益接近零。
  • 对评测方法论:本文的 planted-fact 探针 + 等内存协议 + 重启对照的组合拳,是"负结果论文"的写作与实验范本——可复制到稀疏注意力、上下文压缩、记忆系统的评审中。
  • 对 Harness/Agent 记忆系统:Agent 的外部记忆(对话历史压缩、经验库淘汰)同样面临"按重要性淘汰 vs 随机淘汰"的选择——本文提示:在冗余存储普遍存在的系统里,精巧淘汰策略的价值可能同样被高估,值得做同款对照实验。
  • 对研究方向选择:与其做第 N+1 个打分器,不如研究"冗余结构如何形成、能否主动构造”——把可靠性从打分器转移到表示结构本身。