Random Attention 精读:KV 缓存驱逐的选择信号几乎买不到任何东西
Salesforce AI Research×UIUC 的 Random Attention 证明:长推理场景下 KV 缓存驱逐的’重要性打分’几乎无用——在每个注意力头内均匀随机驱逐、完全不计算分数,即可在 4 个模型×6 个推理任务上匹配最强选择器,且在 vLLM 分页 serving 下因省去打分 pass 快 32–43%。本文基于全文阅读拆解其三层机制解释与实验设计。
Salesforce AI Research×UIUC 的 Random Attention 证明:长推理场景下 KV 缓存驱逐的’重要性打分’几乎无用——在每个注意力头内均匀随机驱逐、完全不计算分数,即可在 4 个模型×6 个推理任务上匹配最强选择器,且在 vLLM 分页 serving 下因省去打分 pass 快 32–43%。本文基于全文阅读拆解其三层机制解释与实验设计。