Random Attention 精读:KV 缓存驱逐的选择信号几乎买不到任何东西
Salesforce AI Research×UIUC 的 Random Attention 证明:长推理场景下 KV 缓存驱逐的’重要性打分’几乎无用——在每个注意力头内均匀随机驱逐、完全不计算分数,即可在 4 个模型×6 个推理任务上匹配最强选择器,且在 vLLM 分页 serving 下因省去打分 pass 快 32–43%。本文基于全文阅读拆解其三层机制解释与实验设计。
Salesforce AI Research×UIUC 的 Random Attention 证明:长推理场景下 KV 缓存驱逐的’重要性打分’几乎无用——在每个注意力头内均匀随机驱逐、完全不计算分数,即可在 4 个模型×6 个推理任务上匹配最强选择器,且在 vLLM 分页 serving 下因省去打分 pass 快 32–43%。本文基于全文阅读拆解其三层机制解释与实验设计。
SWE-Gate(中山大学/浙大/重大)从真实 PR 评审评论中提取约束并构造 303 个仓库级修复实例,发现 644 个通过功能测试的补丁中 221 个(34.3%)违反评审约束——SWE-bench 式功能唯一评测系统性高估了 Agent 的真实修复能力。本文基于全文逐页阅读,拆解其约束提取管线、双测试设计与 221 个隐藏失败的分布规律。
Qwen 团队×清华的 Terminal-Universe 通过回放轨迹中的文件操作逆向恢复环境,把海量 Agent 轨迹转化为 37.3k 个可重查询、可验证的终端环境,并沿广度(跨代码库任务)与深度(多轮需求迭代)两轴扩展。Qwen3.5-27B 微调后 Terminal-Bench 2.1 +11.9、多轮 EvoCode-Bench +13.8。本文基于全文阅读拆解环境重建管线与数据飞轮设计。
NVIDIA 以约 129.3 亿美元收购 Hugging Face 震动开源生态;OpenAI 发布 GPT-6 Astra、Google 推出 Gemini 3.8 Flash、Meta 交付 Muse Spark 1.3,三线混战;学术侧 BAAI 团队 Repo-To-Skill 用 5000+ 技能库让 Codex 在 MLE-bench 相对提升 134.3%,NVIDIA 竞赛系统在 IOI 2026 以 535.4 分首次超越人类最高分选手;KAIST×Google DeepMind 的 Declarative Attention 让模型自主控制注意力,Berkeley×MIT-IBM 的判别式世界模型将 WebArena-Lite 成功率推至 28.48%。Agent 技能化、harness 工程化与评测降本成为贯穿产学研的主线。
现有 LLM 自进化研究都从人类定义好的显式任务出发,agent 只搜索’怎么优化’;但人类学习往往始于’成为更好的物理学家’这样的模糊目标。ByteDance Seed 联合 SUTD、M-A-P 等发布 Aspire 基准:只给一句自然语言能力目标,评测集对 agent 完全隐藏,agent 必须自己决定优化什么、怎么训练、如何验证。实验给出罕见的机制级阴性结果——24 次 final-only 运行仅 1 次超过基线分,最佳进化 harness 仍低于人工 Qwen-Agent。本精读拆解隐藏评测设计、三条研究问题(RQ1-RQ3)的实验逻辑,以及’代理增益不迁移’这一失败模式的根源。
RLVR 用最终答案的对错给整条推理链打分,粒度太粗;PRM 要训练专用奖励模型,OPD 要求师生推理同构。Amazon Web Services 联合 UIUC 的 Cliff 给出过程监督的最小充分形式:只用现成 LLM 定位每个错误 rollout 的’第一个错误步’(Pitfall Step),把轨迹切成正确前缀与错误后缀,前缀正优势、后缀负优势。12 个场景上一致超越:比 On-Policy Distillation 高约 15%、比标准 GRPO 高约 7%,且弱教师(27B)下依然有效。本精读拆解’错误前缀之后无信息’这一核心洞察、token 级优势的构造细节,以及教师定位能力与人类标注 80% 一致率的验证实验。
Web agent 用世界模型做测试时动作选择:采样候选动作→预测下一状态→排序执行。但现有世界模型都用监督式’下一状态预测’训练——花大量 token 复述页面上没变化的部分,而下游 ranker 需要的恰恰是’不同动作导致的差异’。UC Berkeley 联合 MIT-IBM Watson AI Lab 提出 predicted-state matching:预测表示必须把真实结果状态从替代动作的结果状态中区分出来。同一份数据、同一个 Qwen3-8B 底座,仅换训练目标,匹配准确率从 47.77% 跳到 80.80%,WebArena-Lite 端到端成功率从 13.94% 提到 28.48%。本精读拆解’训练目标与下游任务对齐’这一教科书级修正的完整证据链。
跑一遍前沿模型在 SWE-bench Verified 上要花数百到数千美元,而 agent 开发需要反复评测。上海交大联合新加坡管理大学等提出 EarlyEval:agent 的最终成败往往在轨迹中段就已注定——训练一对 LightGBM 成功/失败分类器,一旦置信度过阈值就提前终止运行。三个基准上砍掉 13%–26% 步数、最高省 44.1% 输入 token,预测精度 89%–97%,排行榜排序保真度 Spearman ρ 高达 0.99。本精读拆解’轨迹内降本’与’基准蒸馏降任务数’的正交关系、行为特征为何比参考解更有用,以及阈值-保真度的可调权衡。
长上下文解码时,模型每生成一个 token 都要把整个 KV cache 读一遍——1M token 上下文意味着每步约 15GB 的内存搬运,而注意力其实高度集中。KAIST AI 联合 Google DeepMind 提出 Declarative Attention:让模型在思维链里用 // 三种标签自己声明’现在需要看哪里’,推理引擎像解析工具调用一样解析声明并跳过绝大部分 KV 读取。零训练、零外部打分器,15 个长上下文任务上 Gemma-4-31B 注意 token 降 52.0%、精度仅降 1.27pp。本精读拆解三模式协议、与代理打分式稀疏注意力的机制差异,以及’模型自己最知道该看哪里’的第一性原理。
OpenAI infra 工程师赵迪在访谈中回看了自己 25 年踩中每一个浪潮的职业路径:Oracle、摩根斯坦利、Salesforce、Netflix、Twitter/X,直到 2025 年加入 OpenAI。他在 Twitter 期间用 Rust 写的 Navi 推理引擎统一了全站推荐与广告的 serving,这套 batching、caching 的思路今天在 LLM 推理中依然成立。他近距离观察了马斯克“两周法则”式的极端管理,也解释了为什么 Codex 普及之后写代码这件事被重新定义、为什么模型的好坏没有统一标准、以及为什么“智能平权”的口号与“智能成为阶级工具”的现实可能同时为真。