FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving 精读

深度精读中科院自动化所、国科大与腾讯微信联合发表的 FlashPrefill V2——面向长上下文 LLM 服务的训练免费块稀疏 prefill 注意力方案。针对前作「精度失控、内核落后、不兼容生产引擎」的三重差距,V2 以块均值校正补偿被剪枝块的注意力贡献、以对齐 FA3/4 的 warp 特化稀疏内核兑现稀疏收益、以原生 paged KV 与连续批处理无缝接入 SGLang。128K 上下文下 H20 算子级较 FA3/4 对齐 dense 基线加速 17.5 倍(FP8 达 30 倍),端到端 TTFT 最高 4.83 倍,而 RULER/LongBench 精度损失不足 1.1 分,是「算法-内核-系统」三层协同落地的教科书级范例。

August 22, 2026 · 6 min

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements 精读

新加坡国立大学、南方科技大学与牛津大学团队论证:在长程agent微调场景中,进化策略(ES)不只是更便宜的RL替代品,而是结构性更优的选择。Agentic ESOpt以参数空间扰动+奖励加权更新实现免反传全参优化,GPU显存与推理持平(8.41GB,比GRPO低85.7%),在可控Sudoku实验中呈现horizon-dependent crossover——H*=15时超最强GRPO 12.5个百分点;WebArena-Lite上完成27B模型全参适配(29.47%→36.16%),并支持prompt-参数协同进化。

August 20, 2026 · 3 min

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents 精读

华为LegoX团队联合港中文发布LEGO-RL——在不修改原生编码agent harness内部控制流的前提下接入可扩展策略梯度训练。三大支柱:进程内LLM代理捕获原始生成流实现token级对齐与训练端logprob重算(即使harness压缩/重序列化上下文)、Nydus镜像缓存+分级防御抑制reward hacking、插件化校验监控+Live UI轨迹诊断。训练Qwen3.5-35B-A3B(GSPO)在三大harness上全面提升:OpenHands SDK 64.0%→70.4%、Claude Code 62.4%→68.2%、OpenCode 57.2%→66.6%,rollout-训练概率相关性保持0.99以上。

August 20, 2026 · 2 min

MoNe: Modular Neural Memory for Efficient Long Context Inference 精读

三星研究院提出MoNe——附加到任意冻结预训练Transformer上的模块化神经记忆,实现O(N)预处理+O(1)查询的长上下文推理。两阶段设计:测试时以固定分段读入上下文、快权重神经记忆网络做层局部梯度更新;推理时仅从查询token生成KV,不再重读任何上下文token。128K token时计算与峰值显存较ICL均降约80%(参数开销仅6.4%),RULER上S-NIAH 128K达0.96(ICL仅0.28、MK-NIAH上ICL完全归零而MoNe保持),且可泛化到骨干原生窗口远之外的长度。

August 20, 2026 · 2 min

Agentic Kernel Optimization: Generating State-of-the-Art GPU Kernels Without Hand-Written CUDA 精读

Intellifusion(云天励飞)技术报告:验证通用代码Agent能否在无任何手写CUDA的前提下产出SOTA GPU内核。在Houmao多Agent编排框架中构建“正确性门控”的内核优化工作流——人类仅做编排(定义流程、强制正确性与反作弊约束、提供关键参考、卡住时重定向搜索),完全不审阅内核代码;起点仅为PyTorch参考实现+工作负载定义+基准命令+紧凑CUDA优化技能集。约19亿agent token在NVIDIA B200上产出:Fused MoE加速92.68×(FlashInfer库为47.08×)、DSA TopK 1101.02×(FlashInfer 52.03×)、DSA Sparse Attention 181.35×(FlashInfer 10.33×);MLSys 2026 FlashInfer竞赛官方评测中Fused MoE内核1.71×超FlashInfer基线并超过agent-assisted赛道第一名(1.68×)。

August 19, 2026 · 2 min

Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs 精读

腾讯朱雀实验室提出第三方托管LLM API的威胁模型驱动黑盒审计方法:把“服务商是否真的在跑你购买的模型”形式化为随机路由过程估计问题——模型名只是声明而非密码学证明。Ventor-QTest无需目标API任何概率信息:重复请求组件对冻结约束上下文多次重发、从返回文本计数重构类别输出分布,联合报告平均保真损失(AFL)与最坏情况期望保真损失(EFL)双指标,覆盖“平均诚实但最坏降级”的攻击面。论文论证两指标须联合报告(尤其对长时程agentic任务的最坏行为敏感),工具已开源并入腾讯AI-Infra-Guard。

August 19, 2026 · 1 min

Massive Activations in Hybrid Linear Attention Large Language Models 精读

混合线性注意力(HLA)LLM 用少量全注意力层搭配大量线性注意力层来兼顾长上下文与效率,但巨量激活(Massive Activations)在其中如何表现此前几乎无人研究。本精读覆盖首个系统性分析工作:论文发现两种与架构严格对齐的激活形态——注意力前尖峰(PAS)与尖峰间平台(ISP),在 5 种线性架构、6 种混合配置、5 个数据域、1.2B–397B 的 12 个开源检查点上高度复现,Sink-spike 对齐率高达 99.4%–100%;并提出统一的「写入-汇聚-抵消」生命周期机制:MA 的抵消时机决定形态——快速抵消形成 PAS,延迟抵消形成 ISP,全注意力极限下恢复传统 LLM 的稳定 MA。门控实验的不对称效应进一步印证全注意力层是组织 MA 动力学的核心节点。

August 15, 2026 · 5 min

Thought-Level Beam Search for Reasoning 精读

测试时算力扩展是大推理模型性能的主引擎,但并行采样极度浪费、减法剪枝又让GPU挨饿,核心问题已从“花多少算力”变成“把算力花在哪”。本文提出思维级束搜索 Gambit:用轻量评分器探测步骤边界隐状态,周期性剪除劣迹并立即从高分前缀分支,以零和交换维持固定容量活跃池,同时保持硬件满载。在 5 个基准 × 3 个模型上严格支配 SC、Slim-SC、DeepConf、STEP 四大基线:HMMT-24 最高 +6.7%,token 消耗较并行采样最高降 68.5%,吞吐超 2 倍,管理开销仅 0.97%。本精读覆盖其问题形式化、方法细节、实验证据与因果链根源分析。

August 15, 2026 · 3 min

从DeepSeek到Kimi K3,中国开源模型如何逼出黄仁勋的'开源联盟'

DeepSeek V4 Pro登场,中国开源模型连续逼近前沿能力,迫使黄仁勋牵头组建美国"开放安全AI联盟",Sam Altman、Sundar Pichai等闭源掌门人罕见支持。这期硅谷101系统拆解了AI"开源"到底开的是什么——从七步训练流程到Open Weights与Open Source的本质区别,以及许可证之争、开源公司如何赚钱、闭源阵营的安全担忧与商业焦虑。

August 13, 2026 · 1 min

Addressable Memory for Video World Models 精读

交互式视频世界模型在长时程生成中会遇到一个隐蔽的「记忆失效」问题:KV cache 里明明存着过去的画面,模型却读不出来。本文精读 NVIDIA/Princeton/ Toronto 联合提出的 WorldTrace 框架,它精准定位了 RoPE 旋转位置编码超出训练范围导致的「内容不可寻址」根因,并用一套无需训练的虚拟槽位机制,在时间一致性上提升 15.5%、在 LoopBench 情景回忆上提升 19.5%。本精读将从世界模型的记忆机制讲起,逐层揭开位置编码、相位抵消、虚拟槽位、规范 key 平均等关键技术。

August 11, 2026 · 8 min