MoNe: Modular Neural Memory for Efficient Long Context Inference 精读

三星研究院提出MoNe——附加到任意冻结预训练Transformer上的模块化神经记忆,实现O(N)预处理+O(1)查询的长上下文推理。两阶段设计:测试时以固定分段读入上下文、快权重神经记忆网络做层局部梯度更新;推理时仅从查询token生成KV,不再重读任何上下文token。128K token时计算与峰值显存较ICL均降约80%(参数开销仅6.4%),RULER上S-NIAH 128K达0.96(ICL仅0.28、MK-NIAH上ICL完全归零而MoNe保持),且可泛化到骨干原生窗口远之外的长度。

August 20, 2026 · 2 min

Infra 的浪漫与 AI 平权:盛颖从 SGLang 到 RadixArk

SGLang 发起人、前 xAI 推理负责人盛颖在 101 视频播客中讲述了从斯坦福形式化验证到 xAI 推理系统、再到创立 RadixArk(1 亿美元种子轮)的完整路径。她提出 Infra 不应是 support 角色,而应成为产品本身;RadixArk 的使命不止于推理引擎,而是让所有人拥有制造 AI 的能力。文章梳理了推理引擎的竞争格局、开源社区的商业化困境,以及一位女性研究者在技术圈中的真实体验。

August 3, 2026 · 2 min

GPU其实很闲:AI Infra四层架构与榨干硅极限的效率革命

当AI行业的重心从训练转向推理,一个被忽视的事实浮出水面:GPU大多数时间其实很"闲"。Azure推理负载高达65%的能耗消耗在空转等待上,OpenAI的Chat类请求也达到52%。本文基于硅谷101播客,系统梳理AI Infra四层架构,拆解SGLang/vLLM等开源推理引擎如何通过KV Cache复用、连续批处理、PD分离、投机采样、强化学习训练框架MegaScale等技术,把GPU利用率从50%推向90%+——软件层的每一次优化都变成直接的商业问题。

July 31, 2026 · 1 min

清华程序员很聪明:清程极智如何把Token成本砍掉75%——AI Infra创业的降本逻辑

清华系AI Infra创业公司清程极智(八卦炉+赤兔推理引擎+AI Ping)联合创始人师天麾深度访谈。高二信息学奥赛金牌保送清华、博士师从翟季冬做高性能计算,2023年底创立公司,一年融资过亿。本篇梳理其核心观点:为什么推理引擎是AI的操作系统、赤兔如何通过FP8/FP4让四台服务器变一台、Token经济爆发后AI Infra被投资人追着投、以及Token服务市场为何是个"黑盒"。

July 31, 2026 · 1 min