Infra 的浪漫与 AI 平权:盛颖从 SGLang 到 RadixArk

SGLang 发起人、前 xAI 推理负责人盛颖在 101 视频播客中讲述了从斯坦福形式化验证到 xAI 推理系统、再到创立 RadixArk(1 亿美元种子轮)的完整路径。她提出 Infra 不应是 support 角色,而应成为产品本身;RadixArk 的使命不止于推理引擎,而是让所有人拥有制造 AI 的能力。文章梳理了推理引擎的竞争格局、开源社区的商业化困境,以及一位女性研究者在技术圈中的真实体验。

August 3, 2026 · 2 min

GPU其实很闲:AI Infra四层架构与榨干硅极限的效率革命

当AI行业的重心从训练转向推理,一个被忽视的事实浮出水面:GPU大多数时间其实很"闲"。Azure推理负载高达65%的能耗消耗在空转等待上,OpenAI的Chat类请求也达到52%。本文基于硅谷101播客,系统梳理AI Infra四层架构,拆解SGLang/vLLM等开源推理引擎如何通过KV Cache复用、连续批处理、PD分离、投机采样、强化学习训练框架MegaScale等技术,把GPU利用率从50%推向90%+——软件层的每一次优化都变成直接的商业问题。

July 31, 2026 · 1 min