基于硅谷101播客「“榨"出硅的极限:怎么让GPU不"闲着”?」的完整转写整理。主持人陈倩,邀请了由SGLang孵化出的Radix AI的联合创始人和核心成员,以及数据中心专家,系统讲解AI Infra(人工智能基础设施)的效率革命。
一、背景速览:GPU其实很"闲"——AI Infra千亿市场的底层逻辑
新的变化
AI行业突然开始了一场造芯大战——OpenAI亮出了首枚推理芯片,谷歌计划将模型架构直接写入硅片,Anthropic、Groq、DeepSeek也相继传出相关布局。背后的原因很简单:当模型从训练进入部署阶���,让模型更快、更便宜地跑起来变成最重要的事。
但并不是每家公司都有资金和能力去重塑芯片。于是,一个市场正在引发资本和巨头的关注:AI Infra(人工智能基础设施层)。它的核心逻辑是——已经部署好的数据中心和GPU本身还存在巨大的优化空间。
- AI推理平台Together AI一年收入增长了二十倍,估值从21亿美元暴涨到130亿美元;
- 同赛道的Fireworks七个月内估值翻了四倍,达到175亿美元,年化营收突破10亿美元;
- 开源推理引擎双子星vLLM和SGLang相继宣布商业化,种子轮融资都超过1亿美元,背后几乎聚集了AI产业里所有巨头和顶级风投的名字。
GPU为什么跑不满?
一个反直觉的事实:你以为GPU很忙吗?大多数时间GPU其实很闲。
GPU只是整个AI系统中的一环。从一条用户请求进入系统开始,它需要经过网络传输、资源调度、模型加载、内存管理,再到最终完成推理返回结果。整个过程当中,只要任何一个环节出现瓶颈,GPU就只能停下来等待。
某研究机构最近对756块GPU运行了31天的细粒度遥测,覆盖从A100、H100到最新B200的六大产品,结果发现很多时候GPU都处于一种"执行时空转"的状态。在他们观测的集群中:
- 整体上有近20%的执行时间和约11%的能耗被浪费在了等待上;
- 推理场景更为严重——Azure推理负载有高达65%的能耗消耗在空转上,OpenAI的Chat类请求也达到了52%。
嘉宾观点与解释
当模型重心从训练走向推理,算力需求性质完全不同。 训练成本极高,但训练完之后任务就告一段落。推理则完全不同——无论是Chatbot还是Agent应用,应用越多,GPU就需要处理越多的请求,而且这些请求是不间断的,推理需求随之爆发性增长。嘉宾强调:“每一家都缺卡”,对于有钱的巨头来说,最直接的方法是继续建数据中心、采购更多GPU。Meta、Google、Microsoft等科技巨头今年预计资本开支超过一万亿美元。
但华尔街在担心泡沫。 嘉宾指出,这种担心不无道理,过去有前车之鉴——互联网时代的泡沫破灭,当时大量投入光纤建设和互联网公司投资,虽然长期看实现了价值,但短期出现了很大问题。如果不能在短期内大规模增加算力,还有别的办法吗?答案是:提高GPU的利用率。这就是AI Infra这一层产业存在的意义。
二、AI Infra四层架构:软件层为何成为主战场
四层架构拆解
AI Infra可以拆解为四层,每一层都会影响GPU的利用率:
| 层级 | 内容 | 决定什么 | 问题性质 |
|---|---|---|---|
| 第一层:能源基础设施 | 电力、散热 | GPU能否持续稳定运行 | 硬问题 |
| 第二层:计算硬件 | GPU、高带宽内存、高速互联、CPU | 理论计算上限 | 硬问题 |
| 第三层:系统软件 | CUDA编译器、通信库、内存管理、底层算子库 | 每次计算能否触及硬件物理极限 | 软问题 |
| 第四层:服务编排 | 推理引擎、训练框架、请求调度、资源管理 | GPU任务如何优先运行、动态调度 | 软问题 |
嘉宾观点与解释
下面两层是"硬问题",上面两层是"软问题",行业注意力正在快速上移。 电力、散热、芯片的改造周期以年为单位,优化空间正在快速见顶。而系统软件和调度逻辑本质是工程问题、算法问题,优化之后往往能带来数倍的性能提升。嘉宾明确指出:“most of work都要放在软件层和服务编排,因为你把人力投入到这一块当中,能够带来最大的优化的可能性。”
一个机柜的例子直观说明问题严重性。 一台NVIDIA GB200 NVL72机柜采购成本大约400万美元。如果软件层没有做好调度和优化,GPU实际利用率可能只有50%,相当于只用到了200万美元,剩下的200万美元以电费、折旧和机会成本的形式被白白烧掉了。反过来,如果能把利用率从50%推到90%以上,效果相当于凭空多出了一台机柜。这就是为什么当硬件成本高到这个量级时,软件层的每一次优化都变成了直接的商业问题。
这解释了为什么英伟达现在最大的员工群体是AI inference工程师。 网友挖出英伟达inference团队已扩张到200多人,正是这个逻辑的体现。OpenAI和Anthropic也把AI inference团队放在公司内部——inference已经成为各大前沿实验室的竞争壁垒之一。
三、开源推理引擎双子星:vLLM与SGLang
对于没有资金量去做优化的较小模型团队或初创公司来说,两个开源框架成为了他们的支柱:vLLM和SGLang。
设计思路的差异
- vLLM:因为提出了PagedAttention而受到广泛关注,更加强调常规通用的推理部署场景;
- SGLang:从推理执行流程出发,更强调计算复用和系统优化。
目前所有的优化工作都可以归结为对四个核心问题的回答:
- 哪些计算不用重新做?(计算复用)
- 哪些等待可以消除?(消除等待)
- 哪些算力没有吃满?(榨满算力)
- 哪些资源没有协同?(资源协同)
四、优化方向之一:计算复用——KV Cache与RadixAttention
新的变化
在模型推理里有一个"很傻"的事实:当同一段文字被反复喂给模型时,它每次都要从头计算一遍。 这在实际业务里简直是硬伤——尤其是在AI工作流(Agent)里,同样的工具描述可能被调用几十次,每次都是从零开始。
KV Cache:把算过的东西存下来
核心思路叫做KV Cache复用——把算过一遍的东西存下来,下次直接拿来用。Transformer在解码时,每一层的Attention都会把历史token映射成Key-Value张量(简称KV),Cache就是缓存。有了KV Cache之后,在第一次请求的"预填充"阶段(prefill,用户输入prompt到生成首个token的过程),系统把prompt中每个token每一层的KV都存下来。之后解码每个新token时,只计算新token的KV并追加到缓存里,历史token的KV直接复用。
但KV Cache有一个弊端:它虽然可以降低解码计算量、降低首token延迟(TTF),但代价是占GPU显存。 当上下文很长同时有很多用户请求时,KV Cache会占用大量显存,显存一旦不够,模型就很难继续提高并发和速度,常常变成推理服务的主要瓶颈。
SGLang的核心技术:RadixAttention
SGLang在这件事上的解决方案是RadixAttention——用一种叫做基数树(Radix Tree)的数据结构来组织海量请求的KV Cache。可以把它想象成一个共享前置的"家族树":共享同样开头的请求共同用同一段枝干,只有当内容开始分叉时,才各自长出新的树枝。
这在Agent场景下尤其重要——Agent通常会有很多shared system prompt,在共享的system prompt之后会有不同的user prompt,同一个user prompt下面又会接着追问。RadixAttention在2023年就预见到了这种模式,随着agent coding越来越普遍,这种树状共享结构的复用价值越来越大。
工程上的精细设计
SGLang把KV Cache变成了全局可复用资源——跨请求、跨机器共享。但这听起来简单,工程上却极其复杂:缓存存在哪里?怎么快速匹配多个请求?怎么共享?显存不够时该淘汰谁?每一步都要精细设计。
为此SGLang做了多项优化策略:
- Cache-Aware Scheduling(缓存感知调度):把相似请求排在一起处理。类比餐厅后厨——连续处理三份麻辣香锅,很多调料和准备工作可以复用,效率就高;如果顺序是麻辣香锅、寿司、牛排来回切换,中间洗锅换厨,复用机会就少了。
- Eviction(淘汰机制):显存不够时扔掉最不可能再用的缓存。常用的system prompt、高频百科文档、最近刚被用过的对话前缀会被保留,而很久没用过的、复用价值低的KV Cache会被淘汰。
- Distributed Cache-Aware Load Balancer(分布式缓存感知负载均衡):如果某段长prompt的KV Cache在GPU 1上,下一个相同前置的请求却被发到GPU 3上,GPU 3没有这份缓存还是得重新算。SGLang会尽量把请求发到已有缓存的GPU上,减少重复计算。
五、优化方向之二:消除等待——连续批处理与PD分离
第二大浪费是"等待"
内存价格一个季度能涨90%,高端显存缺货缺到2027年,GPU有钱都不一定能抢到。但这些花了大价钱抢到的卡,一半时间却都在等待。
连续批处理(Continuous Batching)
请求之间的等待问题经历了演进:
- 最早是排队式:请求一个一个来,一个算完了再算下一个;
- 后来演进到批处理(Batching):凑够一批一起算。但凑批也要等,而且一批里如果有的请求短、有的请求长,短的算完了还要等长的算完才能一起下车,短请求的用户体验极差;
- 现在主流算法是连续批处理(Continuous Batching):不再等一批人全部到齐再发车,而是像一辆随时上下客的公交车,新请求随时上车,算完的请求随时下车,GPU始终保持满载。这一改造能让GPU实际吞吐量提升2到4倍。
Prefill-Decode分离(PD分离)
计算阶段也有等待。大模型推理包含两个阶段:
- Prefill(读入阶段):快速处理一大段文字,对算力要求高;
- Decode(生成阶段):一个字一个字往外蹦,计算量不大,但每写一个字都要翻一批完整记忆,对显存带宽极其敏感。
过去这两个部分被塞进同一张GPU里混合执行,结果是Prefill在算的时候Decode在等,Decode在算的时候Prefill在等,互相拖累。
现在的做法叫PD分离——把这两个阶段拆到不同的GPU上,各自用最适合的硬件适配,通过高速网络传递中间结果。例如DeepSeek就采用了这个方案:Prefill读题时32张GPU组成一个最小计算单元,等真正开始逐字作答时,任务就交给另一批GPU接手,两波卡各干各的互不打扰。
PD分离已经成为推理引擎最重要的架构演进之一。 在英伟达最新推出的分布式推理架构中,PD分离被放在了整个架构设计的核心位置,而SGLang也是业界最早支持大规模PD分离部署的推理引擎之一。
六、优化方向之三:榨满算力——低精度计算与投机采样
算力没吃满的问题
英伟达H100发布时,Tensor Core算力相比A100提升了数倍,整个行业期待AI推理能同步飞跃,但现实并非如此。背后的主要原因是GPU大量时间花在了数据搬运上,又受限于串行解码,计算能力无法充分释放。
方向一:低精度计算
GPU显存里装了三样东西:模型权重、中间激活值、KV Cache。这三部分的精度可以独立设置,用更小的数据格式来存储或运算其中任何一部分,都能减少显存占用,也能利用GPU上更快的低精度算力。在合适的场景下,这相当于能多释放出一倍的算力空间。
方向二:投机采样(Speculative Decoding)
先用一个小模型(Draft Model / 草稿模型)猜接下来的几个字,再让大模型进行一次性验证,猜对了就等于一次计算生成了多个字。
嘉宾用了一个生动的类比: 大模型是很厉害但很忙的老师,小模型是速度很快的助教。之前学生每写一个字都要问老师"你看这个字行不行",老师确认之后再写下一个。而投机采样是助教先帮学生写一小段草稿,老师一次性看这一小段——如果前面都对就全部通过,如果中间错了就从错了的地方重新再来。这种方式在一些情况下能把生成速度提升2到3倍。
推理引擎:把四层打通的关键入口
推理引擎在这里扮演着至关重要的角色——把新功能第一时间集成到系统里,把软件和硬件的四层都打通,让优化协同起来。SGLang本身是一个整体思路,包含cloud optimization、schedule本身的optimization、CUDA graph、continuous batching,以及更上层的routing、prefetch cache怎么build到对应engine replica等大量技术,这些technique埋在一起,把inference整体solution做到极致。
与芯片厂商的深度绑定联合优化
SGLang现在跟芯片厂商之间已经是一种深度绑定的联合优化关系。芯片厂在设计新硬件时就已经在和SGLang团队一起做联合调优,等到硬件正式发布时,SGLang几乎在同一时间完成了Day-0支持。
SGLang甚至变成了hardware评测的工具。 AMD最新的硬件、微软最新的硬件发布时,SGLang都是launch hardware——在硬件发布当天,厂商会说"在SGLang的performance上达到了多少多少"。这解释了Radix AI从SGLang孵化融资时,机构投资人阵容极其豪华:AMD、联发科、Daybreak等AI硬件与系统层主要玩家几乎全部到齐,个人投资者包括Intel CEO陈立武(Lip-Bu Tan)、Broadcom CEO陈福阳(Hock Tan)、OpenAI联合创始人张学文等。 对他们来说,投资推理引擎是一种战略下注——他们需要一个连接算力与应用的基础入口,把更多模型、企业应用和Agent引入自己的算力生态。
七、优化方向之四:资源协同——强化学习时代的训练框架MegaScale
强化学习改变了训练形态
强化学习(RL)成为了新一代模型的核心训练方式(包括OpenAI的O1、DeepSeek R1等),这让AI训练形态发生了巨大变化。
传统模型训练是单一的事:喂数据、更新参数、再喂数据、再更新参数,GPU干的是同一类活儿。但强化学习要把推理、评估、参数更新这三种完全不同的计算揉在一起循环跑——先让模型生成很多回答内容,然后根据这些内容打分,再更新模型,然后再去回答新问题,再打分。这三件事对硬件的需求天差地别。
如果用传统训练框架来跑强化学习,它们会在同一批GPU里面争抢资源:生成的时候训练在等,训练的时候生成在等,大量算力被浪费在阶段切换和互相等待上。所以资源协同成了效率提升的命门。
MegaScale:把训练和推理放在同一个系统
DeepSeek团队在SGLang这边推出了训练框架MegaScale——面向大模型后训练的开源训练框架。后训练(Post-training)是指模型有了基础能力之后,通过SFT、强化学习的方式继续打磨,让它更会听指令、也更会思考。
MegaScale和传统训练框架最大的不同是把训练和推理放在了同一个系统里一起考虑。 MegaScale和SGLang配合在一起:SGLang在推理端不断产出新样本,MegaScale训练端不断更新模型权重,更新后的模型继续用于下一轮生成。这让推理和训练衔接得更顺,减少等待和切换的时间浪费,形成更高效的后训练闭环。
此外,MoE(Mixture of Experts)架构在训练和推理中,kernel level的并行策略会导致accuracy不同,因此需要更强的工程能力来保证training-inference alignment。MegaScale在新硬件支持、MoE训练以及推理一致性方面都进行了大量工程优化,去年11月发布后已被不少企业和实验室采用。
八、推理引擎正在成为AI时代的"操作系统"
新的变化
开源模型开放的只是权重,权重并不会自动变成token。 今天开源模型迭代速度越来越快——从DeepSeek V3/V4、GLM到最新的各类模型,每个季度都会出现新的强劲开源模型。但任何人下载了这些模型,依然要解决部署、显存、吞吐和调度等一系列问题。
嘉宾观点与解释
推理框架正在越来越像AI时代的"操作系统",成为连接模型与芯片的关键一层。 Radix AI做这件事的更大目标,是希望以后不要有"前沿模型"(frontier)这个词——因为人人都可以做前沿模型。华人牵头成立的开源AI联盟里,既有模型公司、芯片公司,也有像SGLang这样的AI inference项目。
Radix AI创始人沈瀛(前xAI inference推理团队负责人)表示: “两年前大家觉得除了OpenAI,其他都不是frontier;在这之前,大家觉得Google离OpenAI太远了,不可能追上。AI变化太快了,我们相信会有越来越多挑战者、越来越多有自己想法的人能做出更好的AI产品和模型。“Radix AI希望做的是一个supporter的角色——给这些有想法的人提供最强的inference支持,让他们在想做的这一刻开始,就有和现在的"前沿巨头"一战之力。
结语
当AI Inference的能力从少数前沿模型巨头的独家资源,变成任何一家创业公司都能直接调用的公共品,从事AI工作的门槛被显著降低。这或许才是"榨出硅的极限"这件事最重要的意义所在。
软件层的每一次优化,不只是技术问题,更是直接的商业问题和战略问题。从KV Cache复用到连续批处理,从PD分离到投机采样,从强化学习训练框架到与芯片厂商的深度联合调优——AI Infra正在系统性地释放整个AI系统的算力效率。而在这套效率革命的红利被全面释放之后,会有越来越多带着新想法、新架构、新应用场景的团队,不再因为inference门槛而被拖慢脚步——这也让AGI距离我们更近了一步。