GPU其实很闲:AI Infra四层架构与榨干硅极限的效率革命

当AI行业的重心从训练转向推理,一个被忽视的事实浮出水面:GPU大多数时间其实很"闲"。Azure推理负载高达65%的能耗消耗在空转等待上,OpenAI的Chat类请求也达到52%。本文基于硅谷101播客,系统梳理AI Infra四层架构,拆解SGLang/vLLM等开源推理引擎如何通过KV Cache复用、连续批处理、PD分离、投机采样、强化学习训练框架MegaScale等技术,把GPU利用率从50%推向90%+——软件层的每一次优化都变成直接的商业问题。

July 31, 2026 · 1 min

清华程序员很聪明:清程极智如何把Token成本砍掉75%——AI Infra创业的降本逻辑

清华系AI Infra创业公司清程极智(八卦炉+赤兔推理引擎+AI Ping)联合创始人师天麾深度访谈。高二信息学奥赛金牌保送清华、博士师从翟季冬做高性能计算,2023年底创立公司,一年融资过亿。本篇梳理其核心观点:为什么推理引擎是AI的操作系统、赤兔如何通过FP8/FP4让四台服务器变一台、Token经济爆发后AI Infra被投资人追着投、以及Token服务市场为何是个"黑盒"。

July 31, 2026 · 1 min

美团领投月之暗面A轮背后的故事:叶奇意亲历中国两代AI十年人才迁徙

叶奇意(TME)是横跨中国两代AI浪潮的见证者与投资人:在依图做产品经历AI 1.0的四小龙时代,在创新工场尝试做"中国版GPT-2",后在美团龙珠主导领投月之暗面A轮。他详述了追踪杨植麟四个月才加上微信的曲折、A轮时有VC drop后美团顶上的内幕、王兴"创业公司能做超级模型+超级应用的概率很低,但我愿意支持一把"的关键一锤,以及他眼中中国AI从"拼性价比平替"到K3"直接摸SoTA且开源"的质变。

July 31, 2026 · 1 min

一部昇腾史与全球芯片30年史诗——华为半导体首席科学家廖恒5小时深度访谈

华为半导体首席科学家廖恒博士5小时深度访谈,从全球半导体30年兴衰史到昇腾芯片的断供求生之路。他以"十八层宝塔"重构芯片产业链全景,详解摩尔定律的三个方面(经济性已死、性能微弱、能效仍有),阐述昇腾与英伟达为何"越来越不像",以及DeepSeek稀疏化设计与算力比的深层关联。这是华为在经历2020年磨难后,高管首次系统讲述昇腾史。

July 25, 2026 · 1 min