推理芯片之战:带宽成为新算力,Groq、Cerebras 与 OpenAI 的三条路线与 Bill Dally 的 location 哲学

推理的瓶颈正在从算力转向带宽:每生成一个 token,都要把整个模型从存储介质读一遍。硅谷101本期请到两位正在做推理芯片创业的嘉宾——Bill Dally 的博士生 Mark 与前亚马逊 Annapurna 芯片软件栈科学家子阳,拆解 Groq 的静态调度、Cerebras 的晶圆级集成与 OpenAI Jalapeño 的 HBM4 通用路线为何是不同约束条件下的各自最优解,为什么中国关心 tokens per dollar 而美国关心 tokens per watt,以及推理速度如何决定模型智能的上限。

September 16, 2026 · 3 min

消失的1.65万亿:数据中心影子借贷、GPU金融化与AI次贷之辩

硅谷101本期深扒AI数据中心背后的债务暗账:美国五大hyperscaler发债总额已达1.65万亿美元,回购四年缩水九成、发债规模暴增至年均六倍,巨头用SPV搭壳、融资租赁、信用衍生品担保、超长期租约五种手法把债务移出资产负债表。Meta路易斯安那Hyperion项目借273亿美元、表内只留23.7亿;微软融资租赁负债两年翻倍至629亿藏进"其他负债";Oracle签下2600亿租约尚未起租分文未上表。华尔街私募信贷因SaaS崩盘急于转投AI基建,GPU被证券化为可投资资产,黄仁勋宣布联合六大资管成立5000亿美元算力融资平台。两位华尔街投资人给出反方视角:认购倍数下滑是市场变挑剔而非缺钱、Oracle CDS新高是商业模式转型后的正常reprice、数据中心债占企业债市场仍是零头,AI次贷危机论未必成立。

August 22, 2026 · 4 min

泡沫是2029年,不是2027:王煜全的荷塘、中间物种与击穿围墙的Agent

海银资本创始人王煜全做客《AI相对论》,给出与蒋涛"2027年爆破"不同的判断:泡沫在2029年,且是"大而快的危机"——半年内恢复、见底时遍地黄金。他的分析框架是"荷塘理论"(胜负已分,只是收入利润滞后五六年才显现)与佩蕾丝技术革命周期(导入期狂热—泡沫破裂—展开期高速增长)。据此推演:特斯拉Waymo地盘战已定调、FSD规模数据优势无人能敌;中国车企不做数据联盟将成为"中间物种";人形机器人是"训练腿的是大泡沫、训练手的是小泡沫";低空经济不可能规模化。七巨头中英伟达未来五年安全、谷歌十年内广告模式失效、苹果失去战略眼光、微软无自研大模型有风险。中国机会在智能服务出海与"农村包围城市"式的全球算力基建。

August 18, 2026 · 2 min

从DeepSeek到Kimi K3,中国开源模型如何逼出黄仁勋的'开源联盟'

DeepSeek V4 Pro登场,中国开源模型连续逼近前沿能力,迫使黄仁勋牵头组建美国"开放安全AI联盟",Sam Altman、Sundar Pichai等闭源掌门人罕见支持。这期硅谷101系统拆解了AI"开源"到底开的是什么——从七步训练流程到Open Weights与Open Source的本质区别,以及许可证之争、开源公司如何赚钱、闭源阵营的安全担忧与商业焦虑。

August 13, 2026 · 1 min

在算力最多的地方做世界模型:对话英伟达Cosmos掌舵人刘洺堉

英伟达研究副总裁、Cosmos Lab负责人刘洺堉的4小时深度访谈。从GAN到Diffusion到世界模型的20年研究者之路,到Cosmos 3为何将语言/视频/音频/动作统一进单一模型,到"模型竞争不是零和游戏"的Low Ego哲学,再到黄仁勋的第一性原理决策与"不裁员"文化。他认为模型能力终将收敛,真正决定胜负的是生态整合;他不想击败任何人,只想帮助Physical AI整个领域成功。

August 13, 2026 · 1 min

特修斯之船:Kimi K3如何把Transformer的零件全部换掉,还能逼近前沿

月之暗面K3是首个达到3T级别的开放权重模型,其47页技术报告揭示了一种"特修斯之船"式的架构哲学:注意力改成了线性+全局混合(KDA+MLA),残差变成了深度方向的Attention,FFN变成压缩空间的稀疏专家,甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3:线性注意力在2.8T规模上实现了6.3倍解码加速,Quantile Balancing路由是3T稳定训练的关键之一,MOPD让九个领域专家模型高效合板,而KDA(Kernel Development Agent)证明RSI已在kernel优化领域高速运转。核心判断:权重只是一次训练的产物,环境才是能反复产出下一代权重的护城河。

August 6, 2026 · 1 min

Infra 的浪漫与 AI 平权:盛颖从 SGLang 到 RadixArk

SGLang 发起人、前 xAI 推理负责人盛颖在 101 视频播客中讲述了从斯坦福形式化验证到 xAI 推理系统、再到创立 RadixArk(1 亿美元种子轮)的完整路径。她提出 Infra 不应是 support 角色,而应成为产品本身;RadixArk 的使命不止于推理引擎,而是让所有人拥有制造 AI 的能力。文章梳理了推理引擎的竞争格局、开源社区的商业化困境,以及一位女性研究者在技术圈中的真实体验。

August 3, 2026 · 2 min

何谓蒸馏?硅谷如何看中国开放模型逼近前沿

月之暗面K3开源权重发布震动硅谷,开源模型首次在多项能力上追平甚至超越最强闭源前沿模型。两位嘉宾——前Hugging Face开源生态负责人王铁镇和TinyFace联合创始人TJ——深度拆解了"蒸馏"争议的技术真相、中国开源模型为何成本更低、Kimi License商业模式对闭源实验室估值体系的冲击,以及开源模型安全之争的真正焦点。核心判断:没有开源,才是这个时代最不安全的事情。

August 1, 2026 · 1 min

GPU其实很闲:AI Infra四层架构与榨干硅极限的效率革命

当AI行业的重心从训练转向推理,一个被忽视的事实浮出水面:GPU大多数时间其实很"闲"。Azure推理负载高达65%的能耗消耗在空转等待上,OpenAI的Chat类请求也达到52%。本文基于硅谷101播客,系统梳理AI Infra四层架构,拆解SGLang/vLLM等开源推理引擎如何通过KV Cache复用、连续批处理、PD分离、投机采样、强化学习训练框架MegaScale等技术,把GPU利用率从50%推向90%+——软件层的每一次优化都变成直接的商业问题。

July 31, 2026 · 1 min

一部昇腾史与全球芯片30年史诗——华为半导体首席科学家廖恒5小时深度访谈

华为半导体首席科学家廖恒博士5小时深度访谈,从全球半导体30年兴衰史到昇腾芯片的断供求生之路。他以"十八层宝塔"重构芯片产业链全景,详解摩尔定律的三个方面(经济性已死、性能微弱、能效仍有),阐述昇腾与英伟达为何"越来越不像",以及DeepSeek稀疏化设计与算力比的深层关联。这是华为在经历2020年磨难后,高管首次系统讲述昇腾史。

July 25, 2026 · 1 min