推理芯片之战:带宽成为新算力,Groq、Cerebras 与 OpenAI 的三条路线与 Bill Dally 的 location 哲学

推理的瓶颈正在从算力转向带宽:每生成一个 token,都要把整个模型从存储介质读一遍。硅谷101本期请到两位正在做推理芯片创业的嘉宾——Bill Dally 的博士生 Mark 与前亚马逊 Annapurna 芯片软件栈科学家子阳,拆解 Groq 的静态调度、Cerebras 的晶圆级集成与 OpenAI Jalapeño 的 HBM4 通用路线为何是不同约束条件下的各自最优解,为什么中国关心 tokens per dollar 而美国关心 tokens per watt,以及推理速度如何决定模型智能的上限。

September 16, 2026 · 3 min

一片晶圆的赌局:Cerebras如何从 Scaling Law 的实验室走向千亿推理市场

硅谷101专访Cerebras早期投资人周南、前百度研究员Greg Diamos及产品高管Angela,复盘这家"晶圆级引擎"公司十年史。从百度三亿参数模型发现Scaling Law、2016年赌注式投资、良率工程突破,到G42订单、OpenAI两百亿美元推理合同、千亿市值IPO,文章梳理了Cerebras如何从一个物理学的疯狂赌注,变成推理时代绕开HBM与CoWoS瓶颈的差异化基础设施,以及上市后毛利率、供应链和客户自研芯片带来的真实风险。

August 7, 2026 · 1 min