先说结论

2026年5月,Cerebras在纳斯达克上市,市值一度逼近千亿美元,首日收盘价311美元,较Series C入场价回报超25倍。一家十年前被主流芯片行业视为"不可能造出来"的公司,最终靠的不是训练市场,而是推理——更准确地说,是在推理时代用一片整晶圆级别的芯片,把"内存带宽"这个被GPU架构天然拖慢的瓶颈彻底打开。

这期硅谷101专访了Cerebras的早期投资人周南、最早验证产品可落地的前百度研究员Greg Diamos,以及Cerebras内部负责产品的高管Angela。串起这些蛛丝马迹之后,真正值得理解的不是"又一个英伟达挑战者上市"的爽文叙事,而是三条相互咬合的链条:Scaling Law的发现如何催生了对全新硬件架构的需求;晶圆级良率这个七十年无解难题如何被工程化;以及当AI从训练走向实时推理,“速度"如何重新定义了基础设施的竞争格局。

从百度的三亿参数模型说起:Scaling Law的硬件起点

故事要从2014年说起。那一年,吴恩达离开斯坦福AI实验室加入百度,百度投入三亿美元在硅谷成立AI实验室。Greg Diamos是吴恩达带去的顶尖研究员之一,在那之前,他在英伟达做了多年CUDA软件架构——用他自己的话说,“当年的CUDA还是个没人用的笑话”。

百度团队很快发表了端到端语音识别论文Deep Speech,并训练了当时全球最大的语言模型,三亿参数,训练耗时三个月。正是在这个过程中,他们发现了一个可以预测的规律:模型越大、数据越多、算力越强,模型就越聪明,而且这种提升是线性的。这个规律几年后以论文《Deep Learning Scaling is Predictable Empirically》发表,而团队里那位"卷发研究员"Dario Amodei把这个发现带去了OpenAI,成为GPT的核心逻辑。

Greg用一句话描述当时的震撼:“这就像是智能的配方,我简直不敢相信智能是有配方的。“但问题随之而来:如果Scaling Law成立,训练未来模型所需的算力将远超当时的GPU集群。百度研究员们意识到,他们需要一种全新的硬件。

五个人的白板与一个物理学赌局

同年(2015年),五位在AMD收购的微型服务器公司C Micro共事过的工程师——Andrew Feldman、Gary Lauterbach、Sean Lee、J.P. Fricker和Michael James——决定创业。Andrew和Gary是C Micro的联合创始人,这家公司2012年被AMD以3.34亿美元收购。他们在白板上写下目标:要让自己的名字被写进计算机历史博物馆。

Cerebras从第一天起就要为AI造硬件。他们问的是一个更底层的问题:如果AI会成为一种全新的计算负载,能不能为它重新设计一台机器? 他们的答案极其激进——不是把GPU拼成更大的集群,而是把整片晶圆做成一颗芯片。

节目用了一个清晰的类比来解释差异:CPU是负责调度的"总经理”,GPU是"有几千个工位的巨大工厂”,擅长大规模并行计算。但AI训练中,参数、梯度和激活值需要不断在GPU的内存、缓存和计算单元之间搬运,而"数据在芯片、内存和机器之间来回移动"才是拖慢AI的真正瓶颈。Cerebras的方案是把尽可能多的计算单元、内存和片上互联放进同一片硅——这样,原本发生在GPU之间、服务器之间、网络之间的数据传输,全部在晶圆内部完成。

周南是这段历史的关键证人。2016年她加入百度AI实验室,成为Greg的同事,第一个任务就是"找到一种除英伟达之外、足够强大的AI算力”。研究员们预测,五到十年内会出现远超5亿参数的、维基百科级别的大模型,而当时的GPU并不是为深度学习优化的结构。

周南告诉硅谷101,她把投资尽调变成了一个为期四周的科学项目,把所有风险拆解成可验证的技术问题:良率能不能控制?第一次流片能不能成功?晶圆上坏掉的区域系统能否识别并绕开?真实AI工作负载能否被编译器映射到新架构上?能否接入客户已有的机器学习框架?

Greg最初对Cerebras也持保留态度——他已经看过二十多家芯片创业公司的pitch,都是"要做比英伟达更好的GPU",Cerebras看起来只是其中平平无奇的一家。直到他亲自去了Cerebras办公室,看到CEO拿出一块巨大的散热金属块和一整片晶圆,他才意识到:“你真的在造一块更大的芯片,而且你居然已经成功了。“百度团队随后把Cerebras的编译器接入了三亿参数语言模型,在模拟器上跑出不错的结果。四周后,周南得出结论:这个架构能成立,百度共同领投了Cerebras的Series C。

七十年的良率难题如何被工程化

节目用了相当篇幅解释Cerebras如何解决晶圆级芯片最致命的问题——良率。

在台积电5纳米工艺下,每平方毫米约出现0.001个缺陷。Cerebras的WSE3芯片面积达46225平方毫米,算下来一片晶圆上约会有46个缺陷。在传统芯片上,任何一个缺陷都可能让整块芯片报废。Cerebras的解法有两层:

第一,把核心做到极小。 传统GPU一个计算核心很大,英伟达H100的一个SM核心约6平方毫米,缺陷落在上面6平方毫米全废。Cerebras把每个核心缩小到0.05平方毫米,约为H100核心的百分之一——同样的缺陷只损失0.05平方毫米。仅这一点,容错能力就提升了百倍量级。

第二,冗余加智能路由。 Cerebras在整片晶圆上多放了约1%~1.5%的备用核心,平时关闭闲置。芯片内置可动态重新配置的片上网络,制造测试阶段识别缺陷区域后屏蔽坏核心、绕开它们,把工作负载映射到正常区域。从软件视角看,整片晶圆始终是完美无缺的芯片。

节目特别指出,这个思路并非Cerebras原创——内存芯片厂商和GPU厂商几十年来都在用冗余核心处理缺陷(英伟达H100需要132个核心工作,但实际造了144个,允许最多12个坏的)。Cerebras真正的创新,是把冗余逻辑从一块小芯片放大到整整一张晶圆,用几十万个微小核心加一套能在整片晶圆上动态绕障的路由网络,把一个七十年无解的良品率难题变成可管理的工程问题。

隐身三年与第一台冰箱大小的机器

尽管有投资人选择相信,Cerebras那段时间实际举步维艰。从2016年成立到2019年中,Cerebras完全隐身——没有产品、没有客户公告、没有新闻稿。内部一度非常危险:每月烧钱约800万美元,每六周开一次董事会都要汇报同一个坏消息:芯片还是不能用。 三年近三亿美元花在一个没人见过的产品上。

晶圆级芯片的功耗高达25千瓦(约一个普通家庭年用电量的两倍多),集中在一块餐盘大小的面积上,这意味着Cerebras还要重新发明散热系统、重新设计供电结构、重新设计与服务器机架的接口。

2019年夏天,第一代WSE终于成功量产并正常运行。那天,几位工程师在Los Altos市中心的临时办公室里盯着屏幕看这个"被认为不可能的系统"真的跑起来,半小时没人说话——“没人能做到这件事,但它在工作,我们做到了。”

2019年8月,Cerebras在Hot Chips大会上发布WSE-1,全球第一款晶圆级芯片:面积超4.5万平方毫米(是当时最大GPU的56.7倍),40万个AI计算核心,18GB片上SRAM内存——同期英伟达GPU的片上内存只有几十兆字节。它整体交付为CS-1系统:一台冰箱大小的机器,芯片、散热、供电、接口全部整合,插进数据中心机柜即可使用。

但第一个问题立刻来了:谁会用它? 2019年商业AI客户远未成规模,大家都在用英伟达,没人看好Cerebras。Greg直言不讳:“我们解决了计算机行业最难的问题,但没人在乎。” 第一代大约只卖出去十几台,第二代卖了约三百台,第三代才卖到数万台——Cerebras曾领先市场两三年,却几乎无人关注它"快得惊人"的事实。

第一批真正的客户来自意想不到的地方:美国能源部旗下的国家实验室。 阿贡国家实验室用Cerebras系统分析新冠病毒变异序列,这个实验协助获得了2022年Gordon Bell特别奖(高性能计算领域最重要奖项之一);劳伦斯利弗莫尔国家实验室用它跑核聚变模拟;国家能源技术实验室的测试结果是Cerebras比实验室自己的超算快了约500倍。这些严肃的科学任务证明技术能落地。

2021年WSE-2发布(7纳米制程,85万个核心,2.6万亿晶体管)。2022年,Cerebras用一台CS-2在单台机器上训练了200亿参数模型,创下当时纪录。同年,美国计算机历史博物馆为WSE-2揭幕永久展览"The Biggest Chip in the World”。 距离2015年五位创始人在白板上立下"被写进算力历史"的目标,过去了整整七年。

G42:从政府实验室到商业规模的转折点

2021年11月,Cerebras完成Series F融资,估值40亿美元。2026年5月IPO估值950亿美元——五年间估值涨了近25倍,其中一半功劳归于一个客户:它在三年时间里把Cerebras从只有政府实验室客户的公司,变成有真正商业规模的企业,但也是它让Cerebras的第一次上市计划彻底泡汤。

G42是阿布扎比的AI科技集团,与阿联酋政府深度关联,同时是微软的战略合作伙伴。2023年G42与Cerebras宣布合作Condor Galaxy——基于Cerebras系统建造大规模超算网络,最大一台算力达4个Exaflops,合同规模超10亿美元。G42最初想做的是阿拉伯语版ChatGPT。

周南解释了这个客户对Cerebras的意义:“作为一家硬科技公司,仅靠技术验证是不够的,你真正需要的是一个大客户愿意部署系统、付真金白银围绕技术来建设。G42给了Cerebras这一点,这帮助他们带来了真正的营收。” 财务数据印证:2022年Cerebras营收2460万美元,2023年跳至7870万美元,G42占比超83%;2024年上半年,G42占比进一步升至87%。

2024年9月,Cerebras向纳斯达克提交S-1招股书。美国外国投资委员会(CFIUS)看到大批营收来自阿联酋客户G42后几乎立即启动国家安全审查,Cerebras在无法获得CFIUS放行的情况下主动撤回S-1。G42持有的股份被转为无投票权股份,双方关系重新定性。最终CFIUS在2025年3月31日正式给Cerebras上市放行。

撤回S-1的等待并非白费。2025年Cerebras完成两轮大规模私募:9月Series G融资11亿美元(估值81亿),2026年2月Series H融资10亿美元(估值230亿),用私募市场完成了再一轮资本化。

平安夜的两笔交易:推理时代的格局重塑

2025年12月24日的平安夜发生了两件事,改变了整个AI芯片产业格局。

第一件,英伟达与Groq签署合同,达成200亿美元规模的技术授权和资产交易。Groq是Cerebras在推理芯片市场最直接的竞争对手,做的是LPU(语言处理单元),专门为固定大小的模型设计,追求极致的确定性和低延迟。Greg对此始终有所保留:“我总是对Groq没那么热情,因为我一直在想,如果英伟达真的想做,他们也能做同样的事。”

第二件,Cerebras与OpenAI宣布合作,合同总价值同样超200亿美元。OpenAI承诺部署750兆瓦的Cerebras算力用于推理业务,最大可扩展至2030年的2吉瓦——全球历史上规模最大的AI推理部署合同。

Cerebras是英伟达的挑战者,而就在英伟达吃下Groq的同一天,OpenAI把最大的推理计算合同给了Cerebras。这并不令人意外:Sam Altman是Cerebras最早期的投资人之一,两家公司团队从2017年起就频繁交流,都相信一点——随着模型规模扩大,硬件架构和模型需求迟早会汇合。

Andrew在2025年夏天与Sam Altman交流时,Altman说了一句关键的话:“这是我们第一次不再只是为了跟上需求而拼命,我们开始看到快速推理的重要性。” Cerebras随即进行了测试,速度远超竞争对手。感恩节前夜签了Term Sheet,四周后平安夜签了Master Agreement——一个200亿美元以上的交易在四周内完成,极为罕见。

Angela总结OpenAI选择Cerebras的原因很简单:速度加供应多元化。OpenAI需要的算力远超单一供应商能提供的规模,它想要实时产品的快速推理,也不想只依赖英伟达做推理。合同落地速度同样超出预期——2026年2月就交付了首个与Codex的集成,推出针对速度和交互性优化的Codex Spark模型,后端由Cerebras支撑,让开发者乃至个人用户首次直接体验Cerebras。

为什么推理利好Cerebras:内存带宽的胜利

理解这个转变,需要回到训练和推理在硬件层面的根本差异。

训练是建造模型——把海量数据喂给神经网络,让它学会语言规律和世界知识,是巨大的一次性计算过程。GPU非常适合训练,因为矩阵乘法高度可并行,可以把几千块GPU连起来同时计算。

推理则完全不同。 语言模型生成回答时,不是一次性把整段话吐出来,而是生成第一个词才知道第二个词该是什么——推理有很强的串行性。训练时可以把海量数据分批扔给几千张GPU并行计算,但推理(尤其是生成答案的decode阶段)必须沿时间顺序前进,每生成一个token都要进行一次模型计算,都要在模型权重缓存和计算单元之间搬动大量数据。

所以在推理时代,关键词是"速度”——模型能否足够快地读到数据、足够快地生成下一个token。 这正是Cerebras架构的天然优势:它的根本创新是让计算和内存位于同一片硅上,提供了极高的内存带宽,“比GPU高约上千倍的内存带宽”。

Angela解释了为什么Cerebras从训练市场转向关注推理:“2016年多数公司专注训练基础模型,现在不同了——OpenAI、Anthropic和许多开源公司都有了足够强大、可广泛用于应用的前沿模型。Cerebras对训练和推理都擅长,但当我们看到推理市场扩张的速度,以及我们在推理上比GPU快15倍的优势,就知道这里有一个好机会。”

推理需求也改变了Cerebras的产品形态。之前像G42的例子,Cerebras卖的是超级计算机;现在它把硬件能力包装成云服务——客户通过API发送请求,Cerebras在后端完成推理返回结果。Angela表示,他们已把整个产品做成OpenAI API兼容,客户只需换成Cerebras的API key,无需重写代码。

在推理服务上,Cerebras目前平均可达每秒超2000个token的输出速度,相比之下很多传统方案是每秒200到300个token。更重要的是,速度更快会创造全新的应用场景。节目给出了三个例子:代码悬停调用图(开发者鼠标悬停在代码上即显示完整调用关系)、实时AI教育(AI边在虚拟黑板画图边回答追问)、AI科学家(药物研发会议中实时查论文、测试假设、直接参与讨论)。这些应用的本质都是互动,而互动的本质就是速度。

和所有人合作,除了英伟达

2026年3月,Cerebras宣布与AWS合作。Andrew在采访中解释了逻辑,并宣布将与所有Hyperscaler合作——除了英伟达。

这个合作基于对推理问题的拆解。推理分两部分:处理提示词(prefill,可并行的计算)和生成答案(decode,严格串行的计算)。Cerebras找到AWS说:“你可以用你的Trainium芯片做prefill,我们用我们的大芯片做decode,组合起来就是非凡的方案。” Andrew表示,Cerebras正在用"用别人的芯片解决问题的一部分,用我们的芯片解决另一部分"的方式,与除英伟达外所有的社区成员合作。

至此,Cerebras的四层产品已清晰:芯片(WSE-1/2/3)→ 系统(CS-1/2)→ 超算集群(如2022年用16台CS-2组成的Andromeda,1350万个核心,超1个Exaflop算力)→ 云端推理服务(2024年8月发布的Cerebras Inference)。 它从一家硬件公司转型为一家推理基础设施公司。

上市后的真实挑战:毛利率、供应链与客户自研

2026年4月17日Cerebras重新提交S-1,5月14日正式上市。周南在纳斯达克交易桌后目睹了全过程:“IPO前一天定价还在120到160美元,我想这已经是25倍回报的大满贯了。但上市当天,股价从200美元一路冲到300美元再到380美元——这是我整个职业生涯见过的最疯狂的IPO。” 首日收盘311美元,涨幅68%,融资规模55.5亿美元,市值盘中一度触及千亿美元。

但上市不是终点,Cerebras面临至少三层挑战。

供应链的单一依赖。 Cerebras整条产品链(包括750兆瓦的OpenAI承诺)全部建立在台积电5纳米产能上——台积电是目前唯一能制造Cerebras芯片的代工厂。不过Andrew也指出了Cerebras的意外优势:它避开了当下AI芯片行业最紧张的三个供应链瓶颈——HBM高带宽内存、台积电的先进封装CoWoS、台积电最先进的3纳米产线——这三个激烈竞争的瓶颈,Cerebras的产品都用不到。

激烈的竞争格局。 英伟达已与Groq合作有了自己的推理优化技术;Broadcom在帮各大云厂商设计定制ASIC;谷歌TPU、亚马逊Trainium都在做推理;一批新的推理芯片创业公司正在融资。Angela的回答强调Cerebras的全栈能力:“我们对前景非常有信心,因为我们拥有全栈能力以及在每一层持续创新的能力。”

关键客户的战略变数。 就在2026年6月,OpenAI与Broadcom发布了OpenAI第一颗自研推理芯片Halopinion——专门为语言模型推理设计的ASIC。OpenAI表示这是其长期全栈AI基础设施策略的一部分,未来想把模型、软件、网络服务器乃至芯片本身更深地掌握在自己手里。这不意味着OpenAI会立刻放弃Cerebras(它的算力需求太大),但Cerebras必须证明它能提供的推理速度是长期且不可替代的。

2026年6月24日,Cerebras发布上市后第一份财报,股价下跌15%,一度跌破IPO发行价。表面看财报不差(Q1收入高于华尔街预期),但Q2指引中调整后毛利率只有36%~38%,低于Q1的47%——收入增长留下的利润空间正在被压缩。Andrew解释,Cerebras在2026年初就向投资者分享了计划:为了跟上客户的超常需求,Cerebras会从部分客户那里租回已售出的设备,这会带来约10到15个百分点的毛利率影响。“我们在每一个指标上都超前于计划。” 但市场是否买单,是另一回事。

一个硬科技公司真正进入主流市场的时刻

投资人对于Cerebras长期稳定盈利的关注,恰恰是这个故事最有意思的地方——它不是一个英伟达挑战者上市的爽文。

Cerebras的一波三折,很大程度上是对AI时代基础设施需求变迁的回应。当我们对模型的需求从规模变成推理、从能力变成速度,我们到底需要什么样的计算机?英伟达的答案是GPU集群,OpenAI在自研ASIC,Groq选择了LPU,而Cerebras给出的答案是一整片晶圆。

十年前它是硅谷疯子,今天这块餐盘大小的芯片在数据中心服务着OpenAI、AWS和一系列重要客户。这个曾经的科幻设定变成了可以登录纳斯达克的现实——真实到资本市场开始用毛利率来审判它。这或许才是一个硬科技公司真正进入主流市场的时刻。

对读者的启发至少有三条:第一,AI基础设施的竞争核心正在从"算力规模"转向"内存带宽与延迟",谁能把数据搬运的成本降到最低,谁就在推理时代占据身位;第二,Cerebras避开HBM、CoWoS、3纳米三大瓶颈的供应链策略,提示了一个反直觉的判断——在算力焦虑时代,“不依赖最稀缺资源"本身就是一种壁垒;第三,当OpenAI、谷歌、亚马逊都开始自研芯片,独立芯片公司的长期价值取决于能否提供这些巨头自研无法复制的差异化(对Cerebras而言是晶圆级内存带宽),而非单纯的性能参数。