先说结论

这期硅谷101录制于 2026 年 6 月 24 日——恰好是 OpenAI 与博通发布第一颗自研推理芯片 Jalapeño 的当天。两位嘉宾(硬件架构方向的 Mark,NVIDIA 首席科学家 Bill Dally 的博士生;软件与编译器方向的子阳,曾在亚马逊做 Trident 芯片软件栈)自己也在这条赛道创业,所以整期节目既是技术科普,也是一份"从业者如何看同行"的参照系。

核心判断可以压缩成三句话:第一,推理的经济与技术瓶颈都从算力转向了带宽——自回归解码每吐一个 token,都要把整个模型从存储介质完整读一遍,谁能让"读模型"更便宜更快,谁就拿到下一个时代的门票。第二,Groq、Cerebras 与 OpenAI 的分歧不是技术品位分歧,而是约束条件分歧——Groq 用编译期静态调度换取确定性、Cerebras 用整片晶圆缩短物理距离、OpenAI 反其道堆 HBM4 带宽,对应的是"性价比优先"与"电力优先"两套完全不同的目标函数。第三,推理速度的意义被普遍误读了——快不是为了把一分钟的回答压缩成一秒,而是在同样的延迟预算里塞进十倍的内部思考;正如黄仁勋演讲 PPT 的横轴写的不是速度,而是 smarter AI。

一、训练赌的是信仰,推理算的是账:为什么 GPU 不再是唯一答案

Mark 把训练与推理的分野首先讲成一个商业问题而非技术问题。训练本身没有直接回报,所以理性策略是"赌一个最强大的集群,换一个最强大的模型,指望未来在推理侧把投入收回来"——这解释了为什么训练时代没人认真算性价比。推理则完全相反:用户愿意为每百万 token 付多少钱、系统推理出这些 token 要花多少成本,这笔账"可以很清楚地算明白",所以推理天然追求性价比而不是极致性能。

技术层面的根源在于自回归解码的串行性。推理分两个阶段:prefill(预填充)阶段所有输入 token 已知,可以大规模并行,特征接近训练;decode(解码)阶段则必须一个 token 接一个 token 生成——上一个 token 的输出是下一个 token 的输入。这意味着每生成一个 token,都要把整个模型(节目以 1.6T 参数模型为例)从存储介质读到计算单元一遍。GPU 的应对是 batching(批处理):收集一万个用户的任务,把每个人的第一个、第二个、第三个 token 分别并行处理。代价是用户体感变慢——你在等自己这个 token 之前,还得等 GPU 算完同一批里其他 9999 个用户的 token。

理解了这一点,三种存储介质的取舍就变成一道算术题,节目用"离干活的地点有多远"做了通俗类比:

  • DRAM 是电脑内存条:容量大、便宜,但离计算单元远,来回取数据慢;
  • HBM(高带宽内存)把 DRAM 搬到计算芯片旁边、开了很多通道:容量大速度也快,英伟达高端 GPU 的标配,但贵且全球产能紧张;
  • SRAM 直接做在计算芯片内部:最快,但一个比特要六个晶体管(DRAM 只需一晶体管加一电容),存同样数据面积代价是几十上百倍,单芯片容量比 HBM 低约两个数量级——“最快,但装不下”。

嘉宾的判断是:业界云端推理芯片正在向 SRAM 收敛——不止 Groq 和 Cerebras,美国的 D-Matrix、MatX,以及谷歌 TPU、亚马逊 Trainium 的每一代产品,SRAM 都在变大(谷歌在博客中提到其 SRAM 更多用于存 KV Cache)。这个判断在节目后半段被 OpenAI 的新芯片部分打破,后文再展开。

二、SRAM 路线的两条分岔:Groq 的确定性 vs Cerebras 的良率

Groq 与 Cerebras 看到的是同一个问题:在 Transformer 出现之前,它们就预判未来 AI 系统对带宽有极端需求,也都收敛到 SRAM 这个介质。但 SRAM 容量小,迫使系统做大——要把一个 TB 级模型塞进每颗只有几百 MB SRAM 的芯片,需要几百上千颗组网。系统一大,瓶颈就从访存转移到芯片间通信与调度。两家公司在"怎么解决大集群通信调度"上走向了不同技术路线,这是全节目最有信息量的对比。

**Groq 选择把调度搬到编译期。**Jonathan Ross 出身编译器背景(Mark 称其为谷歌 TPU 奠基人之一),Groq 的整套硬件围绕"确定性"(determinism)重新设计:数据从 SRAM 读出来是 100 纳秒还是 300 纳秒出来,这类抖动在 DRAM 上更明显,而 Groq 用 SRAM 加芯片设计把静态时钟同步做到极致,让编译器在运行前就把每个时钟周期做什么计算、什么通信全部排布好。代价是遇到了时代错配:MoE(混合专家)模型每个 token 在 128 个专家里动态选 8 个,这个决策发生在运行时,编译期无法预测。Mark 推演了静态调度的两种应对——保守地把 token 复制多份送到多个可能的芯片(一部分空转),或者换维度切分模型(但对当前模型尺寸很难切干净)。好在大带宽的富余允许这种浪费:SRAM 相对 HBM 有两到三个数量级的性价比优势,“浪费掉一个数量级,还是比它好”。

**Cerebras 选择缩短物理距离:把一个机柜的事情塞进一整片晶圆。**这引出了它最大的成本魔咒——良率。Mark 给出了一笔业内账:传统单芯片设计极限约 800 平方毫米,一片晶圆能切四五十颗,良率 50% 还能得二十颗好的;而 Cerebras 的产品就是整片晶圆,靠 partial good 设计接受约 30% 的坏点仍然可用,可一旦整片达不到良率要求就整片作废——“你每造十个,可能九个不能用”。再加上它是目前唯一有名的晶圆级厂商,软件上如何在几十万个 core 里绕过坏区、系统上怎么插进机柜,都没有先例可抄,全要自己解决。

把两家的折扣讲清楚,就理解了"理想很丰满"的折损路径:一个没有良率问题的简单 SRAM 芯片,Mark 估算单芯片成本可以做到英伟达的十分之一、带宽十倍;但 Cerebras 的制造成本摊进来后,“很可能是十倍英伟达的带宽、三倍 HBM 的成本”。**Groq 为确定性打折,Cerebras 为良率打折,折扣最终都打在 token 成本上。**这也可以解释为什么两家目前的市场定位都是"快"(低延迟)而非"便宜":Cerebras 能做到 750 甚至 2000 token 每秒的速度,客户愿意为快付溢价——Mark 补了一句商业观察:“当你能做出比别人更快而且更便宜的东西时,你不会告诉别人你的成本其实更便宜。"(外部核验:节目播出后,2026 年 8 月 13 日 Cerebras 宣布与 OpenAI 合作推出 Ultrafast 服务层级,GPT-5.6 Sol 以最高 750 token/秒的输出速度运行,印证了这一速度定位。)

至于英伟达那笔交易:节目里 Mark 说是"两百亿 acquire”,实际结构更微妙。据纽约时报、路透及多家媒体 2025 年 12 月 24 日之后的报道,英伟达并未直接收购 Groq,而是以约 170 亿美元达成非独家技术授权协议,创始人 Jonathan Ross、总裁 Sunny Madra 及大部分工程团队转入英伟达,Groq 名义上独立运营、更换 CEO——2026 年 9 月美国司法部已就这笔"反向人才收购"是否规避反垄断申报正式启动调查。播客嘉宾分析的动机依然成立:黄仁勋清楚推理时代算力不是唯一,CUDA 既是护城河也是创新包袱,把 research idea 颠覆式推进产品线在大公司内部阻力极大,不如整建制收一个成熟团队——2026 年 3 月 GTC 上英伟达已发布了采用 Groq 技术的推理处理器。

三、OpenAI 为什么反着走:电力约束下的 HBM4 与"芯片内异构"

节目最有戏剧性的部分是补录环节:两位嘉宾原本判断业界向 SRAM 收敛,而 OpenAI 当天发布的 Jalapeño 恰恰没有走存储路线,而是把 HBM4 带宽堆到单封装 15.4 TB/s。子阳的研究给出了一个约束条件层面的解释——OpenAI 的第一限制不是钱,是电。

逻辑链条是这样的:美国数据中心现在缺的不是资本和空间,而是电力供给;每年的新增电力产能有明确上限,所以 OpenAI 关心的是"同样的电产出多少 token",即电转换成智能的效率。HBM 贵,贵的只是买芯片的资本开支(Capex),而 SRAM 的性价比优势恰恰兑现在这一侧——对电费不敏感的买家,为带宽单价付溢价并不心疼。子阳给出的中美对比数字:电费在总持有成本(TCO)中,中国约占三分之一,美国约占三分之二,“所以老黄天天讲 tokens per watt,中国关心 tokens per dollar”。

通用性是第二个理由。Jalapeño 定性上是一颗通用推理芯片:prefill 与 decode、attention 与 FFN 一颗芯片全包,还加入了对小维度矩阵乘法的支持(小 batch 下性能也好),甚至 demo 跑了游戏,公开信息称下一代要支持训练。而 SRAM 方案(包括嘉宾自己的路线和 Groq 与 GPU 结合的方案)本质上都是系统级异构——一颗芯片只做最擅长的一段,其余交给 GPU。模型公司业务多元、有训练需求、模型五花八门,对芯片通用性的要求天然更高。子阳点出 OpenAI 的第三个特色是"暗硅"(Dark Silicon)策略:把异构做进芯片内部,做某些任务时关掉或降频另一部分,用更多的芯片成本换更高的电效率——“从 per dollar 的角度,这个方案其实不会很好”。

外部资料可以补全这颗芯片的参数拼图:Jalapeño(西班牙语"墨西哥辣椒",与博通联合开发)额定功耗 700W、实测持续功耗不超过 550W,配备 216 GiB HBM4,RTL 到流片仅用九个月,Kernel 优化大量交给 Codex 完成;在 SemiAnalysis InferenceX 基准上(测试模型为 GPT-OSS 120B、DeepSeek R1 与 Kimi K2.5),每千瓦吞吐比英伟达 GB200/GB300 高 1.5–1.9 倍,端到端延迟低 1.7–3.6 倍——但注意未与最新的 Vera Rubin 平台对比,且这是 OpenAI 参与运行的厂商自测。顺带一提,Jalapeño 被评价为"电效率优先"的另一个注脚是英伟达芯片额定 1200–1400W,而它只有 700W。

关于 SRAM 路线会不会在两三年内被 HBM 追平,子阳的判断是 HBM 带宽增长"没有大家想的那么乐观":HBM 的连线走的是封装内走线而非光刻线,密度有天然瓶颈,走到底会演化成 3D DRAM 这类"从边走线变成面走线"的方案——乐观的方向存在,但落在权衡空间的不同点位上,很难达到 SRAM 带宽的绝对值和性价比。SRAM 自己的死穴在容量:模型权重这种固定量的数据可以用上千颗芯片摊着存,但 KV Cache 这种随用户数和上下文动态增长的数据,“落在 SRAM 不太舒适的区间里”——尽管 DeepSeek 新模型把每 token 的 KV Cache 压缩到了前代的四分之一到八分之一,趋势在缓解但需求仍是动态的。所以嘉宾路线和 Groq 的方案都把 attention 与 KV Cache 留给 GPU,专攻 FFN 段:“解决了 90% 的问题,留 10% 给 GPU,所以系统最多十倍提升——虽然那 90% 是以一千倍的效率解决的。”

四、被误读的"快":推理速度决定智能上限

主持人问了一个普通用户都会问的问题:“我觉得现在推理速度够用了啊。“嘉宾的回答是全节目最精彩的认知反转。

Mark 指出,自 agent 大规模爆发后,大量 token 根本不是给人读的:chain of thought(思维链)是模型给自己看的,agent 的输出是给别的 agent 读的。人类阅读速度的上限约 100 token 每秒,当前 GPU 系统就是朝着这个数发展的。但对 agent 系统而言速度"没有上限,越快越好”。关键的一步推理在这里:推理更快,不是把你一分钟的回答压缩成一秒,而是在同样一分钟的交互时间里,让模型用十倍的 token 做更多的内部自我思考——你看到答案的时间一样,背后是模型思考了一遍还是思考了十遍。这就是黄仁勋 PPT 的横轴不标速度而标 smarter AI 的原因,Bill Dally 管这个叫 interactivity(交互性)。

这个逻辑有现实约束背书:世界不会为 AI 慢下来。让 AI 判断明天的股票市场,它想两天再回答就毫无意义;生产事故响应、实时语音交互,都有硬性的时间卡点。“我们希望在确定的时间卡点里获得更多智能,这个就翻译成快。“一个直接的用户侧推论有点扎心:你看到某些应用回答特别快,可能只是它思考得少。

嘉宾甚至给了一个终局想象:未来绝大部分 token 在 AI 系统内部循环,为你产生最终的那个智能——你对系统说"去解决癌症”,它在内部跑掉海量 token,只把结论递给你。到那时,推理系统的单用户速度就是智能产出的吞吐量。

五、Bill Dally 的方法:location、trade-off 与"不要用 PhD 写的代码”

最后三分之一节目从行业转向个人:Mark 是 2017 年经韩松(Song Han,后任 MIT 教授)引荐进入 Bill Dally 组里的。他强调 Dally 对他影响最大的不是具体方向,而是思考方式——三个片段值得单独拎出来。

**第一,局部性(locality)是芯片设计的第一性原理。**Dally 的原话:“Computer architecture is like real estate, is all about location, location, location."(计算机架构就像房地产,全看地段。)时间局部性是用过的数据短期内大概率重复使用,空间局部性是用了这段数据马上会用到旁边的——CPU 的 cache 就是这两种局部性的经典应用。Mark 的引申很妙:AI 推理的 decode 阶段,时间与空间局部性在算法层面都被抹平了,所以必须在硬件架构层面重新制造局部性——用 SRAM 存模型权重,就是把"数据挨着计算"这件事做到极致。

**第二,数量级提升必须想清楚牺牲什么。**Dally 的做事逻辑是找最难、对系统影响最大的问题;做微小改进可以保全大局,但追求数量级的跳变时,必须清楚哪些东西可以牺牲、哪些是真正的关键——“跳出局部最优,找到更大的全局解”。失败很多,但失败不否定问题本身是正确的,只说明还没找到正确解法,或者解法暂时不存在。

**第三,研究的本质与工程的残差。**Dally 认为研究是"用最小的代价获取最多的知识”——流片之前你已经获得了 99% 的知识,流片本身不带来额外认知,所以他用科研经费造芯片毫无必要。但创业恰恰是去解决剩下那 1% 的工程问题,而且"要花 99% 的精力”。他给 Mark 的创业建议只有一句:一定不要用 PhD 写的代码——这是他上一次创业的惨痛教训,也很符合他"科学家而非企业家"的特质。

顺带一个时间线细节:2017 年 Mark 入组时,Dally 最感兴趣的不是深度学习加速,而是强逻辑 AI 的硬件加速——构建大型知识图谱、数学定理证明、芯片布局布线里那类严谨逻辑计算。他判断未来 AI 是强逻辑加强感知,而强逻辑部分没人做过针对性硬件。Mark 评价这个方向至今仍处算法研发阶段(核心是 SAT 类问题),但现在硅谷已有不少公司在尝试让 Transformer 服务数学与物理原理——如果科学探索的瓶颈落在"更快解一个复杂逻辑问题"上,芯片需求会是确定的。

子阳补充的亚马逊哲学与 Dally 一脉相承:一套是"从系统反推硬件",一套是 Customer Obsession(客户至上)——想清楚芯片造出来时(两三年后)用户要跑什么 workload,从整个系统多少节点、物理上装不装得下,一路反推到芯片最关键的那个参数:计算带宽与访存带宽的比值,它决定了读一份数据要做多少次计算才能把两者都用满,也决定了哪类模型在这颗芯片上跑得最好。

结语:异构是终局,约束决定路线

把三家公司放回各自的约束条件里,分歧就不再奇怪:对带宽性价比敏感(中国市场的 tokens per dollar、开源模型生态、成熟制程可用)→ SRAM 系统级异构;对电力敏感(美国数据中心的供电天花板)→ HBM4 通用芯片加暗硅策略;对生态与迭代速度敏感(英伟达的 CUDA 存量与包袱)→ 170 亿美元买下 Groq 的团队与技术。嘉宾最后没有直接回答"推理市场还会不会是英伟达的天下",只说希望 AI 芯片"更多彩一些"——这符合他们对异构的认知:未来不会有单一赢家,而是一套系统里多种芯片各司其职。

对读者的可迁移判断有三条。其一,评判任何推理系统,盯住三个指标:单用户速度(tokens per second)、token 成本(tokens per dollar)、能耗(tokens per watt),以及利用率只在这三者被威胁时才重要——用户端视角永远是"这个系统每秒给我多少 token、单价多少"。其二,同一技术问题在不同约束下最优解不同:中美电力成本结构(1/3 vs 2/3)决定了两条收敛路线,识别自己市场的第一约束比追逐"最先进"路线更要紧;这也解释了为什么嘉宾认为国内供应链成熟、开源模型最强的环境反而是推理芯片创业的结构性优势。其三,交互延迟不变时,内部计算量是隐藏变量:观察一个 AI 系统"变快还是变聪明",看的不是它回答多快,而是同样的回答时间背后 token 消耗涨了多少——未来大模型竞争力的分水岭,很可能就藏在这个用户看不见的数字里。

(注:本文基于硅谷101播客转写稿整理,嘉宾观点归属 Mark 与子阳,行业数据已尽可能外部核验并标注来源;转写稿中 Groq、Cerebras、Bill Dally、Jalapeño、Rubin、Itanium、JAX、SAT、PD 分离等人名术语均由 ASR 音误校正,“两百亿收购 Groq"以外部报道的 170 亿美元授权加人才转移结构为准。)