基于B站 x WAIC AI会客厅「对华为半导体首席科学家廖恒的5小时访谈」的完整转写整理。廖恒博士,清华少年班出身,普林斯顿博后,曾就职PMC-Sierra经历硅谷半导体日落期,2008年回国加入华为海思。本篇是华为经历2020年断供磨难后,高管首次系统讲述昇腾芯片从低谷走出的故事,同时也是一部从亲历者视角展开的全球芯片产业恢弘30年史诗。
一、半导体的三十年:两条主线与三个时代
新的变化
半导体产业过去三十年被两条纵向主线交织贯穿。 第一条主线是处理器(CPU):从1984-85年IBM PC开始,从桌面办公终端到企业IT服务器,再到全球数字化基础设施,CPU是最重要的支柱。2005-06年AI浪潮兴起后又催生了新的处理器形态(GPU/NPU)。第二条主线是通信基础设施:人类从非连接的物理世界进入everything connected的互联网时代——从电话线modem到宽带、光纤、城域干线,再到无线移动网络和智能手机。智能手机一度消耗了全球60-70%的半导体。
横向上,半导体经历了"极度繁荣→漫长凋零→AI爆发"三个阶段。 最令人意外的是中间的凋零期:2005-2015年整整十年,硅谷VC对芯片startup几乎零投入,所有人都认为这是夕阳产业。标志性符号是Broadcom发明的"Broadcom模式"——并购成熟半导体公司、重组裁员、提升运营效率,本质是一个夕阳产业的收割操作。半导体公司的市盈率(PE)跌到3-5倍:年利润10亿美元的公司市值只有30亿美元。
嘉宾观点与解释
垄断一旦形成,会反向扼杀上游芯片创新。 廖恒提出了一个"反直觉"的判断:恰恰是某些领域(如Google搜索、Meta社交、苹果手机)的极度成功,导致了芯片行业的凋零。逻辑链条是:当一个客户占据某类产品采购量的绝大部分,它就拥有极强的定价权,会把供应商毛利压到极低;同时它主导技术方向,但芯片从产品定义到量产至少要三年,如果完全听从客户,就会滞后四年。这种"主导方压制创新"的机制让绝大部分半导体公司在AI爆发前迅速衰亡。
AI这波暂时还没有进入凋零期,因为技术本身未饱和。 2016-17年至今,AI硬件持续繁荣,尚未出现垄断——因为每个月每个季度的进步都超出想象,谁也不能说某家是最终赢家。廖恒特别强调:“也许是在五道口,也许是在杭州的那些超级smart的年轻人,他们不断带来惊喜,让垄断一直无法形成。“这是技术本身活跃度所决定的。
二、十八层宝塔:芯片产业链的全景重构
嘉宾观点与解释
黄仁勋说"五层蛋糕”,廖恒心中是"十八层宝塔”。 这是一个从应用层到矿石的完整产业链分层框架:
- 塔尖(最上层):应用层——豆包、微信、支付宝等,直接变现
- 中上层:Agent框架、KV Cache系统、慢思维模型
- 中层:算法/模型——大模型本身
- 中下层:编译器、编程语言、并行切分、模型压缩、稀疏化、新数据格式
- 第七层:芯片本身——如何向下利用物理约束,向上提前四年设计架构让软件容易编程
- 第五-六层:工艺制程(5nm/3nm)、先进封装(堆叠)、可靠性制造
- 第四层:器件设计——FinFET、GAA晶体管,或将平行线改垂直线以缩小电容提速十倍
- 最底层:矿石、稀有金属、原材料(半导体本质是沙子加稀有金属)
“Computer Architecture is the interface between software and hardware”——这是Hennessy & Patterson经典教材中最让廖恒震撼的一句话。 芯片架构不是孤立的硬件设计,而是软硬件之间的沟通界面。当编程方式从PyTorch算子演进到Triton、TALLen(北大杨弋老师团队,DeepSeek主要开发方式)、PyPTO(昇腾自研)时,这个界面正在被重新打开。CUDA的生态护城河正在迅速消失,因为它已不再是主要的界面。
跨层能力是最稀缺的。 每一层的专家都不缺,但能跨越层次、像线一样把珍珠串成项链的人极少。廖恒举了一个精妙的例子:全世界可能有十万个AI算法研究者,但也许只有梁文锋一个人深刻认识到要突破稀疏化问题、用更高复杂性换取更小算力——这是一个跨层的问题定义,而问题定义本身占了80%的功劳,具体解决方案只占20%。
三、DeepSeek的"抠底站"与算力比的深层含义
新的变化
DeepSeek在2025年之前就预判了算力稀缺,提前选择了更高的复杂性路线。 两个关键决策:第一,参数稀疏激活——不需要暴力计算全部参数,只需聪明地选择1/32的参数参与运算,就节约32倍算力和访存;第二,attention稀疏化——序列从4K到1M差256倍,但通过压缩和稀疏化,不需要256倍的计算代价。
嘉宾观点与解释
8比1和32比1的算力比差异,决定了模型设计哲学的根本不同。 廖恒做了一个极其微观的对比:英伟达Blackwell芯片的vector算力与cube(tensor core)算力比是32:1,而昇腾是8:1。这意味着——英伟达的算力空间"很富裕",模型可以随意浪费(就像住400平米别墅堆满没拆的快递箱);昇腾的算力空间"比较紧凑",模型必须精打细算(100平米的公寓住一家四口)。
DeepSeek主动选择了后者的路线:付出更多的vector计算来挑选送往cube做暴力运算的数据,实现"抠底站"。这就是为什么昇腾虽然是Blackwell四分之一规格,跑DeepSeek时"也还可以"。 相比之下,Anthropic或OpenAI的模型不需要这么做——它们买来的机器有32倍的富裕算力。
这是跨了两层楼的协同优化。 做算法的同学意识到,模型优势应该建立在什么地方;做芯片的同学意识到,算力比的设计要匹配算法的演进方向。廖恒强调:“无论是做芯片的,或者是做模型的同学,如果有这层consciousness,这层对大前提的understanding,努力方向会发生非常大的不同。”
四、摩尔定律的三个维度与"换道题"思维
嘉宾观点与解释
摩尔定律有三个维度,但只有能效维度还有收益。 第一,经济性(每个晶体管成本下降)——在7nm/16nm时已停止,之后每个晶体管反而变贵了,摩尔定律的反通胀红利消失。第二,性能(管子越小越快)——也非常微弱,因为线越细电阻越大、极板越近电容互相抵消。第三,能效(翻转更小水桶消耗更少能量)——这是当前唯一真正有收益的维度。
中国与台积电的主要差距就在能效上。 廖恒坦言:要提供十万个GPU的算力,华为轻松可以提供,只是比世界第一的产品更耗电。但中国的电力供应是美国的约三倍,数据中心电费是美国的1/4到1/5。这并非以耗电为荣,而是"保底不需要过于担心"。
“换道题"可能给出完全不同的答案。 廖恒用一个捕鼠器的比喻来阐释:人类历史上灭鼠器专利可能上千个(化学工程师做毒药、机械工��师做夹子、电气工程师做高压电),摩尔定律也好超定律也好,无非是工程师用爱迪生式思路从不同角度解决同一个问题。如果把两根平行线改成正交线,重叠面积骤减、电容缩小、速度可以快十倍——这就是"结构性改变"的力量。当你换一个度量尺度(从空间纳米到时间皮秒、从面积到能量皮焦耳),答案可能完全不同。
五、昇腾史:从910到950,从迷茫到清醒
新的变化
910时代的条件最好但方向迷茫,950时代的条件最差但方向最清晰。 910设计时拥有世界最先进的逻辑工艺(台积电最先甚至英伟达都不用的制程华为第一个用),但不知道AI最大的变现机会在哪里——当时推理市场压根不存在,只能幻想把训练好的模型部署到边缘设备。950设计时面对的是硅谷市值最高的对手,条件极为苛刻,但大模型爆发提供了丰富的设计依据,DeepSeek R1催生了推理需求爆发,设计参考变得现实而具体。
断供之后,“impossible"的问题被拆解成了一千个物理化学数学问题。 廖恒形容那段最困难的日子:可能五千到一万块单板全部重新做过,每个零件都换了,快速重新达到量产能力。五G网络从未断供,通信基础设施建设从未明显推迟——这背后是无数人日日夜夜的努力。但这不需要用单一事件来标记,“就像今天没下暴雨没发生地震,理所应当的事情背后有非常多人的努力”。
嘉宾观点与解释
最困难的时期不是被批评的时候,而是没人批评的时候。 廖恒对"熬过最难日子"的判断标准极为独特:当开始收到越来越多内部批评时,就意味着最难的日子已经过去了。因为"如果你在沙漠里走了七天没喝水,看到再脏的水都觉得是救命水;等你恢复体力喝到第二瓶水,就开始觉得味道不好了”。最困难时没人批评你,因为大家都在求生。
断供后5-10%的人迅速离开了,但80-90%的骨干选择了留下。 廖恒说不同角色感受不同,他个人的感受是"激发了解决问题的极大热情”——终于有机会去搞清楚光刻机台如何做到一纳米精度、如何高速运动中定位测量。“对于一个工程师来说,这是天赐良机。”
海思每年tape out约70-100颗芯片,五年381颗,从未听说有一颗回来"冒烟"(测试不通过无法量产)。 这个如此高的命中率证明了团队的quality。廖恒刚加入时的"不相信"被迅速教育转变——他发现身边同事虽然履历不一定光鲜,但在各自领域都极其负责任。
六、不抄作业:昇腾为何与英伟达"越来越不像"
嘉宾观点与解释
“没有世界上任何一个科技公司可以靠抄作业获得巨大的成功。” 这是廖恒最核心的设计哲学。抄作业意味着借用别人的生态,看起来省力,但有两个致命问题:第一,永远不可能长得跟别人完全一样,不完全一样就一定有后果;第二,技术体系完全不可演进——一步抄必然步步抄,完全丧失自主设计创新的可能性。
微观层面在学习对方,系统层面越来越不像。 昇腾早期与英伟达有更多相似,甚至某种程度上"对方变得越来越像我们"——英伟达的Tensor Core越来越像昇腾的Cube,在变大以获得更高计算效率。但系统层面走向了截然不同的两条路:英伟达追求极致的rack密度(每代双倍算力塞进同样机框),昇腾选择了"稀疏"设计——更小的积木块、全光互联、舒适的物理空间分布。
2.5D scaling有物理上限,因为n²与4n的矛盾不可调和。 廖恒做了一个精彩推导:如果把计算die看作边长为n的正方形,算力是n²(正比于面积),但所有内存带宽和互联带宽都要跨越周长4n的边界。当n越来越大时,n²的曲线和4n的直线之间的gap会越来越爆炸。这意味着靠"越来越大计算die+越来越多HBM"这条路有上限——也许还能做一到三代,大概率第四代就不行了。
单个rack不应无限提升密度。 如果机框功耗从10万瓦到20万瓦到40万瓦再到1兆瓦(只需四年),用自然散热的话散热塔需要500平方米才能散掉1兆瓦。一个Gigawatt数据中心可能只有1000个rack,但要占地一平方公里放散热塔——250倍的空间放大意味着水管要拉一公里才能到达散热塔。所以昇腾选择用光纤互联让芯片舒适地摆放在更大空间里,而非暴力塞进密集机框。
做芯片要同时突破二十个物理极限,只要有一个没突破产品就挂掉。 99%的二十次方接近于零,但99%的五次方还可以忍受。昇腾选择把精力集中在突破五个特别难且高价值的问题上,把其他难题留给别人,大幅降低产品失败概率。
七、光互联与7.2T光模块:直觉驱动的设计决策
嘉宾观点与解释
昇腾做出了一个7.2T的光模块,是市面上800G(0.8T)光模块的9倍带宽,并坚定放在芯片边上(NPO)。 这个设计决策背后是一系列基于物理直觉的判断,不需要做实验或咨询一百个专家:
- 为什么不放芯片封装里面? 封装内部有一个1000瓦的NPU,非常热。温度每变化一度,所有光学材料的折射率都会变化。放在极热环境里,折射率剧烈变化会带来无数问题。
- 为什么不把光源放在外面? 如果用一颗外部光源给72路光供能,那一个点承受72倍功率,会形成局部热点,烧坏材料或灰尘——“它就不再是光通信了,变成切割机了”。所以昇腾做了两颗光源放在里面,坏了一颗还有另一颗继续工作。
- 为什么放芯片边上(一到五公分距离)? 去掉了传统从芯片到面板连接器几十公分的电缆,消灭了"八爪鱼"式的线缆飞出问题。
这些决策来自2008-09年就开始学习光通信打下的基础。 廖恒当时报了荷兰一个大学的暑期班,花一两周学习了激光器设计、信号调制、折射率等基本知识。这恰好印证了他对人才成长的理念——“喇叭口要张开”,不但关心自己手头的事,还要关心楼上楼下、上下左右三百六十度,多读几篇看似毫无关系的论文。
八、内存海啸与HBM:AI芯片本质是在卖高带宽内存
新的变化
2026年上半年HBM暴涨十几倍,给整个电子行业带来巨大冲击。 廖恒透露,昇腾在七年前就意识到"与其说在卖AI算力芯片,不如说在卖高带宽内存",并成立了专门部门建立HBM设计能力。但即便提前七年准备,等到海啸来临,依然发现准备不够。
嘉宾观点与解释
AI芯片80%的成本是HBM的钱,只有10%花在先进逻辑die上。 所以AI芯片的主要竞争力来自有多少带宽,而不是多大的计算规格。计算规格变大时,带宽必须等比例放大——而HBM不能独立销售,必须寄生在GPU/NPU里才能变现。
推理芯片和训练芯片需要不同的算力与带宽比。 进入大规模推理部署后,昇腾迅速发现:做推理(尤其是DeepSeek的MLA部分)算力不需要那么高,反而是内存带宽特别重要。训练和推理所需的"算力/带宽比"有显著不同,因此需要不同类型的内存配置。推理(profit center)一定比训练(cost center)更大——如果推理不多,说明economic不好。
九、CANN开源与AI生态的三层难度
嘉宾观点与解释
开源的本质是最大化沟通带宽。 廖恒用了一个精妙比喻:人与人沟通每秒可能只有三五个字(约1kbps),但两颗芯片之间通信带宽是7.2T(terabit per second),差了无数个数量级。当限制文档何时发给谁看、还要签NDA时,就是在本来极其受限的沟通channel上又加了不必要的防护门。开源是极致的开放——把所有代码公开后,不需要费口舌沟通,对方自己看无数的目录和文件就行。开源后无论是开发方还是客户方,都"如释重负"。
AI生态有三个难度递增的等级。 第一级:模型推理适配(一次性工作可复制部署,最简单)。第二级:大规模训练(工作量约推理的三倍,但也是一次性投入,靠人力可跨越)。第三级:研究支持(几十个算法人员每天改代码做不同实验,必须靠更先进的编译站才能完成)——昇腾当前突破推理已基本解决,突破训练完全可期待,突破研究需要在一年内局部达到。
超过CUDA比突破纳米级物理更难。 因为前者只要自己努力(70%在自己手里),后者要改变无数人的群体习惯——“就像发明一个即时通信软件说服所有人不用微信,非常难”。但CANN社区已成为中国开源社区的火焰社区,过去一年在众人拾柴的趋势下取得长足进步。
十、芯片人才论:必须经历过tape out cycle
嘉宾观点与解释
天才博士做不了芯片,必须从模块级经历完整的tape out cycle。 芯片设计与写软件最大的区别:软件写十分钟代码就会编译运行一次,但芯片要十八个月后才能按一次按钮,而且按一次至少花掉两三亿人民币。芯片有极多物理层面的东西——差一纳秒一皮秒的timing没到,芯片立刻fail。学校教育给不了这些,必须在真实项目中历练。
看重三观对齐胜过光鲜履历。 廖恒不看名校名师背景,第一看中的是价值观对齐——“就算特别collide很高的同学,如果只花半年一年没有耐心经历训练cycle就走,对我来说是完全浪费时间”。华为不天价抢人,“不太符合奋斗者文化”。
算力不是中国做AI的主要瓶颈。 在学术界,中国的算力绝对比海外充裕得多——北京上海的国家实验室有万卡以上规模,而国外最著名的高校一个系可能只有几百卡。在企业界,只要有价值的团队都能获得一定算力。廖恒特别提到DeepSeek团队"算力相当少,绝对不是十万卡百万卡规模,是以千卡规模",但实现了极高突破。
十一、对AI未来的判断:垄断不太可能,物理AI的ChatGPT moment还没到
嘉宾观点与解释
AI垄断近期不太可能形成,至少有三个因素在"刺穿泡泡"。 第一,技术本身未进入饱和期,领先者三个月六个月后可能被超越(Llama曾经世界最优秀,现在暂时不是,但明天也许东山再起)。第二,有一些有志向的人并不想成为"世界终结者",而是希望普惠地让更多人加入做下一个发明——至少中国的一两个leading团队价值观就是这样。第三,中国群星璀璨的人才供给和开源文化——开源模型是刺穿垄断最重要的针。
数字AI已经足够有用,但缺少"带入人的场景"这一环。 廖恒对下一个超级应用的判断是:AI在95%的具体事务上都比人做得好,但唯一还缺人的是——它没有参加你的会议,不知道你领导写的KPI,不知道你这半年的核心项目。谁能设计出一种novel的方案让AI带入个人上下文(同时解决隐私安全边界问题),谁就找到了下一个超级应用。这个设计"可能跟模型本身没有半毛钱关系,是一个更好的APP"。
物理AI的ChatGPT moment还没到,但可能在未来两三年。 廖恒从华为七年自动驾驶经验判断:带腿机器人暂时难以变现(能耗问题是原因之一,拖一根线就解决了但限定工作范围),更大的鸿沟在于物理AI的模型还没有到ChatGPT的moment。一旦突破,会催生一个庞大产业——“一旦进入物理世界就不太容易垄断,汽车工业发展上百年还是有这么多不同品牌”。
十二、中国的芯片道路与廖恒的使命
嘉宾观点与解释
这十年对中国芯片产业是"能力的爆发期"。 除了工艺和封装有一定差距,绝大部分美国能做的芯片中国都可以自己做。设计相对复杂的、有门槛的芯片能力已经百花齐放——自动驾驶芯片、机器人芯片、WiFi芯片,这个能力变得不那么稀缺了。而且从业人员比硅谷年轻二十岁,代表更多希望。
“当我接受到越来越多批评的时候,就感觉到已经熬过了最难的日子。” 廖恒用沙漠行走的比喻解释:七天没喝水时看到再脏的水都觉得是救命水;恢复体力后第二瓶水就开始觉得味道不好。最困难的时候是没人批评的时候——去年前年就已经过了最难的时候。
推荐书单:
- 《思想工厂》(Idea Factory)——贝尔实验室历史,尤其1940-45年那段,计算机(冯诺依曼)、信息论(香农)、晶体管(肖克利/巴丁)三大发明压缩在普林斯顿周边一百公里范围内,与当下中国"所有right ingredients恰好right time right place"高度呼应。
- 《Innovator’s Dilemma》——成熟组织通常容纳不了新东西,给企业领导者看。
- 《Rules of Work》——年轻人如何合适地看待工作环境,在学校里学不到。
- 《Edison》(Gutenberg.org免费电子书)——爱迪生可能连初中都没上完,但有天生的engineer quality:做有用的事、尊重现实、选择值得解决的问题。
- 《The Soul of a New Machine》(新机器的灵魂)——Data General公司工程师群体设计新一代机器的真实日常,工程师代代相传的故事。
“Betting on China并不等于bet against America。” 廖恒在访谈最后的这句话,或许是整个5小时对话的精神内核。Silicon Valley不在硅谷,也许在五道口,也许在上海的滨江——因为那里有人在餐馆咖啡厅激烈讨论"昨天的loss为什么跑飞了"。
这篇访谈信息密度极高,从半导体30年宏观历史到昇腾芯片微观架构设计,从DeepSeek稀疏化的跨层协同到7.2T光模块的物理直觉,从摩尔定律三个维度的精确剖析到不抄作业的设计哲学,堪称一部芯片产业的全景式教科书。廖恒博士以工程师的严谨和亲历者的温度,还原了华为昇腾从断供磨难到走出低谷的真实历程。