先说结论
2026年9月23日下午,云栖大会「AI Native 磐久超节点服务器与硬件工程创新」分论坛用七场演讲回答了一个问题:当大模型把服务器逼到单柜650千瓦、单颗GPU模组3500瓦、互联域要从64卡跳到千卡甚至万卡时,硬件工程还能怎么办?阿里云给出的答案是磐久AL144超节点——单柜144卡、650千瓦,通过二级光互连最多扩展到10368卡,一年前还被视作极限规格的AL128(350千瓦、64卡互联)如今成了「上一代」。但这场论坛真正值得记录的不是参数,而是方法论:主持人刘清溪口中的「系统工程究竟要怎么做」,被拆解成了铜与光的边界、热阻的分配、电压的取舍、故障率的治理,最后落到用AI研发AI硬件。嘉宾反复强调的一点是——四道工程墙(互联、散热供电、内存、拓扑部署)里,任何单点优化都无法同时作答。
一年一代:超节点撞上四道墙
开场嘉宾、阿里云资深技术专家郭锐用四个信号解释了为什么硬件必须重构:MoE(混合专家模型,把万亿参数拆给多个专家网络)成为主流,单域卡数需求从64卡跃升到百卡、千卡级;推理算力与芯片功耗同步大涨;KV Cache(大模型推理时缓存的上下文键值对)让内存需求变得急迫——显存HBM很快但很贵,装不下所有上下文;而Agent应用的兴起让CPU「重新回到了AI集群的关键路径」,因为Agent需要的是内存和IO,而不是纯算力。
这四个信号在郭锐看来映射成四道墙:互联墙(scale-up域,即单机柜内高速互联的卡数域,要从64卡走向百卡千卡甚至万卡)、散热供电墙(机柜从两三百千瓦向五百千瓦、兆瓦级演进)、内存墙(KV Cache要不要池化)、拓扑部署墙(老旧机房怎么办)。他的原话是:单点解决一个工程,没办法回答四个问题。
所以AL144的答案是一代架构、三个产品族:旗舰AL144整机柜超节点(基于AI Infra 3.0架构)、面向存量机房的AL64分布式超节点、面向Agent场景的CPU整机柜与CXL(Compute Express Link,一种缓存一致性互联协议)KV Cache内存池化整机柜。AL144的形态细节最能说明「系统工程」四个字的分量:36个GPU计算节点加12个交换节点组成IT柜,旁边是独立的供电柜——之所以把计算和供电分成两个柜子,是因为散热和供电部件在原设计里占位太大,塞在一起就无法保障144卡的互联密度;3个PDU加14个Cap Shelf(电容备电架)负责秒级瞬态功耗支撑。整柜全液冷,而上一代AL128还是风液混合。
阿里云自报的规格跃升是:单域密度提升2倍,机柜功耗从350千瓦涨到650千瓦(提高86%),GPU模组设计功耗从2000瓦涨到3500瓦(涨75%)。这些数字与官方通稿一致(外部核验:搜狐转载的官方发布稿确认144卡、650kW、3500W、万卡Max 10368、单柜带宽Pb/s级)。郭锐还补充了一个容易被忽略的工程细节:3500瓦的模组必须用垂直供电——平铺电源的PCB寄生参数太大,满足不了芯片微秒级的电流突变,所以供电模块干脆贴到芯片背面。
铜光边界、仿生液冷与800V:三场攻坚里的同一套账
**铜和光的边界在哪里。**主持人刘清溪的串场给出了框架:柜内互联按TCO(总拥有成本)测算,最优解仍是铜;跨柜互联正从铜走向光。高级硬件工程师王嘉琦把这层「边界」算成了账:单波速率从53G到106G再到212G,铜的损耗随速率和距离线性增加,走到212G时,芯片封装、过孔、PCB走线和连接器已经吃掉了芯片驱动能力的大头,留给外部互联的链路预算所剩无几。硬要用铜,就得加Retimer(信号重定时芯片)——但它会引入约100纳秒的器件延时,而且「在实际应用中会成倍体现在传输时间上」。光互联则把器件延时降到纳秒级,传输损耗随距离几乎不涨。王嘉琦据此把2026年定义为「光互联元年」,并预测2030年AI scale-up域的光互联渗透率超过30%——这是演讲者的判断,不是既成事实。
方案选型上,阿里云选了NPO(近封装光互联,把光引擎放在主芯片附近)而非侵入芯片设计的CPO(共封装光学),理由是NPO可以模块独立维护、故障与主芯片解耦。落成产品叫SNPO:单模版DR32用硅光方案、外置光源、最远500米、功耗低于26瓦;多模版VR32内置光源、30米、低于10瓦;两者共引脚定义、共socket,同一块主板按场景换模块。接口兼容3.2T/6.4T/12.8T三档带宽,误码率实测在1e-10到1e-12量级(规范要求1e-9)。量产时间表是2026年Q4量产、2027年上半年批量交付。配套的NPX规范做了一件事:铜和光封装进同一个socket——向内短距配铜线缆,向外拓展用光模块,省掉重复开发。这套东西也开放:王嘉琦明说,光互联还在起步阶段,性价比和可靠性待提升,仅靠一家公司做不成,所以开放规格书和规范。
**热怎么散。**资深技术专家钟杨帆的分享把「全栈液冷」拆到了热阻级别。行业背景是:GPU模组功耗从100瓦一路涨到GB300世代的约2700瓦、Rubin世代预计3000瓦以上;机柜功率从2006年的8千瓦、2021年的15千瓦,涨到如今业界口径的GB200/300约一百三四十千瓦、Rubin Ultra预计600千瓦以上(这些为演讲者引用的业界口径)。他的结论是「再大的风也吹不凉滚烫的芯」,液冷从可选项变成必选项。工程上有两笔账:一是TIM(芯片与冷板间的导热界面材料)——导热硅脂做到约6 W/(m·K)就到头了,液态金属可以超过26,在功率密度330 W/cm²时能把温升改善近15度,对3500瓦的模组来说这15度直接兑换成功耗释放空间;二是冷板——从水平微通道升级为按芯片Power Map(功率分布图)定向喷射的射流冷却,把喷射点放在最热的地方,用最短路径带走热量。整机柜层面则是仿生思路:像叶脉和血液循环那样按每个芯片的实际需流做阻抗匹配,避免「近端抢流、远端欠流」——从350千瓦到650千瓦的关键不是更大的泵,而是更均衡的流量分配。可靠性上,全焊接冷板减少密封圈漏点、三级漏液检测、分区防扩散,因为漏液和凝露是不可逆的。
**电怎么送。**练恒和向蓓两位专家接力讲了800V HVDC(高压直流供电)。练恒先算天花板:电流越大,线缆越粗,粗到拐弯半径拐不过来就是物理天花板;损耗按I²R平方增长。从54伏母线提到800伏,电压提升十几倍,线路损耗大幅下降。为什么是高压直流而不是高压交流?他给了三个理由:柜内部件全用直流、备电系统(BBU/CBU)天然直流、以及最关键的安规——800伏直流可以做浮地设计,故障电流不会经过人体入地。整条链路极简:10千伏市电进来,经「巴拿马」电源(阿里与台达2019年联合推出的中压直转直流方案,取代中间一串配电设备)到sidecar供电柜,再到节点,只经过两级设备。Cap Shelf用电解电容而非超级电容,为的是微秒级响应GPU的EDP瞬态尖峰(最快可冲到卡功耗的2倍),瞬态峰值支撑能力1.5兆瓦;电解电容定制后支撑10亿次充放电,设计寿命5年以上。向蓓接着讲板级:800伏进节点后,计算节点转50伏中间母线(功率约20千瓦),交换节点转12伏(约3.6千瓦),两级三级转换并存,按转换效率与路径损耗取最优;HVDC PDB在IEC 62368安规基础上加了20%裕量,节点拔出后1秒内降到60伏以下安全电压,漏电流2毫安预警、10毫安保护,PDU与节点联动可以把绝缘故障定位到具体节点。垂直供电则与平头哥芯片团队共同定义了十二相power block,比三个四相模块释放约20%布板空间给电容。
这三场攻坚背后是同一套逻辑:每一项「参数提升」都要先算一笔物理账(链路预算、热阻、I²R),再把账转成可分配、可验证的工程指标,最后把接口和规范开放出去换取供应链安全。郭锐说得更直白:800伏的电源砖如果不开放、各伙伴不pin-to-pin兼容,「选定的方案一旦出现供应问题,你没有第二个供方」——开放不只是生态姿态,是供应风险管理。
故障率要打到最后一个数量级:稳定性治理的账
高级技术专家杨磊的分享回答了一个尖锐问题:超节点更复杂了,怎么反而可能比传统八卡机更稳定?他先列了三大挑战:迭代周期缩到一年,新平台必须一个季度稳定下来;元器件种类和用量爆炸式增长;单柜价值和「爆炸半径」(单点故障影响的业务规模)指数级上升,故障率必须极致地低。
阿里的应对分两层。管理层面上:重构质量标准、开发流程、质量活动和交付模式,让平头哥芯片、服务器整机、云实例可以同时发布;从2017年起推动从整机到部件全归一——A厂、B厂、C厂交付的是同一套产品;对液冷新部件做白盒化,管控深度到高温区电容和端子。运营层面上是「用AI治理AI服务器」:把每个部件的故障特征抽象成原子故障特征,监控颗粒度细到杨磊比喻的「毛细血管」级别,再用AI拟合多维数据识别变异点,问题发现时间从周级、天级缩短到分钟级;自研诊断系统做拓扑级、节点级、链路级分层诊断定界,减少误报。与合作伙伴的攻关节奏是:固件类问题当天解决,硬件类两天完成定位,关键部件有一周内的快速失效分析通道。杨磊自报的收益数据是:超节点故障率峰值在一个季度内收敛;整柜折算成八卡的故障率,达标周期比传统八卡缩短两个月,第三个月就优于同期八卡——这些是厂商口径,无第三方数据佐证。
他同样点出了超节点最怕的两件事:批量漏液和凝露——传统机房空调坏了顶多过热保护,液冷漏液是不可逆损伤,「一旦批量发生,代价以亿起步」。这解释了为什么整场论坛的可靠性设计都围绕「故障域隔离」展开。
AI写硬件:当验证比生成贵,SOP先变成AOP
最后两场演讲把话题从「造硬件」转向「用AI造硬件」。高级硬件工程师佟思凯抛出的问题很扎心:同样的模型在软件领域已经能跑自我迭代的循环,放到硬件领域大多还停留在问答助手。他的诊断是四个困难:硬件知识长尾且大量依赖不成文的隐性经验;原理图、手册、示波器波形这些数据格式不适合喂给AI;大量工作依赖Cadence、Creo等第三方软件和物理世界;最关键的是「验证比生成贵」——软件有编译器和单元测试这两件「被低估的奢侈品」,判断一个想法对不对几乎零成本,而硬件要仿真、打板、上测试台,投板错误不可逆。
所以他们的方法论不是等更聪明的模型,而是把成熟SOP(标准作业程序)拆解成AOP(Agent Operating Procedure,写给智能体的行动手册):把硬件研发按8个领域×6个阶段拆成48块、上百个动作,每个动作按输入、动作、判据、验证器四元组定级——AI能参与哪一步,不是拍脑袋,是评审出来的。他们还提出了L1到L5的五级分级:L1人本主导(他举例说展台上那台AI音乐整机柜的结构设计,基于当下transformer架构的AI做不出来)、L2物理交互、L3工具中介、L4协同决策(当前实践所在)、L5自主闭环(CPLD固件开发已接近)。落地案例包括需求分解、FMEA失效模式分析(转写疑似「飞马分析」,按语义校正)、电源工程师五段式助手,直到AI直接驱动Creo生成三维装配。可靠性靠搬运软件界的benchmark概念:黄金测试集加双轨对照打分加版本对比防退化。佟思凯最后呼吁把数据结构、交付模板、判据测试集做成行业开放标准——「一家企业把SOP变成AOP,提升的只是自己的独立交付率;整个行业一起开放,提升的是这条长链的整体效率。」
压轴的赵哲讲了固件团队的「数字员工」:不是找无所不能的超级模型,而是构建一个稳定工作的系统——主Agent只当调度者不写代码(保持上下文干净),写代码和做审查的Agent必须分开(「既当裁判又当运动员,幻觉严重」),知识库以人和AI都可读的Markdown文档按需挂载,每轮交付持久化成文件、可审计可回放。自报运行数据:上线三个月,平均单项交付约3小时但可并行、可7×24工作;项目代码AI生成采纳率100%;AI缺陷发现占比从约50%提升到90%,目标96%以上「人可以完全放手」。他引用了一句口号式总结——从vibe coding到vibe working(转写疑似「Web coding/Web working」,按语境校正为业界流行说法,归属阿里CEO吴泳铭)。
观察指标与启发
把整场论坛串成几条可跟踪的链条:
其一,跨柜互联从铜到光。变化源于212G世代铜的链路预算耗尽与Retimer的100纳秒延时;谁得谁失——存量老旧机房业主因AL64分布式方案不必推倒重建,铜互联与Retimer厂商的长距市场承压,光器件国产链路获得确定性订单;二阶影响是「超节点专属机房」与「改造存量机房」两条部署路线并行;观察指标是SNPO能否如期在2026年Q4量产、2027年上半年交付,以及2030年30%渗透率的预测是否兑现。对读者的启发是:介质选择不是技术审美,是一笔链路预算账——当驱动能力被封装和PCB吃掉大头,就该换介质了。
其二,供电从54伏走向800伏直流。变化源于I²R损耗与线缆物理天花板;运维人员获得免拔线的盲插运维,功率器件厂商获得新市场,但安规与器件生态要整个重构——向蓓坦言器件级安规拼图「还不特别成熟」;二阶影响是电源模块故障率标准被要求下降一个数量级(柜级模块用量从AL128的约150颗涨到AL144的近二三百颗);观察指标是那份基于IPC-9592B加严、覆盖6大类24项的白皮书能否在Q4如约开放,以及几家厂商跟进。启发:高压化的瓶颈从来不是拓扑,是安规、供应安全和生态。
其三,液冷从可选项变必选,AI从运维工具变研发同事。散热上,TIM材料与冷板结构的热阻分配决定了650千瓦之后还能不能再往上;研发上,「验证比生成贵」决定了硬件AI必须先把判据工程化。观察指标是AI缺陷发现占比能否过96%、独立交付率的行业基准能否共建。
郭锐在开场说,AL128发布一年就从「极限规格」变成了「上一代」。这场论坛留下的真正注脚是:下一代超节点的竞争,用钟杨帆的话说,「是工程深度与标准广度的竞争」——两个都要抓。对普通读者,看懂这层的捷径是盯住三个数字:单柜千瓦数、互联域卡数、以及开放规范的跟进厂商数量。
(本文基于官方回放转写整理,讲者姓名与议题已按云栖议程页校正;关键规格经官方通稿交叉核验,故障率、采纳率等为阿里云自报口径;转写疑似项已在文中标注。)