先说结论
2026年9月23日下午,云栖大会「超节点Scale-Up开放互连与开源计算生态:UALink实践」专场(当天上午另有一场同主题总览论坛,本篇只覆盖下午这场实践专场)把十场演讲排成了一条完整的产业链:联盟、GPU厂、FPGA、服务器厂商、交换芯片、Retimer、SerDes、EDA,每家讲自己离UALink落地最近的那一环。UALink联盟主席、AMD基础设施策略总监Kurtis Bowman给出的定位是全场的题眼:「算力的单位不再是芯片,而是Pod,Pod内部的fabric决定了什么有可能。」这个成立两年的联盟已经从8家发起公司长到110多家成员,其中31家在中国;2026年4月同日发布四份规范,第一批UALink交换机和加速器预计2027年面世。真正的矛盾不在协议好不好,而在两件事:一是带宽增速(年约1.4倍)追不上算力增速(年约3倍),谁也躲不开这笔账;二是协议「百家争鸣」(NVLink、PCIe、以太、ESUN、UALink),最终的胜负取决于端到端互通性而非单点性能——这是本场反复出现、也最有信息量的判断。讲者姓名均按官方议程页校正(转写误识较多,如「高海敏」实为皋华敏、「袁静茹」实为袁靖茹),关键事实与产品规格经外部核验。
一、带宽追不上算力:一本逼出开放互连的账
要理解为什么这场论坛上每个人都在讲互连,得先看合见工软袁靖茹给出的三组数据:模型规模按年4到5倍爆炸式增长,集群从千卡演进到十万卡,加速器之间需要交换的数据随之指数级增长;而算力大约每年增长3倍,带宽只增长1.4倍——一条明显的剪刀差。传统上行业讨论最多的是算力峰值,但从千卡到十万卡之后,计算带来的限制正被互连的限制替代,训练、长上下文、MoE(混合专家模型)推理场景全都撞在这堵墙上。Marvell刘扬从供给端补了同一本账的另一页:AI相关HBM(高带宽内存)市场今年增速42%、长期也在30%以上,但内存带宽的增速依旧远低于GPU算力增速,于是需要一个Scale-Up互联网络去共享远端内存,弥合算力与内存容量之间的缺口——这里的Scale-Up指超节点内部把成百上千颗加速器连成一体的纵向扩展,与跨服务器组网的Scale-Out相对应。
阿里云资深技术专家孔阳的开场则把这本账落到了推理业务上:超节点过去一年在服务化、功耗与散热工程上进步显著,但更大的价值在推理——Prefill(预填充)阶段靠超节点内HBM大容量把算力密度做上去,Decode(解码)阶段靠多颗GPU的HBM高带宽把吞吐做上去;在智能体时代,超节点本质上是「Agent效果、用户体验、token成本」三者的均衡点——数字员工之间的机器对读要极致吞吐,而成本敏感的异步任务更在乎低token成本下的端到端效果。他提到阿里云2026年在去年基础上发布了更新的分布式AL64方案与下一代AL144方案(均为转写记音,已与上午专场信息互证)。
Intel资深技术专家Josh Collier(UALink联盟技术任务组联席主席,视频演讲)把账算到了物理层:scale-up对带宽的需求最高可达scale-out的18倍,而且处在单次推理或训练步的关键路径内;这些带宽最终都变成端口、通道(rails)、线缆、光学器件和交换机,所以scale-up已经是机柜里网络成本的大头。「借用通用网络,帮的是你的日程表,不是你的效率」——量级会放大每一分低效:如果每个加速器能省下100瓦,年部署百万颗加速器的公司省下的就是天文数字。他的结论是,每次行业撞上新的规模问题,答案都是一个专门构建、深度优化的网络,而不是把旧网络复用一遍。
Kurtis Bowman给出了联盟侧的进度表:UALink架构可以概括为每station端口800Gb/s、一个Pod最多1024个加速器、任意两颗加速器之间单跳可达;今年4月同日发布的四份规范里,Common规范新增在网计算,200G链路与物理层规范独立成篇(物理层可按自己的节奏演进),Chiplet规范让互连可以作为独立芯粒经UCIe(通用芯粒互连标准)接入SoC,可管理性规范则基于Redfish、gNMI等标准协议给运营方一个标准化控制面。他还讲了一句行业政治学:阿里云是UALink董事会成员,「只有芯片公司参与撰写的规范,只会是对芯片公司好的规范」——阿里把规模、可管理性、租户隔离、生产环境真实故障这些运营方要求写进了4月发布的规范文本。谁坐在制定标准的桌边,谁的诉求就会被写进协议。
二、内存语义与在网计算:UALink 2.0把通信开销从GPU搬进交换机
这场论坛反复出现两个词,值得先解释清楚。「内存语义」(memory semantic)指GPU可以直接对远端加速器的显存做读、写和原子操作,像访问本地内存一样,不需要组报文、建队列、注册内存那一套软件栈;「在网计算」(in-network compute)指把广播、规约、AllReduce这类集合通信原语下沉到交换机里执行。瀚博半导体IP设计高级总监王祥称在网计算是UALink 2.0最重要的新功能:其硬件主要落在交换机侧,GPU侧只需要接口IP支持协议格式,几乎不增加芯片面积就能享受卸载收益;大块数据模式下GPU一条命令就能完成大批量操作,通信流量和传输次数都大幅减少。Kurtis Bowman的说法更直白:在网计算把带宽还给系统,把计算时间还给GPU。
Josh Collier用一组对比解释了「专用」为什么比「复用以太网」值钱:承载内存语义协议时,以太帧格式在理想情况下也只有约75%的线速效率,UALink的定长内存语义帧约89%;折算下来,以太系方案需要多出约20%的端口才能交付同等有效带宽——那是真实的成本、功耗和线缆,而且额外延迟直接落在TPOT(每token输出时间,即用户体感延迟)上。他还给了一张诚实的限定条款:不声称UALink今天在每个维度都领先,生态与拓扑广度仍在扩展,但效率、延迟、面积与开放多厂商生态这些基本面,都站在专门构建的内存语义网络一边。星拓微电子马明辉从系统视角做了补充:系统性能是单芯片算力、互联效率、软件效率的乘积,scale-up的真正意义是把集群规模的部署变成「一台计算机」的协作。
内存语义打开的另一扇门是「谁可以进这个域」。AMD嵌入式产品资深IO专家皋华敏的分享最有想象力:UALink打破了原本闭源的scale-up域,FPGA迎来了进入这个域的最好时间窗口。AMD已在最新7nm器件上完成UALink demo的上板验证(转写记音为「博索」器件,疑指Versal系列,存疑)——「能接入」已经跑通,「是否值得接入」他留给听众带着自己的负载去判断,并给了三个例子。其一是KV Cache(大模型推理的键值缓存,模型的「记忆」)分层:参与decode的热数据留在GPU HBM,可复用前缀和不活跃会话放进FPGA管理的容量池,按需分块读取与预取,省掉重复的前缀计算算力;相比在主机域用CXL做内存扩展,scale-up域内天然带宽更大、延迟更低。其二是P/D分离:Prefill产生的KV先存入域内FPGA内存池、Decode按需取用,系统多了一块高低延迟缓存就能支撑更高并发,代价是占用scale-up域端口。其三是把FPGA当作域内存储服务端点,朝加速器走UALink、另一侧经PCIe接SSD放更冷的数据,或者顺手做量化/反量化、张量布局转换这类GPU做起来不划算的算子。这套思路与袁靖茹的判断互相印证:原生支持内存池化是UALink协议的先发优势。
王祥还公布了瀚博的工程数据:其支持UALink的GPU预计年底推向市场、将是业界最早一批,芯片设计在2.0规范发布时已接近完成,因此支持1.0标准;但设计之初瀚博就与交换机芯片厂商合作在芯片内实现了自定义在网计算,今年4月完成了与交换机厂商在UALink IP层面的互联互通测试。IP性能前访测试中,256字节数据的读写SoC带宽利用率分别达到89.5%和91.3%,64字节时降至73.8%和84%,接口收发延迟读写基本一致、约280纳秒(含UPI到SoC总线的转换延迟)。他同时提醒工程细节里的互操作缝隙:规范没有规定接口微控制器UART消息的内容与格式,这需要GPU与交换机厂商自行对齐——标准覆盖不到的地方,就是联盟成员要谈判的地方。
三、端侧成本账:die面积成了协议选型指标
刘扬把当下scale-up协议的格局称为「百家争鸣的战国时代」:NVIDIA私有的NVLink、PCIe、以太(每家再叠一层私有优化)、OCP去年提出的ESUN(Ethernet for Scale-up Network,定义物理层和链路层的开放规范),以及UALink。他的比较落在非常实际的指标上:UALink交换机是crossbar(交叉开关矩阵)结构、定长flit(流控传输单元)转发,灵活高效;端侧UALink控制器对缓存和逻辑的需求小——相比传统以太方案,die面积可能只有三分之一、四分之一甚至五分之一,「对die面积追求苛刻的GPU厂商来说,这是非常关键的指标」。而ESUN在传输层需要把load/store操作组装成报文、且只能对同一目的地址组装,存在变长报文的问题。星拓微的马明辉则点出PCIe的先天局限:延迟虽低,但树状架构绑定host,两台系统要互联就得打破host管理——multi-host PCIe Switch本质上是在突破协议自身的限制;星拓微把公司的定位叫「运力芯片」——算力、存力之外的第三类,产品覆盖PCIe Retimer、Switch、桥接、时钟、内存套片以及112G以太PHY Retimer。
Marvell的路线图具体到了数字:UALink交换芯片将有传统封装、共封铜(支持机柜内约2米免Retimer的铜互联)与共封光三种形态;带宽上,115.2T版本用200G SerDes支持576条链路、单层组网互联576颗GPU;57.6T版本有两种规格——288×200G面向更小的超节点,以及576×100G SerDes的版本,专供短期拿不到200G SerDes的国内XPU厂商,端侧因此不必额外加gearbox做112G到224G的转换。软件侧,Marvell在参与UALink SAI接口的标准制定,让客户能兼容不同厂商的交换机;scale-up交换机不需要SONiC那样重的网络操作系统,行业正在定义一个轻量级开放OS,遥测(Telemetry)被单列为一等公民,用于问题定位、负载均衡与拥塞控制。刘扬还转述了背景:黄仁勋六月称Marvell是下一个万亿美元公司,CEO Matt Murphy九月接受CNBC采访时的回应是Marvell做中立芯片供应商——不绑定终端客户、不做系统级方案,以太、UALink、Retimer、定制芯片都做(Marvell当前市值约2300亿美元,经外部核验)。他预测未来一到两年协议会收敛:以太会长期存在,UALink若能以健全生态和实际部署证明性能与有效带宽利用率至少媲美NVLink,就是非常有竞争力的方案。
四、互通性才是胜负手:SerDes、组网验证与EDA的隐形卡位
集益威半导体高级总监曹云鹏贡献了全场最好的比喻:「每面临一个新协议,大家就像在相亲——GPU找交换机,交换机找生态,SerDes就是相亲双方的这张嘴,决定两边能不能稳定地交流。」他的判断是:scale-up的胜负是端到端的互通性,而非单点的性能。一条链路只有两端,一个超节点有上千个端口、中间隔着Retimer和交换机,互通组合数随厂商配对数指数增长。解法之一是同源SerDes穿链路:集益威把SerDes IP授权、Retimer、光DSP做成同源,从GPU到交换机用同一套链路训练与均衡策略。他公布的224G SerDes测试数据(IEEE 802.3dj KR合规测试,与UALink 2.0电气层要求吻合)包括:波特率106.25G、SNDR在preset2下32dB(规范要求27.5dB)、RMS抖动16.3mUI,块级误码率做到1E-17(规范要求1E-11);112G SerDes在44到48dB插损下误码率仍有1E-9/1E-7,相对KP4 FEC的2E-4门限有三个数量级的裕量。他特别提醒国内的现实约束:112G与224G SerDes将长期并存,设计必须考虑两代兼容;而且PHY与控制器的边界必须闭环——眼图漂亮但链路起不来、训练收敛但flit持续CRC错,都是各自合格、合在一起出问题的典型场景。
楠菲微电子副总经理张鹤颖从管理与测试侧补齐了另一半。她总结UALink针对scale-up网络特征的设计:规模有限的封闭网络(1024个节点、10比特节点号、简单节点号路由)、控制信息不超过16字节、全硬件协议栈、灵活打包(去往不同GPU的数据可以打包进同一个flit,既省组包等待又提高物理链路利用率)——每一项都直接对应低延迟需求;可靠性则是全路径保护:事务层信用流控、链路层CRC加重传、物理层FEC。运维上,通过规范在传输通路上虚拟出的管理通路可以获取对端配置,由链路层消息机制自动生成网络连接关系,方便故障定位;楠菲微还在交换芯片里实现了事务层自发包加蛇形链回环,在没有GPU做数据源时也能自测整条处理路径。互通进展方面,多家UALink接口IP已经就绪,跨厂商接口IP之间、接口IP与交换FPGA原型系统之间的联合测试正在进行中、部分已完成功能测试。
袁靖茹则点出了产业链最上游的四个卡点:IP从哪来(自研亚微秒级IP需要架构与后端的双重积累,不是投人力就能解决;商用供应商又稀缺)、PPA怎么优化(延迟要求极高,架构或后端稍有偏差就达不到亚微秒诉求)、组网怎么验(1024节点的边界corner case靠软件仿真很难覆盖,等流片后才发现组网问题就意味着项目延期甚至重新流片)、生态怎么互通。合见工软的答案是「IP加平台」:全栈UALink 2.0 IP的协议栈与SerDes层解耦,可适配各家SerDes,经改造MAC/FEC后还能支持56G SerDes以覆盖成熟工艺客户;200G协议栈端到端时延142纳秒,比该公司自研ESUN方案的165纳秒低14%;还提供ESUN与UALink的Combo IP(0.77平方毫米,MAC/PCS/FEC三层约三成可合一),理由很务实——客户会问「我要多个协议都支持,你怎么办」。验证侧,内置4颗赛灵思VP1902(转写记音)的原型验证系统可级联上百台,配合组网套件在流片前与真实交换机做流量互转、错误注入和时延测量。她透露公司在scale-up IP上已服务国内四十多家客户,UALink方向已与几家XPU公司落地商务合作。
五、超节点的工程标准化补课:卡、电、光、液冷
新华三集团程凯的视角把镜头从协议拉回整机柜。除了智能密度每三四个月翻倍、全球AI基础设施投入已超万亿美元、中国日均AI调用量两年千倍增长这些大盘数字,真正拖慢基础设施推出速度的是碎片化——国内每种加速卡都在定制,缺乏统一标准。新华三沿四条线补课:加速卡模组上推动OCM标准,规划三类形态(支持600瓦以上下一代国产PCIe卡的类PCIe形态、面向3000瓦八卡场景的模组形态、整机柜超节点用的扣卡形态,其中600瓦正是今天风冷标卡服务器的上限);互联介质上判断光互联是超节点的必然选择,明年落地第一代整机柜产品(转写记音为「NPU超节点/交换机」,疑指NPO,存疑),现阶段以成熟的背板连接器架构为锚点、从电互联向光互联切换;供电上,单芯片明年接近2000瓦、2028年两三千瓦,单柜超过200-240千瓦后380伏交流难以支撑,高压直流可提升约10%供电效率,垂直供电则解决「机柜的电进芯片」的问题;散热上判断2028年超节点整机柜将接近100%液冷,连网卡、硬盘芯片都要液冷,而这些今天都还没有标准。
结语:接下来看什么
把十场分享放在一起,这场论坛展示的不是某一项技术,而是一个开放标准从文本变成产品的完整链条:联盟定规范、GPU厂做芯片、交换与SerDes厂商供部件、服务器厂商补工程标准、EDA公司提供「流片前验证组网」的基础设施。三条值得记住的机制链:其一,算力与带宽的剪刀差(年3倍对1.4倍)使scale-up成为成本与延迟的大头,专用内存语义网络以约89%对75%的线速效率,兑现为更少的端口、线缆和功耗——规模放大每一分低效,也放大每一分优化。其二,在网计算把集合通信从GPU搬进交换机,GPU侧几乎零面积代价;内存语义让FPGA、存储、内存池成为scale-up域的新公民——协议开放本身在创造新的生态位,而新进入者要回答的是「值得接入」而不只是「能接入」。其三,端到端互通性而非单点性能决定胜负,验证与测试基础设施(同源SerDes、原型验证系统、组网测试套件)是生态早期的隐形卡位点。
接下来一年,可观察的指标很具体:2027年第一批UALink交换机与加速器是否如期面世,合规测试体系是否上线,协议版图是否如刘扬预测收敛到一两种,磐久AL64与AL144之外还有哪些国产XPU带着UALink接口登场。正如Kurtis Bowman在开场所说:开放标准的成功不靠工程好——UALink的工程已经很好——靠的是正确的公司早早承诺、然后真正做工作。2026年,这句话的中文注脚正在杭州一家一家地写出来。