先说结论

2026年9月23日上午,云栖大会「超节点 Scale-Up 开放互连与开源计算生态」分论坛用三小时回答了一个问题:当模型的记忆比模型本身还大、当Agent把每一轮通信都推进关键路径,互连还只是「把卡连起来」的管道吗?阿里云资深技术专家孔阳在开场给出的一组数字定下了整场基调:对千问3-235B的分析显示,KV Cache已占到存储需求的57%,超过了模型权重——显存装不下的不是参数,是记忆。这个转折把论坛的六场演讲串成了一条线:UALink联盟代表张小林讲开放协议怎么落地,CXL联盟主席Debendra Das Sharma的视频讲一个曾被判「死刑」的标准如何复活,阿里云朱峰讲用什么介质承接爆炸的KV Cache,吴月敏讲Agent如何改写通信流量的形状,黄涛与李俊儒讲Beluga架构把CXL内存池与RDMA方案放到同一张测试台上,最后的产业圆桌上,AMD、英特尔、Marvell、三星的代表罕见地把「开放还是封闭」说破。结论并不玄妙:超节点的竞争单位正在从单颗芯片,变成「开放协议+分层介质+系统软件」的生态位;而这个生态位目前最大的风险不是技术,是协议太多、收敛太慢。

一、互联为什么突然变得这么值钱:一本从算力转向存储的账

要理解这场论坛,得先理解孔阳开场时讲的那笔账的转变。过去一年超节点火热,行业讨论的重心已经从「能不能把成百上千张卡连起来」——这在工程上早已不是难题——转向了三个更难的问题:超节点究竟怎么在业务中产生价值、多大范围的Scale-Up域才有竞争力、算力芯片之外还要搭配什么外围子系统。孔阳的观察是,需求端的变化比供给端更剧烈:AI从对话时代走到提示词工程时代,再快速进入智能体时代,模型的工作链路要理解用户意图、保持长程记忆、跨平台调用工具,这对算力架构提出的要求已经完全不同于两年前。

具体到推理,孔阳把用法分成了三类:实时交互聊天、Coding工程与多数字员工协同、任务并行丢给模型过段时间再看。第三类的性能瓶颈其实在人不在线的那段时间里,一分钟和两分钟没有本质区别;真正需要极致优化的是前两类。超节点的价值恰恰在这里兑现:一个足够大的HBM互联域可以让KV Cache零卸载;prefill阶段用足够显存把batch组高、把算力打满;decode阶段用超节点内PB级互联带宽和更高的HBM带宽把访存瓶颈压到最轻。孔阳给出的量化口径是:通过分层缓存把prefill首词命中率做到接近99%,整体token成本可以降低50%。

这本账还有一个常被忽略的推论:P和D分离部署时,超节点反而降低了网络建设成本——因为大块KV传输可以走超节点内多个网卡并行,对Scale-Out网络的带宽需求并没有水涨船高。这也是阿里云敢把磐久AL144(一跳范围内144卡全互联,通过第二层光互联可扩展到10368卡)和磐久AL64分布式超节点(可Scale-Up至1024卡)两套架构同时推进的原因:前者赌极致性能,后者保留弹性,对冲的是「没有人能说好未来一两年模型一定发生什么」的不确定性。

下午的姊妹场讲了散热供电这些硬件墙(另文详述),这场上午的论坛聚焦的是更上游的一层:协议和介质。而驱动这一切的同一个变量,是内存。

二、UALink与CXL:一个新标准的落地节奏,一个老标准的复活

新思科技(Synopsys)资深产品市场经理张小林代表UALink联盟登场,他给出的定位句值得原样记录:UALink不是对PCIe或以太网的替代,而是补充——PCIe仍是机柜内通用接口,以太网负责更大范围组网,UALink提供的是低延时的轻量级Scale-Up方案,而且明确「不能转发」自居为替代品。这个谦逊的定位背后是务实的产业判断:机柜里的协议生态是分层共存的。

Synopsys的角色是UALink董事会里唯一的IP公司成员,张小林介绍的落地细节相当具体:UALink 2.0面向控制芯片,PHY层同时提供112G和224G SerDes方案;200G物理层天生,每个加速器四个端口可组成三种模式——x4链路相当于800G、两个x2相当于400G、四个x1是200G;同时对仍在用112G SerDes的客户提供106.25G实际速率的兼容路径。2.0版本的关键更新不是提速(速率保持不变、协议栈不变),而是把在网计算(INC,用于在高速Switch Fabric中做offload)、安全性、可靠性与可管理性直接集成进协议层——对芯片开发者来说这是「演进」而非「重新设计」。这些IP基于新思在PCIe和以太网上的现成经验升级,相关产品已经过上千次流片验证。

更有信息量的是两个新范式和一个时间表。范式一:内存直接挂到switch上形成Memory Pooling——内存不再从属于某个加速器,而是大家共享,随之而来的是内存语义、数据隔离与一致性的新命题。范式二:UALink芯片的chiplet化——随着芯片逼近物理极限,把协议栈从计算die里分离出来做成独立I/O die甚至光chiplet,趋势「很明显」,但中间die放在加速器侧还是I/O侧尚无定论。时间表则是UALink 3.0的规划:协议栈不变、复用200G PCS实现400G速率、die间互连大概率走UCIe、光侧复用OCI/MSA的400G标准,核心出发点是「把高速I/O向光侧推」,张小林给的口径是明年Q1推出——他同时强调这还是「Business Plan」层面的规划。经外部核验,UALink 200G 2.0规范确已于2026年4月发布,3.0节奏与之相符。

如果说UALink是新兵,CXL就是老兵的复活赛。CXL联盟主席、英特尔资深研究员Debendra Das Sharma在录制视频中回顾了这段历史——联盟从2019年的9家发起公司做到如今285家以上成员,规范从1.0一路后向兼容地演进到4.0:3.0把速率翻倍到64GT/s并引入真正的fabric架构(多级交换、spine-leaf拓扑、跨服务器内存共享),4.0再翻倍到128GT/s且保持相同FLIT格式、同等延迟。他反复强调的判断是:AI不仅是算力挑战,更是内存、互连和系统组合的挑战,而CXL的目标负载延迟小于200纳秒、非对称复杂度设计(主机管一致性,设备只实现所需子集)使它成为异构计算与内存扩展的基础设施。生态数据也足够硬:2023年4月以来已举办11次合规活动,集成商列表里有30个CXL 1.1设备和34个CXL 2.0设备,Type 3内存扩展已在阿里云、Meta、微软Azure规模部署——他专门点名了阿里云磐久128超节点和Beluga作为KV Cache场景的范例。但他同样坦率:直接挂载已广泛部署,池化才刚起步,大规模共享与fabric是下一前沿,「这类标准是数十年的旅程,我们还在最初阶段」。

圆桌上英特尔研究员龚海峰把这段历史讲得更直白:两年多前网上有篇文章讲「CXL is dead in the AI era」(经核验为SemiAnalysis 2024年3月刊文),但这两年CXL又复活了——原因恰恰是Agent AI爆发带来的内存墙,而Agent时代的内存访问有别人替代不了的两个特征:数据天然冷热分明(适合分层),以及强烈的内存共享需求(CXL独有缓存一致性语义)。他给出英特尔的承诺:已发布的机架级产品支持CXL,接下来支持3.2,未来与协议演进保持同步。

三、介质上主桌:UMX分层架构与「以存代算」

如果说协议是路,介质就是货。阿里云服务器团队朱峰的演讲标题是「重塑内存边界」,他把这场论坛最硬的一组数字摆了出来:AI对存储的需求是分裂的——训练要高吞吐(数据加载与检查点写入),推理要大容量(长上下文、高并发把KV Cache推到极高水位)。以千问3-235B为例,KV Cache已占57%、超过权重;DeepSeek V3经过压缩后KV仍低于权重,但「不管哪种模型,趋势不变」。

解法是磐久UMX(Unified Memory Extension)统一内存存储扩展架构:用一整套分层介质承接不同温度的数据。最上是HBM和DRAM(GPU本地热数据);往下是自研的阿里SCM——基于PCM相变存储器的非易失内存,走CXL 2.0 Type 3接口、E3.S形态,单模组256GB到1TB,寻址粒度128字节(比英特尔傲腾低128字节,更接近64字节cache line),PCIe Gen5 x8下读带宽较傲腾大幅提升;再往下是阿里Flash CXL——用低延迟NAND替代PCM进一步压成本,第一代GN6目标在推理机柜内实现数TB容量,第二代GN7面向CXL 4.0、目标单设备5000万到1亿IOPS;机柜内100盘以上池化可聚合出百亿级IOPS。最底才是传统NVMe TLC和QLC。这套分层不是硬件堆叠:UMX软件框架按访问频率、复用概率和延迟要求决定数据放哪一层、何时迁移——「以存代算」这个词在后面几场演讲里反复出现,说的都是同一件事:算力芯片工艺迭代慢了,存的潜力还大得很。

朱峰还展示了一个概念验证实验(他特意声明非生产环境):用千问3-8B加SGLang加NVIDIA RTX Pro 5000(48GB GDDR),把两级缓存里的32GB DRAM换成约等成本的128GB阿里SCM,吞吐提升58%、TTFT P90大幅下降;三级缓存架构下趋势同样成立。更前瞻的一步是把SCM通过UALink直接挂到GPU下面:稀疏注意力模型下,indexer类热数据只占约10%留在HBM,约90%的主KV可以外置;这些数据每层每token约584字节、散布在不同KV block、空间局部性极弱、且无法预取——所以介质必须同时满足小颗粒IOPS和低访问延迟,PCM恰好吻合。按主流推理模型「主KV容量带宽比约20」的实测规律,UALink版阿里SCM按100GB设计。仿真显示端到端延迟相较本地DDR都有大幅下降——朱峰解释这并非PCM比DRAM快,而是UALink直连省掉了通信延迟。

圆桌上三星半导体Memory战略规划总监冯方为介质侧补上了产业视角。她的判断框架很朴素:一个技术是死是活,回到根本——痛点是不是真实存在,「金子永远是会发光的」,就像GPU当年从图形附件变成基础部件。她不回避今年的现实:存储「上主桌」了,而且涨价已经波及消费端。三星的布局横跨CXL各代:从1.0/1.1时代就供货、2.0量产仍在交付,最新的CMM-D 300系列已交付,PCIe Gen6接口、混合读写双向最高约75GB/s(外部核验其CMM-D 3.1规格为1TB容量、72GB/s带宽,与演讲口径一致);混合形态CMM-H、与阿里在CXL Flash上的长久合作、以及与阿里共同探索的存内/近存计算。她还透露了介质路线上的几个方向:FMS上提过的定制化HBM与Z-NAND(面向百万级IOPS需求)、把LPDDR引入CXL生态、以及三星内部叫PRAM的相变介质。软件上三星不搞供应商锁定:Cognos内存管理软件和一套面向高IOPS小包场景的开源方案全部上GitHub,「大客户可以只把它当参考,中小客户拿走硬件加软件双重加持」。这个姿态像极了十年前整机厂商的Node Manager——CSP们并不用,但正因为每家都提供,底层被拉通了。

四、Agent改写了通信的形状:从大块搬运到内存语义

如果说前几场讲的是「存」,阿里云吴月敏的演讲把「联」的需求侧讲透了。她的核心判断是:AI计算正从芯片级扩展走向系统级扩展——模型到了万亿级,上下文从32K涨到1M,单颗芯片的算力、容量、访存带宽、I/O带宽都有明确的物理边界,互联要解决的不再是「把卡连起来」,而是让计算单元、内存资源和I/O端点「表现得像一个紧耦合的计算域」。

变化最剧烈的是prefill。Agent场景下prefill命中率可达95%以上,原本计算密集的prefill变成了「带状态的」——大部分上下文根本不用重算,缓存下来直接复用就行,稀缺算力省给真正需要计算的地方。decode侧则是通信进入逐token生成的关键路径:线上典型模型通信占比10%到30%,MoE大模型拆解下来通信占18.2%(TP集合通信加MoE all-to-all)。这带来三个性能机会:低延迟下用内存语义优化TP集合通信,小数据量场景收益三倍以上;扩大EP规模——仿真显示EP从8到32有21.9%收益,但128到256就明显趋缓,这恰好推导出「百卡级紧耦合计算域」的架构选择;以及让fabric本身可执行multicast和reduce操作,从端点发起、由网络完成复制与聚合,理论上性能收益两倍。

更深的一层是语义之变。传统集合通信是buffer transfer:负载起来时谁传谁、多大块、地址长度全部已知,由CPU编排launch。而现在MoE和稀疏注意力的动态访问中,传给谁、目标地址在哪、数据量多大,都是主kernel运行到那一刻才知道的——每次访问都要拉起kernel、组织buffer、等待完成的开销成了纯粹浪费。所以Scale-Up域必须在消息语义之外提供内存语义(write、read、atomic),让kernel内直接交换token、按需load远端状态、做远端同步——业内从MegaMoE开始探索的计算通信融合大kernel,正是建立在这种语义可用性之上。她的总结是下一代Scale-Up的画像:百卡级紧耦合域、稳定低延迟、大块语义与load-store小访问并存、异构资源全部入域——从一个设备互联,变成Agent AI的系统级计算底座。

五、Beluga实测:把RDMA内存池换成CXL,账能算平吗

黄涛和李俊儒的联合演讲贡献了整场论坛最有说服力的一组实测数据。背景是KV Cache需求已到10TB量级,而HBM是百GB级、本地DRAM是TB级,两层都接不住,需要「G2.5」大容量内存池。业界现有方案是基于RDMA的远端内存池,它有四个结构性问题:消息收发语义下内存操作由网卡完成;小数据块搬移时跨组件同步开销占比远大于数据传输本身;KV Cache天然碎片化受限于网卡scatter-gather能力(单次请求最多约30个SG list项,传1024个KV Cache块要好几百次RDMA操作);以及队列管理、内存注册都离不开CPU——本质上是把远端内存当网络节点管理。

Beluga架构(论坛正式发布)的思路是让远端内存回归内存语义:计算节点(最大4 CPU加16 GPU)通过PCIe交换、CPU Root Complex到CXL交换节点,再访问JBOB内存机箱里的三种介质——阿里Memory(CXL DRAM)、阿里SCM(CXL PCM)、阿里Flash(CXL NAND),单机最大18TB,同时支持DDR4利旧(新CPU平台不支持旧代内存,CXL恰好解耦了CPU代际与内存代际,这是全场被点了好几次的隐性价值)。实测对比:CXL内存池写延迟约为RDMA池的七分之一,读约为六分之一;软件上统一地址空间,CPU侧4KB以下用load-store、以上用DMA,GPU界限24KB;CXL 2.0没有跨主机硬件缓存一致性,他们给了Uncacheable配置、显式cache line flush、non-temporal指令加DSA三条软件路径按场景取用。

李俊儒(来自PolarDB产品线)的业务侧数据更直观:单机内存提升16倍;q depth=1的延迟敏感场景延迟降至四分之一,q depth=128的吞吐是1.8到2.7倍;KV Cache索引查询用共享内存标志位加忙轮询替代RPC;调度器不再需要感知数据局部性——池是扁平的,任何节点访问任何数据延迟都接近DRAM,节点自由增删、数据无需rebalance。端到端对比Mooncake(月之暗面开源的KVCache中心化分离架构,FAST'25最佳论文,经核验):缓存填充场景平均TTFT降12%、QPS提升1.21倍;缓存命中场景TTFT从13秒降到1.36秒(降89.6%),QPS从1.54涨到11.32。一套改了硬件路径的架构,把命中的收益放大到这个量级,这是「内存语义优于网络语义」最直接的证据。Debendra在视频里点名Beluga,显然不是客气。

六、圆桌:开放与封闭的分界线,以及协议太多这个真问题

压轴圆桌把气氛推到了最坦率的一档。AMD资深研究员卢璐的分析从负载出发:每一层网络本质都是内存扩展,TP/DP/PP/MoE各有流量画像,而agentic AI是几十上百轮的增量prefill、decode加tool call串行——每轮token不大,但每轮all-to-all的延迟都会在整个轮次链上被放大;KV Cache大流量换入换出与all-to-all小包混合,要求fabric尽量减少队头阻塞;更狠的是RAS——推理出错了不能像训练那样回checkpoint,长生命周期的KV Cache只能热迁移。她给multi-tier的定语很精彩:每加一层至少三倍延迟、两倍link、两到四倍switch成本,「架构上一定要避免、工程上不可避免的选择」。她的规模判断也值得记下:训练域可能继续涨(72到288到576甚至1K卡),推理域有明确上限——内部数据显示4T参数256专家的模型跑在8卡和72卡上有成倍差别,72卡和256卡则完全无差别。

最尖锐的话留给协议生态。卢璐直言:过去几年各家为快速迭代自建每一层互联、甚至自研switch,这个过程不可持续——GPU厂商面临switch供应链单一风险,先进工艺switch流片极贵,出货量不足以分摊成本。她的预判是:垂直整合极强的企业(比如NVIDIA)会坚持封闭或半封闭私有协议,但对其他大部分GPU厂商,开放肯定共赢;「未来三到五年,如果Scale-Up协议在国内范围的百花齐放能收敛,对整个业界都是非常好的结果」。Marvell市场总监刘扬从switch厂商视角补了四条fabric刚需:确定性的低延迟、在网计算、原生内存load-store语义、RAS——并指出无论开放以太网、UALink还是私有NVLink,特性目标已高度趋同,竞争剩在软件:Scale-Up switch需要类似SAI的标准接口和比SONiC更轻量的开源网络OS。龚海峰谈了光电边界:柜内用电(成熟、低延迟、高密度),密度到顶后光成必然(NPO/CPO),英特尔硅光基于CMOS工艺便于与计算芯片集成。

把圆桌串起来看,这场论坛真正的主命题浮出水面:当互连决定系统效率、内存决定成本曲线,单家公司封闭全栈的难度在急剧上升,开放标准的生态位价值在同步上升——但前提是协议数量得收敛,否则碎片化成本由全行业买单。

观察指标与收束

沿「变化→原因→谁得谁失→二阶影响」的逻辑,这一场留下三条可长期跟踪的链。其一,KV Cache超过权重(千问3-235B占57%)→根因是长上下文、高并发与Agent多轮→分层介质厂商(PCM、低延迟NAND、CXL控制器)与CXL生态得利,纯HBM堆叠的成本压力和RDMA内存池方案承压→二阶影响是以存代算成为推理降本主路径,接口语义从网络回归内存→盯首词命中率、TTFT P90、单token成本和介质GB单价。其二,Agent多轮串行放大每轮通信延迟→得利的是确定性低延迟fabric、在网计算switch与内存语义协议,只优化大块集合通信的方案失势→二阶影响是switch从转发设备变为可执行规约的通信fabric,计算通信融合kernel成为新编程范式→盯通信占比(当前10%-30%)与multi-tier层数。其三,封闭与开放的分野→根因是自研switch流片成本与供应风险、推理域规模上限→多数GPU厂商、IP与switch供应商、云厂商得利,垂直整合巨头的技术溢价被稀释→二阶影响是未来三到五年协议若不收敛、碎片化成本全行业共担→盯UALink 3.0时间表(口径2027年Q1)、三星CMM-D量产节奏、英特尔CXL 3.2产品线,以及UALink互操作测试的厂商名单。

冯方说存储今年「上主桌」。更准确地说,是存储与互连同一年一起上桌——因为当记忆比模型贵、通信比计算卡脖子时,决定一台超节点效率的不再是那颗芯片,而是协议、介质和软件这三样谁也封锁不了的东西。论坛议程标题里「开放互连」放在「开源计算生态」前面,顺序本身就是一个判断。

(本文基于官方回放转写整理,讲者姓名与讲题已按云栖议程页校正——张小林、卢璐、刘扬、李俊儒等ASR人名均已核对;磐久AL64/AL144、UALink 2.0规范、三星CMM-D规格、CXL联盟数据、Mooncake、AMD Helios等关键事实经外部核验;Beluga实测与朱峰概念验证实验为阿里云自报口径;「转写疑似」项如三星高IOPS软件方案名、CXL 3.2热特性细节等无法确证处已模糊处理或注明。)