先说结论

2026年9月22日,云栖大会「可预期网络2.0:Token Performance Network」分论坛上,阿里云网络研发负责人蔡德忠正式发布TPN 1.0(Token Performance Network),宣布智算网络的目标从「优化训练集群的极致性能」转向「保证推理服务质量前提下的极致成本」(120–600s,蔡德忠)——这是全场一切技术细节的总纲。这场历时约四小时、覆盖阿里云、博通、英伟达、清华、小红书七场演讲加圆桌的论坛,真正值得记录的不是产品清单,而是三个尚未收敛的分歧:超节点到底该做到多大、长距离传输该用深缓存还是浅缓存、scale up的终局是私有协议还是以太网。博通讲清了交换芯片扩容的「二次方增长」物理约束(3360–3600s,Asad Khamisy),英伟达给出五维网络分类学(4440–4560s,Rochan Sankar),清华章明星和小红书宁本哲则分别证明:异构推理的瓶颈常在调度与Python运行时而非物理网络,RL训练的利用率洼地可以用角色解耦填平。对读者最有用的判断是:AI网络的KPI已经从带宽和时延,变成了「每Token成本+分位数SLO」,凡是不能折算成这两个数字的网络创新,在这个范式里都会失去预算。

一、优化目标之变:从「训练尽快跑完」到「每个Token可度量、可控制、可承诺」

理解TPN要先理解可预期网络1.0是什么。2023年8月阿里云上线HPN 7.0,把以太网性能从Best Effort变成Predictable,那是可预期网络1.0时代,解决两件事:集群规模扩大后算力性能保持线性、万卡级训练任务不因网络故障中断(720–840s,蔡德忠;2400–2520s,席永青)。此后HPN沿三条理念演进——两层网络、高 radix 交换机、多平面:7.0是1.6万卡400G,7.0 Pro做到3.2万卡800G并在去年11–12月上线四平面,8.0基于102.4T交换芯片的四平面集群今年上线,从7.0到8.0规模翻了64倍,靠的是radix与平面数的乘法而非工艺奇迹(840–1080s,席永青)。8.0 Pro支持100PB带宽、相当于13万卡800G接入且保持6微秒延时;在研的HPN 9.0面向1GW单集群,采用204.8T交换芯片、1.6T自研网卡与6.4T硅光NPU(120–240s,蔡德忠)。这套架构的外部可信度由SIGCOMM 2024论文《Alibaba HPN》和C114对席永青的专访背书,属「嘉宾称+外部证实」双重确认。

转折发生在2026年。蔡德忠给出两个拐点数字:进入Agent时代,Token消耗量指数级增长;同时算力爆发要求Token成本至少下降一个数量级(240–360s,蔡德忠)。付斌章后来补上第三个数字:以2023年3月为基线,到2026年9月,前沿模型每Token价格只剩16%,即三年降了84%(5760–5880s,付斌章)。这三组数字合起来构成一条完整的机制链:Token消耗暴涨×单价暴跌→网络从Capex科目变成Opex科目→「不计投入换训练提速」的旧哲学失效→架构设计目标整体改写。蔡德忠的表述很直白:训练的成本是Capex,模型公司可以不计投入;推理的成本是Token的一部分,是Opex,直接关系大模型能否可持续发展(360–480s,蔡德忠)。

流量模型的差异同样根本。训练是周期性同步的大象流,故障后回到上一个checkpoint;推理是异步小象流叠加大象流、突发性强、对拥塞和抖动极度敏感(240–360s,蔡德忠)。由此引出TPN必须回答的四个命题:百万级上下文下PD分离的高效KV Cache传输平面、多租户任务级SLO保障、异构卡跨集群跨地域高性能传输、以及最核心的降成本(360–480s,蔡德忠)。TPN的三个关键词——KV-centric、SLO-driven、性价比——分别对应这四问,其落地形态包括前后端两网融合(按需分配带宽)、SRv6加IPv6 RDMA的骨干网任务级路径选择(480–600s,蔡德忠)。席永青的收束口号可以当作理解2.0的三把尺子:让每个Token可度量、可控制、可承诺(2400–2520s,席永青)。值得注意的是,TPN并非凭空出现:2026年7月WAIC论坛上阿里云吴结生已公开讲解这一「多流量合一」架构(外部证实:华尔街见闻报道),云栖这场是TPN 1.0的正式发布节点。对行业观察者,这条链的观察指标是各云厂商推理网络报价中「每百万Token网络成本」的收敛速度,以及TPOT/TTFT分位数SLO写入合同的比例——KPI跟随计费单元演进,是基础设施史反复重演的规律。

二、KV Cache经济学:命中率就是算力,带宽就是TCO

如果只能记住本场论坛的一个数字,应该是席永青的这句话:KV Cache命中率每提升15%,就意味着15%的prefill算力被释放出来,命中率的提升本质上就是推理TCO的下降(1320–1440s,席永青)。这个换算公式的背景是Agent workload对推理的重新定义:聊天工具时代输出速度只需超过人眼(首字3秒、每秒20–50字),Agent时代是工具调用,不需要人眼阅读速度,上下文从百K级到兆级,任务以小时计,SLO收敛到TTFT和TPOT,其中TPOT——decode阶段的吐字速度——最关键(1080–1320s,席永青)。英伟达Rochan Sankar从另一头得出同一结论,他把「context scale」列为五大网络维度之一:agentic负载因为生成速度快、高频上下文要避免重算,反而增加了KV Cache的复用需求,上下文层几乎要跨多租户独立扩展(4320–4560s,Rochan Sankar)。

于是TPN的设计围绕KV Cache重组:其一,用多年部署的Stella RDMA把HBM、内存、SSD组成多级缓存池,每一级之间的「漏斗」带宽按成本与时延联合设计(1440–1560s,席永青);其二,把推理的scale out网络与front end网络合并,东西向与南北向流量按需共享带宽——KV Cache流量原本走机头网络,串联机头机尾带宽后可借用更大管道,融合后的网络规模做到传统前端网络的10倍,单Pod可达2.6万个400G端口(1560–1920s,席永青);其三,在UPN/AI Pod这种大带宽以太网域内,把EP、PD、未来IF分离(attention与FFN分拆)的流量做到超低时延(1440–1560s,席永青)。阿里给出的对比数字是:同等成本下KV Cache带宽提升2.5倍、时延降三分之一、规模十倍(480–600s,蔡德忠,嘉宾口径,未见第三方复现)。

付斌章的实测数据把这条链钉死在工程层面:典型超大MoE模型端到端成本约50%消耗在通信上;千问3.8-Max(2.4T,嘉宾称Roadmap将到10T)在EP16配置下最高负载GPU是均值的3.5倍,木桶效应让慢专家拖垮整层;KV Cache流量峰值1.6Tbps,已经打满机型网卡的物理带宽——注意这不是应用需求的上限,是网卡的上限(5760–6120s,付斌章)。这条机制链完整写出来是:上下文兆级化+PD分离→KV传输成为新增大象流→网络带宽直接决定缓存命中率→命中率折算为prefill算力释放→推理单位成本下降。得利的是拥有高速缓存池网络的云厂商和吃到低价Token的模型公司,失势的是无池化能力的裸金属供给。二阶影响是网络设计重心的迁移:HPN时代参数面流量「很干净」,TPN时代一张网里同时跑EP交互、模型加载、PD传输、KV传输、工具调用,QoS与端到端拥塞控制第一次成为网络的中心问题(1800–1920s,席永青)。观察指标也很具体:KV Cache命中率、TTFT的P99、跨集群KV传输对带宽的占用比。对读者的启发是,缓存命中率的每一个百分点都可以折算成真金白银的opex——凡是能提高复用的工作负载设计(比如Agent会话前缀共享),都等于免费买了算力。

三、芯片的物理账:扩容的「二次方诅咒」与封装、光的突围

博通Asad Khamisy的演讲是全场技术密度最高的45分钟,核心是一个不太被讨论的坏消息:当交换芯片从512 radix走向1024、从50T走向200T,die、封装、interposer、互连尺寸全部上涨,供电与热密度成为主要挑战(3120–3240s,Asad);而真正致命的是工艺后端的停滞——台积电等代工厂的金属层布线层数不再增加、电阻电容反而在变差,发送1T流量所需导线数量翻倍,包缓存的读写带宽翻倍意味着实例数翻倍、互连与内存呈二次方而非线性增长,「工艺不再给你速度、不再给你密度,这是交换产业面临的基础性变化」(3360–3600s,Asad)。这条机制链值得单独写:工艺红利收窄→扩展代价从线性变二次方→创新被迫转移到封装层→multi-die、近封装光学成为主战场。Tomahawk 5是单die的50T、被独立测量为功耗最低(低50%,五年省5000美元);Tomahawk 6为保住共享缓存和特性规模走向multi-die,同时提供512×200G与1024×100G两种形态——他特意指出中国客户全部在用1024×100G(3240s,Asad)。

封装层的突围有三条路线同场竞技。博通的ICA(Integrated Copper Attach,阿里与博通合作的RPO属同类思路)把铜/光集成从封装本体解耦出来,做成可独立制造的「卡」,像光模块一样灵活,正在Tomahawk 6上量产导入(3600–3720s,Asad);CPO方面,Meta报告其前代CPO百万小时零link flap、现已累计五千万小时(3720–3840s,Asad,嘉宾称)——外部证实:博通2025年10月发布TH6-Davisson 102.4T CPO交换机,光互连功耗比可插拔方案低70%。更远的是OCI光计算互连:铜DAC在7pJ/bit走2米、有源铜缆14pJ/bit走5米,集成OCI以接近铜的功耗把距离推到500米,规模化后就能低成本建超大集群(3840–4080s,Asad)。英伟达的CPO路线殊途同归:MRM加台积电COUPE 3D堆叠,靠把激光器功耗分摊到多个400G lane来摊薄数据中心的光功率预算,且平均无故障时间好一个量级、已量产(4920–5160s,Rochan,嘉宾称)。

阿里云的动机则来自国产算力的内存焦虑。席永青算了一笔账:72卡域约20T HBM,放10T模型(INT8量化一半一半)刚好;国产64/72卡AI Rack只放得下约5T模型,未来两到三年国产XPU推理必然撞上HBM墙,出路是光互连AI Pod把域扩到256、288甚至1K以上(1920–2160s,席永青)。UPN架构用低成本光互连加软件高冗余加大radix交换机,一层交换机把GPU域从26卡连到1152卡;与博通合作的RPO封装介于NPO与CPO之间,比NPO贴近主芯片、损耗更低,又不似CPO那样耦合多厂商工艺,已完工可上展台验证(2040–2280s,席永青;外部证实:C114报道UPN成本反降30%、可用性提升3倍以上)。这条链的观察指标是pJ/bit、link flap的MTBF与CPO出货量——当一条增长曲线放缓,创新必然转移到相邻层,这是半导体史的老规律,也是判断光模块公司技术含量的新标尺。

四、超节点该多大:72、1152,还是一万卡?

圆桌第一个问题就问到了 industry 最热也最含糊的参数:scale up域的理想大小,一万节点以上是否必要。三方答案的分歧本身就是信息。英伟达Rochan Sankar认为没有唯一答案,取决于flops、内存带宽与IO的组合;英伟达量产72域、已公布未来两代的NVLink 576与1152路线;至于10K域,「要为flops的缺陷付费」——固定功耗下scale up域变大,scale out域就得缩小(11040–11280s,Rochan)。他演讲中的数据版论据是:scale up域过大后,传输时延与跨域噪声会损害内存fabric语义,而紧耦合的张量并行、专家并行恰恰依赖这个语义;判断标准始终是Token产出曲线(4560–4800s,Rochan)。

博通Asad给出的市场实况是:客户最大部署到9K,但那是多个域拼的,另有客户在用2K以太网scale up域;大规模domain的最大顾虑是blast radius——故障影响半径,有客户明确不愿超过2K;预测两年内业界主流在1K–1152,10K会出现但一定是多域形态(11280–11400s,Asad)。蔡德忠的回应最釜底抽薪,他从三个角度拆问题:模型真实需求——10T参数加千万上下文,用GB300级GPU估算约256卡就够、1K绰绰有余;资源池化——把大域切成多任务共享听起来always make sense,但「切得细、用得起、可靠性还达标,现在还是paperwork,离得很远」;成本——单机柜铜缆或胖机柜最优,其次单层网络(规模等于交换机radix,今天1K、未来4K),再往后才轮到两层,而一旦做两层,scale up与scale out就该合并成一张网。他的判断是:单rack约288卡能满足到2027–2028年,2028–2029年是单层1K–4K的时代,「今天宣传的万卡两层scale up,看起来都是纸面宣传」,唯一例外是北美某些公司直接把scale up与scale out融合一步到位;「搞一个万卡两层scale up、旁边还并行一张scale out」在他看来不成立(11400–11760s,蔡德忠)。

这条机制链对买算力的人有直接用途:故障域半径与功耗约束→决定scale up规模上限→超节点不是越大越好,而是「Token产出/瓦特」的局部最优。scale out侧的两大未解问题被蔡德忠点破:一是多租户干扰——训练与推理混跑、burst特征不同、共享交换机队列与缓存,一个用户就能拖累别人,「这个问题并没有得到根本性的解决」;二是规模再乘五倍十倍时BGP、ECMP等现有机制「都不work了」,架构需要根本性变化、部分功能要下沉到端侧,引发网卡的新一轮创新(11760–12240s,蔡德忠)。Asad补充的物理事实同样重要:高利用率下,现有拥塞控制协议在几十微秒内工作良好,跨楼跨地域的长距离场景它们「真的不太工作」,所以必须用scale across分段解决(12000–12240s,Asad)。观察指标:主流XPU厂商下一代scale up方案的实际域规模(而非PPT规模)、云厂商多租户推理的SLA违约率。

五、深buffer还是浅buffer:长传网络的第一性原理之争,与三份工程答卷

圆桌上最坦率的交锋是深浅缓存之辩,三方立场恰好对应各自的产品现实。英伟达Rochan是浅buffer派:跨地域传输的带宽时延积本来就大,深buffer里被缓存的慢流会把尾延放大2–3倍,Spectrum-XGS的思路是端点间智能credit、「ready了才发」,不需要深buffer交换机兜底(12480–12600s,Rochan)。博通Asad的反问很简洁:你的网络到底想跑高利用率还是低利用率?链路抖动早已不是小概率事件,拥塞不可避免,而排队时延比重传低一个数量级——「想跑超高利用率,就需要buffer把丢包消灭掉」;且深buffer不等于每包都进深缓存,无拥塞时走片上直通(12600–12720s,Asad)。蔡德忠搬出骨干网设计的first principle:长传链路成本(自建或租运营商)远高于设备成本,所以必须用深buffer吸收突发、把昂贵链路的水位拉满,今天所有长传骨干网设备都是深buffer的;他承认阿里目前SRv6加RDMA的跨域试验「性能看起来不错,但还没有经过大规模部署和时间的考验」,并且当众补刀:「英伟达现在没有deep buffer的交换机,所以肯定说不需要deep buffer」——Rochan笑着接话「看来这个辩论被一锤定音了,也许我们该在这里启动一个Spectrum-XGS试点」(12720–13080s,蔡德忠)。分歧的根源不在技术而在成本结构:链路租金占大头时深buffer赢,设备与尾延敏感时浅buffer赢,工作负载最终会驱动架构。

比观点更有说服力的是三份工程答卷。第一份是阿里云付斌章的M890P超节点优化:64 PPU、scale up 51.2T双向互联、磐迈920自研网卡400G/2微秒且内置PCIe Switch 5.0以保证GPU Direct RDMA性能可预期(6120–6360s,付斌章;外部证实:阿里云官网GP9A规格与运行Kimi K3、千问3.8-Max的记录完全一致)。上一代无超节点部署千问3.8时,prefill阶段通信占端到端时间超60%、负载不均导致吞吐损失54%以上;优化后的组合拳包括——利用GPU 128字节原子写把控制消息编码进数据以消灭grid级同步(dispatch提升百分之十几)、通信buffer显式pin住的零拷贝(提升30–40%)、接收端load指令直进寄存器(combine提升20%多)、prefill每步精准重分布专家而decode只能周期性重分布(不均衡度从3.37降到2.47)、小消息冗余传输与大块去冗余的分治策略(端到端再+9%)——最终prefill 2.3倍、decode 1.1倍性能提升(6480–7080s,付斌章)。

第二份是清华章明星的异构PD分离:把「高质量Token」拆成内容质量与交付质量,后者(TTFT、输出速度、稳定性)在Agent时代成为可定价商品,coding场景要30–50 Token/秒,OpenAI的万Agent八十八小时解题让交互速度「无上限」(7080–7320s,章明星)。基于monke系统的千卡级国产异构PD已上线,三个曾被担心的坑全部趟平:跨硬件精度靠KV Cache保持8bit量化加校准数据集;端到端瓶颈「很多时候不在物理网络,而在上层调度和Python runtime」;极端PD比下的故障抛压靠细粒度请求迁移(7440–7800s,章明星)。最有想象力的是他的推演:模型架构进步可以替代硬件升级——Kimi K3相对K2使同等算力产的KV Cache更小,跨楼带宽需求降到原来的一半以下,DeepSeek V4极致压缩下只要八分之一带宽,若V4.1 Flash的压缩落地,「全国八大算力中心连成一张网、想配什么算力配什么算力」就从愿景变成算术(7920–8160s,章明星,跨城部分为推测)。

第三份来自训练侧与稳定性侧。小红书宁本哲的Relax框架(外部证实:2026年4月开源,GitHub与arXiv论文作者名单均可查)用角色服务化解耦加TransferQueue数据总线加DCS注册式权重同步,解决RL训练「rollout与训练固定配比」的老问题;Agent应用接入只需把模型服务URL换成rollout服务地址,复杂场景天级接入;权重更新时session挂起、应用无感知;夜间潮汐资源弹性下,多轮Agent场景从1个引擎扩到8个获得3倍以上端到端加速——但7–8个引擎就到顶,单步decode时延是弹性无法优化的物理下限(8280–9120s,宁本哲)。阿里云焦海荣、钱坤的稳定性体系则把「可预期」从性能扩展到运维:推理容错窗口是秒级毫秒级而非训练的分钟级(9600–9840s,焦海荣);常驻tracing靠四个设计把开销压到CPU侧1%以内——只追同步屏障(上万函数调用降到几十个)、只追GPU关键路径、端侧outlier检测只持久化约1.6%的异常trace、CPU与GPU分采后逻辑关联(10200–10680s,钱坤);再往上叠agent诊断平台(调用千问模型、skill库自动沉淀),线上一次推理服务乱序包事件的根因被agent自动定位为同pod另一用户大流量反压交换机导致buffer打满丢包(10680–10920s,钱坤)。这三份答卷共同印证一条链:推理时代稳定性与利用率的瓶颈持续上移(物理网络→调度→runtime→运维认知)→每一层的工程化都能兑换成SLA与成本→先测量后优化的老办法依然是唯一途径。

六、终局之辩:以太网、开放生态,与中国的需求原点

论坛最后回到每年必问的生态问题,三方立场在2026年有了新的实感。Rochan为垂直整合辩护:英伟达做了大量开源(Dynamo、NCCL、NVLink Fusion),但开源生态「最成功的领域是能推进所有人进步的领域」;多厂商拼装可以把每类成本做到最低,「但是否能产出收入和利润最高的AI工厂」存疑,他引用公开报道称最新一代系统Token吞吐提升67倍(不具名,13560–13800s,Rochan)。Asad的回击带着历史情绪:20年前一家垂直整合公司把交换机卖到10万美元,开放生态把它打到1万美元;scale up曾经一家独大,今天几乎所有最大的XPU厂商都转向了以太网,「我们不相信一家公司发明技术、再邀请大家参与」(13800–13920s,Asad)。蔡德忠没有站队,而是给了一个阶段论:他上月参加Stanford Hot Chips的见闻是,除英伟达外,AMD、OpenAI、微软和多家GPU创业公司的scale up方案基本全用以太网,AMD主推UALink却讲「UALink over Ethernet」,演讲人还说了句「Ethernet always win」(14160–14280s,蔡德忠转述现场);他自己的判断是——私有协议在域小、协议简单、紧耦合快速迭代的阶段有真实价值(平头哥scale up用简单交换机做到低成本快迭代就是例子),但当规模跨rack、走向两层,简单性丧失、云厂商要为每种GPU运维一套不同协议的集群时,「终将统一到一个开放的网络,它的名字肯定叫以太网」,且开放不等于同质化:RDMA over Ethernet各家协议增强不同,scale up即使都用以太网、GPU的transaction layer仍可差异化,真正的行业领导者是在开源生态里经得起比较的那个(14280–14400s,蔡德忠)。

观众问答补上了两个外部视角。其一是CPO与NPU(应理解为准CPO/集成度之争):大互联网公司基本坚持可插拔解耦路线集成行业内最好的芯片与光,但蔡德忠承认NPU与CPO都未成熟时,芯片公司做紧密集成有阶段性优势,「还在观察阶段,没有final decision」(14640–14880s,蔡德忠)。其二是对中国用户很现实的搭售问题——有听众直接问「买英伟达GPU必须搭买NIC和交换机,尤其在中国,怎么看」,Rochan没有正面回应,重申英伟达是系统性设计的infrastructure公司,「客户可以任意选择,只是希望选尽可能多的英伟达产品」(14880–15120s,听众提问与Rochan回应)。最后一个关于scale across落地时间表的问题,得到了全场最坦诚的一个答案:蔡德忠说这不是技术ready的问题,而是需求驱动——美国缺电,所以集群分散在多园区协同训练;中国「卡不太足,但电还是充足的」,不存在跨集群训练的刚需;真正让scale across变得现实的,是推理PD分离遇上资源散落各地的现实,「资源比较紧缺,买的时候可能就散落在不同的地方了」(15120–15360s,蔡德忠)。这句话其实是整场论坛的暗线:中美AI基础设施的网络形态分歧,根源不在技术选型,而在电力与算力供给两种不同的稀缺。

收束来看,这场论坛把「网络是算力的延伸」(2520–2640s,主持人;15360–15415s,闭幕致谢)从一句口号变成了一套可以核算的工程与会计体系:Token是产出单位,KV Cache命中率与分位数SLO是过程指标,每Token网络成本是最终裁决。四小时里反复出现的规律只有一条——当约束变化(工艺放缓、Token降价、电力或算力稀缺),优化的重心就在协议栈与产业链上迁移:从线速到封装,从带宽到缓存,从吞吐到尾延分位,从连通性到可承诺。对从业者,值得放进观察清单的指标是:各厂商scale up域的实际部署规模与故障半径、CPO的pJ/bit与无扰动时长、多租户推理的P99违约率、KV Cache命中率进入产品文档的速度,以及「每百万Token的网络成本」何时成为明码标价的合同条款。对更广泛的读者,这场论坛的启发在于方法论而非技术:先找到计费单元(Token),再把一切工程指标折算到它上面——这套做法几乎可以原样搬去评估任何一条基础设施赛道的真实价值。

(注:本文据liveId 255868转写全文整理,共258个时间段、约142分钟。转写中的人名与术语已按官方议程校正:席永青、付斌章、章明星、宁本哲、Asad Khamisy、Rochan Sankar等;转写疑似处如「磐迈920」网卡、「ICME」算子库、博通「SUI」IP代号等保留原文并标注。文中两处转写重复段(约4080–4200s与12120–12240s的循环文本)已识别为ASR伪影,未作为事实来源。除标注「外部证实」处(HPN论文、GP9A官网规格、TH6-Davisson新闻稿、Spectrum-X Multiplane官方口径、Relax开源仓库、AliNOS技术文章),其余数字与判断均为嘉宾现场口径。)