先说结论
这场近三个小时的论坛只讲了一件事:AI 基础设施的评价体系换了尺子。新华三集团高级副总裁乔剡在开场致辞里把话说得很直白——2023、2024 年大家堆模型、堆参数、不计成本地堆硬件,而随着智能体走进百行百业,“大模型训推的成本比较高,也决定了未来 AI 商业落地的情况”;Token 成本降不下来,AI 就难以形成商业闭环。阿里云专有云网络和安全负责人张然用蒸汽机和电力作类比:真正让一项技术走进千家万户的,从来不是它好不好,而是它贵不贵。
有意思的是,台上十位讲者来自产业链的七个不同位置——设备商、云厂商、CPU 厂商、网卡芯片商、交换机芯片商、推理软件层、算力运营商——但对"尺子怎么换"的回答惊人地一致:训练时代看 MFU(算力利用率)和峰值性能,推理与智能体时代看的是在满足 SLO 的前提下,每瓦、每美元能交付多少有效 Token。这不是指标微调,而是从芯片到软件的全栈重新设计。下面按论坛顺序拆解每一层的答案。
超节点:把"利用率工程"做到物理层
第一个技术分享来自新华三先进技术研究部总经理朱仕银,主题是下一代超节点。他的核心论据是:超节点之所以相对于传统八卡机有"数倍的性能提升、几倍的性价比提升"(嘉宾称,引自第三方分析公司对英伟达 GB300 档位超节点的换算),本质原因只有两个——GPU 间互联带宽的提升,和内存的统一。翻译成机制语言:两者都减少了数据的等待时间,让昂贵的 GPU 不再空转。超节点不是"把更多卡塞进一个机柜",而是一场围绕利用率的系统工程。
这场工程在物理层遇到的约束,朱仕银概括为"三堵墙":带宽、功耗、规模。他判断 224G SerDes 是电互联与光互联的分水岭——当前电、光都还能满足要求,再往上走,光是不可避的选择。而光互联内部又分出路线:可插拔光模块已经成熟;NPO(近封装光学)会在超低时延层先用起来;CPO(共封装光学)虽然英伟达今年已有量产产品落地,但在他看来受工程良率和产业链生态成熟度约束,“短期可能还不会成为主流”,行业普遍预测要到三年以后。
更值得关注的是他对国内 scale-up 互联标准现状的坦率:物理连接的接口定义各家不一、互不兼容,“还是会形成一个技术孤岛,不太利于构建繁荣的技术生态”。国际上由 OIF 主导,国内则有一个二十多家企业参与的开放标准组织在推进。协议层同样碎片化,他透露工信部正在牵头推动 CLink(他称之为"China Link")标准的归一化,主流芯片、设备、整机厂家都在参与,但"坦率来说这个事情还是有难度"——各家 GPU 厂商已经形成了事实上的技术路线,物理层、链路层的定义无法完全兼容。新华三自己的答案是 GLink 协议(GT Link 与 GT Fabric 两颗芯片,由生态伙伴实现芯片),支持最大 1024 卡的双层组网、单层 128 卡——他特意说明 128 卡是当前国内的主流产品形态——单卡 3.2T 互联带宽,并提供 IP 合封与芯粒合封两种接入方式。动机很清楚:新华三没有自研 GPU 卡,开放架构、与业界主流广泛合作是它的生态位。
供电与散热是超节点绕不开的另一半。朱仕银称单芯片功耗已经到了一千一百瓦到一千六百瓦的规模,整机侧必须走垂直供电提升效率、未来走向 800V 直供;散热则整体转向液冷,冷板式为主流,但他提到前两天交流的针式微通道技术"反馈比传统的还要高"——“谁能最终走出来,现在也不好说”。这句不确定恰恰最有信息量:物理层路线之争远未收敛。
软件侧,他给出了一套完整的栈式优化:拓扑感知的路径导航避免拥塞;算子库做 EPLB(专家负载均衡)场景的算子融合,大幅降低时延;KV Cache 缓存走"以存换算",目前主流落在 CPU 内存一级,未来会出现通过 SSD 做 KV 卸载存储的多级方案;推理引擎做缓存感知调度、动态 EPLB、通信重叠等优化,“在对话场景大概有两倍的性能提升”(嘉宾称)。最后他补了两个容易被忽视的点:异构 GPU 的统一资源池化调度是"必然要走的一条路",而大规模集群里光模块故障拉低利用率的问题,让智能运维本身也成了 Token 性价比的一部分。一条完整的链条由此成形:超节点以互联带宽与内存统一减少数据等待 → GPU 利用率上升 → 同样的硬件产出更多 Token → 单 Token 成本下降。
CPU 的价值重估:英特尔把"溢出的热点"接走
英特尔数据中心集团首席软件工程师谢义的分享题目就是"异构协同,释放 Agentic AI 整机算力"。他的切入点非常工程师视角:一年前 AI 对多数人还是聊天工具,今天它具备长上下文和工具循环能力,这给推理后端带来两个新挑战——负载不均衡,和 KV Cache 越来越大。
负载不均衡的机制值得展开。在 MoE(混合专家)模型里,随着负载推进,某个热点专家(他举的例子是"专家五")会成为整个系统的瓶颈,木桶原理决定谁最慢谁拖慢全局。社区现有方案 EPLB 会把热点专家搬走,但搬移本身消耗 NVLink 等互联带宽,所以只能做较长期粒度的均衡(比如每一千次推理做一次)。谢义介绍社区最新演进是 LPLB——线性规划的逐层负载均衡,颗粒度更细。而英特尔的方案更进一步:直接把溢出的热点专家卸载到 CPU 上算。他的论证是典型的"扬长避短":两百五十六个专家共六百多 GB,没有任何 GPU 显存放得下,但单机插 3TB 内存"非常轻松";CPU 的 AMX 算力很强(每指令周期约 1024 或 2048 次运算,具体数字他笑称"还不能说");CPU 的短板是带宽——一张 H20 卡 4TB/s,CPU 整机只有一点几 TB/s——但热点专家在任一时刻只有一两个,带宽需求 CPU 完全接得住。GPU 显存放不下的部分,恰好是 CPU 内存最擅长的部分。
KV Cache 这一侧,他先量化了问题的规模:要实现约 75% 的命中率,通常需要 3M(三百万)Token 的缓存容量,以 MiniMax M3 为例每兆 Token 约 150GB,三兆就是 450GB——对 CPU 内存和 SSD 都是巨大数字。英特尔的解法是两个 CPU 侧加速器的组合拳:DSA 负责数据搬移(针对 KV Cache 典型的 64KB 以内小块,搬运效率远高于 cudaMemcpy,且不占用 GPU 的 SM 资源——用 GPU 的 SM 做 copy 虽然某些尺寸更快,但那是拿宝贵的计算单元做搬运);QAT 负责压缩,实测能压掉 20% 到 30%,而首 Token 时延(TTFT)几乎没有影响,靠的是硬件卸载加上 GPU 逐层流水的重叠。这条链条可以这样读:Agent 长上下文使 KV Cache 膨胀 → 搬运与存储成为推理瓶颈 → CPU 侧加速器把搬运和压缩卸载出去 → GPU 专注计算、缓存命中率上升 → 单 Token 成本下降。这场分享提醒我们:整机的性价比,取决于最不被注意的部件有没有被用好。
网卡走进芯片:平头哥磐脉920与"每瓦每美元的Token"
平头哥半导体产品总监李旭慧的开场换了一个视角:“过去我们谈 AI 基础设施总是说算力有多大,那么今天我们换一把尺子。“这把尺子上刻着三个趋势——参数进入万亿级、万卡集群成为常态、推理需求首次超过训练——它们共同把度量标准从"多少 TFLOPS"变成了"每瓦、每美元的成本能交付多少 Token”。网络因此走到舞台中央,因为通信开销直接影响 GPU 空转时间,空转就是浪费 Token。
他对行业头部动作的梳理收敛成两条主线:网络走进芯片,RDMA 走向多路径。前者包括英伟达把 PCIe Switch 与以太 Switch 功能塞进网卡、BlueField DPU 直连 SSD 做 KV Cache 存储;后者包括多家头部产品支持 MRC 式的逐包喷洒、多平面组网,两层网络支持五十万卡级互联,更激进的微软、Meta 直接把网卡做进 AI 芯片并重写 RDMA 协议。他强调这"不是一个技术路线的选择,而是工程上的必然”——万卡规模下,传统单路径办法已经碰到天花板。
平头哥的答卷是磐脉920,2026 年 4 月发布的首款智能网卡,也是国内首个内置 PCIe Switch 的 400G 智能网卡。它把芯片级网络与多路径 RDMA 原生做进一张卡:内置约 510 核可编程处理器与 P4 引擎,包处理能力大于每秒四亿;单 QP(队列对)跨两个物理端口测出 393.91GB/s 有效带宽,接近 400G 线速,约为主流 2×200G 网卡的两倍(嘉宾称)——传统网卡无法跨物理端口跑单 QP,应用要自己拆流再同步,同步过程浪费算力。集合通信实测中,两机十六 GPU 加八张磐脉920 对标主流 400G 网卡,all reduce 与 all to all 全消息尺寸"持平或略优"(嘉宾称),意味着现有框架和通信库不用修改可以直接切换。更贴近生产的是混跑实验:未来 Agent 混合流量与跨域流量增长快,多张网卡部署成本高,混跑成为刚需,磐脉920 通过硬件 QoS 与可编程拥塞控制让 RDMA 不被 TCP 流量拖高,全包长时延比主流 400G 网卡低超过 20%(嘉宾称)。综合下来,他给出"综合性价比约有 30% 优势"的结论(嘉宾称)。这张卡的产业意义在于它不挑服务器、不挑超节点,并与新华三共建端网融合方案——芯片级网络让数据少绕行,多路径把网络用足用好,一个降本、一个提上限。
跨域与光:当集群大到装不下一座数据中心
新华三网络产品线智算网络架构师蒋新红把视角拉到最大:智算网络的三种形态——scale out 解决卡间同步、scale up 把 MoE 的 EP/TP 流量控制在机柜内、scale across 用跨数据中心协同突破电力和空间限制。数十万卡甚至百万卡的场景下,“功耗、散热这些问题"使跨域成为必选项。
跨域的第一敌人是时延。他给了一个直观的数字:单流传输时间从数据中心内的 1 毫秒增加到 10 毫秒,网络吞吐率会下降到约十分之一(嘉宾称);高延迟场景下丢包重传要等待 RTT 确认,性能损失被放大。新华三的四维解法是:ZR 光传输消除传统 OTN 设备光电转换带来的时延,DCI 交换机直出 400G/800G 光口,单台设备支持 64 个 800G 端口,评估网络投资成本节约 40%、空间节约 30%、功耗降低 25%(均为嘉宾称);SRv6 确定性网络在报文里携带周期 ID 映射到队列,做到端到端时延抖动可控,SRv6 TE 把同一训练作业不同 GPU 的流量调到同一路径,避免 ECMP 哈希到不同时延链路产生的木桶效应;Fast CNP 机制把拥塞响应控制在数据中心内,跨域网络性能提升约 11%(嘉宾称);MACsec 芯片级线速加密支撑 400G/800G 全端口,性能无损。可靠性上,PCL 硬件检测在信号劣化阶段就先于故障切换业务,实现"治未病"式的零丢包。
博通高级产品经理刘婷婷与蒋新红形成跨公司呼应,她把 AI 负载演进梳理为三阶段:大规模训练(集合通信是主角)→ 训推混合与超大规模推理(今年八月 SIGCOMM 把第一个 research session 给了 KV cache 在网络中的高速传输,她说这是个"非常有意思的信号”)→ 基于 Agent 的分布式系统(负载边界从集群内拉远到跨域)。她的洞察是:AI 正在把网络变成计算架构本身的组成部分,“不再是一个通道了,一个连接了”。
scale-up 侧,她详细介绍了 ESUN 工作组——由博通牵头、面向以太网 scale-up 场景的开放工作组:去年成立时有十几家创始成员,到今年年初 1.0 发布时已有 175 家行业伙伴。博通把自己的传输层协议 SUE 贡献到 OCP 开源,让更多 GPU/XPU 厂家可以用以太网做 scale-up 互联互通。落地产品是 Tomahawk Ultra——51.2T 以太网交换芯片,做到 250 纳秒时延,她强调这个数字"可能比一些专门为 scale-up 定制的私有协议时延还要低",且实现 64 字节小包线速(覆盖内存语义依赖的最小 Cache Line 尺寸),是业界第一颗支持 UEC 和 ESUN 标准下 LLR 与 CB-FC 的芯片(嘉宾称;具体协议名以转写为准)。scale-out 侧的数字同样惊人:Tomahawk 系列 2014 年 3.2T 到 2025 年 102.4T(TH6),十一年带宽翻 34 倍;两层 TH6 多平面架构支持 12.8 万个 800G 端口,按国产 XPU 两卡一 800G 网卡折算即 25.6 万卡。网卡侧,博通今年推出了面向 AI 场景深度优化的旗舰 800G 网卡(嘉宾称业界首款完整对标 UEC 1.0;产品名转写不可辨,不予转述),配合 MRC(OpenAI 联合博通、微软、AMD、英伟达向 OCP 开源的多路径可靠连接协议)实现多平面包喷洒、乱序重排与选择性重传。
技术含量最高的一段是光互联路线之争。OCI(Meta、微软、OpenAI、博通、AMD、英伟达等共推的开放光互联方案)做了反直觉的技术选择:不用现成的 200G PAM4,而用多路 53G NRZ 低速波通过 DWDM 组合(四路 53G 凑 200G)。她的解释是:200G PAM4 电平间距窄、误码率高,需要增强型 FEC 纠错,仅此一项就带来约 100 纳秒时延,而交换芯片本身才 250 纳秒;光侧大概率还要全链条 DSP,又是约 100 纳秒。53G NRZ 眼图张开,可以零 FEC 或低时延 FEC,甚至有机会整链去 DSP。一句话总结这个设计哲学:“与其让单个波跑得更快,不如让多个波跑得更慢。“scale-across 侧她列举了吉瓦级数据中心的现实:Meta 的 Prometheus 一吉瓦去年已部署、Hyperion 规划五到七吉瓦、OpenAI 星际之门规划七吉瓦——只有跨域网络是真正解决百万卡规模部署的方案。博通的 Jericho4/Draco4 DCI 芯片(51.2T,自带 HBM3E 深缓存以吸收远距离突发)即为这类场景准备。
Token时代的网络与存储:KV Cache成为"一等公民”
阿里云高级技术专家李旅的分享为整场论坛提供了理论骨架。他提出推理时代的核心指标是 TTLT——time to last token(最后一个 Token 的时间):Chat 时代关注首 Token 时延就够了,Agent 长程任务连续跑几个小时甚至几天,真正反映业务体验的是整个推理流程何时结束。背景数据是:据嘉宾引 OpenRouter 统计,全球 Token 消耗量每年增长约 30 倍,中国过去两年增长了 1400 倍。他复盘了阿里云网络的三代演进:2023-24 预训练时代的 HPN 7.0(首篇智算集群网络架构论文入选 SIGCOMM),2025 年训推一体与超节点时代的 HPN 8.0 与 UPN,2026 年面向推理与 Agent 时代的 TPN(Token Performance Network)。
TPN 的三个设计支点值得记住:KV-centric,以 KV Cache 在不同层级、不同 PD 节点之间的高效传输为设计中心;SLO 追稳,网络抖动直接成为用户体验的一部分;性价比优先——理由是财务性的:“训练时代网络的成本是 capex(一次性投入),推理时代网络的成本变成每一个 Token 的 opex”。这个成本性质的转变,是整场论坛所有技术选择背后最硬的逻辑。流量形态也变了:训练时代集群里是模式固定的大规模 all reduce,推理时代是 KV Cache 传输、PD 分离、存储分级、EP 并行等多种流量共存;训练中断可以回 checkpoint,推理故障"会变成一场真正的线上事故”。他的结论是,网络某种意义上转型成了"模型的记忆总线"。
新华三存储产品线首席架构师陈钊接过话头,把"记忆总线"的另一端——存储——讲透了。他说存储团队每天醒来要回答的问题是:能为极致的 Token 性价比贡献什么?他的答案是外部共享存储池,而驱动它的正是 KV Cache 内存墙:HBM 容量小、长在 GPU 里、高度临时性,与推理负载需要不断复用 KV Cache 的矛盾,会随模型参数变大、上下文变多、应用变化而不断激化。Agent 时代把这个矛盾推向极致:多轮工作流从个位数轮次变成小时级甚至天级;上下文不断积累;KV 变成需要长期保存的记忆;Agent 还会自发派生子 Agent,使单 GPU 的并发度暴涨;任务间歇性回到 CPU(他称之为"脱扣")时,记忆留在 HBM 里已经不合适,必须溢出到外部更低成本的空间。
陈钊给出了一个可迁移的分析框架——“黄金交叉点”:卸载更多 KV Cache 能释放 GPU 算力、降低成本,但引入的加载时延会拖累计算;计算时间与加载时间正好匹配的那个点就是最优解,“这个时间点越往右,说明存储卸载了更多 KV Cache,性价比就越高”。工程上的两大挑战是稀疏小 I/O(decode 阶段要按注意力权重从巨大上下文里挑出 top-key 的小块 KV,而存储天生擅长大块顺序 I/O)和 CPU 瓶颈(PCIe Gen6 单盘数百万 IOPS,24-36 盘的存储系统上亿 IOPS,传统 CPU 控制器成为最大瓶颈)。新华三的应对是一套 KV-aware 的新架构:XCache 连接层向上兼容多元异构算力与推理引擎,向下构建 G2.5(内存语义 load/store 的 CXL 共享池)与 G3.5(KV 语义 put/get 的 NVMe 共享池)两级池化,配合 DPU 硬件通道把 IOPS 从主流分布式文件系统的百万级推向上千万级、时延从毫秒级降到百微秒级(嘉宾称)。他还对比了行业火热的 HBF(高带宽闪存):它确实能扩展 HBM 容量、用更少的 GPU 完成同样任务,但有"寿命焦虑"——Flash 合封进 GPU 后损坏很难处理,而外部存储换一块盘即可。
国产算力的两层解法:把卡用好,把Token卖明白
清程极智联合创始人兼产品副总裁师天麾的分享现场改题为"AI infra 软硬协同释放国产算力效能"。这家源自清华计算机系高性能计算研究所的公司(首席科学家为所长翟季冬教授,首席顾问为郑纬民院士,外部检索可证)对国产算力现状的判断是:硬件越来越好,但"好不好用、能不能用起来"是软件问题——就像手机没有操作系统就是一块板砖。vLLM 这类为英伟达设计的推理框架兼容国产卡"能运行,但很难彻底发挥性能"。他同事的比喻很形象:老外爱吃面包买烤箱,中国人蒸馒头包子,工程能力很强也许能把烤箱改吧改吧用,但费力不讨好——“针对中国人的场景,我们就应该设计一套蒸锅”。于是赤兔推理引擎每行代码从头自研,有开源版与商用版。
案例部分的数字都有来源:2021 年青岛"海洋之光"超算(神威系列十万核纯国产,嘉宾称),他们与智谱唐杰团队、阿里云三方合作把大规模训练系统跑起来;2025 年深圳超算纯 CPU 架构上优化 DeepSeek 推理,16 个节点的吞吐约相当于 80 张主流 GPU,从 644 节点扩展到 892 节点仍保持 74% 的并行效率,该超算前两个月拿到世界第一(嘉宾称);今年上半年与郑州海光 BW1000 集群从万卡做到八万卡以上规模训练,论文入选 HPC 顶会 SC 即将发表。最能说明"软硬协同"价值的是 PD 异构混搭:国产卡计算强、海外卡显存带宽强,用海光 BW1100(144GB 显存)做 Prefill、H200 做 Decode,两到三台 BW1100 可以替换一台 H200,吞吐基本不变、时延降低约 90%(嘉宾称)——他据此判断海光新一代显卡的性价比"已经比肩甚至超过 H200",代价是"都被抢完了"。
但生产出 Token 只是一半,卖给用户还有流通环节。师天麾指出 Token 服务是个黑盒:同一个 DeepSeek 模型、同样的标价,头部大厂之间的服务质量"性能差个五倍是很正常的",甚至存在"标了一个模型,实际用的是一个更差的模型"的情况;同一家服务商一天内性能波动一两倍也很常见。清程极智做了 AI Ping:汇集三十多家合规服务商、四百多个模型服务,7×24 小时不间断评测延迟、吞吐、成功率、上下文长度、价格、缓存命中率,再根据用户需求(低延迟、高吞吐、成本优先)做智能路由。这个业务形态本身就是一个行业信号:当 Token 成为商品,商品市场就需要第三方质检与比价系统。
让每个Token更值钱:是石科技的后训练答案
是石科技首席科学家李俊涛的收尾分享换了一个方向:前面所有人都在降低 Token 的生产成本,他讲的是"通过后训练让每个 Token 变得更值钱"。这家 2021 年成立的独立第三方算力运营商(嘉宾称 2022 年运营盐城超算中心、2025 年算力调度平台纳管超 2 万 PFLOPS 算力、Token 优化工厂累计订单超 30 亿元、已完成 A 轮 B 轮数亿元融资)联合开源社区做了针对 Agentic RL 的后训练框架。
问题的起点同样来自 Agent:用 Claude Code、Codex 这类强大的 Harness 框架能让模型展现长程推理能力,但直接拿它做强化学习训练会失效。三个具体挑战是:模型与 Harness 适配失效(特定模型需要特定 Harness 才能取得最优表现);上下文与推理路径不匹配(Harness 有自己的上下文管理,模型训练需要精确的 Token ID,一个文本序列可能对应多个 Token 序列,导致训练拿到错误信号);训练对 Harness 设计高度敏感——黑盒框架的微小改动就能让训练动态剧烈波动。他们量化了这一点:Claude Code 的系统提示词约 20K Token,其中只有 25% 与问题直接相关,剩下 75% 是规则和产品逻辑;对开源模型而言,简单的白盒 React 框架反而训练效果更好、能力提升更快。
框架设计围绕"让 Harness 直接能训练"展开:把复杂任务解耦为 agent、sandbox、奖励建模三大组件;维护 running token buffer 让 Token 只编码一次(拒绝重编码);智能 split 机制在 Harness 切换上下文时自动开启新推理链,避免跨上下文污染;rollback 机制在 Harness 做轻量重写或重试时回滚到决策起点,“确保只训练真实的决策”。量化结果:不同大小模型、不同 Harness、多个基准上相对提升 12.6% 到 65.8%(嘉宾称),支持超过两百轮推理。训练效率侧,长上下文 rollout 占单步训练时间的 60%-80%,固定资源分配下 GPU 空闲率可达 60%,他们的异步策略让 reasoning RL 训练时长缩短 35%-38%,Agentic RL 吞吐相对同步训练提升 40% 到 100%(嘉宾称)。
收束:一张全景图与三个观察
拼起来看,“下一代智算基础设施"的轮廓清晰:scale-up 用超节点和开放以太网协议把机柜内的带宽与时延做到极致,scale-out 用多路径 RDMA、UEC/ESUN 和大容量交换芯片把集群做到十万卡级,scale-across 用 ZR 光传输、SRv6 确定性与 DCI 深缓存把算力池拓展到跨域百万卡;在这张网络的每个节点上,KV Cache 沿着 HBM—CPU 内存—CXL 池—NVMe 池的分层存储流动,DSA/QAT/DPU 负责搬运压缩,CPU 承接溢出的热点专家;再往上,推理引擎把国产算力用足,评测路由把 Token 商品的信息不对称抹平,Agentic RL 让每个 Token 承载更高的智能密度。
第一层观察关于"尺子”。这场论坛反复出现同一组对照:MFU vs TTLT,峰值性能 vs 每 Token 成本,capex vs opex。指标的改变传导到每一层的设计哲学——网络不再追求单一性能峰倍,而是把 KV Cache 当"一等公民";存储不再是大块 I/O 的仓库,而是 KV 语义直通 NAND 的记忆层;连液冷、运维、供电都成了 Token 成本的变量。机制 → 影响:当基础设施的成本从一次性投入变成随 Token 产出的持续支出,所有组件的 KPI 都会向"单位 Token 性价比"收敛;启发:判断一项智算技术的前景,先看它优化的是峰值还是分母——优化分母的,时间站在它那边。
第二层观察关于"开放与国产生态的重叠"。ESUN 175 家伙伴、SUE 开源进 OCP、UEC 1.0 发布、MRC 由 OpenAI 联合各家向 OCP 开源、国内 CLink 与二十多家企业的标准组织、磐脉920 不挑服务器不挑超节点——开放协议正在同时降低两个门槛:超大规模的组网门槛,和国产芯片进入生态的门槛。朱仕银坦承 CLink 归一化"有难度"因为事实路线已成,而李旅判断私有 scale-up 协议"绝大部分会让位于开放协议"、只在极小众极致性能场景保留。机制 → 影响:协议开放化削弱单点厂商绑定,让设备商(如新华三)、芯片商(如平头哥)在标准层面获得与生态共成长的机会;启发:对国产链而言,接入开放标准的速度本身就是竞争力,比单点性能参数更值得关注。
第三层观察关于"异构混搭替代全栈替代"。师天麾的 PD 异构案例(国产卡做 Prefill、海外卡做 Decode)与谢义的 CPU 专家卸载,本质是同一个思路的两面:不追求在任何单一维度上全面追平,而是把不同部件的长处拼起来——CPU 的内存容量、国产卡的计算、海外卡的显存带宽、网卡的多路径、存储的每 GB 成本。机制 → 影响:异构混搭让"够用的算力"组合方式大幅增加,缓解单一供应链的产能与价格约束(H200 涨价与国产卡"被抢完"是同一枚硬币的两面);启发:在算力紧缺周期,系统级整合能力(软件层、调度层、路由层)的边际价值高于单芯片的代差追赶。
论坛名是"打造 Token 极致性价比",但十位讲者实际上共同回答了一个更根本的问题:当 AI 的竞争从"谁的模型更强"进入"谁的 Token 更便宜且更值钱",基础设施的每一个物理层和软件层都要为这个目标重新组织。张然说他们在讨论"一个时代的问题"。从这场论坛的密度看,此言不虚;而所有数字都标注着"嘉宾称",成色如何,要靠未来一年各家的交付验证。