先说结论
9月23日上午的云栖大会平头哥算力峰会「云模之芯,共筑非凡」,八位讲者从芯片、超节点、模型、智驾、具身智能、CPU、网卡七条线讲了一件事:AI算力的竞争单位已经从一颗芯片变成一套系统。李伟良开宗明义——「真武是系统,不只是芯片」;阿里云的王超随后给出全场最有方法论价值的一句话:超节点的判定标准不是卡数,而是「系统的语义不会在物理边界处断裂」。真正的矛盾在于:模型权重已经涨到1.5TB量级,单卡访存带宽撞上物理极限,行业只能靠系统工程——统一内存编址、确定性时延、协议协商、CPU与网卡补位——把几十上百颗芯片拼成一台计算机。对读者的启发是:看国产算力别再只盯峰值算力,要盯MFU、RTT长尾、语义连续性和它承载的真实模型。
一、每年一颗芯片:真武的节奏与护城河
平头哥副总裁李伟良用十五分钟把真武产品线摆了出来。真武定位全自研、高性能、训推一体的AI芯片,已落地810E与M890两颗;2027年一季度推出前一天主论坛刚发布的V900(现场另称G900,媒体报道多为J900,2028年三季度上市、基于新架构——正文统一采用J900并在此注明口径差异),形成「每年交付一颗芯片」的节奏。对比M890,V900计算单元翻倍,FP4/FP8算力增至三倍,显存216GB(M890的1.5倍),片间互联用112G serdes做到1200GB/s双向带宽;自研ICN Switch 1.0交换芯片单芯片25.6Tbps、端到端时延小于250纳秒,通过CBFC与P2P实现无损传输。以上数字与IT之家、极客公园等现场报道一致。
规模上,李伟良称真武已累计服务超过650家企业客户、覆盖二十多个行业,用时不到两年,其中线上场景有超过40家自动驾驶和20家具身智能客户,并进入运营商计算平台、各地智算中心与金融、能源行业;基于M890超节点,真武正在支撑千问、Kimi等大模型的推理任务。他认为护城河有四条:应用驱动的芯片定义(依托阿里云规模化场景,在feature、loss选择、算力内存配比上与业务方深度对焦,「不闭门造芯片」)、软硬协同设计、多芯片融合设计(平头哥同时自研CPU、SmartNIC、SSD主控,AI Agent的任务调度与KV Cache管理天然需要多芯片协同)、完整的工程实现能力。这四条的底层逻辑是一致的——芯片竞争力不再来自单点堆料,而来自对真实负载的先验知识。
值得单独点出的是他把V900的意义归结为「对AI算力底座的重新构建」而非简单改良:性能边际从单芯片转向超节点多维度提升,生态上兼容主流生态与开源开放双线并进使其成为「可灵活转用的生产性资产」,安全上以硬件信任根、多级固件安全启动、设备身份远程验证等六大能力完成从可用到可信的升级。
二、真超节点的判据:语义连续,不是卡数
如果说李伟良给了产品坐标,阿里云加速计算负责人王超给的是方法论。他一上台就调侃自己的PPT原名「真超节点」因「攻击性太强」被改——因为它暗讽别人的超节点是假的。他不点名地质疑「上万卡超节点」:「虽然在数学逻辑上可以成立,但我不相信在今天的技术上物理世界可以实现,否则星舰也不会那么难。」当芯片数量达到一定程度,系统级问题会不可抑制地发生。
那什么才是超节点?王超的定义是:把多个OS、多个服务器连起来,软件管理的范围超过物理边界;而最关键的判据是——「系统的语义不会在物理边界处断裂」。软件不应因为要访问的物理内存在另一台服务器上就改变编程模式,内存操作必须以统一的、顺序的方式完成语义。他梳理了三种编程模式(消息/DMA式、软件管理的内存语义、硬件一致性维护),强调三者无优劣、只是物理依赖与维护成本不同,并总结出高效超节点的四项关键能力:统一内存语义、确定性低时延、目标负载下无收敛互联、系统级闭环——「这四件事,大部分发布会从来都不说」。
这套方法论有量化骨架。他提出理解Scale-up要看五层(事务顺序→报文穿越交换→流控验错恢复→PHY介质),而发布会只讲最后一层的速率带宽,「只定义了天花板,没有上层你到不了天花板;PHY的相似性不代表事务语义、传输可靠性和交换能力的相同性」。对decode场景他给出公式:维持目标带宽的理论并发下限≈带宽×RTT÷每次请求的数据块大小——所以只标带宽不标RTT的超节点宣传是没有意义的,要看P99.99长尾下的RTT。训练场景则相反:all-gather/reduce通信可以与计算流水重叠,需要的是「稳定的可预测延时」而非绝对低延时,因此把TP类通信藏进Scale-up域、把DP通信暴露到以太网。
规模选择上,王超坦言这一代scale-up率做到64卡、未来向128/144/1024演进,依据是负载反推:Kimi K3的2.8T模型、Qwen3.8 Max的2.4T模型,64卡M890加MXFP4量化「完全塞得下去」;模型涨到5-10T就「勉为其难」了——「今天主流的模型是这个系统最好的甜点,我们在balance cost、稳定性和模型尺寸之间平衡」。拓扑上他比较了英伟达GDC上展示的576卡结构(单层crossbar加第二层)、华为论文中的机内3D Torus加一层crossbar、谷歌延续的3D Torus,结论是「今天的模型尺寸下,64卡单层超节点是最经济的方式」。落到真武M890的四条验收标准:语义上芯片与交换芯片共同构建远端内存访问并补齐顺序完成规则;时延上端点交换、信用流控、链路恢复共同设计以消除长尾;拓扑上64卡任意可达、不超卖域内带宽;系统闭环上从芯片到Runtime、通讯库、框架提供9216GB HBM统一访问与51.2T峰值总带宽。他也提醒:英伟达、华为、平头哥走私有协议私有实现,UALink、Ultra Ethernet是开源生态,但「定义归定义,产品归产品」——同一UALink标准下拓扑和软件实现不同,性能完全不同。Scale-up与Scale-out「没有任何对立性,没有谁比谁高端」。
三、100毫秒里的经济学:访存决定下界
Kimi工程副总裁许欣然的分享是全场信息密度最高的一段。他先给背景:Kimi K3(2026年7月发布)有2.8万亿参数,是开源世界最大的模型,MXFP4之后权重约1.5TB——模型太受欢迎,「相当长一段时间推理扛不住流量,不得不停售API」。这直接引出他的主题:推理成本的大头在decode阶段,占总成本60%到90%。
他把一次100毫秒的decode step拆成四段:固定的软硬件开销、Attention(KDA/MLA结构)、通信、MoE读权重——最后一段是「整个时间的下界」,因为1.5TB权重必须被完整读过一遍。100毫秒读1.5TB,意味着系统至少要提供15TB/s的带宽。降本只有两条路:把每条attention压短,或者把MoE耗时压小。模型侧的演进是「面多加水、水多加面」:从MHA到KDA/sparse attention降低访存绝对量,再靠投机采样趁访存卡住时多用闲着的算力一次验证多个token——「大家用着用着发现计算一不小心用多了,计算反而成了瓶颈,于是再砍计算」。芯片侧,他回应了「能不能造一颗只有强访存能力的芯片」:不行,decode对算力密度要求同样在涨,大约每byte访存能力需要配100 FLOPS以上的算力,越高越能支撑更长的验证长度。
最有说服力的是三个量化反例。假设attention和MoE各占50毫秒:如果访存能力弱一倍,MoE时间翻倍,「成本不是亏一倍,而是从能跑一百条请求变成零到一条,成本上升一百倍」;如果算力密度差一倍,每条attention计算时间翻倍,均摊成本同样恶化;如果超节点互联和基础时延差——模型93层、每层两次通信,每操作多100微秒,乘下来就是20毫秒被削掉,「attention只剩30毫秒,成本又翻倍」。所以「decode对一颗芯片的要求是非常全面的,每一个方向都不能差」。未来他判断三个方向:模型继续变大(芯片各项指标需两到三倍提升)、更激进的投机采样(用算力换访存,因为访存是实打实的物理限制)、更小的KV Cache——线上全体用户的KV Cache总量有时已经比1.5TB的权重还大。超节点也带来了新玩法:他介绍了与真武团队合作、已在GitHub开源的MoE并行方案——过去EP范围一大,稍有不均衡就总在等最慢节点;有了超大带宽,「不一定把数据拉到expert那里,也可以把expert拉过来,哪个地方压力大就多找几个节点一起算」。迁移体验上,Kimi自有算子和代码「只花了比较小的工程量」就迁移到M890,之后又做了大量联合优化才把性价比「显著提上来」。
四、物理AI的长尾战争:量级、反馈与快慢脑
元戎启行CTO曹通易与无界动力联合创始人夏中谱接着把话题从数字世界拉到物理世界。曹通易的核心判断是「自动驾驶是物理AI最好的实验场」,理由有三:硬件架构已经uniform化、数据质量远比数量关键、以及独一无二的on-policy反馈。他给出一个量级规律:元戎量产已超50万台车(嘉宾现场口径),从五千辆、五万辆到五十万辆,「你在某一个量级看到的问题,需要下一个量级的数据才能积累足够样本去解决」——长尾问题高度依赖真实部署的物理实体数量。反馈机制同样独特:每天上千万公里智驾里程,模型开得好就继续开、开不好用户接管并给出「应该怎么开」的示范,这才构成高质量数据;相比之下很多具身数据采集「没有反馈」。他概括物理AI问题可解的三前提——足够多高质量数据、系统完全模型驱动、模型容量足够大——而当前车内模型只有0.0x B到0.x B,把容量做大是剩下的核心挑战。解法是云端训练大两个量级以上的基座模型,训练范式从模仿学习转向「Video Foundation Model预训练+中训练(驾驶+分析+认知任务,训练思维链)+后训练(思维链采样+强化学习)」,再用模型反哺数据管线——「Analyst和Critique任务本质上是蒸馏ML工程师每天的工作,让迭代速度随模型提升而变快,recursive improvement跑起来」。模型变大后出现了未经单独训练的涌现行为:避让空间不足会倒车退出、忽闪忽灭的红绿灯前停下观察旁车通过后再跟进、看到人行道绿灯变红就提前起步——「模型开始有一点思考的能力」。他还不掩饰对infra的重视:支出两年提高一到两个量级,「MFU翻倍,几个亿的预算就能发挥十几亿的效果」,并称真武PPU「手感非常好」,工程师几乎零适配、单任务轻松到千卡。
夏中谱(2026年3月从理想端到端负责人位置加入无界动力,现场口径为联合创始人兼CTO)讲的是具身智能的通用大脑。无界动力2025年成立、两百多人、硕博占比90%,路线是「隐空间世界模型+强化学习」,从工业场景练技能、商业场景练泛化,逐步走向家庭。他把物理AI的挑战拆成外部三条(目标不确定、开放环境、本体多样)与自身四条(闭环误差积累、实时系统算力有限、物理约束、大量状态不可观测),对应的方案是快慢脑:慢脑低频做长程任务拆解,快脑高频做动作控制——而关键洞察是「任务拆解和任务执行完全不一样」:拆解任务千问、GPT都能做好,真正的壁垒在快脑对「每个动作会产生什么后果」的理解(不同力度拿玻璃杯和纸杯的结果不同)。快脑用多模态隐空间世界模型实现,学习动作引起的环境变化、因果性与价值评估,执行时推演不同动作的后果再选路。数据上四类并用(互联网、第一视角、真机、仿真)走三阶段训练(预训练学空间与物理因果、后训练适配硬件与任务、强化学习在真实场景闭环)。成果方面他称两臂模型上半年登顶Robocasa榜单、第一视角学习的任务可zero-shot迁移;本体K15轮式双臂机器人获欧盟CE认证、公司拿到全球七亿元订单(嘉宾口径,未独立核实)、已向欧洲发货,世界机器人大会上五天接待近万人客流。算力底座选了真武:大显存放得下2B到8B模型,实测「相比主流GPU性能提升非常明显的50%」,加上不用改代码、CUDA工具链直接复用,「从上机测试到业务部署不到两周」。
五、圆桌:优化什么,以及省着用的尽头
峰会中段的圆桌(千问算法科学家郑博、王超、平头哥副总裁邹云晓,平头哥软件技术资深总监毛钧主持)把分歧摆到了桌面上。郑博主张优化「解决问题的效率」而非token生成速度,提出「有效token」概念——同样的算力投入能否带来更多有效产出。邹云晓从芯片侧说链条:AI需求已经把从架构定义到底软的每个链条「逼到物理极限」,「从其他环节做不同的选择,可能比你自己单独优化好得多」,且不能只看纸面算力要看MFU——「计算单元在芯片里占比并不大」,寄存器、缓存、片上网络、片间互联这些配平了算力才发挥得出来。王超则抛出三个「优化」:优化时间(「如果能提前半年实现AGI,我愿意付出巨大的成本」)、优化per-task cost而非per-token cost(「打车只关心付多少钱,绝不关心油耗」)、优化模型的使用方式。
郑博还系统讲了千问的attention演进:千问三之前是全层full attention,Qwen3.5和Qwen3-Next把大部分换成linear attention(压缩状态存储上下文、保留少量full attention做全局精细检索),最新的Qwen3.8 Flash-Next又把一小部分换成sparse attention——「不是简单用精度换效率,而是结构加训练的改进」,取舍原则是全局检索能力必须以某种形式保留。TCO话题下他补充三个方向:动态稀疏激活、低精度适配(Qwen4.8 Flash-Text的gated residual大幅降低outlier、让量化更友好)、自适应推理让模型自己决定生成多少token。邹云晓则把推理专用芯片的选择谱系摊开:按PD分离阶段做P/D芯片、在通用架构上专门优化、做DSA牺牲灵活性,极端情况是「把模型权重固化进芯片」——国外已有团队发论文在做、国内也有类似想法,但「真到那天成本最省、灵活性完全没了,只能跑某种模型」,现阶段模型还在快速发展,仍属极端。
王超的两段发言是全场最锋利的。谈痛点,他把今天类比56K拨号:「我们花了三十年让流量成本趋近于零,现在做的所有优化都是因为算力太少,只能省着用、抠着用——某些时间是在浪费生命。我们最大的痛点是半导体制造业能不能扩大一千倍的规模,尽快堆到足够的芯片,让工程师可以挥霍算力,达到算力free。」谈TCO,他用第一性原理推演:「幸好半导体用的是硅不是黄金。它这么贵主要因为产能不足」;路径依赖上缺人才缺设备但不缺原材料,AI能把30人设计一颗芯片变成3人,设备大规模国产化后「流片成本从五千万美金变成五十万人民币」——他预测五到十年半导体产能过剩,「这个话题本身会被消灭掉」,而且即便算力近乎免费,就像电已经很便宜但仍有能效等级分级的空调冰箱,优化与供给扩张是正交的两条线。他还现场算了笔账:这次PPT用agent引了四十多篇论文,烧掉四万个credit、约八百美金,「比我工资还高,还不如我自己写」。谈愿景,他认为今天的基础设施根本没有为AI重构:「终结者用电脑不该咔咔敲键盘,应该插根管子,屏幕以一万倍速度闪现」;人形机器人的逻辑是「今天所有基础设施是给两条腿两只手的人设计的」;而agentic之所以原始,是因为「工具为模型重构」尚未发生。
六、回到关键路径的CPU与网卡
最后两场演讲补上了AI计算里最容易被忽略的两块。平头哥产品总监黄伟讲倚天CPU:Agent负载从一问一答变成多步骤循环(反复推理、工具调用、决策),工具执行与长上下文驻留把负载推向CPU侧——他给出现场实测:agent场景工具执行占请求响应时间约60%,编码agent场景55%到60%的时间花在CPU侧的容器初始化与工具执行,「CPU重新回到计算的关键路径上」。两类负载要求截然不同:延迟敏感型(与加速器紧耦合)要更高单核性能与带宽,吞吐并发型(沙箱、RAG、编排)要更多核与更大内存——实测单agent实例峰值内存可达28GB,Head Node单次迭代有41%的负载不可并行扩展,所以一边要宽前端、页表预取、内存重命名去压缩串行路径,另一边要神经分支预测(应对间接跳转)、图预取(应对RAG的gather/scatter)、动态缓存替换与MPAM资源分区去撑起更多更稳定的沙箱实例。路标上倚天720面向吞吐并发、730用第一代自研高性能核面向延迟敏感(单核跑分最高上代1.4倍)、未来750可与真武共用同一套高速互联——与主论坛披露一致。
阿里云高性能网络研发负责人付斌章的论点更直接:推理decode阶段50%以上的成本或性能由通信决定,而网卡的物理成本只占10%到20%——「网卡是这个集群里投资产出比最高的」。与平头哥合作的磐脉920(国内首个内置PCIe Switch的400G智能网卡,2026年4月发布即量产)提供400G带宽、2微秒时延,支持标准RoCEv2与阿里自研SOLAR(SRDMA)协议,并做到Per-QP级协议自动协商——与老网卡混部时退回RoCEv2、两端都是磐脉920时自动升级SRDMA,透明增量部署。他纠正了一个流行误区:「两年前说预训练用集合通信只关注带宽、协议无所谓,是对的;今天训推一体、多租混跑,PD分离的burst流量会干扰预训练」,磐脉920的包级多路径与拥塞感知绕行在千卡任务上把DP通信耗时降低43.2%、端到端性能提升12%;面对跨集群PD分离的5到10毫秒广域网时延,SACK选择性重传加多路径协同把端到端吞吐提升55%;弹性场景下新虚拟化方案做到传统SR-IOV的64倍设备密度且「弹性不以牺牲性能为代价」。网络架构层面,HPN从7.0(51.2T交换芯片)到8.0(102.4T、13万个800G接入)再到研发中的9.0(200T、52万接入),今年新推的TPN(Token Performance Network)则把前端网络与Scale-out网络融合,让PD分离从跨集群回到集群内。压轴的落地数字:磐脉920已随灵骏真武M890超节点上线,Qwen3.8 Max推理任务在超节点实例上相比传统实例,Prefill性能提升2.3倍、Decode提升1.1倍。
结语:看系统,别只看芯片
这场峰会串起来的是一条完整的因果链:模型权重涨到万亿参数、MoE成为默认架构→单卡访存与显存撞上物理极限→必须把几十上百颗芯片用内存语义拼成超节点→互联、网卡、CPU从配角回到关键路径→软件栈与生态兼容决定这些硬件能否被真正用满。平头哥的打法是把算(真武)、联(ICN Switch)、网(磐脉)、存(镇岳)、通用(倚天)全部自研再装进同一台「计算机」,用阿里云的真实负载定义芯片,再以每年一颗的节奏迭代。嘉宾们的分歧也值得记下:王超赌的是供给端(五到十年半导体产能过剩、算力free),许欣然与郑博押的是需求端(模型继续变大、结构继续换效率),邹云晓提醒专用化的极限是把权重焊死在芯片里——这三条路径并不互斥,但决定了未来几年钱和人才往哪流。
对读者,三个可观察的指标比任何发布会数字都硬:一看V900能否兑现2027年一季度量产和「每年一颗」的节奏,那是应用驱动定义芯片真伪的试金石;二看M890/J900超节点上真实模型的MFU与P99.99长尾RTT,而非标称带宽;三看PD分离是否真的从跨集群回到集群内、单位任务成本是否随TPN与磐脉920的部署下降。若这三条曲线走平,再大的卡数也只是发布会语言——正如王超所说,关键从来不在卡数,在系统语义的连续性。
(注:本文据2026云栖大会平头哥算力峰会现场转写整理,人名与产品名已按官方议程校正,讲者观点与数据均归属嘉宾本人现场陈述;个别转写存疑处以「嘉宾称」或括注标明,未经独立核实的企业数据均已在文中注明口径。)