先说结论
2026年9月23日下午,云栖大会「平头哥算力峰会:T-Head SAIL软件栈技术论坛」上,平头哥把自家AI芯片真武(PPU)的整套软件栈T-Head SAIL摊开在桌面上:名字取自Seed of AI Library,官方口径是"每一行开源代码都是一颗种子"。这是继7月WAIC上宣布开源之后,SAIL第一次在正式场合拿出完整路线图——分批开源、GitHub主线开发、适配代码回流上游社区。据公开资料,截至2026年4月真武芯片累计交付56万片、服务400余家客户;论坛上平头哥软件生态资深总监陆生华给出的更新数字是20多个行业、约650家客户(截至今年6月,嘉宾口径)。真正值得关注的不是数字,而是这场论坛揭示的行业转折:芯片静态算力的竞赛接近同质化之后,竞争的定价权正在向软件栈的"兑现率"迁移——同一颗芯片,软件栈好坏能让实际业务吞吐差出数倍。蚂蚁团队在论坛上给出的账本是一年29倍的推理吞吐提升,这个倍数里没有一代硬件的更换,几乎全部来自软件。对任何采购算力、做推理平台或写算子的人来说,这篇文章试图回答三个问题:平头哥开源了什么、客户们真实用出了什么水平、以及这套逻辑对局外人的决策有什么用。
一、SAIL开源路线图:不是放出代码,而是交出开发流程
陆生华的开场逻辑很直白。上午的硬件论坛刚发布新一代真武V900芯片,算力指标"国内领先"(嘉宾称);但他的论点是,静态算力要靠软件兑现成业务性能,存量软件迁移到新芯片要花多少工时,取决于软件栈的完备度与可迁移性;而PyTorch、vLLM、Hugging Face这些开源生态的迭代速度,芯片厂必须跟得上。他说截至今年6月,650家客户用真武跑主流训练推理场景(嘉宾口径),客户开始提出更高要求——想自己写高性能定制算子,这就需要了解硬件架构、软件栈实现甚至指令集设计。需求侧的参与意愿,是这场开源的直接推力。
SAIL的结构分两层。下层是平头哥自研SDK:内核与用户态驱动加PPU Runtime统一管理设备与内存;编译器支持C/C++/Python与存量代码平滑迁移;往上是计算加速、互联加速、编解码加速三类高性能库;再往上是设备监控、诊断、性能分析等开发者工具。上层则是对开源软件的适配——用陆生华的话说,“几乎适配了整个AI界的全部软件栈”。据公开资料,这套栈对外宣传三个"不":不重写代码、不等待适配(主流推理框架平均适配时间小于7天)、不被平台锁定,已适配超过260个主流训练推理框架组件。论坛上陆生华强调的三个特点与此呼应:基于主流生态开发的程序重新编译一次即可在PPU上运行且性能不错;跟随PyTorch、vLLM、SGLang最新版本快速迭代,他称平头哥是"国内跟随开源社区版本最激进的厂商之一";以及全量框架适配,让开发者保留原有开发方式。
真正有信息量的是开源的方式。陆生华给出三条原则:信任为基——全部代码放GitHub,开源开发分支就是研发主线,平头哥内部工程师怎么开发对外全程可见,他称这是"开发流程的本质变化";标准为纲——拥抱既有生态的使用习惯,不另起炉灶、不把开发者锁进私有体系;加速为势——对真武的适配代码全部提交(upstream)到上游社区,借助社区力量迭代。配套动作已经落地:两个月前上线平头哥开发者社区网站,SDK、内核驱动、性能分析工具、文档、预编译包全部开放;Model Scope上已放出39个针对真武低精度特性量化的主流开源模型(千问、DeepSeek、Kimi、MiniMax等,覆盖INT8/FP8的A8W8与A4W4多精度,嘉宾称截至9月累计下载34.8万)。GitHub上第一批仓库包括PyTorch for SAIL、模板库、DeepGEMM、FlashMLA、FlashAttention、Xformers、代码迁移工具与Triton支持;他承诺月底或十月初放出第二批:TensorFlow、JAX、推理引擎、Flash Linear Attention、低精度计算库、PPU GDB与高性能集合通信库。据公开资料,集合通信库官方名为PCCL,这与论坛口径一致。
治理规则同样照搬主流开源社区:issue、fork、PR、公开评审、CI验证,三原则是透明可信、自治共享、无分叉负担——所有贡献统一回流主线,升级即得最新演进,避免私有分叉的长期维护成本。长期规划有四条:一套软件栈支持多代硬件(810E、正商用的M890、刚发布的V900三代共用一套软件);从深度学习扩展更多场景;持续推进PPU upstream到vLLM、Triton、PyTorch等主流生态;社区运营上每年开平头哥开发者大会、常态化Meetup、校企联合实验室与开源实习。陆生华的收尾定调:“T-Head SAIL是一份软件栈,也是一份共建的邀约"“凡可开源者皆尽开源”。
从行业机制看,这一步的实质是:当一家芯片厂把研发主线搬到GitHub,它卖的就不再只是芯片,而是把客户从消费者变成共建者的通道。二阶影响是客户切换成本与厂商锁定成本的同时下降——小红书拿开源文档喂agent、蚂蚁与SAIL团队共研量化格式、北大拿捐赠算力跑科研,都是这条通道上的早期样本。评估任何新算力平台时,“软件栈开源深度、上游社区是否有原生支持、是否存在私有分叉负担"应与峰值算力同权重。
二、推理侧的两本账:蚂蚁的29倍与小红书的agent调优
四份客户账本里,蚂蚁集团高级技术专家蔡腾纬这份最像一份性能工程编年史。起点是去年DeepSeek R1发布后,蚂蚁要在810E卡(96GB显存、单机16卡)上低成本部署这个MoE大模型。第一个坑就很典型:BF16版R1部署后每卡权重占用约84GB,KV Cache只剩约74K token容量,并发很快受限——排查发现是推理引擎默认打开了MoE矩阵吸收,把投影矩阵合并成更大的融合权重,挤占了KV空间。关掉这个特性、修复非吸收路径的tensor shape后,权重降到约80GB,KV容量提升70%,单机16卡折算吞吐从880提升到1210(+38%,嘉宾称,测试口径为每请求4K输入1.5K输出、平均TTFT小于3秒、P90 TPOT小于100毫秒下的最高吞吐)。这个案例的启发是:性能问题先查引擎默认配置,再怪硬件。
接下来是一条量化路径。W8A8(权重激活均INT8,channel-wise权重scale加per-token激活scale,int8点积、int32累加后处理scale)让吞吐推进到3100+;更有意思的是W4A8:蚂蚁先用Triton做per-group量化验证精度与链路,再与SAIL团队共同定义高性能方案——非共享专家权重量化成INT4 per-channel(蔡腾纬提到这结合了计算库acext的channelwise能力,据公开资料acext确为SAIL的扩展库)、激活保持INT8 per-token,执行前做打包布局预处理、寄存器内解包符号扩展后送入矩阵单元,SAIL侧优化tiling与循环展开控制INT4解包成本。最终模型权重从600多GB降到330GB,量化工具沉淀进QLin并集成到SGLang,整套用于生产;对照实验里W4A8折算16卡吞吐比W8A8再提升59%(嘉宾称)。再叠加PD分离(SGLang加Mooncake框架,两个TP8的Prefill实例配一个EP32的Decode实例)、KV传输与专家均衡,单机折算总吞吐达到6600+。蔡腾纬特别说明这些吞吐数字均为折合单机16卡口径。他还提到一个反直觉的实验结果:在810E上把专家并行从EP32扩到EP48、EP64,吞吐不再提升——并行度不是越大越好,通信拓扑有上限。把一年串起来看:从最初连高效attention实现都没有、output TPS只有75,到2100+,29倍提升(嘉宾称),全部发生在同一代硬件上。今年的新工作是GLM长上下文场景:CP16分摊attention计算加稀疏化attention,40K输入单并发TTFT从8.59秒降到5.6秒(-35%);相邻层索引复用让80K输入从9.4秒降到8.1秒(-14%,需结合精度验证);两阶段流水线分层从41:37调回39:39,prefill吞吐+8%。对新一代M890,蚂蚁用内部AI coding数据集压测给出的综合折算加速系数是:以810E为基线,DeepSeek V4 Pro约2.5倍、GLM5.2约4倍——他强调这反映的是硬件、精度格式与软件栈整体共同作用,且为内部数据集口径。
小红书模型工程负责人骆兆楷的账本展示了另一条路径:用agent把调优经验工具化。搜广推场景三级缓存架构里最难的差异点在hash table(embedding)算子层。他的判断是,真武PPU与GPU生态兼容度特别高、开箱即用,“但最难的是把国产硬件用好”(嘉宾原话大意)。迁移已有算子时,GPU与PPU硬件参数、存储大小的差异会变成多参数调优问题,他们用一个agent加workflow把这些细节补齐;新开发算子则让agent基于平头哥开源文档与知识库构建,再结合profile工具拿到真实调优数据迭代。这里有个细节很有行业信息量:英伟达Nsight Systems的分析报告没有API可调,agent只能截图喂给视觉模型、丢失大量信息;而平头哥的报告可以用命令行方式逆向解析,对agent友好——骆兆楷把这称为"小技巧”,并期待未来profile报告直接提供API。他称这套agent调优能达到80%以上专家调优水平,架构直接复用一篇打过FlashInfer比赛的论文(友商出品),路径可复现。计算图层面,他们先把"free style"的Pythonic代码(for循环逐行塞tensor)改写成torch.compile友好的形式——他用"从中文变成英文"作比——FX Graph压平后算子间模式复杂度下降,Kernel Fusion才好做;而平头哥底层算子较多归一到模板库(对标英伟达CUTLASS),分支集中意味着agent幻觉更少、GPU上前几年的学术与工程优化成果可以复用。这本账的启发是:当硬件文档、profile工具、开源算子库对机器足够友好,“专家调优能力"就开始平权,中小团队也能吃到大半的优化红利。
三、训练侧与学术侧:小鹏的千卡与北大的2K全景
小鹏汽车AI Infra高级专家彭飞补上了训练视角。他称小鹏"应该是"第一家使用PPU的企业,PPU在小鹏不只做推理,很大一部分在跑模型训练,覆盖训练、部署、自动标注、闭环仿真与数据挖掘。时间回到两年前,小鹏正处BEV范式向VLA 2.0切换的节点,团队拿PETR、Sparse Drive等开源模型先在PPU上验证可用性,最担心的两点是去掉CUDA生态与NVLink后通信能力够不够、能否scale到千卡万卡。结果(嘉宾口径):60项指标中16项相对某些H卡最优、训练Tensor相似度96%以上;随后依托平头哥profiling工具做系统级调优与瓶颈算子kernel优化,整机性能约2倍提升,千卡线性加速比保持96%以上,故障率约为GPU卡的1/11.7(此处转写口径存疑,方向为显著低于GPU)。工程细节上,小鹏自研了基于PyTorch的训练平台(带通讯、蒸馏、RL框架与弹性容错),上面做了一个自动感知硬件的调度模块——GPU、PPU、CPU之间无感切换、自动配超参,业务侧对硬件无感;底座是阿里云的容器算力服务(转写为"ECS弹性容器”,据公开资料阿里云面向真武PPU的容器服务为ACS),相对裸金属故障率减少80%(嘉宾称)。kernel层面的例子:调整tiling策略让Conv3D性能提升20%多,FlashAttention支持不规则mask后SDPA性能提升90%多;他特别指出这些算法与框架层优化没有为PPU做特定修改,从反面印证PPU生态与主流生态匹配度高,GPU上的优化开箱即用。痛点与方向同样具体:十六卡机器上视频训练的瓶颈在CPU,数据与训练分离(独立CPU机器预处理再传给PPU)带来约2.5倍加速;单卡推理任务则更划算地用PPU内部的专用解码硬件,他称"一颗大约等效七十颗GPU芯片”(口径存疑);VLA 2.0上线后旧业务收缩释放出PPU卡,小鹏正在尝试GPU与真武的混合训练。
北京大学施柏鑫教授(议程头衔:长聘副教授、研究员,Camera Lab负责人)代表学术用户视角,讲了智能体视频生成。研究目标是"电影感"的四个可控:光影可信、镜头连续、音画同步、叙事连贯;方法隐喻是智能体分工——导演、灯光师、分镜师、配音师、剪辑师各司其职。技术上,光照可控靠3D proxy场景代理加多材质渲染作为显式条件注入扩散模型,把光与材质形状解耦;视频生成网络本身还能兼作光照估计器;分镜靠首尾帧迭代预测加多镜头记忆模块;音视频联合生成与自动剪辑两项工作刚在9月初的ECCV宣讲(嘉宾称)。与平头哥的合作始于2026年3月之前的算力捐赠,先小规模试用体验不错再推荐给学院,6月正式签约(他提到平头哥尹总是北大计算机学院校友),目前部署4台810E共32卡,用于科研与本科教学。最能说明软件栈价值的一个数字:团队基于万相Wan底座的全景视频生成工作(论坛转写为"Panda One",经外部核验应为PanoWan,NeurIPS 2025论文,基于Wan 2.1文生视频框架扩展全景能力,需处理球面极点与赤道采样率不均、左右边界闭环无缝等特有难题)在810E平台上代码几乎没改、支持bf16混合精度,96GB大显存直接把训练分辨率从480p推到2K——迁移成本极低,显存约束的解除直接改变了产出质量。他的团队正在赶ICLR投稿,做可交互的全景世界模型。
四、性能分析方法论:从凭经验猜到用证据讲
平头哥软件技术资深总监王政华的演讲可以看作整场论坛的"内功心法":在M890超节点上对千问3.8大模型做性能分析与调优的完整实践。他把性能目标定为四个指标——TTFT(首token时延,决定"开始快不快")、TPOT(每token时延,决定"流不流畅")、吞吐(系统产能)、硬件利用率(判断计算瓶颈还是访存瓶颈,决定优化方向),并强调SLA条件会限制最大batch size,同一模型在不同SLA下吞吐利用率差异很大,性能分析不能脱离SLA。成果(嘉宾口径):100K长输入下TTFT提升6%;4K输入1.5K输出场景下TPOT提升600%、在SLA要求TPOT小于30毫秒的同时单卡output吞吐提升117%;核心算子GDN显存带宽利用率约69%,MoE与GEMM的矩阵利用率与带宽利用率分别达75%与70%——他的解读是,这些提升主要来自把硬件能力真正发挥出来。
方法论三步。第一步抓trace:用平头哥的性能分析工具(论坛转写为"Asset System",据公开资料官方名为Asight Systems)获取模型运行的完整时间线,CPU与PPU上的事件、每个kernel起止、通信与同步位置一目了然,“把性能分析从凭经验猜变成用证据讲”。第二步分解:看端到端占比排序,千问3.8实例中top5 kernel类别是framework、flash attention、MoE、GEMM与通信;再看重点算子的硬件利用率——flash attention初始矩阵利用率仅26%、GEMM为56%、all-reduce带宽利用率74%已接近理论上限,优先优化占比大而利用率低者。第三步逐个击破,且kernel与框架两层并行:kernel层要理解PPU的硬件差异,比如为提升CU访存带宽,PPU把shared memory分成4个group每组1024字节,除bank conflict外还要避免新的group conflict;CU数量不多但每个CU有更多指令发射单元、可装更多thread block,同样能发射更多访存指令提带宽;用warp interleaved让两个warp访问向量核与矩阵核的时间错开、消除bubble。框架层的例子则说明"kernel快不等于系统快":某个device的请求提前结束后新请求优先执行费时的prefetch,会让其他device的decode空等;一个device上combine前的kernel耗时异常变长,会让所有device的同步被阻塞,系统级combine平均耗时被拉长——这类问题只有回到框架粒度才能定位。框架侧四类手段:并行策略组合(TP/PP/EP/DP加PD分离)、投机采样策略(如MTP)提升draft命中率、MoE的FP4加FP8混合量化配合EPLB专家负载均衡、核心算子选用PPU优化版本。最后他把整个方法总结为四层粒度逐层细化:请求端到端、框架iteration、算子OP、kernel硬件指令与访存,并把这套方法论沉淀成工具(Asight Systems做系统级、Asight Compute做kernel级分析,均带智能专家分析),让"每个人都成为性能分析专家"。对读者的启发是:这套"定目标、抓trace、做分解、两层击破"的流程与具体硬件无关,任何做性能工程的人都可以直接搬用。
五、圆桌:day-0适配、超节点的爆炸半径、agent写代码的时代
压轴圆桌「超大规模模型推理的技术挑战」由平头哥编译器技术资深总监何军主持,嘉宾是vLLM核心维护者兼Inferact联合创始人游凯超、红帽大中华区CTO张家驹、阿里百炼推理平台高级技术专家何涛、平头哥推理引擎技术资深总监邢冲。背景是近几个月旗舰模型密集发布——主持人列举Kimi K3(7月)、千问3.8 Max(8月初)、DeepSeek V4 Pro(8月中),均为万亿参数、百万级token上下文,会场透露下一代参数规模将达5T到10T。
第一个话题是day-0适配。游凯超的解释最系统:模型权重是静态的,跑起来需要对应代码;百炼的适配代码在阿里内部无法共享,所以vLLM的做法是在模型发布前与模型厂合作提前拿材料做适配,发布时权重与适配代码同步开源。他称适配最难的部分是KV Cache管理——独立的kernel适配可以拆分并行,KV Cache管理在引擎上层、与其他模型共享模块,必须前置讨论,比如Kimi K3的混合线性注意力需要与Moonshot合作做partial prefix cache hit。据公开资料,Inferact确于8月完成Kimi K3的厂商验证认证,与论坛口径互证。张家驹给出了企业级视角的分层:红帽在vLLM社区投入了专门的团队,但企业客户不求day-0,要等大厂验证可靠才上——“有点像Kubernetes从互联网进企业”,红帽做的是day-1、day-2的深度优化,重心在Kubernetes层的llm-d项目(据公开资料,llm-d为红帽与Google Cloud等联合发起、2026年3月进入CNCF沙箱的K8s原生推理服务栈)。何涛从百炼角度定义了"day-0即生产"的三重挑战:精度对齐(他提到历史上有的模型给开源社区的reference code本身就有问题)、给定硬件无经验时拿出满足SLA的交付、以及day-0就意味着接生产流量带来的稳定性问题。邢冲则给出芯片厂答案:平头哥从芯片设计阶段就把用户使用方式前置,programming model与业界主流一致,对DeepGEMM、DeepEP、MoonEP等库提前适配,内部自研推理引擎做集成验证,与vLLM深入合作让能力第一时间进开源代码——“让day-0发生在PPU芯片上”。
第二个话题是超节点。主持人给出量级:通信开销约占推理时间的10%到30%(论坛口径)。何涛的两个点最有运营深度:一是模型越大、规模越大,调度请求、KV Cache长度、通信、专家激活四类不平衡都成为性能抖动来源,需要在并行策略上精细调整;二是扩大EP能更好利用超节点通信能力提吞吐,但单节点故障影响的节点也越多,生产上要按工况动态调节部署形态,平衡性能与故障爆炸半径——“规模不是越大越好”。游凯超补充了经济学视角:scale-up域要装得下权重加活跃请求的KV Cache,scale-out域最好容得下未来可能缓存命中的KV Cache;万亿MoE模型的部署成本有一条陡坡,用户量不够就亏,用户多则靠稀疏性摊薄,“平摊下来的成本可能跟同等激活量的模型差不多”。他还提到阿里同学做的部署simulator即将放出,因为真实加载几个T的参数冷启动要几分钟到十几分钟,每改一个配置就重测的代价太高。邢冲给出硬件侧坐标:M890提供800G全互联带宽,当天发布的V900支持214GB单卡显存与1024卡超节点(论坛口径),下一代互联带宽将到1200G;算力仍紧缺,超节点下对硬件MFU的挖掘仍有空间,EP rank变大后负载均衡问题更显著。
第三个话题软硬协同,被游凯超引向一个更远的问题:agent时代,未来代码大部分可能是agent写的,硬件应该做的是开放接口、把programming model说清楚——“agent有能力消化这个复杂度”,业界已有工作把硬件细节spec喂给agent自迭代、省掉很多软件抽象层、直接最大化利用硬件能力;甚至不必为兼容老芯片保留抽象层,因为agent的上下文"脑容量"比人大得多。张家驹提出平衡的一面:传统抽象层是给人看的,为了优美与可维护性,agent成为写代码主力后,如何在效率与长期可维护性之间取舍是长期课题。邢冲给出现场最有说服力的实例:平头哥内部一位并非MMA优化专业的同学,让agent协作阅读开源sample代码与SAIL开放文档,写出了定制化的attention算子,在特定shape上"某种程度上达到SOTA性能"(嘉宾原话,限定语较多);他还提到FP4低精度不应只停留在推理,最好进入模型后训练过程保障精度,以及上午Kimi讲的MoonEP用超节点互联带宽换取专家负载不均衡的trade-off。展望环节,游凯超用了电力的比喻:“我们还在学发电,但更有用的是电器”;张家驹强调开放(开放权重、开源框架、开放硬件API)让更多人类智慧协同应对AGI时代;何涛判断一年后高质量、低成本交付每个token仍是最大挑战与机会;邢冲收在"生态协同、软硬协作,充分释放芯片算力支撑AI普惠"。
六、把论坛压缩成五条链条
这场论坛的信息量大,但真正可迁移的是几条完整的"机制、二阶影响、启发"链。
第一条,兑现率链。静态算力不等于可用算力,软件栈完备度决定兑现率(蚂蚁同一代硬件29倍、王政华利用率从26%提到75%均为证据)→ 二阶影响:芯片竞争的主战场从制程与峰值参数转向软件生态与迁移成本,软件栈开始给芯片定价 → 启发:评估任何新算力时,把"重编译即可跑、上游原生支持、无私有分叉负担"当作一级指标;反过来,厂商通稿只谈峰值算力不谈软件栈时值得警惕。
第二条,开源主线链。研发主线搬到GitHub加适配代码upstream(陆生华承诺、游凯超与邢冲的vLLM合作互证)→ 二阶影响:客户从消费者变成共建者(小红书逆向文档喂agent、蚂蚁共研W4A8格式、北大多轨教学科研),厂商锁定成本与社区迭代速度同时改善 → 启发:企业团队可以把厂商的开源文档与sample代码当作agent知识库资产管理;选基础设施时估算"分叉负担"的终身维护成本。
第三条,低精度与并行链。量化(W8A8→W4A8,权重600G→330G)释放显存 → 显存释放打开并行与资源配置自由度(TP8双实例、PD分离、EP32)→ 二阶影响:推理成本结构被改写,万亿模型部署的规模经济门槛被拉低(呼应游凯超的"陡坡"论)→ 启发:模型部署的成本杠杆有优先级——先量化与显存,再并行策略,最后才是单kernel优化;跟进硬件原生低精度格式(FP8、FP4、MXFP4)的落地节奏。
第四条,超节点权衡链。高速互联聚合显存带宽算力(800G→1200G、1024卡)→ 单故障影响面同步放大 → 二阶影响:部署规模从技术问题变成"性能对爆炸半径"的运营问题,simulator与成本模型成为上线前标配 → 启发:大规模部署不要单调"越大越好",建立仿真与动态调节能力再扩规模。
第五条,agent写代码链。软硬件适配的主体正在从人转向agent → 硬件接口清晰度比抽象层完备度更重要,开放文档与可解析工具(如平头哥可命令行解析的profile报告对比闭源无API的竞品)成为agent时代的隐形基础设施 → 二阶影响:专家能力平权(邢冲的内部案例、骆兆楷的80%专家水平)→ 启发:把"agent可操作性"纳入工具链与供应商评估维度;个人层面,与其和agent比拼写kernel的手速,不如积累"喂给agent的知识资产"——文档、样例、可复现的调优流程。
七、反方视角与观察清单
按惯例要说明这场论坛的局限。第一,主场叙事:所有性能数字均为嘉宾自报、论坛口径,没有竞品同台对照——“60项指标16项最优"的对照卡型模糊、“一颗解码硬件等效70颗GPU"与"故障率1/11.7"两处转写不清且无脚注,M890的2.5倍与4倍加速是蚂蚁内部数据集的折算,不可直接外推到公开基准。第二,客户数字快照不一致:论坛称650家客户(截至6月),公开资料4月口径为400余家,两者时间不同但都为厂商口径。第三,承诺待验证:第二批开源(TensorFlow、JAX、推理引擎、集合通信库PCCL等)承诺在月底或十月初,upstream"几个月内达成"是自估时间表,兑现与否要看GitHub与上游commit,而不是看通稿。第四,圆桌共识大于分歧:真正的反方观点——例如开源软件栈的安全合规成本、企业级客户对社区版稳定性的疑虑——只有张家驹从day-1/day-2角度点到,没有展开。
下一步的观察清单很清晰:十月初看T-Head GitHub第二批仓库是否如期放出;看vLLM、PyTorch、Triton上游是否出现真武PPU的原生支持commit(这是"无分叉负担"承诺的硬指标);看Model Scope上量化模型数量与下载量的增长斜率;看平头哥开发者大会的规格与校企课程的落地;以及看蚂蚁、小鹏们在M890与V900上的下一批公开数字是否与内部折算口径收敛。算力正在变成水电煤式的基础设施——这句收尾的修辞背后,真正的产业事实是:定价权在软件栈,而软件栈的竞争,才刚刚开始。
附注一:转写校正记录(ASR Corrections)
本文依据论坛音频转写整理,转写稿中术语与人名被ASR大量打散,以下为主要校正(未定项已正文标注"转写存疑”):
- T Head Cell / Tidal Cell / T4 Core / T H A R T C L / T H C L / Cell → T-Head SAIL(依官方议程名)
- SAIL全称:转写"Seed of AI Libraries”,官方口径为 Seed of AI Library
- 正武 / 政务 / 真我 / 正五 → 真武(PPU系列芯片)
- 施伯新 → 施柏鑫;骆兆凯 → 骆兆楷;蔡同伟/蔡腾伟 → 蔡腾纬;王振华 → 王政华;尤凯超/尤海超 → 游凯超;张家军/家居/嘉驹 → 张家驹(均依官方议程)
- VLM(社区语境)→ vLLM;Infraact/InfraX → Inferact
- 收广推 → 搜广推;探询(计算语境)→ attention;N I system → Nsight Systems
- Asset System / Asset Computer / Anside → Asight Systems / Asight Compute(据平头哥开发者社区公开资料核验)
- Peekle / Pico → PCCL(高性能集合通信库,据公开资料核验);ACEXT → acext(计算扩展库,据公开资料核验)
- 八幺零E / 八幺零一 → 810E;千万三点八 → 千问3.8(Qwen3.8)
- Q Lin / Qing → QLin(量化工具,转写校正);MuEP / Moon EP → MoonEP(Moonshot专家并行方案,待官方确认)
- Panda One → PanoWan(北大施柏鑫团队全景视频生成工作,基于Wan 2.1,据智源社区等公开报道核验;转写"基于One的视频background"应为"基于Wan")
- V I 二点零 → VLA 2.0;iClear → ICLR;DeepJin → DeepGEMM;LMD → llm-d(红帽K8s原生推理项目,据CNCF公开资料核验)
- MFO → MFU;A真 → AGI;ECS弹性容器 → ACS容器算力服务(据阿里云真武PPU页面核验)
- 十一点七倍 → 按"故障率约为GPU卡的1/11.7"校正(方向依上下文推断,口径存疑);二点五解码 → PPU内专用视频解码硬件(转写不清);Auto Level业务 → 旧智驾业务(转写不清,模糊化);天感训练 → VLA 2.0相关训练(转写不清,模糊化)
- 两百一十四B显存 → 214GB单卡显存(单位依上下文推断);中ウ芯片 → 真武芯片;百百灵千问 → 百炼/千问
附注二:外部核验清单(External Verification)
以下主张已用论坛外公开来源核验:①T-Head SAIL于2026年7月18日WAIC宣布开源、五层栈结构、开发者社区上线与分批开源计划(chinaainews、百度百科、FlagOS等);②真武810E规格96GB HBM2e、700GB/s片间带宽,M890为144GB、800GB/s、64卡全带宽互联,截至2026年4月累计交付56万片(阿里云真武PPU官方页面等);③Asight Systems / Asight Compute、acext、PCCL等工具与库名(平头哥开发者社区公开资料);④游凯超为vLLM核心维护者、Inferact联合创始人兼首席科学家,Inferact于2026年8月完成Kimi K3厂商验证认证(Inferact官网、个人主页);⑤llm-d为红帽联合发起、2026年3月进入CNCF沙箱的Kubernetes原生推理项目(GitHub);⑥施柏鑫为北大长聘副教授、Camera Intelligence Lab负责人,PanoWan基于Wan 2.1、PanoVid数据集1.3万片段(智源社区、实验室官网);⑦小鹏扶摇智算中心与阿里云共建于乌兰察布(小鹏官网2022年新闻)。论坛内部数字(29倍、+59%、2.5×/4×、80%专家水平、故障率与解码等效比等)均为嘉宾口径,未做独立复测。