先说结论
这场论坛表面是阿里云灵骏的年度产品发布,实质是给"AI 超级计算机"换了一套度量衡。王超(阿里云智能集团加速计算产品和技术负责人)开场的判断贯穿全场:过去两年大家在这里讲训练、去年讲推理,今年的计算对象变成了 agent 任务——多个阶段、多个回路、会暂停会重试的长事务,瓶颈这一刻在 GPU、下一刻可能在工具调用或外部网络。于是评价体系从 MFU(模型算力利用率)和 token 单价,转向他反复强调的一个新公式:单位成功任务的成本 = 总拥有成本除以成功的任务数,“失败不应该收钱”。围绕这条主线,13 位讲者把灵骏拆成了三层:底层是真武 M890 超节点与 64 卡 800GB/s 的互联底座;中间是 RuntimeKit 资源引擎和全生命周期状态机;上层是 REIN 控制器,把训练、推理、开发三个场景封装成"任务意图"。对行业来说,最值得记下的是:国产超节点第一次拿出了 40 天服务一百多家客户的生产化数据,而竞争的焦点已经从谁的卡更强,转移到谁能交付"从任务提交到首次有效动作"的端到端确定性。
负载变了:当推理只是 agent 执行路径上的一环
整场论坛的起点不是产品,而是对负载的重新理解。王超把话说得很直:agent 负载不是推理负载,推理只是 agent 执行路径中的一环。一个 agent 任务要先理解意图、检索数据、调用 API 和 MCP 工具、进入 CPU 沙箱执行、拿到结果再回到模型,一条大循环里嵌套着并行、回退和重试,“每一次任务、每一次请求都会不一样,没有可复制性”。
李伟男(阿里云弹性计算资深技术专家)给出了全场信息密度最高的一组数字,他说明这些来自对公开研究的总结:每个任务的平均工具调用超过 40 次,SWE-bench 类复杂任务的往返轮次达到 30 到 60 轮,单任务平均消耗 token 在 20 万以上;更关键的是结构——工具执行占端到端时间的 35% 到 61%,而推理的占比可以低到 10% 到 15%,工具调用是串行的,无法靠并行掩盖;输入输出比从 25:1 最高拉到 275:1,缓存读取占输入 token 的 80% 以上;同一个任务多次运行,token 消耗差异可能达到 30 倍。他分析的一个典型代码编辑任务约 130 秒,其中 LLM 推理仅占 12%。
这些数字合起来指向一个结论:Agentic 时代的性能问题,大部分不在推理框架内部,而在推理与外部世界的接口——工具、状态、网络和存储。李伟男由此把场景分成四种压力结构:纯对话长输出压 decode 和显存带宽;RAG 与搜索 agent 的收益大头在状态命中;coding agent 工具密度最大;web agent 的瓶颈在外部等待,因为网页加载平均要 3 到 5 秒。万佳(阿里云高级架构师)补充了硬件侧的呼应:模型每三到六个月就有一次大版本迭代,MLA、DSA、GDN 等新结构不断出现,GPU 硬件只能跟着变。他的判断是,随着 AI 写代码能力增强、算子优化门槛下降,推理方案一定是百花齐放的格局,不再有一种硬件打遍天下。
成本标尺变了:任务账单取代 token 单价
负载变了,钱怎么算也要跟着变。王超对现在流行的"每百万 token 降价多少"不以为意:完成同一个任务所用的 token 数量本来就不一样,token 单价乘以数量才是真实成本,而客户真正关心的是"我完成一次任务该付多少钱"。他甚至拿自己开涮:让 AI 做一份 PPT,“这个 PPT 比我工资可能还贵一点”,因为浪费了太多 token。所以金标准应该是单位成功任务的成本——总拥有成本除以成功任务数,失败的任务不应收费,就像打车半路被丢下去,司机不该收钱。
这不止是定价话术。王超还提出一个尚无行业标准的新指标:从任务提交到首次产生有效外部动作的时间。他形容今天使用 agent 的体感"就像当年用 56K Modem"——任务提交出去不知道什么时候有回应,以至于产品要做个"叮"一声的完成提醒,用户端着笔记本到处跑都不敢合盖。这个指标与 GPU 算力、推理引擎效率相关,但不是绝对相关,它衡量的正是整台超级计算机的端到端效率。
落到产品上,这套度量衡的直接产物是陈祎(灵骏产品经理)发布的 REIN 控制器。名字一语双关:英文 rein 是缰绳,与"灵骏"这匹骏马相配,“把缰绳交给客户”;同时又是 runtime engine for intelligence 的缩写,面向 AI 负载的运行时引擎。它要拆的是陈祎总结的"四堵墙":环境墙(拿到裸金属后 OS、驱动、runtime、多云产品的编排组装)、编排墙(算法同学不该被迫学习 Kubernetes 的繁杂语义)、故障墙(过去响应靠人、定位靠人、恢复靠人、经验靠人)、调优墙(经验不可复制)。REIN 把训练、推理部署、开发环境三个纵向场景加上任务自愈与 AI 调优两个横向能力,封装成统一的控制面,客户可以用 API、控制台甚至自然语言驱动。其中推理一键部署的 REIN OPT 提供三档业务模式:均衡型 TPS 大于等于 20,兼顾时延与吞吐;经济型牺牲 TPS 换更大并发,面向批量离线;极致的 Ultra Speed 用并发换低时延,TPS 大于等于 300。马骏(阿里云高级技术专家)补充了背后的机制:规划组件把模型、输入输出模式、卡型、并发约束、SLO 当作统一输入,靠大量实测 profile 加自研仿真模型,秒级生成配置且与线上实测接近。
陈祎特别强调了一句有分量的话:REIN 的本质不是控制客户,而是把自由的调度权和组合能力交还客户。杰文斯悖论在这里被引用——基础设施的推进降低计算成本,反过来迫使基础设施复杂度急剧增加。众擎的案例被拿来佐证:第一代真武 PPU 的适配在两个月内完成,现在客户提出的要求是一周以内。
架构变了:状态第一次成为调度的一等公民
如果说度量衡是"为什么变",架构篇回答的是"怎么变"。王超的框架是三句话:负载从同步稳定的训练作业变成动态可恢复的 agent 任务;架构从固定 Pod 走向可感知、可组合的系统;目标从单一 GPU 利用率走向端到端 SLO、任务成功率和单任务成本。
最反直觉的变化发生在存储与计算的关系上。为了提高 KV Cache(大模型推理的键值缓存,决定复用率与成本)的命中率,缓存从显存一路外溢到内存、本地盘、远端存储,命中率从 90% 往 95%、98% 追。但王超提醒了代价:丢失一块本地盘,可能意味着一批客户三个小时的计算量要重算;硬盘故障率乘以损失乘以系统数,与命中率收益之间要做联合优化。他讲了个段子:讨论怎么优化计算时,发言最多的是存储同学——“我们到底是在研究计算还是研究存储?“更大的反转在于,阿里云弹性计算曾以计算存储分离为傲,王超称这是全世界第二家做到这个水平的努力;而到了 Agentic 时代,“我们不能分离,得携手共进”,计算、存储、网络被捏合得前所未有地紧密,因为 KV Cache 已经从临时数据变成了会话状态,影响并发上限、长尾时延和成本。
异构解耦的诱惑与陷阱被反复讨论。王超用了一个比喻:最好的发动机加最好的变速箱,车不一定最快——prefill 到 decode 的传输路径带宽不够时,传输成本远超重算。他转述了对英伟达的"灵魂拷问”:GPU 与 LPU 类 ASIC 以什么比例匹配最好?对方答只要确定 SLO、模型结构、精度就能算出。但 SLO 和模型每分钟都在变,两种完全不能互相替代的芯片组合成推理系统必然产生碎片,最后要算的是收益减去碎片是否真正降低了单位成功任务的成本。李伟男的数据支撑了这个谨慎:GPU 的出入口只有 PCIe,与显存带宽相差 50 到 140 倍,已是最大瓶颈;跨 NUMA 的有效带宽只有本地的 12% 到 40%,下一代 CPU 上剪刀差还会扩大,所以他的判定是 GPU、CPU 调度线程、KV 内存池、网卡、VPC 应收进同一个 socket,单 socket 加多 GPU 可能成为主流。网络上,席永青(阿里云网络研发资深技术专家)把 AI 数据中心比作一台 token in、token out 的计算机,网络就是它的总线;而二十年来网络互联的发展速度最慢,资源稀缺决定了"局部优先、分层互联"的原则。他给出的演进路线是:从 HPN 7.0 的第一代万卡 400G,到今天四平面单集群 13 万卡 800G,再到明年底 52 万卡单集群;针对国产超节点显存带宽不足的问题,阿里去年提出的 UPN 架构用低成本光互联加高冗余协议,把超节点从一柜扩展到 256 卡甚至 500 卡以上,3.2T NPO 已点亮,6.4T 在研发中。
资源层的答案是唐小川(灵骏团队)介绍的 RuntimeKit——口播里叫 Runtime Market,本质是"一层统一的标准的资源协议”,追求"声明即所得":客户说要一张卡、半张卡、通信最快的一组卡,平台自动完成拓扑发现、多级选卡、gang 调度。卡内细粒度切分用纯软件实现时分与空分,不受硬件 MIG 规格限制;卡池化后解绑了卡与容器生命周期,可以超卖提升整体利用率。韧性侧最有意思的是"健康分":同样负载下温度略高、可纠正错误略多的"体质不好"的卡,规则看不出来,交给模型打分,分低的卡故障概率比分高的高出几倍到几十倍,训练任务优先用高分卡。
国产超节点的成年礼:从能跑到敢上生产
杨延超(灵骏产品经理)的分享是整场商业化浓度最高的部分。他把国产超节点要迈的门槛归纳为五道:模型跑不跑得起来、成本压不压得下来、迁移丝不丝滑、敢不敢上生产、供应稳不稳定。对应的数据是:8 月 10 日商业化上线,到论坛约 40 天,一百多家客户完成生产化部署(累计口径是六百多家),客户从首次接触到下单最快三天,下单到推理部署一小时内完成——这个"30 多天上百家企业接入"的口径与阿里云弹性计算负责人吴结生在云栖期间的公开表述一致。
技术底座上,真武 M890 超节点 64 卡全互联,单卡带宽 800GB/s,聚合带宽 51.2TB/s,整机显存 9TB 以上,支持 FP8/FP4 精度,是国产首个支持 2 万亿参数级 MoE 模型(转写口径为 2T,外部报道中 Kimi K3 为近 3 万亿参数)的超节点,Kimi K3 和千问 3.8-Max 第一天就在其上跑起来。成本上杨延超宣布:以 DeepSeek、千问 3.8、K3、GLM5.3 四个模型的线上实际业务测试,per token 成本性价比首次超过业界旗舰 GPU——这是厂商口径,但测试基准明确是 agent 场景而非实验室跑分。迁移方面宣称代码零修改、重新编译一次即可拉起生产业务,并面向大语言模型、文生视频、VLA 具身与自驾训练、搜推、AI for Science 五个垂直场景做了定制优化。
真正难的是第四道门槛。从 8 卡机型到 64 卡超节点,杨延超坦言爆炸半径扩大了四倍、故障呈指数级增长。灵骏的答案是体系化稳定性:全部真武超节点支持备机替换,40 天内备机替换成功率 100%,故障后分钟级拉起;自愈服务能识别 99% 的软硬件故障并主动推送事件。赵子涵(灵骏稳定性团队)从原理上解释了为什么超节点的稳定性是全新问题:rack 成了一台计算机,可靠性边界变了,散热从风冷走向必须液冷,爆炸半径从单卡单机变成整柜,小的根因可能通过拓扑放大成大的业务影响,“靠人力闭环不现实”。郑超(灵骏智算集群管理团队)则给出管理学的解法:把超节点升级为一个独立的产品对象,用 28 个状态、30 个原子操作、68 条状态约束构成状态机驱动全生命周期,健康判定从"设备在线"提升到"整柜巡检"——计算域、互联域、网络域、存储域联合验证才算恢复。他的收束值得引用:“我们管理的不是一组设备,而是一份可持续、可信的算力承诺。”
供应链的答案是一张明确的路线图:今年 Q3 已发布 M890(单集群 12.2 万卡),明年 Q2 发布 V900(单集群 50 万卡、性能为当前代三倍),2028 年 G900 的 scale up 域将达 1024 卡(转写此处含混,存疑)。杨延超坦言地缘政治与产能让"有了这一代、下一代还能不能保证体量"成为客户最大的顾虑,路线图本身就是信任产品。
应用飞轮:具身大脑与实时视频是超算的新客户
两位外部讲者把这场架构升级拉回了需求侧。众擎机器人 CTO 李力耘描述的具身智能路线是"body for AI, AI for body":物理世界的 scaling law 围绕本体展开,机器人本体是 AI 触碰物理世界的媒介。众擎的 EngineAI Awaken 采用五层模型结构——从运动控制、运动大脑到负责决策规划的 System 3、群体协作与自我成长——反对用一个端到端大模型解决所有问题,“不能像汽车一样在二维平面里解决”。与众擎的合作案例是灵骏价值的最好注脚:基于真武 PPU 的千卡级训练集群支撑其云端大脑,实现小模型天级、大模型周级的迭代,团队参考的开源模型多达 57 个;众擎在郑州与深圳南山具备万台级年产能,已进入立讯苏州工厂做 pick-and-place 与巡检。
生数科技的张金涛带来的则是算力需求的另一极:实时视频生成。他的工作沿三层递进——SageAttention 用低比特量化把 attention 算子最高加速 5 倍(GitHub 约 3800 star,据他称几乎所有多模态公司都在用,阿里在 PPU 上适配后从英伟达迁移拿到了同等收益);稀疏注意力再把计算节省推到 20 倍,两者正交叠加实现 attention 70 倍加速;TurboDiffusion 框架端到端加速 100 到 200 倍,去年就在消费级单卡上实现 2 秒生成 5 秒视频。9 月中发布的 Vidu S2 支持 720P 以上实时生成与实时参考图交互,他把需求逻辑推到极致:人类的视觉享受分离线与实时交互两支,实时交互每人有独立会话,需求量远大于离线,“未来一定有一家实时视频生成公司的市值超过 OpenAI 加 Anthropic 之和”——这是讲者的自我判断,听众不妨记住这个逻辑及其利益立场。
论坛的最后一块拼图是安全。李成林(灵骏团队)指出 agent 请求携带长上下文、私有知识与记忆,而传统 MaaS 架构里 HTTPS 只保护到网关,之后明文在推理节点流转。机密推理用 CPU 的 TDX 与 GPU 的 CC 特性构建可信执行环境,数据以密文穿透全链路,明文只存在于客户端与可验证的 TEE 内。代价是 RDMA 与 GDR 不可用,跨节点通信从高带宽降到 TCP,团队靠 int8 量化传输(数据量减半以上)、context 并行、多流通道等手段,把 1M 上下文的输入吞吐做到接近翻倍,最终把机密推理性能恢复到生产可用水准。
这场升级意味着什么
把 13 位讲者的内容合起来看,一条清晰的传导链浮现出来:agent 负载的三个结构特征——长事务、串行工具调用、输入输出严重失衡——使得推理算力在端到端成本里的占比被稀释,于是基础设施的竞争重心从算力规格转向控制面软件与状态管理能力;而国产算力第一次用生产化数据证明了自己能承接这种负载,云端训练与推理的分工(众擎的端侧本能加云端大脑)又把新的、更长的算力需求拉了进来。
几条可以带走的判断链:其一,成本标尺之变——工具执行占比 35% 到 61%、推理占比可低至 10% 到 15%,意味着只优化 GPU 性格比的做法边际收益递减,云厂商获得"任务账单"的定价权,读者采购算力或评估 infra 时应看单位成功任务成本而非 token 单价;观察指标是王超提出的"任务提交到首次有效外部动作时间"能否成为行业标准。其二,异构解耦的条件之变——PD 分离与专用芯片组合在静态测算里都成立,但动态 SLO 下碎片与 KV 迁移成本可能吃掉全部收益(丢一块盘等于三小时重算), RuntimeKit 式的统一资源抽象和拓扑感知调度因此成为必需;下一步看 KV Cache 命中率、单字节迁移成本是否进入产品级监控。其三,国产替代的信任之变——40 天百家客户、三天决策、一小时部署构成新的信任基础,但爆炸半径扩大四倍使稳定性体系(备机替换、健康分、28 状态状态机、整柜巡检)成为真正的商业化门槛;观察指标是备机替换成功率能否长期维持、2028 年 1024 卡 scale up 域是否兑现。其四,需求侧的飞轮——具身智能与实时视频生成把 scaling law 拉进物理世界与交互时长,云厂商从卖卡变成卖训推一体闭环;众擎"一周适配新芯片"的要求会是衡量 infra 敏捷度的标尺。
也有理由保持审慎。杨延超的成本领先是厂商口径的线上测试;张金涛的市值预测是讲者为自家方向背书;王超自己反复承认这套架构"今天只是认知和理想,并没有都做出来",跨长传 PD 分离等原子能力还在验证闭环阶段。万佳那句总结或许是全场最诚实的注脚:超级计算机的竞争是全系统协同设计的竞争,“不是绝对的最大最强,是面向业务的最优”。这场论坛展示的,正是中国的 AI 基础设施第一次系统地、而非单点地,按 agent 的形状重新设计自己。