先说结论
9 月 22 日下午这场"AI Native 数据基础设施论坛",是云栖 2026 里最"硬"的一场:三个小时、六场发布、七位客户与研发讲者,全部围绕一个矛盾展开——GPU 越来越贵、越来越大(万卡集群已属平常,讲者称已有百万卡建设规划在路上),但训练和推理真正的损耗,越来越多发生在 GPU 等 CPU、等网络、等数据的那一刻。存储产品线负责人蒋江伟的开场判断很直白:过去三年的数据产量几乎超过人类历史总和,而最大的增量不是基模训练,是自动驾驶与物理世界感知(演讲自报)。产品负责人彭亚雄补上外部坐标:IDC 预计 2026 年 AI 基础设施支出增长约 56%(据 IDC 预测,2026 年约 4870 亿—4970 亿美元、同比增 53%—56%,口径随发布版本略有差异),Google 官方披露其平台月处理 token 一年内增长 7 倍(从 480 万亿到超过 3.2 千万亿,Google 官方账号 2026 年 5 月)。阿里云的回答是三件产品:全栈自研 CPFS 商业化、KVCacheStore 全球公共云首发、OSS 与 EBS 面向 AI 原生全面翻新。本文按时间轴完整复盘全场,机制链条展开写,关键主张标注来源层级,厂商自报数字未经第三方核验的均已注明。
一、图景:存储从"配套工程"被推上"主战场"
整场论坛的叙事起点是一个反常识判断。蒋江伟(阿里云高级研发副总裁、存储产品线负责人)认为,数据大爆发并非基模训练驱动——训练集没那么大——真正的引擎是自动驾驶和具身智能对物理世界的持续感知:温度、坐标、轻重,到目的地只是过程,完成任务才产生数据(演讲自报)。这个判断随后被三位讲者从不同侧面加固:罗明(OSS 高级产品专家)引用的一组背景数据里,Waymo 已覆盖美国 10 个城市、每周约 50 万单(据 TechCrunch 2026 年 3 月报道交叉确认),英伟达训练 Cosmos 世界模型用了 2000 万小时视频、切成约 1 亿个片段、生成 8 亿条描述(据 Cosmos 论文 arXiv:2501.03575 核实,2000 万小时与 1 亿片段为论文原文口径)。
数据形态变了,存储的考核指标也变了。彭亚雄给出的结构是三段:训练侧要在万卡到十万卡规模下加速 checkpoint 读写、缩短训练回退;推理侧要让每个 token 更便宜;Agent 侧要提供海量多租安全隔离的工作空间,让长上下文沉淀成记忆(演讲自报)。这三个月前发布的框架,对应本次三款产品:CPFS 管训练、KVCacheStore 管推理、AgentFS 管智能体。CPFS 的核心数字:单文件系统上限 100PB——彭亚雄称相比三年前提升 17 倍(以 6PB 为基数);若按上一代约 20PB 计则是 5 倍(据每日经济新闻、第一财经 2026 年 9 月 22 日报道口径,“单文件系统规模提升 5 倍至 100PiB”,两个口径基数不同,本文并存)。吞吐从 20TB 级提到百 TB 级(约 5 倍),元数据性能提升 10 倍(演讲自报,媒体通稿确认百 TB/s 级吞吐与亿级 IOPS)。9 月 30 日起在北京、乌兰察布、新加坡三地域正式开售。
第一条机制链在此成立:物理世界数据(音视频、感知流)爆发 → 单实例 20PB 的文件系统上限迫使客户反复拆分、全量预热 → 统一大平面(100PB 单命名空间)+ 按需加载(lazy-load)把数据管理成本从用户侧转移给云厂商 → 二阶影响:智驾、芯片等数据密集行业可以裁掉自建存储运维、把精力还给模型 → 读者启发:评估 AI 存储时先看"单平面规模与数据流动方式",裸吞吐反而是第二位指标。
二、训练侧:先消灭"拆文件系统",再消灭"训练回退"
两位客户的讲述把 CPFS 的卖点落到了具体痛点上。小鹏集团基础平台部总监乔肖桉(转写"乔肖安",按议程校正)说,小鹏 OSS 数据量已达数百至上千 PB(演讲自报),旧架构下单实例约 20PB、百亿文件,到上限只能拆文件系统——而每拆一次,挂载、权限、容量规划全要重来;Kubernetes 管理下每个集群要重复挂载所有文件系统,同一个训练集从计算侧看是完整的、从存储侧看却散在多个实例的多个目录里,底层复杂度全部透传给业务。新一代 CPFS 的单命名空间支撑"百亿级容量与万亿级文件"后,训练样本和模型产出放进一个文件平面;再叠加 lazy-load 与 range cache(按需拉取、只缓存训练需要的片段),不再做全量 warm-up——第一个 epoch 慢,后续 epoch 复用缓存,训练启动更快、无效 IO 更少、磁盘利用率更高(乔肖桉演讲自报)。黑芝麻智能产品部高级总监沈杰从芯片公司视角给出同一结论:研发上千人、算法/模型/工具链团队之间数据来回倒,“数据孤岛"是真实痛苦;切换后读吞吐提升约 2.5 倍,端到端核心训练任务提升约 80%(演讲自报;阿里云徐立给出的案例口径为读带宽近 2.5 倍、写带宽近 50%、核心训练任务 80%,双方一致)。沈杰还留下一个行业判断:具身智能的世界模型尚未收敛,他预计"明后年出现具身的 GPT 时刻”,而芯片周期长,必须等市场稍收敛再进入(嘉宾观点)。
技术负责人徐立的 Deep Dive 解释了这些数字从哪来。AI 时代并行文件系统面临三重新挑战:混合负载(训练与数据处理并发、预训练与后训练同步)、成本精细化(数周前的 checkpoint 应沉到廉价介质)、以及稳定性(慢 IO 与训练超时的关联定位、全链路 CRC 校验、控制故障爆炸半径)。他的答案是三个关键词——文件的接口(POSIX 便捷性)、对象的扩展(容量与计算节点数)、快存储的延时(万卡写 checkpoint 时低延时才保 GPU 利用率)——底座则是飞天盘古(据世界互联网大会 2021 年资料,盘古为飞天操作系统存储内核)、ArkDB 分布式索引、高性能存储访问通道与自研存储协议栈。徐立称阿里云存储"连续三年获得存储顶会 FAST 最佳论文奖"(演讲自报;据阿里云开发者社区与新浪财经 2026 年 3 月报道,准确口径为"过去四年内第三次"获 FAST 最佳论文,含 FAST'23 与 FAST'26,与上海交大等合作——按外部报道处理)。
全场上信息密度最高的 40 分钟,来自千问预训练 Infra 负责人袁满(转写"Tencent Foundry"应为 Token Foundry,“困训练"应为千问训练,均按议程与上下文校正)。他公布千问训练做到 ETTR(有效训练时间占比)大于 97%,且口径比标准 ETTR 更严(计入前若干步慢启动),全程不引入温备机/热备机——“稳定性是一个带成本约束的命题”。拆解剩余 3% 的损耗构成一张全景图:故障检测约 14%、资源调度约 22.3%、训练回退约 23%、训练拉起与启动约 40%(演讲自报)。三组优化分别应对:健康度感知的节点恢复(故障检测前移、健康节点原地恢复、只替换真正故障的 rank),把调度耗时从十分钟量级压到分钟级;多级检查点(每 40 步写高频检查点到本地/CPFS 临时文件、每 200 步写全局检查点确定性落 CPFS),平均写入时间从 150 秒降到 15 秒以下、故障后平均回退从 150 步降到 15 步,约一个数量级;流水并行感知的并行预热,单场景省 7 分钟。他反复强调前提:“这些方案都建立在同一个前提上——底层存储必须稳定可预期”,CPFS 的百 PB 容量、权限隔离、容量配额与数据洞察能力是整套体系的地基。第二条机制链由此成立:万卡级训练故障成为常态 → 整体重启代价不可接受 → 感知/调度/回退/启动四段分别工程化,存储稳定性成为约束条件 → 二阶影响:不带温备机的高可用成为训练成本优势,checkpoint 策略本身变成可优化对象 → 启发:大规模系统的可靠性不是运气,是分层工程治理的产物;看一家模型团队的功力,看它故障恢复的四段耗时分布比看峰值算力更有信息量。
三、推理侧:KVCacheStore——用 SSD 换显存的经济账
如果说 CPFS 解决"训练等数据”,KVCacheStore 解决的是"推理重复算"。产品专家李洋把需求侧变化归为四条:模型参数到万亿级奔向十万亿级、上下文从数万 token 增长到百万级、多轮对话要求会话跨算力节点灵活调度、公共前缀在业务请求中重复出现千万次(演讲自报)。这些共同指向一件事:算力无状态可以自由调度,但 KV Cache 的存放与读取需要跨节点共享——没有大规模可弹性扩展的 KV Cache 存储空间,昂贵的 GPU 就在重复计算上空转。KVCacheStore 定位于"G3.5 层":比 GPU 本地盘(G3)远、比传统共享存储(G4)近,存算分离、独立扩缩容,单实例可扩到千亿级 KV 数据;与算力亲和部署下做到单机 40GB 吞吐、Batch 接口百万级 QPS(演讲自报)。蒋江伟开场预告的实测口径:两个大客户缓存命中率提升约 20%、prefill 节点(转写"Proview/Prefer"按上下文校正为 prefill)GPU 节省接近 50%;彭亚雄口径为 TTFT 降 30%—50%、命中率提升 15%—20%、prefill 节点省 30%—50%(均为演讲自报)。据阿里云开发者社区 2026 年 8 月文章,KVCacheStore 与 CPFS、AgenticFS 同属阿里云存储该轮 AI 原生产品序列;“全球公共云首家发布同类产品"为厂商自报口径。
技术专家张小路拆了缓存流转链路:KV Cache 从 HBM 换到本地内存、换到本地 SSD(G3)、再换到 KVCacheStore 后端(G3.5),读取时按 key 判断所在层级,miss 即触发 GPU 重算——“如果读取速度比不上 GPU 重算,这个 KV Cache 帮助就比较小了”。所以读取链路全用硬件卸载(CIPU、BlueField-3 DPU,转写"ZIPU/BPF3"校正)打通,后端是为 KV Cache 场景定制优化的存储硬件 eBuff(转写疑似,产品名待核)。他特别点出 SSD 寿命问题:KV Cache 持续高吞吐写入,TLC/QLC NAND 的擦写周期有限,好的 SSD 引擎要把盘内写放大压下来,让 PE cycle 尽量全用在用户写入上——这预示着推理存储的竞争会下沉到介质寿命工程。
首位客户月之暗面(Kimi)研究员陈柏盛的分享是全场最好的"第三方背书”。Kimi 在 K1/K2 阶段开源了 Mooncake(GitHub kvcache-ai/Mooncake 核实为活跃开源项目,定位 Kimi 的 serving platform),核心是"以存换算"+ PD 分离:以 KV Cache 为中心的调度、零拷贝 RDMA 传输引擎、把集群闲置内存组成缓存池,线上请求吞吐提升 75%(演讲自报)。到 K3,上下文从 256K 涨到 1M(约 4 倍,Kimi 官网确认 K3 为 1M token 上下文、采用 Kimi Delta Attention 与注意力残差),模型架构层面 3:1 混合注意力让同长度上下文的 KV Cache 需求比 K2 降低 60%(演讲自报)。但多业务线(Kimi Chat/Code/Work 与 API 平台)加上会话缓存期望从小时级涨到天级,纯内存方案不够——于是与阿里云共创 KVCacheStore 的 G3 层(纳管训推混部集群的闲置 SSD:白天推理高峰、夜间训练高峰的潮汐流量),再定义 G3.5 弹性层补足三个短板:本地 SSD 容量固定、无本地盘集群不可用、算力机故障连带缓存丢失。实测收益:TTFT 降低 54%、吞吐提升 20%、缓存时间窗口扩大 9 倍(天级会话仍可命中,演讲自报)。第三条机制链:推理成本结构从"买卡"转向"存 KV" → SSD 池化替代显存/内存突破物理边界 → 命中率与 TTFT 改善直接换算成 GPU 节省 → 二阶影响:推理降本的竞争轴从单卡采购价移到缓存层级设计与存储介质工程 → 启发:做推理侧成本评估时,把"缓存命中率 × 重算单价"算进 TCO;上下文越长、多轮越深的产品,存储分层的价值越大。
四、数据底座:OSS 从对象到"全模态",表格桶把 dirty work 收进存储
罗明用英伟达 Cosmos 的数据引出结构性变化:训练世界模型/VLA 模型,除了视频图片这类对象数据,还需要标签、描述、版本这类表数据和语义检索用的向量数据——三种数据互相关联,甚至由对象数据衍生而来。OSS 的回应是"三种桶":对象桶之外,去年发布向量桶(OSS Vector Bucket,官方文档确认),今年发布表格桶(Table Bucket,阿里云官方帮助文档与官方博客确认,兼容开源 Iceberg 与 Lance 标准——转写"Lens"按产品事实校正为 Lance)。表格桶的核心卖点是"把 dirty work 下沉":小文件合并、孤儿文件清理、快照管理这些原来要拉 EMR 集群做的事迁到存储端,省计算资源、省计算到存储的带宽;实验室口径下并行写入性能是自建 Iceberg 表的 10 倍以上(演讲自报)。向量桶今年推出 Fusion Mode,检索延迟从数百毫秒降到数十毫秒、QPS 提升 10 倍、召回率最高 99%,让内容推荐、网盘、AI 助手这类高频检索也能跑在 OSS 上。配套的还有加速器(个位数毫秒延迟、可变数据块小至 128K)、资源池 QoS 升级(支持 QPS 精确流控)、生命周期 dry run、OSS Metadata(变更日志表分钟级、实时清单表小时级,Iceberg 格式输出可直接用 Spark/StarRocks 分析)、以及面向 Agent 的 A2A 能力与 skills(转写"A to A"按业界惯例校正为 Agent-to-Agent 协议,细节待核)。
两家手机与电子厂商的实践补上了用户视角。小米大数据计算平台高级研发工程师钟宇江的路径是"Hive/HDFS 存算耦合 → Iceberg 开放表格式 + OSS":一份数据服务批、流、OLAP 与 Python(Ray/PySpark),湖仓维护(快照清理、Data Clustering、列级加密的历史数据重写)做成自动服务;从 HDFS 迁到 OSS 后存储单价约降 80%,目前数十万张表、上百 PB(演讲自报)。多模态侧引入 Lance:相比 Iceberg/Parquet,Lance 支持按 Row ID 高效随机读、直接加列改列而不全量重写,图文交错数据集从"一堆 Parquet 加一堆图片"变成一张表。OPPO 大数据高级架构师付庆午的动机更直接:传统湖仓对多模态有数据孤岛、检索缺失、联合分析缺失、治理缺失四大问题,他们的方案是 Iceberg(结构化)+ Lance(多模态,集群化后比官方 benchmark 快 2—3 倍)+ Gravitino(转写"Graham Tino"校正)做统一元数据 + 自研分布式缓存(转写"Cohen",已贡献 CNCF 开源,名称待核)解决热读。全量数据湖已迁阿里云 OSS 两年多,数百 PB、每天百万级 Spark 任务,自建 HDFS 时代的两名专职运维转岗其他方向;公司已入湖约 11 亿张图片(转写"十一兆"疑为"十一亿",不确定),影像拼图、AI 图片搜索、多模态问答助理已上线(均为嘉宾自报)。第四条机制链:多模态训练要求对象/表/向量三种数据同源关联 → 存储平台长出表格桶与向量桶、维护工作下沉 → 客户侧湖仓从"多套系统来回导数据"变成"一份底座多引擎共享" → 二阶影响:数据平台的运维编制被释放,存储账单变成唯一显性成本,反过来倒逼存储侧做智能分层与 dry run 这类"成本确定性"功能 → 启发:选数据底座时,“维护是否下沉 + 一份数据能否多引擎共享"比单点性能更决定三年总成本。
五、EBS:从"一块盘"到"一个池”,延迟与吞吐的物理隔离
最后一场发布属于块存储。产品专家陶毅的成绩单:去年业内首家商业化的弹性临时盘(官方产品文档确认该产品存在;“首家与全行业跟随"为自报),一年规模增长 260%、近百家头部客户、数百 PB、覆盖 20 多个可用区(演讲自报)。他观察到的需求迁移与徐立呼应:自动驾驶数据预处理是线性流水线,99% 的作业完成却被几个长尾作业拖住——过去 EBS 讲 IOPS、吞吐、时延"快存储三大指标”,AI 时代客户更看重集群吞吐与任务并发度。新品 Disk Pool 把"一块盘的参数"变成"一批任务的池":池内盘容量自定义,每块盘都能拿到 4GB 读/2GB 写的弹性性能,跑完的作业把吞吐让给长尾作业。推理侧三件套:只读共享盘(一块盘挂 16 个节点、省 93% 成本,AutoPL 性能从 4GB 提到 6GB)、多快照创盘(一块盘分区装多个模型版本,换模型只改软链接)、跨可用区与一对多云盘克隆;配套快照锁定防篡改。他引用的客户案例:视频模型厂商生数科技(转写"深数科技"按行业事实校正为生数科技,不确定)模型更新加载从十分钟压到 15 秒(演讲自报)。
资深技术专家吴均平(转写"吴军平"按议程校正)的分享是全场最"体系结构"的一段。吞吐密度:新 EBOF 架构(转写疑似,具体形态待核)用双 DPU 互备,把网络放大系数从过去的 2 点几压到 1——“理论上所有物理带宽全部给用户用”,吞吐密度翻倍;再叠加"柔性压缩":计算端 QAT 加速卡压缩(转写称"GPU 的卡"按事实校正为加速卡),算力不足时把压缩迁移到后端 QAT,极端负载直接取消压缩,用户无感知——已压缩过的用户数据平均还能再压 25%,未压缩数据可压一半,等效吞吐再翻倍(线上数据,自报)。延迟:吞吐拉满后延迟怎么办?他的答案是全链路物理隔离——内核驱动区分"延迟敏感型 IO"与"吞吐型 IO"(他们为此申请了专利),Block Server 用两个线程池分别以 Pull 模式和 Pipeline 模式处理,网卡层面规划"大象流与老鼠流"两条路径(他的比喻:十车道高速路隔离出一条公交道),盘上再分两个池;结果是 90% 极限吞吐水位下,4K 写的五九延迟(99.999%)做到 3 毫秒以内(线上集群自报)。分发侧:只读共享盘后端可做到 100 块云盘共享一块实体盘,内存跨线程无锁读 + 64×64 宽条带让一块盘用上整个集群吞吐;快照批量创盘、副本自动扩展、盘到盘克隆(源盘可继续写,克隆具备崩溃一致性),极限场景单地域一分钟创建 60 万块盘(自报)。
把全场串起来:训练侧 CPFS 用"大平面 + 按需加载 + 稳定可预期的 checkpoint 底座"换训练效率,推理侧 KVCacheStore 用"SSD 池换显存"换 token 成本,数据侧 OSS 用"三种桶 + 维护下沉"换湖仓总成本,块侧 EBS 用"池化 + 物理隔离"换集群吞吐与长尾收敛——四件事是同一个故事:AI 把存储从"买容量"变成了"买有效算力时间"。观察这场发布接下来的走向,值得盯三个指标:9 月 30 日 CPFS 三地域开售后的实际客户迁移节奏(尤其智驾与具身公司放弃自建存储的比例)、KVCacheStore 在 Kimi 之外的第二批推理客户实测数据(TTFT 与命中率口径是否可复现)、以及 OSS 表格桶在 Iceberg/Lance 生态里的第三方采用量。对从业者更直接的一条启发来自袁满那页"损耗全景图:当各家都在晒峰值算力时,真正拉开差距的是故障检测、调度、回退、启动这四段"浪费"的占比——而它们中的三段,最终都压在存储的稳定性与可预期性上。
转写与核验说明:本文基于 2026 云栖大会"AI Native 数据基础设施论坛暨全栈自研 CPFS 商业化发布"官方回放的完整本地转写(10757 秒,全文覆盖无缺段,[0s] 至 [10757s])。人名按议程校正:乔肖桉(转写"乔肖安")、袁满、李洋(转写"李阳")、张小路(转写"张小璐")、陈柏盛(转写"陈百胜")、付庆午(转写"付庆武")、吴均平(转写"吴军平");术语按上下文校正:prefill(转写"Proview/Prefer")、Token Foundry(转写"Tencent Foundry")、千问(转写"困")、具身智能(转写"巨深/巨帧")、VLA(转写"V R V R A")、CIPU/BlueField-3(转写"ZIPU/BPF3")、Lance(转写"Lens")、RoCE RDMA/Solar RDMA(转写"Rocky 链 A/Solar 链 A")、AI Master(转写"AMR/A.Master",推断)、吴泳铭(转写"吴用明")、生数科技(转写"深数科技",不确定)、Blob 类型(转写"Bloom")、Apache Gravitino(转写"Graham Tino")。保留待核项:eBuff(KV Cache 后端硬件名)、EBOF(EBS 新架构名)、OPPO 开源缓存"Cohen"、Web Studio/Web Flow(OSS 数据处理服务名,疑为媒体处理产品线命名)、“十一兆图片"疑为十一亿、彭亚雄花名"空文”、具身 GPT 时刻为沈杰个人预测。经外部核验的关键主张:CPFS 发布与核心指标(每日经济新闻、第一财经 2026-09-22)、千问案例数字(第一财经同源通稿交叉)、FAST 最佳论文(阿里云开发者社区 2026-03,与演讲"连续三年"口径有差异,按"四年三次"处理)、Waymo 周订单与城市数(TechCrunch 2026-03)、Google token 处理量年增 7 倍(Google 官方 2026-05)、Cosmos 训练数据规模(arXiv:2501.03575)、Kimi K3 1M 上下文与 Delta Attention(Kimi 官网)、Mooncake 开源(GitHub)、OSS Table Bucket/Vector Bucket/弹性临时盘(阿里云官方文档)、IDC AI 基础设施支出增速(IDC 官方博客,53%—56% 口径并存)、黑芝麻 2024 年港股上市与华山/武当产品线(港交所与公开报道)。其余标注"演讲自报/嘉宾自报"的数字(如 260%、93%、54%、97% ETTR、60 万块盘/分钟等)未经第三方核验。