先说结论

这场专场(9月23日,国博一期1F-102A)围绕开场那句话展开:「当AI从能对话走向能行动,存储正从AI基础设施的后台,变成决定业务成功的关键路径」——现场主持原话,与官方议程简介口径互为印证。阿里云吴贻刚把它翻译成一条递进链:存储先做数据基础设施(语料大吞吐、低成本),再做训练资产(Checkpoint、断点续训,「存储时延每减少一秒都在为GPU加速」),最后做推理状态层(KV Cache溢出显存后成为「下一代存储的主角」,嘉宾说法),Agent再把要求推高一档——海量在线、有状态、要记忆、要秒级唤醒、要可审计回放。让这场论坛区别于产品发布会的,是五组客户与架构师的一线细节:穹彻智能十四万人时众包数据的上行之路、卓驭科技千亿文件纳管的统一元数据层、小鹏30PB多模态数据湖的20倍读吞吐、美图单桶优化50%容量的治理账本、智创星云「沙箱负责随时重来,文件系统负责从不丢失」的执行底座。贯穿五场景的同一机制是:数据被组织的粒度(帧、Topic、清单、语义索引)决定了AI迭代的速度,存储正从被动容器变成供给与调度的参与者(写作者归纳)。

(说明:本文基于该场回放本地转写(68段,0-8045s)全文整理,讲者与讲题经官方议程页核验。转写存在系统性同音词误识——「具身智能」全程误作「巨深智能」、「穹彻智能」误作「琼澈智能」,按字面检索会误判第②场缺失;经全文复读确认该段完整存在于480-2160秒区间,本文据实覆盖。人名产品名已按议程及外部资料校正:吴一刚→吴贻刚、张肖娜→张哓娜、徐小建→徐小健、张建南→张健楠、陈俊彪→陈俊标、张月→张越、李斌→李彬、卓翼→卓驭、卢策武→卢策吾、Lens/Lambda→Lance、AI Webflow→AI VibeFlow、FCF 30box→FC Agent Sandbox、Open Cloud→OpenClaw、Memory零→Mem0。本文与同届「Agent Native数据基础设施」发布场是两场不同论坛。)

具身智能:一年477.78%的数据洪流,和十万人时背后的IO粒度革命

官方议程简介给这一段定了性:「具身智能迈入数据规模化元年」(议程简介原文)。阿里云张哓娜先给宏观刻度:国家数据局《全国数据资源调查报告(2025年)》显示,2025年具身智能领域数据生产量增速达477.78%(嘉宾引用;经核验国家数据局官网原文一致,与低空经济的75%并列新兴领域最快)。繁荣的另一面是缺口:她判断智能涌现需要千万级甚至亿级有效数据,而全球高质量真实数据集仅数十万到百万小时(嘉宾判断)。破局两条路:采集真实数据加世界模型——她引用英伟达Cosmos(转写作「Cosmos Three」,版本名存疑)称其可将物理AI评估训练周期从数月缩到数天(嘉宾引用)。

穹彻智能AI Infra总监徐小健的实践把这个数字落到地面。穹彻2023年成立于上海,创始人是上海交大人工智能学院副院长卢策吾教授(嘉宾自称职务;公司及获阿里巴巴投资经官网核验),模型与本体同时推进,2026年8月刚发布公司首个具身大模型(嘉宾说法;经核验穹彻确于8月底发布具身世界模型Noe-0,转写中的「六零」疑即Noe-0,写作者推断)。半年来他们采集了9.7万小时「无本体」数据,截至分享前一日已约14万小时——关键在完全众包:数据源遍布全国18省47市,峰值两千多个家庭场景同时采集(嘉宾口径)。他梳理的行业数据形态变迁本身就是路线图:实验室遥操数据→集中式数据采集工厂(口语「素材厂」)→今年上半年行业集体转向的新形态(转写作「五米」,疑为术语误识;结合「无本体第一人称数据」语境,写作者推断指无本体/可穿戴采集)→最近的ego第一人称数据——方向始终是单位小时成本更低、规模更大。

众包路线给存储出了三道题。第一道是上行:与素材厂集中上传不同,两千个C端终端复用各自家庭带宽分布式上行,上半年日均约10TB、峰值约五倍(嘉宾口径);北方城市家庭带宽不足、网络质量差的坑,反过来成了挑选数据供应商的维度。第二道信息量最大:算法高频变更导致历史数据反复回灌。端侧数据是Rosbag/MCAP(机器人领域常用二进制录制格式)整包文件,单Episode原始600-800MB、云端预处理后膨胀到2-3GB;每加一个维度、做一次质检都要整包下载改一点再传回,买来的CPU「大量在等IO空转」(嘉宾描述)。他们从8月起把上云数据按Topic拆分成支持帧级随机读写的格式(转写作「转成Nest」,格式名疑为误识、未核验):新增质检项只读某一帧或某段视频,回灌带宽从GB级降到KB级,任务吞吐「比之前不止一个数量级」(嘉宾口径)。他们还在基于OSS Table Bucket与Vector Bucket推动湖仓一体——他判断这是行业趋势之一。第三道是算力漂移:「卡荒」后排到的GPU不在同一区域甚至不在同一朵云,云企业网稳定性不佳,最终自建跨区同步链路(CPFS→OSS→跨区域复制→对端OSS→数据流动→对端CPFS),checkpoint同步小时级、几十TB数据集天级(嘉宾口径),由此他判断「算力与数据解耦」将长期是常态。

张哓娜对应的阿里云方案是三种Bucket加一个训练加速器:OSS Object Bucket主打TB级带宽与跨区域复制;Vector Bucket按量付费把向量检索成本降95%、单账号万亿行向量(嘉宾口径;向量Bucket今年已商业化,经核验);Table Bucket面向数据湖、TPS较自建提升十倍(嘉宾口径)。标注环节推出一站式托管服务(转写作「OSS Web Studio」,名称待核):一个请求在存储API内闭环预处理-推理-回写,调度优先走低成本Batch通道、失败自动切实时通道。训练端CPFS四把斧:与OSS间100GB数据流动带宽加即将上线的Lazy Load(无需全量搬迁即可开训);新一代自研架构单客户端吞吐40GB/s、4KB随机读100万IOPS(嘉宾口径;40GB/s与阿里云2025年10月公开发布一致);VPC弹性访问共享算力数据;冷热分层生命周期。她以「集采存、集传集标、集喂集算」收束,题眼是最后一句:「模型定义了起点,但数据定义了终局——谁先把数据飞轮转起来,谁就先拿到具身通用机器人的入场券」(嘉宾表述)。

这一段的链条:机制——众包采集加算法高频回灌,让整包二进制「包」级的最小可寻址单元成为瓶颈;按Topic/帧拆分后最小单元变成「帧」。二阶影响——数据管线与算法迭代解耦,改质检规则不再触发10PB级全量下行,数据规模才能以年增477.78%扩张而管线不崩。启发——评估AI数据管线先看最小可寻址单元是包、文件、Topic还是帧,它决定每次算法变更的边际成本,也决定数据飞轮转多快。

智驾数据闭环:稳、快、省的工程学,和一套「统一层」的答案

阿里云张健楠开场即点出智驾与具身的同构性:自动驾驶讲了两年数据闭环——车端采集上云、云上处理训练、模型蒸馏回车端——飞轮越快,模型发现解决问题的速度越快。两条增长曲线撑起紧迫感:城市NOA(领航辅助驾驶)车型销量从2023年40万辆涨到2025年260万辆,两年6.5倍;训练clips从2022年百万级涨到2025年EB级(均为嘉宾口径)。三个真实生产问题对应三个目标。稳:产线任务半年翻三倍,处理、标注、重刷、回灌共用一个OSS资源池,重刷「一下子起上万个Pod,瞬间把资源池吞吐炸满」,敏感的人工标注就慢卡甚至不可用——方案是资源池三步走:产线桶入池设总配额、按桶隔离(raw data、prod、dataset)、再按请求者维度给核心业务保底带宽——「不是为了限制某个业务,而是让突发业务变得更可控」。快:日产clips动辄PB级,默认100G带宽要传一天以上;方案是serverless化数据流动——目录和清单、断点续传、OpenAPI接入编排自动触发迁移;单集群聚合吞吐最高100GB/s,PB级交付从天级到小时级(嘉宾口径)。省:PB级目录多数据集混存,「哪些目录增长异常、多久没访问」看不清就无从治理;方案是元数据洞察加生命周期分层——容量异常发现从天级降到分钟级,训练热点留热层、长期不访问数据自动降入低频层且业务脚本零改动,低频层较标准层每GB每月省至少80%(嘉宾口径),另有冷转热自动策略兼顾多轮epoch复读。

卓驭科技存储架构师陈俊标给出甲方视角的系统级答案。卓驭定位「移动AI」,业务覆盖乘用车、商用车、Robotaxi及泛机器人,已携手35家核心客户量产50多款车型、定点130款(嘉宾口径;经核验,卓驭2026年4月发布业界首个原生多模态基础模型,其智算中心正搭建在阿里云上,与分享互洽)。他的实话是:物理AI平时谈的是算力,「但真正跑起来之后,每天面对的是数据怎么存、怎么在流程之间流动、怎么把成本降下来」。卓驭的三个系统级问题都来自部署形态:数据、生产、模型分在不同地域,云上与IDC(自建机房)存储长期并存、跨地域一致性靠人工对齐;性能与成本天然冲突(全放高性能存储太贵、全放对象存储撑不起带宽);介质分散多集群而单集群有上限。结论是「没有哪一种存储产品能把这些全解决掉」,解法是在存储引擎之上构建统一层:业务统一走存储SDK;MetaHub作为全量元数据中心把云上云下三层池化存储统一成一个命名空间,「数据在哪里、用哪个版本、谁能访问」都由它回答,已纳管千亿级文件(嘉宾口径);存储按热度分热(自建分布式缓存,纳管CPFS)、温(云上OSS加IDC对象存储)、冷(归档)三层,靠MetaHub冷热分析驱动自动沉降,整体存储成本降30%以上(嘉宾口径;转写中缓存层带宽数字疑错位,未采用)。数据生产「两端走对象存储、中间多轮读写走高性能缓存」,多类高性能介质由统一纳管组件提供负载均衡、扩容、熔断与混合云协同(转写作「StoreMatch」,内部组件名未核验);训练场景则全量湖放对象存储、训前预加载进CPFS高性能层、冷数据自动沉降且路径不变;成本治理的关键一句:分层只回答「哪些数据该沉降」,基于MetaHub的访问、版本与归属记录用EMR离线分析找出冗余过期版本再下发策略,「成本治理就从拍脑袋变成了基于元数据有依据的闭环」。

这一段的链条:机制——量产规模扩张与EB级clips把数据产线从「够用」推到「互相踩踏」;二阶影响——存储竞争力从单点性能转向治理结构(配额隔离、清单化流动、元数据分层),性能可以买到而秩序必须设计;启发——判断数据闭环健康度,看的不是峰值吞吐而是「最坏邻居」出现时核心业务的退让幅度。

多模态数据湖与治理:让GPU不再等数据,让沉睡数据重获身份

阿里云邢志伟的比喻人人能懂:GPU已启动、任务已提交,算力等待的「不是模型算法,也不是电力,而是第一批训练数据——发动机已经轰鸣,燃料却没给到」。传统数据湖四个制约:格式(Iceberg等标量湖表善于结构化表,而AI样本是视频-点云-标签-向量的多元关系,散在不同系统成孤岛)、距离(对象存储便宜但训练是小IO随机读、低时延)、链路(查询检索取数经过多套系统,任何阻塞都让GPU等数据)、成本(全量预热让冷数据占贵介质不可持续)。答案是「OSS为底座、Lance加OSS加速器」:Lance(转写作Lens/Lambda,面向多模态机器学习的开放表格式,写作者注)把标量、多模态对象、向量、版本与索引统一组织成Dataset,训练框架Sampler/DataLoader的随机采样、条件过滤、版本回溯请求被它转成扫描与读取计划按需取数——「先基于标签过滤,再根据向量找相似数据源,有的放矢,而不是在对象目录里盲扫」;OSS加速器把缓存放到服务端,「长在OSS里而不是外挂」——与OSS同源、共享命名空间与元数据、感知数据变化保障一致性,只需切换专属加速域名、无需全量预热,支持Block级缓存与Range Get片段读。范式变化被他一句话说破:过去是先搬一堆数据再寻找样本,现在是先明确样本和版本、再按需供给相关数据(嘉宾表述)。

小鹏集团基础平台部资深技术专家黄搏培把这个方案放到30PB体量上。他先讲算法工程师的痛:处理corner case要去多个系统检索,「不再专注算法怎么弄,而是要想我要怎么去找数据」。小鹏多模态数据湖已突破30PB,容量只是表象,形态、访问方式、版本都在持续变化。三个挑战:数据孤岛(视频、标签、元数据、向量各在各的系统)、供给瓶颈(高QPS小IO检索与高带宽读取必须分开供给)、版本与模型难匹配(出问题难回溯数据版本)。新链路下:统一入口按标签、时间、道路类型做标量查询,再向量检索按语义相似度找corner case,Lance做合并过滤与索引定位,适配层分片、批量读取加Range Get汇聚直送GPU;高QPS小IO查询专供元数据索引与样本定位,高带宽链路专供文件读取;OSS加速器作全闪缓存承接热点——与OSS同源共享namespace,版本变动「第一时间感知」,未命中回源OSS「不会有丢数据的风险」;Ray负责任务编排。阶段成果(特定场景对标,嘉宾口径):30PB统一管理查询,读吞吐提升20倍,样本检索效率提升10倍——「算法工程师不再需要兼职做数据工程师」。

阿里云张越和美图李彬把镜头从「供得快」转向「管得清」。张越引用IDC数据:2025年全球企业平均每秒产生约6.9PB数据,2029年将达17.1PB(嘉宾引用,未独立核验),并指出三个变化——量级跃迁(单训练集从TB到PB、总量到EB)、价值密度分化(驱动决策的热数据只占冰山一角,大部分数据很快「沉睡」,业务仍在付费)、资产价值需重估(冷数据随时可能被AI激活为训练数据)。客户痛点是互为因果的「三个看不见」:看不见明细、说不清价值、不敢动手治理。解法是两条重构链:「数据重构」(Storage for AI)用OSS AI VibeFlow(转写作AI Webflow,经阿里云文档核验)创建DataPipeline,调千问大模型把非结构化数据embedding成向量写入Vector Bucket,源端增删改自动同步,支撑语义检索与RAG知识库;「元数据重构」(AI enabled Storage)用OSS元数据清单周期导出对象tag、CRC64、大小类型,OSS AI Agent用自然语言就能问「bucket A近90天哪些prefix没被频繁访问」,文件存储一侧把元数据录入Table Store宽表——线上已支撑亿到百亿级元数据(嘉宾口径),收敛为看得清、算得准、省得下。

李彬的分享是这套范式在美图的落地账本。美图2025年全系产品用户使用AI比例达90%、全年AI生成图片视频超55亿(嘉宾口径)。作为SRE他面对三个老问题的新形态:多业务共享存储互相挤兑、成本不透明(「领导让我优化这个桶,我两眼一摸黑」)、研发把更高权限交给Agent后误删明显变多。实践路径:智算CPFS按业务划目录用fileset设配额,元数据导入Table Store分析出30天、60天未访问的数据交业务方优化;容量接近阈值自动联动告警与工单平台创建扩容工单,工作日双审批、夜间免审优先保稳定;对象存储治理从「桶清单导出加自建平台二次消费」升级为OSS Agent对话级分析(存储分类、目录涨跌幅、AI优化建议);数据安全用CPFS到OSS数据流动定期备份加对象版本控制兜底误删,K8s原生Network Policy构建「安全区」限制训练任务出入流量。收益(嘉宾口径):分析某核心桶发现一个团队目录被历史数据大量占用,交还业务方后优化50%容量、一个月省二十多万元。他最后的总结超出存储本身:AIGC爆发时运维没有先例可抄,「有了AI的赋能可以低成本补课——快速实现之前想做没做成的想法,走错了还能推倒重来」;「AI帮我们补上了之前没来得及修的课,把运维从『人工』(打引号的)推向真正的智能化」。

两条链条在此同时成立。其一(供给侧):机制——多模态训练样本是多元关系而非单文件,「先搬后筛」让冷数据占贵介质、热数据排队等;Lance统一组织加同源缓存按需供给,把样本到GPU之间的系统数压到最少;二阶影响——读吞吐20倍、检索效率10倍(小鹏口径)不是单点缓存改进,而是无效IO被语义索引整体消除的结果;启发——评估数据湖要问:一个样本从被选中到投喂GPU要经过几套系统、几次全量扫描?其二(治理侧):机制——价值密度分化使「敢不敢删」成为最大的成本杠杆,而敢删的前提是元数据可算;二阶影响——治理从周期性人工动作变成有据可依的闭环,沉睡数据「重新获得身份」,运维缺口也被AI低成本补课(李彬的观察);启发——治理投资顺序应先是可见性(元数据)、再自动化(策略)、最后介质降配,反过来做省不了钱只会制造事故。

Agent的存储底座:Session与Memory分家,沙箱负责重来、文件系统负责不丢

压轴的阿里云王太平把话题从训练数据推向在线智能体。他的判断承接全场:开放模型与顶尖闭源模型的差距从两年前的一年以上缩到半个月到一个月(嘉宾判断),智能人人可得,Agent竞争力随之从模型移到运行时框架——他口中的Harness,六个关键能力里上下文、沙箱、记忆、持久化四个与存储强相关。Agent的工作负载与互联网后端完全不同:启动由自主触发而非人触发,动态性极强(一个任务可能起十个只活一分钟的sub-agent即毁);规模从「几千台机器的集群」变成「每用户一个算力单元」——他举例今年OpenClaw(转写作Open Cloud,经核验为2026年初爆火的开源个人Agent)爆火后的托管场景,「几百万个用户就有几百万个Pod」;安全成为半年来全行业的困扰;而跳出单次任务,关于身份、状态、记忆的数据会形成独立的存储类型。由此他给出本场最重要的概念切分:左边是Session存储,承载沙箱内通过路径寻址的工作数据;右边是Memory记忆存储,跨Session甚至跨任务、以语义寻址的身份与经验。一个有状态的Agent经历启动(拉镜像、写时复制、组装上下文)、运行、休眠(销毁算力但保留存储——「你干一件事停一会儿,大概率要回来改」)、深度休眠(归档冷层)、下次唤醒(重新组装身份状态)。他的结论:「Agent时代难的一定不是存,而是能不能正确地、简单地、在海量场景下把业务快速拉起和恢复——存储介入了Agent生命周期的编排」。

落到产品:块存储的Agent Disk Pool把云盘组成共享池——性能资源池化解决「有的Agent忙到需要几十倍性能、有的几天没有一个QPS」的忙闲不均,多镜像合并省下重复拉盘的成本;共享存储的多租户隔离被AI放大了风险——「AI把黑客手段平权化了,几句话就能把别的Agent的数据捞出来」——所以每个用户要有独立挂载点,NAS走向亿级挂载点(转写作「一级」,写作者推断为亿级)、对象存储提供百亿级规模(嘉宾口径);他还以立场性表述称阿里云Agent存储方案「是全球最全面的,远远领先于AWS或者GCP」(嘉宾立场)。记忆一侧,阿里云以Table Store为共同底座同时提供知识存储与记忆存储接口,并在其上提供Agent Memory SDK——「存储一般只管存,压缩读取你自己发起;我们把记忆的抽取、长期留存、沉淀全部帮你做完」,且是Mem0(转写作「Memory零」,经核验Mem0为目前被广泛采用的开源Agent记忆层)标准SDK,OpenClaw与自研场景均可适配。他刻意不念PPT单点指标:「单一Agent召回率再高意义不大」——要解决的是亿级用户大规模并行下的准确率、响应与稳定性,「让Agent平台构建更平权、普惠,云厂商的核心竞争力不是AI,是使能AI」。前瞻判断有三:Agent与存储交互的不再是数据而是token,存储要更懂语义才能省成本(把skill放进存储以减小上下文窗口);记忆正变成一级存储产品,「能否提供超大规模生产级记忆服务平台是关键竞争力」;身份治理从启动一次性赋权走向每步数据路径上的单次权限管控、策略溯源与权限遗忘。他还有一个反直觉收尾:存储反而成了瓶颈——Agent对POSIX兼容性要求极高,因为训练语料大量来自互联网运维文档和GitHub程序;「未来的存储保存的不再是数据,而是Agent平台的稳定性和连续性」。

深圳智创星云AI架构师李伟给出这个底座最生动的用例。这家跨境电商AI公司slogan是「让生意,自己跑起来」(经官网核验一字不差),目标是搭一个运营「大脑」全链路驱动各环节、极少人工介入。架构三层:基座、能力层(把企业SOP、工作流、skill与知识体系落到存储——即Harness)、智能层(数字员工加大脑调度协作)。他们的关键组织决策:中心化便于治理共享,去中心化(OpenClaw式)让个体能力最大化但数据隔离散落——最终「能力、数据、组织结构中心化,执行环境个性化」。三个卡点很有代表性:人是流程中枢(注意力有限、交互丢信息)、知识沉淀在老员工脑中AI读不到、原有系统为人设计没给AI准备好上下文与调用权限。上云后对存储提四个要求:隔离(项目级或用户级)、治理(数字员工入职配发、离职释放)、性能(瞬间拉起大规模时存储跟得上)、持久——他对「持久」的解释全场最好懂:「人可以离职,工位不能离职,工位还是会传承下来」。执行底座三阶段演进:最早自建Docker(计算)加VMware(存储),线上化要海量存储弹性、运维要求太高;2026年6月改用阿里云FC Agent Sandbox(函数计算云沙箱,转写作「FCF 30box」,产品经核验)配NAS,但NAS在海量小文件读写上有瓶颈;现在过渡到阿里云刚上线的Agent FS方案,「起码在文件的海量读写上表现很好」——他们自建控制面让业务三阶段无缝切换。两个设计值得记录:一是通用协议(转写作「AI specific」),把OSS、本地端、服务端的文件统一封装成「一切皆文件」的路径,解决「AI很难判断什么时候该用哪个端的文件」;二是三种沙箱形态——临时沙箱用完即毁(承接工具调用与临时代码执行)、持久沙箱按需唤醒(「人下班了就可以释放」)、常驻沙箱(允许用户部署自有服务上平台)——存储按身份隔离挂载进沙箱,沙箱可释放,上下文与项目文件由存储承接。他那句话适合作为整个Agent存储议题的总结:「沙箱负责随时重来,文件系统负责从不丢失」。他的展望是Agent OS只是中间态,未来每个应用、每个人、每个任务会有一个代表它的环境——「Agent OS不一定是一个文件系统,更多的是一个上下文系统、工作区」。

尾声:五场景合起来看什么

把五个场景叠回去看,存储的新角色其实只有三件事:把数据组织的粒度做细(帧、Topic、清单、语义索引),把供给范式从批量搬运改成按需直达,把「连续性」本身当作要保存的对象(Agent的状态、记忆与身份)。吴贻刚开场那个比喻因此比听起来更准确——AI是超级引擎,存储是燃料系统:燃料系统的职责不是存油,而是「根据算力的节拍提供燃料,理解内容的语义,把自己的状态反馈给算力,引导算力走向更经济、更大吞吐的地方」(嘉宾表述)。观察清单:一看记忆与Agent文件系统何时从「方案」变成「产品」(Table Store Agent Memory SDK、Agent FS、Agent Disk Pool的成熟度);二看开放格式与云厂商桶类型的竞合(Lance、LeRobot对多模态湖格式的定义权之争,参考穹彻推动的湖仓一体);三看推理占比继续抬升后KV Cache分层与token级语义存储的落地速度。风险同样要记下:本场所有效果数字(477.78%除外,其为国家数据局官方口径)均为厂商与客户自报,未经第三方审计;而Agent把「黑客手段平权化」的安全命题,才刚刚开始被存储层回答(写作者注)。