先说结论
9月23日国博一期 1F-102B 的「Agent Native 数据基础设施论坛」,是阿里云存储产品线罕见地以「矩阵」为单位做的整体发布:彭亚雄开场定调,随后 OSS Agent 宣布商业化、Agentic Bucket 百亿级隔离底座、AgenticFS 亿级工作空间、EBS 面向 Sandbox 的亚秒唤醒、MiniMax 客户证言、Tablestore Agentic Memory、云上数据保护、Agentic Drive 企业网盘,九个环节一气呵成。真正的题眼是开场那句话——「以访问主体之变为第一性原理」:当云上数据的读写者从人和应用变成 Agent,存储不再只是 AI 链路的后台组件,而要同时充当 Agent 的记忆载体、隔离边界和成本闸门。三位外部客户(ATIV、MiniMax、Matrees)的现场证词显示,这轮变化已经发生在生产环境,而不是 PPT 概念。需要区分的是:这场与另一场面向具身智能、智驾数据的存储论坛是两个场次,本场几乎不谈训练数据湖与吞吐,谈的全是「一个 Agent 一份空间、一份记忆」的工程学。
一、访问主体之变:三个数字把存储逼到墙角
彭亚雄的开场没有讲架构图,先讲了三个数字。第一个来自外部:他引 Cloudflare 的数据称,今年上半年已有约 50% 的流量来自 Agent 访问(嘉宾引述,转写原文如此)。第二个是内部数据:阿里云 EBS 之上每天新建的云盘,超过 70% 由 Agent 创建——据后一场 EBS 环节胡航丽的补充,半年前这个占比还小于 5%,起点是春节后某款 Agent 应用的爆火(转写作「龙虾」,写作者推断疑似指 OpenClaw,保留存疑);彭亚雄进而预测,明年云栖时这个比例可能到 99%(嘉宾预测)。第三个数字关于广度:他引 Kimi 从 K2 到 K3 的数据称,单个子任务最多可爆发 300 个 sub-agent 组成 swarm 并行工作,工作周期虽只有数小时,但并发广度是数量级的膨胀(嘉宾引述)。
他还给了两个方向性的案例。深度方向是转写作「Anton Rubik」的 Project Vend(写作者推断疑似指 Anthropic 的自动售货机实验,保留原文存疑):2025 年 7 月让一个 Agent 独立经营小型便利店一个月,自主决策库存、资金与订单,最终亏损——嘉宾用它说明,当 harness、记忆和工具能力补齐后,这类看似简单的长程经营任务未来可能真的不需要人类介入。广度方向就是上面 300 个 sub-agent 的 swarm。深度与广度叠加,压到存储上就是四件事:其一,并发洪峰——「人要睡觉,Agent 不睡觉」,量级从数千、数万到百万级并发,背后还有亿级常驻工作空间要求数据隔离与权限策略不混乱(嘉宾称);其二,生命周期从虚拟机的数天数年压缩到沙箱的分钟级,拉起、休眠、销毁的每个环节都在打数据面和管控面;其三,记忆——他举自动驾驶的例子,摄像头五秒前看到的障碍物,被遮挡后系统仍然记得,具身智能场景更甚;其四,数据保护——「当你把 Agent 的全部上下文干掉,它跟从零开始没有任何区别」(嘉宾原话大意)。
这里已经出现第一条完整链条:Agent 的并发规模与分钟级生命周期,使传统「按容量卖性能、按实例收管理费」的存储模型失效(机制)→ 厂商被迫把管控面重构成数据面、把性能做成池化(直接变化)→ 单个 Agent 的存储边际成本趋近于零,平台才敢把「秒级唤醒、分钟级回收」写成产品承诺(二阶影响)→ 对读者的启发是:评估任何 Agent 平台或自建方案时,别看容量单价,先问两个数——每个 Agent 的存储边际成本,和唤醒延迟的 P95。 本场后面每一个产品,几乎都是这条链条的一次落地。
二、隔离的救赎:从一个 Prefix 的妥协,到一个 Agent 一个桶
对象存储环节是本场信息密度最高的部分,产品负责人(议程为谢桂珍;转写中其自报名被识别为「邢代」,报幕公司名被识别为「千尚科技」,均按议程校正)与技术专家韦楠(转写作「韦南」)讲了 OSS Agent 从预发到正式商业化的跨越:2026 年 5 月预发,至今超 10 万用户使用,今天宣布支持 Agent-to-Agent 标准协议接入与多个 IM 端接入,新增大规模数据下钻分析与账单用量对话两大场景(嘉宾称)。这一点有官方文档可直接印证:阿里云帮助中心的 OSS Agent 页面写明其基于通义大模型,能力分智能运维与 Talk to Bucket 两类,且按风险分级管控——低危读操作直接执行、中危写操作需二次确认、删除类高危操作不交给 Agent 直接执行——与韦楠现场所说「不同风险等级的操作百分之百覆盖人工确认和风险预警」互相咬合(官方文档)。
Demo 与客户证词把「存储管理被重写」讲得很具体。谢桂珍演示了自然语言上传分类、失败任务经钉钉飞书即时通知、监控视频里「消失的杯子」多模态破案、一周近万元账单的下钻——97% 费用出在存储容量,根因是资源包的存储类型与地域不匹配(现场演示数据)。客户 ATIV(翁柔莹,议程为北京谦上科技,现场自报品牌 ATIV)是一家做「原生为 AI 服务的搜索引擎」的公司:千亿级索引库、每天数十亿条多模态数据更新、用搜索替代推理省 token 90% 以上(嘉宾称)。她的运维案例更有说服力:过去 OSS 出 403 错误要提工单,十几分钟到半小时才能解决;用 OSS Agent 后约 30 秒关联到请求特征,一分钟左右定位到 bucket policy 的权限条线并给出修复方案与影响范围,人工确认后自动执行变更,前后两三分钟闭环(嘉宾称)。而高风险操作如扩容、释放资源,仍会触发人工确认后才执行——隔离与效率的边界被明确画在「风险等级」上。
韦楠回答了「怎么敢把线上存储交给大模型」:三条原则(默认安全不触碰 AKSK 与敏感数据、全程可追溯可审计、可回滚的 dry run 预演与变更快照)加上四层防护(输入意图保障、业务知识约束、白名单动作控制、输出审查合规)与五层部署架构;对百亿级 bucket 的长耗时任务(清单可达百 GB 级),先拆子任务、把本地工具注册为 client tools、每个 react loop 的状态沉淀进 Agentic Bucket 以支持崩溃恢复,再用滑动窗口、摘要压缩、轨迹检索管理跨轮上下文(嘉宾称)。
真正的架构宣言来自 Agentic Bucket。谢桂珍指出 Agent 时代的租赁逻辑变了:同一个 Agent 的不同 Session 之间数据与记忆完全隔离,有多少会话就需要多少完全隔离的存储池——但「一个沙箱一个独立 Bucket」受限于 Bucket 数量上限,行业普遍妥协成「一个沙箱一个 Prefix」。阿里云的选择是把困难留给自己:直接把 Bucket 数量扩到百亿级。三层架构为 Agentic Bucket(模板化管控层,新 Space 自动继承 policy、ACL、多版本等配置)/ Bucket Space(能力等同于一个完整 Bucket:独立域名、独立配额、独立权限)/ Object 层(兼容 S3 协议,支持 OSSFS 以 POSIX 挂载)(嘉宾称)。肖国平的技术解读给出关键判断:「在 Agent 时代,管控面就是新的数据面」——把 Bucket 元数据直接放进自研分布式文件系统、网关直达,Bucket 数量达到百亿级,单用户创建 Bucket Space 可达 10 万 QPS;再配合泛域名(一次绑定、每个 Space 一个子域名)、调度打散到不同集群的物理隔离、Bucket Space 级容量上限与默认流控(嘉宾称)。客户侧的落点是荣耀终端的悠悠智能体:从「通用 Bucket+Prefix 逻辑隔离」升级为「一沙箱一个独立 Bucket」,联合阿里云 ACS 团队端到端打通(嘉宾称)。Agentic Bucket 的真实性可由官方 CreateCnameToken 接口文档佐证——其中已出现 Agentic Bucket 专有的 wildcard 泛域名参数(官方文档);写作者另检索到腾讯云也已推出「智能体桶 COS Agent Bucket」,单桶承载亿级空间,可推断「隔离粒度」正在成为云存储竞争的新规格战场(外部检索+写作者推断)。
文件存储 AgenticFS(转写中混作「Agentic FS」「ErgentaFS」等,按官方名校正)把同一逻辑推到亿级。孟威给出的对照是:传统 NAS 单实例文件数只有 10-20 亿、配额与接入点仅千级,Agent 平台被迫把业务拆到多个实例;AgenticFS 聚合 region 内多可用区多存储集群为一个超级文件系统,单个集群可管百万级 Space,挂卸载 QPS 十万级(较传统文件存储提升约千倍)、端到端挂载约 600 毫秒,生命周期加归档可把成本降 92% 以上,零 KB 起步按量付费(嘉宾称;官方文档当前邀测版本标注单文件系统最高 50 万 AgenticSpace,「百万现值、亿级即将」属现场路线图口径,两者并列存档)。刘善阳把隔离讲成了故障域经济学:每个 AgenticSpace 有独立 inode 命名空间、独立配额、独立挂载点与凭证,大容量写异常被配额困在 Space 二内部、高 IOPS 异常被性能隔离困在 Space 三内部,Space 一照常运行——平台从「全平台排查」退化为「只处理出问题的那个 Agent」。安全侧的零信任临时凭证设计同样以 Agent 为前提:「Agent 的执行逻辑由大模型动态生成,容易被诱导走向破坏性路径」,所以凭证自动轮转、不落盘、每 Space 独立,攻击窗口从月级缩到分钟级(嘉宾称)。
第二条链条在此成型:会话级隔离成为刚性需求 → Prefix 式逻辑隔离是安全债(机制)→ 云厂商把隔离下沉为物理与凭证两层原生能力(变化)→ 安全责任从应用层部分转移给存储层,应用团队不再自己造多租户隔离(二阶影响)→ 启发:审计你系统里所有「用目录隔离冒充权限隔离」的地方,并把凭证轮转自动化提上日程——这两件事 Agent 时代都守不住。
三、亚秒唤醒的经济学:Sandbox 的存储账本与 MiniMax 的三次搬家
块存储环节由胡航丽、鲁振伟主讲,产品叫 Agentic Disk Pool。胡航丽把 Agent 负载总结为三个字:并发大(较此前业务提升 6 倍,正朝 10 倍甚至百倍发展)、轻(云盘容量降一个数量级,数 GB 级)、短(生命周期基本小于 30 分钟,任务完成即释放)——由此产生一组矛盾需求:小容量却要数百 MB/s 吞吐、低成本保持却要随时快速唤醒(嘉宾称)。解法是把性能池化:Disk Pool 内哪怕 1GB 的云盘也能突发到 350MB/s 吞吐、2000 IOPS——鲁振伟给的对照是传统 NVMe SSD 约 100 IOPS/GB、AutoPL 约 1000,同价位下吞吐约 3 倍、IOPS 约 10 倍;用开源 E2B 测试,高吞吐场景性能提升 2 倍以上、唤醒阶段 3.8 倍(嘉宾称)。深圳地域实测:一分钟内启动一万个 Sandbox,全链路 P95 耗时下降一个数量级、从数秒降到百毫秒级(嘉宾称)。启动链路的另一个细节是多镜像合并:过去八个镜像意味着八次创盘、八次挂载、串行的设备枚举,合并到一块云盘后耗时降到原来的 10% 左右。
成本侧的三个数字更值得记:其一,NVMe 多 Namespace 机制让单个控制器挂多块云盘、设备数从 M 扩到 M×N,fast mount 把挂载路径从 PCIe 热插拔缩短为 Admin Queue 直接下发,挂载 P95 从接近 1 秒降到约 50 毫秒,单 vCPU 可挂载云盘数量提升 4 倍——同样 CPU 内存开出 4 倍 Sandbox,单 Sandbox 成本降为四分之一(嘉宾称);其二,闲置与休眠态用快照保存,按实际数据量计费,单 GB 成本约为 ESSD 类云盘的 10%,整体可降 95% 以上,配合 lazy load 按需加载与热点预热,仍能亚秒级唤醒(嘉宾称);其三,面向强化学习场景提供跨 AZ 克隆与一到 N 批量克隆,保证并行探索的起始环境完全一致(嘉宾称)。总承诺被胡航丽压成一句话:支撑百万级 Sandbox 一分钟内启动,同时保住设备级隔离。
这套东西好不好用,MiniMax 的演进史是最好的证词。莫蒂(上海稀宇科技,转写作「西语」;MiniMax Agent 研发工程师)给出规模:MiniMax Agent 累计百万级用户、PB 级 Agent 数据,M3 系列模型原生多模态、百万级上下文(嘉宾称)。他们的存储架构换了三代:第一代 K8s Pod+EBS 云盘,任务结束把 EBS 归档到对象存储、冷启时再恢复——用户代码仓库、编译依赖越大,归档恢复越贵,还要自管归档逻辑;第二代引入 ACS 安全容器,EBS 路线(大规模快速启动+快照休眠)用于托管长期运行的个人助理类 Agent(转写作「Open Cloud」「Holmes」,写作者推断疑似指 OpenClaw、MaxHermes 类产品,保留存疑),NAS 路线用于 Web 端任务型 Agent——存算分离了,但「目录的隔离并不意味着权限和资源的完全隔离」:coding 用户海量小文件与多模态用户并发大文件互相干扰;第三代与阿里云共建引入 AgenticFS,给每个用户分配独立 Agentic Space(嘉宾称)。他们的最佳实践是两次分离:harness 与 compute 分离(把文件系统和操作系统相关的工具抽象进安全沙箱,Agent 感知的环境更纯净,harness 层可独立优化);compute 与 storage 分离(ESSD 承载镜像与运行时、快照预热实现百毫秒级创建挂载,AgenticFS 承载用户持久化数据,对象存储承载跨会话数据)。效果是 compute 沙箱拉起加 AgenticFS 挂载达到秒级、用户无感;Agent team 里不同成员的 compute 跑在不同沙箱,却能按需挂载同一个 Agentic Space 目录共享文件与上下文;任务结束即回收计算资源,续聊时新拉沙箱挂回原目录即恢复状态——「把整个架构上所有有状态的依赖都收敛到 AgenticFS 上」(嘉宾原话大意)。这正呼应第一条链条:当唤醒是秒级、保持是快照价,「Agent 常驻」才在经济上成立。
四、会记事、会思考的存储:记忆、保护与网盘
Tablestore 环节(薄磊、李昕朋;产品名在转写中混作「table store」「table style」「表格存储」,客户公司 Matrees 被报幕成「Matrix」,均按议程与官方名校正)把话题从「空间」转向「上下文」。薄磊称,去年云栖表格存储发布了知识服务与记忆服务,今年将其升级为 Tablestore Agentic Memory,定位是「云端托管智能体的认知协同上下文存储」:不再局限于一条条记忆,而是把短期会话记忆、提炼出的长期记忆、团队 Wiki 知识库、RAG 切片知识库、从会话中提炼的技能统一进「泛记忆」范畴;今年新增文件记忆(Agent 产出的 Markdown 文档直接存入工作区、以 FUSE 挂载进 Sandbox)与 Agentic Task(记忆提炼、整理、反思、知识编译)。底座是 Tablestore 分布式存储加 OSS Vector Bucket——后者在昨天隔壁论坛刚发布的 Fusion Mode 面向温热向量数据,检索延迟数十毫秒、召回率 99%、检索 QPS 数千,支持向量多路、标量混合与全文检索(嘉宾称)。内部用户包括千问、千问办公(转写作「千万办公」,按公开产品名校正)、Agent Core 与百炼(嘉宾称)。李昕朋给出的硬指标是:在记忆场景行业公开数据集上综合端到端准确率 92.34%、行业第一梯队,单记忆库支持百万级租户、亿级记忆条数;技术上是三层记忆引擎(保留背景与人物的情景层、沉淀偏好与决策的事实层、包含实体时间关键词的检索表达层)加基于 Vector Bucket 的高召回索引,再加记忆整理引擎做归并去重与经验提炼,以及记忆与知识的双向演进——记忆沉淀为知识文档、与存量手册共同编译成知识图谱,用户反馈知识过时则先存为长期记忆再经知识回流修复(嘉宾称)。现场 Demo 用三次集群故障排查演示了进化:第一次靠图谱和工具能定位却无经验处理,用户指导沉淀为带来源版本的长期记忆;第二次召回记忆完成诊断;经记忆整理沉淀出可复用的 skill 与画像、增量编译、并保留知识订正前后的视图;第三次一次完成诊断、治理与验证。
客户 Matrees(刘华耀,唐山文余联合创始人)的故事对中小团队最有参考价值。他们做架空世界观创作平台:世界观从核心概念生长出角色、地点、组织、宗教,再衍生小说、剧本、漫画;痛点是几百个角色、几万年编年史、单个设定数十万字、总量上千万字之后,改一个人物的出生年份整条时间线崩塌,多人协作(插画师、剧情师、人设师)更难维护。他们的 Agent 需求是秒级全量检索、提案制写入(审核、门禁、历史版本)、按「用户×世界」多对多隔离记忆。技术选型走过弯路:demo 阶段用 n8n 加开源向量库(转写作「Coherent」,写作者推断疑似指 Qdrant,保留存疑)加自建蒸馏记忆,灰度一个月用户反馈很好;随后开源架构 bug 触发升级,向量库数据膨胀占满内存与硬盘,更要命的是生产库重启需要把全部向量从硬盘加载进内存,持续两个小时。迁到阿里云 Vector Bucket 加 Tablestore 记忆服务后,三人技术团队只用三天完成迁移;现在百万到千万字的世界观秒级召回,用户写作习惯与文风沉淀成画像也能秒级召回(嘉宾称)。他的结论很直白:大公司的 Agent 能力是黑箱、开源框架自由度太高,「我们要自己的 harness,但记忆、存储、向量这种高技术债,放心交给云」。
数据保护环节(李媛、张磊)的出发点冷静得近乎扫兴:Agent 误删的速度「可能是以前人删速度的几万倍」,再叠加人为误操作、勒索加密与合规举证需求(嘉宾称)。AI 全链路上每类数据都输不起:训练集丢了要重采集重清洗,checkpoint 丢了损失的是算力和时间,RAG 知识库丢了要从原始标量数据重新向量化建索引,AgenticFS 上的 Markdown 与 skill 丢了等于 Agent 的记忆与工作状态清零。对应四个进化:新形态全覆盖(Vector Bucket、AgenticFS 均可备份恢复,AgenticFS 支持按文件系统、Space、目录、文件四级粒度);CPFS 升级为无代理高性能备份(不再需要客户自购 ECS 装备份节点,扫描速率 3 万文件/秒、备份速率 5GB/秒);备份索引搜索(从百亿备份文件中秒级到分钟级定位、点对点恢复);以及即将发布的数据保护专家 Agent——之所以叫「专家」不叫「助手」,是阿里云把多年数据保护经验蒸馏了进去,能做等保 2.0 各级的合规解读、扫描云上资源、列出差距、给出可执行脚本并一键整改(嘉宾称)。两个落地案例给了量化效果:某头部互联网用户在 CPFS 上有约 200 亿个训练数据集文件、约 2PB 实时滚动的 checkpoint(每天新增与淘汰各几十 TB),多个业务方各自的 Agent 和脚本频繁误删误改——采用无代理备份加每天全量加增量加逐目录元数据索引后,RPO 小于 24 小时、百亿文件约 5 分钟检索定位、恢复全程无需自备 ECS(嘉宾称);某房地产用户 300 多台 ECS、80 多个 OSS Bucket、20 多个 NAS 分布在三个地域,靠专家 Agent 每天自动扫描、发现新增不合规实例立即修正(嘉宾称)。张磊的收尾值得引用:「往往是一群人带着一个军团的 Agent 在处理数据,每个人都能碰到数据」——所以「让 AI 放心创造,让每一份数据都有退路」。
最后登场的 Agentic Drive(转写中混作「Zentyx Drive」「Zendesk Drive」,按议程校正)把整场推向「存储会思考」的收束。徐慧的场景从个人痛点出发:在会场用手机拍照,要传回电脑再交给 Agent 写报告,多个 Agent 之间来回搬文件,「本地目录都要爆炸了」——解法是把网盘变成多 Agent 共享的知识库:个人、团队、企业空间都可以授权给 Agent,每个 API Key 是一个带身份权限的独立工作空间,可以像管理真员工一样给 Agent 设「只查看、不许改、不许下载」;文件入盘自动 embedding,文搜文、图搜文、文搜图、图搜视频一句话召回;权限、身份、日志审计、版本恢复、两道回收站、访问流控齐全;从购买到可用十分钟(嘉宾称)。最关键的一句是「权限发生在召回之前」——无权限的文件根本不会进入 Agent 与模型的视野。杨晔辉的技术解读把动机说透:传统存储只感知字节,Agent 被迫把数据捞到本地 Sandbox 处理、再建本地向量索引,数据反复搬运、token 大量浪费、权限可能被绕过;Agentic Drive 用三层重写——多模态网关(RAM 之外支持 LDAP/SAML、OAuth 与 API Key policy,权限可精确到每个 Agent 每个会话)、多模态存储(一个视频的画面特征、语义、人物物体、时间、字幕、OCR 持久化进键值、倒排、向量、图、地理位置五个并行索引,检索各层都嵌入权限控制)、多模态计算(上百种 AI 能力变成存储内算子,smart flow 编排引擎按任务目标与成本生成执行流,token 消耗可降 90% 以上)(嘉宾称)。三个落地场景:一句话用图片素材生成视频成果并分发;把三小时云栖视频自动总结成 PPT 沉淀为企业知识;每天早上七点 Agent 自动汇总业界新闻、内部待办与邮件生成当日工作文档。「存储正在从沉默的数据仓库醒来,成为 Agent 的大脑和双手」(嘉宾原话大意)。
收束:矩阵之后看什么
把九个环节放回一张图,这场发布其实只有一个命题的九种解法:对象存储给隔离(Agentic Bucket、Vector Bucket)、文件存储给工作空间(AgenticFS)、块存储给运行时(Agentic Disk Pool、快照休眠)、表格存储给记忆(Agentic Memory)、网盘给协同(Agentic Drive)、备份给退路(云备份+专家 Agent),再用 OSS Agent 把管理界面本身换成自然语言。第三条链条由此闭合:Agent 产生记忆与技能 → 记忆成为新的数据形态(机制)→ 记忆被产品化为带准确率指标的服务,92.34% 这类数字开始出现在存储发布会(变化)→ 初创团队 3 人 3 天替换掉自建向量库与记忆管线,运维债变成 API 账单(二阶影响)→ 启发:记忆系统自建还是托管,决策点不在功能清单,而在「重启加载两小时」这类隐性运维成本上。 第四条链条同理:Agent 会误删(几万倍速)→ 数据保护从 yearly 演练变成 RPO/检索分钟级的日常 SLA → 给 Agent 开写权限之前,先配好快照策略、回收站与版本链,顺序不能反。
往后半年的观察指标,写作者建议盯四个:AgenticFS 从文档现值 50 万 AgenticSpace 到现场宣称亿级 Space 的路线图兑现速度;OSS Agent 商业化后对高危操作的放权节奏(这决定「对话式运维」的真实边界);记忆服务会不会出现第三方基准榜,让 92.34% 这类厂商自报数字有对照;以及「智能体桶」这个新品类有多少厂商跟进——腾讯云已经入局,规格战大概率围绕单桶空间数与隔离粒度展开。至于更远的判断,不妨记住彭亚雄那个 70%:当每天新建的云盘几乎全部由 Agent 创建时,存储产品的买主也会从人变成 Agent——今天这些面向 Agent 的接口、凭证与计费设计,就是在为那个「存储自己采购存储」的未来铺路。
归属说明:本文事实与数字均出自本场论坛现场转写(0-11379 秒,95 段,全文覆盖),讲者身份以官方议程为准;标注「嘉宾称」的为现场陈述,标注「官方文档」「外部检索」的经阿里云帮助中心等公开来源核验,标注「写作者推断」的为本文分析判断;转写同音错误按议程校正并在事实账本中留痕,无法确认的专名保留原文并注明存疑。