先说结论
2026年9月23日云栖大会这场《为Agent重做数据层:一体化湖库与多模数据管理》论坛,给出了一个与以往数据库发布会完全不同的叙事:数据层竞争的主战场,已经从"谁的引擎更快"转到"谁能为Agent的负载重新定价"。阿里云在主论坛发布的Apsara LakeBase(转写中的"Epsilon Lake Base"应为ASR误识,官方议程与公开报道均作Apsara LakeBase,李圣陶开场还特别说明该产品前一天已正式发布)是全场的锚点:它把数据库实例的生命周期与Agent任务对齐,配合对象存储底座,让Agent"深度睡眠"时存储成本接近于零——这改变了过去按规格付费的成本模型。围绕这个锚点,七场分享各自回答了一个Agent时代数据层的子问题:多模引擎怎么建(PolarDB宋震、满帮李颖琨)、具身智能的数据从哪来(ADB李伟、求之科技陈博远)、开放湖仓怎么检索(SelectDB艾乐强)、Agent怎么被观测(ClickHouse/拍拍贷姚尧)、训练数据怎么管(Lindorm邓栋、赵志强)、推理怎么省算力(Tair朱国云、NVIDIA徐添豪)。真正值得读者关心的,不是又多了几个产品名,而是这些方案背后共同承认的前提:Agent的负载是脉冲式的,Agent产生的数据是资产而非垃圾,Agent的成本大头在推理而非存储。理解了这三条,就能理解为什么"一份拷贝、多模统一"会成为所有演讲的公约数。
一、为什么是现在:从AI for DB到agent ready,数据层的"生产关系"变了
李圣陶(阿里云数据库产品事业部解决方案与专家服务部负责人,转写误作"李盛涛")用十五分钟把行业演进压缩成三段:最早的AI for DB是用AI调数据库参数、做SQL优化;2025年前后向量数据库百花齐放,数据库进入AI ready;而今年Agent走出对话框进入办公与办事场景,数据库必须回应"agent ready"。他给出六条判断,其中两条最为根本:一是生产关系变化——数据库原来服务应用程序,现在服务行为多变、多任务并行的Agent;二是高价值数据的定义变化——原来高价值数据是结构化交易数据,现在是音频、视频、文档,甚至是Agent的行为数据与人机对话数据本身。
胡庆达(阿里云资深技术专家)把这个判断工程化:AI落地四阶段(基模→领域模型→Agent→应用闭环)中,数据负载呈现三种完全不同的形态——训练层要"存得下、算得动"(动辄百PB级数据、TB级吞吐);Agent构建层要"跑得快、弹得开"(基于蒙特卡洛树的试错性脉冲负载);应用落地要"改得快、记得住"(越用越好用)。传统数据库为稳态负载设计,对这三类负载都不友好。
这条"变化→机制→影响→启发"链是全场的理论基础:Agent负载的脉冲性(变化)→ 数据库生命周期与任务对齐+对象存储(机制)→ 成本模型从规格计费变任务计费(影响)→ 选数据层先看弹性粒度而非峰值性能(启发)。李圣陶举的例子很直白:基模公司做强化学习时,一次要拉起十万个Agent跑任务生成、执行、检查、记录,用完即关——低成本靠的是"秒级拉起、不用即关",而不是存储单价。
二、LakeBase:把"十万个Agent"变成经济上可行的事
胡庆达对Apsara LakeBase的拆解可以概括为"一套底座、两类负载"。一套底座指结构化、半结构化、非结构化数据统一入湖,POSIX、S3、SQL、向量检索多协议接入;两类负载中,第一类是Agent工作空间:每个Agent独占子目录与视图,底层共享存储,目录可对全员只读、写权限收在小组内,保证高价值数据不污染公共空间。他给出的关键指标是:Agent从深度睡眠唤醒小于1秒,端到端创建分支小于3.6秒,一份存储可拉出十万个零拷贝分支(实现方式与Git类似:共享image layer、只记录LSN位点、写时才产生增量页),支撑十万级Agent负载。客户侧的证据包括:一家同步建模客户的分支数从最早的20万涨到接近2300万;昆仑万维两万个活跃Agent、十万级并发连接、秒级启动。他的原话判断是,用传统数据库架构预留资源满足这种需求,“成本是客户难以承受的”。
第二类是训推一体化:训练数据清洗后存OSS,训练时需要短时高带宽与高IOPS,通过LakeBase的透明缓存层加速;Agent运行产生的trace滚存到OSS,反哺下一轮递归式训练。这里能看到阿里云十年软硬协同的复用:LakeCache基于PolarDB积累的内存池与分层存储技术构建,专门解决对象存储性能差的问题,LakeRay兼容开源Ray生态(支持Spark、Dask、DuckDB),LakeSearch在共享存储上同时提供在线低延迟与近实时批量的向量检索,按用户对延迟与成本的偏好选择内存策略。
快手电商AI生产力研发负责人车明君(转写误作"车明军")则从应用团队视角做了一场风格迥异但逻辑相通的分享。他的痛点判断是:AI加持后单点提效显著——“每个人都是十倍工程师”,但综合提效不明显,关键原因是"生产关系没有得到根本性的变化,说白了就是大家还是各自干各自的"。解法上他借鉴了阿里内部提出的FDE+ABE分工模式,主张能力右移:让更靠近业务的产品经理、设计师去承担研发侧工作,并给出可落地的分级——业务侧能自闭环完成端侧界面开发为L1,完成全部端侧工作为L2,再拿下服务端为L3(“数据库都全搞定那就是超级个体了”)。具体工具是"Web Design而非Web Coding":普通web coding产品让PM交付生产级代码有两道坎——能否真正完成生产级功能、完成后敢不敢提交(会不会被研发diss);Web Design让PM用原型级体验工作,流程图即时显示按钮点击后怎么调数据库、怎么做逻辑判断,随时运行随时调试,同时把Figma以AI native方式融入工作流,AI生成后立刻可视化调整、直接得到代码,切断"先生成、导出调整、再交研发"的信息损耗链。企业既有代码仓、类库、规范以Harness方式给AI画围栏,保证生成物符合企业要求。他引述自己曾在阿里的观察——开会时间约占工作时间20%——作为生产关系转型收益的参照,并透露该平台(灵创MyBreeze)已在快手内部推广至大部分产品经理与设计师。这场分享对数据层的意义在于交叉验证:他的平台最看重的正是LakeBase"瞬间拉起上百万个agent、即起即停、百万级元数据QPS、秒级快照挂载恢复、不用提前规划容量"——数据底座把重活累活包圆,应用团队才能只专注Agent本身。
三、多模数据库:向量、图、全文之上,长出记忆、知识、本体
PolarDB产品专家宋震厘清了LakeBase与PolarDB的关系:LakeBase是今年新立项的一级产品,面向多模数据湖与湖库一体,但其中面向Agent的语义层能力(agentic DB技术)由PolarDB PostgreSQL版供给——多模能力直接决定LakeBase在Agent语义层的高度。这一年PolarDB在三个引擎上的迭代:向量引擎做了量化全家桶(PQ/SQ等加自动重排)、分层索引、库内AI函数、SIMD矩阵化计算;全文引擎做成即插即用的BM25,原生中文分词支持拼音与领域词库,且读写分离路由到RO节点,避免建索引拖垮查询;图引擎做了89项重大提升,完整Cypher语法、十多种图算法用C/C++库内重写、GraphSage图神经网络,以及用变长跳过滤算子下推替代多表Join——原来五跳六跳查询可能涉及十几张表Join,每张表上亿行时"性能是不可能快的"。
更有行业信息量的是引擎之上的三层组件。记忆:两横(对话记忆/行为记忆)三纵(人设/画像/事件偏好),有记忆蒸馏合并机制(演讲者类比为Claude Code的"Auto Dream"概念,转写存疑),还有结合PolarDB时空引擎优势的"全模态记忆空间"——机器人行走时把视频流逐帧记忆,回看时可按时间轨迹与位置点检索。头部厂商学习机场景已跑到50万DAU(接近百万)、2-5万并发、P99召回60毫秒,记忆蒸馏让token减少50%,客户实测使用时长提升20%。知识:在RAG切片之外引入图组织与向量混合,车企查询"某车型左大灯不亮"时靠精准约束过滤掉相似但不相关的结果,有效降低幻觉。本体:把知识归并为object、link、action三类对象,从库表、PDF、钉钉飞书文档自动构建图谱,排产到期自动触发下游备货,本体还能生成skill直接给Agent执行,已在头部车企供应链生产化。
满帮集团AI中台负责人李颖琨(转写误作"李颖坤")的分享是这层能力的最佳注脚。满帮(运满满+货车帮,2021年纽交所上市)的起点判断很清醒:2025年还没上Agent时,“瓶颈不在模型,在公司内部的认知无法沉淀”。他们的认知飞轮口号是"记忆做灵魂、知识做血肉、本体做骨架":电销场景中,电话结束先评估效率,主管分析精彩话术,AI抽取结构化知识点回流,下一通电话实时推荐话术(实时ASR+RAG),通话后用千问大模型生成沟通小结,自动提取发货要素、关键节点人工确认。他对"记忆"有一个值得抄下来的辨析:“小结并不是组织的记忆,只有靠人工审核的正确的记忆才是。” 结果侧数字:本体重做外呼后,小范围试点整体成交提升15%(内部核验),新场景研发与复制成本节省30%-50%。底线设计同样清晰:多租户知识隔离授权、关键知识更改必须人工确认——“机器管效率,人必须守住底线”。
四、具身智能:数据的采集方案决定泛化上限
ADB(AnalyticDB)具身智能多模数据平台负责人李伟把具身技术栈分三层:本体、大脑服务层(数据驱动的基础设施,即ADB平台的位置)、场景应用。平台的五大能力覆盖采集、标注、合成、评测、仿真闭环:统一数据底座用Lance为MCap等原生机器人协议构建Metadata层;批量标注平台用CPU/GPU/token协同设计的分布式调度把GPU利用率做到70%-80%以上;针对长程任务的关键算子(clip切分原子动作、caption标注动作语义)用Agent架构混合千问与CV小模型,clip切分准确率从60%提到80%-90%;数据合成泛化做场景替换、物体替换、人手换机械臂手、负向样本生成,配套检验物理规律与结构一致性的质检引擎;仿真平台用分布式调度把并行仿真效率做到比直接用开源引擎高十倍以上。
客户求之科技(转写误作"求知科技")AI数据负责人陈博远贡献了全场最反常识的两个观点:“采集方案的设计决定了模型泛化的能力”——一般认为算法架构决定泛化,但他认为VLA、World Action Model这类架构"本身并没有那么重要,真正重要的是这样的架构能够吞下什么样的数据";“采集设备的形态决定了数据的分布”——从斯坦福Mobile Aloha的笨重双臂,到UMI再到EGO头环越来越便携,采集场景越来越多,才有了这几年模型能力的飞升。求之的对策是"数据先铺进千家万户":场内自建1000多平米的采集场,分割成几十个房间、摆放几千种物品、定义几万种任务,场景从家居城一比一搬进训练场;场外则发布DAGO S1拇指相机,用户平时记录生活,闲暇时经隐私同意付费接单采集,vlog内容与训练数据严格双入口隔离。他们的数据集用Git式版本管理,训练、评测、回归集与模型效果一一对应可追踪;叠衣服demo做到了"实验室测到世界第一"的效率——叠短袖每小时80多件、平均40秒一件(有干扰屏环境)。他还给了一个个人预测:大模型会吞噬一切有良好环境定义的任务,而具身迟迟未被攻克,是因为它不是封闭环境,仿真与真机之间始终有gap;最终"具身可能成为一个harness,成为Agent调用的工具库"。
这条链完整走下来是:具身泛化瓶颈在数据分布(变化)→ 高保真场采+便携设备+合成泛化+云端仿真压缩真机gap(机制)→ 数据成为可版本化、可追踪的企业资产(影响)→ 做具身先算数据账再算模型账(启发)。
五、开放湖仓、观测与训练数据管理:三个配角,三种职业智慧
SelectDB的艾乐强面对的是智驾场景的"数据闭环三问":管理(bad case视频存哪、怎么建目录)、找(以图搜图把相似bad case批量捞出)、分析(按车型/天气/日期统计)。早期方案是OSS对象存储+数据湖+向量数据库+OLAP引擎+文本搜索引擎四五个技术栈拼装,链路长、一致性难保障;SelectDB的做法是保留开放数据湖(如Paimon),但在仓内提供向量列与结构化、文本的SQL级混合检索,冷热分层由业务决定(历史预训练样本放湖、昨日路测热数据进仓)。实测指标:在1.28亿基础样本集中取出100万张高度相似图片,召回率96%以上、极致场景99.9%,分钟级返回。
拍拍贷(信也科技出海品牌Adakami)的姚尧带来一个所有AI团队都会遇到的新命题:运维Agent顺利生成巡检报告、全程无报错,结论却是错的——因为Agent拿到了什么上下文、调用了什么工具、为何形成这个结论,外界全然不知。“执行成功并不一定代表结果可靠”,可观测的边界从系统稳定性延伸到AI的质量与成本。他们选ClickHouse做统一底座(列存高压缩、存算分离serverless、Langfuse等AI生态兼容),上层用Langfuse做token按项目归因与效果评估,用HyperDX做传统排障;运维Agent纠错走"观测还原→bad case沉淀为dataset错题集→新旧版本同用例对比→质量门禁发布"的闭环。数字很硬:对比原SaaS平台成本只占13%、核心查询性能持平,综合成本下降87%。
Lindorm(灵动)的邓栋、赵志强聚焦AI训练数据管理:高质量训练数据集的供给正成为模型迭代的瓶颈。传统链路把文件放对象存储、元数据放关系库、全文放搜索引擎、向量放向量库,数据多副本、同步转换、PB级搬迁一次耗时漫长。Lindorm用统一分布式共享存储(同时支持HDFS与S3协议)加存算分离,宽表上构建向量、全文、倒排、列存多种索引,几十PB语料上沉淀了四种去重算子(精确匹配、X-fuzzy高相似识别带高效后验证降误删、X-dedup跨文档高频片段删除、X-contain包含关系检测)。针对AI负载的特殊性做了专门优化:质量分批量刷写、大KV(向量或超长文本做Value)分离与动态列编码压低读写放大,异步向量化在大批量写入时不阻塞、失败可重试。检索侧一分钟能导出3000万条大TopK结果,生产环境有千亿级向量实践,今年新增的分布式全量聚类不再采样、千亿级向量全部参与,聚类结果写回宽表,用于训练数据圈选与自驾corner case挖掘。赵志强还提到一个正在成为共识的趋势:Agent正被嵌入多模数据产线本身——用trace日志加大模型裁判评价Agent好坏,bad case泛化增强后经评测再进生产流程,Lindorm为这类数据闭环提供多模trace采集存储与评测工作流的基础设施。客户案例里,一家视频生成大模型客户管理千亿级标签记录与数百亿高维向量,融合召回上万QPS、延迟1秒以内,性能提升3倍以上、TCO下降三分之二;哈啰robotaxi三个月建成自驾数据闭环平台,Ray产线覆盖解析、质检、增强、预标注到精标全流程,每天数万到十万核按负载自动弹性,AI自动标注每天调用近百亿token,如今车辆数据实时回传Lindorm支撑调度服务;具身客户两周建成数据平台。
六、缓存层重做:从语义缓存到KV Cache,以及一场39万倍的仿真
压轴的Tair环节信息密度最高。朱国云(阿里云资深技术专家、Tair负责人)指出Agent执行中有两类重复:一类是请求语义重复——“怎么申请退货"和"退货流程是怎么样的"字面不同、语义相同,第一轮的推理结果完全可以给第二轮用;另一类是上下文前缀重复——系统指令、多轮历史在每次调用中重复出现,算过的KV Cache不必重算。Tair的对策是双层:应用层语义缓存做租户/业务限定、embedding相似度匹配,命中直接返回(embedding调用成本远低于LLM);推理层KV Cache把引擎内的KV扩展为全局资源——RDMA共享内存池加SSD扩展、KVCM管理全局元数据决定保留/迁移/淘汰、Router按KV位置与引擎负载调度请求,支持SGLang、vLLM(转写分别误作"SGLM"“VLM”)等引擎。落地数字:百炼理论最高命中率提升7个百分点,实际集群从约90%提到96%左右,对应GPU算力提升40%-50%。语义缓存侧,上下文感知重写技术把标准QReCC数据集命中率从13.1%提到79.6%;游戏翻译场景命中率55.1%、成本节约49.4%。他也没回避适用边界:语义缓存适合结果稳定、问题重复度高的场景(客服、企业知识、教育答疑),并展望结合Agentic框架感知工具调用时长来做更精准的KV预取与回收。
NVIDIA徐添豪(转写误作"徐天豪”,消费互联网解决方案架构总监)补上了最后一块拼图:这些缓存调度的好idea都需要集群验证,而每次验证都耗时,“肯定是不scale的”,因此需要仿真。HiSim是首个开源的高保真推理仿真器(外部资料:Tair KVCache团队与异构计算软硬件协同设计团队联合推出),复用SGLang原生调度逻辑,模型计算与缓存搬迁用经验模型预测、虚拟时钟推进;AIC Configurator(NVIDIA Dynamo生态,正演进为AI Simulate项目)负责把算子级时延预测做准——Transformer层拆到Attention、MoE、矩阵乘等基础算子,GPU实测构建数据库再泛化到端到端。徐添豪坦承难点:算子性能随token数不是平滑过渡而是剧烈抖动,GPU对齐边界(64→65)的跳变必须捕捉,KV Cache复用带来的冗余计算要刨除(转写"差值系统"按上下文应为仿真建模系统)。结果:在最新复杂模型上TTFT与端到端吞吐的预测误差控制在3%-5%,CPU仿真时间是GPU实测的39万分之一,调优评估周期从天级降到分钟级。双方下一步要联合做集群级KV Cache容量规划、GPU数量规划与负载路由。
这条链值得单独记录:Agent推理成本占比飙升(变化)→ “不计算"优先于"算更快”:语义缓存+KV Cache全局化+仿真先行(机制)→ 命中率7个点带来GPU算力40-50%提升(影响)→ 推理优化的第一性问题是被复用的计算占比(启发)。
结语:一份拷贝,多模统一
八场分享拼在一起,“为Agent重做数据层"不是一句口号,而是一组分头推进的工程:湖库一体重做成本曲线(LakeBase),多模引擎重做语义层(PolarDB),数据产线重做具身与训练数据供给(ADB、Lindorm、求之),开放湖仓重做检索(SelectDB),观测重做治理(ClickHouse/拍拍贷),缓存重做推理经济性(Tair/NVIDIA)。它们的公约数恰好是议程简介里那句话:“一份拷贝,多模统一,Agent的数据层正在被重做。”
对读者有三条可带走的观察指标:一看弹性计费粒度——你的Agent睡眠时,存储与计算是否接近免费;二看数据飞轮转速——bad case到再训练的闭环是按月还是按天,满帮30%-50%的新场景成本节省就是这个飞轮的产物;三看被复用的计算占比——语义缓存与KV Cache命中率每提一个点,都是直接的GPU账单。仍不确定的边界也该记下:语义缓存依赖问题分布稳定,仿真器误差3%-5%且AI Simulate仍是实验项目,具身的真机gap尚未被任何仿真完全填平。数据层的重做才刚开始,而这场论坛给出的判断框架,足以让你在下一轮产品发布里分辨哪些是新范式、哪些是新瓶装旧酒。
归属与转写说明:本文事实与数字均出自2026云栖大会该论坛现场演讲转写(liveId=255961),讲者姓名与头衔经官方议程(agendaId=192)核对校正:李盛涛→李圣陶、车明军→车明君、李颖坤→李颖琨、求知科技→求之科技、徐天豪→徐添豪;产品名"Epsilon Lake Base"实为Apsara LakeBase,“多模LTIP"实为多模LTAP(Lake Transactional/Analytical Processing)。其余主要ASR校正:Circle协议→SQL协议、“巨深/巨声/巨帧”→具身、SGM/VLM→SGLang/vLLM、T2RTM→TensorRT-LLM类推理引擎、泰盟/拍盟→Paimon、AI谷的底座→AI原生底座(按上下文推断)、差值系统→仿真建模系统、C PU仿真→CPU仿真。数字均为演讲者现场陈述(如"内部核验"“客户实测”),未经独立复核;陈博远"算法架构没那么重要"为其个人观点,大模型吞噬良定义任务为其个人预测。