先说结论
这场论坛最值得记住的,不是又一批产品发布,而是一个正在换人的事实:数据平台的头号用户正在从人变成Agent。阿里云计算平台事业部产品负责人徐晟用一句话交代了动机——客户调研显示,云上已有很大一部分客户在用Agent管理核心业务,未来六个月内会有大量客户跟进,所以交互主体必须从人换成Agent(嘉宾说法,调研未公开)。围绕这个判断,阿里云把从存储(DLF+Paimon 2.0)、流(Fluss,今年8月刚毕业为Apache顶级项目)、计算(EMR)、开发平台(DataWorks语义图谱)到应用的整条链路做了一遍"智能体就绪"改造。但真正有信息量的,是圆桌上沃尔玛、博西家电、海信聚好看、骏伯网络四位企业实践者的共识:技术底座已经不是主要矛盾,业务语义层才是——博西说语义层是过去八个月最大的挑战,沃尔玛说数据研发效率提升40%到60%(嘉宾口径)背后靠的不是模型而是数据治理。而压轴的孩子王给出了一个激进注脚:约100亿销售规模里近30%由AI完成。本文拆解这场换人的机制、代价与启发。
(说明:本文基于云栖大会2026「全模态Agentic Lake论坛」现场转写整理,讲者名单与讲题经官方议程页核验;转写中的ASR人名误识已按官方议程校正,如徐胜→徐晟、武冲→伍翀、田奇显→田奇铣、陈辉→程辉、王志义、张纪宽、潘力、骏伯网络、聚好看等;圆桌主持人"杨一"与论坛主持人"佑丽"议程页未列,保留转写原文并标注。)
换人怎么换:从"数据湖仓"到"Agentic Lake"的四个技术动作
先解释术语。**湖仓(Lakehouse)**指把数据湖的低成本开放格式与数据仓库的管理能力合在一起的架构;Agentic Lake则是阿里云今年提出的概念——在湖仓之上再做一层面向智能体(Agent,指能自主理解目标、拆解任务、调用工具的AI程序)的增强,核心是"智能体就绪":引擎能不能被Agent调起来、执行命令、自运维、发现慢SQL自动优化。徐晟强调这不是替代关系:“我们永远不指望AI去replace human”,右边这条线是增强线(嘉宾观点)。
具体拆成四个动作。第一,引擎智能体就绪:全系引擎透出MCP skills(MCP,Model Context Protocol,一种让大模型以标准化方式调用外部工具的协议),并支持SQL方式调用AI Function、Python方式调用GPU资源。第二,存储统一:DLF(阿里云数据湖构建服务)同时提供Iceberg、Paimon、Lance三种开放湖表格式——Iceberg代表结构化批计算的业界标准,Lance面向多模态机器学习,Paimon是阿里内部孵化、已有数EB生产实践的实时湖格式(李劲松说法;Apache官网证实Paimon为其孵化项目,李劲松本人即Paimon PMC Chair,此点经官网核验)。第三,实时化:Fluss(Flink Unified Streaming Storage,阿里云Flink团队2023年发起的流存储)今年8月6日正式从Apache孵化器毕业成为顶级项目——这是本次少数可完全外部核验的时间线事实(Apache软件基金会官方公告,2026-08-06),Fluss承担毫秒级实时层,Paimon沉淀历史层,通过Union Read把两层合并成一张逻辑表,即所谓"湖流一体"。第四,语义层:DataWorks发布六级语义层和语义图谱,这恰恰是全场最被反复强调的一环,后文单独展开。
这条技术链的机制→影响→启发链条很清晰。机制:Agent需要多轮"观察-推理-行动",每轮都要点查和检索最新数据,传统湖仓要等批次跑完才有新数据,延迟分钟到小时级,而业务变化是毫秒级的——Agent可能基于过期数据做错误决策(伍翀论证)。影响:实时层从"锦上添花"变成Agent时代的刚需,Fluss毕业、湖流一体一键开关这类产品化动作,本质是把这条延迟曲线压到秒级(嘉宾称淘宝闪购点查从约800毫秒降到5毫秒,厂商口径)。启发:评估数据基础设施的新问题不再是"人用起来顺不顺",而是"Agent调用时数据新不新、语义懂不懂、权限管得住管不住"。
徐晟还补了一层常被忽略的论证:性能与成本。他的说法是,全系引擎针对湖仓优化后能达到约90%的内仓性能——只差一成,看似还是落后,但替代方案是把数据从A引擎导到B引擎,网络传输延迟无法优化、一致性无法保证、成本翻倍,所以"所有性能都基于湖仓优化"才是正解;他甚至举了一个客户案例,用HDD硬盘配合DLF缓存加速达到了SSD的效果(均为嘉宾口径)。他给出的底气数字是阿里集团湖上数据已超过1EB(嘉宾说法)。同时他也坦率承认了生态位的差异:Iceberg是业界生态最好的开放湖表格式,Paimon技术能力已经就绪但生态还需要时间追赶——这是整场论坛里少见的厂商自陈短板,与Paimon 2.0刚发布、需要Doris等引擎侧伙伴配合的现状互洽。
李劲松则把"为什么企业自己搞不定湖表"讲透了:湖格式落地难,难在维护。分桶估多了有小文件问题、估少了有性能问题;对象存储上小文件访问代价大;冷数据要不要归档是道权衡题。DLF的解法是四个自动化:自适应分桶(建表不用指定参数)、全自动小文件合并、按访问模式做冷热分层生命周期管理、多模态索引分钟级自动构建(嘉宾称一到三分钟),底层用全托管Flink执行约一分钟延迟的compaction。他给的企业收益例证包括某车企合并成本降低60%、某物流公司几万张表轻松运维(未具名,嘉宾口径)。这条逻辑链的启发在于:开源湖格式免费,但治理不免费——企业选型时该把"谁来干活"和格式标准放在同一权重上掂量。
五家企业的一线报告:语义层是最后也最贵的一公里
圆桌环节的四位嘉宾加上压轴的孩子王CTO王海龙,来自零售、消费电子、家电制造、移动营销、母婴零售五个行业,但给出的痛点高度收敛。
博西家电(博西家用电器投资(中国)有限公司,西门子家电、博世家电母公司在华主体,经企查查核验)数据与人工智能部总监王志义说,公司现在有约600多个Agent(嘉宾口径),最大挑战不是模型而是数据怎么被它们调用:“过去八个月最大的挑战是语义层。“因为现有Agent大多各自存一份数据,数据复用问题无法解决。他的判断是:未来一到三年,公司真正要做的是把供应链、客服等不同场景的本体建模(即把业务概念和数据关系建成统一模型)沉淀下来,“这是公司真正的资产”,而人的挑战——说服管理层、在各部门建AI大使和AI开发岗——比技术挑战更大。
沃尔玛中国大数据高级专家程辉的表述最体系化。他认为Data Ready(数据就绪)的本质是数据消费范式从面向人转向面向AI,要补四块:可理解(AI能精准找到并读懂数据)、可调用(不管数据在数据中台还是散在业务系统)、安全可控(行列级权限管控,敏感数据不泄露——沃尔玛高度重视数据安全)、数据质量(BI时代遗留的脏数据问题在AI时代会被放大)。他给了一个全场最有传播力的数字:通过AI贯穿"一句话需求→PRD指标拆解→模型设计→代码编写→自测”,数据研发效率提升40%到60%——注意,这是嘉宾所在团队的内部口径,未经第三方核验。他的另一个观察值得展开:单个场景靠微调能把准确度做上去,难的是规模化——把整个数仓的数据开放给AI后,怎么让AI读懂这些数据。
海信聚好看(海信旗下OTT互联网电视运营公司,2016年成立,OTT行业首家独角兽,经官网与工商信息核验)研发中心总经理张纪宽从业务侧反推:电视从客厅里冰冷的设备变成要感知用户情绪的"家庭成员”,意味着数仓里的结构化数据全部要变成多模态数据,还要在多模态之上做知识理解。他们已从单点Agent建设走到统一数字员工平台,他提出的"Agent要担责、要有KPI"引出与阿里云专家(李钰,花名绝顶)共识的"Agent Ready六性"中最关键两性:可审计(Agent接任务到输出结果的上下文、调用工具、思考过程全程可审计且入湖)与可验证(输出结果自动化验证并反馈回湖,下次不犯同样错误)。他还给了一个激进判断:互联网时代讲网络效应,Agent时代是复利效应——Agent越用越好,前提是数据平台能把动态产生的数据实时治理并回流。他对未来的展望同样激进:数据平台不该只做被调用方,反过来去理解Agent要干什么、提前把数据准备好——从"自上而下被调用"变成"自下而上主动供给"(嘉宾观点,纯设想)。
骏伯网络(广州骏伯网络科技有限公司,2012年成立的移动互联网营销公司,2015年新三板挂牌,经官网核验)联合创始人潘力讲了两个组织层面的故事。其一,今年上半年全公司做AI场景化专项,结果是积压多年没解决的需求,业务部门自己全搞定了——研发的组织逻辑随之崩塌,公司干脆重构研发部门:取消产品部、架构部,全部改为AI工程师,约一半业务研发人员直接划进业务部门,研发中心转型做内部FDE(Forward Deployed Engineer,前向部署工程师,指驻场帮客户/业务做落地的工程师)。其二,数据侧反方向收紧:功能开发放权给业务,数据却要建全公司统一底座,治理范围还扩大到会议录音、飞书聊天记录这类非生产数据。他讲的"总费用"案例是全场最好的语义层注脚:广告平台回传一个叫"总费用"的字段,数据团队都当真实费用建模,后来才发现那是"总预估费用"——一个字段语义没掰清楚,就制造了"数据源不稳定"的假事故。
机制→影响→启发链条在这里呈现第二条:机制——语义缺失时Agent无法隐式补全人的常识(同一个字段在两张表里含义不同,人不问就知道,Agent不知道);影响——轻则报表偏差(传统BI时代人工可以兜底,分析师拉个手工表就校正了),重则如潘力所说,投放Agent自主创建、扩量、关停计划,数据错了人是拦不住的,“对公司损失非常巨大”;启发——语义层建设没法外包给云厂商,阿里云能把技术底座建好(田奇铣称DataWorks语义图谱可用AI基于平台资产自动构建、增量更新),但企业自己的业务模型不统一,技术再好也没用,这是潘力圆桌上反复强调的边界。
语义图谱与"复利效应":DataWorks把知识工程产品化
下半场的产品发布把圆桌的痛点接住了。DataWorks产品负责人田奇铣(开场即言"Data Agent的瓶颈根本不在模型能力,而在它能不能读懂企业业务")发布语义图谱(Context Graph,语义图谱是DataWorks Data Agent的业务大脑):不要求企业人工重建一遍语义,而是由语义Agent基于平台沉淀的元数据、ETL任务、血缘、质量规则、指标术语自动构建,支持每天增量更新。他给出的内部测试数字——叠加语义层后问答业务准确率93.24%、SQL生成一致性99%到100%,且便宜模型加语义层可以逼近旗舰模型效果、大幅降低token消耗——均为厂商内部口径,未经第三方核验。
配套的三道防线设计回应了圆桌上"敢不敢让Agent动生产数据"的焦虑:数据安全(Agent身份管理、细粒度权限、安全沙箱数据不出域)、行为审计(可观测、Agent任务血缘、数据水印——血缘已从"任务→表"扩展到"人→Agent→会话→任务→表"全链路)、成本管控(Credit限额与Token成本治理)。田奇铣的总结是那句可以被记住的话:“放心地把钥匙交给Agent,但监督权、管控权依然留在我们手里。"(嘉宾表述)
值得单独一提的还有多云与多模态两个具体能力:全托管Apache Gravitino服务(转写误作"GraphTino”,Gravitino为阿里捐赠Apache的统一元数据项目)实现跨云元数据纳管——只连元数据,数据留原地、查询原地执行;数据集成支持60多种异构数据源一站式入湖,入湖过程中直接调用AI算子做文档解析和向量化(从ELT退回ETL)。以及血缘的升级方向:Agent的任务血缘让人能回溯"哪个人、用了哪个Agent、哪次会话、生成了哪个数据任务、产出了哪张表"。
第三条机制→影响→启发链条在这里:机制——Agent每次执行都会产生新的过程数据(调用记录、验证结果、失败上下文),EMR负责人李钰把它定义为"governed可信数据集",语言模型缺乏因果推断能力,必须在Agent侧建知识沉淀体系才能自我进化(EMR同步发布Managed Agent平台,他类比"建设Agent时代的Hadoop":Hadoop当年把任务切分、shuffle、failover封装成map/reduce两个原语,这个平台想把失败经验记录与知识沉淀封装成API原语);影响——谁先把失败经验数据化并回流,谁的Agent就进入张纪宽说的复利曲线,否则每个Agent都是每次从零开始的实习生;启发——企业评估Agent平台时该问的问题从"支持多少模型"变成"过程数据能不能入湖、能不能被下一次调用复用"。
从数字到落地:那些被保留的具体案例
论坛保留了几个值得记录的具体案例,数字均标注口径。
孩子王的实践是压轴也是集大成。这家在全国300多个城市有近4000家门店的母婴零售企业(嘉宾口径),CTO王海龙给出的数字链条是:门店生意好坏约70%由店长个人能力决定,所以把最优秀约1000家门店的经营能力"蒸馏"进AI店总助手,给每家门店输出差异化经营策略;私域近1000万会员由近1万名育儿顾问服务,员工助手每天把每位顾问手上约1000个会员盘一遍,输出当天最值得关注的十个会员机会(含画像、话术、推荐商品);约9000多万会员人均被打1000多个标签,全部由湖仓自动完成;结果是畅销品缺货率下降约1个百分点、单客产值提升近6个百分点,2025年约100亿销售规模中近30%基本完全由AI完成人群识别到成交转化的闭环(全部为嘉宾口径;外部佐证仅有腾讯新闻2026年4月对其混沌课程的报道转述同口径,无第三方审计)。
短剧投流是流计算一段的典型案例:短剧行业每天上新上千部AI短剧,一部短剧有上千个切片素材,谁先找到高光片段拼接投流谁就吃到流量虹吸。方案是OSS CDC捕获视频上传事件→Flink切片抽关键帧、ASR与多模态模型理解画面人物冲突剧情→Embedding后连同原始视频统一进Paimon多模态宽表→StarRocks按镜头和高光检索→后加工成投放视频,端到端从天级压到30分钟以内(嘉宾说法,客户未具名)。伍翀还提到与央视体育合作的名古屋亚运会AI直播解说(游泳、射击项目,央视体育App可看),时间线与2026年9月举行的名古屋亚运会吻合,合作细节未见独立报道。
具身智能数据处理是EMR一段的发布重点:EMR Serverless Spark即将发布具身智能数据处理平台(嘉宾称10月公有云可用),解决头戴设备第一视角视频的动作还原——双目优化算法对齐操作手时序、短缺口补全而长缺口不强行补全(避免把错误数据喂进训练)、支持LeRobot V3数据格式(LeRobot为具身智能主流开源数据框架)、相机与世界视图供质检。李钰称团队自测在HOT3D数据集上精度较单目经典算法提升高达60%、端到端耗时降40%(厂商自报口径)。这条线与李劲松讲的Paimon承接LeRobot数据集(SDK转换、千帧拼一个文件使训练时一次I/O读千帧)前后呼应,说明具身智能已经成为湖仓多模态能力的第一驱动力——这一点有交叉印证:快手已在生产环境用Apache Doris直接查询Paimon表上的向量索引(Apache Doris官方博客,2026),李劲松称该方案在快手落地百万到十亿级向量、96%召回(后两个数字为嘉宾口径)。
李钰的另一项发布EMR Serverless StarRocks(全模态在线分析服务)则回答了"数据准备好之后怎么被模型圈选消费"。他举的智驾困难样本场景很具体:找"指定区域、雨天、夜间、满足车速条件、有车辆加塞、且与参考片段相似"的视频样本——时间车速是结构化条件,区域是地理信息,加塞是全文匹配,相似片段是向量查询,传统做法要在应用层把多种引擎的查询结果拼接起来,需求一变就得重写;统一分析服务则让一条SQL完成过滤、召回和排序。他透露千问大模型训练的数据圈选用的就是这套内核:集团数据湖基于Paimon on盘古,Spark加Ray做加工,StarRocks做统一圈选,因为大模型训练目标持续变化,数据团队要不停调整内容与分布条件,反复圈选已成日常工作(嘉宾说法)。他报出的性能数字——TPC-DS 10TB上StarRocks加DLF的性价比超当前榜首友商公开成绩50%以上、1KB点查十万QPS、99%召回下近两万QPS——均为厂商自报基准,未见第三方复核,采信需谨慎。
尾声:谁该关心,下一步看什么
把整场论坛压缩成一句话:存储、计算、调度这条技术链的"智能体就绪"已经基本完成——Fluss毕业、Paimon 2.0把实时上下文与多模态向量检索装进同一张表、引擎全面透出MCP接口——而语义层、安全审计、组织变革这条人与组织的链才刚开始。嘉宾们无意间给出了一致的观察指标:Agent调用占数据平台入口的比例、语义层覆盖的业务口径数量、Agent过程数据入湖率、以及最朴素的一个——数据错误发生时,你的流程里还有没有"人能拦住"的那一环。
对不同的读者,启发各有落点。做数据平台的人,该把"Agent能不能直接用它"当作第一设计约束,并把过程数据的记录与回流做进架构。做企业数字化的人,潘力的"总费用"案例提醒你:先盘点字段级语义的账,再谈Agent落地,业务模型不统一,任何厂商的语义图谱都救不了。做投资或战略判断的人,值得注意这场换人的利益分配——云厂商把引擎和平台层全部重做一遍来承接Agent流量,而企业侧最稀缺的资产从算力变成了本体建模和业务知识沉淀,正如王志义所说,那才是"公司真正的未来资产"。不确定的部分同样要诚实标注:本场所有性能与收益数字(40%-60%研发提效、30亿AI销售、93.24%准确率、96%召回等)均为厂商或嘉宾自报口径,截至发文未见第三方复核;DataWorks所称IDC中国Data AI厂商评估"领导者双维度第一"亦未找到公开报告原文,均按嘉宾说法处理,读者采信前请自行核验。