先说结论
这场以「多模态数据处理与模型训推」为名的论坛,八位讲者实际回答的是同一个问题:当 Agent 从演示走向生产,Agent 之下的那一整套——数据生产、湖仓、训推平台、权限治理——需要重做一遍。阿里云给出「数据闭环+模型闭环」的双飞轮方案,卓驭科技用「一湖两域」和 AI for AI Infra 概括智驾公司的基础架构转向,PAI 讲 token 经济学与模型舰队,中国电信 TeleAgent 展示了 60 万人规模化的 Skill 生态,DLF 把湖仓重新定位为 agentic lake,乐享元游和微财科技则以客户身份给出了 Data Agent 与特征开发自动化的落地样本。全场最值得记住的数字,是李鲁兵报出的那组反差:论坛称 59.9% 的阿里云云上用户已在使用 Agent、48.4% 拿它操作数据,但真正的深度生产用户只有约 5%。瓶颈已经不在模型能力,而在语义对齐、权限管控与数据供给速度——谁先把这套底座补齐,谁的数据飞轮就转得更快。
一、预训练吃干净之后:高质量数据为什么越来越贵
开场演讲的魏博文(阿里云计算平台事业部解决方案负责人)把问题定调得很清楚:基础模型已经相对成熟,竞争转移到领域化的后训练,而后训练的瓶颈是数据。他给出三个结构性挑战。第一,数据生产越来越贵——预训练时代拿公网数据清洗去重就能用,领域增强却需要更精细的处理、用更好的模型去标注再叠加人工,物理 AI 的好数据甚至要靠具身本体在真实环境里采样,合成数据不能完全替代,「数据量小,但生产昂贵」。第二,模态越来越杂——从文本和代码,扩展到视频、环境数据、物理反馈(摩擦力、柔性指标),丰富度远超从前的纯文本和半结构化数据。第三,链路越来越复杂——模型结构从 transformer 到多模态再到世界模型和 world action model,后训练从简单 SFT 进化到 agentic RL,甚至要把推理指令发到端侧机器人、与物理世界交互后再把信号传回训练侧。
阿里云的应对是把这条链路拆成两个闭环:数据闭环负责从业务反馈里抽取 bad case、精细标注、分析 bad case 在已有样本中的分布,再定向抽取补充数据——「否则训练会有偏」;模型闭环负责从 alignment 到与世界模型结合的强化学习,部署后反馈再回流数据侧,形成双飞轮。两个闭环共用一个统一数据底座,让「哪个样本经过哪条处理链路喂给了哪个训练任务」的血缘可追溯。
这里有一条值得展开的传导链:预训练红利耗尽→领域增强数据的单位成本上升、模态复杂度上升→统一数据底座和 bad case 分布分析成为行业标配→二阶影响是企业竞争点从「有没有模型」彻底转向「数据飞轮转速」,标注质量、血缘管理、数据配方能力成为新的溢价工种→对读者的启发是:Agent 效果不好时,先别急着换模型,检查业务反馈到 bad case 到定向补数的闭环是否真的闭合——多数团队的缺口在这一段,而不是在参数规模上。
二、智驾公司的架构十年:万物皆表与 AI for AI Infra
卓驭科技基础架构总监王鹏的演讲是全场信息密度最高的一段(转写中公司名多次识别为「卓誉/卓越」,按官方议程校正为卓驭科技——其前身为大疆车载事业部,2023 年独立后启用卓驭品牌,以「移动物理 AI」为技术路线,这与公开报道一致)。他自述 2015 年入行,把智驾基础架构的十年分成两阶段:平台建设期(采集、标注、训练、车辆管理各自成平台,底座从传统大数据迁到对象存储加 K8s 的云原生架构)和数据闭环期(平台被串成产线,开始关注成本与效能运营),而这两个阶段的共同点是他们建设的一切「主要还是供人使用的」。
他给出的压力数字是:智驾算法从模块化感知到 BEV、端到端 VLA 再到原生多模态基础模型,每一次跨代,算力和数据需求「基本是上一代的五到十倍」(嘉宾称)。这直接引出他的核心判断:弹性、成本、稳定性、性能四因素处在帕累托前沿上互相博弈,任何单点改进都以至少另一方面的退步为代价,因此基础架构的价值「不在于单一领域做到行业领先,而在于每次算法完成跨越式跃迁之后,能快速在边界上找到平衡点、做到全局最优」。压在边界上的是四大类问题:计算(训练、数据生产、评测混在一个资源池里既要优先级又要利用率)、存储(多模态数据散落多平台、统一检索难)、治理(企业运营数据与智驾数据两套体系割裂、口径不统一、没有机器可读的语义层)、运营(流程靠人驱动,产能取决于团队规模)。
解法是自研多模态湖仓加「万物皆表」的设计理念:文本、图像、音频、点云甚至向量都以表的方式管理、寻址、治理。困难样本挖掘这样原本要串多条链路的动作——向量近似检索、关键词匹配、标量过滤、地理区间圈选——在一张表内完成;业务扩展只需要加列。王鹏的提醒很清醒:多模态湖仓真正的难点「不在于把数据存下来,而在于能不能像管理一张表一样管理多样的非结构化数据」。在此之上是「一湖两域」:数字世界的运营数据与物理世界的智驾、基模数据存在同一个湖里,共用表结构、检索、计算和业务认知模型(Ontology),遵循「建模即治理、使用即治理」两条原则。双向赋能的例子很具体:车端异常事件的快照第一时间送售后系统,可以一路追踪到批次和物料,反哺生产质量管理;路测中驾驶行为比模型更稳健的测试员数据,经 Ontology 关联后直接生成高质量训练集喂给模型。
演讲的最后落到他称之为第三阶段的转向:AI for AI Infra(转写原作「AI Square 的 Info」,疑为该英文表述的音译)——服务对象是 AI、驱动流程的也是 AI,特点是能力工具化和架构融入业务环节。两个落地场景:一是数据生产的无人化运营,借用自动驾驶 L1-L4 分级,用「人给目标、业务智能体管运维与优先级、智能整流器做排产与资源约束」的三层结构实现全无人化生产;二是 AI 自主完成模型探索迭代——智能体每天看论文、归类 bad case、提出假设、从湖仓找数据配成数据配方、申请算力跑实验、自己归因反思,人只管定目标和发布准出。这句话值得抄下来:实验上线和模型迭代速度「不再取决于人手多少,而取决于数据供得多快、算力排得多开」。对基础设施团队的启发是直接的:你们的价值评估标准正在从「平台是否可用」变成「智能体调用顺不顺」,预算和架构都应该为工具化重排。
三、token 经济学:推理战场从 QPS 转向 KV Cache 与模型舰队
PAI 产品负责人黄博远用「token 经济学」概括这一年的变化:Agent 让 token 的产生、消耗和性价比估算真正进入了日常工作——开发者算 coding plan 的 token 用量,企业管理者像做财务管理一样核算不同模型的 token 成本效率。他讲了一个自己的例子:让某个海外模型帮他干了半小时的活,一算花了大约十美金,「如果每次都让我花十美金干这样一件事,我肯定不会去干的」。这句话背后是推理服务评估体系的整体位移:过去看 QPS,现在一个请求可能在后端转很久;KV Cache 变得至关重要,命中则成本大降、反复不命中则调用者难以控制;传统网关按 TPM/RPM 和 request 数分发「totally 不 work」;搜索、编码、聊天、视频生成对不同 SLO 的要求完全不同。
他从右往左拆解「高效产生 token」的三个因素:推理 runtime 与并行策略、模型、芯片。中间那层是他判断里最有信息量的:「build 一个特别 fit 你自己 agent 场景的模型,能巨幅提升使用效率,并不是所有人都需要那个最贵最 powerful 的模型」(嘉宾认为)。支撑判断的产品动作包括:PAI 全面适配自研 PPU 芯片并支持最新的超节点架构(即平头哥真武 M890,公开信息显示其单卡 144GB 显存、片间互联 800GB/s、64 卡互联),论坛称 PAI 平台上使用 PPU 的企业客户已超过 800 家;训练侧发布 DLC 3.0(超节点加 HPN 8.0 网络、TurboX 加速套件、训练诊断工具);他估计如今还在做预训练的客户「绝对不超过百分之五」(嘉宾认为),平台的重心因此移向后训练——预告了强化学习平台(连接企业 Agent 的 trajectory trace 回收做 RL,把「异步 RL 太复杂、同步 RL 效率不高」的门槛降下来)和蒸馏套件,他那句「你可能需要雇一个数字员工,但不需要雇一个数字爱因斯坦」是对小模型定制路线最直白的辩护。
模型变多之后是管理问题:十个场景 build 出二十个模型,怎么管?他的答案是面向 agentic inference 的新推理服务(转写作「Pi Infor X」,疑为 PAI InferenceX),六层能力包括智能路由、KV Cache 降本、模型缓存预热、企业内团队 token 配额管理、模型版本兜底(例:旧版本找不到时默认兜底到新版本,转写中模型名「GRM」疑为 GLM),以及按场景一键套用的 SLO 模板。最后他坦白了今年最现实的约束:买芯片非常难,「即使我们阿里云,也很难在某一个地域全满足各位」,所以多地域统一调度成了平台的核心能力之一。
这条链的传导值得读者留意:Agent 长会话化→单位任务 token 消耗上升一两个数量级→推理优化从引擎单点转向「路由+缓存+配额+调度」的系统工程→二阶影响是模型舰队管理和 token 预算管理会像当年的云成本管理一样岗位化,而企业 Agent 的运行轨迹(trajectory)成为可以做 RL 和蒸馏的差异化数据资产→启发:现在就该把 Agent 轨迹数据留存下来,并按场景而非按模型规划推理预算。
四、六十万人的实验:央企智能体的技能生态与安全底线
中电信人工智能科技产品总监娄双双(转写作「楼双双」,按议程校正)从应用范式讲起:从 Chatbot(聊天问答)到 Agent(执行真实任务、达成目标),「端到端完成任务正在成为 AI 应用范式的主流方向」。她给模型侧算了一笔账:上下文从 8K-32K 扩展到 200K 甚至 1M;工作流智能体时代一次任务一到三次模型调用就够,自主智能体要十几次调用、十几万甚至百万级 token。破圈归因上她区分了两层创新:技术层的 Skill——把提示词、行业知识、配套工具脚本封装成一个结构,用渐进式披露解决上下文爆炸,「让通用智能体具备了无限扩展的手和脚」;产品层的记忆系统、心跳机制、IM 渠道三件套——让智能体知道用户是谁、能主动干活、随时可被找到,构成「养成式体验」,她认为这三件套已成通用智能体标配。她反复提到的「小龙虾」即 OpenClaw(转写原作「OpenCL」;公开信息显示该项目 2025 年 11 月发布,曾用名 Clawdbot、Moltbot),2025 年市场上也已有 Manus(转写疑似「Minus」)等产品。
中国电信的答卷是星辰超级智能体 TeleAgent:央企首个开源的全模态、全尺寸、全国产星辰大模型体系之上(嘉宾称),面向办公场景的自主式通用智能体,覆盖文档写作、表格处理、信息整合、办公自动化。论坛披露的规模数字相当醒目:中国电信集团 60 万员工人手一个桌面智能体工作台;技能广场上两万多一线员工贡献了超过五万个技能;外部公众市场用户近 100 万(均嘉宾称)。效果侧他们自建了覆盖四大办公领域、102 个细分场景的真实任务评测集,综合测算任务执行用时约为行业平均的 75%、token 消耗更低,并在上周 IDC 的企业级办公通用智能体评测(约 12 家参与)中进入前三(均嘉宾称)。安全则是央企的硬约束:多层防护框架、国家级评测证书,TeleAgent 是中国电信集团网信安部门唯一认证允许在办公场景使用的智能体产品,并在今年的实战演习中经受住考验(嘉宾称)。
这条链的关键在于规模与生态的互相成就:一线员工(而非算法团队)成为技能的生产者→技能广场供给越丰富,60 万人的使用黏性越强→二阶影响是 Agent 采购的硬门槛从模型能力转向「技能生态+安全认证」双指标,而易用性要用技术水平最参差的用户群来验证→启发:企业推 Agent 前先回答两个问题——谁贡献技能、谁审计权限;没有技能贡献闭环和安全审计的 Agent 项目,大概率停在演示阶段。
五、湖仓为 Agent 重建:卡住 95% 用户的语义、权限与血缘
DLF 产品负责人李鲁兵的两个洞察构成了整场论坛的问题定义。用户侧:论坛称 59.9% 的阿里云云上用户已在使用或应用 Agent,其中 48.4% 的实际场景是操作数据,「但真正的深度用户大概只有百分之五」——卡点是语义对齐、数据发现、调用衔接、权限管控。技术侧:过去两年湖仓为 BI 而建(数据汇聚、加速,时效从 T+1 做到秒级),这条演进已告一段落,下一步是 for Agent:让 Agent 在湖上运行、把上下文汇总到湖上,检索分析和强化训练共用一个平台,「让 BI 和 AI 使用同一份数据资产」。他把这个阶段称为 agentic lake。
产品方案上,底座用统一 catalog 兼容 Iceberg、Paimon 等主流湖格式(Apache Paimon 由阿里云主导推动,公开信息属实),一张湖表承载全模态:视频图片走 Blob、标签描述走 JSON Variant、向量字段异步建索引;管控面做行列级权限——「让 Agent 按需使用数据,而不产生更多越权行为」、KMS 加密、湖上 compaction 优化;性能面是 DLF Cache,让热点数据靠近计算,训练场景用快照和版本管理预热数据集,「GPU 不期望等待」。自报的基准测试显示数据写入效率提升 60% 以上、compaction 场景提升 90% 以上、检索读取至少一倍(嘉宾称)。血缘做到了文件级——不仅知道哪张表,还知道哪个文件经过了怎样的加工链路。案例侧:淘宝闪购的订单刷新处理降到 30 秒以内(嘉宾称),内部一张视频湖表的规模接近 1 EB(嘉宾称)。
把第五节和第四节放在一起看,湖仓 for-Agent 的传导链是:Agent 操作数据成为高频场景但深度生产率极低→瓶颈被定位在语义层与权限层而非算力→湖仓的价值锚点从数据新鲜度转向「机器可读的语义+细粒度权限+可审计血缘」→二阶影响是报表口径与 Agent 上下文同源,「报表当稳定器、Agent 当加速器」成为可执行的渐进策略→启发:上 Agent 之前先补语义层、权限层和评测集,这三样缺一样,Agent 就会卡在演示到生产之间。
六、从湖仓里长出 Data Agent:一家游戏公司的数据提效
乐享元游数据总监杨文锋(报幕时公司名被转写成「海南原油信息技术有限公司」,按官方议程与公开信息校正为乐享元游,2016 年成立的仙侠赛道游戏研发发行公司)的分享是全场最完整的客户视角。公司年研发投入超 1 亿、累计注册玩家超 3.5 亿、覆盖 20 多个国家和地区、单品运营周期超 9 年(嘉宾称)——长线运营决定了数据的重要性。数据平台五年走了五步:单服 MySQL、Celery 自研调度、ClickHouse 加 Elasticsearch、对象存储冷热分离,到去年底基于 Flink+Paimon+StarRocks 建成统一实时湖仓(StarRocks)。升级前的痛点极其具体:多地区版本数据物理隔离连不了表;OLAP 与交易耦合,报表查询影响在线玩家登录支付、为此出过事故;LTV 倍数预估研发侧和市场侧口径不一致;分析链路从策划到运营到分析师层层传递。
选型时的一个细节值得记下:他们对比多家厂商后选了 Paimon+StarRocks 而非更偏 Lambda 架构的 MaxCompute+Hologres 方案,「当时并没有把 Agent 适配性当做标准,但这是后面做 Agent 时发现的意外收获」。建成后的数字:月增日志超 10TB、管理 11000 多张表、实时报表延迟从 5 分钟到 1 分钟、千亿级数据规模下典型查询 1 秒以内(嘉宾称);经营报表从一天一更到一分钟一更、分析师人均报告产出提升 4 倍、LTV 预测误差比规则模型下降 27.6%(嘉宾称)。新的实时礼包推荐场景五天上线,礼包购买提升 3.7 个百分点、金额提高 26%、服务 1.6 秒内完成(嘉宾称)——快的原因是特征级复用(新算法直接用 DWD 层沉淀的字段)加弹性伸缩(不用预留固定资源)。
今年 6 月上线的 Data Agent「小问」是这场分享的核心。支撑它的是三件事:统一入口(StarRocks 贯穿 ODS 到 ADS 层、支持湖表仓表关联,降低 Agent 取数复杂度)、业务知识沉淀(日志规范、分层模型、指标语义、分析师的分析框架沉淀进 skills)、强约束加评测(提示词鉴权、SQL 强制鉴权防越权,基于实际业务整理了超过 150 条测评集,实际任务通过率约 85%,嘉宾称「基本可用」)。他们的风控姿态很务实:报表仍然是数据准确性的稳定器,「并没有把所有报表直接压到 Agent 上」。最生动的案例是一次滚服排查:Agent 的周期任务告警 ARPU 与新增付费激增,专家只给了三句提示词——是不是大 R、回流还是纯新增、多少玩家被号召一起滚服——Agent 从充值订单、元宝消耗、账号设备、公会战力多方向交叉验证,甚至识别出了代练设备,约两小时三个长任务定位了合服导致的集体滚服,而过去这类排查粗略估计需要 1.5 人天(嘉宾称)。杨文锋的总结是全场对「人机分工」最清晰的表述:Agent 不是自己做决策,而是专家用提示词指导方向,Agent 负责取数、关联、推理和交叉验证——「把数据资产和专家经验转化成可以复用的能力」。
七、数据工程的自动驾驶分级:从 L0 到 L3
最后两场演讲共同贡献了一个坐标系。阿里云 DataWorks Data Agent 研发负责人朱佳墩用一个案例开场:运营小陈早上 8:52 接到老板「下午两点给我一份数据」的要求,这条看似简单的任务在数据工程上是完整长链路——需求下发、理解业务、找数据、生成报表、分析、多轮校验——过去整体约需两个工作日,而「跑出第一份数据和真实觉得数据安全可靠之间还存在很大的 gap」。Data Agent 的定位是生产级数字员工:7×24 在线、多渠道连接、集成 15 个专家套件约 80 个技能完成冷启动(嘉宾称)、靠知识库和反馈持续进化。取数场景被拆成四步:找候选表、对口径、按血缘上下回溯、产生分析——其中口径和血缘是准确性的两道闸,因为下发给 Agent 的往往是业务口径而非实体表名,「必须把口径对清楚之后,你的任务才是准的」。
演示链路里最有意思的是多模态归因:发现某段日期环比下降 20% 后,Agent 先连钉钉聊天群复原当时现场,再抽样直播视频看话术与突发状况,结合订单表和用户画像判断——「转化率不仅取决于素材本身,更取决于这场直播进来的用户画像」,价格敏感型用户适合素材 A、功能介绍需求型适合 B。整个分析可以一句话变成每天执行的定时任务。安全架构强调数据不出域:通过 MCP 和 Skill 在同一 VPC 下访问企业数据,「不像现在很多 Agent 一样,需要把你的数据 down 到本地去分析」,配以租户隔离、最少权限和每次操作的安全审计。朱佳墩借用自动驾驶 L1-L5 给数据工程自动化分级(谁执行、谁监督、谁兜底),自评目前大部分情况 L3、一部分 L4(Agent 自主监督完成重复工作,人兜底;部分场景 Agent 执行失败可自行恢复回滚),而 L5 单靠 Agent 本身做不到——需要企业把员工脑子里的技能沉淀进知识库。终局判断是:数仓团队聚焦业务与数据架构、以知识库形式沉淀到 Agent,「人人都是数据工程师」。
微财科技数据智能部总监邢捷(转写作「邢杰」,按议程校正)的分享是这个分级在金融风控领域的具体实现。特征开发是「特征喂给模型、模型喂给策略、策略做决策」这条数据驱动范式的地基。L0 用大数据替换即时计算:实时特征用 Flink 预计算、离线特征用离线计算,全量用户等级刷新从月刷变日刷,「对业务的提升是巨大的」。但 L0 暴露出两个问题:开发效率反而更慢(多了数据探查和逻辑核对,还要回溯贴源层逐级分析),质量不稳——上线一年出了两次 P0、一次 P1 事故,都因开发规范未被严格遵守(嘉宾称),「既快不起来又稳不下来」。L1 的解法是把规范固化进分层建模(特征原子层、计算层、特征池)和平台化流程,测试与上线自动化,人只关注开发阶段。L2 把数仓能力封装成 CLI,团队把开发经验「自我蒸馏」进 Skills。L3 在流程里嵌入四个智能体,实现从需求提出到完成全程无人工,打磨方式是把历史需求梳理成样本逐一回归测试、精调流程和智能体(嘉宾称)。他的收尾不是效率而是人:这个项目更大的价值是把特征开发人员从「又忙又无聊」的工作中解脱出来,让他们成为智能体的开发者,「重塑了这个团队的价值」。
这条链可以概括为:规范靠人遵守必然失效(微财一年两次 P0 是最硬的证据)→把规范固化成平台流程、把经验蒸馏成 Skills、把存量需求变成回归测试集→二阶影响是数据工程的人力结构从执行者转向智能体开发者与监督者,「人人都是数据工程师」的前提恰恰是先有一批人把数仓和知识库建好→启发:想上 Data Agent 的团队先自问「我的规范能不能变成代码、我的历史需求能不能变成测试集」,两问都是否,就还不到谈 L3 的时候。
收束
八场演讲拼在一起,最一致的不是任何单项产品,而是一个方向性的判断,王鹏的表述最完整:技术架构已经从资源的供给方、业务的支持者,转变成了业务流程的参与者——尤其是智能体驱动的业务流程中的一环。湖仓不再只服务报表,训推平台不再只追求吞吐,数据规范不再只约束人:它们都在被重新设计成可供 Agent 调用、由 Agent 驱动、对 Agent 审计的形态。往前看,值得盯住的观察指标有四个:深度生产用户能否从约 5% 的占比抬升(这是 agentic lake 是否成立的最终判据)、企业内技能广场的一线沉淀速度(决定 Agent 能力边界的扩张斜率)、Agent 任务通过率与单位 token 成本曲线(决定「又快又好又省」能否同时成立)、以及多地域多芯片调度能力(算力供给约束下的真实竞争力)。对这些指标的有效性,论坛本身并没有给出独立验证——所有数字均为讲者自报,这也是读者评估这场论坛成色时应有的保留。
信源附记:本文基于论坛现场录音的 ASR 转写整理,人名、公司名与产品名已按官方议程校正(如卓驭、娄双双、杨文锋、乐享元游、朱佳墩、邢捷等);无法确认的转写疑似项(如「GRM」疑为 GLM、「Minus」疑为 Manus、「AI Square 的 Info」疑为 AI for AI Infra 等)在文中保留标注,未作静默修改。