先说结论
云栖 2026 这场专有云论坛最值得记住的,不是又刷新的规模数字,而是一个集体转向:当 Agent 从演示品变成"员工",云厂商和客户的重心同时从"给算力、跑模型"挪到了"管治理、算清账"。阿里云智能集团副总裁、专有云总经理刘国华的数字分身 Felix 交出的年度账本仍然亮眼——2400 万 vCPU、1.5 万 PB 存储、三个万卡级智算集群([120s-240s]),但后面八位嘉宾里,有六位的话题落在成本核算、权限重构、审计留痕和考核度量上。交通银行薛威的总结最有代表性:智能体规模化落地,“质量度量+成本核算+安全审计"三个维度决定天花板([5280s-5400s])。这背后有一条贯穿全场的行业逻辑:AI 的生成成本在骤降,但验证、授权、记账的成本在骤升——新的瓶颈不在生产力一侧,而在治理一侧。对读者的直接启发是:无论你在什么行业,现在建评测集、成本账本和权限模型,比再上一个新模型更能决定两年后你能不能把 AI 用到生产上。
数字分身代读的年度账本,和一张国际化的成绩单
论坛开场由一位 AI 主持人和搭档 OpenTruck(转写记音,疑为阿里云智能体相关产品名的口语称呼)串场,随后刘国华请出自己的数字分身 Felix 代作业务汇报——这个安排本身就是论坛主题的注脚:连年度汇报这种场合,数字分身都已经"上岗"了。Felix 的成绩单包括:专有云管理超过 2400 万 vCPU 和 1.5 万 PB 存储,服务 1300 多家客户;交付三个万卡级智算集群,管理 AI 算力超 3.6 万 P;一站式 MaaS 平台 OpenTrek(转写作 OpenTrack,官方拼写为 OpenTrek)服务超 130 家客户([120s-240s])。市场侧,节目引用 IDC 中国混合云与私有云研究称,阿里云在 S 层软件和 PaaS 软件及服务两个市场的份额与同比增速均居第一;Gartner 分布式混合基础设施象限中今年首次从 Niche Players 迈入挑战者象限,Felix 称其为"首个成功破圈的亚洲厂商”([120s-240s])。
国际化是这份账本的另一半。下个月(10 月底)非洲首届奥运赛事——达喀尔青奥会将由飞天企业版承载票务等核心应用,全部部署在非洲本地,赛后整套云基础设施移交塞内加尔国家数据中心,“从赛事云转变为国家云”([120s-240s])。这一细节已获外部佐证:阿里云 2025 年 8 月官宣以飞天企业版(Apsara Stack)支持 2026 达喀尔青奥会。Felix 还汇报了国际化一年的总量:服务 21 个国家和地区、超 8000 台服务器完成本地化部署,把蚂蚁钱包式数字金融方案、运营商智算运营经验和主权云方案输出到东南亚、非洲、拉美和中东([240s-360s])。刘国华随后的总结把这套打法说得更直白:“把中国的最佳实践复制到全球的每个角落”([240s-360s])——即先在国内最复杂、最大规模的环境里跑通,再以本地化方式向海外复制,这也是"可信"一词在他们语境里的商业含义。
“可信"不只是口号,现场安排了一场颁证仪式:中国电子技术标准化研究院软件应用与服务研究中心主任王志鹏向阿里云颁发 DOMM AI 增强版五级评估证书(转写连记为"DOMMAI”,按主持人"将人工智能能力融入开发运维全过程"的说明整理),刘国华代表领证([360s-480s])。加上产品总监谢宁随后披露的"全国唯一且首家通过等保五级"([1080s-1200s])——后者经查有官网佐证:2025 年 10 月飞天企业版以 97.55% 符合率成为全国首个且唯一通过第五级信息系统安全评估的云平台——可以看清专有云的叙事策略:用第三方评估和合规等级把"可信"做成可采购、可审计的卖点,而不是形容词。
云底座的改造:Agent 要的是沙箱、秒级唤醒和一本 token 账
谢宁的架构演讲给出了今年全景图最大的变化:去年发布的是"AI Native 专有云",今年整个平台进一步演进为"Agent Native Cloud"(转写原音记作 Identity Native Cloud,结合其通篇"所有 AI 都进入了 Agent 时代"的主题推断为同音误录)([480s-600s])。这个词不是话术——它对应一整套底层改造。谢宁把 Agent 对基础设施的冲击归纳为三点:传统应用轨迹确定、Agent 有幻觉且轨迹不确定;因此资源密度要从"一台虚拟机切几十份"走向"成百上千个沙箱",隔离要求随之提高,而 Agent 又非持续运行、需要秒级唤醒与休眠([600s-720s])。阿里的解法组合是 DPU 加自研虚拟化卸载(VMOP)、serverless 动态调度与沙箱:热启动约 25 毫秒、冷启动约 200 毫秒(年底目标 170 毫秒),单机可拉起 2000 个沙箱、年底计划通过内存全量持久化到块存储提升到 4000([600s-720s])。一个容易被忽略的数据是:AI 应用只有约 12% 的时间真正在调 GPU,88% 在调辅助 CPU([720s-840s])——这解释了为什么调度层必须同时管 GPU、CPU 和上下文,也预示了后文所有"token 账本"问题的物理来源。
数据层的提法同样围绕 Agent 重构:从以检索为主的数仓形态演变为多模态数据湖,其上叠加知识工程、上下文工程与数据安全治理([840s-960s])。谢宁举了一个电力行业案例:老专家做全量设备检修规划过去要数月,把数据抽取为知识后,建模效率提升到"当天"水平,需求响应从数天缩到数小时([840s-960s])。效率侧,他给出了一串"平台+模型+框架三层协同优化"的数字:吞吐率比开源方案高约 8 倍、TTFT 时延降低五成以上、等效成本降低 68%;存储侧四级缓存(显存→内存→本地盘→云盘)实测命中率 60%~80%,相当于再降约 75% 成本;后训练侧,某海外金融客户用 9B 千问蒸馏模型达到 397B 模型的效果,推理成本下降 80% 而性能持平或略优([1080s-1320s])。这些数字均属厂商自述,但方向一致:推理与后训练的单位成本正在被系统工程快速压低——这正是后面所有客户敢谈"规模化"的前提。
供给端之上,毛亮亮发布了 OpenTrek 平台的三个产品特性,每一个都在回应"AI 投入大、效果差"的企业痛点([1440s-1560s])。第一是企业数字员工:与办公助理的本质差别是"为组织而生"——有岗位画像、职责边界,可招募、可赋权、可考核,员工使用中产生的知识与技能沉淀回流组织而非个人端侧,数字员工离岗时技能可归档([1680s-1920s])。这实际上是把 HR 的组织管理方法论平移到了 AI 资产上。第二是企业级 AI 知识库:支持五大模态、三十种文件格式,自研 0.8B 高精度文档解析模型,11 种检索工具多路并行召回,端到端检索准确率称可达 90% 以上([1800s-1920s])。第三是 Agent AI 飞轮:把智能体运行产生的 trace 数据回流,经长程归因、SOP 流水线和 SFT/RL 训练,蒸馏出特定场景的小模型,“越用越懂业务”([1920s-2040s])。黄江伟则把这层能力总结为"统一 Agent 运行时"三件套——Agent Ops(统一接入、智能运维、五层全景监控)、Agent Runtime(沙箱隔离、休眠唤醒、兼容十余种主流框架)、AI 网关(鉴权限流、智能调度、token 账本)([4440s-4800s])。他的两个判断值得记录:Agent 必然演进成复杂的分布式系统;支撑这种系统的运维管理能力将成为下一代 AI 云的关键能力([4440s-4560s])。
客户上台算账:光明顶、新烟囱与两千万元的常驻模型
如果说上午的产品发布是"平台视角",下午的客户分享才是这场论坛信息密度最高的部分——因为每家都带着真实账本上台。阿斯利康中国首席架构师金毅的分享可能是全场最诚实的一段:“我不吹嘘我们多牛,吹嘘多牛一点技术含量都没有”,他形容做完企业知识库后"仿佛站在光明顶,被公司各派围攻"([2880s-3000s])。六大门派的拷问是:精准(医药公司"只有 100% 准确率的要求",一个单词都不能错)、聪明(不能只会读 FAQ)、权威(信息必须最新无歧义)、快(不能等 30 秒)、安全、以及领导追问"到底有什么应用场景"([3000s-3120s])。规模背景是约 15000 名用户、十几万份文档([3120s-3240s])。他把矛盾的根源点破得很到位:个人版 AI 工具门槛极低(他调侃"连我妈都在问我 AI Native"),个人版在倒逼企业版,而用户"宽以待己、严以待人"——自己的 AI 出错会原谅,企业的 AI 出错会追责([3120s-3240s])。他的应对有几条可迁移的原则:先想清楚"不做什么"(企业知识库的对手不是个人版);分级解决(术语表、规则库、RAG 能解决的绝不上 Agentic Loop,“没有办法用一个最强的方法解决所有问题,因为那个方法可能太贵了”);知识要按业务场景重新建模而不是切片了事;尽快建两套评测集——业务规则一套、技术一套;点赞点踩数据根本不可信,考虑"用 AI 自动评价 AI"([3240s-3720s])。他还提到一个尚未收敛的变量:一个几天前刚发布的新模型(转写记音为 GAB,具体名称无法确认)让知识库路由不再需要自训小模型,实测近 90% 准确率且更快更便宜——“传统方法可以,但可能会被迅速淘汰”([3360s-3480s])。
北大医疗集团智能与数字化部总经理乐颖提供了医疗行业的结构化视角。他把 AI 应用分成三代:任务型(单点辅助)、人机协同 Copilot、全流程智能体,本质区别在于前两代"仍然是人在用系统",第三代才是"系统被 AI 调用"([2160s-2280s])。他们上线了 30 多个影像模型、约 15% 的检查检验诊断建议由 AI 辅助,体检总检报告从 10 分钟以上缩到几分钟([2160s-2280s])。但他坦承前两代的困境:接口难做、AI 能力成了新烟囱(“我们在信息化时想避免烟囱,AI 又变成另外一个烟囱”)、运行难监控;Copilot 则让医生"用的东西更复杂了",不同厂家的 Copilot 互相打扰([2280s-2520s])。他们的重构路径是以智能体为中心重塑临床交互:系统工具化、医疗服务做成两层 skills(可标准化的 SOP 如挂号医嘱做通用,依赖医生隐性知识的做个性化)、权限管理绝不交给智能体自判(“医生能不能开麻醉药品、能不能做手术"必须由权限体系把关)、执行全程留痕审计([2520s-2760s])。目前已梳理出 14 个业务域、97 个工具的 MCP 层([2640s-2760s])。乐颖点出医疗难标准化的深层原因:行业只有红线级规范而缺 L3/L4 级 SOP,且医生直觉是隐性知识——这也解释了为什么 skills 必须分两层([2640s-2760s])。
交通银行薛威与民生银行林冠峰的分享,几乎构成了一份金融业 Agent 落地的对卷。薛威列出金融业四大挑战:资源容量(从百级用户向全行万级推广时智算通算双瓶颈)、全链路可观测(传统监控和 tracing 体系不满足)、安全合规(现有权限面向可信环境的菜单式设计,需按零信任重构)、持续进化(业务部门"今天说 GLM-5.2 好、明天说千问 3.8 好”,却拿不出依据)([4920s-5040s])。交行的答案是"六可"能力模型——可接入、可观测、可度量、可优化、可核算、可审计([5040s-5160s]),配套动作包括:基于 OpenTelemetry(转写记音 Open Parametric,按可观测语境推断)对接行内多种异构框架(AgentScope 2.0、Spring AI、LangChain 及与阿里探索的金融级底座框架,转写记音 Phoenix Scope);把高危工具关进统一沙箱、以企业级 MCP 工具形式供给各智能体;扩展 RBAC 权限模型以描述"每个员工及其数字分身"的工具权限与数据范围;建立"场景→模型→算力"三层穿透式成本治理,能回答"交行 400 多个 AI 场景每天消耗多少 token、多少成本"([5160s-5520s])。薛威还提到监管变量:金融监管部门"八号文"对银行业 AI 应用安全治理提出了系统性要求(嘉宾提及,未另行核验)。
中国石化工业智能体专家张杨的账本最直观。石化是典型流程工业,油藏开发方案这类任务需要检索重排、多模态识图、达西公式机理计算、油藏数值模拟器等多种模型协同,“不是一个模型能够包打天下”([5640s-5760s])。问题在于规模:集团机理模型保守估计 10 万个以上、机器学习模型超 1 万个,多数低频使用(有的几个月才调一次),传统模式逐个常驻,仅此两项每月算力成本约 2000 万元([5760s-5880s])。中石化的解法与黄江伟的 Agent Runtime 完全咬合:裸代码脚本(Python 或 Fortran 求解器)上传至"模型车间"自动打包,智能体调用时经 AI 网关鉴权、调度器发现实例为零则三秒内拉起 GPU 沙箱,执行完彻底释放——“把工业模型从长驻服务转向即用即算”([5880s-6000s])。按每模型每月调用两次、每次 30 分钟估算,机理模型月费从约 1400 万降至约 140 万,机器学习模型从约 1100 万降至约 110 多万([6000s-6120s])。张杨点出了这笔账的深层意义:成本降下来之后,过去因不划算而从未上线的低频模型终于可以部署,企业可调用的"可计算、可校验的专业能力"反而变多了([6000s-6120s])——这是"基础设施任务化"带来的供给侧扩张。
吉利汽车云技术平台总监黄久远的故事则是 token 运营的教科书案例。今年吉利 token 消费量指数级上涨,评估年底每月 token 费用将达千万级;而此前 AI 接入网关覆盖率仅 4.5%、业务自建网关超过 20 个、七种大模型流量烟囱式并存([6240s-6360s])。治理动作包括:统一接入云厂商中立的智能网关(以合规和 IP 管控策略强制收口)、对后端模型建立"有效交付单价、输出质量、峰值吞吐、请求错误率、首 token 延迟"五维评测打分(避免"谁先接入用谁")、把个人用户成本映射到部门预算、agent 调用映射到产品颗粒度、按 T0-T2 分级管控(核心 To C 场景只告警不降级,行政办公类超限直接降级到私有化大模型甚至停用)([6360s-6600s])。他们还发现 20% 的用户消耗了公司八九成的 token 费用,并用缓存亲和性路由压成本(缓存命中后 token 费用呈指数下降)([6480s-6720s])。结果是 4000 多个 agent 统一纳管、单位成本降约三成([6720s-6840s])。
从写代码到写报告:确定性交付的两条战线
论坛后段,两家机构展示了 Agent 进入高专业性生产环节后的新问题:产出可以很快,但行业要的是确定性。阿里云王伟先给了一组反差数据:2024 年至今 AI 使用率大幅上升,但对"AI 是否真能进入企业工作"的信任却在下降——因为 AI 生产越快、验证成本越高(“验证税”),任务过程变成人工对话后难以审计追踪,token 是否产生价值成了一笔算不清的账,而且"超级个体不等于超级团队"([6840s-6960s])。他的产品回答是企业级 AI 原生应用平台:人定义目标与标准、AI 执行、人验收、全程可追溯,并发布企业级 AI Coding 产品 DevX;他的论断是"代码是二维世界里可审计、可编译、可追溯、可结构化的知识",主张把行业任务的规格编译成代码(转写记音 No House Code,具体产品名以官方为准),让组织经验变成可执行的软件资产([6960s-7200s])。
民生银行林冠峰的分享恰好是 DevX 的用户侧印证。他梳理了 AI Coding 的三段演进——2023 到 2025 上半年的 Copilot(补代码快)、2025 年初的 Vibe Coding(边聊边写)、2025 下半年以 Claude、Codex 为代表的生成式编码(规划到生码)——并引 Gartner 报告观点:智能体在同时放大组织与个人的优势和劣势,“AI ready 不足的团队上了 agent,agent 是添乱的”([7320s-7560s])。民生的四个手段是:把代码而非文档当作最关键的研发资产,做代码隐性知识的显性化(既面向人也面向 AI 的上下文供给);工具转型支持多点协同把上下游"卷进来";引入规格驱动开发(SDD)工艺追求稳定生码;治理先行。他对 SDD 的账算得诚实:需求到设计的前置开销一定增加,生码开销节省,因此 SDD 不是万能的,三到五天颗粒度的任务比较适配([7560s-7680s])。他还有两个管理者视角的判断值得摘录:AI 代码采纳率、AI 代码占比这些旧度量"参考意义已经很小了"(因为八成代码都交给 AI 开发),度量要转向产能、质量、风险;而生码会加速技术债积累、测试与评审环节会成为新瓶颈(“AI 的产出产量很高,人类的吞吐是有限的”)([7800s-7920s])。
联众医疗董事长柴雪挺提出的问题最微妙:影像智能体已经能用视觉语言模型独立完成 DR 几乎所有部位、所有病种的判断,但"病灶发现之后,报还是不报"是一个临床衡量问题——轻微脊柱侧弯 AI 报了而临床建议不报;极细小的手指骨折医生不报是"衡量过"(避免让病人做进一步检查),AI 不报则是错误,“即便医生不采纳也要报”;金属纽扣太明显反而不必写([7920s-8280s])。他给出的技术路径是"类专家校准"(今年刚提出的自适应强化学习方法)加多模态原则(结合电子病历、检验、病理等判断),并定义了一个关键量化指标:零修订审核率——医生拿到 AI 报告后不经修改直接通过的比例,首次测评已接近 70%,“相当于一个硕士生的水平”(完整版录像转写校对;正片转写此处含糊),随训练进化有望向主任专家水准爬升([8280s-8640s])。这套"基座派任务、智能体执行、医生验收、结果回流反向训练"的双回路机制,与北大医疗的留痕审计、民生的 SDD 验收在结构上同构:高专业度场景里,人的角色正在从执行者移动到"定义标准并验收"的位置。
东南大学东方教授的分享为这场企业叙事补上了学术与人才一环:大数据计算中心建成 2 万多 CPU 核、400 多块 GPU 卡的资源池,服务 31 个院系、800 多个课题组、3500 多人;与材料学院刘加平院士团队、阿里云三方合作训练了千亿级"砼真砼知"混凝土大模型(正片转写记音"同真同质/刘嘉平",经外部核验校正为砼真砼知、刘加平,该模型确为国内首个混凝土领域垂域模型),用于南京北站建设([4080s-4200s]);三方分工——学科出数据和业务逻辑、中心做技术落地、阿里云做平台支持——被设计成可复制的合作模式([4200s-4320s])。他们与阿里云合办的 AI 应用创新大赛第一年就有 100 多支队伍参赛,东方的定位是教育者式的:“AI 是很好的工具,但不能替代人的创造力”([4200s-4320s])。
分歧、边界与启发:从"用 AI"到"信 AI"还有多远
把全天内容压成机制链条,至少有四条值得读者带走。
**第一条:生成成本骤降 → 验证与记账成本骤升 → 竞争点转向治理能力。**谢宁的吞吐 8 倍、成本降 68%,毛亮亮的场景蒸馏 9B 替代 397B,都在压低单位生成成本;但王伟的"验证税"、薛威的"六可"、黄久远的 token 账本说明:当产出便宜到可以无限生成,贵的是验证、授权和核算。二阶影响是,企业 AI 的预算结构会从算力采购转向评测、观测与治理体系建设。读者可以自问:我所在组织的 AI 产出,有没有一套独立于开发团队的验收标准?金毅"两套评测集"的做法(业务规则一套、技术一套)是最便宜的起点。
**第二条:低频长尾负载常驻 → 基础设施任务化 → 专业能力供给扩张。**中石化 10 万个机理模型月耗 2000 万却多数几个月才用一次的账本,以及沙箱三秒拉起、用完即释放的机制,把"资源占有"模式改成了"任务驱动"模式。二阶影响常被忽略:成本下降不只是省钱,它让过去永远上不了线的长尾模型获得了上线资格,企业可调用的可校验专业能力反而增多。读者可以审计自己组织里有多少"常驻却低频"的计算负载——这可能是最容易被自动化掉的成本。
**第三条:个人版 AI 普及 → 企业被消费级体验倒逼 → 知识治理重新成为核心资产。**金毅的"光明顶"讲透了机制:员工用惯了五秒响应的个人工具,就会对企业的 AI 提出同样苛刻的要求,且不再容忍错误;企业被迫从"功能正确"升级到"权威、及时、可问责",知识管理的流程(版本、权威源、更新机制)比算法调优更决定成败。他"如果 AI 不能改变公司的 SOP,就只是 nice to have"的判断,与乐颖把医疗服务拆成两层 skills、林冠峰把 SDD 织进研发工艺,说的其实是同一件事:AI 的价值上限由它嵌入流程的深度决定,而不是由模型能力决定。
**第四条:Agent 获得工具调用权 → 权限体系从可信环境转向零信任 → 合规成为规模化门槛。**薛威发现银行现有权限是面向"可信环境"的菜单式设计,乐颖坚持麻醉药品、手术权限绝不能让智能体自判,交行把沙箱做成企业级 MCP 工具统一供给——Agent 每多一分自主规划能力,权限、沙箱、审计就要多一分重构。二阶影响是监管加速入场(金融"八号文"被两位银行讲者各自提及),“可审计"正在从技术特性变成采购资格。
当然,这场论坛也有它没回答的问题。所有效能数字(90% 检索准确率、90% 自运维、零修订审核率 70%、成本降三成)都是厂商或供方客户的自述,缺乏第三方口径;数字员工的"可考核"目前更多是平台提供了考核的钩子,真实组织里如何为 AI 岗位定价、追责,全场没有展开;金毅提到的新模型可能"迅速淘汰"自训小模型的路由方案,也提示这套以蒸馏和小模型为中心的体系本身就处在技术半衰期中。谢宁展望的"私有数据→私有模型→更高质量数据"的自进化飞轮([1320s-1440s]),与其说是结论,不如说是明年论坛可以拿来对账的假设。
论坛的最后发布了专有云在线培训认证平台,收尾 slogan 是"可信 AI 云,中国实践,全球共享”([8640s-8686s])。这个安排同样切题:当产品迭代的速度超过组织吸收的速度,“认证"就成了把实践转化为行业资产的最后一公里——这大概也是这场论坛真正的潜台词:云栖上的专有云,卖的已经不再是一朵云,而是一整套让 AI 可以被组织雇佣、考核和信任的管理制度。
外部核验说明:①"双I战略”(AI+International)确系 2025 年 9 月 25 日云栖大会发布,与 Felix"去年提出"表述一致(阿里云政企业务官网);②Gartner《2026 年分布式混合基础设施魔力象限》首次入围挑战者象限获媒体佐证(2026-09-17 报道,官方口径为"亚太排名最高厂商",与论坛"首个亚洲厂商破圈"表述略有差异),且官方报道确认产品拼写为 OpenTrek;③达喀尔 2026 青奥会由飞天企业版支撑获阿里云 2025 年 8 月官宣佐证;④等保五级:官网 2025 年 10 月载飞天企业版以 97.55% 符合率成为全国首个且唯一通过第五级评估的云平台;⑤"砼真砼知"混凝土大模型及刘加平院士团队获科学网报道佐证(由全国重点实验室、东南大学大数据中心与阿里云共同打造)。其余数字均为论坛现场陈述,归属各讲者。