先说结论:这场论坛真正讨论的不是「AI 能不能运维数据中心」,而是一道算术题——基础设施的规模和复杂度在十年内十倍增长,运维人力不可能十倍增长,中间的缺口只能由 Agentic AI 填。阿里云基础设施团队给出的路线图是三级跃迁:认知进化(让 agent 自主感知数据、自生长知识、像专家一样推演)、行动进化(从图纸设计到整机柜维修的全生命周期自主闭环)、自我进化(具身智能进现场、Agent 自己创造 Agent)。支撑这条路线的不是模型能力的许诺,而是一组可以被工程检验的数字:设备接入自动覆盖 99% 以上、根因定位准确率 96%、故障定位时长下降 75%、测试回归通过率维持 90%、修复率从 40% 提到 80%、时序推理成本降 90% 以上、人工介入次数下降 70%(均为讲者自报口径)。对圈外读者,这场论坛的价值在于它把「Agent 上生产」拆开给你看:哪些环节靠模型,哪些环节必须靠工程,以及人的经验最终沉淀到了哪里。
规模先行的账:为什么运维必须自进化
陆增义(阿里云智能集团基础设施运营平台产研负责人)的开场没有先讲 AI,而是先算了三笔账。第一笔是宏观投资:全球 AI 数据中心资本开支从 2021 年的约 2100 亿美元涨到 2025 年的约 7140 亿美元,而同期石油行业资本开支从 3590 亿美元到 5700 亿美元——2025 年,数据中心资本开支第一次超过了石油(自报口径,具体数字未获独立来源,但与多家机构对 2025 年趋势的判断方向一致)。他引用了英伟达黄仁勋的一个判断:未来二十到二十五年,数据中心就是现代的石油(节目引用,转写中该对话的日期与场合存疑,未单独核实)。第二笔是微观结构:传统 CPU 机柜功率约 10 千瓦,AI 液冷整机柜以 100 千瓦起步、最新一代达到数百千瓦,功率密度几十倍增长。这直接改变了故障时间窗口——风冷时代温升故障大约有半小时处置时间,液冷时代缩短到几分钟,只剩原来的十分之一;整机柜一处故障影响的用户面是过去的十倍二十倍,故障半径十倍级扩大。第三笔是公司战略:他援引吴泳铭在前一天开幕式上的说法,阿里云规模将从约 2GW 向 20GW 增长(外部核验:吴泳铭 9 月 22 日开幕式演讲,目标 2032 年全球数据中心规模超 20GW;高盛等机构估计阿里云当前算力约 4-6GW,「2GW」为讲者口径的约数)。
三笔账叠在一起的推论是:规模十倍、复杂度十倍,对运维团队的压力是百倍级,而行业不可能在短时间内培养出十倍的运维人员。这就是整场论坛的问题起点——运维必须从人力驱动转向 Agent 自主行动。这个叙事对其他行业同样成立:只要需求增速结构性超过人力增速,自动化就不再是降本选项,而是产能前提。读者可以把「资本开支曲线先于运维范式转变」当作一个通用观察指标——投资结构切换的那一刻,就是下游运维、交付、组织形态被迫重构的起点。
认知进化:把物理规律和专家推演装进 Agent
认知进化的第一层是数据接入。牛名一(技术专家)描述的现状是:单栋数据中心楼有几万级设备、上百万个点位、几十种协议、数百个设备类型,而设备识别、采集配置、数据验收三个环节此前全部人工交付,结果是设备遗漏、配置繁琐、校验覆盖不足。他们的做法是把这些环节拆成多 agent 协同:感知 agent 把设施档案库、图纸点表、协议手册变成「设备画像」;配置 agent 做语义对齐——三家厂商的 active power、total power 都映射到「总功率」这个标准指标,再叠加物理量校验(瓦与千瓦差一千倍,生成单位转换表达式)编译成采集规则下发网关;验证 agent 则把物理规律封装成可调用的 skill,用「功率守恒因子图」校验总表功率是否等于分表之和加损耗,超容差就沿因子图定位到具体电表的倍率配置存疑,反馈给配置 agent 复采闭环。两个自报数字:设备自动覆盖 99% 以上、根因定位准确率超 96%。这里有一个值得迁移的细节——用守恒律做数据质检,本质上是不依赖标签的异常检测,任何有「总量等于分量之和」约束的领域(财务对账、能耗、物流)都可以复用。
第二层是知识自生长。郑天(高级技术专家)指出企业知识(文档、SOP、沉淀的经验)人工维护太重,文档写完一次就不再更新。他的方案是给知识装上代谢系统:多源数据经过处理引擎变成「实体—关系—时序—来源」四元结构(他明确对标 Palantir AIP 的本体论路线,外部核验成立),检索时不直接生成 SQL,而是先走中间语义层再编译;知识进化是一个循环——感知、归因、发现冲突或陈旧,由小模型和策略做决策,做「知识晋升」(把散落的经验升格为结构化知识)和冲突修复,再在评测集上验证变好了才采纳,检索侧永远返回最新知识。第三层是专家推演的显式化。刘炯宙、陈润青(高级算法专家/工程师)用一场真实故障复盘说明问题:17:52 制冷异常被当成测试信息,18:44 冷通道超温被判为仅需关注的温升事件,19:16 GPU 宕机被当作疑似计划内重启——三个事件分散在不同系统与时间点,没有任何系统识别它们是同一条故障链,最后是专家查图纸发现四台设备共用一个中央配置、冗余失效,才串起来。他们的方案是在故障前把图纸、配置、规程建模成对象—关系—约束,故障中做时空对齐加多假设因果推演,故障后持续验证温度回落、设备运行。试点数据(自报):故障定位时长下降 75%,跨域故障一次定位率上升 73%,历史知识有效命中率 80%,新复盘知识回流率 85%。刘炯宙也坦承了反方场景:传感盲区、异步采样、机房改造导致的图纸漂移、温升叠加掉电的组合故障仍是难解的 counter case,下一步要靠实景持续校准和不确定性推理。这条链的二阶影响在于:告警孤立刻画的是所有监控体系的通病,而「时空对齐+多假设推演」是唯一被验证过的显式化专家推理的路径——它把「等专家来」变成了「知识被激活」。
上生产的三道门:稳定、安全、进化
认知就绪之后,杜宇(高级技术专家)回答的是「从 demo 到生产」的鸿沟,他的三问框架是整场论坛最具通用价值的部分。第一问是稳定:同一个问题问 agent 三次,会不会给出三条不同的排查思路?他的解法是给 agent 一张「运维地图」——由实体、关系、数据、知识四部分组成的运维本体,并总结出一条关键经验:确定性的事情交给系统(架构、业务知识、固定流程都下沉到本体里,减少 agent 发散),不确定的推理交给 agent。第二问是安全:运维 agent 会执行重启、关机这类对物理世界有真实影响的有损操作,一次误操作可能就是 P0 故障。他举了外部新闻作对照——某用户把邮箱托管给 agent,agent 误删全部邮件,个人场景尚可容忍,运维场景完全不可接受。解法是所有有损操作进管控系统、agent 不得直接操作机器,管控层做三层门禁:权限校验(有没有对这个实体的运维权)、状态校验(是否在变更窗口内)、影响面校验(是否会伤及在保业务),任何一层不过就拒绝并通知人,高危操作全程留痕可审计。他给出的原则是「可控大于自动」。第三问是进化:用工单驱动,异常消除打正样本、未消除打负样本,异步归因负样本是知识缺失、工具权限还是走了弯路,再自动优化本体;agent 完全不会处理的,定义为知识缺口转运维。三个自报结果:测试回归通过率一直维持在 90% 左右、从未因 agent 越权导致线上故障、运维系统修复率从 40% 提升到 80%。
这套框架的价值在于它把「敢不敢让 agent 上线」从文化问题变成了工程问题。机制到二阶影响的链条很清晰:确定性下沉使执行路径稳定可回归,门禁与审计把尾部风险圈住,指标驱动让进化可度量——三者合力,企业才敢逐步放权。对读者的启发是评估式的:看一个 agent 系统的成熟度,不要先看它演示了什么,要看它把多少决策变成了工程问题(本体、门禁、回归),那部分才是可以复利积累的资产;剩下的模型发挥空间,恰恰是要被围起来的部分。
行动进化:从图纸到整机柜的自主闭环
行动进化覆盖了数据中心的完整生命周期。交付端,来海龙(高级技术专家)描述了三处重塑:其一是图纸设计,过去供应商、设计院与设计 PM 之间反复改几十版、交互设计要 40 多天,现在把成百上千条技术规范(如道路间距不小于 7 米、门与路线平行)蒸馏进规则库,用多个 agent 生成方案再互相打分 PK,供应商只需提交地块形状和政府规划条件,十几二十分钟出最优方案,设计 PM 只做选择,SLA 提升 40 多天;其二是质检,施工人员手机采集图像加视频监控抽帧,质检 agent 30 秒内输出问题清单,建设 PM 远端按优先级整改,省下质检飞检的全国出差,SLA 提升 10-15 天;其三是机柜录入,图纸结构化(图层命名区分包间、墙壁、机柜)加二维归属算法加正误案例自我纠错循环,上传图纸一分钟内百分之百输出机柜信息,SLA 提升约 7 天。综合自报成果:蒸馏了约 1900 项知识与专家经验,人机协作效率提升 3 倍,实现 100 天交付一座数据中心的模块化节奏。
运营端,王琦(议程列关通、王琦共同分享,转写中自报者为王琦)给出了整场论坛最有想象力的组织设计:不把 AI 当工具,而是当「数字员工」。老王(资深运维工程师)代表 Copilot 模式——AI 供数据、人做诊断决策,人员能力参差成为稳定运行的制约;小美(AI 员工)代表 Autopilot——接收整体任务后自主感知、关联诊断、定位根因、生成并执行应急预案(EOP)、验证结果,全程自闭环。小美的构建有四步:数据筑基(设施档案库、拓扑与 CAD、三维实景、实时态势构成四维孪生底座)、能力沉淀(把数据中心全部现实人工岗位提炼成技能全集,技能在沙箱评测通过才「点亮」)、员工构建(对标真实岗位建 AI 岗位,职能边界清晰)、评测上岗(试用期 KPI:任务成功率大于 95%、同任务多次执行结果完全一致、不越权——「程序员的小美不能去做阿里云 CEO 的工作」、按每千 token 节省工时算效能)。王琦的收尾判断值得记下:人的经验并没有被丢掉,而是被沉淀到了小美的职责、能力和权责边界里。
诊断端的方案最「模型中心」。王加龙(高级算法专家,转写自报为算法工程师)的判断是:Gartner 2016 年提出的 AIOps 走场景枚举路线,两年建了 20 多个场景,而业务一口气提了 100 多个场景需求——五倍的增速不可能用五倍人力去追,必须从一个模型干一类场景进化到一个能力干几十上百个场景。全局诊断的思路是把全部监控测点一股脑输入一个模型做综合推理,不枚举场景、不圈选测点。三个拦路难题他讲得很诚实:读不准(大语言模型以文本和代码训练为主,数值理解天然弱)、读不懂(一栋楼上万到二十万测点,风险被工况波动和噪声掩埋)、读不起——这里是全场最生动的一笔:一个温度值 24.5 按 token 计是 4 个 token,比中英文文本都贵;一个测点一年产生 300 多万个值,一栋楼一年的 token 费用按传统方法要 100 多万,几百栋楼就是几个亿。他们的「天晓」大模型 2.0 用三重循环破题:data loop 在线持续处理时序找征兆,agent loop 汇聚征兆做综合推理(且他主动坦承「不是一个模型,坦诚讲」),model loop 离线微调让模型更高效地推理时序。自报结果:时序模式理解准确率超 98%(比此前基线高 13 个点)、推理速度快 10 倍以上、token 总成本降 90% 以上,一栋万测点的楼完整推理一遍 10 分钟、平均每测点 0.06 秒——这才敢做 24 小时全年无休的全局推理。他展望的终局指标很提气:运维指标从「1 分钟告警、5 分钟响应、10 分钟恢复」的 1-5-10,变成「无人干预连续稳定运行 365 天」。这条链给所有 LLM 应用落地的启发是:先算 token 账,再做架构决策——时序与数值的表征工程(压缩、专用化、离线微调)是被普遍低估的竞争力,它决定了一个「理论上可行」的方案能否在经济上成立。
最后是服务器侧。廖同舟(议程列朱昊、廖同舟共同分享,转写自报者为廖同舟)主讲真武 PPU 整机柜(即磐久超节点服务器,外部核验:磐久 AL128 于 2025 云栖发布;演讲自报单卡间互联带宽 6.4TB/s、单卡内存 144GB、单机柜 128 卡)。整机柜的关键词是耦合:机柜即一台服务器,任何计算节点中断导致整机柜中断,供电散热共享,一个部件抖动影响整柜;高价值意味着每闲置一分钟的成本是传统服务器的几十上百倍。三个场景的解法都体现「agent 干推理、人握扳机」:根因定位中,一次电源故障引发整柜掉电、各部件失联产生成百上千条告警,agent 接入实时告警、部件状态、整柜拓扑和历史案例库做归并与比对,收敛到「一柜一单」,定位时长缩短 90%(自报);应急恢复中,agent 实时汇聚节点与供电读数判定是否止损,但停机这类高危动作只出结论和回执单,由人审批;维修流程中,agent 秒级接单、判别误报、锁定备件、一键派单,整柜维修效率提升 30%(自报)。
自我进化:具身智能与 Agent 自主创造,人退到监管层
进化的最后一级有两个方向。一个是走进物理世界。潘兵(算法专家)给出的行业坐标:全球具身智能产业规模约 280 亿美元、预计 2030 年达千亿美元(演讲引用的行业预测口径),趋势是从「能跑能跳」转向「能干活能赚钱」,易落地的是结构化程度高的 B 端场景。IDC 现场恰好符合:巡检、应急、随工占用工时高且边界清晰。方案是云端一体——机器人端侧做感知和轻量推理,复杂视频上传云端统一的具身智能大脑,识别结果自动生成诊断报告,现场反馈再驱动模型迭代。效果(自报):机器人巡检把运维人员每天两小时的巡检压缩到半小时看报告加现场复核,已覆盖 60 多种场景、人工巡检替代率 80% 以上、准确率 98%,本财年计划覆盖 20 栋楼。机器人随工的演示更具体:验证外部施工人员身份、带路并识别是否正常跟随、施工中监测行为异常、结束带回——人盯人的岗位变成了机器人盯人。
另一个方向更激进:Agent 不再依赖人类编排。刘建宇(议程列姜骁、刘建宇共同分享,转写自报者为刘建宇)把人机边界划成三个阶段——数字化时代人全程执行、Copilot 时代 AI 给建议人协调、自主运行时代人只定义目标和边界,从执行者变成更高维度的监管者。支撑自主运行的是三件事:一套物理世界感知中枢(视觉识别、设备遥感、门禁告警,乃至会议纪要、业务邮件、钉群聊天、政府与厂商政策,都沉淀为 AI 可理解的业务信号);一个持续更新的业务记忆体(知识萃取保留人事、意图、约束与证据,并做来源复核——比如收到 100G 光模块批次问题,先核实是历史批次还是当前批次,再评估影响面);一条受控的执行链(在目标和 SLA、成本约束内探索多条路径选最优,设红区如「线上在跑的机器不得关机重启」,执行后由独立审计模块复核目标达成、成本、风险并沉淀证据链)。资产运营场景的试用数据(自报):人工投入工时降约 40%,周期性完成目标降 20%,人工介入次数降 70%。一个脱敏案例里,市政要求导致待到货物料断供,AI 自主全局重排交付计划、改从 B 地调货、评估周期成本与 SLA 达标后直接执行,全程无需人介入。他的愿景是打破领域边界连成更大的网,「面向 AGI 乃至 ASI 的探索」。
收束:经验沉淀在哪里,人就在哪里
把十个环节连起来看,这场论坛的暗线比「三级跃迁」的明线更值得咀嚼:每一个环节都在回答同一个问题——人的经验去了哪里。图纸设计的经验去了规则库,数据质检的经验去了物理守恒 skill,专家排障的经验去了运维本体和多假设推演,运维工程师的经验去了数字员工的技能库和 KPI,老王对故障链的直觉去了时空对齐。与之对应,人的角色层层上移:从执行者,到审批者(握住高危操作的扳机),再到目标与边界的定义者。这条路径成立的条件也同样清晰:确定性必须先沉淀为工程(本体、门禁、评测),模型只在不确定的推理段发挥;所有自报的效率数字都建立在「可控大于自动」的前提上。尚未被回答的问题其实不少——天晓的 All in One 在跨架构泛化上的边界、counter case(传感盲区、图纸漂移、组合故障)的收敛速度、集群级自主调度的可行性、以及当「1-5-10」真的变成「365」之后运维组织自身的形态。观察这条路线的下一个信号点,不妨盯住两个数字的斜率:人工介入次数的下降速度,和高危审批中「人说不」的比例——前者度量进化,后者度量信任还差多远。
信源说明:本文基于云栖 2026 大会「以智治算:Agentic AI 驱动的算力基础设施运维自进化」论坛(9 月 23 日,国博一期-1F-103A)官方回放的完整本地转写(8649 秒、109 个时间段全覆盖)写作;讲者身份与议程已对照云栖官网议程页核正,转写人名误差(如「以智智算/真五/天小/巨神智能/盘九」等)已逐一修正并记录于项目工作账本。外部核验项包括:吴泳铭 2032 年 20GW 目标(IT 之家/澎湃/财中社/钛媒体报道)、磐久 AL128 超节点(阿里云官网及开发者社区)、陆增义身份(2023 年公开简介)、Palantir AIP 本体论与 FDE(Palantir 官网)、ChatGPT 发布日期;资本开支对比数字、黄仁勋引语场合、各环节效率指标均为讲者自报口径,未经独立核验。