在2026阿里云栖大会英特尔专场(智启Agent·算筑中枢)上,贯穿十六位讲者的同一个判断是:智能体(Agent)的多轮循环负载,正在把 CPU 从"前后处理"重新推回计算中枢。英特尔产品规划部总经理李尔成称,数据中心 CPU 与 GPU 的配比将从传统的 1:4 走向 1:1,部分场景甚至 CPU 超配;阿里云首席服务器架构师卓九则补上一句关键的异见——当下还没有一颗真正"为 Agentic 而生"的 CPU。另一条主线是 KV Cache(大模型推理保留的键值缓存,用来"以存代算")爆炸所催生的内存-存储分层产业链,以及 AI Agent 自己动手迁移 CUDA 算子、一次任务成本只有传统办公智能体百分之一的云上浏览器。算力生态的护城河,正在被智能体本身侵蚀。以下按背景、架构机制、产业链、生态博弈、落地与信任的顺序展开,全部数字与判断均标注说话者。
智能体浪潮:CPU"重返C位"的数字与异见
英特尔数据中心与人工智能集团副总裁、中国区总经理陈葆立在开场引用了一组机构数据:全球已有约 80% 的企业尝试把 AI 智能体落地到工作流;IDC 预判到 2031 年中国企业使用的 AI 智能体将超过 3.5 亿个;中国大模型日均 token 消耗较两年前上涨约 5000 倍。供给端的交叉验证同样来自他的引用:2026 年全球 AI/云服务商业绩同比增长 96%,美国银行预测中国 AI 智能体需求将带动产业伙伴投入超过 2.2 万亿元人民币升级 AI 基础设施。
陈葆立把智能体概括为"多层软件创新":prompt engineering 让 AI 从聊天工具起步,context engineering 给没有记忆的天才加上记忆,harness engineering 让它能执行命令,loop engineering 让它像好学生一样反复自查重试,确认答案再交付——这些工作流和运算最终都落在 CPU 上,这是他"CPU 重返 C 位"论证的核心。他还给出 AI 数据中心的"三大集群"模型:CPU 集群、GPU/加速卡集群、存储集群,三者的共同点是内部都需要 CPU 调度数据搬运;他引机构预测称,2030 年数据中心所有负载的约 80% 都将与 AI 相关。
李尔成用市场调研数据补全了这幅图景:全球数据中心负载将在五年内再翻倍;到 2030 年传统负载仍占半壁江山,企业级 x86 服务器装机量从 2025 年的约 6300 万台增至 7600 万台、约占全球八成;AI 占数据中心负载的比例从 2025 年的 23% 升至 2030 年的 50%,其中推理占 37%、训练占 13%。他强调传统单轮推理由浮点算力主导、适合 GPU,而智能体是"持续运营的流程":调度、规划、执行、反馈偏重 CPU,只有模型推理需要 GPU——CPU 因此变成"主办方和调度者",这也是 CPU:GPU 配比从 1:4 走向 1:1 的机制来源。(陈葆立引的"80% 负载与 AI 相关"与李尔成引的"AI 占 50%“口径不同,来自不同机构与统计定义,并列存疑。)
最有分量的一句异见来自阿里云资深总监、服务器首席架构师卓九(议程同时列阿里云刘礼寅为联合致辞人)。他说英伟达黄仁勋今年三月 GTC 谈到 Agentic CPU 之后行业热度骤起,但"当下所有号称 Agentic 的 CPU,都是对某一个环节有优势,并不是为 Agentic 而生”——只有从 2026 年 3 月开始设计的 CPU,未来才可能真正配得上这个名字。他同时指出这波浪潮带来的不只是 GPU 需求,还有 KV Cache 引发的爆发式存储与内存需求,需要从硬件到软件、GPU 到 CPU 到存储的全链条协同;阿里已发布 AL128、AL144、AL64 超节点,而英特尔在他看来"不是一家 CPU 公司",是 CPU、GPU、存储、软件俱全的全栈公司。这句异见恰恰是理解接下来所有产品发布的背景板。
把"钻石"摞成中枢:Diamond Rapids 的架构答卷
既然智能体的性能等于任务端到端耗时,而"CPU 跑的时间就是 GPU 在等的时间",那么 CPU 架构本身就成了瓶颈的一部分——这是英特尔首席工程师龚海峰的出发点。他的性能公式把变量拆成核数、占用率、频率、IPC(每周期指令数)与任务总指令数,其中真正由架构决定的是后两者,对策是三句话:简化指令、加快执行、减少空转。
落地到下一代至强 Diamond Rapids(DMR,英特尔称专为智能体时代设计),这套逻辑变成一组具体设计。芯片首次采用 Fan-Out Fabric 封装架构:中心两条 Fabric Hub 带提供内存与 IO 接口,四条计算带(CBB)与之 All-to-All 全连接,任何一个核都能以相同距离访问全部内存通道和 IO,拿到最高带宽、最低延迟。新的 APX 指令集(x86 标量指令集的现代化扩展)把通用寄存器从 16 个翻倍到 32 个,并引入新目标操作数(NDD),让"C=A+B"不再破坏原有操作数、减少内存往返;龚海峰给出的数字是,用支持 APX 的编译器重编 SPEC CPU 2017,程序内 load/store 指令减少 40%。缓存方面,DMR 用 3D 封装把缓存做"地基"、核心放"楼上",整个片上系统提供 1.28GB L3 缓存、每核可直用 320MB;IO Fabric 里也首次加了 L3 缓存并支持 DDIO(数据直达缓存),GPU 之间经 CPU 交换数据不必再写内存。内存侧 16 通道配合 3D 封装与 UCIe 互连,软件不再需要人为切分 NUMA 节点;128 条 PCIe 通道让双路之间最多可配 4 条 x16 通路——龚海峰特意对比,部分平台双路之间只有 1 条 x16,八卡 all-reduce 集合通信时跨 socket 链路必成瓶颈。李尔成补充的规格单包括:最高 256 核、AMX(英特尔 CPU 内置的矩阵加速引擎)与 AVX 支持 FP8/FP16/BF16、1.6TB 内存带宽、支持 MR DIMM、最高 2TB/s 双向 IO。
龚海峰还给了选型者一个更务实的公式:系统可承载的智能体数 = 硬件纸面指标 × routing efficiency × resource balance × offload 系数,真正该看的不是核数,而是 P99 延迟目标线以下能塞进多少个 Agent——DMR 为此提供性能遥测(telemetry)帮助做感知路由与卸载。英特尔软件技术总监胡勇的实测数据则把"纸面与现实的差距"具象化:在 P50/P90/P99 统计下,一个复杂任务的智能体循环要跑几十次到上百次;以"每个沙箱拉起时间不超过 200 毫秒"为标准,至强6+能效核 Clearwater Forest(2026年1月发布,英特尔同日发布 E8355 以太网产品,转写存疑)十分钟拉起十万个沙箱、并发压到 350 个仍达标,相同软件环境下竞品约 240 多个。他的归因是智能体负载对 CPU 前端特别敏感——任务切换、状态切换、缓存有效性、指令预取,这些微架构指标直接决定成败。胡勇的另一笔账关于内存:每个 Agent 约 2G 内存是合理配置,1 核 4G/8G 实例做 2-4 路超配是高密部署常态,而当代平台 12 内存通道对 128/288 核,内存容量而非 CPU 算力才是 Agent 密度的根本约束。两条出路里,CXL 扩展内存池硬件成本高但对软件透明;软件侧用 IAA(内存分析加速器)加 Zswap 做"内存气球",按页面活跃度压缩存放——压缩率软件硬件都能到约 2 倍,但 IAA 压缩速度是软件的 11 倍、解压 12 倍,且不占 CPU/GPU 核心,等于 TCO 不变把系统密度提上去。胡勇总结说,这些微架构归因已反馈给 CPU 设计团队,“下一代才敢谈真正的 Agentic Native”。
KV Cache 挤出来的产业链:从内存气球到 480G 显存
如果说 CPU 是中枢,那么智能体的"记忆"就是另一场爆炸。英特尔首席软件工程师谢毅把挑战归为两个:一是 MoE(混合专家)模型的专家负载不均——DeepSeek 有 256 个专家、每次只激活 2 个,推理中某几个专家明显变热、超出负载上限,把专家复制到其他卡要经 PCIe/NVLink 搬运权重且推理必须暂停;二是 KV Cache 越来越大。他的方案一让 CPU 承载 GPU 溢出的热点专家:CPU 内存可轻松插到 3TB 以上、有 AMX 算力,且只算一两个热专家,内存带宽根本不是瓶颈——典型的扬长避短。方案二是 KV Cache 分层复用:DSA(数据流加速器)负责碎片化搬移,在 16-64KB 小块上亲和性最好且不占 CPU/GPU 资源;QAT(QuickAssist 加速引擎)把 KV Cache 压缩 20-30%,且首 token 延迟(TTFT)无损失。而"以存代算"的代价被谢毅算得很清楚:75% 命中率上限需要约 3M token 缓存,折合 MiniMax M3 约 450GB——任何单节点内存都装不下,分层因此是必然。
这正好衔接了祝鲲业介绍、英特尔称为 Crescent Island 的 GPU(内部代号,据称年底发布;汪洋现场玩笑说中文名该叫"星月岛",此代号无公开报道,归属英特尔)。这位产品规划部总监描绘的负载变迁是:上下文从早期对话机器人的 1-2K 涨到 256K 起步、有时 1-2M;SLO 从 4K/2K 输入输出、TTFT 2 秒、100 毫秒/token,变成 50K 输入、1K 输出、TTFT 10-12 秒——答案就是把显存做大。据其介绍,Crescent Island 单卡显存最大 480G(他对比友商推理卡主流 32-84G、平头哥新发布的 PPU 单卡 144G),功耗约 350W 风冷可直接上、不必改造数据中心,120kW 机柜最高可放 256 张;架构上 32 个 Xe 核、Xe3P IP 支持 FP4 到 FP64、32MB L2 缓存、LPDDR5X 显存(性价比优于 GDDR6/7)、4 编码加 4 解码媒体引擎、PCIe Gen5 级联。装填示例:128G 单卡可装 DeepSeek V4 Flash INT4;256G 八卡可装 Kimi K3——2.8T 模型权重约 1.5-1.6T,剩余约 488G 留给 KV Cache 与用户数据;前沿模型名单里他还提到 GLM-5.3(转写作"GEM5.3",存疑)与千问。祝鲲业顺手举了个消费级注脚:他自己家用 A770,因 24-32G 显存能跑千问3.8-27B(他称之为"业界事实标准",并期待千问4.0的27B版本),英特尔老显卡二手价在升值。他还谈到与绿电算力协同的合作愿景:“把三四毛钱的弃电转成三四块钱的 token”;软件侧承诺 SGLang 等框架对头部开源模型的 Day Zero 支持。
存储是这条产业链的第三层。英特尔资深存储架构师曹刚介绍,至强6两路可挂 24-32 块 NVMe 盘,软硬件协同可跑到盘官方性能的 80-100%,高并发下单盘 2.5M IOPS;SPDK 的第三种模式用用户态中断指令(uint/tpause 类指令)做到接近轮询性能、中断级功耗。把 KV Cache 放到 JBOF(高密闪存阵列)上,一跳 RDMA 只增加约 10 微秒(本地盘约 50-60 微秒);英特尔自研 KV Shrink 分层方案在 JBOF 端复用可获得 5-8 倍吞吐提升,叠加 QAT 后吞吐略降;GPU→DDR→JBOF 三层、本地 80% 命中场景接近 2 倍提升,相关 KV Cache G3.5 白皮书已与伙伴发布。阿里云高级技术专家彭艺蕾则从云盘侧给出需求曲线:单位算力的云盘挂载密度将达 10 倍、性能密度 4 倍以上,每个 Agent 有独立存储空间、在毫秒级无规律地突发负载。磐久9代存储服务器(PCIe 5.0、400G 网卡、以 Granite Rapids 核心的至强平台)上的实践包括:管控面百万实例亚秒级创建、Agent 百毫秒级同步唤醒——靠优化多核锁竞争与上下文切换、Turbo Boost 瞬时拉满功耗消化队列、大 LLC 加 CAT 缓存归属控制;数据面用 DDIO、DSA 搬移卸载与纠删码新指令。压缩链路最见工程功力:企业级要求压缩后重算 CRC、原地解压再校验一次,英特尔把"带压缩校验"内嵌进 QAT,一次提交即得可信结果。彭艺蕾给出的结果是:压缩带宽提升近 400%、参与压缩的 CPU 核数下降 75%、deflate 算法额外多压 10%;新硬件本身只有 1.5 倍吞吐,软硬协同后做到上代平台的 4 倍,且已在阿里云存储生产线上大规模铺开。
0.6 美元一个算子与一百倍成本差:智能体改写生态规则
生态博弈的第一个样本是浏览器。阿里云终端智能计算事业部高级产品专家蒋佳忆说,Agent 正在成为上网的"新用户"——不为浏览内容,而为比价、填表、下单;机器流量今年已首次超过人类流量。但 Web search 只能拿到摘要,Web fetch 处理不了动态渲染和提交流程,浏览器必须从桌面软件变成云端高密度执行引擎。阿里云无影与英特尔的选择是不重造浏览器:保持 Chromium/Blink/V8 兼容,面向 Agent 场景裁剪调优,以 Prebuild SDK 交付并部署在阿里云弹性设施上;英特尔出 AVX512、IAA、QAT 等硬件加速,阿里云负责实例拉起、释放与镜像。单实例内存开销最多降约 30%,可一次并行打开 100 到 500 个浏览器。成功率策略是把跑通的流程沉淀为可回放的 RPA(流程自动化)工作流,同类任务优先回放、异常再切回主 Agent,风控(指纹、行为、session 链路)封装进执行引擎。成本账更直观:用主流办公智能体发一次小红书帖,成本约为复用工作流方案的 100 倍。演讲后,陈葆立与阿里云研发副总裁、终端智能计算负责人张显涛现场签署了 Agentic Browser 合作。
第二个样本直指 CUDA 护城河。英特尔 AI 软件技术总监汪洋坦承静态转换工具效率不高、竞品 API 直译存在"性能黑洞",英特尔的打法是全栈开源并 upstream 到社区:vLLM、SGLang、Dynamo 等框架保持兼容,英特尔是 PyTorch 主要贡献者之一,高性能库全部开源;编程语言用的是存在十几年、基于 C++ 的 SYCL——他强调主流大模型"已经悄悄学会了 SYCL,不光会 CUDA"。Crescent Island 发布时将配套对标 CUDA SDK 的软件包 OmniX(Open Middleware Xe)。真正的新杠杆是让 AI Agent 自己迁移:基于算法意图做原生迁移重写,再用 profiling 技能读取硬件微架构指标反哺代码优化,形成全自动闭环。实测数字是:开源社区十个生产级项目、468 个算子完成 445 个(95%,未完成部分因未提供多卡环境),单算子交付成本约 0.6 美元、约 8 分钟;千行代码约 1 美元、10 分钟;整个项目数小时、token 成本几十美元——对比工程师以月计的工时。更狠的验证在 llama.cpp:团队删掉工程师手工写的算子,让 Agent 从 CUDA 重写 107 个(含 17 个此前不支持的算子),优化后 45 个算子性能超过原手工版本。
阿里云资深技术专家卢晓伟提供了云厂商视角的注脚:两三年前搜推广场景就把 embedding 跑在 Sapphire Rapids 的 AMX 上、密集计算跑 GPU、用带宽连接两侧,当年双 11 主搜推理大胆上线了早期 Sapphire Rapids;如今 AIGC 场景占整个 MaaS token 收入约 30%,将与英特尔 GPU 展开合作。磐久 128(去年)、144(今年)、64(探索中)超节点是他眼中 MoE 大模型推理"最笃定的形态"——模型规模已 2T 以上、未来 5-10T 是确定趋势;AL144 在 5 毫秒/25 毫秒 SLA 内 scale-up 够用,AL64 解决 Ultra Fast(转写疑)场景 5-10 毫秒级 SLA 的 scale-out 甜点。至于异构超节点(Attention 与 FFN 分层选硬件)与同构超节点哪个胜出,他直言"今天回答不了"。
上云的成绩单:从千万核实例到智能体数据库
落到具体产品,阿里云弹性计算高级产品专家武双涛给出九代实例的成绩:发布约一年、基于至强6已达千万核规模,承载阿里云上绝大部分主力 Agent 应用。他引普华永道调查:79% 的高管在决定部署 Agent,88% 决策增加投入,未来三年 33% 的 SaaS 软件将集成 Agent 能力——“没有这个能力,产品就没有竞争力”。至强6平台规格为 120 个性能核、单颗可到 8 路、内存带宽较上代提升至少 70%(MR DIMM 最大 2.3 倍)、L3 缓存 504MB(约 +60%);产品族按场景分 G9I(重负载 Agent)、U2I(低成本高并发浏览器与工具调用)、I5/I5E(数据预处理与 KV Cache);六大能力包括 AMX FP16 推理加速、TDX 机密虚拟机默认支持、QAT 内存压缩、IAA 快照压解压(空间降 50%、启动提速 30%)、ESID 数据持久化与千万核弹性资源池。案例一是小鹏汽车:PB 级自动驾驶数据日处理,AMX 做预处理大幅提升效率、降低成本;案例二是一家国内头部大模型企业(转写"阅知安面",疑指月之暗面),其深度研究、Agent PPT 类产品弹性峰值达几十万核,靠 QAT 与 IAA 优化沙箱启动速度。
数据库是被 Agent 重写的下一层。阿里云数据库技术专家陈浩归纳 Agent 负载四个特征:SQL 不确定(模型输出不固定、实时决定下一步)、脉冲并发、数据类型多(状态、记忆、知识库、trace)、权限与安全边界模糊。PolarDB 的回应是四层架构:接入层用 MCP(模型上下文协议)统一数据访问边界,Agent 不必感知实例地址与账号密码;控制流层存状态、记忆与知识库;内核层做事务与弹性;硬件层提供内存扩展与高性能网络。最有趣的机制是"数据库分支"——Agent 在真实数据的分支上试错,失败即扔掉,不碰生产。性能数字上,AMX 加速向量提取 2.5 倍、QAT 压解压吞吐提升 1.2 倍;把 GPU 的 KV Cache 卸载到分布式内存池,线上 TTFT 降 61%、端到端延迟降 53%;内核侧全异步协程写入吞吐 +90%、ProtoTrans 读写混合 +46%、ProtoIndex 插入 +60%、热点行优化使单点高并发吞吐提升约 60 倍(转写作"百六十倍",疑为 60 倍);Scaleless 让负载低时计算资源降到零、存储仍在,负载来了瞬间加回。客户侧包括用自然语言生成应用的头部软件集团(每个应用一个库、需快速拉起释放)、需要 Agent 资源隔离的 SaaS 电商,以及累计 300T 数据、日增数亿消息的头部模型公司。
信任与端侧:规模化之前的最后两道门
安全是被全场讲者反复点名的"底座"。英特尔全球副总裁、产品保障与安全总经理 Anand Pashupathy 用英文演讲给出行业渗透数据:75% 的受访企业已部署机密计算,包括阿里云在内的全球六大云商都在部署 TDX(英特尔可信域技术,硬件级机密虚拟机)。他把机密 AI 的三支柱总结为机密性(数据与模型端到端加密)、完整性(硬件信任根防止篡改)与可验证性(attestation,密码学证明负载确实运行在机密虚拟机内),核心动作是把云管超管与企业自管管理员统统移出信任边界——这直击企业级落地的三个摩擦点:用户与 IT 信任、监管合规、数据与模型主权。医疗多方安全计算是典型案例:Google 与 ML Commons 的研究中,患者数据留在各医院自己的 TDX 虚拟机里,模型巡访数据集完成联合研究。他还现场"破除迷思":TDX 加 AMX 就能在 CPU 上跑中小模型,机密 AI 并不必然要 CPU 加 GPU;需要 GPU 加速时可用"加密邮箱"式的 bounce buffer 方案(CPU 加密后经缓冲区交 GPU 处理再加密返回),未来 TDISP/TEE-IO 将提供加密 PCIe 链路。对 Agent 本身,他的形容词是"智能、自主、被授权、目标导向、不知疲倦"(relentless)——这些优点恰恰是安全社区的担忧,已有 Agent 失控攻击基础设施的报道,agentic security 必须被当作云和全栈层面的问题。
最后一公里在端侧。阿里巴巴千问事业部 AI Infra 技术专家户瑞林分享千问 APP 的端侧推理实践:两类场景——35B 本地主模型可直接完成 PPT 等任务,端侧小模型作为 skill 承接高频调用、给云端降成本;价值是隐私(数据留本地)、离线可用与成本(“只花电费”)。3.5B/3B 是效果与性能的平衡点,但 35B 不量化要 70G、Q4 量化后 22G、加 KV Cache 约 25-26G,消费级显存装不下。三条优化路线:混合精度量化(首尾层和 router 保精度、其他模块极限压缩,GPTQ 类误差补偿,再对 MoE 冷门专家做模拟路由充分校准)把 70G 压到 12G,平均比特数低于社区 3.x BPW 量化版而精度更高、比 BF16 损失不到 1%;分层卸载(权重分布于显存/内存/SSD,预测激活专家提前预取并做预取重叠)把专家缺失率降到 2%、性能达到不卸载的 95% 以上;Agent 场景专项优化把 prefill 的系统提示与工具定义固化为文件直拉显存,解码用 NTP/EAGLE(转写作"DeFlash",疑为 EAGLE)投机解码并量化 draft 模型,draft 开销降 30% 而接收率持平。在测试设备(转写"三五八H",疑为某硬件型号)上实测约 50 token/s,可日常使用。他的收尾呼应了全场主题:随着小模型能力与终端算力提升,“让日常所需的智能就在身边”。
回看整场,真正值得记住的不是某颗芯片的参数,而是一条清晰的传导链:Agent 的多轮循环改变了负载形态(机制),CPU 从前后处理变成调度中枢、配比走向 1:1(一阶影响),于是微架构、缓存、IO、内存分层、存储网络、软件栈和信任边界全部围绕"循环"重新设计(二阶影响)。对行业而言,这意味着基础设施竞争从单芯片军备赛变成全系统协同赛——英特尔的赌注是 CPU 加 GPU 加加速器加开源软件的全栈组合,阿里云的赌注是超节点加弹性云加模型的体系能力,两者的交汇处正是智能体的单位成本与单位延迟。对读者,可以观察四个信号来验证这场叙事:Diamond Rapids 与 Crescent Island 是否按 256 核、480G 显存与 OmniX 软件包如期落地;云厂商新一代实例的 CPU:GPU 配比是否真的逼近 1:1;KV Cache 命中率与 token 单价是否同步下探;以及 Agent 驱动的 CUDA 迁移能否从演示走进生产仓库。若你自己在做 Agent 应用,本场给出的操作原则同样具体:按"P99 延迟约束下的并发 Agent 数"而非峰值算力做选型预算,把可重复的 Web 任务沉淀为可回放的工作流而不是每次重新规划,并把端侧 3.5B 与云端大模型视为一条成本曲线上的两端——这两三年里,智能的价钱就是这样一点点算出来的。