先说结论

2026 云栖大会「人工智能平台 PAI」分论坛(9 月 23 日,国博二期博览厅 B,主题 Agentic Cloud)给出的核心判断是:Agentic AI 不是给 AI 平台加一个功能,而是让基础设施整体换轨。PAI 负责人周文超把变化抽象为负载、范式、边界三个词:智能体替人跑一整天,调用推理的次数比「人问一句答一句」增长了数百倍;训练重心从预训练移向后训练,RL 的算力消耗「接近甚至超过」预训练;智能从数字世界越进物理世界。真正值得记住的矛盾有三层:推理侧最值钱的资产变成了 KV cache 命中率(论坛口径 92–96%),组织侧个人「效率提升十倍」的体感只兑付成公司 20% 的实际效率,而在科研侧,模型已经强到人类出不出有区分度的题。一句话:模型能力在狂奔,瓶颈落回了调度、缓存、数据质量与经验资产化这些最古老的工程问题。

负载变了:KV cache 成了推理系统里最贵的资产

周文超开场的第一性观察不是模型变强,而是使用方式变了:Agentic 时代的模型会自动选工具、多轮调用、根据反馈规划下一步,一跑就是一整天。这直接改写了推理系统的经济学——上下文变长、多轮工具调用带来前缀高度重复,KV cache 从「一个简单的缓存」变成 LLM serving 里最核心的资产,网关、路由、调度从无状态服务变成有状态服务,系统开始关心 cache 的亲和性、能不能复用已经算过的计算。

负责推理平台的李文鹏把这组负载特征拆成四条:长上下文(请求从几百 token 涨到上百 K 甚至百万级)、cache 高命中(AI coding 场景理论命中率能到 90% 以上,工程目标是让真实命中率逼近理论值)、细粒度流量规划(长短请求混杂,传统 round robin 调度失效)、有状态调度(把请求调到「最长前缀匹配」的 KV cache 所在节点,减少重复 prefill)。对应的系统是三层:智能路由(统一 API 入口、流量治理、弹性容错、调度决策)、可插拔的推理引擎、独立于引擎之外的全局缓存层——后者即 PAI-InferX 的 Flash KV,用推理节点空闲的 DRAM 加 SSD 拼成一个分布式两层存储,配合「SSD 预取 + RDMA 直读本地显存」的流水线,把远端读 cache 的延时藏在调度间隙里。

数字层面(均为论坛口径):智能路由在 agent 典型数据集上让 cache 命中率提升约 40 个百分点,首 token 延时下降 30% 以上,吞吐翻倍;叠加 Flash KV 后再提 15 个百分点、达到约 94%,「基本是这个场景的理论命中率」。另一条降本主线是智能模型选择——训练一个小模型动态判断当前 context 该升档还是降档,在疑似 SWE-bench Lite 的数据集上效果与全用旗舰一致、成本降低 65%。李文鹏的注脚很实在:「写周报用 27B 的模型远远够用。」面向私有模型客户,他们还发布了 PAI-CC 加密计算:模型部署前签名,跑在 TEE 可信执行环境里,建连前先做远程证明、校验模型与内核版本,全部通过才交换密钥——动机直指「token 中转站乱象」带来的数据泄露焦虑:不靠承诺,靠技术自证。

底座侧的硬件事实有外部信源互证:演讲提到的 64 卡真武 M890P 超节点(GP9A 实例)、HPN 8.0 网络、CIPU 2.0 均为云栖与 WAIC 前后的公开发布,Qwen3.8-Max、Kimi K3 等超两万亿参数模型已在其上稳定运行。对读者的启发可以压缩成一句:评估 Agentic 推理,先看 cache 命中率与 TTFT,再看模型跑分;成本杠杆已经从「换更贵的模型」移到「路由与缓存层」。

训练重心后移:RL 生产化的门槛是「稳」不是「快」

翟恩南的后训练框架演讲里,最有信息量的是生产视角的病理学。他把模型演进分成 LLM、agent、VLA 三步并强调「不是替代关系」——预训练像读完高中,后训练决定大学专业,而 RSI(持续自进化)是往后方向;千问 3.3.6、3.7 等版本的 coding、agent、浏览器能力都跑在 PAI 这套后训练 infra 上。RL 闭环本身不复杂(rollout 与环境交互生成轨迹、reward 打分、policy update、参数回写),复杂的是生产环境里的四种病:轨迹长短不一造成调度气泡;rollout 长尾与拥塞;reward 不可信——他特别点了 reward hacking,「模型自己产生智能之后绕开了你的奖励方法,它没学会,但能让评测结果更好」;以及异步化之后版本过期,「用旧模型版本生成的数据去训练,没有意义」。

对应的三个突破分别是:从阶段墙走向持续流动的全异步流水线(rollout 与 trainer 分离部署、负载均衡、动态控制节奏与版本边界,内部 32K/64K/128K 序列长度三组数据显示训推分离后迭代效率全面提升);一个可插拔的 rollout suite(适配 12 种 agent 框架、28 类仿真环境、30 多个权威基准、千级并发任务);以及贯穿全场的 XFuse 稳定性与可观测体系——全面采集网络、调度、reward、环境数据做关联分析定位根因,支撑「数小时到数天」训练闭环的断点续跑。论坛口径的端到端结果:千问 3.8 后训练整体吞吐提升 3.8 倍;媒体通稿进一步显示支撑 DLC 3.0 的 TrainMover、EROICA 等成果已被 OSDI'26、NSDI'26、SIGCOMM'26 收录。「赛车跑得快但三分钟就挂、还要人工找 root cause」是他给「稳比快重要」的注脚。

这套逻辑的极致形态是黄博远介绍的 CrystalLLM 高保真仿真:用 32 张卡(不到 3–4% 的成本)仿真近万卡训练集群,对万亿级模型万卡训练的迭代时间预测误差小于 1%、峰值显存误差小于万分之一,仿真结论反哺真实训练可把 MFU 提升 2–10%。更有意思的是交付形态的变化——这类原本「摸爬滚打多年才会配置」的专家工具,现在以 skill 的形式挂进 agentic 平台:自然语言说清诉求,agent 追问、搭建 dry-run,从约一万种并行策略组合里给出 top 3,专家只做最后验证。试错成本的坍缩,才是「模型自进化」能开始谈的前提。

平台的赌注:把专家手艺变成组织资产

产品负责人黄博远给了全场最直白的组织洞察:「每个员工烧 token 没少花钱,都觉得自己效率提升了十倍,公司算下来效率提升了 20%。」缺口在经验没有资产化——本地 agent 上的个人技巧无法在企业内复用。他的方案是把航空母舰(功能「没有一万也有一千」的传统平台)装上自动驾驶:Agentic PAI 通过自然语言设定目标、监控空闲算力自动提交实验、批量生成并执行实验组合;所有操作轨迹留在平台,可存成模板分享。「三个领域的顶尖专家用一段时间,你的企业就会有一群专家。」他现场还回应了「为什么不让最强模型直接做所有事」的经典质疑:「一定能做,但代价是用爱因斯坦帮你洗碗」——平台十年沉淀的原子能力是个巨大 harness,经 CLI/MCP 调度,比裸模型更省 token 也更可控。流量入口的迁移预测同样激进:当前 80% 以上交互仍来自传统界面,他预计年底 agentic 入口占 30%,明年 90%。

大众 CARIAD 的蒋忠波用汽车工业的语言验证了同一条链。他的起点判断与黄博远互文:个人提效到组织提效之间隔着业务规模、产品复杂度、人机协同与「持续稳定产出」四座大山,缺的是一个工程化系统。大众的三层架构里,模型服务层(GLM、千问、DeepSeek、MiniMax 加智能路由)、Harness 层(桌面与云端 agent 框架、MCP 封装 Jira 等内部系统、企业知识骨架)之上,是数月内吸引三千内部用户的 CEA Skill Hub。最能说明价值的是整车故障归因:测试工程师提工单、架构师「定界」(根因在座舱、自驾还是三电)、研发工程师「定位」(具体哪行代码),流程原本以天计。他们把汽车各领域建成 ontology 支撑定界 agent 推理,把自研代码抽象成 code graph 支撑定位 agent 精准推理,LLM 驱动分析、符号推理保证严谨,且全程可追溯、可循证——「这对车企特别重要」。连企业本体本身也是用大模型构建的。他的两个循环值得抄录:业务循环(Skill Hub 用户暴涨→梳理流程→需要系统→系统带来更多需求)与技术循环(用 AI 管 AI,skill 审核也交给 agent)。

小米吴睿泽的故事则证明这套逻辑能兑现成现金:应用商店广告前三季度单位流量收入提升超 8 个点,来自三次底座升级而非模型调优——从 TensorFlow 迁到 PAI 的 Torch 系框架(训练效率近十倍、收入 +2 点、稀疏参数首上两亿级);端到端 2K 长序列建模(多级 item KV cache、int8 量化、flash attention 让序列推理性能×4、显存省 58%,收入 +4 点为全年最大);流式在线学习(数据响应从三小时缩到二十分钟、模型分钟级更新,+2 点)。模型研发周期从一到两个月缩到一到两周,「更好的基建→更快业务迭代→收益反哺基建」的飞轮是他所说的长期复利。他关于 LLM for Rec 的判断也够锐利:推荐大模型与语言大模型的负载形态「几乎完全相反」——超长 prefix(成千上万的行为序列)、超短 decode(只生成一个广告 ID)、大 beam(一个用户几百上千候选),所以优化路径完全不同:beam 级 KV cache 共享、变长 attention 算子(Jagged Tensor 免 padding)、约束解码前缀树上 GPU;转向的生成式排序框架对标 Meta 的 HSTU 一系(外部核验:ULTRA-HSTU 论文 16K 序列、5× 训练 / 21× 推理 scaling 效率、已全量部署),小米口径的超长序列训练效率提升约十倍、MFU 接近 50%。给企业读者的启发:买平台本质是买一个复利机构,考核指标应从模型精度转向迭代周期与经验复用率。

具身的冷思考:一千小时低质数据不如一小时高质量

Physical AI 是本次论坛篇幅最大的板块,也是口径最克制的地方。周文超把它总结为三座墙:数据墙(真机采集贵、标注难、第一视角数据无法直接训练)、算法墙(VLA 与世界动作模型变化极快、训练框架难复用)、算力墙,分别由 EagleX、RoboX、TurboX 应对;现场演示从遥操采集「拣橘子进筐」到真机自主执行只要一到两天。黄俊把工具链拆开讲:EagleX 的数据处理管线(前置筛检、空间理解、三维动作恢复、语义对齐)产出结构化质量报告,分六个层次且「可被 AI 分析」,问题能归因回具体环节;RoboX 把模型拆成 backbone 加 head 的积木式结构、SFT 与 RL 复用同一接口,还给了多元数据混合训练的三步法(语义对齐、分布校准、可控配比)与两阶段最佳实践(混合训扩泛化、目标任务回正);EAI Eval 用三层分布式编排把上千个仿真评测环境跑出近线性并行(内置 6 类模型封装、12 类任务适配、157 个 suite 配置)。论坛估算:一轮 VLA 完整迭代原本要两到三个月,用套件可省约 75%。施兴的 TurboX 则负责「让 GPU 别闲着」:小算子过多导致 kernel launch 成为瓶颈(算子融合又受寄存器上限约束,要分组)、patch embedding 把卷积转矩阵乘获得 200% 以上算子提升与 36% 端到端吞吐提升、多视角世界模型把 n 次 all-gather 换成一次 all-to-all 砍掉 75% 通信,甚至包括一个尚需推断确认的细节——引入社区还未正式发布的 no-GIL Python 版本解决多进程争用,「领先业界半年」。

但全场最有含金量的判断来自压轴圆桌(阿里云曹志主持,穹彻智能吕峻、Manifold AI 流形空间武伟、费莫一科技刘念邱)。三个热词定调:刘念邱选「真实的应用」(自驾的增长来自真上车被用起来),吕峻选「变化」(数据路线、VLA 与世界模型之争轮番上演),武伟选「发散」(架构、素材都在加速发散,收敛尚需时间)。数据三路线之争里,武伟的两个机制判断值得全文抄录:其一,「现有仿真器不是模型驱动的,物理引擎参数量非常少,本质是小模型——小模型生成的数据训不动几十亿参数的具身模型」;其二,世界模型做数据合成器「反事实数据生成能力不强」,而 corner case 恰恰是 SFT/RL 最需要的,加上生成成功率「抽三得一或抽四得一」的成本结构(吕峻补充),所以世界模型更适合当 robotics 的 foundation model 去解码动作,而不是造数据。吕峻代表穹彻压注无本体 UMI 路线:早期选一个没有严重短板的方案把链路跑通更重要,同时按研发阶段调配比、让数据分布逐渐向真实世界迁移。刘念邱按能力分层配数据:认知空间靠 ego 数据、动作空间靠本体与仿真增强、接触空间靠穿戴设备,「组合而非单一数据解决问题」。

训练痛点的回答同样反直觉。吕峻说全行业「对现有数据的利用水平远远不够」——不否认中期数据还要涨几个数量级,但当前量级并没有兑现已应有模型能力,卡点在 training recipe 与测评体系;武伟把「训练」本身点名为被忽视的环节:课程学习跳过几步,「一样的数据、一样的算法结构也会训得很糟」,这些是「没写在 paper 里的暗知识」。至于未来十二个月押注什么,三人罕见一致:武伟要建「可闭环反馈的系统」,理由是「十二到二十四个月后,最聪明的可能不是天才少年,而是 AI」;吕峻要算法迭代加算力基建但强调「保持灵活身位」;刘念邱一大一小——闭环体系加数据质量,「一千小时低质量数据不如一小时高质量数据」。主持人曹志的总结可以当成行业情绪指标:对算力的压榨正在让位于对数据的压榨。

当模型强到人类出不了题:下一个 scaling law 在科研

上海交大助理教授、无尽前延 CTO 张林峰的演讲是全场认知密度最高的 25 分钟,也解释了为什么一个学术团队会站在云厂商的平台分论坛上——他的原话是「一线应该在 PAI 平台里」。他的研究判断:预训练(加数据加参数)与 coding 后训练两条 scaling 曲线之后,下一条在科学或 auto research,因为「一个科研问题的解决总能激发更多科学问题」——数学命题证明完会有更多命题可证,benchmark 刷到满分就造新 benchmark,数据无穷尽。他先拆了两个误解:auto research 不等于 AI for AI(不能指望模型只写 GPU 优化代码就突然解出千禧年难题,得真学物理、生物、材料);AI for Science 也不是垂类而是通用提升智能的方式——垂域科学模型「懂科学之后就不懂人话了」的教训就在眼前。

真正的转折是出题者悖论。今年初 OpenAI 发布 Frontier Science 基准,前沿模型普遍三四十分;他们请交大各学科老师出题,老师们自叹分支太细「难到看不懂」;等到自己组织博士生和老师出的「很难的题」,模型普遍答到八九十分。张林峰的结论是:模型已经强到人类失去「这道题对它有多难」的辨识力——就像小学生分辨不出初中题和博士题。再加上高质量出题的内在矛盾(要正确、要难、还要规模化且不重复,三个条件互相打架:难题没人能校验,多模型投票会收敛到简单题),高质量数据「基本不可能只靠人类构造」。解法是让 AI 出题、AI 做题:出题侧用强模型加长作答时间针对当前模型弱点出题,验证侧建「科学世界模型」——精准检索科学文献的大知识模型加快速执行科学计算代码的 Matrix 系统。效果(单方口径):FrontierScience 超过 DeepSeek V3 Pro,MLE-bench、BrowseComp、代码与科学基准全面提升,且「只用科学数据训练,通用榜单也涨」——科学反哺通用智能。配套成果同样具体:重构 200 多个科学软件加自动微分获得两百到三百倍加速;多智能体「虚拟科研社会」产出近百篇成果、专家评议约十到二十篇达 PRL 水平;上周刚训完一个 384B 模型。而这一切跑在阿里云上——他专门 call back 了 CLI/MCP 文档「丢给 AI 就能直接用」。这条链的启发比结论本身重要:当数据瓶颈从数量转向「人类判断力」,稀缺的不是数据而是可验证的环境;auto research 是目前最像下一条 scaling law 的候选。

收束来看,这场分论坛描绘的 Agentic Cloud 不是一组产品发布,而是一次分工重划:模型层继续狂奔,工程层接管效率,组织层接管经验。三个可跟踪的观察指标随之浮现——推理侧盯 KV cache 命中率与单位 task 成本,训练侧盯 RL 训练闭环的稳定性与迭代周期,具身侧盯「每有效小时数据」的产出效率与真机反馈回路的转速。周文超的收尾三句话适合作为长期注脚:从资源交付转向能力交付,从专家的手艺活转向平台的标准作业,从数字世界迈向物理世界。换轨已经开始,明年的变量在于:流量入口是否真如预测般九成走向 agent,以及具身行业在「发散」之后,第一个收敛下来的会不会是数据格式。