先说结论

2026年9月24日上午,云栖大会云网络专场把一个过去两年几乎被遗忘的行业重新推到台前:在训练军备竞赛结束后,推理成了基础设施的主战场,而网络——这个在云计算叙事里长期充当"管道"角色的东西——第一次以主角身份出现在发布会的核心位置。阿里云云网络事业部负责人祝顺民在年度发布中给出的信号很直接:Cloudflare 的数据显示 56.5% 的 HTML 请求已由非人类带来,阿里云内部统计 AI 相关流量也已超过 50%——“推理已经来了”(祝顺民引用,外部口径见文末核验说明)。这场近三小时的专场(议题从"从推理爆发到具身智能"到"阿里云×Megaport"共十项)真正想回答的问题只有一个:当网络的消费者从人变成智能体,网络本身要付出什么代价、变成什么形态。对读者来说,这场发布值得读的原因也只有一个:它是观察"AI 需求如何重新定价基础设施"的一份高密度样本。

转折点:从"人联网"到"智能体联网"

专场开场,英特尔数据中心事业部中国区网络与边缘总经理阮伯超给了一个比"大模型爆发"更具体的判断:过去两年,AI 的使用形态从"简单交谈"变成了智能体,而智能体意味着模型被授予工具、账户甚至物理世界的控制权限——这带来三重连锁反应。第一,权限越多,安全与隔离要求越高;第二,智能体执行任务的请求数量远超人类的一次提问,上下文(prompt)会一级级叠加、爆炸式增长,直接催生了 KV cache 存储与重用这一行业标配;第三,KV cache 体量大到必须跨节点搬运,加上 Prefill/Decode 分离(PD 分离)和 MoE 大模型动辄跨几十个 GPU 的分布式部署,网络从"支持连接的角色"变成了"决定推理性能的核心部件"。

阮伯超观点里最有启发的一条是:决定推理平台性能的不是平均延时,而是尾延时。他的比喻很直白——把资料从第一个人传到最后一个人,前面十个人都快没有用,最慢的那个人决定一切。尾延时直接决定 TTFT(首 token 时间)和 TPOT(每 token 时间)这两个推理平台的核心指标。基于这个判断,英特尔主张的网络路线是不依赖无损网络——千节点到万节点的无损网络"非常非常困难"——而用端到端感知拥塞、多路径乱序控制和选择性重传(丢哪个包只重传哪个包)来替代。据阮伯超引用的与合作伙伴在超百万节点上的验证数据:当规模从 50 节点扩展到 500 节点,其他技术的尾延时增加约 6.8 到 7 倍,该方案只增加 1.6 倍;落到收入侧,token 输出时间缩短 20-33%,同 SLA 下可支持的并发用户增加 20-49%。

这条链的终点是一个商业判断:训练是花钱的,推理才是赚钱的,业界未来约 80% 的基础设施建设会用于推理(阮伯超认为)。推理必须讲性价比——“我很贵但我卖得便宜,那就挂了”。因此网络优化的每一个百分点尾延时,都会直接转化为 token 营收。这是整场专场所有产品发布共享的底层逻辑:网络的确定性,第一次被明码标价。

用通信换计算:带宽重新变成稀缺品

祝顺民的年度发布把这层逻辑推向基础设施投资侧。他坦言过去一年最大的压力是"不要让 GPU 等网络"——GPU 太贵,网络传输慢一秒,就是真金白银的算力空转。为此阿里云给出的资源配置是:全球 region 间带宽平均容量提升 130%,公网容量提升 170%(发布会数据),结果是 GPU 应用启动时间下降 90%,训练中 GPU 闲置时间降低 25%。祝顺民用了一个内部流行的说法来概括:用通信换计算。

但带宽扩张有自己的物理学。祝顺民同时坦承:需求增长快于交付速度——尤其跨洋海缆的建设周期特别长——网络资源在过去一段时间出现了紧缺,价格在逐步回升。这是一个值得所有 AI Infra 从业者记下的信号:算力军备竞赛的瓶颈正在向"带宽"这个传统电信业变量传导。

具体到产品层,这场发布有三个技术动作值得展开。第一是 Jumbo Frame(巨帧):把网络设备间 MTU 从常规的 1500 提升到 8500。听起来简单,但正如高级产品专家孙佳辉所说,绝大多数网络运营被"锁死"在 1500 这个数字上——当某天你想改它,会发现这是一项涉及所有网元、还会引发网络瞬断的浩大工程。阿里云去年完成了 ECS 与存储等云服务间的全链路巨帧改造,本次进一步覆盖网元、负载均衡、转发路由器、专线等所有环节,每包有效载荷提升 5.6 倍(发布数据)。第二是 RDMA 二代:在 VPC 上原生支持 RoCEv2 协议,用于异构 PD 分离和 KV cache 传输加速,业务网络拓扑无需改动,长尾时延(P90/P99)显著均匀化。第三是自研可编程芯片的首次公开:阿里云用三年时间基于 IPG 研发出支持 P4 可编程的转发芯片,从第一代 400G 网卡迭代到如今单张 800G、单机四张、整机 3.2T 转发性能,P4 可编程与流水线动态编排使研发效率提升 60%。祝顺民对"云厂商为什么要自研芯片"的解释也坦率:规模不可能像 GPU 那样大到值得做 ASIC 流片,所以追求的不是极致性能,而是在性能与功能复杂度、研发效率之间取平衡。

确定性这条线上还有两个针对企业痛点的发布。一是 BYO ASN/IP:过去企业上云后只能用云厂商的 IP 和 AS 号对外发布,在强监管、强合规行业(IP 与 AS 号代表企业自身的信誉与身份)这是无法接受的;本次支持企业把自有 ASN 与自有 IP 组合在云上发布,白名单行业无需改动即可上云。二是公网"气象图"与调度:基于上万个探测点实时呈现从任一 region 到全球任一城市/运营商的质量状况,配合 Net Express 技术在运营商劣化时切换路径——据发布数据,与网易合作两年间每月至少执行 400 多次调度,P90 延迟平均优化 25ms。孙佳辉把这套机制总结为一个飞轮:质量提升→时延降低→更多业务上云→与更多运营商互联→可调度空间更大→质量再提升。公网质量第一次从"看天气"变成可运营的资产。

推理下沉边缘:杀手级应用可能终于要来了

如果说确定性是"量"的问题,那么边缘就是"形态"的问题。祝顺民的判断是:未来推理除了中心 region 里的大参数模型,小参数模型的推理会是更丰富的业态,而小模型推理的最佳部署位置是边缘——两个决定性优势:离用户近、延迟低;分发与带宽成本低。他还补了一个行业观察:从 5G 时代起边缘计算一直在等一个杀手级应用,等了很多年没等到,但 AI 时代(尤其视频语音交互这类对延迟极敏感的场景)可能会真正落地。

边缘云高级产品专家佘俊泉用三个场景把这个判断做实了。最有说服力的是模型侧的变化:他引用第三方评测(节目称 Artificial Analysis 2026 年 8 月智力指数)称,千问 3.8-27B 的小参数模型综合能力已打平甚至超越上代旗舰大模型;同时扩散模型与文生文不同——增大 batch size 没有推理效率红利,大集群与小集群的推理效率相当。两条曲线叠加的结论是:边缘小集群做 AIGC 视频生成,效率不输中心大集群,而体验和分发成本占优。客户数据侧(嘉宾引用):某客户用"GPU 裸金属本地盘 JustFS(命中率约 70%)→ 边缘对象存储 EOS(单节点约 5000 个模型)→ 中心 OSS(数万模型定期同步)“三级存储架构做模型快速切换,综合成本降低 30%;正在公测的 Art Node 视频生成平台支持 PaaS 试错与专属 GPU 打满的双模推理,客户反馈综合成本降低 70%。

内容侧的佐证更直观。佘俊泉引用数据称红果短剧月活已超过四家头部长视频平台之和,其中超 90% 内容由 AIGC 生成;海外案例 FAL 的直播间用弹幕作提示词实时生成视频——每 5 秒视频只需 3 秒生成加 0.5 秒分发,实现不间断的个性化实时直播。他的推论是:数字内容正从"先生产后消费的标准化内容"走向"实时生产、实时消费的个性化内容”,而这类应用天然属于边缘。(注:以上均为嘉宾引用数据,本文未独立核实。)

物理 AI 公司 Maxinsights 的杨木山从数据侧讲了一个同构的故事。他们管理交付的数据量在一年多内从分钟级涨到百万小时级,他提出把"数据量"拆成存量、流转、交付三种——物理 AI 数据赛道三者都极高,因为全球采集的数据要经历清洗、标注、多算法加工,且每份交付物都是客户定制化的。架构演进的转折点在于:从"数据在哪里就在哪里建基础设施"转向"以数据流动为中心,把带宽放到架构组织的核心"。改造后的近半年(嘉宾数据):存量数据量增长 10 倍,流转数据量增长 30 倍——“对于物理 AI 数据来说,数据的流动可用性比存量更重要”。计费方式也随之从按环节流转付费变成整体带宽付费,换来可用性(多链路互备)、流量弹性(资源在采集与交付环节间动态倾斜)和算力弹性(按需接入边缘算力而不增加带宽成本)三重收益。

Agent 成为网络新主体:安全从"连接"变成"授权+审计"

整场专场最密集的发布,围绕"当网络的主体从人变成 agent"这件事展开。祝顺民做了一个大胆的预测:不到十年,互联网流量可能 99% 以上由 agent 产生,人类流量不足 1%。产品经理贺剑把这轮变化拆成三层,每一层都在挑战传统网络的假设。

入口层:agent 的沙箱(sandbox)计算载体自带身份属性,所以不能像过去那样"先调度流量、再做身份鉴权";沙箱规模从传统应用的一两千个 Pod 暴涨到万级、十万级,且实时创建销毁,没法再一条条挂到负载均衡后面。阿里云的 ALB 应用负载均衡为此做了动态转发:请求声明访问哪个沙箱、网关前置身份鉴权、范围用 CRD 圈定,后端不存在时明确应答而不是挂起。部署层:多模态把视频、图片、语音塞进主站普通请求,“大带宽和低时延聚在了一起”;跨用户、跨 VPC、跨地域甚至跨公司的资源共享,过去靠打通 VPC——等于把整个 VPC 敞开给对方——新的 Resource Gateway 把共享收敛为"一把只能开特定端口的钥匙"。出口层是最敏感的:贺剑点破了 agent 的本质矛盾——“agent 作为你的分身,但他又不完全受你所控”。祝顺民也提到几天前的新闻:某 agent 把用户代码通过互联网传了出去。所以本次发布面向 Agent 场景的 EPG(Egress Proxy Gateway,全托管出站代理网关):沙箱不开公网、出站流量经正向代理收口,支持 TLS 检测与域名级管控(测评场景禁止检索答案、to C agent 禁止访问公司资源),调度侧还能把同一服务的请求固定到同一出口 IP——用贺剑的话说,“让你的 agent 更像你自己”。

这场发布最生动的落地来自小鹏汽车高级总监何锐邦。小鹏 2026 年 4 月正式更名小鹏集团,向物理 AI 公司转型(外部已核验),内部累计创建了 7000 多个 agent、上线约 1000 个——没上线的 6000 多个是被一套严格的准入机制拦下的,“避免低效 agent 浪费 token”。真正与网络相关的痛点在规模化之后:agent 爆发式增长让后端沙箱极高频扩缩容,传统负载均衡"一个沙箱一条转发规则"的模式逼近上限,运维成本指数级上升;而沙箱默认被视为不安全环境,既要去内网调用可信服务,又要大量访问互联网,数据泄露风险随时潜伏。小鹏的方案是"全球一张网"四个关键:用 ALB 动态路由替代传统 LB;用 PrivateLink 打通内部业务、避免沙箱与服务间全通访问;用 NAT 网关加 EPG 严格管控 agent 外联流量;用全球加速组合拳解决全球访问体验。何锐邦的总结代表了客户侧认知的转向:“网络不再是简单的管道,而是业务创新的核心基础设施。”

网络自身的 Agent 化:谨慎是主角,仿真是前提

最后两条链关于"网络自己怎么用 AI"。网易互娱云解决方案团队产品经理康雪分享了与阿里云两年联合实践的方法论:业务方掌握玩家真实体验(哪个国家延迟涨了、哪些大 R 玩家受影响),云侧掌握基础设施探测全貌,双方"各掌握一半数据、用不同的数据语言"。解法不是再造一个工具,而是先统一数据语言:以"国家×运营商→region"为原子链路,把业务侧的敏感度分级注入云侧监测体系,让云知道一条链路 0.5% 的丢包对某项目是否致命。在此之上做质量左移(网络质量基线用于上线前选点选云、七条准出基线)、AI 告警降噪、玩家网络诊断 agent 归因、Net Express 调度快速止血。康雪个人给出的 AI 自主化三因素尤其值得记下:自主程度取决于置信度、可逆性和影响范围——在受控边界内治理,而不是追求自动化程度本身。

阿里云内部的"数字网工"走了同一条谨慎路线。孙佳辉直言:让 AI 写一坨 terraform 网络配置"非常简单,但是真的敢用吗?不敢用"——因为缺了最关键的一环:仿真。全球组网里任何一个路由变更都可能传播到网络每个角落甚至影响线下 IDC,AI 给不出影响面答案。当前的做法是抓取线网快照、计算变更后的路由/路径/流量变化、输出影响面报告,未来才走向"自然语言需求→自动出方案→方案在 agent loop 里与仿真互相迭代"。目前阿里云云网络处理用户工单的第一界面已经是一个 agent:所有问题先由 agent 分析并生成报告供工程师参考,据称在已验证的 80% 场景里效果"非常好"(发布方数据)。连接交付侧的变化更超前:Megaport 解决方案架构师卓诗嘉演示了阿里云 Qoder 与 Megaport MCP/CLI 的联动——用户提出"把数据中心里的 GPU 资源紧急连到最近的存储",agent 追问带宽与 VPC 参数,主动提醒这是付费服务、得到确认后完成部署,全程在 portal 可见。Megaport 覆盖 31 国 185 城 1100 多个数据中心(嘉宾陈述,官方文档数量级一致),宣称连接部署 60 秒完成。网络这个最传统的行业,交付界面正在变成对话。

这场发布意味着什么,读者该怎么看

把六方说法串起来,2026 年云网络的处境可以概括成一句话:AI 把网络从"成本项"重新做回了"决定项"。推理的性价比由尾延时决定,GPU 的利用率由带宽供给决定,agent 的安全边界由网络授权决定,边缘商业模型由分发距离决定。四件事叠加,让一个此前被认为"会被 AI 绕过"的行业反而被更重度地依赖——祝顺民原话:“我们曾经在两年前还在思考,AI 的出现会不会让网络进入一个被遗忘的状态。恰恰相反。”

对读者的可迁移判断至少有三条。其一,评估 AI 基础设施时盯 P99 而非均值:任何只报平均延时的网络供应商,都在回避决定推理收入的那个数字。其二,把"每 token 的网络成本"纳入算力预算:带宽已是重新定价中的稀缺品(海缆周期、资源价格回升都是先行指标),Jumbo Frame、RoCEv2、边缘下沉是现在就可执行的对冲手段。其三,agent 的安全治理要在网络层留最后一道闸:模型层的行为约束永远有漏网概率,入口身份化、资源共享最小化、出口域名级管控构成的是"授权+审计"体系而非简单的连通性。

需要保留的不确定性同样清晰:56.5% 的非人类流量占比是嘉宾转引,Cloudflare 公开报告可佐证方向(2025 年非人类请求份额长期高于人类,12 月人类占 HTML 请求 47%)但未能核到该精确数字;“十年内 99% 流量由 agent 生成"是个人预测;小鹏的 7000 个 agent、红果短剧的日活对比、FAL 的 3.5 秒生成 5 秒视频均为嘉宾引用,本文未独立核实;千问 27B 对 GPT/Claude 的超越来自单一第三方评测口径。观察这场转型是否成立,接下来值得盯的指标是:跨洋带宽价格走势、边缘 GPU 实例带宽升级(25G→100G→200G)的实际落地节奏、以及 EPG 这类 agent 出口网关在企业侧的采纳率——它们分别对应稀缺性、边缘推理成本和 agent 安全这三条主线从"发布"走向"验证"的时刻。

(素材说明:本文基于 2026 云栖大会云网络专场分论坛《从连接万物到连接智能,加速客户AI创新》现场转写(约 171 分钟)整理,讲者人名与议程已按云栖大会官方议程页校正;文中转写疑似错误处按上下文修正并保留存疑标注,未经核实的数据均已注明归属。)