先说结论
这是2026云栖大会「AI Native视频云」专场(9月23日上午,国博一期207会场)给人最一致的信号:视频云的三个关键词——时延、质量、成本——一个都没换,但每一个的语义都被AI重写了。时延从"打开直播间不黑屏"变成"每一次点击被实时响应";质量从"像素清晰"扩展到"语义与镜头语言不出错";成本从"存储传输费用"变成"AI生成、分发、修复的全链路算力账。七位讲者(阿里云视频云产品负责人卞天祥、达摩院视频技术实验室负责人叶琰、阿里云资深技术专家田伟峰、A.O.史密斯中国区副总裁杨国斌、生数科技商业化产品负责人杜晓雷、阿里云算法专家张艺、点众科技首席架构师陈登宇)从产品、编码标准、传输协议、家电场景、生成模型、画质算法、短剧出海七个位置讲的是同一件事:视频的消费对象正从人扩展到模型与机器,整条云上管线都在为此重构。最有代表性的一组对照来自点众科技:分发端把一分钟视频从7-8MB压到3MB,生产端却故意用低分辨率生成再超分回高清——把视频做小是为了省带宽,把视频做大是为了省算力,一减一增背后是同一套成本逻辑。
框架未变,语义已变
卞天祥的开场报告把产业变化收敛成三组数字(嘉宾称):截至2025年底,约75%的移动互联网流量承载的是视频;中国视频观众规模接近11亿;58%的用户曾因观看视频购买过从未体验过的产品或服务。第三个数字是关键——它说明视频已经从单向消费变成互动对象,而这正是"视频云为什么要变"的起点。
他给出的三条变化线是:消费侧,视频的服务对象从人扩展到AI和机器,“人觉得不重要的信息,对模型来说可能至关重要”;供给侧,AIGC让大量视频由模型和机器人生成,不同格式、不同处理要求的素材需要统一媒体平台承接;业务侧,视频业务的边界随生产与理解方式的改变持续扩大。但卞天祥刻意强调"三个不变"——时延、质量、成本始终是视频云的核心竞争力框架,AI时代只是给这三个词换了解释。这个叙事结构本身值得注意(写作者推断):平台型公司在技术代际切换时倾向于强调连续性,把新能力包装成旧框架的升级而非推翻,以降低客户的迁移焦虑。论坛尾声他预告的产品蓝图"AI Media Infra"也是这个逻辑——底层资源与分发、中间原子媒体服务加AI能力、上层智能编排,让原子能力被编排成业务工作流。
机制→影响→启发链之一:视频的"观众"从人扩展到模型(机制),导致编码、传输、质量评估都要为机器视觉另立标准(影响),启发性在于——凡是"内容开始被机器消费"的行业,其基础设施都会经历一次面向机器的重写,机会藏在"人眼觉得冗余、机器觉得关键"的那部分信息里。
编码的代际生意:H.266跨过三道门槛
叶琰的分享是全场技术密度最高的一段。达摩院视频技术实验室深度参与H.266(VVC)、AVS3标准,正在重度参与下一代H.267,并主导了基于生成的人脸视频压缩、面向机器的视频编码等新方向标准,积累了数千项国际发明专利(嘉宾称)。她/他讲述的核心判断是:H.266已经走到规模化商用的临界点,因为它正跨过三道门槛——硬件支持(华为2024年旗舰机先行,小米今年跟进,MTK与高通先后发布支持)、软解能力(硬件铺量前的过渡方案)、以及业务侧头部长短视频和短剧厂商的规模应用。
支撑这个判断的数据(均为嘉宾称):达摩266相比x265有50%以上的压缩能力提升(代际目标是两倍压缩效率),相比AV1也有15-20%的提升;4K场景下H.265需要3Mbps码率,H.266只要1.6Mbps;主观测试中91%的消费者认为效果更好或不可区分;考虑业务大盘只部分采用H.266转码,头部业务伙伴实际拿到约20%的大盘带宽成本节省;达摩266自2021年规模落地,点播日播放量已过亿,直播转码2024年上线,最高支持1080P60、毫秒级转码时延。
编码的意义被两位讲者从不同角度说透了。卞天祥的定义是"编码本质上是用算力去换存储或换带宽",这是个规模生意——生产视频的量越大,用算力换出的节省效应越大。这正好解释了为什么AI时代编码反而更重要:AIGC让供给爆炸,带宽与存储成本压力同步放大。
叶琰分享的后半段从像素跳到语义与三维。视频理解上,实验室走了一条"三层分层"路线:底层用专用小模型为整个视频建立详尽的数字档案(事实感知层),中层把档案交给大模型画重点、贴标签(聚焦层),顶层对整个故事脉络做全局叙事总结,提炼内容大纲、关键转折点及其前后因果(叙事层)。这个设计的动机很实际:专用小模型便宜、快、精度不差但不通用;多模态大模型通用、开箱即用但token开销巨大且偶有幻觉。三层串联后,粒度可以细到每一帧、推理做到准实时、成本远低于直接调用大模型(嘉宾称),相关能力已全面上线阿里云,超分与插帧算法也有外部客户调用。三维方向上,实验室把宝押在3D高斯泼溅:相比传统的Mesh网格与点云,它基于可微渲染、可高效光栅化,实时性与照片级真实感兼得。落点选在电商——用任意消费级手机采集商品视频,云端完成3D建模,再结合生成能力直接产出商品爆炸图、运镜特效,最终在商品页做裸眼3D展示;嘉宾称单品转化率有非常明显的提升,爆炸图对支付转化率与收藏加购的提升明确,优酷封面图的裸眼3D尝试也让广告点击率有明确提升(均未给出具体数值)。
机制→影响→启发链之二:新一代编码标准压缩效率翻倍,叠加终端硬件解码支持到位(机制),使平台在部分采用的保守策略下仍能拿到大盘约20%的带宽节省(影响),启发是——编码标准是一种"算力税对冲工具",其商用节奏由终端芯片生态决定而非算法优劣决定,判断新一代标准的落地窗口要看手机厂商的旗舰机时间表。外部核验显示,MoQ式的判断逻辑同样适用编码界:达摩266的公开指标方向与VVC社区的普遍数据一致,具体数字(91%、20%)为厂商口径,未见第三方复现。
从会话到对象:MoQ重写实时网络
RTC(实时通信)是本场出现两次的主题,一次在产品层(卞天祥),一次在技术层(田伟峰),两次都指向同一个结论:传统RTC已不适合AI实时互动应用。田伟峰把场景变化讲得很具体——过去RTC连接的是人和人,关心听得见看得清;现在链路两端变成了模型和机器:一端是人和Agent,另一端可能是实时生成的数字世界(世界模型),也可能是正在作业的机器人(具身智能遥操)。传输内容从音视频扩展到连续上下文、实时生成的视频、遥测数据和控制指令,RTC的目标从"维持一次会话"变成"支撑感知-理解-反馈的闭环"。
传统架构的三重瓶颈(田伟峰):一是协商链路长,SDP、ICE、DTLS、SRTP层层握手导致连接耗时高、弱网易失败;二是传输通道割裂,音视频走RTP、控制与传感数据走能力有限的data channel,应用层还要自己做对齐;三是可控性受限,H5场景下Jitter Buffer与WebRTC栈难以分离,极致低延迟优化无从下手。
出路是MoQ(Media over QUIC)。田伟峰概括其四个优势:连接更快更稳(建联、鉴权、订阅并发化);对象化传输(音视频、深度传感、控制信息统一为可发布可订阅的对象,按时间、优先级、依赖关系协同);按数据类型定义传输策略(可靠性、优先级、过期丢弃策略原生可配);通过WebAssembly单独实现Jitter Buffer,释放H5端优化空间。服务端随之从"房间转发"走向"媒体对象路由",智能网关一边接媒体传输、一边接AI编排调度(ASR、降噪打断、大模型、TTS)。外部核验确认:MoQ是IETF moq工作组在研标准,核心文档draft-ietf-moq-transport截至2026年仍为草案、尚未成为RFC,Cloudflare等厂商已上线MoQ中继试点——阿里云的讲述与行业标准进程吻合,但"替换WebRTC"仍是进行时而非完成时。
在此基础上叠加快速补全球专线、多网卡多路径容灾、按任务价值(而非媒体类型)调度优先级,田伟峰报出的结果是(厂商自报):端到端延迟从200多毫秒降到80毫秒,接入交互次数从8次以上降到2次,传输丢包率降低60%,抖动降低50%。智能网关还会根据模型置信度动态调整抽帧与分辨率——模型自信时少传数据,置信度下降时提升采集质量。
机制→影响→启发链之三:把媒体从"流"重新定义为带语义属性的"对象"(机制),让网络第一次能区分音频视频、优先级、是否过时,从而并发建联、按价值调度、端网协同(影响),启发是——AI基础设施的瓶颈越来越多地出现在协议语义层而非带宽层;谁能给传输对象赋予机器可读的语义,谁就掌握了新一代实时网络的定义权。田伟峰那句"稳定的延迟有时候比最低的延迟更有意义",值得写进每一份实时AI产品的需求文档。
客厅压力测试:快、准、稳、成
任务里提示的"智能厨房油烟机语音交互案例",讲者正是A.O.史密斯中国区副总裁杨国斌——一家1874年成立、1998年进入中国、服务上千万家庭用户的水设备厂商(公司背景已核验;152年历史与1874年创立自洽)。这场的价值在于:它把云栖上大量"技术已就绪"的叙事放进了真实的客厅,暴露出实验室里不存在的问题。
Life-GPT 2.0的工程目标被提炼为四个字:快、准、稳、成(产品名在转写中误作"Lab GPT/Live GPT",经议程与外部报道校正为Life-GPT,该大模型及灶具-油烟机-蒸烤箱-净水联动的"瀞厨房"已有公开报道佐证)。快:开口即应、边说边答、随时打断,全链路流式化——语音RTC流式上传、流式ASR、流式大模型推理、流式播报,相邻两段语音重叠推进,平均响应控制在1.5秒内(厂商自报)。准:前提是设备安静——油烟机60分贝以内,信噪比高,识别才有基础;再叠加"四路信息"理解:会话上下文、用户偏好、环境状态、设备状态。杨国斌举的例子很生动:晚上十点一句"准备睡了",背后是四个维度同时在变——哪个房间谁在说、室外空气、夜间噪音敏感、设备耗材周期,都需要系统实时共同判断。稳:在推理与执行之间放一层安全护栏,分三条:只做有权的事(只操作本用户授权的设备与信息)、回答有据(关键结论依据家电知识库,不臆测)、先问再动(高风险动作二次确认留痕)——“热水有烫伤风险,是否打开?“必须等用户确认。成:一句话拆成一串动作。案例"烟机打开爆炒档,蒸烤箱开始蒸鲈鱼"被拆成三个设备的编排执行,每个动作有回执,受阻则重新安排;“出差一周,家里帮我安排一下"则触发离家模式、节能模式、回家前预热的全序列规划。
这个案例揭示了家庭场景的真实复杂度:不是模型智力不够,而是家电动作的不可逆性(烫伤、误触发)要求一套与聊天机器人完全不同的安全范式。
机制→影响→启发链之四:大模型存在幻觉且家电动作不可逆(机制),倒逼出"权限过滤+知识库依据+高风险二次确认"的三层护栏(影响),启发是——所有把大模型接入物理世界的场景,都可以直接抄这套"先确认再执行"范式;反过来说,缺少这层护栏的智能硬件,其"聪明"本身就是风险。写作者推断:这也是本场最容易被低估的一段——它示范了云厂商(阿里云提供实时音频、千问语音模型、百炼记忆知识库、安全护栏)与设备厂商(提供家电知识库、场景、执行体系)的分工界面,未来会复制到更多传统行业。
流在被实时改写:生成、修复与"先抽卡后超分”
下半场三段分享拼出了生成侧的完整图景。生数科技杜晓雷的开场视频极具冲击力:一段看似普通的视频通话里,人物的穿搭、背景、所在场景全部被实时替换"以假乱真”。他的论点是:视频内容在采集时就被定死的时代结束了——流不仅可以在传输中分发,还可以在传输中被改写。
市场数据侧(嘉宾称,部分已核验):截至2025年12月中国生成式AI用户6.02亿、同比增长141%——此数字经CNNIC第57次报告核实为6.02亿、+141.7%,口径一致;AI社交陪伴应用在部分地区收入增速达676%(转写数字,未见公开出处,存疑);Vidu从V1.0到V2.0迭代仅69天;某社交业务(转写疑为"Turbine”)半年营收超5.3亿美元(转写疑似,存疑);第三方预计2030年全球社交应用市场规模3100亿美元。杜晓雷的解读是:大家不只想看AI生成的内容,还想和它互动——离线生成是已成熟的第一条曲线,实时交互是萌芽期的第二条曲线。
技术底气来自Vidu S2(外部核验:生数科技与清华大学联合研发,S2-Avatar实时交互数字人+S2-Editing实时视频编辑,官网与技术论文均可查证)。两个关键技术点:帧对齐注意力(转写误作"吸住注意力")保证画面每一帧严格对齐原视频时刻,换装换人后运动轨迹不穿帮、画面不撕裂;针对流式生成最致命的累积误差——前面画面的错误会作为历史包袱指数级传下去,导致画面漂移崩溃——团队让模型先按真实推理生成长视频,回头检查问题片段,重新加噪、因果重构、再训练,“让模型在自己犯过的错误上训练”。推理侧则通过低比特计算、算子融合、编解码器共享把延迟压到百毫秒级。落地案例:与造梦次元打造虚拟IP"子英"直播上岗,实时响应弹幕礼物、送礼触发换装唱歌PK;与360合作把《甄嬛传》做成可复制的IP互动样板。难得的是他公示了未解决清单:空间视频仍在探索、头显场景延迟未解决、长时复杂交互可靠性还在打磨。
张艺(转写误作"张毅")的窄带高清分享补上了生成内容的"售后"环节。AI短剧兴起让超分、增强、修复、转码需求急剧上升,而AI视频有自己特有的低质表现:每帧生成细节不同导致的时域闪变抖动(转写误作"食欲闪抖")、人脸五官缺失、手指粘连、文字畸形。阿里云的对策包括单步扩散大模型增强(864×496超分到1080P,文字处理"像真实写上去"而非AI生成)、基于扩散模型的人脸修复(先验特征字典+浅层特征编码解决小脸latent信息丢失,修复后"还是这个人,不会变脸")、以及自研S系列编码器(S取自Singularity)——相比开源x264/x265有20-40%压缩率增益,最快档比x265的ultrafast快50%的同时压缩率还高20%。更有意思的是编码器优化本身也在被AI自动化:一套Planner-Generator-Evaluator闭环系统自主优化编码器,人在其中只定义目标和边界,短剧通用场景已获得5%压缩率提升、垂直场景超15%(嘉宾称)。
最后是陈登宇的成本账,恰好把"做小"与"做大"合拢。做小(分发端):短剧运营成本60-70%以上是带宽(嘉宾称),点众从720P+窄带高清1.0起步,经短剧场景定制模板、H.265策略升级(配套灰度机型白名单——因为H.265设备支持率实际只有90%以上而非100%)、A/B验证无损后放量,一分钟视频从7-8MB压到4-5MB再到约3MB,累计体积优化约60%;H.266试验中,预估还能再降30%以上流量,但设备支持率低所以谨慎。做大(生产端):AI生成短剧极贵——嘉宾称早期720P生成约1元一秒,抽卡率好坏差距从三抽一到八抽一不等;而生成分辨率每降一档成本约降一半,超分却按分钟计费几乎可忽略——所以正确姿势是"用480P抽卡、720P生成、再超分回1080P"。方法论总结只有一句:以成本为维度立标准,分桶试验,验证后放量,再进下一轮迭代。
机制→影响→启发链之五:流式生成存在累积误差、AIGC画面存在结构性缺陷(机制),催生出帧对齐注意力、自纠错训练、单步扩散增强、人脸一致性修复这一整族新技术(影响),启发是——每一次生成力的跃升都会配套催生一个"画质售后"市场;而"低档生成+后处理定型"(先便宜试错、后花钱修图)是所有AIGC生产流程的通用成本结构,点众的账本证明这个结构已经跑通到了利润表层面。
收尾:一场论坛,一条主线
把七场分享叠起来看,主线其实只有一条:视频正在同时经历"被机器消费"(编码、传输、理解为机器重写)、“被机器生产”(AIGC供给爆炸、画质售后市场兴起)、“被实时改写”(流式模型让内容从制成品变成进行时)三重转变,而视频云是这三重转变共同的承压层。时延、质量、成本的老框架之所以没被抛弃,是因为它们恰好是三重转变的三个受力点。写作者推断,未来一两年值得盯的信号有三个:H.266终端支持率何时过临界点(决定带宽成本曲线)、MoQ何时从草案成为RFC并出现跨厂商互通(决定实时互动应用的爆发窗口)、以及"生成后修复"是否会从云厂商的增值服务变成独立赛道。论坛尾声主持人的收场词说"让视频云的能力在更多场景中生长"——从这场的内容密度看,这不算客套。
信源说明:本文基于云栖大会2026「AI Native视频云」论坛(liveId 255916)官方转写全文(128段,覆盖全部约127分钟)整理,议程信息取自云栖大会官网议程页。转写中的ASR错误已按议程与外部信源校正(如叶琰、张艺、杜晓雷、Life-GPT、Vidu、Media over QUIC、Jitter Buffer等约20处),未能确定者已在文中标"转写疑似/存疑"。外部核验项:CNNIC生成式AI用户数据、A.O.史密斯Life-GPT及瀞厨房联动、生数科技Vidu S2技术能力、MoQ IETF标准进程、点众科技业务与产品线、H.266/VVC公开指标方向。文中标注"嘉宾称/厂商自报"的数字(如91%主观测试、20%带宽节省、80毫秒端到端延迟、1.5秒响应、30%体积优化)均来自现场口述,未经第三方复现。