7B模型挤进闭源效果区、8块钱的翻唱与六个人的偶像工厂:云栖2026视听生成专场复盘——当创作被批量供给,稀缺的成了故事与判断

2026 云栖「视听生成:多模态创作与文化娱乐」专场复盘:千问Image 2.1 以 7B 开源挤进闭源效果区并获英特尔 Day Zero 端侧支持;Wan 3.0 与 Agentic PE 把视频生成推向导演思维;Happy Shrimp 1.1 要让不懂乐理的人「像写代码一样做音乐」;太合音乐总裁余灏摊开 8 元 AI 翻唱对 5000—30000 元实录的成本塌缩与 3000 个版本的维权困局;小旭音乐六人团队运营十几个 AI 歌手、四五个月全网播放破两亿。当供给端被无限放大,「为什么表达」成了全场最贵的提问。

September 24, 2026 · 4 min

实时生成视频的想象空间:从创作工具到“使用即消费”——对话生数科技 Vidu S 负责人张金涛

生数科技 Vidu S2 负责人张金涛(清华朱军教授博士生、SageAttention/TurboDiffusion 作者)做客晚点聊,谈实时交互视频生成:离线生成是被播放量束缚的创作者工具,实时交互是“使用即消费”、每人一个独立会话,需求上限在他看来最终能超越语言模型;数据比模型规模更重要,推理越多越赚钱,最大的护城河与最大的担忧都是数据。

September 24, 2026 · 2 min

把视频做小,再把视频做大:云栖2026上的AI原生视频云

2026云栖大会「AI Native视频云」论坛七场分享给出同一判断:时延、质量、成本框架未变,语义却被AI重写。达摩266规模化商用带来大盘约20%带宽节省,MoQ把实时网络从会话改造成对象分发,A.O.史密斯以"先确认再执行"应对高风险家电动作,生数科技Vidu让视频流在传输中被实时改写,点众科技以"低档生成+超分"重算短剧成本账。关键主张已外部核验,存疑处已标注。

September 24, 2026 · 1 min

账号开了,产能没来:云栖2026「智启新程」四家企业把AI从工具熬成资产

云栖大会「智启新程:AI驱动创新企业」分论坛复盘:阿里云张亮定调企业AI市场靠生态接力,麦芽传媒用Wan3.0把几千个导演蒸馏进生产系统,赛维时代让经营大脑7×24自己跑生意,赛意信息先拿自己开刀再固化数字人,云巴巴用FDE解决「账号买了、90天后没人用」的最后一公里。核心判断:AI落地的瓶颈已从模型能力转移到场景选择、经验沉淀与验收机制;签约八组、授牌二十七家,生态正在把这件事变成一门生意。讲者与机构均已对上公开信源。

September 24, 2026 · 1 min

WorldCrafter:用隐式 3D 感知记忆打造可一致探索的视频世界模型 精读

深度精读腾讯 IEG ARC Lab 与北京大学联合提出的 WorldCrafter。它用一个「隐式 3D 感知记忆」模块让视频世界模型在长时间、可自由探索的交互中保持场景一致性:以 LagerNVS 初始化记忆编码器、用姿态引导读出、与视频 DiT 联合训练,配合最大覆盖历史检索与少步蒸馏,在 4 卡上达到 16fps 实时。重访一致性 LPIPS 从 Lyra 2.0 的 0.487 降到 0.255,相机控制旋转误差 13.536 为全场最低。

September 23, 2026 · 3 min

Programmable World Model 精读

Programmable World Model(PWM)把视频世界模型拆成两层:agent 把自然语言编译为可执行程序(实体状态+转移规则),轻量引擎执行程序维护显式持久全局状态(含屏外实体与非视觉属性);状态经增广 3D OBB 中间表示+相机轨迹确定性编译为像素对齐条件信号,驱动预训练视频模型当生成渲染器。自建 CombatStateBench 上 Count Accuracy 94%(超 LingBot-World-V2 达 53.25 分)、State Accuracy 98%(超 90 分),支持连贯长时程生成。本文精读’符号引擎管规则、生成模型管外观’的解耦架构为何系统性消灭状态漂移。

September 11, 2026 · 1 min