先说结论
今年是视频生成爆发的一年:2 月字节上线 Seedance 2.0 引发全球热议,快手可灵 AI 的年化收入(ARR)在 1 月已突破 3 亿美元,8 月 MiniMax 开源 H3 模型后股价累计涨超两成(主持人称发布当日涨近两成;据财联社等报道,8 月 3 日开源当日涨超 10%,至月底累计涨幅超 20%)。但这些热闹基本都发生在"离线生成"范式里——输入一段描述,等待,拿到一段十几秒的视频。
这期晚点聊的嘉宾张金涛主张另一条赛道:实时视频生成是另一种东西、另一门生意。张金涛是清华计算机系朱军教授的博士生(即将答辩毕业),SageAttention、TurboDiffusion 等推理加速工作的作者,现任生数科技流式视频生成与推理负责人,全链路主导了 7 月 3 日发布的 Vidu S1 和 9 月 16 日发布的 Vidu S2(距上一代仅 69 天)。他的核心判断是:离线生成是"创作后消费",市场被创作者数量和播放量两级束缚;实时交互是"使用即消费",每个人需要一个独立的会话与推理服务——需求上限"最终是能完全超越语言模型的"(嘉宾观点)。这不是一家之言的口嗨:海外的 Decart 靠同赛道拿到约 40 亿美元估值,2026 年 8 月更传出 Anthropic 以 60 亿美元洽购的消息(彭博等报道,交易未最终敲定)。
69 天迭代:S2 把实时视频推进到"与世界交互"级
先看产品本身。按生数官方口径,Vidu S2 包含两个模型:面向持续交互数字人的 S2-Avatar,和面向输入视频流实时编辑的 S2-Editing。S2-Avatar 把实时输出从上一代的 540P 提升到 720P、25-40 FPS,支持任意时刻插入参考图和指令(例如"从屏幕下方拿起一个杯子并展示"),并引入基于视觉语言模型(VLM)的 Agent 系统来规划连续动作;S2-Editing 则可以对摄像头画面、游戏画面、直播流做实时换装、换风格、换背景、换角色——张金涛的设想是"Steam 上有一百个游戏,装一个插件,就相当于有一万种玩法"。
访谈中一个有意思的插曲:聊到一半,张金涛发现团队的技术报告刚刚挂出,顺势展示了官方页面上的空间视频(VR)版本——Avatar 和 Editing 的输出都可以实时转换为左右眼视频在头显中观看。他坦承这部分"技术路线还比较简单,完全可以用,但之后会做得更扎实"。
这套能力被放进朱军教授的"通用世界模型五级分类"框架里理解:第一级是生成视频的模型,第二级是能与世界交互的模型——张金涛认为 S2 的 Avatar 和 Editing 正处在第二级。生数目前的三条产品线——视频基座模型(Q 系列)、S 系列实时生成、具身世界模型——里,S 系列是今年一二月才立项、三月启动的新线。S 系列迭代快(69 天一代,S3 已在计划中)的原因,张金涛归因于发布 S1 前就积累了一套能跑通全链路的 baseline:流式训练比离线生成训练阶段更多更复杂(先训双向的离线阶段,再渐进训成单向实时的),数据准备、训练、推理加速、云端部署每一环都有工程答案,“我有一百种方法可以把它做得更好,而且这些方法都非常明确”。
两本需求账:为什么实时是比离线大一个量级的市场
访谈最有信息量的部分,是张金涛给离线和实时两种范式算的需求账。
离线视频生成的需求,他的拆解是:创作者数量 × 每个创作者的生成需求,再从端到端视角除以播放量——一部作品被百万人观看,但生成动作只发生一次,所以"需求量会被严重地绑在创作层面、绑在播放量层面",本质是少数人的生产工具。实时视频生成的需求则是:每个人对实时多模态享受的需求 × 总人数。“我们每个人每天至少有一半时间在进行实时交互的多模态享受”——聊天、游戏、陪伴,除了看电影刷短视频的时间,全是实时交互场景。从这个上限出发,他得出"最终能完全超越语言模型"的判断。这个判断属于嘉宾观点,逻辑前提是把视频模型定位为满足娱乐与交流需求(非智能密集任务),而语言模型的天花板是解决复杂任务——两者需求上限谁大,行业并无定论,读者可以把这看作一家押注该赛道的负责人的立场陈述。
值得注意的反直觉推论是算力账。每人一个独立会话、每人一份推理服务,算力需求随用户数线性增长——这难道不是坏生意?张金涛的回答恰恰相反:每一次推理服务都是赚钱的,推理的会话越多说明公司越赚钱;而且实时生成目前可以在消费级显卡上满足硬指标,算力不构成瓶颈。这与离线大模型服务"堆 B200/B300 高端卡"的成本结构完全不同(他举例:B300 一台一个月几十万的租用价格,“没有人能承受得了”)。
“Diffusion 只是渲染器”:数据为什么比模型规模更重要
张金涛有一句在业内流传的话:“Diffusion 只是一个渲染器。“他解释说这在做 Diffusion 的人中已逐渐成为共识:语言模型对齐的是人类解决复杂任务的需求,需要智能和推理;而图片视频生成满足的是娱乐需求,学习目标本质上是"文本到图片/视频的一个单射(映射)"。既然是渲染器,决定渲染质量的就是两件事——要生成的图片视频本身足够符合人类偏好,以及输入的文本标注足够详细、与内容严格一致。
这个判断的直接推论是数据的极端重要性。他用了个好比喻:模型大小和架构好比人的智商,大家的智商差得不多,架构现在也相对收敛(基本是 Transformer 的小改动);但学知识时"看一百篇垃圾博客不如看一篇懂行的人写透的博客”——数据质量决定了学习效率。所以实时视频生成对数据的要求比基模更苛刻:不能用五秒五秒的 clip 拼凑,要标注得更细、量更大、且不能有错误。合成数据是方向但"没有那么直接”:很难凭空合成大量高质量视频,不过标注环节可以依赖视频理解模型和传统视觉算法(人脸检测、目标检测、音频分离)来辅助——这套数据处理 pipeline 被他视为每家做得出色的视频生成公司最重要的事情。
S2 画质的大幅提升也沿这条逻辑实现:backbone 模型负责生成低频与结构性信息,一个单步 diffusion step 的 refiner 模型补全分辨率与美学细节;配合 Self-Replay Forcing(SRF)训练法生成长自生成轨迹避免身份漂移,以及推理侧更极致的算子与调度优化。另一个技术细节是速度的性质:实时生成的速度是硬指标而非越快越好——0.09 秒生成 0.1 秒的 chunk 就达标,再快没有意义,因为播放本身需要 0.1 秒;在这个前提下,所有优化都应投向成本(比如进一步下沉到端侧低端显卡)。
Q 系列基模与 S 系列的关系也被讲得很清楚:有帮助但不直接。数据储备可以复用(从海量数据中筛出人物对话等实时交互需要的部分),推理 infra 可以复用,但基模 scale 到几百 B 的尺寸反而与实时性矛盾——实时视频的效果很大程度来自自身的后训练阶段,训练时长堪比基模一次 pretrain。两条技术线相对独立。
竞争与壁垒:H3 直播热事件的冷解读
访谈里最锋利的一段,是对 MiniMax H3 无限流直播事件的评价。今年 8 月底,有开发者把 H3 接入 Twitch 做了无固定节目单的"无限流直播",国内外都火了一把。经核验,这事的主角是推理平台 fal:fal 基于 H3 开放权重做后训练与推理优化得到 H3 Max,一段 5 秒 768P 音视频不到 3 秒生成;工程师 Rehan Sheikh 将其接入 Twitch 搭建持续生成的"跨维度电视",X 平台观看量近 530 万次(财联社 2026-09-01)。
张金涛的解读是泼冷水的:H3 加速的本质还是离线生成——让 5 秒视频生成得更快(快到播放完之前下一段已备好),但"你给下一个 prompt,它可能还是得十几秒甚至二十秒才能开始生成",不是一个能实时交互的模型。他顺带把 Diffusion 加速的技术祛魅了:量化、稀疏加速、步数蒸馏加系统 infra,“TurboDiffusion 那篇 paper 里几乎包含了所有 Diffusion 加速要做的东西”,2024 年 12 月发布的 TurboDiffusion 已经能在消费级显卡上 2 秒生成 5 秒视频——H3 Max 能做到的效果,用这套方法"完全能实现一模一样"。(需要说明:这是一家竞争对手负责人的技术判断;fal 侧的工程细节——新数据、可验证强化学习优化指令遵循——并不在他的叙述里。)
竞争格局上,他把生数的优势归为两点:朱军的前瞻判断(生数是最早对标 Sora 的国产视频大模型,实时方向布局也早)和高端人才的凝聚力。而被问到壁垒能守多久时,他相当坦率:“实时视频生成这个东西不能说很难”,有好的视频生成数据和训练基础的公司认真做,几个月就能做到不错的水平——壁垒短期内主要是时间差和认知差(“大家到底觉不觉得这是个重要的事情”),甚至"国外对这个赛道的价值认可反而比国内更前瞻"。他最大的两个担忧,一是能否在数据标注、数据认知上一直保持领先(获取最优数据源、最优视频理解标注模型、最优数据处理 pipeline);二是能否做好产品、维护用户数据闭环——离线生成没人真正"消费",实时生成用户在使用中就在消费,这决定了它必须懂用户。
商业模式:推理越多越赚钱,和一门 to C 驱动的 to B 生意
商业路径上,生数的定位是模型公司:对外提供 API,发布当天全球全量开放、无遮遮掩掩(对比部分竞品的"早期体验申请/限量预览"),已有企业接入 API 做产品。但张金涛同时直接管理着一款自研产品团队,方向是社交或情感陪伴——通过数字人(尤其实时参考生成能力)满足情感需求。这里有个诚实的问题:情感陪伴用户要的不只是逼真形象,还要"灵魂、同理心、逻辑思维"。他的回答是这部分更依赖产品能力而非最强模型——记忆、对用户理解的 agent 能力,“就像豆包显然不是 GPT-6 这种高智能模型,但大家就是喜欢用”。自己做产品不与 B 端客户抢生意,目的也不全是收入,而是建立模型竞争壁垒:隔着 API 的用户数据"不够直接",需要跟用户建立更直接的连接来形成数据闭环。
至于率先落地的场景,他判断直播和电商会先用起来,但更有潜力的是陪伴——“每个人都会独立地用到这个东西”。
最后是关于 scaling law 的判断:在视频模型上会继续有效,但不如语言模型有效。语言模型是智能密集型任务,越大越聪明、越聪明学得越快;视频生成本质上是"需要智商不高的简单任务",scale 数据比 scale 模型有效得多——这也是当前视频模型尺寸普遍远小于语言模型的原因。以他自己为例:博士论文做高效注意力计算(SageAttention 等算子),本可留在纯 infra 领域或独立创业(去年底在伯克利访学时曾拿着"实时视频生成 infra + 后训练"的 deck 与中美投资机构聊过一圈并拿到意向书),三月选择加入生数带队——“选择的方向比努力重要得多”。他给当前实时生成与传统生成模型的画质差距打分:大约百分之五六十,但一年内做到八九十。
收束:观察指标
这场访谈的价值不在预测(“超越语言模型"是立场而非事实),而在两套清晰的因果链:其一,范式差异决定市场结构——离线生成被"创作者数 × 需求 ÷ 播放量"束缚,实时交互是"人 × 实时会话”,后者天然是 to C 驱动、每人一份推理的生意,若单次推理毛利为正,规模即是利润,这与语言模型 API 的经济学结构完全不同;其二,任务性质决定 scaling 方向——渲染器型的任务里数据质量(标注的细度、准确度、与内容的一致性)比参数规模更有效,这解释了为何实时赛道的竞争焦点是数据 pipeline 而非军备竞赛。
一年后可以验证的观察指标都在这场对话里:S3 及后续迭代能否把画质从"五六成"推进到"八九成";更多视频大厂(字节、快手、MiniMax 乃至海外的 Sora/Veo 阵营)是否下场实时赛道——张金涛自己都说,认真做几个月就能追上来的生意,决定权在认知而非技术;以及生数那款情感陪伴产品能否跑通数据闭环。就像朱军的五级分类暗示的:生成视频只是世界模型的第一级,能与世界实时交互的第二级,才是这门生意真正的入口。