先说结论

9 月 22 日下午云栖大会国博一期 307 场馆的「视听生成:多模态创作与文化娱乐」分论坛,是阿里巴巴 ATH 事业群 Token Foundry 的一次全栈检阅:三个小时按「视觉的进化—听觉的觉醒—创作的闭环」三个篇章推进,从一张透明图(千问 Image 2.1)、一段三十秒视频(Wan 3.0,转写作 One 三零零)讲到一支完整歌曲(Happy Shrimp 1.1),再由太合音乐、小旭音乐、筷子科技、Magnific 和演员王珞丹把这些模型放进真实的产业工作流里过一遍。整场论坛的题眼藏在主持人卢嘉毅的开场承诺里:让每个人「看见」图像如何从一句提示词长成可发布的作品、「听见」音乐如何从一段参考长成一支歌——「创作正在被 AI 重新交还给每一个人」不是宣传语,而是一条可以被成本曲线验证的机制:实录一首歌要 5000 到 30000 元,AI 翻唱一个版本 8 块钱(余灏口径);传统艺人定编曲方向要一两周,现在几个 prompt 当天定案。但同一条曲线的另一端同样锋利:半年 3000 多个无授权翻唱版本打不下来、平台一天从几千首新歌涨到一百万首、导演不敢再投三年做 CG 因为「三个月后模型的迭代干了我三年的事情」(王珞丹转述同行)。本文基于 0—12771 秒、107 段完整转写复盘,全场议程(含圆桌)均落入录音,无跳段。

一、7B 挤进闭源效果区:「最小可用」与 Day Zero 的端侧叙事

千问 Image 技术负责人吴晨飞的发布给整场定了一个反直觉的基调:在别人卷参数上限的时候,他把「性价比」做成了第一卖点。千问 Image 是个年轻项目——2025 年 5 月立项,8 月发 1.0,随后 2509、2511、2512 一路开源;2026 年初因商业化原因转向闭源,发布了 2.0 和 3.0;而这次又把 2.1 开源出来(9 月 20 日,即论坛前两天;经外部核验,Qwen 官方博客与多家媒体均确认 7B、文本到图像与编辑统一、原生 RGBA 透明输出)。他主动回应了「都发 3.0 了为什么又发 2.1」的疑问:2.1 虽名为二点一,能力并不弱——在 Qwen-Image Bench 评测图上,与它效果接近的模型左右两侧「全都是闭源的」,它是唯一挤进闭源效果区域的开源模型,而参数量只有 7B,旁边是 32B、20B、80B、16B 的开源对手。

四大更新里最有产业意味的是原生 RGBA 透明图生成。吴晨飞的论证从 PS 图层讲起:多图层的意义是「修改一个图层绝不影响其他图层」,透明图是组件化创作的基础能力——你可以先生成素材、再自由拼组,且素材本身还能继续编辑。他特意区分了「生成透明图」与「抠图」:火焰特效边缘透明度更高、中心更低,这种逐像素的透明度是抠图抠不出来的。这与他后面讲的设计哲学一脉相承——生产力不该用「可用」而该用「最小可用」来定义:同样办成一件事,谁花的 cost 最少,谁才是生产力。文本编码器(转写作 Queen3VU,疑为 Qwen3-VL 8B)、DiT 渲染器都往小里做;attention 从 full 改成 causal,让 diffusion 多步去噪中的条件可以被 KV cache——条件只算一遍,多图推理效率显著提升。第三个设计选择是通用性:一个模型覆盖文生图、图生图、透明图与各种编辑,理由有二——学到的任务足够多,泛化就更强(透明图编辑的训练数据市面上极少,其效果很大程度上从 RGB 图像的编辑能力泛化而来);基模就该做 general,垂直精通交给社区的 SFT 和 LoRA。这一次他们还把改写模型一并开源:生图不可复现的根源是 prompt 工程,把生图模型与改写模型都交出去,社区才能直观分析「替换更强的改写模型会怎样」。吴晨飞称开源到当天中午官方渠道关注量已近 200 万(口述口径,待核)。

英特尔特邀讲者、端侧 AI 首席架构师罗宁接住了这个故事的下一段:生成式 AI 正从「有门槛的云端服务」变成「端侧随时触手可及的个人生产力工具」,这需要模型足够强、端侧硬件足够强、软件栈成熟三件事同时成立。英特尔在 Day Zero(发布首日)就完成了对千问 Image 2.1 的 OpenVINO 支持,把秒级高质量图像生成带到 PC 端;他强调 Day Zero 的价值不在宣发,而在于「模型发布首日开发者就有一个可以运行、验证、共同优化的起点」。硬件侧他给出具体数字:以 Arc Pro B70 为例(罗宁口述,未独立核验),32 个 Xe Core、32GB 显存、367 TOPS——大显存意味着更大的模型与中间张量(更高分辨率的生成与编辑)、更长的上下文(多轮修改与真正的 agent workflow)、更高并发。他展示的屋顶曲线(roofline)分析是全场少见的硬核细节:千问 Image 2.1 内部不同构建模块分别落在内存受限区与算力受限区,所以硬件必须算力、内存、带宽共同提升,让每个模块都拿到自己最需要的资源。这个细节值得留意:当模型开源到 7B 量级,「端侧能不能跑」就从营销问题变成了roofline 工程问题。

第一条机制链:开源小模型逼近闭源效果(7B 挤入闭源效果区)× Day Zero 端侧适配(OpenVINO+32GB 显存级硬件)→ 图像生成能力从按次付费的云服务变成桌面上的本地工具,创作成本与隐私顾虑同时塌缩 → 二阶影响:LoRA/后训练生态获得统一的高质量底座,「最小可用」取代「最高上限」成为生产力模型的评价维度;端侧显存与带宽成为新的购买决策指标 → 读者启发:选型时先问「同样办成这件事的总成本」,而不是「榜单第几」;模型能力仍在快速迭代,把工作流建立在开源小模型+可替换组件上,比绑定单一闭源服务更抗贬值。(评测图为吴晨飞口径;端侧指标为罗宁口述;开源事实经核验)

二、从提示词到导演思维:视频生成的「全能参考」与白模嘴替

多模态生成算法科学家张世伟把阿里视频生成的历程压缩成一条时间线:三年半前(2023 年 3 月)发布并开源第一个基于 Stable Diffusion 的视频生成模型,随后是可控视频生成 Video Composer、Wan 系列(转写作 A One 系列)与 Happy Horse 系列,一个月前刚发布全新一代 Wan 3.0(经外部核验:Wan 3.0 自 2026 年 8 月 6 日起公开测试,原生 30 秒、最高 1080p、带音频,与「一个月前」吻合)。技术叙述里三个要点值得展开:其一,预训练原生支持文本、图像、视频、音频的联合与组合输入及多模态输出,并在跨模态对齐数据与多条件联合预训练(文生、参考、复刻、编辑多任务一起训)上做 scaling;其二,后训练按画面/运动/音频三轴分别优化——画面走质量微调(高频细节、电影质感),运动走强化学习(降崩坏与穿模),音频走质量微调+强化(BGM、人声、音效的真实性,音画同步,参考视频里音色/ID/镜头一致性);其三,PE(Prompt Enhancement)把用户 query 拆成镜头设计、镜头运动、运动、对白、声音、画面六个维度做镜头间联合编排,并对齐专业视听语言训练——张世伟称之为「优质视频创作的平权」。他还首次支持 DOC、PPT、Excel、Markdown 直接生成视频,展示案例覆盖影视(平行世界题材英语片段)、短剧(六七张图参考一键生成 30 秒)、电商广告、多 ID 音乐 MV。

同团队的姜文韬把问题推向下一代:用户需求已从「五秒左右的简单片段」走向长时长复杂叙事——既要精准控制人物、场景、运镜,又要这些控制在多个镜头中持续成立,复杂控制与长程一致性是下一代视频模型的共同挑战。他的关键判断是「只把文本变详细远远不够」:文本控制的四个难点(空间关系精确表达、动作与状态的时间控制、多条件可控、长视频上下文关联)会随条件增多、时长加长而自我放大——想象五秒到六十秒,描述本身就会爆炸,模型既容易遗忘局部要求又难保前后一致。出路是把预训练从文本条件扩展到以多模态条件为主(图像、视频、音频、布局、轨迹、白模等结构化信号),再由 Agentic PE 围绕创作意图规划剧情与分镜、组织控制条件——判断每个镜头需要哪些条件、哪些信息跨镜头保持、哪些随剧情更新。下一代模型的四个方向被他概括为:更长、可控、完整(理解剧情情绪与叙事)、更智能(逐步具备导演思维、一键成片);更远处是理解与生成的统一——目前是模块级协同,团队正在探索共享表征与联合训练,「不远的未来」可能实现。现场播放了阿里 ATH 多模态生成团队提供技术支持的科幻电影《炎夏未来》概念预演片:60 年后的未来之城,一位垂暮老人与四个年轻人探寻生命意义,120 分钟院线电影预计 2027 年上映(姜文韬口述,未找到公开信源,存疑保留)。

Magnific 首席市场拓展官 Jose Florido 的英文分享恰好给「参考」这个关键词做了全球注脚。Magnific 是总部在西班牙和美国的创作者平台(经核验:官网与官方账号确认每天有超 8000 万 creatives 访问、近期突破 100 万订阅者),正在扩展进入中国,平台上已接入阿里的 Happy Horse 与 Wan 最新模型。他演示的对比很能说明代际差异:上一代模型只能给首帧和尾帧作参考,模型本质上在两张图之间插值;新一代模型可以在每一秒的生成中持续接收参考——用角色设定图(character sheet)保持 23 号球衣这类细节,或者把一段 15 秒的视频作为参考,prompt 只写「continue this video」,模型就带着完整上下文续拍。第二个能力是 multi-shot prompting:一个 prompt 里描述士兵点烟、烟的特写、烟雾的特写三个机位,模型自动拆分成多镜头;不描述运镜时,模型甚至会自己切一个眼神特写并配上背景音乐。他用 Steve Jobs 的话收尾:再多的技术也无法把一个坏故事变成好故事。

第二条机制链:控制接口从文本走向多模态条件(全能参考+白模+轨迹)× 生成时长从 5 秒走向叙事级 → 「会写 prompt」贬值、「会组织参考素材与分镜」升值,导演能力被编码进模型与 Agentic PE → 二阶影响:影视工业的前置环节(预演、分镜、选景)被压缩进同一次生成,爱奇艺式「实拍混制」成为长剧默认工艺;图像与视频的边界开始模糊(大雄测的 GPT-6 Astra 用单图循环推帧即可旋转物体) → 读者启发:把预算从 prompt 工程转向「可控素材库」——角色三视图、参考视频、白模资产才是新一代创作的杠杆;评判视频模型别只看单段画质,看多镜头一致性与参考服从度。(能力描述为讲者演示;Wan 3.0 规格经核验;Astra 为圆桌转写原文,存疑)

三、音乐的下半场:泛化、8 元翻唱与 3000 个版本的维权困局

Happy Shrimp 技术负责人林轩的框架最清晰。上半场已经结束:生成范式基本确定、审美门槛跨过——AI 生成的完整歌曲「可听可用」,社交平台上很多歌其实就是模型生成的(林轩判断)。下半场做三件事:输入走向多模态(音频、图像、视频参考,不再只是 text-to-music)、对象走向泛语音(语音、音效、环境声)、过程走向可控编辑与多轮协作——最终音乐与声音统一成一个音频模型。他把多模态条件分工讲得很细:文本承担意图与「取用规则」(保留 A 的旋律、用 B 的编曲风格、用 C 的音色重新演绎);音频参考给旋律音色细节;图像给场景风格氛围;视频给事件动作时序。编辑的验收标准是四条:修改生效、保留有效、范围准确、衔接自然——改副歌鼓组要有冲击力,旋律人声和未修改区间必须原样。落到产品上,Happy Shrimp 1.1 支持百余种曲风、十余种主流语言,APP 已上线,核心是「一句想法成为一首歌」:林轩举的例子是「雨夜返乡,克制的喜悦」这类抽象表达如何被映射成曲风、配器、唱法、律动与段落结构。他坦承过去 AI 音乐被诟病「编曲太满、副歌必飙高音」,1.1 特意在克制、留白与情绪推进上做了改进;实现路径是把音乐性拆成旋律、律动、声部清晰度、空间定位、音色自然度等精细优化目标,用强化学习与人类审美对齐。他给下一代模型留的关键词是泛化:图像视频模型能在没专门训练过的任务上靠表征迁移生成没见过的东西,音乐模型还困在 polished music 里——「我们都听过猫叫,但没人听过猫唱歌;一个好的音乐模型应该能参考猫叫声生成一首自然的猫唱歌」。终点是 agentic loop:不懂乐理的人像小白写代码一样做音乐,每个版本可确认、可保留、可定位下一轮修改。

太合音乐集团总裁余灏的演讲是全场产业含金量最高的一段,因为他把账摊开了。太合是全产业链公司:太合麦田、海蝶(1986 年成立的新加坡厂牌,今年整四十年)等厂牌,签约加发行代理艺人超四千位,秀动票务、商场公播音乐都是其业务——「在 AI 冲击下扛跌能力相对比较强」。他用音乐工业史给自己壮胆也给自己定位:这是至少第四次行业焦虑——60 年代合成器(催生了合成器乐手这个新工种)、80 年代 MIDI 协议(录音棚工程师抗议,如今是编曲软件的地基)、90 年代 DAW(被指降低品质,结果录制成本降了九成,催生卧室音乐人),现在是 AI。太合内部的实测案例:过去艺人拿着动机来讨论编曲方向,回去录小样再回来决策,周期好几天到一两周;现在几个 prompt 当天定方向,AI 的反馈甚至激发更多灵感——他估算 AI 又把成本降了约 90%。但紧接着是两盆冷水。第一盆是训练数据合规:全球司法实践正在快速变化——欧洲已有初步判例(当地法院认为训练不属于合理使用),北美的诉讼围绕「素材获取是否合规」与「训练出的模型是否合理使用」两点推进中,中国也有进展;太合的态度是希望司法尽快给出清晰规则,「合理的使用的合理的补偿的机制」,对积累三四十年优质内容的版权公司才是公平的游戏规则。第二盆冷水更具体:无授权 AI 翻唱。某位艺人的一首歌,半年出现三千多个翻唱版本,「打也打不下来」——有的重新编曲,有的改个名甚至变速就上架,音乐人的价值被替代性蚕食。成本结构说明了一切:实录一首歌 5000 到 30000 元,AI 做一个版本 8 块钱,「八块钱可能还算多的」。他的呼吁是治理侧的:声音指纹技术识别并不难,难的是规则——应把「允许/不允许翻唱」的选择权还给版权方,而且他相信大多数版权方愿意参与这个新场景,因为它本身就是新的用户价值。往前看,AI 音乐的消费「不可阻挡」(翻唱之外还有冥想音乐这类个性化需求),于是有了那个悬而未决的 DSP 之问:老播放平台存在「左右互搏」——一边是版权音乐,一边是权属未定的 AI 音乐,版税与流量怎么分?要么融入现有平台,要么「重开一局」出现一个全 AI 音乐、商业模式完全不同的新平台。

第三条机制链:AI 把翻唱成本从 5000—30000 元压到 8 元/版本 × 司法与平台治理滞后 → 无授权翻唱供给爆炸(单艺人单曲半年 3000+ 版本),长尾侵权打不过来,版权方价值被系统性蚕食 → 二阶影响:训练数据合规与补偿机制从法律议题变成产业能否持续的前提;播放平台陷入版权/AI 内容左右互搏,可能催生全新 DSP 与按版本授权的新结算层;创作端则面对「作品通货膨胀」(卢小旭:平台日增原创歌曲从几千首涨到一百万首) → 读者启发:内容公司的曲库价值取决于确权与结算基础设施的建设速度,而非存量本身;创作者的竞争单位从「作品质量」上移到「作品+传播+人设」的组合;关注欧洲判例与国内立法进展,它是 AI 音乐商业模式的定价锚。(成本数字、版本数、判例描述均为余灏口述;「一天一百万首」为卢小旭圆桌口径)

四、六个人的偶像工厂:当 AI 歌手开始上央视

小旭音乐创始人卢小旭的演讲是「创作者用脚投票」的最佳样本。这家成立了二十年的游戏配乐公司(服务上千部游戏,「逢年过节大家就会想到我们」的那首歌就出自他们)从 2024 年起做「小旭 AI Studio」视频号,今年其 AI 音乐案例还登上了罗振宇时间的朋友跨年演讲。真正的重头戏是 AI 歌手矩阵:四五个月,全网累计播放破两亿,多个抖音账号几十万粉丝,而整个团队只有六个人。每个歌手都是完整的人设工程:许白是「曾在北京做地下歌手、遭遇变故回泉州开咖啡馆」的心碎系闽南语歌手(全网播放超四千万,说话带刻意训练的闽南普通话);银是「来自大凉山、生活在上海」的彝族歌手,民族又时尚;花妖乱弹是怪诞民俗乐队(「AI 版二手玫瑰」),三个月抖音涨粉二十万,是矩阵里粉丝量最高的账号,海外平台也有粉丝;林海生唱中年沧桑,达尼卓拉是藏族歌手,咖喱街是印度风格反差喜感组合——那条视频两百万播放却有三十五万转发,「视觉创意对传播极其重要」。他总结做 AI 歌手要三种能力:AI 音乐制作(人声音色辨识度第一)、AI 视觉呈现(视觉锚点:金牙、唇钉,造型从几百上千张图里提炼)、歌手策划(像短剧编剧一样写人设故事)。技术选型同样务实:80% 案例用 Wan 3.0 和 Wan 2.7 制作,「One 的对口型能力是我们用过所有模型里最好的」——对口型正是 AI 歌手的命门;非对口型视频用 Happy Horse;算力成本 90% 消耗在视频上。运营侧他们自建了 Codex 系统:每天抓取所有账号的两三千条新增评论,分类(优质/潜在舆情/对创作有帮助)打包发到飞书群。他给的数据很冷静:失败案例是成功案例的四倍,做四个账号能成一个;AI 歌手分 A/B/C/D 级对应月更十条到二十五条的更新强度,「跟经营真人歌手没有区别」。最动人的观察来自一条合拍视频:三万赞、两千条评论,全是真人在讲述自己的青春爱情故事——「明明大家都知道是两个假人在唱,为什么那么多真人在诉说他们的故事?」他的结论:用户可能根本不在意是不是 AI 歌手,只在意内容是否真的打动人;而真人歌手未来最大的竞争对手「真的是来自于 AI 歌手」——视觉听觉上千姿百态、迭代极快。

第四条机制链:模型能力组合(对口型视频+音色克隆+视觉锚点)× 自媒体分发与数据运营自动化(Codex 评论分类)→ 六人团队获得过去五十人经纪公司的产能,AI 歌手成为可批量孵化、可分级运营的资产 → 二阶影响:偶像工业的重资产环节(艺训、制作、宣发)被压缩成「策划+审美+运营」的轻技能组合;传统音乐人转型困难(二十年乐理在 GAW——生成式音频工作站——面前变成路径依赖),年轻人获得技术平权窗口 → 读者启发:内容创业的杠杆率取决于你把多少环节交给模型组合与自动化,但成功率仍是概率游戏(4:1),策划与人设这类「编剧能力」是新的稀缺项;变现仍在早期,别按流量估值。(播放量、粉丝数、成本结构均为卢小旭自述)

五、token 化跃迁:软件生意变成环境生意

筷子科技创始人陈万锋(转写作陈万峰/快手,已按官方议程校正)的视角最商业化。他的判断是全球 AI 赛道只剩两个:AI coding 和 AI 视频(多模态泛指),而筷子把两者拧在了一起——专注「商业创作」而非娱乐创作:娱乐内容追求情绪共鸣,商业视频要打动还要讲清产品与功效。数据面(自述口径):已服务近一万五千家企业(从 SMB 到超大型),商业视频生成与分发超 1.25 亿条、覆盖四五十个国家语言,后台积累十几万个人脸授信——每个 KOC、素人或明星都有完整授权链合同,「在商业领域人脸非常重要」。他们还与 ATH 团队建立数据闭环,把业务里的 corner case 和 bad case 回流给模型训练。时间线上这家公司穿越了周期:2022 年 all in 视频介质;diffusion 时代「关注但没有那么多应用」;去年十月某国际模型确立 DIT 路线后首家试点;今年三四月到二季度「视频模型赛道中国碾压式领先、好几个 SOTA 出来」时正式切入,推出「立正引擎」(转写原文,疑为产品名,存疑)——一个提供 token 与算力 routing 的平台,做合规生成、提示词优化与模型选择(当下性价比与能力的最优解)。增长数字是全场最陡的曲线:Q1 至今 token 调用量环比涨了约 150 倍,9 月环比还有 70—80% 增长(自述)。商业复刻与娱乐复刻的区分讲得很透:娱乐复刻是表现形式,商业复刻要处理「我的产品和对方产品不一样」的特征差异,复刻人脸、场景、换衣服又各是不同技术类型。最下沉的客户是农产品商家——他的原话值得记录:AI 最终的普惠,应该是越难得到这个能力的商家越有机会被赋能,而且市场空间更大。

更有启发性的是他对软件生意模式的判断:从卖 SaaS license 跃迁到「环境级服务」——不只交付一个 agent,而是把几年沉淀的 context、skills、tools(渲染、字幕等)、音乐版权资源整体开放给客户的 agent 调用,「以前是人使用工具,现在是 AI 使用工具」(A to A)。配套的商业模式创新是「AI 钱包」:每个企业一个计量账户,agent 调用环境内所有能力(甚至包括未来调用小旭音乐的音乐资产)按 KB——他们自创的 AI 计量单位——结算。他给的注脚是 Stripe 收购 OpenRouter(经核验属实:Stripe 2026 年 8 月官宣收购 AI 模型网关 OpenRouter,意在嵌入 AI 时代的资金流中间层)——大公司同样在为「AI 按调用计费」铺设金融基础设施。架构上他们规划四层:为 Agent 调用的 FDE 层、Harness 原子能力层、与云厂商共创的模型路由层、算力基础层,并准备在上海成立 FDE Lab 与阿里云合作交付。他把自己已验证成功的标准 SaaS 产品线形容为「我们自己把自己杀掉了」。

LoRA 创作者大熊的分享是从另一个极端看同一件事:个人与小团队怎么活。去年模型能力不足时,他用 LoRA 解决闭源模型做不到的问题(多角度控制、光线迁移,当时即梦、豆包等顶尖闭源模型也做不到),下载量极高;后来用高斯泼溅做可视化可控的 LoRA,解决文本控制「一锤子买卖」的缺陷;CLIP 一致性 LoRA 成了社区标配。千问 Image 2.1 的 PNG 分层透明输出让他这个设计师很兴奋——想接着训练特效字与字体迁移,「争取把 GPT 给干下去」。工具链的演化同样是从痛点出发:团队多账号(GPT、Gemini、即梦)共享难、掉号无替补,他搓了一个开源的无限画布,把各家 API 与 CLI 聚合在一个局域网可访问的界面里;公司级需求(权限、部门、自动化)再往上长出「大雄 OS」——底层统一 Agent 与 API 协议,把每个功能做成 APP(画布只是其中之一),接入 Skill 与 MCP,自动化读销售数据、生成日报周报、钉钉分发。他的理由朴素而扎心:每个开发者都在重复造 Agent 和 API 协议的轮子;而「很多人觉得会用豆包就是拥抱了 AI 的公司,太现实了」。

第五条机制链:模型组合的边际成本趋零(150 倍 token 增长、8 元翻唱、六人两亿播放)× 企业工作流的可编码化(harness/skills/MCP)→ 软件的计价单位从「席位/license」迁移到「按 token/KB 的环境调用」,Stripe-OpenRouter 与筷子 AI 钱包在两端做同一件事 → 二阶影响:软件公司的护城河从功能清单转向沉淀的环境资产(合规授权链、corner case 数据、上下文);个人开发者的杠杆来自把重复轮子平台化 → 读者启发:判断一个 AI 应用的天花板,看它沉淀了什么别人调不走的资产(授权、数据、上下文),而不是界面上接了几个模型;给自己的团队定一个「AI 计量单位」,是控制成本幻觉的第一步。(150 倍、1.25 亿条、15000 家企业为陈万锋自述;Stripe 收购经核验)

六、最后一公里圆桌:单眼皮、金鸡创投与「我为什么要做演员」

圆桌「从提示词到作品」由 Happy Horse 技术负责人、本场出品人葛铁铮主持(转写作葛铁征/铁铮;他透露 Happy Horse 于今年四月发布,自己已转入阿里新一代视频生成模型项目),嘉宾是林轩、演员王珞丹、卢小旭、爱奇艺 AI 制作高级总监朱俊敏和大熊。这一段几乎是整场论坛的人味所在。

王珞丹的创作者视角贡献了最多的细节与金句。她年初开始学 AIGC,「根本不知道为什么要学」,第一支短片最难的不是技术而是**「我不知道该怎么跟它沟通表演」——有明确想要的方向反而难以达到,给宽泛概念却总有惊喜;为了一眼单眼皮变双眼皮跟老师争执半天(老师看不出来,她看得出来),抽卡抽到凌晨四点绝望、六点抽到想要的镜头「像过山车一样」。她还带来了一线行业的风向标:在金鸡电影节创投单元评审的六十个本子里,年轻创作者已经不只有剧本,还带来了 AIGC 的 trailer 预告——以往实拍预告对新人太贵,现在评委能直观看出这是文艺片、商业片还是类型片,以及导演的能力。她的总结:「技术平权到最后,我们聊的还是你到底想要做一个什么东西,你的初心是什么。」她也如实转述了行业的焦虑:想做高概念动画的朋友不敢投——「费两三年用 CG 做出来,可能三个月之后模型的迭代就干了我三年的事情,投入产出比非常不现实」,这类片子暂时搁置;编剧朋友用 AI 做策划和大数据采集,但「创作者的初心最好还是表达个人经历和没被数据采集到的东西」;同行们「都在偷偷用、偷偷学、互相分享」。最重的一句是她的自我诘问:「我为什么要做演员?」——在有限的生命里体验不同的生命,这个经历本身不可替代。葛铁铮接得很好:「我为什么要做演员」是 AI 时代的万能句式**——歌手、程序员都可以拿去问自己。她另一句「差生文具多」的自嘲(吉他弹得不好但吉他多)被她翻成了方法论:最后一公里就是开始的那一公里——为什么上路、要表达什么,比任何工具链都重要。

朱俊敏给的是平台工艺手册:爱奇艺按品类分层——长剧以实拍为主,转向「实拍混制」:剧本阶段导演就用 AI 做重点镜头预演,据此判断哪些镜头实拍、哪些用 AI、哪些绿幕加后效,早期就能定出 AI 与 CG 的占比;CG 后期阶段「能用 AI 的都尽量用 AI」,CG 只做最后的小细节修复;中剧(新品类)推全 AI——他举了李吉导演的《失焦而宠》(转写原文,存疑):两人感情戏的微表情与情绪最难控,最终用 AI 为主、3D 控一致性、AI 棚里真人表演迁移控微表情,「以假乱真,基本看不出是全 AI」。科幻品类的账本和张世伟的演示互相印证:实拍科幻受众垂类小、CG 又贵又慢、商业上难成立,而 AI 恰好擅长 CG 丰富的场景——垂类内容可以低成本做出来,形成商业正循环。制作周期从两年以上压缩到半年一部剧。战略层的动作是爱奇艺年初提出的「去中心化」转型:从重度自制转向让广大创作者借 AI 做出自己的内容与 IP 上传平台,爱奇艺以分账和流量扶持。圆桌最后的畅想也出自他:制作端与体验端将融合,观众即创作者——爱奇艺把院线电影 IP「钟馗」的角色授权到自家纳豆平台上做二创,参与者全是普通观众,有程序员用钟馗形象讲自己加班的故事,让他非常吃惊。

交互方式的演进被葛铁铮和朱俊敏共同梳理成一条清晰的线:早期文生图/文生视频的朴素假设是「自然语言简单交付即可」,实践证明文字很难描述完整画面——几千字的 prompt 也难符内心想象,于是创作者只能抽卡,「这对创作者是一种折磨」;模型侧的回应是图生首尾帧、再到全能参考(A 图的头像+B 图的 logo+C 图的商品一股脑送进去),本质是把控制权交还给创作者,而模型侧对应的是各种素材的统一建模——「模型侧和使用侧在双向奔赴」。大雄的注脚是关于学习的:从 ComfyUI 搓上百个工作流的时代走过来,他对「等模型完善了再学」的反对很具体——「你不能说吃到第五个馒头饱了,前面四个就浪费了」,一步步用过来的模型理解是别人比不了的。林轩与卢小旭则各自补了行业侧的观察:林轩要音乐模型追求泛化而非专任务(猫唱歌的例子),卢小旭强调 AI 时代每个人都要成为「六边形战士」式的超级个体——但话锋一转又是那句:「AI 时代每个人怎么越来越忙了?因为你的期待值更高了,以前不敢做的事现在都愿意去做了。」王珞丹说得更直白:技术**「赋了能,但没有减负」**——本来只要把演戏做好,现在要作词作曲生成影像;「机器可以二十四小时待命,但人要好好活着,好好感受生命,好好吃饭」。

结语:当供给无限,稀缺的是「为什么」

把三个篇章叠起来看,这场论坛其实讲了一个完整的经济学故事。供给侧:7B 开源模型挤进闭源效果区、Wan 3.0 把三十秒叙事变成一次生成、Happy Shrimp 让一句抽象情绪变成一支歌——创作的边际成本以数量级为单位塌缩(太合的两次 90%、筷子的 8 块钱版本、六人团队两亿播放都是同一曲线上的点)。流通侧:软件计价单位从席位变成 token 与 KB,Stripe 买 OpenRouter、筷子做 AI 钱包,金融与路由基础设施正在为「AI 调用 AI」的世界铺路。需求侧:作品通货膨胀已经发生——一天一百万首新歌的世界里,「被人听见」取代「做出来」成为新的瓶颈。三条曲线交汇处站着的,恰恰是论坛里最不技术的那些发言:余灏要的是规则与补偿(确权基础设施决定曲库价值的兑现),卢小旭要的是策划与人设(编剧能力成为偶像工业的新稀缺),王珞丹要的是初心与表达(「我为什么要做演员」的万能句式),Jose 引用乔布斯说的也是同一件事——技术永远无法把坏故事变成好故事。观察指标现成:千问 Image 3.1 的发布节奏、欧洲与北美 AI 训练判例的走向、爱奇艺「去中心化」分账的创作者收益分布、AI 钱包式计量结算能否跑通。反方风险也要记着:台上十位讲者六位与阿里有直接利害关系,各家播放量、企业数、token 增长均为自述口径;而「端侧 Day Zero」的前提是 32GB 级显存的硬件普及,这条路能走多快取决于供应链而非模型团队。

最后一个画面留给王珞丹。她说自己学 AIGC 时连「AIGC 和 AICG 有什么区别」都不知道,抽卡抽到天亮;但论坛结束前她说,无论媒介怎么变——竖屏短剧、电影还是 AI——她最终回归的仍是「一个创作者的表达」。在一个全场都在谈 token 计价与批量供给的下午,这句朴素得几乎不合时宜的话,恰好是整场论坛最结实的注脚:当执行的成本趋近于零,决定做什么、为什么做、为谁做,成了人剩下的、也是最贵的工作。


转写与核验说明:本文基于 107 段、0—12771 秒(约 213 分钟)本地转写的完整覆盖(两遍提取,无跳段),讲者与议程时间对位校正;本场录音覆盖全部议程(含圆桌与收尾致辞),无缺失环节。ASR 人名已按官方议程校正:张士伟/张世伟→张世伟(官方议程作张士伟,现场口播作张世伟,保留口播)、姜文涛→姜文韬、于浩→余灏(太合音乐集团总裁)、卢晓旭→卢小旭、陈万峰→陈万锋、葛铁征→葛铁铮、林薛→林轩、泰和音乐→太合音乐、小西音乐→小旭音乐、小军乐→小旭音乐、「快手」(多处)→筷子科技、「康复 UI/Convo UI」→ComfyUI、极梦→即梦、「A One 系列/万三/One 三零零」→Wan 系列/Wan 3.0(官方英文名 Wan,讲者口播与英文嘉宾发言作 One/万)。ASR 存疑未校正项:「轻微image bench」→按上下文校正为 Qwen-Image Bench;「Queen3VU 8B」疑为 Qwen3-VL 8B(文本编码器);「立正引擎」为筷子科技产品名转写原文(存疑);「Battle Image/Chris Island/Next Island」疑为英特尔 Xe GPU 代号 Battlemage 与 Celestial 等(罗宁口述,保留并标疑);Intel Arc Pro B70(32 Xe Core/32GB/367 TOPS)为罗宁口述,未独立核验;《炎夏未来》(姜文韬称 2027 年上映)、《失焦而宠》(朱俊敏称李吉导演项目)、爱奇艺「钟馗」IP 二创活动未找到外部信源,按讲者口述处理;「GPT 六的 Astra」(圆桌讨论对象,转写原文)存疑保留;大熊所称「香蕉」(与即梦、豆包并列的模型)无法确认对应实体,保留原文;太合歌曲「八方来财」为转写原文。经外部核验的关键主张:Qwen-Image-2.1 于 2026-09-20 开源、7B、统一生图与编辑、原生 RGBA 透明输出——Qwen 官方博客(qwen.ai/blog?id=qwen-image-2.1)与 marktechpost(2026-09-21),已证实;Wan 3.0 自 2026-08-06 公开测试、原生 30 秒/1080p/带音频(与张世伟「一个月前发布」吻合)——morphic.com 等模型库页,已证实;Magnific 超 100 万订阅者、日访问 creatives 超 8000 万——Magnific 官网与官方 X 账号,已证实;Stripe 收购 OpenRouter——Stripe 官方新闻室与 TechCrunch(2026-08-19),已证实。未核验与自述项:千问 2.1 开源关注量近 200 万(吴晨飞);太合成本降幅两次 90%、翻唱 8 元/版本、单曲半年 3000+ 翻唱版本、实录成本 5000—30000 元、艺人 4000+、海蝶 40 年(余灏);小旭矩阵全网播放 2 亿、四五个月、失败案例 4 倍、团队 6 人、算力成本 90% 在视频、花妖乱弹三个月涨粉 20 万、许白播放超 4000 万(卢小旭);筷子服务 15000 家企业、1.25 亿条视频、十几万人脸授信、token 环比涨 150 倍、9 月再涨 70—80%(陈万锋);爱奇艺制作周期半年一部、长剧实拍混制、中剧全 AI(朱俊敏);「平台日增原创歌曲从几千首到一百万首」(卢小旭圆桌)。讲者身份以官方议程为准;圆桌主持人自述「葛铁真/铁铮」统一作葛铁铮。