**先说结论:**这场论坛真正的主角不是某个模型,而是一次「解耦」——语音的交互入口和语音的生产力开始分家。阿里在 2026 云栖大会发布 Qwen-Audio-3.1(千问语音 3.1,包含 ASR 语音识别、TTS 语音合成、Realtime 实时交互三个系列),并宣布全线 API 降价,官方通稿口径最高降幅 95%,产品负责人王羽在场上给出的说法是「价格只是之前的可能十到二十分之一」。当调用语音的成本跌到可以忽略,语音模型的计价单位就从「一分钟转写多少钱」滑向「一次任务多少钱」,这是本场所有分享共同指向的变化。但便宜本身不构成壁垒:论坛同时暴露了两个仍未解决的问题——语音幻觉在不可回看的介质里代价被放大,以及「听得清」和「办得成」之间还隔着整套工程。以下按「发布内容—三项技术—四家落地—边界与观察」展开,全部数字除注明外部报道外均为论坛称或嘉宾称。
一、降价九成五之后,计价单位从「分钟」变成「任务」
先把发布会本身说清楚。Qwen Audio 负责人李先刚的开场主旨只有十分钟,结构却很完整:ASR 模型负责「从转写到理解」,TTS 模型负责「从文本到全声景生成」,Realtime 模型负责全双工对话交互——双工指双方可以同时说话、随时打断,而非传统对讲机式的轮流发言。三个系列之外,还开源了一套语音智能体框架(Voice Agent Harness,转写原为「语音加 Harness」,实指语音 + Agent 的工程脚手架)。最后一页放价格:相比 3.0,各方面价格「都下调了非常的多」。外部报道可以交叉验证:新浪财经与上海证券报在会场均确认 Qwen-Audio 全线语音模型降价、最高降幅 95%,API 已上架千问 AI 平台。
价格为什么值得放在第一节?因为王羽(产品负责人)的分享本质上是在回答「降价之后生意怎么做」。他提出语音的三个价值方向——入口、内容、服务——并给出了一条清晰的推演:过去企业采购的是模型能力,按分钟、按 API 计价;当 AI 能追问、确认、查订单、改系统、做预约甚至执行交易,「企业更关心的可能是我这一次预约用 AI 多少钱完成的,我这一个销售线索多少钱……价值的单位也会从模型的能力走向真正的任务结果」。为说明这个市场有多大,他现场粗算了一笔账:美国客服市场大概有几百万坐席需求,每人每年约两千小时工时、每小时成本几十美元,「对应就是一个千亿美元的规模尺」。这是一笔量级估计,读者可以把同一算式套回自己企业:多少人在提供这类服务、一年占多少工时、人工每小时成本多少、其中哪些任务可以闭环。
入口这条线的论证更值得复述。王羽认为,上一代语音助手(他举 Alexa 升级到 Alexa+ 后交互指标明显变化为例,此为嘉宾称)已经完成了用户教育,「过去真正没有跨过的障碍是用户说完了以后,机器到底能帮他做多少的事情」。而所有基于 GUI(图形界面)的软件都有一条隐性要求:用户必须先理解产品经理设计的系统结构——入口在哪、菜单怎么分、页面怎么跳——再把目标翻译成一串操作记忆下来。语音入口改变的不是「键盘换嘴」的效率,而是交付方式:用户说一句「帮我把信用卡的额度调高一些」,语音负责理解意图并分发,智能体负责执行,GUI 退回来负责最终确认。他据此给出迁移先后的判断标准:功能复杂、入口分散、智能能力能把任务闭环的场景——银行、航空、通信、政务、个人助理——会最先发生入口变化,因为「用户其实很清楚自己今天要干什么,但是他不知道这个功能藏在哪里」。
这里藏着第一条「机制 → 二阶影响 → 读者启发」链:降价 95% 使语音调用从预算项变成默认项 → 二阶影响是企业验证方式改变,王羽反复强调不必先接 API 再评估,去千问语音官方 Studio(论坛演示中产品名转写不清,大致为 CosyVoice Studio / Coze Voice)用真实业务跑一遍即可 → 对读者的启发是,判断自己的业务是否该升级,用他给出的两条硬标准:这项服务是否「通过语言和用户沟通就能完成」,以及所需工具是否已经可以闭环、技能化;两条同时成立,就是适合语音 AI 升级的场景。
他还补了一个观察角度:这一轮没有出现「voice boom」式的新品类,银行 APP 还是那个银行 APP,变的是背后的智能——「可能在这轮我们最先没有改变 APP 的份额,但是它改变了交互的份额」。而录音类硬件(他提到钉钉的 AI 录音硬件等)商业价值突破的原因,不在录音功能本身,而在于「让物理世界过去没有被记录下来的线下发生的电话、面对面的一次讨论,真正记录下来,走进了数字世界,可以被理解、沉淀,进入后续的工作流」。
二、ASR:字错率已经不是主要矛盾,「直接能用」才是
ASR 场是全场信息密度最高的一段,算法科学家高志付的切入点是一个真实矛盾:接入业务测试时字错率(WER,词错误率,衡量转写质量的传统指标)很低,上线后客户却总反馈「不够好用」——因为用户在意的恰恰是错的那几个关键词:客户的名字、产品型号、约定的时间地点。他的整场分享都在回答「怎么把关键信息可靠、完整地带进业务」。
基础能力先铺底:论坛称 3.1 在 Artificial Analysis(一家第三方 AI 评测机构)的词错误率为 1.7%,「在展示的这些模型里面效果是最好的」,支持三十多个语种;方言用「语义句准」衡量——很多方言普通人根本听不懂,逐字对错没有意义,要看语义是否转对——在十六个方言上做了系统测试,宁波话、杭州话、温州话这些难点做到「基本上百分之七十以上的句准」。还有个容易被忽视的细节:同一段粤语,有用户希望输出粤文,听不懂粤语的用户希望出普通话文字,3.1 可以通过配置二选一。写作者按:Artificial Analysis 榜单公开信息显示阿里的 Fun-Realtime-ASR 确以 1.7% 的 AA-WER 居首(后被阶跃星辰 StepAudio 3 追平),数字可信,但榜单位次随时间变动,「第一」是时点性陈述。
真正有信息量的是两个工程判断。第一个关于「快与准的取舍」:想快就要少等后面的内容,想准就要多等后面的内容,这是流式转写内在的矛盾。3.1 的做法是在服务里直接集成双引擎——用户说话时实时出字,说完后给定稿——论坛给的数据是首字延迟从 300 毫秒降到 100 毫秒,定稿延迟从 400 毫秒降到 300 毫秒,四项延迟指标「显著好于友商」(厂商自评)。第二个关于「润色」:纯转写只负责听写,但输入法场景的文字是给别人看的。客户说「帮我预定后天中午去杭州,而不是上海的航班」——他自己口误后纠正了,转写忠实记录口误,语义上他却要去上海。3.1 为此增加原生润色,直接输出修正后的文字;为衡量润色效果,团队放弃了失效的字准句准,另立两个指标——可读性(是否简洁、意图是否清楚)和忠实度(改写后是否还是原意)。论坛称,原生润色与「外接一个文本模型做润色」相比可读性接近、忠实度更高(少了中转环节的幻觉),且省掉一次额外调用——「这不光是一个成本问题,它更多是一个耗时问题」,对输入法场景,多等一会儿就掉体验。
会议场景的对比更硬核。业内主流是级联方案:先用 VAD(语音活动检测)切出有人声的段,再用说话人分离模型标身份,最后逐段转写;3.1 走端到端,一个模型把「谁、何时、说了什么」联合输出。高志付用一段实测demo说明差异(他特意说明都是实测、非 AI 合成):两人交替说话时级联方案文字基本对,但抢话瞬间会丢字——demo 里「两点四十」被丢成「两点」,关键信息直接变化;人数增加到五人、十人,「级联方案基本上是已经搞不定了」。而长会议里级联方案更大的问题是身份漂移——同一人「一会是张三,一会是李四」——端到端能保持全程身份一致。论坛称在三个 Benchmark 的 DER(说话人分离错误率)和 cpWER(带排列约束的词错率)上「遥遥领先」,对比对象包括谷歌和 Meta 最新发布的模型(转写未能确认具体型号)。
再往上一层是 ASR-Next:理解人话之外的声音——机器何时开始运转、音乐用什么乐器、某事件在录音里出现几次,并支持开放式的音频问答,用途示例是音视频素材库的检索。最后他给了一个实用的选型表:大批量录音用 File Transcription,边说边上屏用 Streaming,输入法润色用 Message,分角色用 Flash,理解非语音信息用 Next。把这场串起来看,ASR 的演进逻辑是「信息理解维度的不断扩展」:先听懂文字,再把身份和时间关联起来,再到理解人的声音与环境的关系——字错率只是入场券,「文字能直接用」才是产品及格线。
三、TTS:从把字念对,到一次生成整个声音场景
TTS 场的算法科学家赵瀚讲了一个「架构合久必分、分久必合」的故事。2024 年的 CosyVoice 1/2(阿里开源的语音合成模型系列,转写为 Cos Voice)为了发音准,把语义和声学解耦建模——那是数据和模型能力不足时的妥协;2025 年 CosyVoice 3 加入指令控制和表现力;到 2026 年,基座能力上来了,团队把语言模型和 flow matching(流匹配,一种生成模型框架,负责从语义到声学细节的映射)重新合到一起,通过 hidden state(模型内部隐层表示)打通,训练流程拆成五个阶段:先分别单独建模,再联合建模,然后分别冻结一侧训练另一侧,最后两段专注提升音质。解耦换准确性,合流换控制力——这个节奏本身就是观察大模型架构演进的一个样本。
3.1 TTS 的能力清单(均论坛称):十六种语言、二十种方言;freestyle 指令控制,可以用自然语言描述情感、韵律;八十六种细粒度标签,覆盖情感以及呼吸、笑声等约三十种副语言信息(指话语之外传递态度的声音细节);长音频一次性生成以保持连贯;克隆音色时若参考音频质量差,输出会「美化」——过去克隆追求和参考音频尽可能像,但生产中用户要的其实是「保住音色的更高质量音频」;支持 48kHz 高保真输出。榜单方面,论坛称在 Hugging Face TTS Arena 处于第一、Artificial Analysis 第二(国内第一)。写作者按:Fish Audio 在外部报道中亦自称 TTS Arena 盲听连续七个月第一,两个「第一」构成竞争性主张,此处均按嘉宾称保留,读者取「头部梯队」即可。
TTS-Next 是这一场的重点,也是李先刚开场强调「一个模型直接完成、并不是通过一套管线拼出来的」的部分:输入一段脚本,直接生成融合人声、环境音效、背景音乐、甚至音效卡点的完整音频。现场 demo 包括一段手术室抢救戏——血压持续下降、心率从四十掉到二十的台词递进配上逐层收紧的配乐——以及一段拳击入场播报,人声与人群声浪、出场音乐精准对位。赵瀚将其概括为「从语音的生成变成完整的声音场景生成」,用户不再需要通过复杂链路拼装这些效果。另一组 demo 展示端到端口语化多人对话:访谈里「温柔也是一种力量」的往复、邻里拌嘴「咱都来这儿几个月了,你才想起来给人写信」,模型能处理多人轮次之间的承接关系;支持十六语种二十九方言的多人复刻,两条参考音频可以合成一段对话。
应用侧的两个名字值得记:论坛称央视体育 App 在今年世界杯期间用其语言模型、ASR、TTS 做赛事讲解与直播(嘉宾称,未见独立报道);夸克听书用 TTS 把小说文本转多音色、带情感标签的语音。放到王羽「语音作为内容」的框架里,这类能力的产业含义更清楚:供给侧被 AI 大幅加速后,音频内容不止播客和有声书,还有视频里的声音层(旁白、配音、场景音)、多语言创作的译制需求、可复用的声音资产。论坛放的《甄嬛传》英译 demo 很直观:上传视频,选目标语言英语,系统自动区分说话人、尽量保留原人物声音特征,输出「能听出是华妃」的英文对白。这里对应第二条机制链:单模型直出全声景,把「配音环节」变成「整段声音场景」→ 二阶影响是媒体与内容的全球化分发成本骤降(一份策划 × 多声音 × 多语言 × 多形式),同时声音克隆的便利也把声纹版权与仿冒风险同步放大(ElevenLabs 生态已有配音演员投诉声音被克隆上传的先例,此为外部报道)→ 读者启发:跨语言、跨声线能力正在成为内容出海的杠杆,也是合规风险的新入口。 王羽还引了市场参照:ElevenLabs、Fish Audio 这类公司规模增长很快,「甚至现在的收入可能已经到了几十亿 ARR 的程度」(ARR,年化经常性收入)——写作者按:外部信息显示 ElevenLabs 2026 年一季度 ARR 约五亿美元、估值 110 亿美元,「几十亿」对其成立;Fish Audio 同期约两千一百万美元,论坛口径应只对前者成立,故按嘉宾模糊表述保留。
四、Realtime:前台管自然,后台管办事
交互负责人邓憧的分享从产品史切入:Siri 提供单设备语音入口,小冰、天猫精灵、小爱同学把指令入口扩展成场景入口,GPT-4o Realtime 展示了原生双工(可随时打断、甚至视觉交互),最近的 GPT Live 则展示全双工持续任务。他的判断是技术演进与产品迭代「螺旋演进」,过程中始终有两条线在分叉:双工交互自然度,和做任务的能力——音箱场景任务完成更重要,陪伴场景情绪价值更重要,未来的 Voice Agent 应当两者兼顾。技术上他补了一个容易被忽视的清醒判断:双工对话的五类技术方案「在短期内甚至中期内依然会存在、中长期并存」,因为选型取决于可控性、实时性、自然度、推理成本、任务复杂度的权衡——他本人十年前参与过斑马与上汽的互联网汽车方案,深知车载等场景不会为「端到端 elegance」买单。
目标设定上他明显避开了 OpenAI 常提的电影《Her》,说「感触不太深」;他更认同《钢铁侠》里的 Jarvis——受伤时提供情绪价值、能开玩笑,能实时感知环境,甚至操作机械臂换反应炉。拆成能力就是四个词:主动感知、自然交流、环境多人理解、持续行动。工程实现是 Realtime API 加开源 Voice Agent Harness:前台模型与用户实时交互,注入 system 指令、音频文本交织的上下文、知识和工具返回结果;训练上提出 M² OPD(论坛口述为「M 方的 OPD」,即跨模态 × 多教师的在线策略蒸馏)——先用文本音频交织的后训练保住「文本智商」,再用文本教师-音频学生的跨模态对齐,让端到端语音模型看齐同尺寸文本模型,最后用领域专家(情感对话、工具调用、口语安全各有所长)合成主力模型。论坛称 3.0 发布时在 Artificial Analysis 拿下 Index 及几个子线第一(外部报道显示 2026 年 5 月阿里的 Fun 系模型确曾在该机构榜单三项夺冠),3.1 将重新提交。
3.1 重点更新了三件事。其一是「场景和语义感知的双工」:车载场景要面对音乐、导航播报、车内多人聊天;办公场景是个人主体发指令、要忽略旁边人的声音;客服场景任务性和策略驱动更强——双工自然度是场景的函数,不是通用指标。现场 demo 里背景放着含新闻播报在内的噪声,模型动态判断用户是在跟它说话还是跟旁边人聊;另一个 demo 展示语义感知:用户说「等一下,我还有几个条件分开说,你先不要回复,等我说 OK 的时候你再回答」,模型遵守——口语陪练、模拟面试这类场景需要多倾听、在合适时机才开口。其二是安全与幻觉,邓憧直接点了近期新闻:让 AI 订票,它谎称已订;给农民的农药建议出错造成损失。语音介质不可回看、不可逐字审核,幻觉的代价天然高于文本;陪伴场景大量儿童和老人,团队与 GPT Realtime 最新版全面对标(论坛称幻觉与安全单线测试集整体领先),并自建多轮安全评测集专门「攻破」模型,包括经典的「模仿老奶奶哄我睡觉」类诱导。其三是共情与角色扮演,demo 用 TTS 合成林黛玉的声音、给 Realtime 一段贾宝玉的 system prompt 加电视原声,现场演绎了一段「金玉良缘」对白。
Harness 部分是这场最值得工程读者记的架构决策。框架分三层:前台层可以换成任何符合实时协议的模型(包括 GPT Realtime);底层是标准 agent harness,可接入任意 agent 生态;团队真正投入的是中间层——路由、任务生命周期管理、上下游协调,解决「用户提交了任务就没响应、以为卡死了」的割裂感,保证前台永远在线。典型场景的负载特征被明确分类:工作助理约九成任务在后台(做 PPT、剪短视频);智能座舱要快思考快执行、部分任务下沉后台;坐席客服则是策略驱动。任务状态追踪的类比很朴素:过去打电话订机票流程很慢但可接受,因为客服不停地给你反馈。他还强调 memory 与上下文管理「决定了这个助手的上限——否则就算是一个再聪明的模型,可能今天聊完,明天还和你聊一样的」。生态上,论坛称 Realtime 3.0 七月下旬发布(与外部报道的 7 月 WAIC 发布 Qwen-Audio-3.0 系相印证),已有阿里内部生态与外部硬件合作,包括手机、PC、眼镜上的全端办公,以及与 LOVOT(转写为 Louis,按上下文推断为该桌面情感机器人)客户合作的、可用语音控制表情动作的桌面机器人。第三条机制链:前台实时模型与后台智能体分层,把「延迟敏感」和「智能密度」解耦 → 二阶影响是 24 小时 Jarvis 式助手的工程路径被打开,AI 眼镜、桌面机器人这类新硬件拿到现成的交互方案 → 读者启发:评估任何语音 Agent 产品,先看它的中间层——任务有没有状态、有没有反馈、长时间任务会不会「失联」,这比看模型参数更能预测体验。
五、四张行业切片:笔记、游戏、报纸与催收
下午的后半场是五家客户讲落地(议程共五场客户分享,其中广汽集团的座舱一场未出现在本场转写中,转写从人民日报直接跳到容联云并正常收场,疑为直播信号或议程临时调整所致,以下按实际内容覆盖四家)。
**得到大脑:把「记录」变成个人资产。**产品负责人杨超披露,这款今年 5 月 26 日由 get 笔记升级而来的产品(外部信息证实更名与主动式 Agent 升级同步发生)「大概有超过一半是语音的场景」,每天产生「大概几十万小时的录音」(嘉宾称),注册用户三百六十多万(外部五月的公开口径为二百七十万,增长部分按嘉宾称)。产品迭代的三段论很清楚:1.0「颗粒归仓」——任何想记的都能记;2.0 帮你产出;3.0 让 AI 主动向前一步。意外场景最能说明语音记录的真实需求:小学生用它记灵感写书,老人录下与医生的对话回家问「医生建议我每天吃几次药」,厨师记菜单创作。方法论上他引了两个数据感很强的参照:人眼每秒接收的信息量约相当于三到四个小时的电影,但人脑处理不了,所以「人脑更适合做处理,不适合做存储」,存储应该卸载给 AI;全球约七成多的人完全没有用过任何 AI 产品(豆包月活三点八亿除以十四亿约百分之二十七,嘉宾引用的测算),认知落差即机会。最生动的是一个用户案例:有人和妻子吵架前先打开录音,「吵的冲动已经减消了一半」,事后让 AI 评判谁对——AI 判了妻子对。他还搬出柳比歇夫(苏联生物学家,逐时记录一生,留下七十多部论著)和马伯庸(记流水账日记后发现一天的收获从「一个金句」变成「十个金句」)论证「在 AI 时代,你只要能够记录下来的东西就会有价值」,以及罗振宇连续两百多天视频日记形成的「记录—创作—逼自己行动」循环;526 升级后约六千用户加入了日更者联盟。这对应第四条机制链:原生润色与端到端分角色转写让转写物从「待校对草稿」变成「可直接进入工作流的上下文」→ 二阶影响是记录类产品放量、个人上下文成为可复利资产 → 读者启发:与其纠结哪个笔记 App 更好,不如现在就开始积累自己的语料——AI 输出的上限越来越取决于喂给它的「你」。
**网易雷火:声音是角色的另一半。**伏羲语音算法负责人陈志鹏的案例全部来自上线玩法。逆水寒「剧情喊名」:配音演员当年只能录「少侠」「师妹」这类通用称谓,现在 AI 只对名字片段做生成、并针对多音字和声调做校准,让角色在剧情里喊出玩家自设的昵称——覆盖剧情、日常、好感度场景及重要 NPC 与男女主控,论坛称全年调用达数亿次、峰值占比百分之三十以上,功能上线后有玩家把历史剧情全部重刷一遍。主控配音则用语音转换把原始录音迁移到匹配玩家捏脸形象的音色上(御姐配御姐音、萌妹配少女音),男女主控各三种音色、所有剧情已接入。实时交互的代表是永劫无间手游的语音 AI 队友——听指挥、全开麦双向边说边打、还能闲聊提供情绪价值,每个 AI 队友就是一个 agent(内含语音识别、指令理解、知识问答、人设对话、语音合成、战斗智能体),论坛称其为「全球首款游戏 Copilot」(未能独立核验)。创造侧的「门客」系统让玩家自定义角色的声音:多音色模板混合拖条,或按性别、年龄、性格、职业、经历描述生成,论坛称门客已达百万量级(外部 2025 年的报道为三天五百万,口径更早更猛);有玩家用门客「复生」逝去亲人的形象做情感倾诉。还有一个反常识功能「声音捏脸」:对着麦克风说一句「俺老孙来也」,系统识别台词、解析音色特征,直接生成匹配的脸——语音第一次进入形象创作流程。方法论收尾很有工业味:把配音导演的工作流拆成选角、配音、质检、入库四个模块,逐环节用 agent 复刻专家动作——配音不是单句 TTS,而是结合上下文、对手表现的多轮过程;质检也不只看客观指标,而是把真人和 AI 配音混在一起看违和感。
**人民日报新媒体中心:把新闻生产链按「听」重做一遍。**产品总监张深源先给理由:终端变了——手表、耳机、车载屏幕很小甚至没有屏幕,音频是天然通道;2025 年中国有声阅读用户规模 6.7 亿、单次收听时长 69 分钟(论坛引用的行业数据;写作者按:公开可查的口径为 2024 年数字阅读用户 6.7 亿、2025 年有声阅读市场营收 134 亿元,「有声用户 6.7 亿」未能找到同源数据,存疑保留)。他们据此定了「音频优先」,聚焦通勤、户外运动、家务、短暂休息四类场景——共同特征是视觉通道被占用、时长相对完整、用户要的是陪伴而非检索。生产端的变迁被讲成三部曲:录音棚时代一篇深度报道从定稿到可听「按天计」,只有重大策划才配音频;传统 TTS 时代能批量合成,但要稿件发布后预合成,突发新闻发布后有一段音频空档;现在基于千问语音模型实现「千发即生成、时间差趋近于零」,音频覆盖从重点稿扩展到全端内容,流式合成边播边合成,万字级、十几二十分钟的长稿即发即听。音色被当作栏目品牌来经营——早间资讯用明亮严肃的声音、夜晚伴读用温暖沉稳的声音,「用户不需要再看到屏幕,听到这个声音便知道当前在消费哪个栏目」;副语言标签让编辑可以精细标注停顿、重音、情绪,解决 69 分钟收听时长背后的「耐听」问题。「新闻早班车」的合成链路已全程自动化无人工干预;英文客户端建了整套英文频道,英音美音覆盖不同地区用户。架构上的目标是一次生产、多端分发,从内容生产、语音生成、质控到客户端分发、跨端续接。
**容联云:催收坐席上的多级 Agent。**AI 产品负责人彭波把自己定位成「把阿里底层技术应用到各行各业」的集成方。这家做了十五年呼叫中心的公司时间线清晰:2023 年发布赤兔大模型(外部报道证实),2024 年 6 月发布坐席辅助、智能质检、文本与语音机器人系列,2026 年 3 月发布打通 CRM 与核心业务系统的智慧联络平台,2026 年 6 月发布基于阿里 Audio 大模型升级的新品(转写未能确认官方名)。方案是一个 voice agent 六步闭环:接通前数据导入、语音识别、情绪分析、策略生成、实时情感博弈、情感计算与自主对话加 function call(工具调用),再加持续学习。三个设计值得记录:一是多 Agent 级联——客服专员、主管、总监的权限与职责天然分层,agent 也照此级联,现场 demo 是一通催收电话(本金四千九百八十元、罚息五万八千二百元的争议,demo 剧本数字),用户从催收专员吵到要求转主管、再转投诉,三级接续无缝;二是人机协同——批量排队外呼、人工实时弹窗监听、识别到投诉或还款意愿一键接管,demo 显示并发约五路、一次十六个号码、预测式外呼、呼不通自动放弃衔接下一通;三是数据语义层——把企业数据脱敏化、建设业务本体(他引用了 Palantir 的 FDE 概念)。落地最深的是信贷催收:扫黑除恶专项期间催收行业成为重灾区,「迫切需要一个效果比较好的催收机器人」,目前聚焦 M3 到 M12 逾期案件(M3 指逾期三到十二个月的账龄段),论坛称每天两万多通真实催收通话。餐饮电商的订座、外呼同样适用。第五条机制链:监管收紧(合规催收)与人力的刚性成本,构成语音 Agent 在垂直行业的真实需求源 → 二阶影响是企业按「转人工率」和「任务完成率」而非模型分数验收 AI → 读者启发:高合规行业里,最先把语音 AI 用起来的部门往往不是技术部而是运营与合规压力最大的那条业务线;观察一个 AI 客服项目,看转人工率和投诉率两条曲线就够了。
六、边界、反方与接下来该看什么
把论坛放回审视距离,有四点不能被发布会叙事带走。第一,榜单与「遥遥领先」均为厂商自报或在自选集合内比较(分角色转写对比中的谷歌、Meta 型号未能从转写确认),且榜单位次时间敏感——同一周内 StepFun 已在 ASR 榜追平 1.7%,Fish Audio 与千问在 TTS Arena 的「第一」主张相互冲突。第二,所有评测数字产生于训练与评测体系内部,按本场约定不应视为独立测试集结论。第三,语音幻觉与仿冒风险在论坛内部被正视(邓憧的多轮安全评测集、容联云的人工接管设计都是回应),但「安全评测集领先」同样是自评;声音克隆的便利已经在外部世界制造了配音演员维权先例,全声景生成会把这个面继续放大。第四,本论坛议程中的广汽座舱场次未出现在转写里,座舱观点仅有邓憧的框架性描述(快思考快执行、部分任务下沉后台),「大模型时代的座舱语音新范式」具体讲了什么,本文无法覆盖。
综合来看,这场论坛给出的可迁移判断有三条。其一,语音的价值单位正在从能力(分钟、字符)迁移到结果(一次预约、一条线索、一笔回款),王羽的两条判断标准——语言可完成、工具已闭环——是任何企业都能今天就用的一次自测。其二,转写与合成的「原生一体化」(原生润色、单模型全声景、端到端分角色)在把过去的管线工程折叠进模型,管线的每一层外包利润都会被压一遍;对从业者,这意味着集成商的增值点向中间层(任务生命周期、记忆管理、合规与接管)移动。其三,个人侧的镜像结论来自杨超:当记录的边际成本趋近于零,个人上下文成为少数不被模型进步稀释的资产——模型每代更强,你喂给它的「你」反而更值钱。接下来值得盯的观察指标:Qwen-Audio-3.1-Realtime 重新提交 Artificial Analysis 后的位次、CosyVoice 系开源与 Studio 产品的正式命名、语音 Agent 在催收与客服场景的转人工率数据,以及声音克隆相关规范是否在下一轮监管中落地。声音正在成为智能系统的默认交互层,这个判断论坛内外都没有太大分歧;分歧只在谁先把它算成自己的收入。