先说结论

9 月 23 日上午云栖大会「伶鹊自进化智能体:让实时对话创造企业生产力」分论坛,两小时、五位讲者,回答的其实是同一个问题:**当对话智能体已经证明自己能在真实业务里干活,下一阶段的竞争是什么?**阿里云伶鹊产品团队的答案是「自进化」——把智能体的搭建、评测、迭代从工程师手里接过来交给引擎,场景交付周期从月缩短到天(论坛称)。货拉拉和淘宝闪购两个客户没有讲愿景,讲的是压力:订单猛涨、人工外呼响应不过来,才有了日均 20 万通外呼、97% 意图识别准确率这些数字(嘉宾称)。真正的矛盾藏在马苏彦那段最「干」的分享里:智能体规模化之后,卡住企业的不是模型,而是构建难、测评难、迭代难这三件运营层面的苦活——自进化引擎的实质,是把这三件苦活变成引擎的活,把人的角色收敛为定目标、确认规范、看报告做决策。这场论坛值得记录,因为它展示了一个正在发生的岗位结构变化:智能体运营正在从「写提示词的技术活」变成「管下属的管理活」。本文所有效果数字均为演讲自报口径,未经第三方核验的均已注明;产品官方名为「伶鹊」(转写中作「灵鹊/灵雀」,已按阿里云官网校正),讲者人名按官方议程校正。

一、伶鹊2.0:把「进化」从口号做成引擎

开场讲者、阿里巴巴ATH事业群MaaS业务线千问AI平台AI应用产品总监吴占山先用市场位置定调:客服是 AI 明确可落地、能带来量化价值的赛道,竞争激烈,而伶鹊凭产品能力连续三年蝉联中国智能客服市场第一(嘉宾引述 IDC 近三年统计,阿里云官方页面口径为「2024 年份额 11.4%、持续第一、累计服务超 5000 家企业客户」,两个口径可互相印证)。今年 5 月 20 日伶鹊品牌在阿里云峰会首秀 1.0,四个月后的 2.0 不是功能升级,而是底层重构:自进化引擎(底层)、Voice Studio(中间层)、All-in-One 营销服 Agent(应用层)。平台规模上,在线客户超 5000 个、覆盖 20 多个行业,每天数百万个数字坐席在线、数百万分钟通话(嘉宾称)。

理解 2.0 的钥匙是自进化引擎的五步循环:需求输入后,引擎自动完成场景构建(提示词或工作流都行)→ 全面评测(每一轮迭代覆盖所有场景,不是抽检)→ 仿真模拟对话验证边界 → 自动输出并执行优化策略 → 上线后数据持续回流迭代。吴占山用一个真实案例说明威力:智能外呼场景从零构建到双百达标(能力项、红线项均满分),引擎自主进化只用了不到半天、四轮迭代;此前无论客户自建还是 FDE 工程师代建,一个场景达标通常要一到三周(嘉宾称)。质检场景更直观:国内某头部手机厂商几百条质检项,梳理加验证周期从数月缩到一周,准确率从起步的 57.7% 拉到五轮迭代后的 93.9%,远超客户预期的 90(嘉宾称)。

这里有一条值得展开的机制链:**为什么「全面评测」比「人工抽检」是质变?**依据是吴占山和马苏彦都提到的痛点——人工抽样修了 A 常常按下葫芦浮起瓢,B 指标又掉了;而引擎每轮迭代覆盖全部场景,把回归测试变成内建能力。带来的二阶影响是,智能体的质量保证从「上线前冲刺」变成「持续在线」的过程,上线即巅峰、此后缓慢衰退的老曲线被逆转。对读者的启发是:无论用不用伶鹊,评测覆盖率都该成为你采购或自建对话智能体时的第一问——它决定了你后续运营是「救火」还是「值守」。

二、货拉拉:延迟、情绪和红线的工程学

货拉拉技术中心AI应用负责人林肯的分享是全场技术密度最高的一段。货拉拉有 1600 万活跃用户、140 万活跃司机(嘉宾称),AI 实时对话系统要同时解决四个难点:理解难(场景边界模糊、用户表达零散)、情绪安抚、低延迟流畅度、内容安全。他的数字员工答卷:场景路由加 query 改写准确率 90% 以上、情绪安抚准确率 90% 以上、P95 延迟 1.6 秒以内、红线内容零输出(均为嘉宾称)。

两个工程细节值得记住。第一是快慢思考:快链路先推测执行、实时生成一句承接语让用户立即有回应,慢链路同时走深度推理生成完整回复,承接语播报完毕时完整回复刚好接上。这背后还有早退出机制(识别置信度够高就提前进入下一步)和预测式生成。为什么这个设计聪明?因为它承认了一个用户体验的真相——用户在前几百毫秒里需要的不是答案,是「被听见」。第二是路由的粗排加精排双层架构:知识来源既有结构化流程、2000 多条 FAQ,又有大量文档,全塞进 prompt 延迟要超 2 秒;粗排用规则过滤加 embedding 意图候选做粗筛,精排做流程剪枝、摘要压缩再构造 prompt,最终 70 多个意图的路由 RT 约 700 毫秒(嘉宾称)。这组数字的启发是:企业级 Agent 的延迟问题很少靠更大的模型解决,靠的是知识分层和链路裁剪。

情绪处理则展示了另一种思路:基于心理学的情绪 ABC 理论(事件触发认知、认知输出情绪)把用户情绪分六级,每级对应不同策略——焦虑型用户核心心理是怕损失,要给确定性、明确步骤和时间;愤怒型用户最需要的是被看见,先降温共情。这些策略不是凭空写的,是从线上对话里挖掘优秀人工客服的安抚经验,通过 SFT 微调和强化学习内化进模型。加入情绪安抚后,离线人工评测 Win Rate 提升约 29%(嘉宾称)。安全侧采用预防加消除双保险:生成阶段 prompt 注入红线策略,输出后过规则检测(正则关键词)和相似红线检测(向量相似度识别隐性违规),最后兜底预设话术。业务成效:热线对话场景覆盖率超 60%、分流率提升 15% 以上(嘉宾称)。林肯的收尾判断值得引用:实时对话已从简单问答进入自主规划、调用工具、多步骤执行阶段,未来 Agent 服务将从单点任务智能体走向全链路业务闭环,从降本导向变成驱动增长的价值中枢。

三、淘宝闪购:当 AI 学会「商量」

淘宝闪购智能服务专家郑灿博讲的是一个被业务压力推着演进的故事。2018 年淘宝闪购就接入了阿里云智能外呼,但小模型只能做催促和通知;2025 年订单猛涨(他提到「奶茶大战」),高峰期人工外呼响应不及时,协商类场景由此孕育而生——7 月与伶鹊团队合作,8 月大模型接入只用了九个工作日(因为有 2018 年以来的基建底子),现在日均外呼量 20 万+,整体提效 11%(嘉宾称)。

所谓智能协商,链路是这样的:用户进线求助 → 识别协商场景 → 甄别该呼商家还是骑手 → 把本地变量(订单状态、是否发起退款、是否联系过商家骑手)带给外呼 → 全双工实时沟通 → 整通会话归纳达成情况 → 结果返回用户,未达成支持多轮。覆盖少送漏送、配送慢、投诉安抚三类场景。最值得注意的是他抽检时的发现:用户会真的跟 AI 聊天吐槽——投诉场景里用户有发泄诉求,不只想要赔付,AI 扮演的是聆听加安抚道歉的角色。这提示一个被低估的事实:对话智能体交付的除了事务处理,还有情绪价值,而后者此前被归为「必须留给人类」的部分。试点效果上,智能侧转人工率下降 8 个百分点,人工协同试点提效 6%,标准化场景已替换为 AI 全自动处理(嘉宾称)。

数字含金量取决于口径,郑灿博在这一点上出乎意料地坦诚:意图识别准确率 97% 是交付、质检、外呼三个团队人肉抽检出来的,他给定的标准是整通会话有一个字错误就算错——原以为 90% 就不错了。接通率 75% 则有场景加成(外显淘宝闪购客服号码,用户本就带着诉求而来)。他用一句话总结自己的体会:「解决能力是 AI 的智商,解决方案是 AI 的情商」——AI 不能完全代替人,但标准化场景可以覆盖,人去解决更复杂、更有温度的场景。这和货拉拉把情绪安抚做进模型的路径形成一个有趣对照:一个把温度留给模型学,一个把温度留给人。

四、自进化引擎的实战细节:红线、能力项和三个 bad case

马苏彦(转写作「马素艳/马苏艳」,按议程校正)的分享是全场方法论浓度最高的,她开场就点破真问题:对话 AI 走进真实生产创造价值已经没人怀疑,疑问在于当一个场景走向更多场景、一次上线走向长期运营时,业务需求井喷如何快速构建、智能体如何持续保持生产力。她把生产级对话智能体的困境拆成三难:构建难(业务规则、对话策略、流程、变量分散,要转化成提示词和流程配置,偏技术视角、耗人)、测评难(人工抽样覆盖不了业务底线和复杂场景,修 A 坏 B)、迭代难(业务一变,构建加测评全部重来)。这三难不是产品宣传话术,是「我们自己趟了很多坑」的一线总结。

自进化引擎在外呼场景的闭环是:业务沟通理解(人主导,引擎维护一套完整、内部一致、可量化的业务规范,每次变化做全局审视而非追加单条规则)→ 自动构建方案 → 自动构建测评场景集 → 真实仿真测评 → 批量归因 → 定向优化复测。三个保障设计划清了人机边界:达标后出具测评报告、由人决策是否发布(引擎不自动发布);发现业务规范缺失或规则冲突时,主动回到第一环节找人确认;上线后数据回流持续闭环。量化口径是:红线项 100% 必须达到,能力项 95%(部分弱能力项不影响体验可先上线)。

三个 bad case 复盘是这段分享的价值核心。保险续保案例:强合规下旧规范是「客户质疑你是骗子就挂机、告知打 400 核实」,业务分析发现这丧失了大量沟通机会;业务人员把改进意图告诉引擎助手,引擎主动给出方案——先说明信息来源于客户未完成的续保订单、提供官方渠道事后核实、当前通话不结束,业务确认后配置自动完成。物流撮合案例:货主加价 2500 到 2800 并问「能保证今晚有人接单吗」,AI 回答「好的,记一下期望价格 2800」——表面没错,实际对「保证」存在歧义。归因发现根因不在模型:登记价格有标准参考话术、拒绝保证只是原则性说明,两个场景同时出现时 AI 挑了容易说的那个。改进是把优先级写进规范:凡遇保证承诺先声明不能百分之百保证、以司机意愿为主,再记录需求。家装案例:「已精装修只加柜体」的客户被直接推荐两个商户,根因是旧规则「有家装需求就推荐商户」太泛、SOP 没进业务规范;把确认城市、装修范围、计划后才推荐的 SOP 交给引擎后很快收敛,当地无商户时也会如实告知而不是胡编。

这三个案例指向同一个机制:生产级智能体的大部分 bad case,根因是业务规范本身有漏洞,而不是模型能力不足。修复路径也因此改变——不再改提示词,改规范,再让引擎重新仿真验证。二阶影响是清晰可见的岗位结构变化:过去业务、产品、技术串联完成配置测试发布,现在业务人员只剩三个动作(说清楚要求、确认规范、看报告做决策——马苏彦的原话是「有点像老板的感觉了」),智能体运营从技术活变成管理活。对读者的启发是双重的:如果你在构建智能体,先把业务规范(尤其是话术优先级和边界条件)当成一等公民去维护;如果在规划团队,可以预期「智能体运营」岗位的能力模型将在两三年内向「业务规范管理」迁移。

五、Voice Studio:拟人度是转化率变量,也是伦理变量

压轴的楚熹微(转写作「储希微/楚希微」,按议程校正)讲声音。她开场的提问很直白:接到外呼电话,前三秒听出是机器人你会干什么?挂断。企业语音落地因此有三道坎:音色不自然(机械感劝退)、自然了但没辨识度(大家用同一批优选音色)、想要品牌音色却要找专家花很长时间。Voice Studio 的三大能力是音色复刻、TTS、ASR,两种模式:通用智能克隆(盲评 4.1 分/5 分制,测评员不知道哪个是原声;回归覆盖 90%,保证模型迭代不让现有音色劣化)和 SFT 专属高定(数据采集到上线全流程闭环,粤语及方言识别准确率 95% 以上)(均为嘉宾称)。

技术叙事里有几个反直觉的点。其一,真实录音比录音棚干净数据更值钱:传统声音复刻要求干净环境和标准化录音,成品却缺少场景代入和情感;伶鹊的路径是直接用线上客服录音做工程化处理(声道分离、去噪、提质)再加专门微调的模型,因为真实录音里自带场景感。其二,智能选段按场景挑素材:营销场景挑语调上扬、号召性强的句子,客服回访挑耐心安抚的,有口癖和停顿的选段剔除——「保证出来的不是一个结巴的机器人」。其三,拟人度被刻意拆到极细:高定音色评测把拟人化权重放到 50%(内容准确 25%、风格和音质各 12.5%),拟人度再拆八个维度(呼吸与停顿、发声松弛度、韵律变化、自然连读性等),其中六项排名第一(嘉宾称)。楚熹微给的理由很朴素:真人两句话之间是有换气的,AI 表达不出这一点,闭眼一听就露馅——所以他们刻意保留爆破音、轻微背景噪声这些「不完美」细节,她的朋友第一次听到优化后的录音,以为她在跟真人开会。

这条线存在一个论坛没有回答的问题,写作时必须指出:用真人客服的声音做克隆,声音权属、客服本人的知情同意、以及接听方「有权知道自己在对机器说话」的知情权,整场论坛没有讨论。这恰恰是拟人度军备竞赛最需要的外部约束——结合核验到的背景:9 月 1 日起实施的国标《顾客联络服务 人工与智能客户服务协同要求》(GB/T 47746—2026)已在转人工衔接一侧立规,而声音侧的规范目前是缺位的。二阶影响因此是双向的:拟人度每提高一分,接听留存和转化率涨一分,但「像真人到什么程度算误导」的争议也涨一分。对读者的启发:企业采购语音能力时应把「声音授权链路完整」当成和「盲评分数」同权重的采购条款,否则下一个合规风险点大概率在这里。

自研 ASR 部分补充了数字识别能力强的特点(快递物流单号、地址类场景适应性好),流式长对话和客服场景大幅领先竞品(嘉宾称,未第三方验证),后续投入方向是高噪声鲁棒性、说话人分轨、方言和热词。吴占山在前半场也提到对话分析模型 Pro/Plus 版本与千问3.8-Max 的对比:质检打标场景效果更优、成本降到基模不到 10%(嘉宾称)——专属小模型对通用大模型的性价比逻辑,在这场论坛里出现了不止一次。

六、把五段分享拼成一张图:岗位、资产和边界

五段分享拼起来,能看到一条比任何单项功能都重要的主线:对话智能体的稀缺资源正在从模型能力转移到业务规范的资产化程度。吴占山的自进化引擎吃进散乱的业务材料,产出结构化、可量化的规范体系;马苏彦的三个案例证明 bad case 的根因多在规范而非模型;郑灿博的 97% 准确率靠的是把整通会话当总结单元(而非填槽和关键词);林肯从人工客服对话里挖四元组、挖安抚经验——全都在把人脑里的隐性经验变成可仿真、可回归、可迭代的显性资产。这条链的二阶影响:企业的智能体竞争力将越来越体现为「沉淀规范的速度」,而非「买到多好的模型」;模型的同质化(IDC 也在报告里提到底层技术能力趋于收敛)会加速这个转移。对读者的启发:现在就该把客服 SOP、话术优先级、业务边界条件当作数据资产去治理,它们的回报周期会远短于再造一个模型。

第二条链关于上线的定义被改写。旧模式里上线是终点,此后靠人盯 bad case、靠投诉发现问题;自进化模式下上线是起点,每条真实业务数据回流驱动持续迭代,效果每天爬坡。这改写了运营的考核方式——从「救火响应时长」变成「回流数据的利用率」,也让「业务一变智能体就废」的旧风险变成「业务一变引擎重跑一轮仿真」的新流程。观察指标因此很具体:看一家厂商或一个内部团队成熟与否,问它上线后第 30 天的效果曲线是平的还是斜的。

第三条链关于合规从成本变成需求来源。吴占山专门留了时间讲 9 月 1 日生效的国标要求机器人转人工无缝衔接(经核验属实:GB/T 47746—2026 由市场监管总局 2026 年 5 月 25 日发布、9 月 1 日实施),伶鹊的坐席辅助(挂机后 3 秒出小结工单、话后处理从 3 分钟压到 20 秒内)正是把这纸标准产品化;坐席分身则应对另一类人性现实——不管第一句是真人还是 AI,总有约三成用户坚持转人工,分身托管把转人工率从 30% 压到 9%(嘉宾称,某客户案例)。监管立规、产品跟进、体验升级,这个循环在客服领域转得比多数行业快,因为这里的用户权益争议最集中。对从业者而言,读国标原文可能是投入产出比最高的「需求文档」。

至于边界和不确定项,账本里也该如实记下:本场的所有效果数字均为演讲自报口径,其中横向对比(TTS 综合评分第一、ASR 领先竞品、「业界首个」自进化引擎)没有第三方评测可交叉验证;「连续三年市场第一」与官方页面的「蝉联」表述存在口径差;货拉拉同期的公开报道显示其也与腾讯云在智能客服上有合作(语音识别准确率超 94%,新华网 2025 年 9 月),多供应商并存说明论坛里的数字反映的是伶鹊参与的那条线,而非客户全景;智能外呼行业的市场规模各家口径从 127 亿到 224 亿元不等,论坛本身没有引用这类数字,读者引用时需自选口径。这些不改变论坛展示的方向,但决定了每个数字能被引用的强度。

回看整场,它记录的是对话智能体竞争重心的第三次挪动:第一次是模型能不能听懂人话,第二次是智能体能不能办成事,这一次是系统能不能在业务变化中自己保住生产力。前两次的胜负手在算法和工程,这一次的胜负手在规范资产、评测覆盖和人的角色再设计——这也是为什么五位讲者里最像「产品说明书」的一段(马苏彦的三难与三个案例),反而最值得反复读。至于「自进化」这个术语会不会像之前的「智能」一样被用滥,判断标准其实就一条:看它有没有把「改自己」的闭环连同量化口径(红线项、能力项)一起交出来——交出来了,是真引擎;只给了个名字,那就是新瓶旧酒。


信源说明:本文基于云栖大会 2026 分论坛官方回放转写整理(转写全文 47 个时间段、约 124 分钟已完整阅读),讲者人名与议题按官方议程校正,产品名「伶鹊」按阿里云官网(aliyun.com/product/ai/icss)校正;转写将产品名误作「灵鹊/灵雀」、将讲者误作「马素艳/储希微」等,已统一修正。效果数字均为论坛或嘉宾口径;IDC 市场份额、GB/T 47746—2026 国标、货拉拉与淘宝闪购的 AI 实践方向、伶鹊官方产品定位等关键事实已对公开来源核验(共 7 项,详见工作账本)。