先说结论

2026年9月23日云栖大会,斑马智能办了一场以「原生智能,端上生长」为主题的AI终端论坛。三个小时里最值得记住的不是单场演示,而是两股方向相反的力量同时出现:斑马首席技术官司罗宣布最新端侧模型Auto Omni 2.0(23B-A3 MoE架构,节目称与阿里通义实验室合作)在普通任务上基本相当于十倍参数量的云侧模型、复杂任务达到其八至九成能力;博世智能驾控的王四通却提醒,DDR存储等芯片涨价可能让端侧AI明年的上车节奏反而滞后。技术曲线上扬、成本曲线抖动,这就是当下端上AI的真实处境。

论坛另一条主线是「上下文」。斑马首席产品官蔡明把产品哲学压缩成「我的世界」:AI只有理解用户完整的物理与生活世界,服务才可能贴心,token则是意图经济的新货币;驿道智能创始人肖睿哲拆解车外23小时的数据从哪来;高通Ali Osman Ors补上算力底座。本文按讲者顺序展开,保留关键数字、机制链与反方观点,文末给出四条行业判断。

蔡明:从「我的世界」到意图经济的token循环

蔡明的分享是整场的概念地基。他先交代斑马的三层业务结构:操作系统是传统业务——他称斑马是行业里首家且「唯二」拥有全栈自研自主操作系统的服务商,拥有AliOS全部知识产权,同时开放提供安卓OS服务并帮车企出海;智舱AI层与阿里千问大模型密切合作,包含云侧的Auto Omni、Auto Cloud与端侧Auto Omni;生态服务层约十年前基于小程序起步,2024年底全面推进服务Agent化,2025年在行业率先推出外卖Agent上车,目前合作服务商(CPS)超过400家,分成联合运营超过50家。

成绩单方面,蔡明称自2024年all in AI以来,斑马获得中国主流车厂68%的服务渗透,端侧智能与端模型应用领域市场份额63%(厂商自述)。外部信息可交叉:斑马官网与阿里云市场页面显示,元神AI已在上汽、宝马、现代、智己等超过15个车企品牌落地或规划量产,2025年IDC《智能座舱大模型能力评估》中在7大高频场景拿下6项第一。

真正有分析密度的部分,是蔡明对三代互联网交互范式的梳理。PC互联网的核心是关键词:搜索是入口,行业围绕关键词构建用户关系,网站优化内容供搜索抓取或竞价买排名,但搜索只解决「发现」,不解决服务闭环。移动互联网的核心是注意力:APP是入口,算法推荐加货架、banner、信息流、短视频全力提升曝光转化,把私域流量变现;APP能很好完成单一服务的执行闭环,但跨APP、跨端的服务几乎无法实现。AI大模型时代的核心是意图理解:Agent成为入口,前半段大模型理解意图,后半段各类服务把能力分层开放、封装成工具,通过MCP、A2A或Skill方式被模型调用——用户不再关心哪个APP提供服务,只表达目的。

由此他推出一个飞轮:AI越理解需求→越能规划复杂任务→越能高效整合能力→需求满足越好→用户越愿意用→进入深度使用。而这个飞轮的起点是AI对用户「我的世界」的理解。他借智能驾驶做类比:座舱与智驾都从多模型级联流水线进化到端到端融合,共同迈向第四阶段「我的世界」;区别在于智驾侧重物理世界(尺寸、空间、规律、轨迹),座舱侧重生活世界(偏好、习惯、价值观、精神世界)。他举了一个直观例子:一个物理世界理解很强的机器人能绕过家里睡觉的狗、稳稳端来一杯水不洒;但只有理解生活世界的AI,才知道你刚在同学聚会喝多了、明早还要出差,此刻需要的是一杯温热的蜂蜜水。

现场三段演示短片把这个分层拍成了剧情:无上下文时,用户说「把风开小点」,AI只调低主驾风量,副驾怕吹风的太太直接抱怨「我自己来吧」;获得车内上下文后,AI能为怕热的主驾和怕吹风的副驾分别定制降温方案;进一步打开「全时空权限」——AI能读取手机事件流(几点进场、几点付款、步行多久),在42度的暴晒车内提前开好空调;能从「昨天去了五棵松体育馆」推断车主是球迷,推送首钢主场DJ常用的BGM歌单;能把84条未读消息在高速驾驶时压缩成「仅两条需要确认」——民宿到店时间车牌、以及是否把明天的镜之湖活动改约后天。蔡明总结这套系统的三层架构——场景层(我的世界)、智能终端层(数据触点与服务管道)、服务层,并强调原生AI实现「三个连通」:端云算力与服务连通、多终端连通、用户与服务连通。

最后他抛出token论:token是AI理解意图、满足需求的燃料,是水电煤,是意图经济时代的新货币。AI对「我的世界」理解越准,服务越精准,用户才越愿意把token花在值得的地方,流入意图经济的token随之持续增长直至爆发。这个提法把用户体验与商业模型直接绑在了一起——值得注意,它与论坛议程里「AI终端Token运营」的议题设置互相呼应,说明token计价已被斑马当作产品问题而非单纯技术问题。

肖睿哲:车外的23个小时,上下文从哪来

如果说蔡明回答了「为什么需要理解用户」,驿道智能创始人肖睿哲回答的是「数据从哪来」。他开场回忆十年前与蔡明在上海交大旁的皇冠假日酒店聊「上车前、行车中、下车后」,然后自嘲这次是「被组织派出去帮大家获取23小时的数据」。

他的核心机制判断很朴素:没有上下文的AI,你说不开心它只会回「别不开心了,对身体不好」;而上下文的跨度和维度越丰富,Agent的回复能力越强。车内那一小时的数据已经很完整——位置、聊天、导航、驾驶习惯;问题在于用户一天有23小时在车外。他给出的合规采集路径有五条:第一,手机通知消息——APP发通知是因为「那一刻有事找你」,IM、购物、生活信息都在其中,AI整理分类后沉淀为上下文,比如从六七个家长群里抽出唯一关键的作业信息,滤掉满屏「收到、感谢老师」;第二,IM的开放接口——一个群聊等于一个产品,AI能从发言中沉淀出谁是设计、谁是开发、谁是测试,久而久之还原出整家公司的运作上下文;第三,输入法,补全「我们发了什么」;第四,浏览器插件,把公众号文章带入座舱与AI深度沟通——AI知道你对什么感兴趣、文中哪个点值得follow up;第五,也是当天下午与阿里云无影团队联合发布的RPA能力:在云端虚拟化一台安卓设备跑用户自己的APP,而不需要在手机上模拟人手点击去点外卖,「用户操作的东西跟AI操作的东西有机会分开,各用各的屏幕,各不占各的资源」。

他用了两个脱敏用户案例做对比解构(他强调均征得用户同意):一位共情型用户,AI从聊天记录知道她孩子常去姥姥姥爷家、也捕捉到她对孩子发火后的懊悔,于是以共情方式回应;另一位心力很强的销售,不需要别人共情,AI便先用一句话确认「你的确很烦」,随即指出烦在何处、再告诉他「你不是一个人在扛,这些同事可以帮你分担」——因为AI已经从群聊识别出哪些人是他的同事、可以被at到具体工作事项。他的结论:在座舱里为用户提供同样五个字的回答,上下文不同,体验天差地别。

方法论上,肖睿哲有个工程味很重的类比:自动驾驶本质是「采集→终端计算→自动控制」的闭环,如果把传感器全拿掉,车上坐一百个人也描述不清路况——人的描述损耗极大,所以数据应是第一现场数据,端到端交给AI闭环,而非用人脑转述。具体做法是把人的信息变成一个个事件,用线索串联上下文召回,提升座舱数据召回与memory管理质量——远程开空调的能力大部分车都有,稀缺的是「谁知道这个事件该发生」。他还有个反直觉观点:人把70%的push消息一键清除当垃圾,但知乎、B站被你当成广告的推送本质是千人千面的兴趣标签——不要预设什么有价值,尽可能保留原文、拿全量数据,让AI在对的时间、对的推理流里用它。演讲末尾他引用「宝哥」的观点:人的三个状态是常住地、家里、车里,车是连接人在不同场所的连接器,原生AI有机会把三者串起来;驿道愿充当采集器,把上下文与理解能力作为元神AI生态的一部分贡献进去。

司罗:端模型的天花板与「token工厂」

司罗的分享是全场技术含量最高的一段。他先给出三个趋势判断:其一,端AI进入快速发展期——端上不是把云能力简单迁移,而是实现差异化,因为端上可以保护隐私、可以长聆听长睁眼,从而支撑主动智能;他举了个生动的例子说明车内隐私的特殊性:有人开玩笑说手机信息都可以给太太看,但车内、副驾的信息不能分享——车是半封闭的隐私场景。其二,云AI正全面从级联小模型转向大模型统一驱动,2026年端云一体架构将成为主流。其三,舱驾融合加速:2026年会先看到智舱通过自然语言理解和规划能力调用智驾暴露的API,之后才有模型层面的深度融合。

模型侧,他与阿里通义实验室合作打造的Auto Omni是「为原生智能打造的全模态端侧大模型」,4B版本在智能座舱全场景平均提升20%——座舱文本理解提升22%、视觉场景理解提升17%、音频情绪语音理解提升更大,同时通用能力与头部通用大模型持平或更好。外部信息可佐证其芯片合作路径:2025年7月WAIC上斑马联合通义、高通首发了行业首个基于高通8397平台的端侧多模态大模型方案,司罗在论坛上也确认「去年云栖联合高通进行8397首个座舱AI端侧方案的发布,2026年已有多个量产车型落地」。

实车演示展示了4B端模型的三类能力:全时聆听并分辨人人对话与人机对话(风噪下20迈以下可收音);给副驾起名「小李」并长期记忆;多意图跨意图操作(「找一首窦靖童翻唱她母亲的歌,然后关掉我的座椅按摩」);以及通过手车互联在端上直接操作微信——发位置给联系人、读取并总结回复。司罗「重要的事情说三遍」:这些全部用端上模型完成——最大化隐私保护、把车企已花掉的芯片成本充分发挥、大幅降低云上流量与token消耗。舱外场景同样必须端侧:舱外视觉信息按法规不能随意传上云,他展示了首发于某旗舰车型(转写为「神行者八」,待核实)的主动迎宾——识别车主走近,提醒「雷雨将至,路上慢行,空调已调至你喜欢的温度」。另一个已规模化的端云结合案例是无感停车付费——合作停车场直接识别放行、缴费40元30分钟内离场,非合作停车场自动找码快速付费,覆盖率他称为全行业第一。

全场最重头的发布是Auto Omni 2.0(23B-A3 MoE):普通任务上基本相当于十倍参数量的云侧模型,复杂任务达到十倍参数云模型的80%到90%。司罗坦率披露了迭代内幕:三周前他第一次评测时差距还非常大,当时判断云栖大会不可能做展示,短短几周快速迭代后已经敢上台——「端侧能力提升速度有时候比我想象的还要快」。演示视频里,这个模型连续处理了「风量八档+导航浙大紫金港选最快路线」「先去西溪园区接王总的孩子再加加油站途经点」「换一首周杰伦最近的歌」「改去杭州最贵的酒店」等多轮复合指令,中间还纠正了曲库里没有的歌、把「上海悬崖边的酒店」理解为佘山世茂深坑酒店。

框架层面,端云一体的编排(他提及Hana Engineering框架)负责决定什么任务放云上、什么放端上——隐私数据留端,记忆数据经总结后上云;目前已搭建数十个主动智能场景,向更完整的端云一体Agent框架演进。安全被单列为「新兴的关键功能」:斑马打造了端侧AI三层安全框架(内容、框架、环境处理)。路线图上,他说智能汽车是具身智能的大型试验场和规模化压测平台,斑马将从Auto Omni走向Edge Omni——覆盖更多垂直领域的端侧全模态模型,从单体智能走向多群体跨端智能融合。主持人陆明补充称司罗「前不久获得2026世界金融论坛年度科学家奖」,此为主持人陈述,未另行核实。

Ali Osman Ors:车是物理AI的第一个规模化样本

Ali Osman Ors(高通汽车、机器人与工业IoT的AI软件产品管理负责人)提供了产业纵深。他把AI分三层交互:面向人的AI(作用于数字世界)、仪表化AI(传感器输入)、具身AI——车是具身AI最佳实例之一。他给出高通口径的数字:当前已有超过5亿辆新车具备AI能力;工业IoT有超过500亿设备交互;到2035年计划部署超100万台机器人,对应万亿美元级市场。汽车业务上,高通方案在路上行驶的汽车约5亿辆(部分与斑马合作)、驱动超9000万智能座舱、近五年发布400个新车型且多数在大中华区,座舱计算已迭代五代。

他的核心论点是「软件定义汽车」正在转向「AI定义汽车」,而高通的应对是统一平台:同一颗骁龙芯片可做座舱开发,可调整为ADAS设备,也可用Flex架构在同一IP上跑混合关键性任务——让座舱体验域与安全域共存。他把车与机器人放在同一条演进线上:车是物理AI真正规模化的首发场,机器人则从工业质检走向运输移动、灵巧操作、多智能体编队,最终进入家庭——这与车内自动驾驶的演进同构。架构上他借用人脑类比提出「三计算机」模型:System 2是大脑(深思,cerebrum),System 1是小脑(动作规划,cerebellum),System 0是神经系统(实时执行),三者异构协同才有高效的机器人或车辆行动。芯片层面,除与斑马的汽车版合作外,他介绍了面向工业的单芯片方案(转写为「Dragonfly Q10」,疑为Dragonwing系列,待核实):700+ TOPS NPU、18核CPU、支持40+传感器,单芯片覆盖三系统并可扩展。

王四通:博世给端AI泼的冷水与全域AI路线图

压轴的博世分享是全场最重要的反方视角。王四通所在的智能驾控事业部覆盖智驾、座舱、智能网联全品类软硬件,全球1.8万名员工。他说2026年拜访了中国几乎所有本土汽车品牌,500多场拜访集中在两个关键词上:全域AI与出海破界。

他先从智驾讲起,因为智驾比座舱更早经历AI上车。两个数据勾勒现状:今年上半年高阶智驾装车率已达35%;个别单一品牌的用户驾驶里程中智驾使用占比超过50%——供给与消费两端都真的起来了。他提炼的框架很干净:所有场景都有「够用了的算法门槛」,每种算法都有「用得起、性价比够高的算力门槛」;发展至今,智驾已是数据工程——拼的不是数量而是质量、配比乃至需求,世界模型将成为下一阶段必备要素。一段式端到端提供了基座但不够:手势识别、辨别残疾车位、通过声音和造型识别特种车辆并绕行,都需要对交通交互的「理解性」,需要更高层的决策大脑——很可能是VLA加世界模型的范式。对座舱的启发:智驾可以带动座舱发展,博世的高阶智驾方案与奇瑞的合作即在此列(他称获去年年度技术出行大奖,为中国首发一段式端到端,所用操作系统转写为「Unix」,疑为QNX,待核实)。

座舱AI被他划分为五个阶段,最值得注意的是他对节奏的判断。第一阶段是「漫长的小白鼠期」:座舱性能长期由CPU、GPU算力驱动,但GPU渲染需求已近上限,CPU则像手机一样按比例缓升——手机过去十年CPU需求翻了四到五倍,座舱大概率同趋势。第二阶段云端模型成为临时方案,但这里他泼了冷水:DDR等芯片大幅涨价,很可能让端侧AI明年的上车节奏反而滞后,「不会像今年讨论的这么波涛汹涌」。第三阶段,从家庭场景迁移来的应用会衍生出出行特有形态,他举「出行运筹」为例:用户要的不是导航到终点,而是综合杭州的酒店、高铁班次、昨晚今天的安排,判断该开车来、开到高铁站还是把车放家里——比车机点音乐问科普更刚需。第四阶段才是端侧模型真正上车,他点出三个云解决不了的点:隐私、与智驾联动的高实时性、车载特有的唤醒方式——家里是一个人对手机AI说话,车里是多人同时与同一套AI对话,这要求AI像会议主持人或高级助理,分得清什么要请示领导、什么自己就能办。第五阶段,AI先在软件层形成大模型,再落到舱驾融合的芯片上;智驾刚需会先把这个大模型带上车,再复用到座舱。

他还顺手拆掉了行业里一句流行语:都说车是「第三生活空间」,但仔细想未必——五年前十年前就说用车机点咖啡,到现在也没人真的用;而且家庭场景里要出多大事,才会让夫妻二人相隔不到三十厘米、清醒地严肃交谈两小时还不能离席?车首先还是出行工具。这个反例与蔡明「我的世界」的叙事形成了有意思的张力:一个要把车的AI做成生活管家,一个提醒别高估车作为生活空间的属性。

「全域AI」是王四通给出的终局判断:与传统电子电气架构相比,全域AI最标志性的变化是能自主迭代。他提出一套供探讨的架构思路:区域控制器降级为电源与接口分配,控制策略与AI算力全部上移至「大脑」,由大脑通过自主迭代与推理完成整车决策;智驾和座舱退化为「小脑」——具备固定AI算力的执行器,算力大小不过是十年与二十年老司机的区别。但成本约束立即跟上:考虑DDR与LVDS视频流的硬件成本,这个大脑很可能必须舱驾融在一起才能落地,否则太贵。他还强调AI大脑的分层正变得更复杂,必须拥抱生态——没有一家主机厂或零部件供应商能从最底层做到最上层。分工上他说得直白:博世懂车,硬件、执行层、为整车AI做最终防线兜底、端侧安全是底线;斑马是座舱行业的「黄埔军校」,更懂用户懂座舱,且具备AI工程能力——AI怎么做OTA、怎么快速迭代。

出海部分是时间上最近的一颗雷。他判断地缘政治会成为今年中国车企出海的最大挑战:从2027年开始,不仅有美国的一系列法规和长臂管辖,欧洲在中美之间摇摆且越来越倾向美国方向——网联安全法2.0、实体清单、AI Act(限制对人的情感捕捉的情感介入式AI,甚至限制高阶智驾功能)、以及对本土化的一系列要求。他给出三个博世踩过坑之后的答案:其一,全球化团队——L2智驾方案全球出货已超千万,新客户合计两百多个车型,团队分布在印度、巴西、德国、罗马尼亚,但负责人在中国,兼具中国效率与属地化落地;其二,尊重当地合规——与某车企(转写为「极客」,疑为极氪,待核实)合作落地欧洲第一个高速NOA并拿到全球首个E-NCAP 2026五星且分数最高,背后付出最大代价的不是算法而是工程化、数据安全的跨境合规、以及合规地把数据传回国内完成训练;其三,开放生态——与谷歌、高通及属地调研机构合作,让座舱在全球生根发芽。

值得注意的是,论坛议程公布的最后一场是圆桌「AI端智能,选择云模型还是端模型?」(斑马联席CEO郝飞、Rokid王俊杰、中兴微电子张效宇、机器之心赵云峰等),但转写文本在该时段对应的是博世王四通的演讲,圆桌内容不在本次素材覆盖范围内——这更可能是现场议程与线上发布版本的时间差,中段四位讲者(蔡明、肖睿哲、司罗、Ali Osman Ors)与议程完全一致。

行业机制链与读者启发

把四位讲者的内容串起来,可以提炼四条完整的传导链。

第一条:端模型能力跃升→成本结构反转→token经济成型。 变化是Auto Omni 2.0在复杂任务上达到十倍参数云模型的80%-90%(嘉宾称);直接原因是MoE架构与快速迭代(司罗自述三周内从不可演示到可演示);谁获益——车企把已经花掉的座舱芯片算力变成「token工厂」(司罗语),云token与流量成本大幅下降,用户获得隐私更安全的主动服务;二阶影响是商业模式从一次性license转向token运营与生态分成——这正是议程里「AI终端Token运营」的题中之义。观察指标:2026年端云一体架构的装车率、8397等平台车型放量、车企云成本曲线。对读者的启发:端侧AI的商业化拐点出现在「沉没算力成本」与「模型能力」的交叉点,判断任何端侧方案先看它能否让已有硬件增值。

第二条:上下文全量采集→Agent理解质变→隐私监管反弹。 信号是肖睿哲的五条采集路径(通知、IM接口、输入法、插件、云手机RPA);机制是上下文跨度与维度决定Agent回复能力(同样五个字天差地别);但二阶影响已经在发生——手机厂商抵制第三方实时屏幕分析、欧洲AI Act限制情感识别。肖睿哲的对策值得注意:第一现场数据、事件化召回、端侧处理、用户授权前置。观察指标:主流手机厂商上下文接口的开放度、情感计算相关监管案例。启发:上下文是新数据资产,但合规设计必须是架构前提而非事后补丁;「让AI住在你的数据里,而不是数据住在AI的云里」式的端侧路线正在获得工程支点。

第三条:智驾能力外溢→舱驾融合→但存储成本是隐藏节拍器。 变化是VLA与世界模型先为满足智驾刚需上车(王四通判断),随后经API互调走向模型融合、最终汇聚为单芯片「大脑-小脑」架构;但博世同时提醒DDR涨价可能让明年端侧AI上车节奏滞后——技术可行不等于商业可行。观察指标:舱驾单芯片方案的定点数量、DRAM价格曲线、35%高阶智驾装车率的爬坡速度。启发:评估AI功能落地时机时,把「算法门槛」和「用得起门槛」分开算——王四通这个双门槛框架适用于任何AI垂直场景。

第四条:出海地缘收紧→合规工程化→新护城河。 2027年起网联安全法2.0、实体清单、AI Act相继落地;直接后果是数据跨境训练成本剧增——极氪案例中最大代价是合规而非算法;传导出的组织形态是「中国团队+全球交付」(印度、巴西、德国、罗马尼亚团队、负责人在华),这正与斑马开场片「两百余车型、全球化团队」的收尾呼应。观察指标:E-NCAP 2026五星榜单、2027年各项法规的实际落地节奏。启发:对智能汽车产业链,合规工程化能力正在取代纯技术能力成为出海的核心竞争力;个人层面,「懂汽车+懂AI+懂欧盟法规」的复合背景会是稀缺组合。

回到论坛本身:蔡明说「理解我的世界是AI发展的必然」,王四通说车未必是生活空间、端AI明年未必汹涌——两句不矛盾,恰好构成理解端上AI的坐标系:方向由前者定义,节奏由后者校准。对普通用户,2026年最实际的变化是,车里的AI开始知道你是谁、昨天去了哪、明天要干什么——它用84条消息里挑出的那两条来证明;而它有多懂你,取决于你愿意把多少「车外23小时」交给它。

(注:本文事实与数字均出自论坛现场转写,标注「嘉宾称/主持人称/节目称」的为现场陈述,未经独立核实;ASR存疑处已以「转写为X,疑为Y」标明,共修正人名、机构名10处:易道智能→驿道智能、肖瑞泽→肖睿哲、斯罗→司罗、吴永明→吴泳铭、Ali Osman Ours→Ali Osman Ors、ROKI易道智能→Rokid与驿道智能、中芯微→中兴微电子、上海文→上下文、A静姐/A经理→Agent、彩云老师→蔡明老师。)