先说结论
这场名为「空间智能·AI生万物」的高德技术峰会(云栖2026,9月下旬,杭州国际博览中心),表面是一场产品发布会,实际是一场关于「AI进入物理世界之后,稀缺性变成了什么」的论证。高德董事长刘振飞给出的判断是:大语言模型解决了机器如何理解知识,空间智能要解决机器如何理解物理世界——后者需要三维空间表达、动态感知、时空推演三项能力叠加,AI才会「从会说走向会做」。高德为此交出的硬件答卷是全空间无人体系(宣布全国已有超过十座城市落地,现场七城代表共同启动)和 ABot 全栈具身技术体系;但紧接着的圆桌把浪漫叙事拉回了成本表:境跃科技创始人周训飞用顺丰的教训说明,在物理世界,决策错误的纠错成本是一票十元,一个百分点的错误率乘上每天三千万票,就是每天三百万元的真金白银——可靠性比传统运营方式差零点一个点,「就不具备规模化的条件」。一边是分钟级生成三维城市的世界模型,一边是百分之二十的客户降本门槛和百分之三十的车辆利用率,这场峰会最有价值的地方,恰恰是它把这两张账本同时摊开了。
「验收即巅峰」:城市智能为什么需要换一种活法
峰会的故事从一句不太客气的话开始。高德副总裁、高德云图总经理董振宁在主题演讲里说,杭州是中国城市大脑的发源地,城市每天在变,但很多建起来的智能系统「从验收的那一天起,就再也没有变过」。这句吐槽指向智慧城市投资里最大的隐性浪费:系统在交付时刻达到能力巅峰,之后随着城市变化持续折旧。他由此引出本场的关键词——城市的自主进化,并把城市智能的发展概括为四级台阶:数字化解决「城市可见」,把道路楼宇变成数据;在线化和智能化解决「城市可知」,数据实时回传、跨部门协同;而下一步是自主进化,即「让城市的经验逐步迭代成城市的能力」(董振宁演讲口径,框架源自其团队,其中数字化/在线化/智能化的提法他归功于前高管俞永福多年的总结)。
为什么是现在?董振宁给出三条外部依据:AI已进入物理世界(他举李飞飞 World Labs 和 GPT-6 在三维生成重建上的跃迁为例);智能体从理解判断走向工具调用与真实行动;AI开始参与下一代 AI 研发——他引用称某前沿实验室的 Claude 已主导公司约26%的 AI 研发(七个月前不足1%),OpenAI 披露其智能体运行时间已达人类研究员的3.1倍(以上均为演讲引用的第三方口径,且转写存在疑似误差,数字保留嘉宾原述)。笔者认为这个「为什么是现在」的论证结构比结论本身更值得注意:它不是在说高德的技术变强了,而是在说外部条件齐了——理解环境、参与行动、帮助改进三条线第一次能拼成一个循环。
地方政府的表态印证了这种政企合拍。杭州市委常委、萧山区委书记孙旭东在致辞中报出三个「第一次」:云栖大会主会场第一次跨过钱塘江设在萧山、云栖与数贸会第一次同频召开、高德技术峰会第一次落子萧山。他给出的落地数字包括:高德云信信控平台在萧山覆盖全区1260个红绿灯路口、3600余个路段的实时分析,产出130条滤波方案,主干道平均通行速度提高6.3%,拥堵报警率下降6%;联动中国安全生产科学研究院的「鹰眼守护」系统实现二十余类交通风险的超距感知与秒级预警(以上均为致辞口径,未经独立核验)。更实质的一条信息是:阿里巴巴集团已批准高德、阿里云与杭州萧山国资的合作协议,共建「杭州市综合立体交通人工智能中试基地」,在交通部、浙江省和杭州市支持下开展综合交通出行、拥堵治理和无人物流等场景探索。笔者推断,「中试基地」这个措辞值得玩味——它意味着城市 AI 的组织形态正在从「项目招投标」转向「合资共建+持续中试」,能力的产权和养护责任第一次被摆到台面上。
三项能力与一个底座:高德把「理解世界」拆成了什么
刘振飞的致辞承担了定义工作。他认为 AI 从数字世界走向物理世界后,缺的不是内容和答案,而是「理解真实世界的能力」,具体拆成三项:三维空间表达(高度、深度、距离、层次与连接关系)、动态感知(现实变化的数据持续进入模型)、时空推演(把行动放进具体的空间条件和时间约束中实时计算)。他重申了去年提出的目标——让空间智能像云计算一样成为三百六十行与物理世界交互的标配——并明确高德的分工:「负责处理物理世界的复杂性,让合作伙伴专注于自己的创新」「我们不替别的行业定义答案」。他用一组数字佐证这个底座的体量:高德自称是北斗系统全球最大的民用系统,今年春运峰值单日处理定位量嘉宾口述为「一万亿亿次」(转写疑似口误,应为万亿量级),当日导航总里程超过九十亿公里,相当于地月往返约一万一千次。
董振宁的演讲则把底座落成产品。全空间无人体系里的「全空间」指空地一体、室内外一体,未来加上地面地下一体;「无人」指无人机、无人车、具身机器人共用同一套空间数据底座。支撑体系的是三个核心产品(产品名来自现场转写,官方拼写待核):「云镜」是可成长的数字底座,含两种重建能力——还原式重建(ABot-Earth,以真实世界为参照,转写称可还原全球四百多个海外城市街区)和生成式重建(ABot-World,一句话生成可漫游、遵循物理约束的交互世界,让 AI 先在虚拟世界见识场景、减少真实试错);「云睿」是时空智能平台,把空间智能底座与行业知识结合生成「数字分身」,董振宁称已生成七类行业智能体(含杭州在用的交通智能体「杭小通」),开放56项以上 MCP 服务,并与千问办公、百炼等智能体开发平台打通;第三个就是 ABot,负责「让 AI 走进真实世界」。分工机制说得相当清楚:政府统筹场景开放、安全治理和运行保障,高德在数据授权之下做能力共享,合作伙伴接入专业能力并带回真实需求——「能力从来不是一次交付出来的,而是城市、平台、合作伙伴一起共同养成的」。
这段叙事的机制核心是董振宁结尾的「两个飞轮」:能力进化飞轮(城市运行产生新问题→沉淀经验→学习验证→形成能力→回到现场检验→再产生新经验)与生态协作飞轮(平台开放数据工具接口→伙伴建场景→场景多则经验多→经验多则能力强)。他把整场演讲压缩成一句话:让昨天解决过的问题成为今天的能力,让今天的能力去解决明天的问题。笔者提醒一句,这套框架的成立前提是「运行数据真的能回流」,而数据授权边界、安全治理和商业分成恰恰是现场没有展开的部分——两位政府官员(交通运输部科技司副司长龚永军、公安部科信局处长焦强,人名以转写为准)的出席暗示监管在场,但规则细节缺席。这是整套故事最大的未答之问。
ABot 全栈:让机器人在仿真里长大,再进物理世界
议程中最硬核的一段来自高德 ABot 系列技术负责人徐牧(转写误作「徐木」,据官方议程校正),讲题「ABot:面向物理 AGI 的全栈技术体系」。他把 AI 能力演进概括为四个叠加而非替代的阶段——感知智能、生成式智能、智能体智能、物理智能——并把物理智能拆成三个相互耦合的问题:世界如何构建、行动如何生成、能力如何进化。ABot 的布局正是按这个闭环铺开的:世界模型侧,ABot-World 面向通用可交互世界生成,ABot-Earth 面向城市尺度原生三维建模;行动模型侧,ABot-N1 做视觉语言条件下的导航,ABot-M0.5 统一机器人移动与机械臂操作;智能体侧,ABot-ER 提供具身理解与推理,ABot Agent OS 把模型、记忆、技能、任务组织成可长期运行的 Harness。
徐牧对世界模型的判断是全场最有信息量的技术观点之一:下一代世界模型的竞争「不再局限于单帧或短视频的生成质量,而在于是否建立统一的世界状态表示,并在动作条件约束下完成可控的状态转移」——几何、时序、动作和任务目标要进入同一表征空间,同时服务于渲染、预测、规划和行动,才配称 Unified World Model。ABot-Earth 交出的指标(均为讲者口径,部分已获官方渠道佐证):覆盖全球一百九十多个国家和地区,单张卫星图即可生成实景三维城市,分钟级完成,结果可无缝接入 UE 和 Unity 引擎。笔者核验:高德今年6月发布的 ABot-Earth0.5 官方通稿与 arXiv 论文(2606.09967)确认了「全球首个3D原生城市世界模型」「190+国家覆盖」「10分钟生成公里级3D城市、制图成本约为传统方式百分之一」等说法,与峰会口径一致。
两个行动模型的架构值得细看。ABot-N1 用异步快慢系统连接语言理解与实时控制:快系统(System 1)把视觉观测与语言指令编码为 token 送入多模态 Transformer,经 QFormer/MLP 动作头预测未来多步轨迹点;慢系统(System 2)整合更长上下文生成目标与可通行区域的语义引导,异步缓存传导给快系统——高层推理给方向,局部控制持续响应变化。徐牧称一个模型覆盖指令、物体、点位、POI 导航和行人跟随五类任务,在九个权威评测中八项超过业界最好结果(笔者核验:ABot-N1 官方页面口径为五类范式七个基准全面 SOTA,室内外场景成功率95.4%/92.9%,POI 到达率提升35个百分点至77.3%;其中 SocialNav 工作2026年7月入选 CVPR 2026 Best Paper Candidate,与峰会所说「CVPR Best Paper 候选」相符——两处口径略有出入,并列存疑)。ABot-M0.5 则把「未来世界的变化」与「机器人的动作」放进同一个模型联合预测:世界分支预测环境如何变化,动作分支生成移动与操作的控制序列,核心是 D-MoT 架构(Dual-level Mixture-of-Transformers,转写误作「DMOT」),用共享注意力让世界与动作信息交互、又保留各自的专用输出头。徐牧称其在 RoboCasa365、RoboTwin 2.0、LIBERO、LIBERO-Plus 四个基准上达到行业领先(笔者核验:GitHub 开源仓库确认这些基准上的 SOTA 结果,如 RoboCasa365 从前 SOTA 36.0 提到46.6)。
更值得关注的是自进化的工程化表述。徐牧承认,一次执行失败的原因可能来自模型理解、记忆缺失、技能覆盖不足或任务编排不合理,因此自进化「不是一个单一的训练动作」,而是四条更新路径各管一段:Model 路径做诊断-数据合成-训练-评测把关;Memory 路径沉淀任务与场景经验并通过索引检索清理保持可用;Skill 路径从成功轨迹中抽象可复用技能形成技能图(转写误作「Scale 路径」,据上下文与公开材料校正);Harness 路径优化路由监控与反馈。他称 ABot-ER 在具身评测榜(转写「In Body Arena」,疑为 Embodied Arena)取得综合与核心能力双第一,Agent OS 在五项跨模态长程记忆基准均第一(自家体系参评自家口径,权威性留待独立验证)。这套「先归因、再更新、评测确认」的方法论,笔者认为其可迁移性超出机器人行业:任何在线学习系统(推荐、风控、代码Agent)都会遇到「失败原因分层归因」的问题,ABot 把它做成了显式工程。
末端五十米与20%门槛:无人配送的商业账比技术账难算
如果说前半场是高德的时间,后半场的圆桌「AI 驱动供应链进化:无人配送重塑城市物流」则贡献了整场峰会最诚实的三张账本。主持人高德云图物流行业负责人张林把议题定得准确:无人配送如何从「一台车、一条路线」进入城市里可监控、可调度、可被监管的完整网络。三位嘉宾的视角刚好互补:罗戈研究院院长潘永刚做行业洞察,行深智能创始人安向京(转写误作「平升智能」,据议程与官网校正)代表无人车厂商,境跃科技创始人周训飞(转写误作「周俊飞/静越科技」)做城市无人物流运营——他的履历本身就代表了人才流向:在高德做了八年技术,在顺丰做了八年并创立两家物流科技公司,如今基于高德世界模型做城市无人物流运营平台。
潘永刚先划了分水岭:技术上「把货从A点运到B点」已经不是问题,行业内路上跑着的无人配送车「有几万台」(嘉宾估算),真正的门槛是企业级交付的履约能力——收发货、转运装卸、在途管理、异常处理、单据与信息共享的全流程。他提出的判断标准很具体:什么时候无人配送这种服务形态在货主订单中的占比超过10%,它才算真的成为行业不可或缺的基础能力。笔者注意到这个度量方式的换轨:行业惯用「车辆数」讲故事,而订单渗透率才对应真实的商业存在感。
周训飞的三张账本是全场密度最高的部分。第一张是成本账:无人车只解决了「运」这一个环节,交接成本可能不降反升——他举例,工业场景里叉车装四米二的大货车很容易,无人车变小后衔接部分成本变高;生鲜行业原来的司机兼有交接和验收职能,无人化之后这些活谁来干?第二张是可靠性账,来自他在顺丰的亲身教训:他带队上线的分拣机器人调度服务准确率98.4%,被顺丰管理层拿人工98.5%的准确率对比批评——一票快递决策错误的纠错成本是十元,按每天三千万票、百分之一错误率算,一天就是三百万元的损失外加客户投诉。「实体产业的运营和数字化世界有个本质区别:决策错误会带来额外的线下成本。」他由此给出一句可以裱起来的标准:无人车和具身智能的可靠性哪怕只比传统运营方式差零点一个点,都不具备规模化条件。第三张是结构账:物流订单约80%来自B端,而任何单一B端客户都养不起一辆无人车——他正在做中国邮政的无人车运营变革,邮政一天只发两个班次,车辆利用率只有30%,剩下70%在闲置;出路是把多个客户、多个行业的订单拼起来,把利用率做到70%。而商业上的生死线是:从有人车切到无人车,客户的总成本降不了20%,这个切换基本不会发生——「原来一个月一百万物流成本,你八十万接过来,这个变革就会很顺畅;低于20%,人家对新事物的接受程度还是很怀疑。」此外他补了两组行业实感:接管率行业宣传1:50、实际都没做到(何时能到1:50乃至1:100是真实瓶颈);高精地图采图上线周期约一周,何时轻图化决定扩张速度。政策面他点出路权、安全、拥堵之外「更致命的灵魂拷问」——就业:如果只把人替换掉而不创造新就业,「国家都不会支持这个产业的发展」。
安向京的回应提供了供给侧解法。他的技术路线是高精地图→轻图→无图(与高德合作的无图导航方案已上线,新城新线路「开箱即用、无感部署」),而更大的主张在架构:末端五十米里,开放道路轮式车效率最高,小区楼宇上楼人行道则是足式机器人效率最高,所以行深智能提出 ABA+CX 架构——ABA 是与行业无关的共享运力底盘,CX 是封装行业属性的「原子集装箱」,可以是笼车、便利零售柜,甚至高德的导盲机器狗「图图」。这个设计的现实针对性极强:送快递的车不能送生鲜,送生鲜的不能送药品,送药品的不能送烟草,垂类监管要求导致「一行业一种车型、甚至一用户一个车型」。他把这上升到历史类比——集装箱的发明是人类历史上运输和需求的第一次分离,ABA+CX 想做AI时代的第二次分离:软件上业务调度与运力调度彻底解耦,用户只跟业务调度打交道,运力侧实现「箱箱打车」,运力系统才能无差别地看待所有需求。潘永刚从评价体系侧补充:设备厂商、运力运营商、物流服务商是三个关注点不同的群体(场景适配、资产利用率、订单级履约),物流场景里一单拆多单、多单合一单交错组织,「你只需要找到设备和包装级别相适应的场景就已经很好了——能高效、能满载、多拉快跑」。这句朴素的表述笔者认为是对「通用无人配送」叙事的最好解毒剂:没有通用解,只有场景-载具匹配解。
周训飞还给出了一段对世界模型的三个期待,恰好把圆桌与前半场的技术叙事缝合起来:其一,未来所有无人车和具身应该先在世界模型里仿真训练达标再上路,「在仿真世界都达不到指标要求,你不应该上,因为物理世界犯错的代价太大」;其二,物流规划——他在顺丰的经验是下单后一百毫秒内就要依赖高德 LBS 决定小哥何时上门、走哪条路、何时装哪辆车、赶哪趟航班、北京端何时派送,决策越提前资源投放越精准;其三,实时调度与异常处理,依赖实时交通数据与事件模型。结尾展望时他报出行业体量——物流占GDP约13.9%、超二十万亿市场规模——并留下一句阿玛拉定律式的提醒:「我们经常对技术变革的一年周期太乐观,对它十年带来的结果太悲观。」能穿越周期的企业,是「持续不被资本绑架、不被KPI困扰,持续为客户创造增量价值」的企业。
谁来养城市的能力:颁奖名单里的生态版图与未答之问
峰会的收尾是两份名单。第一份是全空间无人体系城市启动名单:杭州、常州、彭州、福建德化、深圳龙岗、阳江、南京鼓楼滨江七地代表上台(官员姓名以转写为准);董振宁介绍的两个样板中,彭州拥有九百公里以上自主飞行空域、是全国无人机演练和能力积累最靠前的城市之一,常州则以无人物流为全无人体系的突破口(嘉宾口径)。第二份是智能运营伙伴获奖名单(公司名以转写为准):数字运营创新实践奖给了中国电信武汉分公司、中国移动重庆公司、中信科移动、北京顺和通达;交通治理先锋奖给了北京万极科技;城市全空间无人体系共创奖给了数梦时空智联、广东恒勤、四川祥恒智航、南京天宇;零售消费类「先锋实践奖」(转写疑为「智慧商业」类)集中给了联合利华、海尔、百威、瑞幸、伊利、华润饮料、霸王茶姬、茶颜悦色;智驾新范式奖给了长沙行深智能、上海易博图、苏州智加;智慧物流奖给了申通快递。笔者认为这份名单比任何演讲都直观地展示了高德空间智能的生态版图:电信运营商(数据与网络)、地方政府平台、零售品牌(场景需求)、智驾公司(运力供给)、快递企业(履约网络)——高德站在中间做「空间参照系」。主持人马震(高德云图,人名转写疑似)的收束语与开幕呼应:云栖2026的主题是「知以致用」,创新成果要走进企业业务才算数。
把整场峰会压回一条主线,笔者认为可以用三根链条概括,每根都值得读者带走观察指标。其一,世界模型链:ABot-Earth 把三维城市生成成本压到传统方式的约百分之一、效率提升约千倍(官方通稿口径),直接后果是无人装备可以在仿真环境里先训练达标再上路(周训飞:「仿真里达不到指标就不该上」),二阶影响是机器人训练的试错成本数量级下降、低空与无图区域从「无图可用」变为「有图可依」——观察指标是仿真到实测的迁移率和3DGS资产成本曲线,它们决定具身智能的数据供给节奏。其二,共享运力链:单一B端客户车辆利用率仅30%的现实,倒逼出 ABA+CX 的硬件解耦与「箱箱打车」的调度解耦,二阶影响是商业模式从卖车、租车走向卖运力,资产持有结构与司机岗位结构随之重构,而就业与路权政策成为时间表上最大的变量——观察指标是满载率和单到单降本幅度能否同时过线(20%),而不是接管率。其三,城市养成链:「验收即巅峰」的浪费,被「数据授权+平台开放(56项以上MCP)+两个飞轮」的组合替代,二阶影响是政府与供应商的关系从一次性集成转向长期共养(萧山中试基地是组织载体),风险则在于数据授权边界与安全治理规则尚未成文——观察指标是一个城市有没有把运行数据回流成能力的产权与机制安排。
峰会没有回答的问题同样清晰:云镜、云睿等平台产品的定价与数据分成机制未披露;自动驾驶公司、图商与城市国资之间的权责在「中试基地」里如何切分尚无细则;圆桌上被点到名的就业问题,只有提问没有方案。AI从「会说」走向「会做」的路上,模型能力的竞争或许正在让位于另一场更缓慢的竞争——谁先把物理世界的错误成本、履约流程和政策约束变成自己系统的一部分。空间智能能不能像云计算一样成为创新的基石而非门槛,刘振飞自己说得最诚实:「生态从来不是某家公司宣布出来的,而是一个产业共同使用出来的。」(本文事实与数字均出自论坛转写与嘉宾口径,转写疑似错误已按议程和公开资料校正并标注,未经独立核验处已逐一注明。)