先说结论
第一,Agent的瓶颈已经从「模型够不够聪明」转移到「开发—运行—评测—进化」的全链路基础设施,阿里云用Agent Studio全栈服务平台和它的硬件版Agent Studio for Hardware把这条链路一次性摆上了货架。第二,端侧是第二主战场:千问端侧模型、高通的异构计算架构、英伟达的边缘推理引擎三方合围,让Agent真正跑进手机、座舱、玩具和机器人。第三,客户的账本很朴素——保险、企业知识库、IoT平台的实践都指向同一个兑现点:从「答得准」到「办得成」,护栏与知识运营比模型调用更决定成败。第四,也是最诚实的一课:平台给的是能力,确定性最终是一群OPC(One-Person Company,一人公司)构建者在法律、财税、短视频等真实场景里,用一笔笔付费反馈「反推」出来的。全栈平台解决共性问题,真实场景解决个性问题,两者缺一不可。
一、把「框架选择」变成「能力清单」:Agent Studio的主张
本场由一位AI数字人主持开场,报幕点名「企业级Agent基础设施加速业务转型与落地」分论坛,并预告Agent Studio与Agent Studio for Hardware两场发布——这个安排本身就在宣示主题:Agent正从演示走向规模化生产,从云端走向端侧,从单点工具走向基础设施。
阿里云MaaS业务线Agent平台产品总监徐志远上台的第一件事不是介绍产品,而是列问题。模型更新越来越快,千问、开源、闭源乃至做单点决策的小模型层出不穷,「我们的agent、我们的harness、我们的上下文,能不能跟得上」?正在用的模型效果不错,忽然因为版本更迭要下架,怎么办?他的拆解是「agent约等于model加harness加context」,而业务语义的统一要靠「本体」(ontology)——用一个东西把不同业务里同一个产品概念的表达对齐,模型才能建立关系、做好处理。衡量价值时,「对错不重要,重要的是原因」:错在工具、描述、上下文太长还是模型丢失?要看全链路日志里的根因,再谈优化。他提到主论坛发布的「智能密度」公式(嘉宾称):整体价值由单token价值、token速度与任务价值共同决定——从模型到agent,是一个把token价值放大的过程。
这套判断落到平台上,就是一张能力清单。开发范式上,CLI、低代码画布、ADK都被支持;运行时上,企业级Agent要求在高并发、长程任务下,沙箱能毫秒级拉起——平台预先预热好沙箱池,「把离散的资源集中化,再隔离出来给每一个agent的运行者」——并支持任务断点自恢复;工具层打通了100多个MCP生态,用One Key机制免掉为每个MCP单独申请鉴权的麻烦,另有Auto MCP用模型做智能路由;评测与进化层面,自进化引擎按「观测→评测→归因→优化」的闭环建设,配套的资产化引擎(转写作「资金化」,疑似)预计四季度发布。外部报道显示,该平台提供50多个原子API,并随9月云栖主论坛的千问AI平台升级一并亮相。
两个细节值得记住。一是Agent API:官方明确它「不是对既有开发方式的替代,而是平行的新范式」——像调用模型一样,把需求、工具、环境在这一次请求里传进去,瞬间拉起沙箱、调用完直接给结果,用完即销毁、不做留存,十月正式推出。二是知识层的三类记忆:事实记忆记事实信息,特征记忆记用户画像,技能记忆记「可复用的经验路径」——基于用户使用日志对技能路径多次更新,既省token、降响应时间,又支撑自进化。徐志远还提醒了一个常被忽视的环节:很多RAG效果差,不是知识库建得差,「一开始解析PDF的时候这张图丢了、处理视频时这个帧抽错了,非常正常」——解析决定下限。面向个人开发者,百炼的Token Plan(转写作Talk Plan,经核验为百炼订阅套餐)对除模型外的Harness相关服务提供88折。
本节的机制→影响→启发链:沙箱预热池+断点自恢复+One Key统一鉴权(机制)→企业把Agent从demo推向百并发、几万TPM生产环境的迁移成本大幅下降(影响)→选Agent平台时先看运行时与鉴权链路的完整度,而不是模型清单的长度(启发)。
二、Agent定义硬件:一次性越过六座山
第二场发布的主角是硬件。阿里云司红江(转写作「司洪江」,按议程校正)先画出硬件智能化的三代范式:2020年以前是规则时代,智能是写死的,玩具播一段预置音频、音箱听懂一百句固定指令词,「AI只是硬件上的一个feature,不是主角」;2022年底ChatGPT火了之后到2025年,是大模型组装时代,硬件公司自己选模型、接语音、搭RAG、写agent脚手架、做端云协同,「每一个硬件公司都在重复造轮子,模型一换重新对接,芯片一换固件重写」;2026年以后进入第三代「Agent定义硬件」——不是先造硬件再往里塞AI,而是先定义一类agent,再决定硬件长什么样:能记住孩子情绪的玩具,本质是陪伴agent;看得懂菜单、能翻译的眼镜,本质是视觉agent。
他的判断是:90%的硬件agent项目都卡在六座山里(嘉宾称)。能力供给之山——模型、语音、视觉、知识库分散在不同供应商,一个环节掉链子整个体验就塌;端云协同之山——哪些在云、哪些在端,每次做产品重新决策,选错返工几个月,「这些共性边界问题本应由平台回答,现在却由每个行业的朋友重复承重」;实时链路之山——从语音唤醒到回包的跨端云时延,「用户不会等一个只会转圈圈的玩具」;硬件适配之山——为主控芯片调好的agent换个平台从头再来;工具链之山——云端是Python、Java、Docker、微服务,硬件端是Arduino和烧录器,两个团队人肉联调;出厂后运营之山——商业化鉴权、计费、观测、OTA升级,「Agent跑出来之后怎么收钱、怎么管、怎么升级?很多硬件团队走到这一步才发现没有标准答案」。这六座山「从头到尾都不是在讲AI能力够不够,本质是先进AI能力到硬件产品之间缺少一条转化通道」。Agent Studio for Hardware要做的正是这条通道:开发者只需描述需要什么样的硬件agent,平台把需求转化为能跑在具体设备上的agent——从一句话需求到真机点亮。
产品经理张栌兮(转写作「张露西」,按议程校正)展开全景。对话级开发四步走:输入一句话或一篇文档;「产品方案专家」产出云端agent方案与端云协同方案——以「给怕黑孩子的讲故事玩具」为例,涉及指令怎么定义、什么时候触发、长期记忆该记什么字段、什么场景召回用于安抚;然后是仿真验证(不需要真板子,在平台里模拟麦克风、摄像头、屏幕交互)与真机调试(日志回传平台,coding agent协助定位问题)。除对话式开发外,低代码工作流与CLI并存,CLI打包了全双工/半双工语音、实时视频、知识、记忆等硬件特有能力。三套开箱方案覆盖消费电子智能硬件交互、AI座舱与千问端模型,开发者「从八十分的基础上开始调优,而不是从零做on-device agent」;三种交付模式(纯云、端云协同、纯端)适配不同功耗与隐私要求;量产侧有设备群管理、托管运行、灵活计量计费、可观测四件套。生态上已联合三方厂商预适配30多款芯片平台和开发板,「接上就能跑」,标杆案例是乐森机器人与雷鸟眼镜。
芯片伙伴博流智能研发总监陈磊的视角更底层。过去芯片公司交付SDK、开发板、参考设计、兼容性测试报告,工程师一个个学;现在博流把这些资料全部「wiki化」,变成AI agent读得懂、能召回的知识,「不只是文档,而是AI agent能理解的逻辑」。他们的BL616CL芯片(官网可查的BL616系列为320MHz RISC-V、Wi-Fi 6+蓝牙5.3组合)已接入千问大模型提供turnkey方案;新的端侧产品BL618DG用双核架构把小型传统语音模型做前级、多模态大模型做后级,配双屏,官方称功耗比上一代降低约50%。他把合作价值总结为两个字加两个字:「更快」,还有「更稳」——开发只是硬件生命周期很小的一环,复用让技术稳定性沉淀下来。
本节的机制→影响→启发链:芯片厂商把SDK与文档wiki化为机器可读、可召回的知识(机制)→硬件agent开发从「人肉联调」压缩到一条对话式工具链,低配硬件也能上电即跑(影响)→供应链的竞争维度正从芯片参数转向「知识供给的可检索性」(启发)。
三、端侧三国:千问模型、高通架构、英伟达引擎
「如何把模型跑在设备上」是陶永亮(阿里云高级算法专家)的命题。千问家族六个分类:语言模型(最新千问3.8-Max,0902版本据嘉宾称在全球agent榜单排到第二);全模态Omni(「四进两出」:语音、文本、视频、图像输入,音频与文本输出);Voice(千问Audio 3.0,3.1版本陆续发布);Image(3.0升级到3.1,支持4.5K token输入的复杂图文生成,「可以生成以假乱真的截图、UI」);面向具身智能的Robot Suite(含VLA等);以及创新孵化线——Happy Oyster世界模型、Happy Shrimp音乐生成(「虾米音乐又回来了」)、MyUI交互模型、Agent World、千问Scope。PPT上标绿色的是已在终端芯片跑通的模型,包括小尺寸的千问3.5-Flash-Mobile与Fun-ASR、Fun-Conversant等ASR/TTS模型。
架构上的关键动作,是把原本占四分之一层的full attention换成QSA(Qwen稀疏注意力,千问3.8-Flash-Next架构,千问四将沿用)——这与Qwen3-Next公开的Gated DeltaNet+Gated Attention混合架构相互印证(写作者按外部资料比对)。新发布的千问3.8-Omni-Flash中,DPU负责长程记忆、QSA负责快速查找,n-gram embedding以短语为单位查表,比token级快几倍;空间音频升级后,单个声源即可判断方位与距离——做「根据说话方向转头」的设备不再需要双声源定位;1M全模态上下文意味着「一部电影丢进去,分析男三号在哪些场景出现、有什么变化」。嘉宾称其在主流全模态评测集上比上代提升25%,具体benchmark后续公开。
端侧部署被整理成TDIA四阶段(训练Training-部署Deployment-推理Inference-应用Application,转写作TIA/TDA,写作者按语境推断):训练支持LoRA/SFT/RL并规划on-policy蒸馏(转写疑似);部署量化从DDQ/EWQ走向QAT(转写作KAT,疑似),方向是泛化任务3bit、垂直任务1.5bit,让非旗舰手机芯片也能跑2bit模型——这一步与高通、NVIDIA联合推进;推理加速的目标是在4bit量化模型上把加速比提到5倍左右。案例侧:与ARM合作的高精度语音输出,解决「669欧被读成六六十九」、序号与断句错误这类朴素但致命的问题;与高通合作智能座舱;与NVIDIA合作头部三家具身智能企业(以千问3.5-Omni-Flash为主做全双工语音、环境事件感知与VLA运动操作);现场演示的全双工语音交互支持实时打断、对咳嗽笑声不介入,且全程端侧离线运行。
高通的刘思杰(议程头衔:全球AI产品技术生态总经理)给出「智能体四大基础模块」框架:感知(像五官持续采集多模态数据)、推理(思维链分解目标,先思考再行动)、工具(自主调用搜索、应用访问、代码执行)、记忆(向量数据库与上下文窗口记住偏好与历史)。完整的智能体体验需要云端与终端协同:「云端负责深度思考,终端负责贴身服务。」支撑它的计算架构四件套里,传感器中枢被她称为智能体的「潜意识层」——以极低功耗24小时感知情境、在端侧自主构建个人知识图谱,不需要唤醒主芯片;NPU是AI算力核心(更多标量与向量加速器、更高性能张量加速器、64位内存架构、INT4与FP8精度格式);CPU是总指挥,负责调度、流程编排、工具调用与系统协调;调制解调器是端云桥梁,以5G等高速连接保证低时延高可靠通信,让分层推理与跨设备协同成为可能。这套构成即高通AI引擎(Hexagon NPU+Oryon CPU+Adreno GPU+Sensing Hub,与高通官方资料一致),再叠加「统一路线图」:一套IP组合从高复杂度的汽车覆盖到低复杂度的耳机手表,「一次投入,多领域受益」。
英伟达的柴林(议程名Lin Chai,TensorRT推理引擎产品经理)解释了为什么嵌入式端侧必须单独造引擎:延迟是物理约束,高速变道的汽车等不起数据上云再下云,「提高网速解决不了」;隧道、矿井、无网络覆盖的手术室要求零依赖;车内对话、病人影像、工厂生产数据受国内法规与欧洲数据保护条例约束,不能出设备;嵌入式平台的内存与算力和数据中心显卡完全不在一个量级。她给出三个已量产的场景:智能座舱里千问ASR→大模型→TTS的全链路端到端延迟不超过200毫秒(「空调调高两度,顺便找最近的加油站」);工厂机械臂用VLA模型看懂零件、听懂指令、直接生成动作序列;以及她上周带宝宝看眼科的亲身经历——医生用AI辅助系统实时录制医患对话、生成病历,并用一个轻量的LoRA在心外、内科、外科之间切换。千问与TensorRT-LLM的协同做到了「Day Zero支持」:千问3.6-27B发布当天即可开箱使用(嘉宾称)。性能数据(嘉宾称):千问3-0.6B每秒跑出1569个词元,3-8B每秒283个,3-30B每秒253个;开启投机解码后再提升4.5到5倍,「改一个参数即用」。自研NVFP4低精度量化在保持精度的前提下极致提升性能与吞吐、缓存减半(NVIDIA官方文档:NVFP4相较FP16内存约省3.5倍,精度损失通常小于1%)。
本节的机制→影响→启发链:稀疏注意力、低比特量化、投机解码三线并进(机制)→端侧可承载的模型尺寸与速度门槛快速下移,非旗舰芯片也能跑全模态交互(影响)→做端侧产品应按「芯片×模型×引擎」三方兼容矩阵选型,而不是单看模型榜单(启发)。
四、客户账本:从答得准,到办得成
友邦人寿云计算部门负责人陈斌的分享,几乎是一份金融业AI落地的方法论。保险是超长业务链:一张保单服务客户很多年,从投保、核保到查询、变更、理赔,每一步都涉及大量岗位与系统,而业务结论直接关系客户利益,「必须准确、可解释、可追溯」。所以AI要从对话走向行动,但行动是「在清晰的边界内调用被允许的能力,并不是让模型自行决定」——这是企业应用与科研探索最大的不同。四条护栏:权限(谁能看什么数据、调什么服务)、规则(业务约束与内容合规进入执行流程)、监控(所有调用可追踪)、人工介入(核保、理赔、投诉的关键结论必须由有权限的岗位确认)。落地按三步演进:面向营销员的知识问答与智能演练(AI扮演客户做语音对练、检测话术、暴露团队能力短板)已上线稳定运行,页面问答准确率超过九成;智能坐席处于POC验证(坐席一边听客户说话,AI一边自动写小结、填工单、整理投诉报告);面向客户的智能助理即将内测——因为监管对to C的AI应用有额外的审批流程。他反复强调一个经验:知识运营比单次模型调用更重要——资料的格式化管理、领域专家的测试审批、按一线反馈持续调整,最终沉淀成意图、知识、业务接入与评测的共性底座,「新场景进来是在现有能力上组合,而不是每次从头开发」。
阿里云内部的「产品博士」是另一面镜子。技术内容总监毛军介绍,阿里云几百款产品构成庞大的知识体系,2023年基于百炼建成智能知识平台,如今已是内部流量最大的AI应用(嘉宾称)。方法论一句话:知识治理决定下限,平台能力决定上限。内部资料里,PPT、PDF类常规文档只占三分之二,剩下三分之一是功能对比表、产品定价表、架构大图、演示视频与课程视频——现在全模态直接入库,无需预处理。检索从「纯文档单库单轮」升级为「全模态多库多轮」:小而精的精品文档与大而全的帮助文档分库并行检索,避免大文档淹没精品库;bad case整理成常见问题库并被业务策略优先召回;标签体系有十多个大类、一百多个标签,入库时以规则自动打标为主、大模型智能打标为辅,极少人工。复杂任务从RAG模式切换到Skill模式:意图理解→拆解改写→智能路由打标→多库并行检索→跨库统一重排→生成,不满意再循环。现场演示了Hologres(转写作hologress,校正)的「八连问」:公共云与专业云来回穿插的递进式提问,最终输出图文并茂的对比材料。
三棵小草CEO陈青带来最「土」也最有效的数字。这家一站式全球化IoT平台累计接入三四千万台设备、每月新增一百多万台(嘉宾称),做出过出厂价七八块钱的全球最便宜摄像头。技术路径是端侧YOLO模型(转写作U N模型,按语境校正)做初步分拣识别,再与大模型迭代优化,在非常低端的安防市场把识别准确率提升了三到四个百分点。千人千面的个性化模型做得很具体:饺子店老板要的不是通用安防,而是「饺子浮起来就提醒我熟了」。大模型把监控从「看得见」变成「看得懂」——过去树影晃动就触发误报,用户每天要过滤大量无效视频;现在系统能描述「老人从这里走过、正在干什么」,信息完全围绕关注对象展开。宠物线做了每日活动摘要(一天吃几次饭、喝几次水)、运动热力区域、与健康状态的关联分析,高光集锦分两档产品线对应不同客单价(普通集锦与带故事成长线路的集锦),并与华硕、荣耀合作宠物项目,与派旺等工厂「一宠一制造」。他说来云栖前专门赶工,「把跟千问合作的安防、宠物功能全部上线了,不然不好意思来」。
本节的机制→影响→启发链:护栏前置+知识运营+评测反馈闭环(机制)→AI在强监管、长业务链的行业里变得可审计、可放大(影响)→企业上Agent的第一件事不是选模型,而是建权限边界、评测集与知识运营流程(启发)。
五、OPC圆桌:确定性是跑出来的
最后半小时的圆桌,可能是全场最没有PPT、却最接近真相的部分。主题是「Agent时代的OPC」——One-Person Company,一人公司,一群把AI跑进法律、财税、AI短视频、玩具等真实场景的构建者,官方话术叫「用真实世界的反馈来反推产品与平台的确定性」。主持是阿里云的毛德峰与林晓翠(转写作毛泽峰、林小翠,按议程校正),嘉宾:法律AI公司AltaLex的陶佳茜(转写作陶佳倩,校正)、财税品牌「一起闯」创始人姚振国(金允耀阳)、AI获客短视频创业者陶萌(现场自述为温川智能创始人,议程作杭州月印万川人工智能,两源不一致,存疑)。他们都来自YourSpace创业园区,也是阿里云百炼播客「链场」(转写作练场,据主持人现场解释「百炼的链、YourSpace的场」校正,写作者推断)的受访者,完整对话可在喜马拉雅、小宇宙收听。
什么能力值得沉淀成Agent?姚振国给了三个标准:公司内部重复性的劳动;围绕核心人物、离了他们「可能就不转」的专家经验;以及「离钱近的事」——他服务的一家商业培训公司靠直播间引流卖线下课,私域转化率每提高一个百分点,收入就能涨很多,「这块最适合用智能体辅助销售」。他的技术观很清醒:「我不会做大模型已经覆盖掉的。我把大模型当做意图识别,把客户收入、成本、费用的计算规则沉淀成自己的独特算法,变成接口开放给大模型调用。大模型永远不知道你企业内部的工作流和知识,这部分才不会被迭代掉。」
陶佳茜的追问更深一层。大家都说要做「专家判断」——老会计看报表直觉「这个数有问题」,律师看合同直觉「这份合同不能签」,直觉背后其实已经闪过了三四十条念头。可是,「一旦我们把专家判断固化成一个skill、一个工作流、一段prompt,把它变成商业产品,这部分专家判断是不是也逐渐容易被取代了?」真正难替代的是另一层:「产生专家判断的逻辑」——持续在商业场里经营、接触新案例,让专家判断不断进化,再把进化抽象回产品的工作流。用主持人的话说:「作为专家的结果」和「成为专家的过程」,后者才值钱。
怎么收到第一笔钱?姚振国的打法最凶悍:第一天访谈完老板,第二天就把设计好的框架和HTML demo摆到老板面前,「不合适现场改」——只要痛击痛点、快速看到demo,老板就愿意买单。陶萌是研发出身,自认不擅长卖产品,选择借力渠道:自己只能卖5万的产品,渠道能卖20万,渠道分走10万,自己反而多赚5万——「如果你不会塑产品的价值,就找会卖的人合作」。陶佳茜的策略是不做大而全:「如果想把律所客户的所有问题都解决,铺上去的人力只能都做到六十分。先推拳头产品,打他最疼的那个点,信任建立之后,产品是跟客户深度共创出来的,忠诚度非常高。」她还提到律师业态的变化(节目引用一位做了十七年诉讼法务、自己开律所的朋友):客户开始带着「和AI讨论过的方案」上门,律师卖的是对方案的专家判断,收费模式正从计时咨询转向「判断」定价。
主持人的收尾观察耐人寻味:AI和流量一样,给了缺少光鲜背书的普通人「敲开传统老板的门、进去看业务」的机会——90后财税创业者靠「直接带着结果去见老板」赢得信任,高流量博主靠流量进入原本进不去的生意。而全场传播最广的一句话,来自「链场」采访过的一位产品负责人(节目引用):「这个世界就是一个巨大的草台班子……大家都在尝试、都在探索、都在努力地想去实现。腰挺直一点,往前站一点,去争取到机会,帮助更多的人一起AI向善。」
本节的机制→影响→启发链:专家判断一旦固化为商业产品就开始贬值,唯有真实案例驱动的持续自进化能保值(机制)→OPC的护城河是「行业深度×迭代速度」,而非技术本身(影响)→个人切入AI创业,选「离钱近、含专家判断」的窄点,先交付出可演示的确定性(启发)。
编注
一、官方议程中13:50-14:50的「从上下文到工具:企业级Agent核心组件能力解析」(讲者方唯振、王潇斌、黄佳东)未出现在本场回放转写中,疑回放剪辑或转写缺失所致,本文未涵盖该环节内容。二、本文基于官方转写整理,产品名、人名、公司名按官方议程与外部资料校正二十余处(如OPC、链场、司红江、张栌兮、毛德峰、具身智能、YOLO、QAT、Hologres等),无法确定之处已随文标注「转写疑似」「嘉宾称」「写作者推断」。三、外部核验七项:阿里云Agent Studio产品手册与媒体报道、OPC行业概念、高通AI引擎官方构成、NVIDIA TensorRT-LLM与NVFP4官方文档、博流智能BL616/BL618系列、千问Qwen3-Next稀疏注意力架构、百炼Token Plan权益页。