先说结论
这场分论坛回答了一个多数云厂商还没正视的问题:当客户不再只是人,平台应该长成什么样子。千问AI平台网站负责人孔琳琳的开场判断很直接——互联网上非人类流量已首次超过人类(论坛引用的全球流量报告,与 Imperva 2025 Bad Bot Report 口径一致:2024 年自动流量占 51%),越来越多 Agent 在替人读文档、调模型、跑业务,它们已是云平台"非常直接的使用者"。这个 2026 年 5 月上线的平台把设计理念定成一句话:把简单和价值留给客户,把复杂和工作交给 AI Agent。用户只定目标和预算边界,繁琐操作下放给 Agent,平台提供身份验证、额度约束和操作记录,让过程可管控、可追溯。整场论坛实际上是在把这句口号拆成四个工程问题:Agent 以什么身份用平台(李翔的 Agent as Customer)、靠什么调用能力(徐一鸣的 Skills 与 MCP)、怎么把应用跑稳(葛钧的三个运维 Skill)、花的钱怎么管(聂小敏的计费设计),再加上陈祖龙的 Qwen 共创计划把评测权下放给行业专家。真正的分水岭不在模型能力,而在平台的每一层——接口、上下文、安全、观测、账单——是否都把 Agent 当一等公民。
一、客户变了:从"为人设计"到"人机共服务"
孔琳琳用一个观察开场:Agent 不怕复杂,它怕的是混沌。人类用户遇到模糊的页面可以反复尝试、打电话找客服,Agent 遇到模糊只能反复试错、报错,或者在试错中烧掉更多 token——这是主持人在串场里的补充,也是整场论坛最底层的动机。对 Agent 友好,本质上就是让更多非专业用户能用上专业云服务:设计师、业务专家、创作者只需要提出业务目标、定好预算边界,剩下的交给 Agent。
对人类用户,平台做的事相对传统:千问系列与智谱 GLM、Kimi、MiniMax、DeepSeek 等三方模型集中呈现,参数、能力标签、上下文长度、定价一屏对比,同一条提示词并发多款模型同屏比较,配免费额度与 Token Plan、按量付费两种付费方式。这一层在 5 月阿里云峰会上已有公开报道,千问云官网当时即提供 150 多款主流模型 API。
真正的转向在圆桌上被孔琳琳点破:下一场平台体验的竞争,是谁能占领客户的工作流、进入 Agent 的执行计划。用户已经不再逛网站选模型,而是待在自己熟悉的 Agent 环境里(Qoder、千问办公、Claude Code、Hermes、OpenClaw 等),让 Agent 替他选型、调工具、做比较、装部署。这意味着平台必须把服务"说得很明白"——适合什么任务、需要什么条件、价格怎么算、怎么授权——因为交付标准不清晰,Agent 就会反复试错,浪费的是用户的 token。她甚至给出一个商业判断:未来的新买家除了人类,还有 Agent,它在用户授权下帮人做比较和选择。
AI 应用研发负责人徐昭把系统层面讲得最完整,称之为"AI 开始自己消费 AI"的自洽循环:人消费 AI 是单线程、高容错;Agent 消费是高并发、高频,却又需要人指导来解决兼容和错误。由此平台要在四个方向演进:接口层面向机器,要确定性、结构化、可追踪、可观测、出错能自愈,协议上用 MCP 做服务接入标准、A2A 做智能体协作标准;上下文从无状态问答变成有状态服务,跨会话缓存、跨 Agent 记忆复用、压缩时机成为第一性要素;安全边界面向自动化执行体重设计——沙箱、权限边界、限流、幂等(失败可重试不产脏数据)、审计缺一不可;观测单位从单次请求变成规划到交付的完整链条,要能诊断、归因、回放。这四条几乎是所有"Agent 友好"平台的检查清单。
二、Agent as Customer:身份、执行、账单三问缺一不可
产品经理李翔把"Agent 当客户"拆成三个必须同时回答的问题。第一,Agent 代表了谁——首次使用需要用户注册、登录、授权,平台必须知道哪位用户授权了这个 Agent、允许它做什么,不能因为它接入了平台就默认它能操作账户下所有资源,前提是可信身份。第二,Agent 能不能自主执行——从选模型、调服务、取结果到部署应用,每一步都要有 Agent 能理解和调用的方式,异步任务(比如生成视频)还要能查进度、判断能否进入下一环节。第三,Agent 做了什么、花了多少钱——权限、额度、支付状态、账单在自动执行过程中都要可查询、可追溯。他说这三件事缺一不可:只有调用没有边界,Agent 不知道尺度;只有限制没有执行,Agent 干不了活。
落到全链路是六个环节:注册授权、模型选型、实际调用、费用(余额不足时 Agent 能发起充值并核验到账,需确认的环节仍交给人)、部署、对账。顺序不固定——欠费就先充值——关键是 Agent 能根据状态继续处理,而不是每到一个环节就让人从头操作。为让人敢放手,他给出三条设计要求:权限只给任务需要的部分(部署演示站就不该有改生产系统的权限);预算要影响执行而非事后看账单,超额度就触发用户确认,而不是执行完再告知花超了;关键操作留痕可审计。他还留了一句清醒话:模型调用、支付、部署各自能自动化到什么程度需分别验证,不能因为跑通一次流程就认为所有场景都可无人确认——自主执行必须建立在可受控、可约束、可追溯之上。
受益者分三层。开发者把精力从接入配置转回业务目标(结果是否准确仍需人的专业判断);企业拿到"谁授权、能用多少、最多花多少、出问题去哪查"的规则框架,才有条件扩大自动执行范围;平台衡量体验的标尺也变了——以前看人能否找到入口、看懂页面,现在还要看 Agent 能否理解说明、正确调用、识别失败、带回结果。李翔的结论被印在议程标题上:下一代云平台的客户不只有人,还有 Agent。
三、Skill 即产品:专业品味第一次可以被复制分发
如果说 Skills 和 CLI 解决的是"Agent 怎么用平台",徐一鸣(花名盘古)讲的是反过来的一件事:人的专业经验怎么变成 Agent 可执行、别人可复用的资产。他的论点浓缩成八个字——skill 即产品,品味即价值。
他带了两个自证案例。一个是白猫主演的猫粮广告片:生成分镜、剪脚本、编排素材全部由一个动画广告片 skill 完成,编导的判断——同一只猫跨镜头形象要一致、产品包装文字要看得清——直接写进 skill,Agent 在结果不合适时回到对应环节修改订正。另一个更有说服力:本场演讲的 PPT 就是他用一个 AI 生图做演示稿的 skill(转写疑似名为 Pick PPT)做的,接入千问新一代图像模型;他的判断是模型升级后 skill 一字不改,产出自动变好——skill 打磨和模型成长形成旋转的飞轮,产品在"自然生长"。
这背后是对模型调用与专业交付之间距离的洞察:同样一个生图模型,懂摄影的人考虑构图景别,懂品牌的人考虑产品如何出现、观众要记住什么;这些常年积累的判断很难靠一次调用里的几句提示词完整表达。而 skill 本质上是一套渐进式压缩的复杂提示词,它能把专业人士"知道却讲不清"的经验持续带进 Agent 的工作上下文:怎么分析问题、什么结果值得保留、哪里需要重做。徐一鸣的判断是,从一次模型调用到一份专业交付,中间这段距离正是平台的价值所在。
所以本场的一项正式发布是技能市场全面开放——用户可以创作并上传自己的 skill(他那两个案例 skill 各只花了一到两天)。市场里已经有云存储、函数计算、轻量数据库这类高门槛 skill,让完全不懂云计算的人也能轻松上云,他把这叫"放大稀缺的经验与品味",并承诺后续打通商业化链路,让创作者从被使用的 skill 中获得收益——用他的话说,作品有人用、创作者有回报,才有人长期投入。配套的还有 MCP 商店(让 Agent 连接外部数据和商业服务)和 One Key Service(一个 API Key 统一模型调用、鉴权与账单,平台处理服务发现、路由、计费),前者先支持 MCP 服务,随后扩展到 skill 生态。这一层对服务商的含义值得注意:数据服务、软件服务、专业服务,现在都有机会成为 Agent 工作流里被调用的一环——商业服务的分发渠道正在多出"Agent"这一条。
圆桌上孔琳琳给这套生态补了关键的治理视角:未来进入平台的每个 skill,背后都带着行业专家的经验,同时也要附带一份可验收的标准。以 Arena 比赛的跨境电商素材生成为例,普通人只会说"生成一张图片",懂行的人知道海报的产品卖点、文案准确性、甚至对外投放的广告尺寸才是关键——这些标准藏在人的经验里,平台内部很难自己完成。技能市场因此不只是工具商店,更是行业方法的登记所。
四、写完之后:从 Vibe-coding 到 Vibe-operating
葛钧接过前面所有演示留下的尾巴:应用写出来了,然后呢?客户明天要试用,需要尽快上线交付可访问的地址;上线后要关心运行稳不稳、有没有性能问题、一个月花了多少钱;凌晨告警,要尽快搞清出了什么问题、影响面多大、怎么处理才稳妥。他的答案是围绕同一个应用串起三个 skill:上线有结果,运行有结论,恢复有边界。
部署 skill 用自然语言驱动:Agent 分析项目、给出方案和预估费用,用户确认后创建资源、部署、检查、交付地址,全程不在对话里暴露密钥。可观测 skill 让用户直接问"我的应用运行得怎么样",它按部署记录找到资源,汇总可用性、性能、实际费用并附判断依据——这里有个少见的诚实设计:某项数据没采集到时,skill 会指导 Agent 明确说明,因为"没有数据不代表一切正常"。可运维 skill 处理异常分两段:先只读诊断,查服务器、应用服务、数据库,说明发现、依据、建议与影响;人确认后一次只执行一个恢复动作(如重启、重载 Nginx),执行完立即验证是否恢复,最后无论完全、部分还是未恢复都如实反馈并保留记录。演示案例里,应用能访问但 CPU 持续满载,skill 把异常指标、具体进程和压测脚本关联起来给出可追溯的原因,清理后负载回落、复查闭环。
这套设计延续的是同一条权力分配原则:涉及状态变更的操作必须经人确认,用户取消任务就不会执行变更;Agent 负责执行与验证,人负责在了解影响后拍板。主持人把这步概括为真正的分水岭——搭建一个应用只需要几次对话了,竞争的下半场是让应用稳定地在线运行。
五、Token 焦虑:不是价格问题,是信息和控制感问题
商业化与账单产品经理聂小敏开场念了一句社群里的真实反馈:“我的 Agent 一晚上跑了三千多次调用,第二天早上打开账单八百块,而我一觉睡到了天亮。“她立刻说明金额因模型和用量而异,不是固定换算——但真正的重点是:人已经休息了,调用还在继续。当调用方从人变成 Agent,人每次点击带来的天然节流就消失了:过去人点一次系统执行一次,现在人发一条指令,后面跟一长串自动运行的步骤。计费系统因此要重新回答三个问题:谁在花钱?花的值不值?失控了谁能及时停下?
她把开发者社群里扩散的这种心态命名为 token anxiety,拆成三层:价格的抽象(一千个 token 到底是多少字符,一次对话花多少钱,用户心中没有锚点)、消耗的模糊(只看到总数,无法判断消耗是否正常)、失控的恐惧(Agent 还在跑,预算够不够,第二天账单会不会爆炸)。前两层是信息问题,第三层是控制权问题,越往上越难解。她给出的判断是全场最值得记住的一句:这其实并不是价格问题,而是信息和控制感的问题——降价能降低门槛,但不能自动解释账单。
平台的解法分两条产品线。第一条化解焦虑:用 Token Plan 订阅把抽象 token 变成财务可预算的月度确定性(健身房月卡的类比——付了月费就不会每次跑步都算一次钱),权益覆盖千问多模态模型和 DeepSeek、GPT、Kimi、MiniMax 等三方模型,兼容主流 AI 编程工具,新版本还纳入联网搜索、图片视频生成、代码解释器、知识库、沙箱等 Agent 能力;订阅与按量付费分工而非替代——稳定基线用量走订阅、弹性需求走按量;针对"买多用不完、用超了、阈值感知"三个边界场景分别给出历史用量推荐档位(只推荐合适的不推荐贵的)、加油包与升降档、按小时按应用按模型的准实时消耗曲线加主动提醒。第二条化解失控感:事中三道安全带——每应用每 Agent 可设预算天花板、超限自动停服,准实时的用量费用推送做到分钟级更新,消耗速率明显偏离历史模式时系统主动暂停并等人确认;事后四步追溯——看见(按 API Key、工作空间、模型、输入输出多维拆账)、定位(成本归因到应用、团队、用户、调用模式)、复盘(异常回放、回溯时间点和调用链,可回推给 Agent 自动响应)、治理(审计数据导出接入企业分摊流程)。她的概括是:把 Agent 从成本黑盒变成可治理的资产。更远处她给了一个方向性判断(并明确说这不是当前承诺):计费单位会从 token 走向按任务甚至按结果,就像用电的人不需要懂千瓦时怎么算——计费单位越接近用户能感知的价值,焦虑就越少。
支付环节的对应发布来自孔琳琳与支付宝合作的 AI 支付:用户掌握资金边界的前提下,Agent 在授权额度内可以无感支付,尚未授权的 Agent 走扫码。控制权设计得像给儿童电话手表设零花钱额度:单次任务可限额、总任务可限额、周期支出可设预算,每笔资金动作都有日志,用户可随时一键熔断。支付宝的 AI 付体系在公开报道中已有相当规模的真实验证(官网口径称 Agent 支付笔数已破 3 亿、用户破 1 亿),云栖现场还给出了 9.9 元购原价 79 元 Token Plan 的专属套餐。圆桌上孔琳琳把这层设计升了一级:Agent 规模化之后,人类的注意力变得更宝贵了——如果每次选型、付费、每个异常都要人盯着,注意力就成了限制 Agent 并行的瓶颈;预算本质上就是一种授权,额度之内自主执行,超出就回来找人。这是整场论坛对"人机分工"最精确的一句表述。
六、榜单之外:把评测权还给行业专家
陈祖龙的专题分享从一个人人遇到过、却少有人系统化解释的现象切入:模型在各大榜单上的分数越来越高,用户在真实场景里还是遇到各种失败。他引了一个国外学者的实验(转写未明确基准名称):把基准题面做简单修改、答案不变,模型的分数排序却发生巨大变化。他的归因有两条:一是刷题和数据污染——训练海量数据时可能不小心纳入榜单数据,很多模型发布前还会基于榜单特点做定向训练;二是榜单环境和真实场景差异太大——真实任务有长上下文、环境依赖、强依赖关系、多轮会话,而且用户早已不满足于让模型回答问题,而是要它改复杂代码、写专业分析报告,难度不在一个量级。即便像 Artificial Analysis 的 Intelligence Index 这样汇总十几项评测的综合榜,也不代表真实效果。
他的框架是把评测分成两套:标准评测边界明确、可重复可比较,提供横向对比;反馈评测任务边界开放、专家判定标准隐性、关注任务完成与实际可用性——互补而非互斥。反馈评测补足三种"不可见”:场景不可见(脏数据、边界、环境依赖)、标准不可见(专家多年经验难以显性表达)、失败不可见(用户重试、绕过、放弃从未回流训练)。一条反馈要进入训练,需过六步漏斗:质量判定(证据完整、可复现,含输入输出与轨迹)、结构化入库、归因(能力树定位三级类目,区分模型还是 harness 问题)、对症优化(预训练还是后训练补、补知识还是补约束)、环境重放、效果验证,所有 case 沉淀成评测集持续追踪。两个例子:要求三百字以内仍啰嗦,归因指令遵循,定向补硬约束样本;让模型深读图片它只调工具、结论与图相反,归因证据引用不足,在输出与证据对齐上训练。
据此发布的 Qwen 共创计划意图明确:模型的好坏不由算法团队说了算,而由行业专家和真实用户说了算。计划覆盖金融、法律、医疗等 26 个以上领域,设三级参与机制(从最简单的 case 反馈,到以专家身份深度共建真实场景评测集,并承诺每次模型迭代在你共建的评测集上有效果提升),参与者可抢先体验预览版模型、获得免费 token 额度,提交的专业报告另有激励。圆桌给出了这套机制运转的现实证据。米羊科技创始人徐奕成(原 WPS;转写曾误作"徐义成”)的算盘是:今年二月因为自家功能 token 成本太贵要换性价比模型,索性做了选型平台,现在每天五万多 UV、两千多万 PV;千问 3.8 发布前他已抢先测试,自家产品 Alice 帮千问做了 preview 体验、收集了四十多个 case;模型 day0 接入对应用厂商加持很大——那正是流量最高的时候;他还当场提了个需求:千问 3.8 缺小尺寸版本(转写疑似 0.6B/2B),他们还在用上一代小模型训练架构模型,孔琳琳和徐昭当场记下。基元律动联合创始人韩凯的发现更有意思:他们自建软件工程评测集测试千问 3.8-Max 时,发现模型遇到难题会"想尽办法"——上网搜答案、去 GitHub 找现成实现。由此得出的区分被霍太稳总结成一句妙语:评测模型看基础能力,不希望它作弊;评测 Agent 看端到端交付,开卷考能答对就行——“希望模型聪明又努力,但不能太努力”。徐昭则确认这些反馈已经在"重写研发闭环":失败路径和轨迹进入后训练与强化学习,评测标准从单点结果转向轨迹级、过程级,在线反馈倒逼产品设计;过去模型能力提升和真实任务处理是分离的两件事,现在每个新版本上线前先基于真实任务做对齐校正,而不是上线之后被用户骂。
Arena 颁奖是这套逻辑的前哨战:今年八月上线的千问 AI Arena 所有任务来自真实业务场景,第一期聚焦海外电商素材生成,二十天里收到八百多人报名、一千六百多个 Agent 提交,经 AI 评测和人类专家评审选出五位获奖者(一等奖由海南奇物记智能科技 CTO 潘景获得,转写中另作"潘鼎",以官方议程为准存疑)。一等奖得主的圆桌发言点出了比赛与真实世界的差距:Arena 的问题定义得非常清晰,输入什么、输出什么、怎么运行都明白;而真实业务"很脏、很混乱"。他的经验是开发者要和业务人员组队——开发者自己就要当 FDE(现场部署工程师),像 Palantir 的 FDE 拿着产品线进企业排列组合那样,用平台开放的能力在现场拼出解法。
七、收进口袋:入口战争的最后一块拼图
李彦的移动端发布补上了最后一环:模型每周都在发,你刷到"这个模型真厉害"最想做的是马上试,但你在开会、在路上,“过会儿再说"往往就没有然后了。Qwen Cloud App 的主张是把最前沿的模型装进口袋——从体验、选型到任务完成都在手机上做完。Discover 频道刻意不做参数清单或测评榜(呼应陈祖龙对榜单的批评),而是让用户第一次接触新模型就看到真实用户用它生成的作品,划一下就能二创;选型方法论很直接——真正让你拍板的不是榜单和参数对比,而是你用真实案例在模型之间跑出的结果。App 内置数十个行业垂直 Agent(“口袋里的数字同事”,比如提交数据表、像跟同事聊天一样提问的分析专家),也支持用自然语言讲清任务目标、服务对象、交付标准三件事来创建个性化 Agent;再往上有通用任务 Agent"Genius"当大总管调度其余 Agent,还计划提供 Dispatch 模式让手机当电脑上 Agent 的遥控器——一个目标进去,一个结果出来。他讲了一个 MCN 内容运营的一天:通勤刷到创意视频存下、咖啡时间建视频分析 Agent 拆脚本、让不同视觉模型生成多版人工挑选上传、下午数据回流再优化——全天不坐电脑前。这款 App 已在海外 iOS 和安卓市场上架,国内将陆续上线(讲者自报口径)。
结语:平台进化的真问题是控制权的设计
把六位讲者和一场圆桌的内容合起来看,千问AI平台的"进化"并不主要发生在模型层,而发生在平台与人、与 Agent 的关系层。李翔的三问(代表谁、能否自主执行、花了多少钱)、葛钧的三句话(上线有结果、运行有结论、恢复有边界)、聂小敏的三层焦虑(价格抽象、消耗模糊、失控恐惧)、徐昭的四个演进方向(接口、上下文、安全、观测),其实都在回答同一个问题的不同切面:当执行者从人变成 Agent,控制权、透明度和责任边界必须被重新设计,而且必须在平台设计之初就设计,而不是事后补丁。这场论坛给出的可检验判断有三个:第一,Agent 友好不是加个聊天框,而是把服务说明、操作接口、验收标准、费用账单全部结构化——谁先做到,谁就占领 Agent 的工作流;第二,专业经验正在获得产品形态,skill 即产品意味着个人品味可以复用、分发、定价,技能市场加商业化分成会催生一类新的"经验供给者”;第三,token 计费会向任务计费、结果计费演化,因为计费单位越接近可感知价值,用户焦虑越小——这一条还是方向而非承诺。对普通读者,最实际的启发或许是孔琳琳那句"人类的注意力变得更宝贵了":自动化程度每提高一级,授权边界的设计就得跟上一级,预算就是给 Agent 的零花钱,可审计是敢放手的前提。霍太稳的收尾玩笑为整场定调:在 AI 全面接管之前,好好享受还有工作的这段时光——管理好预期,也管理好你的 API 额度。