先说结论

2026年9月23日下午,云栖大会「构建 Agent Infra——智能体与大模型训推生产级实战与解析」论坛(议程页标注兴趣领域为容器与K8s、Agent运行时与沙箱,闭幕报幕用的别名是「容器和沙箱分论坛」,两者为同一场)用十场演讲回答了一个问题:当Agent从聊天框走进生产系统,基础设施要重写哪些规矩。第一讲者杨旭(阿里云资深解决方案架构师,转写中名字按议程核对)开场就把时间线拉开:去年年底开源个人Agent平台OpenClaw(中文社区因"Claw→螯→龙虾"的梗把它昵称为"龙虾",“个人养虾"即自建个人AI助手,此说法经外部多源核实)出圈,到今天Harness工程在云上大规模落地——企业的注意力从"模型选哪个"转向"执行环境怎么建”。全场最硬的主张有两个:其一,沙箱(Sandbox,一种为AI Agent提供隔离运行环境的轻量虚拟机,基于MicroVM技术)已经独立成一种新算力形态,与ECS、K8s并列,阿里云称其在线沙箱已超千万个、单region支持百万级并发;其二,强化学习训练(RL)正从头部实验室的专属变成中小企业可按量购买的服务。而十位讲者的客户案例合起来给出一个更冷静的判断:Agent进生产的瓶颈已经不是模型能力,而是隔离、弹性与成本这三本账能不能算平。

一、沙箱成为"第四种算力":安全是入场券,弹性是护城河

杨旭把阿里云的Agent Infra定位成"不做单一产品,做Agent安全高效运行的基础设施":底座是十六年弹性计算的沉淀,往上分环境(沙箱、隔离文件系统、网络控制)、上下文(memory、RAG)、工具(skills、MCP)、安全(身份、防护、审计)、模型五层。他强调单机100毫秒启动一个沙箱不难,难的是一百万、一千万个沙箱同时启动并长期稳定运行——这是云厂商与创业公司的分界线。

两个版本的产品形态贯穿全场:容器版百分之百兼容K8s生态(可继续用Helm管理,嘉宾原话转写为"压模",即Helm的误识);极速版面向开发者,主打启动速度。当天上午刚做过品牌发布的Agent Sandbox,其官方文档口径为MicroVM级隔离、内存级休眠唤醒、Checkpoint克隆、每分钟最高15K规模弹性扩展;而论坛现场讲者给的是更激进的一组数字——并发创建10万每分钟、无预热1秒启动、单region百万级并发、在线总量超千万(两种口径差异已在文中标注,现场数字为嘉宾说法)。

卢萌凯(化名骆浩,阿里云高级产品解决方案架构师)把"为什么不是ECS/K8s"讲得最直白:三点区别——安全做到极致(六层隔离:运行时、网络、存储、内容、身份、扫描防护;沙箱内放假API Key、出网时才换真Key)、弹性做到极致(1000 QPS并发启动沙箱1-2秒拉起、全region一分钟10万个)、Agent特有功能(深休眠、快照、Checkpoint克隆)。他由此断言Agent Sandbox是"云上的超级计算机",并称云上超过九成的Agent负载已经跑在沙箱里(嘉宾说法)。

性能的底层机制值得展开,因为它解释了"快"从哪来:极速版用五层缓存加亲和调度——快照缓存到内存(几十毫秒启动)、裸金属本地盘(百毫秒)、跨机P2P拉取、专用root集群上的热镜像、最后才是远端ACR/OSS——分层命中率超过98%(嘉宾称),最终做到冷启动180毫秒、热启动20毫秒、深休眠唤醒600毫秒。这组数字是理解后面所有成本故事的前提:只有唤醒足够快,“闲时休眠、忙时秒起"才成立,沙箱才能按秒计费而不牺牲体验。

这一段的机制链可以写成:Agent负载天然不可信且突发(模型可被提示词注入诱导越权)→ 必须用MicroVM级隔离+临时凭证取代共享容器→ 安全成为入场券而非加分项(杨旭原话)→ 二阶影响是"敢不敢接生产系统"从安全团队的问题变成基础设施的属性→ 读者启发:自建Agent执行环境前,先算隔离与审计的隐性成本,多数团队会在"万级在线就上不去"这堵墙上撞到(千问办公的弯路,见下节)。(证据层级:性能数字为嘉宾说法;隔离架构与产品形态有阿里云官方文档佐证;“九成负载已在沙箱"为嘉宾判断,待核验。)

二、千问办公的生产账本:从万级瓶颈到千万用户的四道关

千问办公技术专家严龙(转写为"颜龙”,按议程核对;千问办公为面向办公场景的通用Agent产品)的分享是全场最完整的甲方复盘。千问办公能写PPT、生成周日报、定时收集资讯、一句话生成带数据库的网页应用,用户是千万级——这两个量级叠加,对沙箱提出五个要求:快(用户下发任务要立刻感知执行)、持久(第二天还要接着优化代码)、安全(销售数据不能泄、不能越权访问他人数据)、海量(一个用户可发起多个任务)、便宜(规模一大成本就爆)。

选型走过弯路:最早接入某服务包装完善的沙箱产品,“比较快跑通了业务流程”,但放量时同时在线卡在万级上不去、创建耗时压不下来;随后基于开源E2B方案自建沙箱集群,物理成本与运维成本都很高,低峰期机器基本闲置。最后迁移到Agent Sandbox。这段弯路本身比成功案例更有信息量——它标注了自建路线的真实天花板。

落地时四道关的解法都可迁移。快速创建:把与用户无关的环境(OS、浏览器、依赖)预置进基础镜像做沙箱模板,再维护预热池,用户来了直接分配,把整体创建耗时从几十秒压到1秒级。安全隔离做了三层(企业间、业务间、集群间——同一套代码部署海内外多集群),任务级再做四环节控制:身份校验、凭证虚拟化(真凭证不落沙箱)、记忆数据按用户身份加载、出网黑白名单。数据持久化用沙箱外挂文件存储(阿里云Agent FS类产品),释放沙箱后数据仍在。成本控制靠两段回收策略:临时任务拿完结果即释放;多轮对话环境先深休眠(任务来时毫秒级唤醒)、休眠期间不占CPU、数据保留,之后再释放——闲置阈值是按线上真实会话时长分析定的。

这条链是:通用办公Agent要服务千万用户→ 单纯"快"不解决"敢用”,安全与持久化才是信任前提→ 分层隔离+凭证虚拟化+深休眠把安全与成本同时压住→ 二阶影响:不懂技术的用户也能让Agent独立开发带数据库的应用,应用生产门槛向非程序员下沉→ 启发:做Agent产品选执行环境时,用"万级在线、创建耗时、闲时成本"三个硬指标压测,别被Demo阶段的顺利迷惑。(证据层级:全部为嘉宾(甲方工程师)第一手说法,无外部独立核验;弯路细节为其自述。)

三、训练与推理的民主化:百炼把RL变成"来了就能训",生数把算力差变成调度题

第二场是百炼的双人讲。阿里云产品专家洪晓龙先用考试比喻厘清概念:RL(强化学习)像平时作业与单元考,靠行动奖励不断更新模型参数;Eval(评测)像中考高考,用固定模型+Agent配置跑不同数据集打分,不更新参数、只大规模验证能力。两者都需要在真实环境里跑真实任务——代码类(SWE-bench类基准)、OSWorld类桌面操作、企业工具API调用——这正是沙箱的价值:真实执行、状态连续、任务间完全隔离、批量供给。他把这套体系提炼为"Loop Engineering":RL Loop(策略模型→Rollout采样→奖励反馈→参数更新)与Agent Loop(决策→工具调用→环境执行→结果反馈)组成一个大循环,中间的Eval决定能不能发布。现场给的指标:五分钟开箱即用、批量交付10万每分钟、5000并发3GB异构镜像1-2秒就绪、RL+Agent loop综合TCO降低50%以上(嘉宾说法)。

百炼模型训练高级技术专家罗自荣的主题是"多租户场景下的企业级Adaptive RL训练平台",三个关键词——训得了(完整功能与体验)、训得起(成本降到极低)、训得好(满足真实场景)。技术架构五板块(CLI、控制面、执行面、训练面、观测面)里最关键的设计决策有两个:一是把Rollout函数与Reward函数系统化抽象为"函数实体/函数实例",独立于训练构建,训练时跑轨迹、评测时直接复用为打分组件——这是"训练-评测复用闭环"的工程前提;二是网络架构:Agent跑在客户侧网络、损失与梯度计算在百炼平台,两侧数据交互直接吃掉GPU使用效率,团队最终联合集团网络团队做了Region化的专属内建通道,用户无感走内网,避开公网的不安全、低效与成本,还支持绑定客户VPC——Rollout里像访问内网服务一样访问自己VPC。这页内容对任何做多租户训练平台的人都是实打实的架构参考。

生数科技(视频生成公司,产品Vidu,自研U-ViT架构融合diffusion与transformer,官网称Vidu S2为全球首个实时交互视频生成模型——外部已核实)基础架构负责人姚峥的账本则展示了另一面:全球化业务的算力潮汐。白天数万张卡在线服务、凌晨掉到几千卡;数百个模型因用户还在用而无法下线,形成长尾;十种GPU卡(国产、英伟达、AMD)故障与监控方式完全不同;二十多个节点分布在多云与IDC。四个解法对应四组数字(均为嘉宾称):依赖弹性计算把ToB服务稳定性做到99.9%、长期采购成本降20%;基于ACS镜像缓存技术把100G模型切换从10分钟以上压到15秒内;基于ACK事件转换与节点异常探测做全自动故障自愈闭环,硬件故障自愈率超99%;用ACKOne把北京、上海、乌兰乃至线下IDC的多地域GPU统一管理,全局HPA与调度器按付费/VIP等级做workload级抢占,GPU利用率提升20%、计算成本降15%。生数下一阶段的方向(训推一体统一算力池、全球一张网、显存级多模型热切换、基于业务指标的自治运维)几乎就是一份AI Infra的路线图样本。

这一段的机制链:Agentic RL需要瞬时拉起上万乃至十万级隔离环境(传统K8s调度速度跟不上)→ 沙箱化Rollout+函数抽象让训练/评测复用同一套执行环境→ 二阶影响:RL从头部实验室专属变成中小企业按量购买的服务,数据与know-how开始向平台沉淀→ 启发:判断一家公司Agent RL的真实施Scale,看它每分钟能销毁多少个干净环境,而不是看它有多少张卡。(证据层级:架构与产品能力为嘉宾说法+官方文档佐证;Vidu S2"全球首个实时交互模型"来自厂商官网口径。)

四、长尾战场:具身智能、卫星气象、小红书与"白天规划、晚上执行"

论坛后半程四个案例各自补上一块拼图。

具身智能侧,阿里云架构师赵堃的判断是"敏捷基础设施决定创业公司能跑多快":2026年技术态势未成共识(VLA与世界模型两条路线将结合、真机数采转向无本体采集、数据或从互联网学习动作),此时基础设施不是成本项而是试错杠杆——短期平台化、中期规模化、长期自治化,最小闭环是"数据训练、仿真、推理、数据回流"。他特别提醒:如果基础设施与某条技术路线深度绑定,路线一旦变化企业会"陷入万劫不复的境遇"(嘉宾原话),所以方案要模块化、拥抱开源、不绑定技术栈。智元旗下觅蜂科技(转写误作"智源蜜蜂",按议程核对为智元创新;36氪与腾讯新闻2026年4月报道证实其发布一站式物理AI数据服务平台与MEgo系列无本体采集硬件、宣布2026年千万小时产能)SRE尹欣补上需求侧:众包数据采集App"蜜蜂派"当天发布,脉冲式运营要求算力随洪峰秒级伸缩,压测峰值并行1.6万个Pod;他们引用友商Figure的数据——上线四个月覆盖108个国家、4.4万日活、上传1600万条视频、支付1500万美元(嘉宾引用,未找到独立公开报道核验,待核验)——论证"为什么不为洪峰买断一百倍产能"。落地用ACK Pro弹性节点+Serverless容器+全托管Argo工作流,与开源对比单工作流最大节点数从三千到两万、并发运行工作流从五千到五万,资源节省约三分之一(嘉宾称)。

时空智能侧,洞察时空副总裁沈健的框架最有认知增量:大语言模型的起点是人类的符号世界,物理世界模型的起点是真实世界状态;后者要靠观测反馈而非人类打分。中国对地观测数据2025年约10PB,2030年保守估计300PB(嘉宾引用行业数据);他们的星阙大模型(2026年4月航天日期间发布,全国首款物理世界大模型产品——外部已核实)配576颗低轨/超低轨数算一体AI星座(2026年7月WAIC公开——外部已核实),台风"白海豚"路径推演误差较行业平均低两到三成、提前九天预判核心降水区,电价预测做到14天前瞻(以上为嘉宾自述口径)。案例价值在于把"AI+行业"的算力问题翻译成"观测密度决定模型进化顺序"的数据问题。

推理侧,阿里云高级技术专家车漾给出成本公式:北极星指标是Cost per Token(引用英伟达"每百万Token成本才是推理总成本标尺"的说法),分子是每小时GPU成本,分母是吞吐×GPU利用率——降成本只有两条路:向推理引擎要性能,向时间要效率(低谷期把闲置算力调给RL与数据处理)。具体能力落在推理网关(融合优先级、端点负载、KV Cache亲和性选路;真实客户TTFT降75%、TPOT降40%、吞吐3倍——嘉宾称)与Fluid ModelScale权重分发(RDMA/ERDMA原生+GDR直达显存+Mooncake Transfer Engine做P2P分发,千问3-32B加载从45秒到GDR P2P模式3秒、提速15倍——嘉宾称)。小红书云原生负责人熊峰(转写口播为"奥可",按议程核对)则讲了应用侧的两年演进:第一阶段GroupSet/PodGroup两层API把PD分离推理做成"组"的编排(Gang调度准入、拓扑约束、原地发布、Pod Group Cache回迁,单批发布从几十分钟降到几分钟);第二阶段把Role作为一等编排单元、通过RBG(Role Based Group,已开源至sgl-project/rbg,GitHub可查——外部已核实)声明协同策略,Segment机制把2P1D成组放进超节点、KV Cache尽量局部保留。生产结果:核心业务与内部MaaS场景规模化落地,同等SLO下吞吐2-3倍提升(嘉宾称)。

最后的两个收尾讲者把话题拉回"谁来运维这一切"。阿里云产品专家胡光介绍容器服务Agent(智能运维):公测阶段累计主动发现异常3.6万次+、诊断准确率85%以上、约80%存量容器客户已尝试(嘉宾称);核心设计是plan-sense-think-act四阶段加Human-in-the-loop——任何生产变更都需客户approve,代码执行拉起沙箱隔离,全程审计。朗新科技AI4SE负责人张栋的九宫数字分身则给出组织级答案:这家六千人规模(技术约三千人)的能源科技公司服务国家电网、南网、移动与蚂蚁系,从Vibe Coding走到SDD范式(spec-driven development),再基于Agent Sandbox搭云端编码平台——底层沙箱算力,往上编码Agent CLI运行时(接入了多家国内外主流编码Agent)、项目资产层(Rules/Knowledge/Skill/MCP/Memory)、流程编排(复杂需求用Super Power流程、中小需求用Open Spec,计划审核与MR审核两个人工卡点)。他们把需求智能分流:中小型需求云端全自动闭环,复杂/探索型需求走本地算力纳管(自研Pilot接本地Runtime),两类开发都把资产回流云端——“不管是哪种开发,云端数字分身最终拥有项目最全的知识资产”。现状:集团内一百多个常驻分身、两百多个动态分身,基于Sandbox底座"从开发之后开始就没有产生过任何生产级问题"(嘉宾称)。张栋的目标状态一句话可概括:白天规划,晚上执行——人的工作变成审核Plan与结果,分身在空闲时段跑完队列里的需求。

这两段的机制链:生产规模超越个人运维极限(97%的组织近一年至少一次安全事件,嘉宾引用)→ 运维知识从人沉淀为Agent的skills+工具链,人退到approve节点→ 二阶影响:运维岗从救火转向规划与审计,开发组织从"人以岗位分工"转向"AI为生产力、人做规划审查验证决策"→ 启发:引入Agent运维/编码分身时,先设计的不是能力上限,而是审批卡点与审计日志——朗新把卡点放在Plan审核与MR审核两处,是可复用的最小治理方案。(证据层级:数字均为厂商/嘉宾自述;“97%组织"为嘉宾引用统计,未独立核验。)

结语:三本账与一个观察指标

整场论坛没有出现"模型突破"式的新闻,但十场演讲拼出一个清晰的趋势:Agent时代的基础设施竞争,比的不是谁的单机指标漂亮,而是三本账——隔离账(安全是入场券)、弹性账(启动/唤醒/销毁的速度决定成本模型)、复用账(训练与评测、规则与记忆、专家经验与skills能否在同一套底座上流转)。杨旭说的"一百万个沙箱同时启动"与张栋说的"一百多个常驻分身、白天规划晚上执行”,是同一条光谱的两端:前者是云厂商的规模叙事,后者是企业组织的生产关系实验——张栋甚至用"初中政治课"的生产力-生产关系框架论证:AI提升了生产力,岗位分工与组织架构必然随之改变。

值得留意的反方与限制:所有性能数字(千万在线、10万每分钟、98%命中率、99%自愈率、吞吐3倍)均为厂商或嘉宾在自家场地的自述口径,官方文档与现场口径存在差异(如弹性扩展每分钟15K对10万),除特别标注外未获独立第三方核验;MiniMax"全球最大强化学习规模"的说法另有报道指其训练沙箱建于腾讯云,多云并存下"最大"归属存疑;Figure众包数据、台风预报误差等关键引用也未找到独立来源。观察这个领域,下一步盯三个可验证的信号:Agent Sandbox官方文档的弹性指标是否向现场口径靠拢、RBG与Harbor类数据集标准在开源社区的采纳度、以及千问办公/朗新式"常驻分身"数量是否成为企业AI化的公开披露指标。沙箱会不会像容器一样从"新算力形态"变成默认值,答案就藏在这三个信号里。