先说结论
2026年9月23日下午,云栖大会「AI Agent原生操作系统」分论坛(国博一期201厅)把一件过去两年悬而未决的事摆上了台面:当AI Agent成为操作系统的新“用户”,操作系统这一层的价值正在被重新定价。这场论坛给出的不是统一答案,而是一场仍在进行的定义权之争——阿里云把它叫Agentic OS并宣布GitHub开源,中兴通讯架构负责人蒋学鑫说操作系统的第一性使命不是让智能体跑得更快而是“踩刹车”让大家敢用,AMD和Arm则用“单机架能塞多少个Agent沙箱”重写了CPU规格表。核心矛盾可以一句话概括:**Agent是概率系统,生产环境要求确定性,谁把这个“不确定→确定”的转换层做出来、做标准,谁就拿到下一代基础软件的定义权。**对普通从业者,这场论坛至少留下三个可验证的信号:升级操作系统本身正在变成最便宜的算力扩容手段;token账单的优化正在从提示词层下沉到系统调用层;而“被约束者不能自己当裁判”正在成为agent架构评审的硬性问题。
一、“新用户”入场:操作系统的地基假设被拆了
阿里云基础软件产品负责人张鹏程(花名渐远)的开场框架值得完整复述:操作系统从诞生起的一切概念——文件、进程——都建立在一个基本假设上,即系统由人操作、运行的是人写出来的程序。这个假设如今被一类新用户打破了:它们不睡觉、由目标驱动、自己规划任务、自己写程序调工具,甚至自己决定开关环境。这就是AI Agent(智能体)。
但张鹏程真正的贡献是把“操作系统该怎么办”拆成了递进的三件事,而不是一个含糊的“AI化”:加速(把CPU、GPU、RISC-V等硬件红利快速释放给用户)、扩展(面向智驾、具身智能等物理世界场景延伸优化边界)、新生(面向智能体全新设计一套操作系统)。前两件是存量生意,第三件才是赌注。
存量部分的数字颇为直观,且都出自张鹏程口径:不换硬件、不换应用,仅把系统升级到Alibaba Cloud Linux 4,通用负载性能提升40%以上;加解密和数据密集型负载通过AVX指令集使能获得50%至3倍提升;在高密度Agent沙箱测试环境中,借助多规格大页(multi-size THP,一种内存管理优化)等特性,运行时间缩短10%以上、内存节省20%以上——直接换算成同一台机器上更高的Agent部署密度。“换OS等于免费性能”,这是存量用户最容易听懂的价值叙事。
“扩展”部分藏着一个本场反复出现的机制判断:大语言模型(LLM)的训练栈已经收敛(Transformer架构为主、技术栈集中、高端算力为主),系统级优化可以被框架吸收;而智驾、具身智能的训练现场是VLA(视觉-语言-动作模型)等多条技术路线并行、数据管线和算子差异大、高中低端算力并存——组合爆炸之下,优化没法被框架吃掉,只能被推到操作系统这一层。阿里云的回应是OS级训练加速组件Loongkit(现场口头读作Longkit,官方拼写为Loongkit,正文按官方名):零代码侵入、以插件方式与PyTorch自适配,宣称在智驾、具身智能训练负载上带来50%到3倍以上的性能提升,并在本次论坛宣布进入1.0。
至于“新生”,张鹏程给出了一个可迁移的判断标准:预装几个agent应用、桌面加几个辅助窗口,都不叫Agent OS的原生体验。他认为原生要满足三个特征——系统级agent交互与支撑、系统可被agent原生互操作、面向agent负载的治理能力。这套架构分三层:接入层的系统级agent与harness框架适配、全生命周期的身份/权限/安全/可观测/workspace治理、内核层面向沙箱快速启停的优化。其中最“离谱”也最说明问题的一条收益是token经济性:通过系统调用和工具层面的“瘦身”,同样的token额度能跑更多轮agent——token成本治理已经下沉到了syscall(系统调用)层,这是云厂商把算力账单问题翻译成自己主场语言的典型动作。
二、CPU的反攻:从“陪跑GPU”到“Agent流水线主力”
如果说软件侧在讲“负载变了”,硬件侧则在讲“谁的网络该被重构”。AMD全球副总裁Raghu Nambiar的演讲几乎是对“Agent=GPU生意”这一普遍认知的正面反驳:Agent AI不是单一负载,而是一条工作负载流水线——网关接入、上下文组装、规划路由、推理、工具执行、验证、流式响应——除推理层视模型规模可选GPU外,多数环节跑在CPU上。他给的理由很工程化:ERP、CRM这类传统系统不会消失;多GPU系统需要高性能宿主CPU做内核启动、内存拷贝和前后处理;50亿到300亿参数的小模型CPU就能干好。
落到产品上,AMD第六代EPYC处理器Venice(2026年7月发布)被Nambiar称为“对agent负载最有说服力的CPU”:单路256核512线程,双路512核1024线程;不做超额订阅也能单服务器跑500+个沙箱,两倍超额订阅则超过1000个;代际核强度提升20%,支持DDR5-8000与MRDIMM-12800内存、PCIe Gen 6。这套规格的外部核验完全吻合(与多方媒体口径一致),但要害不在参数而在叙事:CPU的规格表正围绕“沙箱密度”重写——因为一个沙箱≈一个agent的运行环境,沙箱密度就是单位空间的agent吞吐。
Arm讲的是同一个故事的另一个版本。Arm云人工智能事业部市场总监侯科鑫给出两个锚点数据:Neoverse平台累计已部署超15亿个CPU核,其中从10亿到15亿只用了6个月(Arm官方口径为近9个月出货5亿,会场与官方数字基本一致);以及引用称自2025年OpenClaw发布以来,agent产生的token数是人类15倍以上(Arm官方另一口径是到2030年agent token用量将增长24倍——量级相同,方向一致)。这里需要解释OpenClaw:这是2025年11月发布的开源个人AI助手(吉祥物是一只太空龙虾,也是中文社区“小龙虾/龙虾”梗的出处),60天内GitHub star数超过React十年积累、成为史上增长最快的开源项目,转写稿里反复出现的“小龙虾”“OpenCLow”“Open Cloud”均指它。
基于同样的“agent流水线”判断,Arm推出了自家的首款自研量产CPU——AGI CPU(136核Neoverse V3):36千瓦风冷机架塞进8160个CPU核、180TB低延迟内存,200千瓦液冷宽体机架45696核、超1PB内存,机架算力密度较x86翻倍(官方参数页逐项吻合)。侯科鑫还留下一句全场最抽象也最大胆的判断:“数据中心自身已经变成了一个智能体”——CPU在其中做任务编排、数据预取、把任务分配给加速器,传统为人驱动、可预测负载设计的数据中心正在为不间断推理、目标导向工作流、代理间相互调用而重建。
一个值得记下的细节是两家公司的“中国本地化”姿态:Nambiar专门讲了过去三年在中国的路线图——2024年软硬件协同优化、2025年深耕虚拟化/安全/数据库等差异化领域、2026年实现Venice的Day-0(首发日)优化,并透露AMD团队已向龙蜥SkillHub提交了十余个基于AMD技术的skill;Arm首席软件工程师贺军则演示了Arm Performance性能分析套件加Agent Skill的组合——把Arm微架构调优经验封装成agent可调用的知识库,现场案例接近5倍性能提升。芯片厂商不再只交付芯片,开始交付“agent能直接调用的专家经验”,这可能是本场对“开源生态”最实操的注脚。
三、“踩刹车”的人:治理、裁决与敢用
中兴通讯AIOS架构负责人蒋学鑫的演讲是全场最体系化的一讲,也是对前述“性能叙事”的必要平衡。他的起点判断是:智能体已经进入手机、平板、家庭、办公乃至电信设备,但“决定成败的往往不是模型本身,而是模型之外、把概率输出变成可靠执行的那部分系统能力”。
顺着这个判断,蒋学鑫提出了本场最反直觉的命题:**操作系统在AI时代的第一性使命不是让智能体更高效,而是“踩刹车”——让大家敢用。**他用工程控制学的语言说,要把不确定的概率系统变成确定的系统,这件事的优先级高于性能。具体架构是三层Harness(直译“马具/执行脚手架”,指包裹模型、负责把“想”变成“做”的工程层):Agent Harness管单个智能体的循环、记忆、工具、沙箱;OS Harness管单节点设备;System Harness管端边云集群的身份、编排、全局策略与端到端可信。他坦言在中兴自治网络的网优智能体实践中,最终裁决权不敢交给“AI as a Judge”(模型即裁判)模式——理由有三:模型以完成任务为目标,天然倾向放宽对自己的约束;裁判逻辑本身不一定靠谱;规则容易被模型自己绕过(自己划的边界自己能改)。
配套的是一套自主权分级:只建议不执行(重大权益、低置信度场景)、先审批后执行(资金、隐私、物理动作——他举例豆包手机可以全程自动在京东下单买奶茶,但付款那一下必须人来点,这是法规要求)、低风险先执行、更低风险自动执行。这套分级正在行业和国家层面形成标准。落地手段则相当“内核”:用eBPF(内核可编程观测/钩子技术,转写误作EPPB)在智能体全生命周期布判定点、执行点、观测点——包括对闭源agent框架,也能从操作系统底层拿到调用链(龙蜥社区的Agent Insight项目在做这件事),可观测性不依赖agent自觉。蒋学鑫还用生物遗传学类比讲自进化:进化=变异+选择+遗传,变异发生在个体,但如果只有单个智能体进化,经验无法遗传;所以要把整个系统(配置、OS、业务)纳入进化环,让“整个种群不必学习第二遍”。
阿里云资深技术专家冯富秋讲的SysAgent(转写稿中的CC Agent,按议程校正)是同一命题的产品化样本,但更贴近运维的疼点。他先摆出四个真实困境:AI写的代码占比已超九成(其团队标准代码场景口径),但写得快不等于敢上线;软件垂直栈越来越厚,CPU告警和应用卡顿之间的因果关联人已经联想不出来;告警泛滥到不知道该看哪条;CVE(通用漏洞披露)爆发后“修还是不修”两难——不修怕被黑,修了怕变更引发故障(“现在很多故障都是变更引发的”),而热门漏洞从公开到出现PoC(概念验证 exploit)只要约72小时,企业实际平均修复却按天算。他的方案是把传统的“辅助机器人”升级成“数字员工”——区别在于能不能把事办成而不是给一百条参考建议(他原话的比喻:就像订票助手,能办好就继续用,办不好就“炒掉重新请一个”)。防幻觉的三条设计原则很值得抄走:安全判定必须给出攻击链证明、诊断结论必须附证据链(如Java中间件GC前后的吞吐数据)、宕机分析要能画出CPU核间冲突因果图。
鼎道智联总经理李晋渊(转写作李进渊/顶道智联,按议程校正)则贡献了普及侧的三道坎和联合落地的样本。三道坎是:用不起来(有用户直接问“什么是API、什么是Token”,80%的用户搞不定命令行安装)、不敢用(他引用公开统计称国内80%以上企业生产部署要求私有化)、用不起(AI coding推进激进的企业,工程师月账单轻松过万,财务月底就要来问投入产出)。鼎道智联的DingOS与阿里云Agentic OS联合版本在联想ThinkCentre X Tower上做了验证,主打四个字:看得清(任务轨迹、token、资源的系统级统一观测)、管得住(可审计、可干预、可追溯)、用得省(借助龙蜥的token治理能力实现30%以上token节省)、跑得长(工作区毫秒级快照恢复)。这家公司今年3月31日随联想发布了首批“给AI用的电脑”YOGA AI Mini和Think AI Tiny(媒体戏称“龙虾终端”,因为预置了OpenClaw一键部署),是“AI原生智能终端”品类的第一批产品。李晋渊还留下一件值得长期验证的预测:目前手机端吐出的token超过95%由云端算力提供,随着端边算力和隐私需求增长,几年后端边侧承接的token生产可能反转到80%以上——这属于单一嘉宾判断,本文按预测处理,未见第三方佐证。
四、AI吃掉OS研发本身:范式与十倍杠杆
论坛里最“内生”的一讲,来自龙蜥社区发行版技术工作组负责人王江波——他用自己团队两三年的实践回答“AI如何改变操作系统的生产方式”。背景是发行版的复杂度:成千上万个软件包、100多种架构与制品的交付组合、龙蜥社区5年维护标准(国内友商多为4年,商业版13年)。他讲了一个1890年到1920年的类比:美国制造业很早就给蒸汽机装上电机,但到1905年电器普及率只有5%,直到1920年流水线和研发流程彻底重造后才到50%——把AI嫁接进旧流程不等于范式转换,流程重组才是普及的前提。
四个范式里最有信息量的是前两个。范式一:确定的事情让流程(Workflow)做,不确定、模糊、“最后一公里”的事情交给AI。他们最初把全部工作交给AI,结果“在这台机器能跑,下一个同学桌面就跑不稳”;春节OpenClaw爆火后他们又给OpenClaw写了很多插件,然后发现插件维护成本高于收益——OpenClaw几乎每天一个正式版本、日均200到300次commit,追不上。三个月摸索后收敛为工作流固化+AI按需插入。范式二:让AI七乘二十四小时跑下去、人只在必要决策时介入——用outer loop(把同事打断、bugzilla问题抽象成事件喂给子agent)加inner loop(保证单点正确执行)的双层循环实现。范式三讲功能边界:通用能力拿来主义(“技术平权”时代等一两个月常有更通用方案,别自己造轮子),垂直领域做深。范式四最大胆:既然模型上下文窗口越来越大(他提到昨日发布的新一代千问参数量约2.4T——与Qwen3.8-Max公开规格吻合),就把整个发行版数据面放进一个AI可解读的monorepo(单一代码仓)里,让AI发现人发现不了的包与包之间的关系,选型、构建、修复“之前人击鼓传花的东西一句话搞定”。
量化成果也来自他的口径:对两三千个软件包的构建流程做AI改造,此前约需8000到12000小时(70到80人月),提效10倍;CVE修复采样了约18万条社区与理事单位数据,用“生成代码的agent+review的agent”互搏、人只兜底;RISC-V跨OS升级适配中,AI自动完成软件包分层、依赖图谱与差异取证,业务方拿到报告时的反应是“震惊”。他的行业观察同样直白:龙蜥支持的架构从2款涨到5款,人没有涨5倍,靠“人+AI”补上了gap;红帽、SUSE的人力规模不再是最难逾越的壁垒,“怎么把AI用得更好”才是下一个竞争点——Agent与AI Native阶段给了中国操作系统一个罕见的弯道窗口。
阿里云高级技术专家王卓压轴讲了SAIL(Seed of AI Library,平头哥2026年开源的真武PPU软件栈)与PyTorch生态的兼容共建(阿里云今年已成为PyTorch基金会白金会员,官方于6月宣布,嘉宾口头称5月,正文按“今年”处理)。三个技术点都给出实测:NoGIL(去除Python全局解释器锁的多线程方案)让序列化/反序列化性能提升4到5倍、loss计算2倍、Web服务1.5倍,代价是内存翻倍(已修复,从20MB回到10MB量级),目前在PPU上达到生产就绪;Torch Compile与PPU独有的AIO内存特性结合后性能从75%恢复到约110%;PPU原生插件绕开CUDA兼容层直连自家SDK,典型算子最高11倍以上提升,某具身智能客户端到端约7.48倍。“摆脱兼容层”同时买了性能上限和自主可控——这是软件栈层面对“Agent基础设施”的最后一格拼图。
五、把这场论坛翻译成三件事
**第一,看懂价值迁移:OS层正在变成agent时代的“性价比杠杆”。**机制链是:Agent负载特征(自主规划、按需隔离、长程任务、异构协同)→框架吸收不了的优化下沉到OS(Loongkit、Agentic OS内核优化)→用户获得“换OS=40%性能”“token省30%”的直接收益 →二阶影响是硬件采购与云账单的评估单位从“算力峰值”转向“单位token成本/单机沙箱密度”。对读者的启发:在评估任何agent基础设施投入前,先检查一遍存量——升级操作系统和运行时可能是被忽略的最便宜的扩容;同时把token预算纳入系统级监控(阿里云和鼎道的联合方案已证明这在工程上可行),而不是等月底账单爆炸。
**第二,看懂权力转移:裁决权正在从模型层回到系统层。**机制链是:概率系统进入生产环境 →“敢用”成为准入门槛(80%企业要求私有化)→模型自裁不可靠(目标冲突、规则可自我绕过)→裁决与约束下沉到OS(三层Harness、eBPF观测、自主权分级、意图总线)→二阶影响是“系统级ABI/契约”(调度、授权、状态、进化四类契约)成为下一个标准之争,而龙蜥SkillHub这类“专家经验资产化”平台是争夺开发者的事实接口。启发:做agent产品的架构评审时,把“被约束者不能当裁判”列为必答题;给每个高风险动作设计分级授权表和证据链输出,这不仅是合规,也是把agent从demo推进生产的工程路径。
**第三,看懂组织变化:AI重塑的不只是产品,还有生产函数。**机制链是:复杂度增长快于人力(架构数翻2.5倍、人不变)→AI补位但直接全托管不稳定→流程/AI分工范式(确定归流程、模糊归AI、双层循环)→十倍级提效(构建70-80人月→约1/10)→二阶影响是基础软件竞争要素从“人力规模”转向“AI工程化能力”,红帽SUSE式护城河被相对削弱,而skill/知识库成为工程师经验的新沉淀形态。启发:团队引入agent的第一步不是选框架,而是把工作切成“确定/不确定”两堆;把资深工程师的判断力封装成可复用的skill资产——Arm、AMD都在这么干,这个打法对任何垂直团队都成立。
论坛结尾是第四轮抽奖,特等奖SKG按摩仪,主持人调侃“抽奖系统可能有点激动”才吐出中奖名单。这个不完美的小插曲倒是意外地贴合整场论坛的隐喻:所有人对智能体的期待和担忧,本质上都是同一件事——它很强,但它需要一套让它“敢被托付”的系统。这套系统长什么样、标准由谁定,2026年9月23日下午这场三个半小时的讨论给出了各家筹码,答案还在路上。