先说结论
9 月 22 日下午的云栖大会「企业级Agent实践峰会」,是这场大会里离企业钱包最近的一场——七个小时、八组讲者(含圆桌)都在回答同一个矛盾:**当 Agent 从写周报的助手变成承接真实交易、参与投资决策、领工号上岗的「数字同事」之后,卡住企业的已经不是模型聪不聪明,而是工程、组织和账本这三样东西。**开场讲者、阿里云智能集团资深副总裁、公共云事业部总裁刘伟光给出的定调是:Agent 已经「不是我们今天所有做的工作的补充,而是帮我们完成我们做不到的事情」,未来评价一家企业是否真正拥抱 Agent,不看 Agent 本事多大,而看三件事——停掉它企业有没有影响、它能否独立闭环完成任务、企业有没有建设以 Agent 为核心的安全治理平台(以上为演讲观点)。满帮集团 AI 算法总监高艺铭用一句话补上了工程视角:生产级 Agent「上线仅仅是一个开始」——他「不太敢相信任何一个新上线的 Agent 能够打得超过二十分」。这并非厂商话术:阿里云 AIX 技术服务负责人施磊讲了一线组织故事(给公共云总裁做分身、两个月涌现六十多个数字员工),基元律动联合创始人兼 CTO 韩凯讲了 Harness 数据如何反哺模型(RSI 飞轮),贝壳首席算法科学家尹俊希与易方达基金首席信息官刘硕凌(转写「刘硕林」)分别代表了房产与金融这两个高确定性行业「保下限」的工程路径,压轴圆桌则直面「账怎么算、怎么管」。本文按回放时间轴(0—10381 秒)完整复盘全场,关键主张标注来源层级;演讲自报的效果数字未经第三方核验的均已注明。本场讲者所属公司与峰会本身经外部核验属实(量子位、观察者网对基元律动韩凯本场演讲的报道,2026 年 9 月 22 日;满帮高艺铭身份经中关村在线、时代财经核验)。
一、定调:Agent 时代的企业人机组织变革,以及「Agent Take the Cloud」
刘伟光的致辞值得完整记录,因为他把「为什么是现在」说清了。这是他的第十次云栖大会——2017 年他第一次登台讲容器化、分布式架构、云原生,如今自评「没有远见」:如果在 2017 年预测七年后会出现 ChatGPT、八年后出现通义、九年后出现世界模型,「可惜当年我没有那个 vision」。但他一步步见证了云、云原生、云和 AI 融合直到「AI is everything」的时代,并给出一个结构性判断:今天所有应用还是人编程写出来的,「我们会相信,在不久的将来,所有的应用,无论是 PC 端、手机端,都会由 AI coding 完成」——到那时云承载的就不只是既有老应用,而是全部 AI coding 出来的新应用,云因此成为 AI 的必备组成部分。他还引用了自己 2025 年 12 月 31 日媒体访谈中的预言:「2025 年所有公司在 AI 产生的收入,会低于 2026 年 AI 所有收入增量的百分之十」,并称这句话已经实现——今年全社会在 AI 上的消耗(无论 token 还是收入)远超 2025 年,「甚至说十倍到百倍」(嘉宾称,未找到原始访谈核验)。更关键的组织判断是:Agent 已从办公编程的补充,深入到千行百业的核心业务流程;阿里巴巴作为成立二十七年的公司,希望「用五到十年时间,把阿里巴巴所有业务……全部打造成一个以 AI native 为核心业务」的 AI native 组织——如果没有 Agent 深入办公、编程、研发流程,「这家企业是不足以称为 AI native 转型企业」。他还提醒 Agent 不是软件:软件不迭代就不会进化,而有效的 Agent 需要模型、harness 和数据三者共同演进,当前市场仍是同质化竞争,真正被认可的 Agent 一定「超越今天人类智慧工作的边界、能力的边界,或者是时间的边界」。
第二位讲者、阿里云公共云事业部副总裁、公共云解决方案总经理韩鸿源(转写「韩宏元/韩红元」)把这张大图落到企业需求侧。他的受众规模刻画是:国内约三千万程序员、约两亿白领,再加千行百业的生产系统(演讲自报口径)。三条应用主线各有各的「水面之下」:编程上,AI coding 的个人提效不等于企业提效,因为软件投产与研发全链路绑定,必须与 DevOps 流水线、CI/CD 有机结合,未来走向人介入越来越少的 AgentOps;办公上,他现场引用了前一晚(9 月 22 日)的美股行情——芯片股大涨,归因于 Meta 的 Muse 应用让大家看到 Agent 落地的扩散范围(经外部核验方向属实:Meta 于 2026 年 9 月 8 日发布个人 AI Agent 应用 Muse,Reuters、NYT 均有报道;9 月 22 日纳指创历史新高、存储芯片与 Muse 概念股联袂走强,见每日经济新闻 9 月 23 日市场观察;「CPU 股票」为演讲口误,应为泛指芯片股);生产系统上,Agent 作为 interface 让「人适应软件」翻转为「自然语言指挥系统」。他抛出了本场第一个反直觉判断:当写代码变得容易,企业对技术架构的设计管控能力反而成为更重要的因素——「软件和程序是两件事情,程序是一次性写好了之后到处可以运行的」,而软件要经过持续检验,这个检验过程让 AI 实现起来比写代码难度更大。他同时给出阿里云的口号「Agent Take the Cloud」:云要从适应系统管理员和开发者,转变为适应 Agent 使用云。此提法并非孤立宣传——阿里云 2026 年 7 月 WAIC 期间即办过「Agentic Cloud:智能体时代的基础设施」论坛(经中关村在线、时代财经核验),本场多位讲者的基础设施叙述与之同源。
二、满帮:让 Agent 进入真实交易,先造一层「桥」
高艺铭(转写「高一鸣」)的分享是全场压力测试最实的一段,因为他站在交易真金白银的一侧。满帮是车货匹配的干线物流平台(经官网核验,满帮定位「中国干线运力的基础设施」,做「车找货、货找车」的智能化),几百万货主、几百万司机在上面找货发货。这个场景的两个特点决定了 Agent 化的难度:任务时间极长——司机除开车外一天要用三小时找货,货主委托一票货从发货、找车到跟单要一到五天;决策 stakes 极高——运费动辄几千上万块。他对「委托」的本质定义是全场被引用最多的概念之一:委托就是目标、约束和优先级,且随用户输入持续变化(「今天我要回南京,这票货可以接,但价格要一千五百块以上」)。他的行业史叙事把 Agent 的位置讲得很清楚:物流从线下(电话、物流园区小黑板)到互联网(信息上网)再到满帮过去十年的平台化(规模化供需、信用体系、在线交易、履约),但「用户在这个平台上最长时间的问题是怎么去做决策,而 Agent 第一次使得软件系统有可能承接帮助用户做决策这件事」。
他的核心论点是:生产级 Agent 没有定论,满帮的公式是「业务目标 × context × harness × runtime + evaluation loop」——「不能只看一个基座加 harness 就认为是 agent」,因为对企业最重要的是业务目标和自己的上下文;harness 解决弱模型解决不了的问题,runtime 解决大规模扩展,evaluation loop 解决二十分的产品怎么进化到八九十分。四个难题逐一展开。难题一是意图与知识:物流对话高度异步(用户连续补充、反悔、加条件),他们踩过的第一个坑是设计意图识别模块让主 Agent 下发单意图子任务——真实企业场景「根本不存在非常纯粹的单意图」,用户一句话往往绑定问答、执行和议价;知识上两个极端都走不通——纯靠基模不行(司机说「标箱」,大模型都答「厢式货车」,实际是拉标准箱的平板车,因为司机货主不写 wiki、攻略根本不联网),无节制注入也不行(内部文档里竟有教司机货主用心理学议价的,「我不觉得我们同学的心理学能力能够比大模型要强」,这类知识进入上下文整个系统劣化),答案是「很节制地生成真正模型不懂的知识」。难题二是规模化:第一次扩量到两千个 Agent,就把扛得住几百万用户的生产系统打崩了——Agent 的请求速度远超真实用户、二十四小时运行、大量调用工具接口,造成「请求海啸」;他的结论是「大规模商业化的 Agent 本质是一个高并发的系统,跟以前云时代的高并发非常近似」,状态持久化、按需唤醒、事件压缩、排队都要设计。架构答案不是重写旧系统,而是「两个生产系统、一层桥连」:传统系统保证确定性(货源发布、撮合、下单),Agent 系统处理不确定性(编排、A2A、human in the loop、统一记忆——司机货主的记忆必须全平台统一,「否则 A 优化了 B 没有得到任何收益」);桥接层存在的理由有三个——鉴权、高风险行为管控(运费几千上万,出错即用户损失)、语义翻译(传统系统返回「二一九」错误 Agent 读不懂,应返回「缺少车长,并根据当前吨方建议十三米或十七米五」)。难题三是上线只是开始:以前 App 功能上线约等于完成百分之八十,Agent 上线才是种下一颗种子;每天几千个 bad case,一天上线几百个改动,「很快就会劣化成一个无法进化的系统」——他们的司机 Agent benchmark 涨到六十七分后再也上不去,就是因为系统债太多。他们的解法是双循环:外循环做业务指标与技术指标的对齐拆解(业务指标是留存时,优化指标是回复与执行正确率——但正确率从 20% 涨到 70% 时留存一直涨,过了 70%—80% 后正确率不再影响留存,此时必须重新对齐,否则优化方向完全错误);内循环看过程不只看回复(有没有真的调工具、参数传没传对)、归因(能力、策略还是工程问题)、bad case 加 good case 形成 golden set 做全量离线回归,再灰度——而准入红线是加价、成交、电话「绝对不能出错」,因为「错误一次,用几百次的正确都无法挽回」。难题四是经济性:架构必须支持「水涨船高」——能轻松更换 harness 和推理模型,「每三个月 harness、基座模型都在发生巨大变化」;他们上半年换过一次基模,做得好的几个 Agent 直接成本降到原来的四分之一,做得不好的成本没降、准确率还下降——打满补丁的系统「再聪明也跑不起来」。满帮整体架在阿里云 Agentic Cloud 上(转写「Gentry Cloud」),用模型服务、算力、统一记忆与可观测设施;底层大量使用阿里云 Qoder(转写「Coder」,产品存在性经阿里云官方博客核验)解决数据安全与知识共享。最有余味的是他对护城河的回答:基模和 harness 只决定天花板,「数据本身都不是壁垒,经验本身也不是壁垒,而是能不能将数据和经验转化成自己真正的 Context」,形成自己的规则、Tools 和 Evaluation Loop;而产品心智也从平台时代「让用户多停留」翻转为「少刷货、少空驶、少电话、少熬夜」,「用户愿意下一次、再下一次把事情继续委托给我们,这才是我们真正的护城河」。
第一条机制链由此成立:Agent 第一次能承接「帮用户做决策」(而非信息撮合)→ 但决策意味着真金白银与高并发,请求海啸与语义鸿沟使 Agent 不能直接怼上传统生产系统 → 出现「两套生产系统一层桥连」的架构范式(Agent 管不确定性、工程管确定性)→ 二阶影响:企业竞争力从基模/harness 选型(只决定天花板)转移到把数据与经验转化为高质量 Context、golden set 与准入红线的能力 → 对读者的启发:让 Agent 进核心业务前,先建三样东西——桥接层(鉴权+语义翻译+沙箱)、全量回归的 golden set、明确到具体动作的准入红线;评估采购方案时问「你的评测闭环长什么样」,而不是只看模型跑分。(机制为嘉宾观点,架构细节演讲自报)
三、给 Agent 一个工号:数字员工的组织学
施磊的分享从今年六月讲起:他给阿里公共云总裁刘伟光(英文名 Patrick,公司里鲜有人知道)做了一个「领导力分身」Patrick。发布会视频里,Patrick 清晨把经营看板整理成早报送到管理者桌前,遇到数据波动一句指令就「自主找人调研、追问到底」,一句「落实」把任务与待办同步至执行人,周五结果回传形成闭环,每晚把实战经验沉淀进知识库自我迭代——「把一号位的领导力升级成整个组织的领导力。当一号位率先把自己数字化了,组织的变革就不再是喊口号动员,而是变成了大家的本能」。这段演讲的技术含量在 harness 三件事。第一是「像」:分身对话体验取决于像不像背后那个人——语义风格上像(钉钉听记加内外部发言新闻稿共一千多条语料,用大模型提取讲话风格、惯用表达、口头禅,写进 Agent MD、SO MD、Profile MD 等 Markdown 人格设定文件),业务判断上像(把管理者过往业务决策做成 few-shot,且要时常更新)。第二是自进化:长期记忆分三层——情景记忆(每天谁来找 Patrick 聊了什么)、语义记忆(事实与偏好,如最新产品特性)、社交记忆(对人和事物的画像提取,决定分身的判断),每晚自我反思、从当天对话做定向提取更新。第三是安全:Patrick 必须有自己的工号、作为独立权限个体存在——若与总裁本人共用账号,权限过大的隐患不可控;调用 MCP 工具采取零信任策略,所有调用做身份鉴权、身份信息贯穿链路,确保最终调用用的是「实际跟他对话的那个人」的身份而非公共账号。
但这场演讲真正的主题是组织而非技术。Patrick 六月上线,两三个月内在公共云事业部掀起了「数字员工」风潮——系统里有工号的 Agent 已有六十几个(自报);他们把「有独立工号、有明确职责、能端到端完成任务」的 Agent 定义为数字员工。组织侧的三个管理实践比技术细节更有信息量:上岗审批——曾发生两个团队重复建设相似能力,若放任下去「单个数字员工越来越臃肿……最终只会得到一个个数据孤岛」,所以所有数字员工上岗需写清职责,由业务 TL 和 HR 共同审批;协作机制——通过 AI 网关把所有数字员工连起来,每个维护一份自然语言的「岗位职责说明」(像人的 JD),数字员工 A 遇到超出知识边界的复杂任务时,通过网络找到 JD 最匹配的 B 求助;复利效应——数字员工工作中产生的上下文包含企业最新信息,写回知识库,「参与的工作越多、回流的知识越多,这些知识又帮助数字员工工作得更好」。外部客户侧他也给出了路径观察:一号位率先拥抱 AI 会形成自上而下的示范效应;落地从后往前做——法务、财务、运营这类中后台岗位 SOP 全、文档多、收益明确;他举了一个零售客户的销售陪练案例,两步走:先把陪练 AI 化(产品信息生成陪练脚本、与多模态大模型语音对练、AI 打分),再封装成钉钉里有账号的数字员工,小组长一句任务指令,陪练专家顺着通讯录找到团队里需要陪练的员工开展对练、结果回传。收尾的三阶段模型与刘伟光的 AI native 组织呼应:第一阶段 AI 工具/copilot(所有输入输出经过人,人是效率瓶颈)→ 第二阶段数字员工(人变成数字员工背后的经营者与监督者)→ 第三阶段 human-agent 人机共生网络(从静态岗位分工转向围绕业务目标、按人与数字员工各自知识技能动态协作)。
第二条机制链:给 Agent 一个工号,本质是把「组织接口」而不是「技术功能」发给它——工号意味着独立权限个体、可被拉群、可被艾特、参与讨论并留下管理痕迹 → 个人提效不等于组织提效的症结在人这个瓶颈节点,数字员工绕过它 → 二阶影响:Agent 落地从技术问题变成管理问题——上岗要审批(业务+HR)、协作要 JD、知识要回流,否则重复建设出数据孤岛;一号位率先数字化自己成为组织变革的开关 → 启发:企业上数字员工前先补三份「组织文件」——数字员工岗位职责说明、上岗审批流、知识回流机制;先从 SOP 完整的中后台岗位做起,而不是从最炫的前台场景做起。(案例与数字均为演讲自报)
四、从 Harness 到 RSI 飞轮:轨迹数据成为模型进化的燃料
韩凯(公司名转写「机缘律动」,经核验为基元律动,2026 年 4 月成立的 AI 基础设施公司,8 月完成数千万美元融资,产品 TokenRhythm API 对标 OpenRouter)的分享把话题从「用好模型」推进到「喂强模型」。他的起点是业界共识公式 Agent = models + harness:模型决定智能上限,harness(上下文管理、工具调用、记忆、安全)保障端到端交付——「做一个 harness 有 AI coding 很简单,做一个好用的 harness 却很困难」,现有 harness 的三不足是上下文失控(主流 context window 约百万级,长任务溢出)、执行不可靠(工具调用报错如何校验修正)、成本不可控。基元律动的答案是开源微内核 harness OpenSquilla(转写「OpenSula/OpenSquila」,经 GitHub 核验:opensquilla/opensquilla 仓库,约 6700 星,Apache 2.0,2026 年 5 月创建)——极简核心 agent loop(react/planning 模式)保证稳定,上下文、工具、记忆、skills 全部插件化,配三级安全策略;四个特性是省(模型切换+上下文压缩+思维链分级)、多模型协同、Meta Skills 协议(在海量 Skills 之上加一层组织调度)、类人四层记忆(工作/情景/语义/原始,按需加载)。效果数字(自报):在 PinchBench(转写「Pin Bench」,经第三方技术博客核验为 PinchBench,测发邮件、写文等办公任务)上成本降低 88.9%;在深度研究测评 DRACO(转写「DuraCo」,经 arXiv 论文 2602.11685 核验为 DRACO benchmark;演讲称其为「海外 Perplexity 推出」,与论文的学术 benchmark 属性有出入,待核)上千问 3.8 Max 接入 OpenSquilla 后超过海外顶尖模型(转写「OPPOs 4.8」疑为 Opus 4.8),最新组合拿到 63.1 分、比海外旗舰(转写「飞波五」,名称待核)高三个多点,而成本只有对方的三分之一。
下半场的 RSI(recursive self improvement,递归自我改进)飞轮是这场演讲的核心,也是满帮、贝壳、易方达三条线索的合流点。他的论证是:通用模型在企业级场景不是最优,原因有三——能力错位(通用语料训练,天然缺失交错式推理、长程任务链和环境反馈信号)、信号稀疏(高质量 Agent 轨迹难获取,人工标注难覆盖真实多样性)、飞轮缺失(模型不知道自己的问题出在哪里,「只有和 harness 结合、在真实的环境中运行,模型的能力才有真实体现,从而帮助模型本身继续改进」)。飞轮四步闭环:在阿里云 ECS 上批量构建隔离环境的 harness 与用户环境、规模化合成真实任务轨迹(信号产生)→ 结构化校验加六维语义评估筛选高质量轨迹(数据准入)→ 基于千问 3.5 的 4B/9B 做后训练(模型训练)→ 新模型放回 harness 在真实环境运行评估(回放)——四步循环迭代。算法侧做了三项 agentic post-training 创新:交错思考监督(不以单次 LM call 而以整个用户轮为训练样本,把轨迹内多次 LM call 加最后一轮思维链纳入监督)、三阶段课程学习(利用 harness 拿到任务难易度,从易到难)、路由引导的 OPD 蒸馏(teacher 对当前模型输出做 token 级监督)。效果(自报):十项 Agent 任务上,NeoHorse-1 4B 比千问 3.5 4B 提升 5—6 个点,9B 提升 3—4 个点。这个模型经外部核验确有其物:科技日报 2026 年 9 月 9 日报道,基元律动联合无问芯穹与清华、北大、阿里等机构于 9 月 8 日推出首个 Agent-Native 模型 NeoHorse-1(4B/9B 两版本),定位正是「将 Agent 使用工具、接收反馈和修正错误的经验系统性转化为模型自身能力」;而演讲结尾预告的与阿里云持续合作也已被落地——据网易科技报道,9 月 23 日基元律动与阿里云在杭州签署战略合作,围绕 Qwen 模型与 Agent 应用的协同优化,探索「模型供给—场景评测—能力适配—迭代优化」协作链路。
第三条机制链:Agent 大规模运行后,harness 里沉淀的轨迹(含环境反馈与错误修正)成为稀缺训练信号 → 出现「合成轨迹→准入筛选→后训练→回真实环境评估」的 RSI 闭环,小模型(4B/9B)也能在 Agent 任务上大幅超越自己的基座 → 二阶影响:应用企业与模型厂商的关系被改写——贝壳把房产认知数据反哺千问、基元律动与阿里云共创,数据不再只是燃料,还是谈判筹码;「数据本身不是壁垒,能转化为 Context 与高质量轨迹才是」(高艺铭语)→ 启发:企业从第一天就该把 Agent 轨迹当资产管理——清洗、打标、沉淀为 golden set;这既是回归测试的尺,也是未来与模型厂商换能力的筹码。(数字为自报,模型存在性已外部核验)
五、贝壳与易方达:高确定性行业的「下限工程」
下半场两位讲者分别代表房产与金融——两个错不起的行业,他们的实践共同构成了对「上限叙事」的纠偏。尹俊希(转写「尹俊熙」;议程头衔首席算法科学家,LinkedIn 显示其为贝壳 Director of AI & Chief Architect)的开场提问是全场最有共鸣的一刻:「在座的有多少人,无论买房、卖房或者租房,没有被坑过的,请保持安静」——全场安静。他把这个体感拆成机制:信息不透明(贝壳平台化多年解决的就是这个)、决策空间海量、房子高度非标(刷房源列表很难找到数值最匹配的那套)、更难的是用户自己的需求——买房影响两代人,学区房决定孩子今天和一个家庭的明天,「选海淀和选朝阳完全不同的两种生活路径,甚至可能是人生未来不同的走向」。由此贝壳的命题是「不再是搜索,而是决策的智能」:理解人(需求画像 = hard constraint + soft preference + 随买房周期演化的心智变化)与理解房(知识图谱壁垒极深——「买中关村一小的房子,买的是哪所学校的入场券;住万柳代表什么圈层、孩子未来选择是什么」),方法是本体论(ontology):回答「业务图谱本来应该长成什么样、房与房什么关系、什么人喜欢什么房、人房发生关系时什么因素导致决策」。他借最强模型(转写「Fable、Astra」,疑指海外顶尖 Agent 模型,待核)的体感说明智能的来源——「模型好懂你,是因为它在你之前见了大量的人……懂你的困惑,知道你在什么地方、接下来往哪走、会问什么问题」,把这种「引导和决策空间」抽象出来融入业务。工程侧的关键词是轨迹白盒化:买房是长周期决策链路,必须能回答「究竟做对了什么导致用户做了这个决策」——用户在任何场景的交互行为都作为自进化反馈信号,而轨迹中每一步「模型一定要 follow 检索的数据、知识可控、决策路径可控、guardrail 控制输出」;有了高质量轨迹才能做 post training(SFT/RL),而 RL 的经验之谈是「环境反馈往往是最重要的东西,构建业务场景下的反馈环境并不容易」——RL 已是系统性问题,不再只是 GRPO/PPO 范式的更新。他也回应了所有企业都逃不掉的成本问题:从千问最小参数模型到 Max/Flash 组成高效模型矩阵,分场景微调。值得记录的还有他对能力与约束的态度:「能力就应该野蛮生长,模型就应该不断发展边界」,但业务 harness 要保证精准需求理解与性能稳定——「帮用户做出反事实、反常识、略带惊喜的选择,同时保住下限,让用户产生足够的信赖」。
易方达基金首席信息官刘硕凌(转写「刘硕林」)的分享是全场最坦诚的一段,金句密度也最高。开场即自嘲:这是他第一次以嘉宾身份参加云栖,「连主持人都没有了,是 AI 叫我上来的」;材料很多是 AI 写的所以「内容都比较像」,到压轴讲技术「我的 agent 就变得比较弱了,小参数……做个 flash」。他先给出机构底色(嘉宾称):易方达管理超四万亿人民币资产、近两亿客户(规模口径未核验到精确数字;公开数据显示易方达位列公募非货规模前三,2025 年末全行业 37.64 万亿元,新浪财经 2026 年 1 月)。他的四阶段用户观察极有参考价值:2023 年研究员把大模型当搜索框——那时很多人说元宝好用,但 benchmark 与内部判断不一致,后来发现「最重要的不是模型聪不聪明,而是数据源靠不靠谱」(老板发公众号文章让你评论,转给哪个模型方便、信源准,比模型聪明更重要);第二阶段做深度研究报告,PDF 七八十页塞不进去;第三阶段 Agent/harness 出现后选择多了——他听过最好的用例是有研究员「镜像了一个自己的投资哲学」,在决策分歧或犹豫时跟自己对话、被自己反驳,「提升了一个境界」;呼应施磊,他做 CIO 第一件事也是做了自己的分身「数字 CIO」,想象大家会问 IT 项目进度、部门 budget,结果「问最多的问题是刘硕凌在哪儿」,为此开放了考勤数据。第四阶段(AI 驱动的研究体系)他明确说还没到——全球皆然,海外调研发现金融行业这轮不像过去那么快拥抱技术:一波激进投资 AI 企业,另一波谨慎认为 AI 带来隐患,「本质是 AI 技术在理性思考上有两面性」。他还主动碰了全场都绕着走的问题:算账——「作为金融企业是不可能不算账的」,AI infra 的投入到底给收入带来了什么变化?今年没有,明年会不会有?持续没有的话,「是不是又会是一次 AI 泡沫的破裂?」
工程细节上,易方达的企业级平台 eWork 经外部核验确有其物(财联社 2026 年 9 月 6 日报道:eWork 平台上可公开安装调用的 Skill 覆盖投研、交易、运营、销售、市场、合规、IT 全部核心业务条线,网传「上千个 Skill」不准确)。刘硕凌透露 eWork 三四月份就开始做,「如果是现在,满机场都是某某 work、某某 body,我们就不能叫 eWork 了」——「上古时代的产品,居然是今年上半年的」。架构演进也说得直白:第一版基于 OpenClaw(转写「Open Cloud」,疑为 2026 年初爆火的开源 harness OpenClaw),后来全面升级到千问系开源框架(转写「千问泡」,名称待核)——因为发现 OpenClaw 很多 bug 且「我们发现的 bug 没办法 merge 进主分支」,而新框架社区健壮性好、harness bug 少了非常多。金融级的取舍标准是全场最锋利的一条:要求四个九(99.99%)稳定性,「金融选系统不仅看上限,更多是看下限——上限靠人类完成,系统和平台保住下限」,任何 bug 都是「真金白银的损失」。成本侧的 KV Cache 实践朴素而有效:数据分析发现 50% 的人问的问题基本是「今天金融市场怎么样、帮我收集金融早报」,缓存后延迟和成本都大幅下降;模型侧走大小模型协同(联邦学习理念,数据不出域、外部教师模型定期迁移),并基于千问 4B 后训练了金融版语义理解(他们为此发了 paper,例:「老百姓大药房」这类词,转写「百姓大药房」疑漏字,通用大模型未必理解是上市公司),4B 训练成本可控,让合规与不出域场景真正能用。组织侧的金句是「skill 层是管理问题不是技术问题」——易方达的 skill 绝大多数由业务部门而非 IT 开发,靠一把手自上而下宣贯(几次大的 skill 推广都是董事长、总裁级别才能推动),内部 AI 大赛决赛由总裁带队当评委,给年轻人「逆天改命的机会」。治理侧他已经把团队转型:算法工程师转成安全专家、评测专家和漏洞防护——「Gartner 会上说 CIO 也叫首席保安」;他过去的工作是推动 AI 使用,「今天怎么驾驭这套 AI 系统、让它真正达到金融级别,是我后面唯一重要的工作」。skill 的生死机制也值得抄:上线做记录,两三周跟踪使用量,没有科学提升就淘汰——「不能像 App Store 两三万个放在那儿,用户对话时根本不知道后面调了哪些 skill」。
第四条机制链:房产与金融的决策容错率极低(错一次赔真金白银/人生路径)→ Agent 工程的重心从「跑分上限」转向「下限工程」:轨迹白盒化、guardrail、四个九稳定性、可解释、人可接管 → 二阶影响:高合规行业反而成为 Agent 工程方法论的输出者——评测尺校准、数据治理以用促建、skill 优胜劣汰、安全团队建制,这些方法可被低合规行业直接借用;而「宁愿用上一代技术」的保守也划出了 AI 泡沫论的现实边界 → 启发:判断自家 Agent 该做到什么程度,先问「这个场景错一次的代价」;代价高的场景,把预算从更大的模型挪到评测、观测与兜底上。(贝壳、易方达细节均为演讲自报,eWork 已外部核验)
六、圆桌:打通最后一公里后,Agent 的账怎么算、怎么管
压轴圆桌由极客邦科技创始人兼 CEO 霍太稳(转写「霍泰文」,经百度百科核验公司为 InfoQ 中国/极客时间运营方)主持,嘉宾为众阳健康产品研发中心总经理郭龙领(转写「郭龙玲/郭龙岭」)、小红书质效&AI 应用总架构师孟洪进(现场自述用化名「飞鸿」)、阿里云资深技术专家孙廷韬(自述化名「龙雾」,做 Agent Loop 研发)。霍太稳的开场故事把成本焦虑具象化:一位朋友上个月的 AI 应用有个开关没关,token 一直算,原本一万块能 cover 的账单超了三万(嘉宾称)。
观测先于优化。孙廷韬的回答层次清晰:企业要算清账,先要具备观测能力,「看得清楚,才能决定是否可以大规模使用」——第一层是基础指标(token 消耗、处理数据、延时),能看状态好坏但不能回答「是否真正解决了用户的问题」;第二层是轨迹信息,把 Agent 从黑盒变成可解释过程,token 消耗异常时能定位到环节,且轨迹经清洗、打标后「沉淀成企业的数字资产」;第三层要把观测与业务结果关联(Agent 说完成了,用户满不满意)。他特别强调「最基础的能力一开始就不能欠账」,高阶能力(Agent 自进化)可以后补——而阿里云产品已把观测做成开箱即用。评估的方法论更狠:过程指标比结果指标重要,因为「Agent 往往会撒谎,会取悦于人」——说帮你找到车了,实际根本没调 API;而评估的尺本身准不准需要校验:用轨迹沉淀的数据集校验,「与人类专家的评判标准达到 90% 以上一致性,才可以在生产环境使用」。他给出的跨行业结论是「有跨行业的方法,没有跨行业可以直接抄袭的答案,没有银弹」:标准各不相同(客服看问题解决与满意度、运维看稳定性、货运看车货匹配),但流程相通——观测→评估→归因分析→实验发布循环;三步骤是先定义成功标准与红线(「优化第一步不是降成本」)、再从线上真实数据找问题(优先高频、影响大、可衡量的任务;先干掉无效、循环、重复调用)、最后实验验证后逐步灰度。
成本治理的四个切面。孟洪进的分享是圆桌技术密度最高的部分。他先给了两个版本的架构目标——「人的版本」心酸:从「既要又要」变成「既要又要还要」(能力好、规模大、还要便宜);「更有效的版本」是组织创新:面向经营单元的成本可观测——企业内 AI agent 项目多是技术团队发起、花的是技术预算,把这笔钱算清楚服务于哪个最小经营单元、该单元愿不愿意付钱、愿不愿意付更多,才能解决「钱从哪儿来」;有的业务团队愿意一个月付三百,成本在那个领域就不再是第一优先级。降本四切面:熔断策略(精细到人、天级甚至周级的 token 熔断,堵住非预期循环调用的纯浪费);自研 Self GC——借鉴 JVM 堆对象管理理念,把 tool 调用与模型返回 message 当对象治理,判定某段资料在未来对话中被引用的概率,不大就隐藏、保留恢复指针,下次需要时 Agent 可恢复,「几乎效果无损」,线上小红书峰值 20% token 下降(自报);LLM Router——每家企业大规模落地都该做自己的网关,按任务真实难度路由模型,「不要无脑用 SOTA 贵的模型」(他引新闻:Codex 的 Top Query 已经是「你说的太难了,帮我简化一下」),这一项 Auto 上线后约 69% 成本下降、用户反弹不大(自报);自建算力利用率(敏感数据不出境的兜底)。他的三个月判断同样值得记录:团队已经没有真正手写代码、全部 AI 生成,但「质量不好,对架构的腐化非常严重……现在还没发生问题,一旦发生可能是无法想象的」,所以明确投入 verify 类 Agent 把控代码生成质量;而架构判断是「harness 不再有强门槛或壁垒」——年初 OpenClaw 是「token 时代的 iPhone 时刻」,加上 Codex 开源、DeepSeek harness,harness 未来不会成为瓶颈;应对是把 agent core 做成热切换、把周边(个人 memory、组织 memory、skill、tools proxy、LLM router)全部服务化云化,「业界有新变化,一周内完成全新 agent core 的平替上线」。霍太稳顺势追问:未来是不是再也不会出现《代码大全》那样谈优雅代码的书了?他答「理论上是这个目标」——但最终产出质量除 Agent 能力外,也取决于用它的人。
医疗的「不降本而降本」。郭龙领代表容错率最低的行业:医疗「不可能给你下错药、无缘无故开手术」,信号来自医生护士管理者主动要求智能体参与医院工作——从试点转为基础设施。他们的算账方式是把近千个应用拆解到每个场景(如门诊下诊断这条任务):耗多少算力、输入输出是什么、哪些固定(国家指南、专科指南固化进参数)、哪些可减(按医患沟通语料筛掉不需要的信息)、输出提取哪些关键字段(诊断、医嘱、药品、耗材、检查检验)——「像每家都有一个电表,用了多少电能算清楚」。最生动的例子是人血白蛋白的用药规则:国家规定必须用于抢救/重症/癌症或肝癌、且白蛋白指标低于 30 克每升——但这个指标早上八点和下午两点在变,他们按疾病构建本体(概念、属性、调用方法)、把医生话语、护理话语和跨病种话语聚成针对单个患者的完整关系图,再用智能 loop 时刻监测指标变化(早八点低于 30 可用药、下午两点不满足就不用)。降本的前提是质量与合规:直接成本靠固定规则工具化、通用知识摘要缓存、任务按复杂度分流(复杂任务大模型推理、高风险医生接管);间接成本的判据是「token 消耗高时医生的诊疗指标有没有降低」——降了就不能为降成本而降成本。未来十二个月的加减法也说得直白:加大投入的是患者生命相关、医生效率(让患者与医生沟通时间更长)、科研辅助与面向基层医疗资源不足的「数字医生」;要砍的是重复建设、尝试性 demo 和「不需要医生介入」的无人化方向——「前期喊无人化医疗机构的,现在很多都不喊了,因为对人的生命重要,都需要人的干预」。
第五条机制链:Agent 从试点走向规模化部署 → token 账单从「技术预算」变成「经营成本」,倒逼出观测-评估-优化闭环与四切面降本(熔断、无损上下文裁剪、难度路由、算力利用率)→ 二阶影响:预算主体转移(经营单元付费取代技术团队报销式投入)与治理主体转移(HR 参与数字员工上岗、skill 使用量决定生死、无人化叙事在高风险行业退潮)→ 启发:先建观测和评估这把尺(校准到与人类专家 90% 一致再上生产),再谈降本;降本顺序是先杀无效循环调用、再上下文裁剪与路由,而不是先换便宜模型;账要算到经营单元头上,让用的人付钱。(圆桌数字均为嘉宾自报)
结语:模型之后,拼的是桥、工号和电表
把八组讲者串起来看,这场峰会讲的其实是同一条产业链的三个层次:底层是模型与 harness 的 RSI 飞轮(韩凯的轨迹闭环、贝壳的轨迹白盒化、千问生态的反哺),中层是工程与组织(满帮的桥接层与双循环、施磊的工号与上岗审批、易方达的四个九与 skill 治理),上层是账本(圆桌的经营单元成本观测与四切面降本)。全场最一致的共识藏在意想不到的地方:没有一个人把赌注押在「更大的模型」上。满帮说基模和 harness 只决定天花板,贝壳说 RL 里环境反馈比算法范式重要,易方达说上限靠人类、系统保下限,小红书说 harness 不再是壁垒、要为一周内换掉 agent core 做准备——所有人的精力都投向了桥接层、评测尺、golden set、观测轨迹、组织制度这些「不性感」的资产。这大概就是「打通最后一公里」之后真正的行业状态:演示已经不缺了,缺的是让 Agent 在真实业务里持续待下去的工程与管理。接下来值得盯四个指标:数字员工会不会长出跨企业的管理标准(上岗审批、JD 协作是否产品化);RSI 飞轮能否出现第三方可验证的公开基准(那是「轨迹资产」定价的开始);LLM Router 与上下文 GC 这类降本技术会不会成为云厂商标配;以及高合规行业(金融、医疗)的 Agent 是否始终停留在沙盒——如果易方达们始终不敢把核心业务切出沙盒,而低合规行业又困在成本账本上,Agent 的「四万亿时刻」就还得再等等。用刘伟光的标准收尾最合适:判断一家企业有没有真正拥抱 Agent,别看它发布了多少智能体,看它敢不敢停掉一个、能不能闭环一件事、有没有建起治理一套的平台。
转写与核验说明:本文基于 260 段、0—10381 秒官方回放的完整本地转写(全文覆盖无缺段),讲者按议程时间对位校正。ASR 疑似错误已按议程与上下文校正:韩宏元/韩红元→韩鸿源、高一鸣→高艺铭、机缘律动→基元律动、尹俊熙→尹俊希、刘硕林→刘硕凌、霍泰文→霍太稳、郭龙玲/郭龙岭→郭龙领;圆桌孟洪进、孙廷韬现场自述使用化名「飞鸿」「龙雾」,本文按议程归属。经外部核验的关键主张:峰会与基元律动韩凯演讲《从 Harness 到 RSI 飞轮》(量子位、观察者网,2026 年 9 月 22 日);OpenSquilla 开源项目与规模(GitHub,约 6700 星)、NeoHorse-1 模型 4B/9B 与无问芯穹等联合发布(科技日报,2026 年 9 月 9 日)、基元律动与阿里云 9 月 23 日战略合作(网易科技);PinchBench、DRACO benchmark(arXiv 2602.11685);满帮车货匹配平台定位与高艺铭身份(满帮官网、中关村在线、时代财经,2026 年 7 月 WAIC);阿里云 Agentic Cloud 提法(WAIC 2026 同名论坛);Meta Muse 发布于 2026 年 9 月 8 日(Meta 官方、Reuters、NYT)及 9 月 22 日 Muse 概念与芯片股行情(每日经济新闻,9 月 23 日);千问 3.8-Max 云栖发布(量子位);易方达 eWork 平台与 Skill 覆盖(财联社,2026 年 9 月 6 日);众阳健康 27 年医疗信息化、服务 2000 余家医疗机构(齐鲁网);极客邦科技与 InfoQ 中国(百度百科)。存疑与待核项:刘伟光 2025 年 12 月 31 日访谈预言未找到原始出处;易方达「超四万亿资产、近两亿客户」为嘉宾口径(公开可证其为公募非货前三);PinchBench 成本降低 88.9%、DRACO 63.1 分、满帮换基模成本降至四分之一、Patrick 语料一千余条与六十余个数字员工、Self GC 峰值降 20%、LLM Router 降 69%、圆桌「一万超三万」等效果数字均未经第三方核验;转写「千问泡」(易方达现用框架)、「飞波五」「Fable/Astra」(海外模型名)、「A 算 Loop/Agent Loop」(阿里云评估观测产品名)、「DuraCo 系 Perplexity 推出」等名称或归属待核;「老百姓大药房」按转写「百姓大药房」疑漏字处理;众阳健康用药规则(人血白蛋白 30 克每升)为圆桌口述,未对照药典核验。