先说结论

9 月 22 日下午的云栖大会「Qoder 助力 AI Native 超级组织」专场(国博一期新闻发布厅 B,13:30—16:20),是这场大会里离「AI 编程到底改变了企业什么」最近的一场。背景先补一句:Qoder 是阿里巴巴 2025 年由通义灵码升级而来的 Agentic Coding(智能体编程)产品线,如今旗下有 Desktop、IDE 插件、CLI、Cloud Agents 等一整个家族(经核验:Qoder 官网与阿里云帮助中心,原 Lingma 系列已整体更名 Qoder CN);本场论坛就是它的企业级年度升级发布会——刘洋洋的 Agent SDK、田皓的 Qoder Cloud Agents、汪圣平的安全可信底座,加上满帮、海信、慧博、中宏保险四个行业客户的一线账本。

全场真正的主角是一个矛盾,由海信曲栋在开场就抛了出来:**AI 代码写得越来越快、工具越来越强,交付效率是不是跟着提升了?一个工程几分钟就能写出来,但和业务对齐的时间、功能确认的时间、迭代上线的时间,缩短了吗?**七位讲者从不同行业给出的答案高度一致:没有。满帮李旭泽用木桶理论说破——Web coding 让开发提效了,不等于组织提效了,「一个水桶能盛多少水,不是由最长的木板决定,而是最短的木板」;田皓拿服务企业客户的反馈佐证——95% 的问题反馈不是模型不够聪明,开源仓库 GitHub issues 里七八成是 harness(执行系统)的问题;汪圣平引 Veracode 报告提醒——45% 的生成任务会把已知安全漏洞写进代码;中宏王志宇则给出组织侧的解法——把 human in the loop 改成 human on the loop,人退出环路、监督环路。把这些拼起来就是本场论坛的核心判断:模型能力已经跑在前面,卡住 AI Native 组织的是模型之外的四重基建——执行系统(harness)、全链路流程、安全治理和组织文化。

需要如实说明的是:本文依据的现场录音转写共 63 个时间段、覆盖 0—7441 秒,全部读完无缺段;但对照官方议程,十个演讲中转写只覆盖了七个(李旭泽、曲栋、刘洋洋、田皓、贾世龙、汪圣平、王志宇),开场张燎原、联想刘琳琳、收官宁晓民三段未包含在这份录音内(刘洋洋演讲中两次提到「燎原刚才放过的图」「联想伙伴等会儿分享」,可侧证两段确实发生过)。下文按行业逻辑而非议程顺序组织,关键主张均标注来源层级,企业自报数字未经第三方核验的均已注明。

一、货运平台的第一课:个人提效不等于组织提效

满帮集团资深算法专家李旭泽的分享是全场最「业务」的一段,因为他先讲清楚了一个大多数 AI 转型演讲回避的问题:什么场景根本不适合 AI。满帮的背景他自带核验(与公开资料一致):运满满 2013 年成立,2017 年 11 月与货车帮战略合并组成满帮集团(经核验:钛媒体、界面新闻及满帮官网均载;满帮后于 2021 年在纽交所上市,以 2020 年 GTV 计为全球最大数字货运平台),如今是典型的三边市场——货车、货、司机在平台上撮合,业务特点是专业知识深、时空错配严重、运力极端不平衡、个体司机居多。个体司机居多带来一个很中国的细节:干线上普遍存在「副驾文化」——丈夫开车,妻子坐副驾帮他找货、跟货主沟通,孩子留在老家由爷爷奶奶带。李旭泽说,满帮转型 AI 平台(他称 2025 年为转型之年)的最终目标就落在这个场景上:用 agent 替代「卡嫂」,让妻子回归家庭、让留守儿童得到母亲身边的爱。这句收尾是全场少见的把 AI 转型讲到人身上的表述。

方法论层面他给了三层筛选。第一层是场景:标品很难结合 AI(会阻碍原有链路),重决策场景(比如买房)用户不会让 AI 拍板,真正合适的是「中决策」场景——一定要决策、订单金额从几百到几千、需要大量交互,满帮的撮合平台恰好符合。第二层是能不能做:他坦承满帮「技术栈偏老」(转写记作「GTK 八」,疑为 JDK8 之误,无法确认则存疑)、对 AI Agent 框架需要自研,而近千人的开发团队在 2025 年落地时 AI Agent 经验几乎为零,只能内部培养加外部引进两条腿走。第三层是价值排序:先做内部提效(几千人的标岗团队:运营、开发、测试),再把 AI Agent 结合到业务侧服务客户。选择 Qoder 的理由他给了四条:背靠阿里、安全可信(「AI 时代数据安全是第一要务」)、企业知识库、生态——「它不是一个单点工具,是全链路全方位的组件」。

最有信息量的是三组具体账。其一是 prompt 的工业化:满帮业务级 prompt 普遍在万 token 以上,「人很难维护了,每加一条规则,准确率不会上升,会下降」——于是他们基于强化学习把整条链路拆成优化器、变种池、ML 推理、基于黄金数据集的智能评估器和候选池做自动迭代,发货场景字段准确率提升约 12 个百分点(嘉宾自述口径)。其二是开发提效:算法同学不是专职开发,借助 Qoder 从架构分析、需求分析到实现,「原有五十人日的需求今天变成十人日」;与 Qoder 快速模式协作约一周产出 agent 技术框架——关键洞察是「发货业务大家以为是表单,其实是订单」,订单需要字段准确率、字段间联动和状态机——一个月内落地第一版 agent。其三是知识管理:过去每个算法同学要手工把代码整理进 wiki,如今提交代码时实时生成 Repo Wiki;过去排查问题人工翻代码「找一天两天」,现在把链接交给 Qoder 的 web agent 边看代码边对话解决;甚至基于 Qoder 把存量 RPC 接口自动转换成 MCP(Model Context Protocol,模型上下文协议)来适配新的 AI 架构。

组织侧的判断比技术侧更锋利。「公司赚公司的,个人赚个人的」——想让员工用 AI,得让他看见自己的效率提升,所以要树榜样:把人群分成顶部的尝鲜者、中部的观望者、下部的绝缘者,用「超级智能体」个体去牵引。但话锋一转就是全场的金句级反方:超级个体的出现不等于组织提效——Web coding(转写如此,疑为 Vibe Coding 之误)一定提效开发,但木桶的短板在别处,必须全链路把每个工种都 AI 化,看整体不看局部。他给出的时代公式是:非 AI 时代产出 = 人力 × 工时;AI 时代产出 = 判断力 × AI 执行力——所以越懂业务、越知道哪部分用户要解决什么问题的人,经验反而越来越值钱。同时组织会更扁平:原来的汇报体系靠人层层 summary,AI 自动 summary 之后「管理半径会不断扩大」。

第一条机制链:Agentic Coding 把个体编程速度提上去 → 组织产出的瓶颈转移到最短的工种(木桶效应)——业务闭环里未被 AI 化的环节(对齐、判责、客服、报表)重新成为交付时长的决定项,满帮的应对是把履约侧、判责侧全量 AI 化、六个业务 agent 上线(发货、跟单、找货等,对应三边关系)→ 二阶影响:研发提效指标(人日、字段准确率)与业务指标(客诉接手率、判责自动化)必须分开核算,否则会高估转型收益;经验丰富者的判断力溢价上升 → 读者启发:先画出端到端流程里每个工种的 AI 化覆盖率,找到那块最短的木板再投预算;同时警惕「我们也在用 AI coding」这类汇报——没有业务侧 agent 落地证据的提效都只是局部故事。(观点与数字均为李旭泽口述自报;满帮集团沿革经外部核验)

二、四阶段是叠加不是升级:海信用 Harness 工程把 AI 塞进交付链路

如果说满帮讲的是「为什么」,海信集团 AI 技术中心负责人曲栋讲的就是「怎么干」。他的开场之问(即前文核心矛盾)之后,先交代了海信的约束条件:1969 年成立的跨国多元集团、六家上市公司、1+7 运营中心、32 个研发中心、六千多研发人员分布国内外(公司背景与公开资料一致,内部数字为自述)。这个约束决定了选型逻辑:「我们找的不是一个更好的工具,而是可复用的标准工程底座和可治理的新开发范式」——只考虑一个团队好不好用,在全集团推不开。

建设历程是一条清晰的工具进化史(自述口径):2023 年 GPT 刚出就引入智能编码,最早用 Copilot(转写记作 Complent),「摁个 Tab 键就能补齐」,但推不动——代码外发、安全合规、成本问题使它在集团层面铺不开;2024 年做多产品综合评测,通义灵码评测第一,一周内完成投产部署;2024 年底经重新安全评测引入 Qoder,「内部推得最快的产品,一个月推广两千多用户」;2025 年重点做 Harness 工程建设,并在内部推 Loop AI 之夜和 Graph AI 之夜两个专项。术语解释一下:Harness 本义是马具,在 Agent 语境里指承接大模型、供其调用工具并约束其行为的那套执行系统——曲栋的定义是「把分散的知识和规范,一步一步变成 AI 智能体可以理解、可以执行的资产」。

全场最有复用价值的认知框架是他的「四阶段」论:第一阶段提词工程(Prompt Engineering,解决能不能用 AI 开发);第二阶段 Harness 工程(解决 AI 输出能不能稳定地放上生产);第三阶段 Loop(智能体把单个交付流程跑成闭环,而不是每个环节点状辅助);第四阶段 Graph(多任务、多角色自动协调编排)。关键是他的强调:这四个阶段不是迭代演进关系,而是叠加关系——「没有前面 Harness 工程化的规范,不可能自动跑 Loop;Loop 如果跑不稳,谈不上做 Graph,Graph 可能就是只画了张皮。」海信目前正从 Loop 级向 Graph 级过渡:Loop 已在很多生产环境自动化运行,先锋项目基于 Graph 做 SDLC(软件开发生命周期)全流程提效。

落到工程细节,三层依次展开。Harness 层投入最大:把设计文档、测试用例、软件规范全部纳入代码仓,「AI 和开发者共享同一个知识源」,用 Rules 和 Spec(转写记作 Scale,疑为 ASR 对 Spec 或 Skills 的误识别)把规范变成可执行护栏,再用 AI 审查做可观测反馈——Qoder 在这里提供 Repo Wiki、Rules、Spec、MCP 等原生接口。角色也重新分工:泛化组织里所有角色参与交付,产品经理用 Qoder 输出验收标准,SE 技术经理定方案和接口边界,产品、开发、测试统一以 Spec 为基准确认生成内容,业务方用自然语言参与需求闭环,还有专职的 Harness 开发工程师。效果(自述):过去需求对齐要一周、至少三到四次会议拉通,现在 PRD 生成、门禁核验、Spec 生成全部自动化、人只做关键节点判断,「基本上缩短到一天内」。Loop 层的要点是人在关键环节做门禁闸口,AI 在约束条件内自动生成、测试、评审、修复,配合「有界、有据、有档、有苗」(转写如此,末词疑有误)四要素加硬性熔断机制。Graph 层把交付全流程变成「可恢复、可停机的节点图」:需求节点人做最终决策,方案拆解由 Graph 自动编排,编码由多个数字员工并行,测试由独立验收器验证,交付过 review 门禁——他们用阿里开源的工具(转写记作 AutoMander,疑为阿里通义实验室开源的多智能体框架 AgentScope,经查该框架真实存在且支持编排与 A2A 协议,但名称未能确证)把 Graph 跑起来,用 Event Gate 和 States 门禁记录每个节点的进入条件、产出证据和关闭结论,做到「流程中断能继续跑、失败能快速定位定点重执行」。

收益数字他给得很克制、分了档(均为自述):新项目或适合 Loop 化、Graph 化的项目,端到端交付提升三倍以上(三到五倍),人力成本节约 50% 以上;搭建十年以上、框架特别老的系统,基于 Harness 工程实践「至少 1.3 倍到 2 倍以上提效」。而他特意解释了数字的来源:「这些数字背后的意义,并不是一段代码写得更快,而是整个链路的压缩」——从需求对齐到代码交付压缩出的时间,最终投到关键评审和决策上;跨复杂系统的改造则需要投入更多精力做 Harness 治理。三层架构(工具层 Qoder 原子能力、Harness 实践层质量护栏、编排层承载数字员工)对他最大的意义是「既能让 AI 大规模跑起来,又能保证它不越过治理边界」。

第二条机制链:AI 生成质量不再由模型单独决定,而由知识供给决定(Harness = 把规范与经验变成 AI 可执行的资产)→ 企业能否把 AI 放进生产,取决于最不性感的那层基建——文档入仓、规范成护栏、经验可沉淀;跳过 Harness 直接画 Graph 的组织只会得到一张皮 → 二阶影响:需求对齐等「会议密集环节」成为被 AI 重构的第一批对象(海信一周三到四次会议变一天内),研发效能的度量单位从代码量转向端到端交付时长;老系统与新系统出现两套收益率(3—5 倍 vs 1.3—2 倍),技术债被重新定价 → 读者启发:自检你们公司的设计文档、测试用例和编码规范是否进了代码仓、机器可读——如果没有,先补这层再谈多智能体;评估供应商时把「规范能否变成可执行约束」当第一问。(框架与数字为曲栋口述自报;通义灵码 2024 年评测背景未独立核验)

三、Harness 全面开放:Qoder 把「Agent 减大模型」做成生意

产品侧的重头戏是两场连讲:刘洋洋的 Qoder Agent SDK 与田皓的 Qoder Cloud Agents,一个开放内核、一个托管上云,合起来是 Qoder 把内部沉淀的 harness 能力商品化。刘洋洋先给认知坐标:两三年前做 Agent 靠 Prompt Engineering,后来是 Context Engineering,而今天「没有一个词可以很技术化地概括 Agent 到底要怎么做」。由此两个判断:已经发生的是,Agent 的竞争从模型能力转向「模型和执行系统共同完成真实任务的能力」;对未来的判断是,Harness 的战场正从 coding 走向复杂通用任务、从个人扩展到组织——多人协作、人和 agent 协作、能力边界与安全,是下一步要发展的方向。

他首次对外分享了团队做 Harness 的「北极星指标」:单次任务成功交付的成本。分子不只是 token 和工具调用的资源成本——时间成本(一个端到端任务十分钟完成和一天完成有本质区别)和人工介入成本(human in the loop 里人要校验、监督、返工,「这个成本其实更高」)同样计入;分母是成功交付的任务数。翻译成白话就是「多快好省」。支撑这套指标的是案例:Qoder 之前一个办公智能体,五人七天从想法做到推向市场(自述),因为 Harness 内核已经沉淀了大量能力;而不同场景、不同任务形态的反过来又让内核更普适——这就是 8 月 11 日低调发布到官网、受欢迎程度超出预期的 Agent SDK 的底气。集成模型很清楚:企业自己管产品形态、业务流程、审批、数据和权限,SDK 负责「Agent 减大模型」的那部分——模型调用(多模型、BYOK 自带密钥)、工具协同、Agent 运行时、会话记忆、安全治理、模型策略。一个卖点是新模型 Day 0 可用:提前跟模型厂商做适配,模型发布第一天用户就能用上,包括 SOTA 模型和自家的 Qwen 系列。适配场景他分了四类:产业智能化(并点破一个常见误区——企业 AI native 转型不是「采购足够多的工具、token 管够、让大家都变成超级个体」就起飞,而要从端到端产业流程看 AI 改变什么)、软件 AI 化、硬件智能化(眼镜、耳机、AI PC、AI 手机——时效性和复杂环境挑战更大)、行业智能体。合作伙伴名单是首次分享:联想天禧电脑集成 Agent SDK 做个人 AI 助手;新东方全国机构的教师将用上基于 SDK 定制的教师端工作台(备课、知识、学生管理);客如云(转写记作课如云,按知名餐饮 SaaS 厂商校正)为数百万餐饮商家提供客流与业务分析;卡比特(转写如此,车机与两轮车智能化方案商,待核)在安卓设备里做智能化;阿里云 AnalyticDB 的数据库运维场景已经可用。SDK 目前提供 Python 和 TypeScript,Java 即将开放。

田皓的 Qoder Cloud Agents(简称 QCA)回答的是另一段路:从 demo 到生产。他的观察跟前面满帮、海信的痛点完全咬合:做出一个 agent demo 不难,难的是老板问「可以交付给客户了吗」时的忐忑——开源方案带来低成本试错,但看 GitHub issues 会发现「百分之七八十的问题并不在模型本身,而是在整个 harness 的一些问题上」:任务跑一半中断了,是连接断了还是沙箱断了?接入企业内部系统后权限、工具、凭证怎么管?不同用户怎么隔离?高峰期扛不扛得住、闲时会不会白白浪费资源?他引一份 YC 报告称 99% 的业务场景没有触达模型上限,结论是「模型能力当然重要,但跑通之后还得投入大量时间精力搭建系统,把运行、权限、资源和效果管起来」——企业需要的不只是一套模型接口,而是一套能持续把事情做完的生产系统。产品时间线(自述):今年 2 月某云端 Agent 产品(转写记作 Open Cloud,疑为 ASR 误识别的产品名,待核)带火「环境范式」时推出 alpha 给阿里内部试用,5 月上线 beta 邀测,9 月 16 日——OpenAI 发布 Agent API 后约一周——正式发布 1.0,目前月调用量已超千万级、客户数千家。

QCA 的本质是 Agent as a Service:把支撑 agent 在企业上下文完成任务的所有底座变成可集成、可管控、可扩展、可观测的云服务,与其他 Qoder 家族产品共用同一个「与五百万以上终端用户联合打磨一年多」的内核(自述)。架构上最有辨识度的是「脑手分离」:中心化的 Agent Runtime 七天二十四小时在线,沙箱按需拉起——查天气这类简单任务在 runtime 里调一个 MCP 就完成了,不必为每个用户常驻一台云电脑。他给出的对比数字:相比每用户分配一台云电脑/云 Linux 的单机架构,沙箱持有时长和成本节省 95% 以上,沙箱并发上限可达十万级(自述口径)。产品能力四件套对应四类痛点:一键直达生产(从 Qoder Desktop、IDE 乃至其他 AI coding 工具用自然语言发起集成,不必登录控制台;控制台所有能力都有 API,可以自建行业级 agent 托管平台再交付给自己的客户)、在业务中生长(内网打通、五层安全管控、知识库/MCP/Skill 市场、多智能体协同)、可验证的智能引擎、上量后成本可控。其中「可验证的进化闭环」值得展开:执行中由类似 AI 监督员、打分器的机制持续校验过程与产物,每次会话可设预算防止 agent「陷入不断较真儿的 loop」;事后有 trace 和多维指标,平台自动识别配置冲突(今天上的 skill 和明天的 skill 矛盾)、支持夜间自动记忆整理(「晚上自动沉淀白天做的事,重新优化记忆,越用越懂你」);上线前可针对业务特性设评估器——他举的例子很具体:金融客户查今天的股价,绝不能返回昨天的开盘价。三个客户案例:小多科技(电商智能客服与消费者洞察,痛点是上下文割裂——用户退鞋换码七天后再回来问,会话一换指标就得重讲;上线时间从数周级缩短到数天级,转写记作「数千级」疑为「数天级」,自述)、慧博科技(后面详述)、阿里云数据安全检测(面向系统而非人的场景:批量打标、数据批处理、内容审核,agent 辅助研判多源告警给出风险等级再交专家复核,核心指标是「AI 与专家一致率——代表能解放多少个专家」)。成本设计上还有闲时折扣:夜间模型五折、部分两折。

第三条机制链:模型能力趋于可替换(多模型、Day 0 适配、BYOK)→ 竞争壁垒向执行系统迁移——harness 从大厂的内部基建变成可采购的商品(Agent SDK 开放内核、Cloud Agents 托管上云),「Agent 减大模型」成为一门可计费的生意 → 二阶影响:企业自建 agent 底座的必要性被重估——通用运行时外包(QCA)、行业知识自持(慧博把研发精力留给零售业务)成为新分工;demo 与生产的差距被产品化为「稳定性、隔离、成本归属、结果验收」四个可验收指标;沙箱架构(脑手分离 vs 单机常驻)直接改写云成本结构(自述省 95% 以上)→ 读者启发:选 agent 平台时先问四个田皓式问题——十几个小时长程任务中断可恢复吗、新业务接入的边际成本够低吗、多租户资产边界清晰吗、结果谁说了算;别为「查天气级」任务付常驻沙箱的钱。(产品能力、数字与案例均为 Qoder 团队口述自报,发布时间线未独立核验)

四、零售与保险的两种落地姿势:从拉报表到安全左移

两位行业客户一零售一金融,恰好展示了同一套底座在「轻」与「重」两个极端的用法。北京慧博科技 CTO 贾世龙的赛道是消费者运营:2013 年成立、服务两千家品牌客户(安踏、联想、Babycare——转写记作 B B Care 疑为该品牌、乖宝宠物等,自述),做全渠道消费者数字化运营,让品牌无论在淘宝、抖音还是企业微信都能识别出同一个人。十三年下来他看清楚零售闭环就六步:看报表、找问题、定策略、去执行、做复盘、再优化——过去靠运营人员的经验在系统里找功能模块串起来。问题随之而来:「数据有了,系统有了,谁来解决经营的问题?」他的答案是零售全域 Agent(转写记作「小慧 Qoder/小会Cloud」,产品名待核):过去交付的是系统能力,现在用 Agent 来组织这些能力,「让它像人一样去干活,把真实的经营任务完成」。

最能说明问题的是一个真实到扎心的案例:服务联想时,新来的运营不会拉内部报表,慧博上门培训,对方对系统很满意,最后却说「你能不能把刚才取数的步骤写下来,我照着去做」——「BI 再好用再实时,对新运营来说上手门槛依然存在」。现在品牌把自己内部的报表模板(不需要标准格式)交给 agent,它理解表头、识别渠道/门店/品类维度、自动打通中台找数填回表格,过去一整天的报表工作变几分钟(自述)。往后是完整的经营链路:agent 诊断哪些客户流失、谁到了补货周期,基于购买商品、规格、数量和消费行为算出每个人专属的复购窗口——把「按统一购买日期给所有人发一样的提醒」升级为「每个人的个性化经营时钟」;再编排分阶段策略(前七天初步提醒、前三天看加购浏览行为强化触达、当天在最可能下单的时间点引导、过七天未购二次召回),每发一条信息都过一次安全校验避免过度打扰。而对于「AI 全天候运营是不是让大模型 24 小时盯着安踏几千万客户不停判断」的误解,他的架构回答很清醒:大模型负责思考(策略、规划),工作流负责稳定执行——到满足时间和条件就触发,客户已购买就停止,需要分析和决策时大模型再参与,效果回流帮运营复盘迭代。「让 AI 从帮我们做一次运营,走向帮我们持续做生意。」复购能力被整理成四层(基础零售能力、业务规则知识、harness 运行支撑、经营 agent),新场景如流失召回、小样转正装直接复用。工程底线有三条:任务中断能恢复、多品牌账号数据权限严格隔离(「SaaS 的底线也是红线」)、成本可控——于是慧博选择由 QCA 承接通用 Agent 运行能力,自己的研发精力放在零售业务和经营链路落地上;对 QCA 的评价除托管完善、按调用计费且夜间更便宜之外,他还特意点名了「团队的责任心和响应速度:群里解决不了,马上抠个会」。

中宏保险 AI 基础架构总监王志宇代表的是另一个极端:强监管、重流程、老系统。中宏是中国第一家中外合资保险公司(经核验:1996 年 11 月由加拿大宏利金融与中化集团合资成立,为国内首家中外合资寿险;嘉宾称今年恰逢三十周年,与成立年份自洽),同时受集团安全团队和国内监管机构、等保体系的双重监管。系统现状(自述):最大应用约两百个微服务,保险交易流程极长——一个新单从录入到交单提交长达约二十个节点、录入接近二十到三十分钟,「不像短平快的互联网业务」,是强人为干预的长链路;三十周年积累的大量存量老系统带着技术债。最硬的约束是安全:所有上生产的系统,中级以上漏洞要求全部修复——这直接决定了他们 AI coding 的建设方向。旅程分四段(自述):去年 6 月用 Qoder 的前身通义灵码做补全(与 Qoder 品牌沿革的公开信息一致);10 月用基本 rules 进入类似 Vibe Coding(转写记作 Web coding)的模式;第三阶段个体标准化,用 Qoder 加 Spec 的模式逐个职能提升;今年正式做 coding 流水线,不到半年 loop 迭代约十个版本——4 到 6 月简单 Spec loop,7、8 月 agent loop,当前是 agent loop 加并发 work tree 模式。他解释了为什么单点先行:保险是相对传统的行业,组织和全公司变化都慢,在保持现有组织框架的前提下以单点提效先行,「偏互联网的公司可以跑得更快,我们不行」。

这套流水线的全局设计分三层:底层 harness(Qoder、agents、rules、Spec、工具加复盘度量机制与 agent loop benchmark),中间 loop 运行时(按软件生命周期定义交付节点),最上层是人——他做了一个精确的概念迁移:把流行的 human in the loop 改成 human on the loop,「你不再参与环路,而是监督环路怎么运行」。人只需要盯两头:需求和方案设计,以及最终 SIT 验收的指标与测试报告;中间的 bug 诊断、需求规划、编码、测试、代码评审、安全评审、安全修复「全过程可以全部自动化」,所有失败都能在规则定义里回到原点继续诊断,环路一直跑到验收目标达成为止。安全左移的做法尤其具体:中宏每年安全投入大几百万(自述),流水线上最重要的三个扫描——静态扫描、开源扫描、镜像扫描——全部前置,通过 MCP 接入 Spec:扫描报告进来、Spec 分析、回流水线修复,集中流水线再设一道安全门禁验证真实修复效果。最新版本还做了并发:以 work tree 的「甬道式」开发,每条甬道独立编码、测试、扫描、提 PR,并配独立的临时 SIT 环境(用阿里云 serverless,AI 直接拉起部署、测完即销毁),最后进串行合并队列。模型策略上做高低搭配:因 Qoder 暂不支持用自然语言给子 agent 绑定模型,必须以 custom agent 方式配置,于是拆出 master 与 sub agent——master 和高性能要求节点绑强模型,按计划执行的节点用低性能模型。他总结的 Spec 开发六条经验里最有价值的是「明确授权和证据」:agent 能跑什么、不能动什么要定义清楚,每个节点的流转是否真实执行,「不能凭 agent 一句话说我做完了,而是要真正有证据和留痕」;还有契约闭合(下游节点是上游产物的消费者)与渐进式披露(什么时候加载上下文,而不是一次性塞进去)。benchmark 的做法朴素但可抄:以某真实版本发现的 31 个 bug 冻结修复前后效果作基线,此后每次 Spec 变更、agents 变更、模型切换都回基线重跑验证,指标包括工具成功率、路由准确率、端到端耗时、人工介入率等。阶段收益(基于一个现实的小项目,他明言复杂项目还没走到那一步,自述):交付周期降约 80%;供应商报价十人月的系统,流水线跑下来两人月完成;安全反馈从「中央流水线才知道有没有漏洞」变成开发过程中实时发现。定性收益三条:个人经验变成团队资产、交付流水线证据化交接、以及「基于新应用的开发,真的可以做到超级个体——一个人承担原来一个团队的角色」。

第四条机制链:AI coding 的收益兑现点因行业监管强度而分岔 → 轻场景(零售运营)按「大模型思考+工作流执行」分工,把 agent 嵌进经营动作(报表、复购、触达),价值度量是经营指标;重场景(保险研发)按「单点标准化→流水线化→安全左移」推进,价值度量是交付周期与漏洞时效 → 二阶影响:安全要求越严的组织,AI 化的切入点反而越清晰——把「中级以上漏洞全部修复」这类硬约束转译成 MCP 接入的扫描门禁,合规成本变成工程问题;供应商报价体系被流水线重写(十人月变两人月),软件外包市场承压 → 读者启发:别抄互联网的激进姿势,先按监管与流程长度给自己定位;建自己的 benchmark(冻结一组真实 bug 的修复前后效果),让每次换模型、改 Spec 都有回归测试可跑;把「证据和留痕」写进 agent 的规格——没有验收证据的自动化是负债不是资产。(两家企业的全部数字均为嘉宾自述;中宏 AI coding 实践未检索到公开报道,属灰色信源)

五、45% 的生成任务带漏洞:AI 编程的安全账

压轴之前,Qoder 安全负责人汪圣平把全场绕不开的一笔账摆上了台面。他的引用(经核验,口径略有出入):Veracode 今年发布的报告称约 44% 的情况下模型会在代码生成中产生漏洞,「去年是 45%,模型已经非常聪明了,但代码生成安全性并没有得到提升」。经查证:Veracode《2025 GenAI Code Security Report》(2025 年 7 月发布)实测一百多个大模型、80 项编码任务,45% 的生成任务引入 OWASP Top 10 漏洞,且安全性随模型发布时间基本持平——与嘉宾的核心论点完全一致,具体数字(44%/45%)与报告口径略有差异。他把后果推演成一条链:模型安全性没有提升 + 代码生产采用率逐年提高 = 进入最终代码仓库的漏洞越来越多,单位时间内代码仓积压更多漏洞。更麻烦的是漏洞形态的变化:大模型把过去单行编写的漏洞演化成跨配置依赖、跨数据流、跨信任边界的复杂漏洞,局部审查很难发现;而且一个错误的写法或框架函数会在企业里被快速复制,影响面放大。

他的应对框架分四层安全架构(身份、运行、数据、审计)和三条主线。接入安全:Admin Portal 做企业身份对接、agent 运行时映射员工身份、模型接入管控(企业自定义模型、专属 VPC、机密推理);运行安全:MCP 插件管控、命令黑白名单、模型执行意图识别、命令执行沙箱;数据安全:企业数据隐私模式、代码仓库对模型的可见性控制、多租隔离、CN 版本的机密推理(推理层不可见防护);可控审计:控制台操作审计、端上日志、安全信息导出(转写记作 SPM/S form 表,疑为 SIEM/SAST 类合规报表,待核)。其中一个设计思路值得单独记:Qoder 通过端上的 Hooks 机制把数据脱敏和日志审计接到企业既有的安全软件上——「把 Qoder 纳入企业原有的安全管控体系」,而不是另起炉灶。代码安全本身则分四阶段扫描:编码时(静态规则实时反馈、即时修复、不打断编码流)、变更后(分析本次 commit 的局部语义)、深度扫描(跨文件追踪、调用链分析、完整数据流还原)、全量扫描(从编写到进仓库全生命周期覆盖)。相比传统 SAST(静态应用安全测试,擅长已知危险函数和漏洞框架),大模型的优势在业务权限的语义理解、资源与业务的关联分析、代码变体追踪,结合规则、模型与 agent 多轮推理,「论证漏洞产生的原因、是不是真的可能被触发」——用分支可达性分析压误报,在传统难题越权检测上也有不错表现(自述)。整体效果是把传统「扫描→发工单」的修复链路推到小时级。近期发布的企业能力包括成员 L1 到 L3 的控制开关、代码合入分支前的强制安全扫描、企业自定义规则(「每个企业会因业务属性产生漏洞偏好」)、安全统计报表。最有想象力的部分是他把安全也 Agent 化:在需求阶段就根据需求点生成对应安全要求(支付链路自动带出权限与金融管控要求),设计阶段调用安全规约形成安全上下文,代码生成时默认纠偏,发布时联动门禁——通过 Agent Graph 联动安全知识、代码智能、智能编排和风险治理,「做到生成即约束」;发现漏洞后再把原因沉淀回企业安全上下文,形成自进化。信任中心同步上线,可下载三方审计证书与安全白皮书。

第五条机制链:AI 编程的漏洞率不随模型变强而下降(Veracode:45% 引入漏洞且随时间持平)× 代码生产采用率上升 → 安全债务的积累速度被双重放大——漏洞形态复杂化(跨信任边界)+ 错误代码被 agent 批量复制 → 二阶影响:安全从流水线末端的门禁左移为生码时的约束(生成即约束),扫描工具从规则匹配升级为语义推理(可达性分析压误报);「中级以上漏洞全部修复」这类监管硬约束成为强监管行业 AI 化的第一驱动(中宏即为实例)→ 读者启发:把「AI 生成代码的漏洞率」和「AI 代码占比」两个指标放在一起看——剪刀差越大,安全左移的紧迫性越高;采购 AI 编程工具时先看它能否接入你现有的安全体系(Hooks、MCP、日志导出),而不是只看代码补全采纳率。(Veracode 数据经外部核验,报告为 45% 且持平;其余能力与效果为厂商自述)

结语:模型之外,全是组织问题

把七场演讲串起来看,这场论坛真正讲的是一个分层结构。满帮回答「为什么慢」——个人提效和组织提效之间隔着木桶的最短板;海信回答「怎么补」——Prompt、Harness、Loop、Graph 四阶段叠加,先打地基再上楼层;刘洋洋和田皓回答「买还是建」——harness 已经成为可采购的商品,企业的差异化在行业知识而非通用底座;贾世龙和王志宇展示了轻重两个极端的落地姿势;汪圣平则提醒所有人,速度的账单最终要由安全来结。有意思的是,几乎每位讲者都在不约而同地做同一件事:把人从「执行者」的位置上挪走,挪到「目标设定、关键门禁和例外处理」上去——从满帮的判断力乘以 AI 执行力,到海信的人在闸口,到田皓的验收标准,到王志宇的 human on the loop。AI Native 组织的「超级」,最终不是超级个体,而是让每个工种都被 agent 补齐之后、管理半径扩大了的扁平组织。

值得盯的观察指标有四个:Qoder Cloud Agents 的月调用量(现已千万级,自述)与数千家客户的续约情况——它验证「harness 即服务」这门生意是否成立;海信式四阶段与中宏式 benchmark 能否沉淀出跨行业可复制的度量标准;AI 代码占比与漏洞率这对剪刀差的走向——Veracode 下一份年报若仍持平,安全左移将从最佳实践变成准入门槛;以及满帮那句最朴素的检验标准——agent 到底有没有把「卡嫂」从副驾上解放出来。反方风险同样清楚:这是 Qoder 的主场论坛,四个客户案例都由供应商串联,提效数字(50 人日变 10 人日、十人月变两人月、3—5 倍交付提升)全部是嘉宾自报口径、未经第三方核验,中宏的 AI Coding 实践甚至检索不到公开报道;harness 叙事本身也在鼓励「多建底座」的消费。对于正在做预算的读者,这场论坛最可迁移的也许是最不性感的三句话:先把规范和文档变成机器可读的资产;给每一次 agent 交付留证据;别为查天气级的任务付一台云电脑的钱。


转写与核验说明:本文基于 63 个时间段、0—7441 秒的现场录音本地转写(两遍提取法全文读毕、无跳段;末段仅「就坐」二字,为自然收尾)。对照官方议程(云栖大会 9 月 22 日国博一期新闻发布厅 B「Qoder 助力 AI Native 超级组织」论坛,13:30—16:20 共十个演讲),本录音覆盖其中七个:李旭泽(满帮)、曲栋(海信)、刘洋洋(Agent SDK)、田皓(Cloud Agents)、贾世龙(慧博)、汪圣平(安全)、王志宇(中宏保险);张燎原开场演讲、刘琳琳(联想天禧)端侧 AI、宁晓民收官演讲三段未包含在这份录音内,文中仅据刘洋洋转述侧证、未采信具体内容。ASR 人名与专名已按议程及上下文校正:张辽元→张燎原、许栋→曲栋、田浩→田皓、汪盛平→汪圣平、汇博→慧博、课如云→客如云、Coder/Code 的→Qoder、Complent→Copilot、通义明码→通义灵码、困模型→Qwen 模型、搜塔→SOTA、加拿大红利金融→宏利金融、YD→ID;存疑保留项:满帮「GTK 八」疑为 JDK8、「Web coding」疑为 Vibe Coding、「Scale」疑为 Spec 或 Skills(中宏段「渐进式披露」「契约」语境指向 Agent Skills 生态术语,未能确证,正文按 Spec 处理并标注)、海信「AutoMander」疑为阿里开源多智能体框架 AgentScope(该框架真实存在、语义吻合,名称未确证)、田皓段「Open Cloud」疑为某云端 Agent 产品名、「Manage Agents」疑为 Anthropic Managed Agents、慧博 agent 产品名(转写「小会Cloud/小慧可乐」)、「回天表格」疑为「回填表格」、小多科技上线「数千级」疑为「数天级」、「有界有据有档有苗」末词疑误、「Web 购的点位」疑为 Webhook、卡比特为转写原名待核。经外部核验的关键主张:Qoder 为阿里巴巴通义灵码 2025 年品牌升级而来的 Agentic Coding 产品线(Qoder 官网「Qoder(原灵码)」、阿里云产品页与帮助中心 Qoder CN 系列,2025—2026);满帮集团由运满满(2013 年成立)与货车帮于 2017 年 11 月合并组建、全球最大数字货运平台(钛媒体、界面新闻、货车帮官网);中宏保险为国内首家中外合资人寿保险公司、1996 年 11 月由加拿大宏利金融与中化集团合资成立(中宏官网、新浪财经),与嘉宾「三十周年」表述自洽;Veracode《2025 GenAI Code Security Report》实测 100+ 模型、80 项任务、45% 生成任务引入 OWASP Top 10 漏洞且安全性随模型发布时间持平(Veracode 官网报告与 BusinessWire,2025-07-30),与汪圣平引用口径(44%/去年 45%)略有出入,核心论点一致;AgentScope 为阿里通义实验室开源多智能体框架(阿里云开发者社区)。待核项:中宏保险 AI Coding 流水线实践未检索到公开报道(阿里云保险业公开客户案例为中华财险,非中宏);海信 2024 年多产品评测「通义灵码第一」、Qoder Agent SDK 8 月 11 日发布、Cloud Agents 9 月 16 日发布 1.0 及月调用量千万级、各企业全部提效数字(满帮 50→10 人日与 +12pp、海信 3—5 倍与 50%、慧博一天变几分钟、中宏 80%/十人月变两人月/31 bug 基线)均为嘉宾或厂商自述口径,未经第三方核验;满帮六个业务 agent、慧博两千家品牌客户、新东方/客如云/卡比特/AnalyticDB 集成进展为刘洋洋、田皓口述。本场嘉宾职务与议程以云栖官方议程为准,主持人顾莹莹(转写一致)。