来源:《硅谷101》播客 · 「从信任人到信任AI」 嘉宾:Peter(Creo CTO,前Meta基础模型团队研究科学家、苹果多模态模型工程师)、陈凯(Creo联合创始人/CTO)、Mark(Creo联合创始人,Go to Market负责人)
本文整理自「硅谷101」播客。Creo是一家25人的公司,99%的代码由AI编写。以下内容按主题组织,涵盖「新的变化」和「嘉宾观点与解释」两个维度。
一、新概念:从Prompt Engineering到Harness Engineering的进化
新的变化
过去三年,围绕大模型工程能力,行业经历了三次概念上的进化:
- Prompt Engineering(2023年):核心是怎么写好提示词,让模型给出更好的答案。它优化的是人与单一模型之间的交互,任务通常是一个相对垂直的场景。
- Context Engineering(2024年):核心是怎么给模型提供更完整的上下文,让它理解更复杂的任务。它仍然是静态的——你优化的是一个模型、一个任务。
- Harness Engineering(2025-2026年):Harness原意是套在马身上用来引导和约束马的装备。现在被引申为:围绕大模型搭建一套能让它在真实世界中持续工作、自我修复、自我提升的系统。
为什么会有这种变化? 因为随着AI能力的飞跃,单独优化提示词和上下文已经不够了。AI系统涉及工具调用(Tooling)、沙箱架构、安全机制、延迟控制、推理扩展(inference scaling)等一系列工程化问题。Prompt和Context Engineering的"视野"太小——它们只关注怎么和大模型本身交互;而Harness关注的是一整个系统的运转能力,scope远大于前两者。
可能带来什么? Harness决定了AI系统是被"静态地用好"还是"动态地持续进化"。一个Harness做得好的系统,可以自我学习、自我改进、根据市场信号和用户反馈不断迭代;做得不好的系统,AI可能跑两天产出全是垃圾。这直接决定了AI从"工具"走向"生产力主体"的成败。
嘉宾观点
Peter(CTO):Harness的本质不是一个静态的、固定的枷锁去束缚AI智能,而是要给它提供空间让它能够成长——“就好像你在养一个孩子,你怎么样能够让它不断在一个规则内变得越来越好”。具体来说,Harness包括:怎么让Agent在推理阶段扩展(inference scaling)——给它更多上下文、更多工具、让它思考更长时间;怎么在推理过程中控制幻觉(hallucination)和上下文溢出(context overflow);以及怎么把负面反馈变成系统自我改进的驱动力。
陈凯:很多人觉得LM能力提升了,但为什么做不到想要的事情?那是因为还有很多工程化问题需要一起被解决——这和传统软件一样,一个看似简单的功能,背后可能有大量的工程化问题。
二、AI-First ≠ 用AI工具,而是围绕AI重构组织
新的变化
大多数公司所谓的"AI First"都是假的。 这不是给每个人配一个AI工具——让工程师用AI写代码、让产品经理用AI写PRD、让设计师用AI做图——这样做不但没有增加效率,反而因为每个人的工作节奏和进度不同,对齐(alignment)成本变得非常高。
Creo的亲身经历:他们早期也是每个人都用AI工具辅助工作,但效率提升远不如预期。核心问题是生产力工具的使用者还是人,而不是AI。如果人还是工具的使用者,效率倍数存在上限(毕竟人一天最多工作24小时)。真正要做到效率提升100倍、1000倍,AI必须是所有生产力的主导。
真正的转变发生在2025年下半年:Creo意识到如果还是"AI辅助人"的模式,效率提升非常有限。于是他们开始彻底重构——不是在现有流程上叠加AI,而是围绕AI的能力重新构建工作流程和组织形态。这次重构从2026年1月开始,仅用两周就完成了全部架构重写。
可能带来什么? 25人团队能做出过去需要100人团队花4-5个月才能完成的产品版本。开发速度远远超过市场团队的销售能力——从"销售超前产品4-5个月"变成"技术超前市场4-5个月"。
嘉宾观点
Mark(Go to Market负责人):现在他们的开发速度远超市场进度,不再需要讨论"产品路线图是什么",而是讨论"市场需求在哪里"。他们就像拥有一个机器猫的万能宝箱——如果市场需要苹果,就从产品库中挑一个苹果去卖;需要香蕉,就挑香蕉。这大大降低了内部对齐成本。
Peter:AI First的工作方式下,迭代一个产品功能的速度极高,所以核心关注点从"详细讨论要做什么"变成了"搭好数据链——让Agent通过数据来判断功能是否有用,决定要不要上线或回滚"。这是一种完全不同的决策机制。
三、开发流程的彻底重构:一天内完成"写→测试→砍掉→重写"
新的变化
Peter在Twitter上分享的工作节奏引发了187万次浏览:
早上10点写了一个功能 → 中午A/B测试 → 下午3点根据数据反馈砍掉部分功能 → 下午5点重写了更好的版本。
这在传统开发流程中需要6周。效率提升的核心来自三个系统的建设:
- AI驱动的CI/CD系统:传统的CI/CD是基于规则(Rule-based)和单元测试驱动的。现在用AI驱动的测试(如Playwright做端到端测试),可以保证提交的代码中没有明显的破坏性Bug。
- AI驱动的Bug分诊(Triage)系统:系统自动发现Bug、分诊归类、分配给工程师。不同Agent各司其职——有的专门负责前端Bug,有的负责后端,有的负责Agent行为问题。发现Bug只需1-2分钟,分配任务只需几秒钟。工程师拿到任务后也用Agent去调查、提出修复方案。整个循环从过去的一周缩短到1-2小时。
- 自动修复(Auto-fixing)系统:根据代码修改涉及的文件路径来判断风险等级。低风险文件的修复,AI自动提交PR,工程师只需简单审核即可上线。目前50%以上的Issue是通过自动修复完成的。涉及安全或Agent行为的高风险修改,才需要专人深度审查。
为什么能做到? 因为Harness不是一个静态状态——它持续监控代码质量、日志中的错误和事故信号,将这些信号反馈给AI,形成一个闭环。这不是"写完代码就结束"的模式,而是代码从编写到上线到运行到修复的全链路都有AI参与。
嘉宾观点
陈凯:他们以前有一个"功能愿望清单"和一个"Bug清单",市场和工程师团队总在讨论先做哪个——这是传统软件公司的典型痛点。现在这两个清单都不存在了:Bug即时发现即时修复,Feature的数量远多于所需。
Peter:Harness的核心在于,当系统效果不好时,是靠人的负面反馈来改善,还是系统本身能够自我学习、自我改进?这正好是Harness的意义所在。
四、组织架构的重塑:产品经理角色消解,工程师角色扩展
新的变化
Creo的组织架构发生了几个根本性变化:
1. 产品经理角色被拆解到了每个工程师身上。 传统上,产品经理是矛盾最集中的角色——同时要和市场沟通、和开发沟通,所有对齐成本都发生在这个角色上。在AI First的组织中,因为开发成本极低(一个功能只需1-2小时实现),产品决策不再需要专门的中间角色来协调。每个工程师都可以在AI的帮助下拥有产品判断力,直接把想法在1-2小时内实现到产品中。
2. 工程师分为两类:架构师(Architect)和操作者(Operator)。
- 架构师负责设计系统的整体结构——比如沙箱和宿主服务之间怎么交互、安全策略如何制定、延迟怎么优化。Peter在2026年没有写过一行代码,他的价值在于找到AI规划中的缺陷(如安全性、延迟问题),然后通过批评和质疑(criticize)来引导AI产出更好的方案。
- 操作者负责在架构师设定的框架内,利用AI完成具体的开发任务。
3. 初级工程师比资深工程师更容易适应AI环境。 原因是初级工程师的技术债务和思维束缚较小,更愿意扩展自己的职责范围——不仅写代码,还参与产品设计、功能上线后的数据分析。而资深工程师因为长期在某个细分领域深耕(如推理优化、后端开发),习惯了"写完代码就结束"的模式,在AI环境下需要扩大职责范围时,思维转变的难度更高。
为什么会有这种变化? AI的编码能力已经很强且在持续增强,这使得个人的专业技能壁垒(specialty)被大幅降低。传统上一个人可能需要十年才能成为某个领域的专家,但AI可以在几分钟内达到甚至超越这个水平。因此,“专精"的价值在下降,“广博+系统思维"的价值在上升。
可能带来什么? 未来需要的是复合型人才——有产品Sense的工程师,或者有实施能力的产品经理。关键标准是:你能不能在1-2小时内把自己的想法直接实现到产品中。如果你需要把想法传递给另一个人去实现,那沟通和对齐的成本就远大于做事本身的成本。
嘉宾观点
Peter:在AI环境下,一个资深架构师的价值仍然不可替代——但之前可能需要10-50个这样的人,现在只需要1-2个。关键是要找到既能拥抱AI思维,又有产品Sense和系统架构能力的人。
Mark:未来产品经理这个角色不会被取消,但会变成一种新的形态——可能是工程师兼做产品,也可能是整个团队共同扮演产品经理的角色。传统软件时代的"个人英雄主义”(一个灵魂人物造就一个成功产品)会逐渐让位于"组织化产出”。
Peter:UX和UI设计师在未来会变得非常重要——但前提是他们具有把想法直接实现到产品中的能力。纯粹画设计稿、然后交给工程师去实现的传统模式,在AI环境下效率太低。
五、Harness的核心差异:静态vs动态,信任人vs信任AI
新的变化
市场对Harness的普遍认知 vs Creo的实践,存在一个根本性分歧:
| 维度 | 普遍认知 | Creo的实践 |
|---|---|---|
| 本质 | 静态过程:开发一个系统把LM的优势发挥出来 | 动态过程:让系统真正"活起来",持续自我改进 |
| 迭代主导 | 人为主导 | AI为主导,人负责将各种信号(市场、产品、基础设施)喂给AI |
| 对AI的态度 | AI是工具,人是使用者 | AI是生产力主体,人是架构师和审核者 |
| 问题处理 | 发现问题→人去修复具体错误 | 发现问题→思考系统层面是否有漏洞,修复系统而非单一错误 |
核心思维转变:不要把AI当成一个"智能"来看待,而要把它当成一个"系统"来看待。 当AI发生错误时,不要想着怎么纠正这个智能(那是传统思路),而要想着怎么弥补和优化这个系统。Harness就是为AI提供一套规则和成长空间——像养孩子一样,让它在一个框架内持续变好。
一个更极端的想法:你的内容可能未来是给AI看的,不是给人看的。 Creo团队在营销素材投放中发现,一些从人的审美角度看"不够好"的素材,投放到市场后由Agent阅读和筛选时,数据反馈反而更好。随着Agent经济到来(Agent帮人买东西、订服务、做筛选),你的广告到底是给人看还是给Agent看?这直接决定了你怎么构建你的内容系统。
嘉宾观点
Peter:Harness不是一个静态的、固定的枷锁去束缚智能,而是要给它提供空间让它成长。Harness的工程能力决定了你能不能把一个大模型榨出它的最佳使用上限。
陈凯:如果你在写作时发现一个巨大的问题,你应该花更多时间去思考系统上有没有漏洞,而不是花时间去改正某一个具体错误。与其说"彻底修复它",不如说"重新思考这个问题是否还是一个问题"。
六、AI能力的时间线:从"辅助人"到"主导开发"
新的变化
Creo的转型不是从第一天开始的,而是一个逐步演进的过程,与AI基础模型能力的提升密切相关:
- 2025年上半年:AI被定位为辅助人的工具,人在工作中占主导地位。这个阶段效率提升有限,“还不如人做来得高效”。
- 2025年下半年(约8-9月):意识到"AI辅助人"模式的局限性,开始花大量时间做团队思维对齐(mindset alignment)。
- 2026年1月:正式开始架构重构,仅用两周完成全部重构并上线新产品版本。
- 2026年至今:99%的代码由AI编写。Peter全年没有写过一行代码,角色完全转向系统架构和AI规划审查。
关键里程碑:AI的Planning能力从"不及格"到"优秀"。 一年前,AI做系统规划可能只有50分的水平,需要人工大幅修改。现在AI可以做到90分,架构师只需要通过对话式的批评和质疑(criticize),就能让它产出修订后的优质方案——而且整个过程不需要写一行代码。架构师还可以把审查经验提炼成"Skill"(技能模板),下次AI规划时直接引用,形成可复用的知识体系。
嘉宾观点
Peter:从技术角度来说,一年前让AI主导整个开发过程是不成立的。但当AI能力到达那个临界点时,整个重构的速度和效果远超一年前能想象的程度。这不是线性提升,而是一个质变。
七、SaaS产品本身也在重构:从"给人用的Dashboard"到"给Agent用的API"
新的变化
Creo团队在使用任务管理工具(如Asana、Linear)时,关注点已经从"Dashboard好不好看"变成了"API好不好用"——因为现在处理任务的主体是Agent,不是人。这折射出SaaS产品的一个根本性转变:
以前:SaaS产品设计围绕人→Dashboard、可视化界面、手动操作。 现在:Agent成为主要使用者→API能力、Agent可读性、自动化接口变得更重要。
Creo自己的产品方向也是顺应这个趋势:他们不是提供"一个统一的Agent"让所有用户使用(这是上一代General Agent公司的思路),而是让用户在Creo平台上搭建属于自己的Agent,这些Agent具有自我改进和自我修复能力,能理解用户的具体工作流。例如,一个广告投放Agent可以持续学习如何优化Campaign效果、降低成本。
嘉宾观点
Mark:现在主要的市场挑战不是"客户能不能接受AI",而是"客户不知道这种工作方式的存在"或者"不知道怎么高效使用Agent"。
八、人的未来价值:定义需求、审核结果、架构系统
嘉宾观点
关于"人在AI时代的价值",三位嘉宾形成了共识:
Peter:人的核心价值在于两件事——定义需求的方向和审核最终的结果。确定技术发展方向的永远是人的需求和社会的需求。只要人这个物种还在,定义需求方向和审核结果是否满足要求的价值就不会被取代。
Mark:人的价值在于对"价值"本身的定义。价值定义延伸出来的东西就是"我们知道自己想要什么",知道想要什么才能判断事情是否有价值。
Peter:不管什么岗位,人最核心的能力是系统架构能力——怎么架构AI系统、怎么维护AI系统。工程师如此,做市场营销也是如此:怎么搭建一套能自主运行的Agent营销系统,而不是单纯产出营销创意。
Peter:对未来的态度是"谨慎乐观"。变革过程中会有很多痛苦和噪音,但最终AI能带来更多自由时间和更大价值发挥。就像工业革命时期很多纺织工人和车夫被取代,但人会找到新的方向去实现更大的自我价值。
九、关键数据一览
| 指标 | 传统模式 | AI First模式 |
|---|---|---|
| 产品版本开发 | 100人团队,4-5个月 | 不到10人工程师团队,2周 |
| 功能迭代周期 | 6周 | 1天(上午写→中午测试→下午砍/重写) |
| Bug发现到修复 | 约1周 | 1-2小时 |
| 自动修复比例 | — | 50%以上的Issue自动修复 |
| 代码编写 | 100%人工 | 99%由AI编写 |
| 架构师需求 | 10-50人 | 1-2人 |
| 产品经理 | 专门岗位 | 角色分散到工程师团队 |
| 技术vs市场 | 销售超前产品4-5个月 | 技术超前市场4-5个月 |
总结:从信任人到信任AI
这场对话揭示了一个核心命题:AI时代的组织转型,本质是一场信任体系的迁移——从"信任人"转向"信任AI系统"。
传统组织中,人是最核心的一环,所有的流程、角色、层级都围绕人的能力和局限性来设计。AI First的组织则要解决一个全新的问题:你能不能信任AI做决策和执行任务? 而建立这种信任的方式,不是靠"相信AI"的心态,而是靠构建一套Harness系统——用规则、机制、信号反馈来保障AI的所有工作可以被信任。
这不仅仅是技术变革,更是思维方式的变革:从"出现问题→人去修复具体错误"到"出现问题→思考系统层面是否有漏洞";从"把AI当智能来纠正"到"把AI当系统来优化";从"人定义流程AI执行"到"AI主导流程人架构和审核"。
正如陈凯所言:Harness不是一个固定的枷锁,而是一套成长机制。未来能胜出的组织,不是那些AI工具用得最多的组织,而是那些率先完成这场信任迁移的组织。