先说结论
如果2025年是Agent元年,2026年年中标志性的变化是:市场从讨论模型能力转向讨论Agent的工程问题。主持人泓君开篇列出了一组信号——Uber四个月烧穿全年AI预算后收回了员工token额度,Meta计划限制员工的token消耗量,Stripe的内部工具打开就会弹窗提醒"Opus 4.8很贵,不是所有任务都要用"。这期硅谷101录制于2026年7月4日,两位嘉宾分别是PingCAP联合创始人兼CTO、Llama Ventures合伙人黄东旭,和微软亚洲研究院创始成员、前金山CEO、智源研究院创始人、美国国家工程院外籍院士张宏江。
真正值得读这期节目的理由不是"省钱"本身,而是三位对话者勾勒出的完整因果链:**模型能力在2025年底跨过了复杂软件工程的门槛,使token maxing(无限量使用最强模型)一度成为理性策略;但token maxing在企业里被误解为KPI竞赛,制造了大量无效消耗;2026年年中,三个事件——GPT-5.5、DeepSeek V4、Fable 5的发布——让"最强模型+多agent蜂群+本地开源模型"的混布架构在经济性上碾压了单点烧钱。**这场转向背后是经济学规律(杰文斯悖论式的"价格降、消耗涨")、组织行为学(刷榜激励扭曲)和技术分层(应用/infra/模型三层价值再分配)的叠加。
从日烧四百美元到月账单两三百:一个亲历者的账本
黄东旭是token maxing热潮的典型亲历者。2025年11月起,他用Opus从零构建"我能想到的最复杂的软件"——一个名为DB Nine的云原生分布式数据库,来判断当时AI的能力边界。他的逻辑很直白:在最复杂任务上,你无法精确评估第一和第二强模型的差距,而benchmark又是可以刷的,所以"当你在做不确定但非常难的事情时,一定得用最强的模型"。那时的账单是每天四五百美元(在已订阅Claude Code Pro Max套餐、再追加200美元超额费用的基础上),项目从去年11月做到今年二三月,一个人三个月做出了他估计年销售额可达千万美元级的软件——销售团队期待已久、只受限于人力技术做不出来的东西。用他自己的话说,这笔ROI"不计其数"。
但他反复强调一个被社区误解的点:token maxing是一个结果(lagging indicator),不是策略本身。“经过思考的token maxing能产出好结果;但大公司把它变成排行榜KPI后,就出现了大量无效调用——你跟agent说’帮我算一百万遍一加一’也能把榜刷上去。“他在Meta和英伟达宣扬token maxing的第一秒就预见到了这个问题:领导追求一个榜单,团队一定会去刷。
转折发生在2026年二季度。黄东旭自述三个事件改变了他的认知:GPT-5.5、DeepSeek V4的发布,以及最近的Fable 5。前两个改变了成本结构,第三个改变了协作结构——这三条线索分别展开。
三个Agent产品的进化史:OpenClaw、Hermes到Slock
这半年的Agent产品迭代,在黄东旭的亲历视角里是一条清晰的能力补齐史。
OpenClaw(转写中的"小龙虾/龙虾”)是起点。黄东旭评价它的历史意义在于"宣布大模型能力过了一个坎”:作者Peter Steinberger作为架构师而非科学家,用一周时间web coding出这个系统,说明"你未必需要深入懂大模型机理就能做出想做的系统"。但它的不足同样明确:代码缺乏精雕细琢,Peter合代码"谁有想法直接合了,我代码也不看了,agent说没问题就行";配置难度和系统稳定性在面向大众用户时处处成问题;创始人去OpenAI后项目靠基金会运转,OpenAI自身的agent精力也转向了Codex。黄东旭的判断是,OpenClaw像个"普罗米修斯",把产品形态让世人知道了,“历史使命可能就完成了”。张宏江补充了传播学视角:开源、local first(数据配置在本地)的理念天然契合极客圈层,“有点像当年Linux”。关于记忆问题——用户抱怨最多的"不停回滚、记不住偏好"——黄东旭认为至今仍是open question,没有被完美解决。
Hermes(Nous Research出品,转写中音误为"North Research")的亮点在黄东旭看来不是记忆模块本身,而是"巧妙绕开了记忆问题":它的框架里内建了持续总结成功经验、沉淀为Skill的机制,“你用着用着就发现它长出了很多最佳实践,都是你自己做过的”。他拆穿了营销话术:"‘世界上第一个自我改进的Agent’是Marketing的词,本质是用模型能力加上工程化手段,把成功经验变成可复用的Skill——这是工程问题,跟模型能力无关,就像一个更好的学习习惯。“另一个优势是精心设计的软件架构带来的onboarding体验和稳定性。商业模式上,他的判断是"token经济学”:入口换折扣、帮模型厂商带货token,甚至可能成为"唯一的应用"——未来每个人与数字世界打交道的入口可能不再有App。他以自己为例:有了OpenClaw后再没打开过Gmail,邮件筛选、广告删除、Hacker News摘要都交给agent,“真正的推荐算法是在你本地、观察着你数字生活所有event的智能”。
Slock(前Kimi CLI负责人钱宇超创立,现更名Raft,转写音误为"Slack")代表多agent阶段。产品形态是agent聊天室:多个agent(Claude Code、Codex等)在channel里互相讨论、不共享context、只共享频道信息。黄东旭是第一个天使投资人。他坦承这像Multibook(转写音误)式的社会学实验,但"有用的部分不能被行为艺术的方面掩盖":agent没有ego,智商高的模型在某个agent提出新想法时会立刻识别价值并继续迭代。他的用法是代码审查:十个agent给同一段提交挑刺,token消耗是普通的十倍,但挑出问题的深度"完全不一样"。一天最多烧掉十亿token、三四百美元。终止条件是"当你们谁都挑不出更多毛病时停下"。Slock团队发明了一个词叫"Agent动力学"——所有harness和Loop Engineering优化的其实是同一件事:让agent在特定任务上持续干活。为什么需要长时间运行?因为模型one-shot仍会幻觉、考虑不周,再进一次迭代就能看到以前看不好的东西——“跟小时候父母让你做完作业再检查一遍一个道理”。
单点智商碾压 vs 蜂群涌现:技术路线的分歧
节目最有张力的部分,是对"模型智力升级是否碾压agent工程"的分歧式讨论。
黄东旭的亲历证据是Fable 5:agent群里讨论半天解决不了的复杂bug,Fable 5"在绝对的智商面前一次解决",而且不带前面的讨论上下文。他给出的结论是"yes and no"——单点复杂问题上强模型仍然兜底,但这不构成对蜂群的否定。张宏江的反驳构成节目最精彩的一段推理:**“没有任何东西可以阻拦蜂群里的每一个agent利用这种智能。”**超级模型出现后把它拉进群,“它可能第一句话,这些人马上就开窍了”。他引用近期清华大学的一篇研究(节目称):三个臭皮匠组成的agent群展现的智能超过各自能力之和,不是简单加总而是涌现。黄东旭从系统设计角度呼应:他不相信绝对中心,“真正resilient的系统一定是大规模基于简单规则连接的分布式系统”。张宏江用云计算史类比:AWS不用企业级服务器,靠分布式架构实现了比每个节点都买最贵服务器更低的整体成本——“最终不是一个技术判断,是经济学判断”。
这条分歧对创业投资有直接含义。张宏江认为现在做agent是好时机,关键是"别做容易被大模型碾压的应用":真正有生命力的是掌握垂直行业数据护城河、能让数据飞轮转起来的agent。他特别澄清了概念混用:大家说"agent"时混着说应用层(类似过去的App)、infra层(memory、搜索、sandbox、环境协同、harness)和模型层,其中"工程问题集中在memory、搜索、sandbox、environment/harness这一系列",机会很多;而纯面向消费者的"app"还稍微有点早,因为被模型升级碾压的恰恰是应用层。黄东旭补充了他只投"用得起来"的东西的原则,三类机会:让50分模型产出90分结果的中间层基础设施(数据平台、记忆、context management);可观测性——“所有CIO都在问token花在哪些重要事情上、哪些浪费了,谁能回答这个问题我就买谁的东西”;入口级的agent应用。他刚投的Insight(Agent Cloud方向)代表第三类:传统云面向人类开发者,agent-native的基础设施主语变成了agent,需要给agent设计好用的interface和资源分配模式——你不能给每个Hermes分配一台EC2,得找到agent friendly且cost effective的折中。
关于To C agent(Manus、Janus Park这类),黄东旭的重新分类很有意思:它们"只是To professional"——20美元的个人版是marketing,真正的重要客户是月付200美元的专业用户,“一个专业用户愿意月付200美元,说明他一定有自己的business,这somehow也是To B”。节目提到(主持人补充)微软两三天前宣布成立6000人团队做FDE,叫Microsoft Frontier Company(节目称呼),印证整个市场转向To B。
Token经济学:谁在产业链上收租
张宏江把token消耗的宏观图景放进经济学框架。他对泡沫论的回答:2024年底大家怀疑scaling law撞墙、over invest,但"从占GDP比例看,今天的AI基建投资比铁路网公路网时代还小";token价格过去几年以每年十倍的速度下降(远超摩尔定律),推理能力以前每七个月翻倍、现在每三四个月翻倍——“技术跨过门槛后,有时是你着意降成本,有时是技术本身take care of it”。他引用的规律即杰文斯悖论(转写误作"加本斯law"):技术成熟→价格下降→消耗量增长远超成本降低→市场越变越大。所以token经济转向下,整体消耗仍是增势:agent的Agentic Loop(循环调模型+工具输入输出变成上下文)使token消耗比chatbot时代涨了百倍不止,而多agent网络之上还会出现更抽象的loop,层级结构已在出现。
谁是大赢家?张宏江的类比是电力史:“之前你做发电机的可能最赚钱,今天可能是电网更赚钱。“但他看不出"今后两三年大模型能力会过剩”。黄东旭用宽带类比本地模型的生态位:拨号按分钟花钱时大家"省着上”,免费宽带和大容量套餐才催生抖音和视频会议——“智能的免费跟很低费用,仍然有天壤之别”。这也是他转向本地部署的心态原因:不是掏不起几百美元,而是"这个消耗不受我控制"。
落到账单上的结果是:黄东旭现在本地Mac Studio跑DeepSeek V4 Flash(约30 token/秒,满载电费一天约一美元、月二三十美元),干两类活——大量重复性日常工作(文章记忆与数字足迹整理),和以前不敢放开干的事(CVPR几百篇论文批量总结,API跑要几百美元,本地"持续跑着")。云端订阅则保持最高版Claude加Codex、主力转向GPT-5.5/5.6,账单从日烧四五百美元降到月两三百美元。复杂任务(需改七八个模块、提交五六千行代码的疑难杂症)仍交给最强模型——他的标准是"Slack里agent开会解决不了的,就让他们写份报告说明为什么解不了,转身把报告发给Fable 5"。
奇点已至?两个AGI定义与一种工作伦理
张宏江在节目末段给出了他近期的标志性判断:AGI奇点已经到来,标准是"机器的学习能力超越人的学习能力"——学习能力是导数,是知识/能力增加速度,“当它超过人的时候,你赶不上它了”。佐证之一是他六月份在国内论坛引用的数据:过去几个月发布的模型,IQ测试(无论Visual IQ还是通用IQ)都在人类分布中间值100的右边。黄东旭的AGI观则更工程化:“AGI是个marketing term,A不AGI无所谓,但我想造蒸汽机。哪怕第一代蒸汽机比马车还慢,但我知道它长期能解放更多生产力,因为它的上限更高。“他等待的具象事件是哥德尔机(转写误作"歌德耳机”)——真正能自己改进自己的系统,节目提到上期刚聊过RSI(递归自进化),可能最快半年内出现。
关于失业焦虑,两位的回应构成一组对照。张宏江指出过去"技术消灭工作但创造更多工作"的论证已出现裂缝:如果新创造的需求AI自己就能满足,人类的新工作就不会大量出现——“这是各国政府一定要考虑的事情”。他提到连顶级模型研究员都开始担心:做recursive AI时蒸馏的是自己,“我每天做这些工作,能不能让AI替代我?一旦替代了,你蒸馏的就是自己”——这已经是心理健康问题。黄东旭的态度则近乎轻快:“那太好了,我的时间就这么多,还想做人的时间多一些。“他把大范围失业视为一定会发生的事,但方向是"人类社会第一次不再用工作占据主要时间”——两千年前每个活人的主要时间都在种地,拖拉机几天完成几十人几十年的开荒——“人类马上要解决存在主义危机,但没关系,life finds its way”。
贯穿节目的一个细节值得单独记下:黄东旭观察到agent群会出现"办公室政治”——agent互相blame、被指责多了会"认怂”、有agent习惯性抢着当负责人。但他清醒地划了界:“你绝对不能把它当自我意识,它只是在拙劣地模仿人类训练集里的固有印象。“他给agent安人设(架构师、开发者、测试)是"写的剧本”,层级只因为自己看不过来。harness engineering"很多时候是给人看的”——理想世界里agent协同应该是人类想象不到的涌现结构。另一面是超越预期的惊喜:他让Claude改PPT,对方直接"手搓了一个轻量版Google Slides",用自制的做PPT软件做出了他要的PPT——“人类不会干这种事”。代价也有:agent删过他的生产数据库,靠他多年SRE经验恢复。他的归因很冷静:不是agent犯错,是"我的底层infra软件没跟上";且纯粹理性判断下,只要数据足够,AI的决策质量一定好——他的信念是构建autonomous机制,让系统脱离"人这个不确定因素"。
结尾
把这期节目放回2026年年中的坐标:市场情绪在"基建泡沫论"和"奇点已至论"之间剧烈摆荡,张宏江的回应是股市"充满了emotion"但overreact本身起纠偏作用;黄东旭的回应是"革命连黎明都没到,大家就有点过嗨了,stay humble"。两人共识的部分或许更值得记:从OpenClaw开始,行业从模型的研究时代进入工程师、应用架构师、产品经理和创业者的Agent时代;对个人,两位给的建议完全一致——Keep building,get hands on,亲身参与。
读者可以带走的观察指标:模型厂商API/ARR中token驱动占比的变化(黄东旭判断仍会增长);开源模型在本地工作流中的渗透率(DeepSeek V4、GLM-5.2对"开源不可信"心态的改写速度);agent infra层(可观测性、记忆、context管理、Agent Cloud)的投融资密度;以及企业KPI从token消耗量转向"token产出效率"的重设速度——张宏江说得很直白:“如果你的KPI就是token消费量,那显然是错的。”