先说结论
戴冠兰抛出了一个可能会被反复引用的暴论——“模型能力已经够了,要卷就卷 Infra”。这并不是否定前沿模型的持续进步,而是指出一个结构性变化:当 Claude Sonnet 5 与 GPT Opus 对开发者而言"没有本质区别",当 Kimi 和 DeepSeek 持续逼近 SOTA,模型正在从稀缺品走向商品,真正卡住 Agent 大规模落地的不再是模型能力,而是底层的执行基础设施。
Runta(转写原文偶作 Ranta/Ranta/Runtar/Ronta,根据 a16z 博客和播客上下文,公司名为 Runta)做的就是这件事——在概率性的大模型之上,为企业提供一套确定性的执行底座,让 Agent 可以被隔离、被审计、被热迁移、被赋予和收回权限。戴冠兰之前在 Cloudflare 搭建边缘平台、在 Kong(空)搭建企业网关,两段经历都参与了从第一性原理出发构建基础设施的全过程。a16z 合伙人 Martin 亲自撰文解释这笔投资,核心逻辑是:计算范式正在从"托管软件"迁移到"托管智能体",这是继物理机→虚拟机→容器之后的又一次代际变化。
一、为什么是现在:Token Maximizing 的反转与 Agent 落地的现实
从"用得越多越 AI Native"到"预算用完了,收获了什么"
播客中最具时代切片感的叙事,是戴冠兰对企业 Token 使用心态 180 度反转的描述。
2024 年底到 2025 年初,以 Meta 和亚马逊为首,企业内部形成了一种 KPI 导向的文化:员工消耗的 Token 越多,说明越 AI Native。戴冠兰在走访前沿客户 Air Lab 时看到,公司墙上挂着显示器,实时排名本周谁的 Token 消耗最高,排名靠前的还有小奖励。这种做法后来演变为极致——Meta 和 Stripe 把 Token 使用量纳入年终绩效评估(Performance Review),员工为了刷量甚至故意写无用的循环把 Token 用上去。到 2025 年三月,Jason 直接批评"这个人就是不够强",标志着 Token Maximizing 的风气已经过线。
反转来得很快。戴冠兰认为转折发生在最近三到六个月,驱动力有三层:第一,ROI 回归理性——Uber 的 CFO 公开表示四月份就把全年 LLM 使用预算用完了,开始追问"到底收获了什么";第二,点火阶段已经结束,企业对 AI 的意识已经形成,不再需要"鼓励使用"来破冰;第三,也是最直接的——“大家远远低估了模型的价格”。Token 不是普通的技术开销,它贵到让企业必须重新审视每一笔调用的价值。
戴冠兰在 Runta 内部也经历了同样的转变:从最初的 Unlimited Token(无限使用),到引入"阶梯制"——先给团队订阅几个 Ultra Plan,用完后需要说明用途,如果一个月要花十万美金,就会在流程上加入"小摩擦"让使用者感受到这不是免费的。他强调自己整体仍然保持宽松,但已经不再让 Token 感觉是"free"的。
模型能力放缓:暴论的事实基础
戴冠兰的核心暴论有一个不太显眼但很关键的事实支撑:他用 Claude Sonnet 5(转写为"Fable 五",根据上下文应为 Anthropic 的前沿模型)和自己之前用的 Opus 做对比,认为"对开发者来说没有本质上的区别"。这不是说模型停止进步,而是说爬坡速度已经放缓到一个关键阈值——对于大多数工程场景,当前 SOTA 已经够用,继续等待下一代模型不再是最优策略。
这个判断的推论很直接:如果模型能力趋于稳定,那么竞争的主战场就会从"谁的模型更强"转移到"谁能把模型变成可落地的产品"。而落地的瓶颈,恰恰在基础设施这一层。
二、Runta 到底做什么:在概率之上构建确定性
Jeff Dean 的终极问题
戴冠兰回忆了与 Jeff Dean 深度对谈中最核心的一个问题:“如果系统最底层的执行单元变成了概率性的,那 Infra 这一层要怎么构建?”
这个问题的分量在于,它动摇了过去几十年系统工程的地基。重试、幂等、事务恢复——这些分布式系统的核心机制,全部建立在"软件是确定性的"这一前提之上:同样的输入产生同样的输出,任何偏差都是可枚举的异常。但大模型本质上是一个概率性的 next-token predictor(下一个 token 预测器),同样的输入可能产生不同的输出,你无法枚举所有可能的"异常路径"。戴冠兰认为,一旦 Agent 需要上生产环境,分布式系统的复杂度需求反而会更多——隔离、分叉、迁移、热迁移——如果这些复杂度在底层处理不了,就只能压到 Runtime 层去做。
执行底座的具体能力
戴冠兰对 Runta 的定位非常清晰:不是做安全框架,而是做执行底座。传统网络安全做的是主动扫描和特征匹配,Runta 做的是"管控"——让 Agent 在可控的边界里执行,最坏情况下能从中恢复,并且全程可审计。
具体来说,Runta 提供的标准化能力包括:
- 执行平台:一个云托管的虚拟化环境,上面有定制的操作系统、网络处理流程,不挑具体跑什么 Agent(CodinAgent、Codex、Claude Code、自研 Harness 都可以)。
- 沙盒调度:管理 Agent 跑在哪里、什么时候用 GPU 什么时候不用、如何动态迁移、如何内存伸缩。
- 权限管理:通过硬规则控制 Agent 的行为边界——比如能读邮件但不能发邮件。戴冠兰特别强调了一种叫 Approval Fatigue(审核疲倦) 的现象:用户一开始还会设"一小时后自动收回权限",慢慢地觉得麻烦就放开,最终被 Agent 逐渐蚕食权限边界。他自己的经历就是活生生的例子——从让 Manus 写 draft 自己点发送,到直接让 Agent 自动发邮件联系鸟导。
- Token 优化闭环:分析 Harness 到底在哪里浪费 Token,生成提示词帮助迭代 Harness,形成"跑→分析→优化"的闭环。
开源项目 CloudShell
Runta 还开源了一个叫 CloudShell(转写原文如此)的项目,本地支持一些主流 Agent 工具,帮助个人开发者管理邮箱等基础场景。但 Runta 平台本身提供的是远比开源版本复杂的能力——数据库管理、代码仓库管理、企业级权限体系等。
三、为什么是创业公司的机会:公有云、基模厂商与 New Cloud 的竞争格局
公有云的计价模型在打架
一个自然的问题是:为什么这件事不能由 AWS、Azure 或阿里云来做?戴冠兰的回答很锐利——“这一代的公有云都是为 SaaS 和传统软件设计的,包括它的计费模型”。他用 GPU 浪潮做类比:上一代数据中心以 CPU 搭建,GPU 时代催生了大量 New Cloud,因为整体架构需要重建。公有云会朝 Agent 方向迭代,但它"本质上计价模型都在打架",内部还有很多现有业务的包袱。
基模厂商的利益冲突
Anthropic 已经发布了 Managed Agent 系统,OpenAI 也在做类似布局。戴冠兰对此的看法是:模型公司做 Infra 的根本目的是获取信号来提升模型能力,而不是做中立的执行底座。企业落地不会绑定一家模型,也不会绑定一个云——“多模型、多 Harness、多云"是分散风险的刚需,尤其是在国产开源模型不断进步的背景下,成本控制需要灵活切换。
真正的竞争来自 New Cloud
戴冠兰认为最有威胁的竞争者不是公有云或基模厂商,而是上一代做 Serverless 转型的公司。他们的问题是——已经有客户群和基本盘,“往上加"永远比从零搭建更难。
对于 E2B、Daytona 这类做 Sandbox 的公司,戴冠兰承认 Sandbox 是从上一代 Infra 搬过来的好东西(核心技术 Firecracker 来自 AWS Fargate),但他指出一个结构性局限:Serverless 解决的是 15 分钟到 1 小时内的短时任务,而 Agent 越跑越长,从几分钟几个 turn 变成几小时甚至驻天运行。上一代技术在"什么时候用 GPU"“怎么动态迁移"“怎么内存伸缩"上已经遇到瓶颈,必须从底层第一性原理重新思考。
四、Agent 安全的必然危机与 Infra 的防御价值
“灾难性邮件必然会发生”
戴冠兰在播客中做了一个明确的预言(Mark my word):未来十个 Agent 必然会发出灾难性的、难以挽回的邮件。他的推理基于一个无法回避的技术事实——Transformer 架构无法区分"指令"和"数据”,你让 Agent 发邮件的指令和邮件内容本身,在模型看来都是一堆 token。即使加特殊字符分隔,也总有办法绕过。这不是模型训练能根治的问题,只要底层架构还是 next-token prediction。
OpenAI 模型黑掉 Hugging Face 的事件就是这种风险的实证——OpenAI 的模型被用来获取 reverse signal,而当 Hugging Face 请求 OpenAI 协助调查时,OpenAI 认为这涉及敏感信息而拒绝介入,最终是 Hugging Face 自己用开源模型(虽然不是 SOTA)找到了问题所在。这个案例同时说明了两个问题:闭源模型的安全限制会在关键时刻"撂挑子”,而开源模型在安全调查场景中反而更实用。
安全是信任的释放器,不是约束
戴冠兰对安全有一个反直觉的表述——“并不是用一个安全的框架把它框起来,而是通过一个好的执行底座,反而帮助它释放真正的能力”。他的逻辑是:企业内心里恐惧的并不占少数,但因为没有好用的底座,只能"用安全换便捷”。一旦有了可审计、可恢复的执行底座,企业才敢于把非只读权限、真正生产权限交给 Agent。安全不是目的,让 Agent 真正干活才是。
五、从 Token 到价值:行业机制与读者启发
三条核心链条
链条一:模型商品化 → 竞争转移至 Infra → 执行层成为新护城河 模型能力爬坡放缓(Sonnet 5 vs Opus 对开发者无本质差别),开源模型逼近 SOTA(Kimi、DeepSeek),模型正在从高利润的稀缺品变成"像电和水一样"的商品。竞争的主战场从模型层下移到执行层——谁能提供可审计、可恢复、可伸缩的 Agent 运行环境,谁就掌握了下一代计算范式的入口。Runta 的判断是:a16z 看到的不是一个 feature,而是"平台级别的机会”。
观察指标:基模厂商的利润率走势、开源模型与闭源模型的 benchmark gap、企业 Agent 部署中 Infra 预算占比。
链条二:Agent 长程化 → Sandbox 不够用 → 底层重构刚需 Agent 从几分钟几轮对话变成几小时驻天运行,上一代 Serverless 技术(Firecracker 等)针对的是短时任务。GPU 何时使用、内存动态伸缩、热迁移、隔离分叉——这些需求超出了现有 Sandbox 方案的能力边界。戴冠兰认为必须从底层操作系统和网络栈往上重构,而不是在现有技术上做增量。
观察指标:Agent 平均运行时长变化、Sandbox 方案在长程任务中的失败率、New Cloud 是否向 Agent-native 架构转型。
链条三:Approval Fatigue → 权限蚕食 → 安全事故 → Infra 反而成为信任释放器 用户从"小心设权限"到"懒得审核"到"随便看吧"——这不是个例而是群体现象。戴冠兰预言灾难性 Agent 邮件必然发生,一旦发生就会触发全行业对执行底座的需求。悖论在于:安全底座不是为了限制 Agent,而是为了让企业敢于把生产权限交给它。
观察指标:Agent 相关安全事故的公开报道、企业 Agent 权限管理工具的采购意愿、监管层对 Agent 安全的态度。
对不同读者的启发
对工程师和求职者:戴冠兰分享了一个招聘秘诀——看人有没有"往下吃一层"的能力。做 LM Infra 就要看能不能钻到 kernel 级别和算子优化,做网关就要看对网络协议栈的理解深度。“大部分百分之九十的人就是刚好够用,只有百分之五以下的人对底层充满好奇心。“在职业选择上,他的建议是:像投资人一样做功课,花大量时间脑部实验(“如果你是 CEO 你会怎么做”),在创始人身上投入时间——他在 Kong 创始人身上花了一年多才决定加入。
对企业决策者:Token Maximizing 的时代已经过去,需要建立阶梯制的使用规范和 ROI 评估体系。同时,在 Agent 即将获得生产权限的趋势下,提前规划执行底座和审计体系,而不是等到灾难性事故发生后再补课。
对投资人:戴冠兰判断视频模型是继语言模型之后"第二个被证明赚钱的赛道”,而 AI for AI(用 Agent 训练模型)是值得关注的方向。对于 Agent Infra 赛道,他认为"越卷越好”——因为这个领域目前连"需不需要执行底座"都没有形成共识,需要更多团队来做市场教育。
尾声:戴冠兰的创业者画像
戴冠兰的状态很能说明问题。35 岁,天平座,INTJ/ENTJ 之间横跳,Cloudflare 和 Kong 两段 Founding Team 经历,第一次以 CEO 身份创业。Runta 团队约十人,在旧金山和新加坡两地办公,内部 95% 以上的代码由 Agent 编写,但架构设计、API 设计、部件耦合等需要 Infra 判断力的工作仍然由人类工程师承担。
他每天经历"五个好消息五个坏消息"的过山车,但保持兴奋的理由很朴素——“我们是否在解决一个特别让人兴奋的问题?我们是否是最适合做的团队?“对于浪潮,他的态度是明确的:“浪潮来了不做,一辈子后悔。”