基于【101视频播客】「对话叶奇意:“寻找”��之暗面杨植麟、中国两代AI、十年人才迁徙,与AGI信仰」的完整转写整理。嘉宾叶奇意(TME)自称"在AI行业打杂了十年的打杂工",历经依图(AI 1.0四小龙之一)产品经理→创新工场AI工程院前沿探索→美团龙珠领投月之暗面A轮,现正创业做面向普通人的人机交互工具。
一、追踪杨植麟:四个月才加上微信的A轮投资故事
新的变化
ChatGPT发布后,叶奇意所在的团队在一两周内体验后意识到"这件事情不一样"——它似乎是一个能通过图灵测试、触碰AGI门槛的东西。而当时中国需要一个全新的盘面来做这件事:上一代有历史包袱的公司很难放开手脚。锚点只有一个——相信AGI的人一定会聚集在一起。
嘉宾观点与解释
杨植麟在ChatGPT发布前就一直在追求Transformer架构下的Scale模型。 叶奇意从公开论文追溯了杨植林的轨迹:2019年在Google实习时发表了Transformer-XL和XLNet(光从命名就能看出他讲究Scale);在致远研究院的CPM、GLM模型中有他的团队身影;华为发布的盘古1.0里也有他的团队。“这个人好像一直都在追求这件事情,即使在ChatGPT发布之前。”
加杨植麟微信比想象中难得多——追了四个月。 叶奇意坦承自己是行业新人(刚从AI产业界跳到投资界,没出手过任何项目),加微信不通过"是一件非常合理的事情"。他去了杨植林之前的公司拜访三次,见了其他几位联创,又通过已加入四小龙的前同事介绍了一批优秀的安全研究员过去。直到这些人在模型训练中展现了价值,才反过来帮叶奇意说了话。最终在高铁站突然收到消息:“Kimi同意要见你们了”。
杨植林第一面印象:一个很朴实的研究员。 叶奇意见到的杨植林"很纯粹、很简单,就是单纯对于解决一个问题非常投入"。他认识的DeepSeek、智谱等公司里也都有这样一波"真正热爱行业、很纯粹"的人。杨植林当时定义的目标缩写为LTV——L是LangChain(工具链调用),T是Truthfulness(可靠性,即解决幻觉问题),V是Video(多模态,因为文本模态被重建后需要更多data来补充智能skill)。叶奇意觉得这个缩写很有意思——在广告行业LTV是Lifetime Value(客户终身价值),一个特别商业化的词;在杨植林口中,LTV是一个特别AGI的词。
A轮估值:月之暗面当时是市场最低。 到2023年五六月份,同期大模型公司的前一到三轮基本融完了——零一万物、百川投前接近十亿美金;MiniMax、智谱也过了十亿美金。月之暗面因为团队相对年轻、之前没做出过特别大的公司,市场关注度相对较低,估值也最低。叶奇意觉得"运气比较好"。
A轮时有VC drop了,美团顶上了。 叶奇意没有透露太多细节,但确认在2023年上半年,因为团队很年轻、非常实,融资大概率没有成名国际的企业家那么顺利。
王兴的关键一锤。 内部投委会讨论"非常非常激烈"——核心争议在于:创业公司能不能做超级模型+超级应用?模型投入是不是无底洞?会不会变成大厂的机会?王兴在赶去下一个会之前丢下一句话:“我确实(认为)创业公司能够去做超级模型和超级应用的概率很低,但我愿意支持一把。” 就是这句话把后面推了过去。
二、月之暗面的2024:投流争议与"二等公民"体感
新的变化
2024年初,一位KOC在二级市场路演时展示了Kimi的Long Context(长上下文)读研报能力,一下子让非AI界的人意识到Kimi模型做得不错,DAU大幅增长。但随后Kimi在B站等平台大量投流(叶奇意有体感——做AI内容的视频banner位全是Kimi广告),引发了"是否背离最初AI承诺"的争议。
嘉宾观点与解释
DAU增长本身就在给模型补充data。 更多不一样的用户带来不一样的task,这些task在整个模型训练中会进一步给模型补充更多data和任务,推动模型进步。
中国大模型公司特别不容易——资源非常非常匮乏。 叶奇意反复强调:2024年中国大量初创公司都缺算力,非常非常缺。而你要烧钱,就得说服有资源的人把钱给你。但也正因为资源匮乏,DeepSeek、Kimi、智谱等都被逼着做了大量优化,“反倒是有时会拿出一些北美那些资源充裕厂商不一定重点优化的点”。
To C端大模型产品竞争太激烈。 豆包、千问背后是大厂支撑,Kimi如果走To C路线,直接竞争的就是字节、阿里,而且大家都没有收费。这些都是创业公司面临的现实压力。
三、从K2到K3:中国开源模型的质变——不再拼性价比,直接摸SoTA
新的变化
叶奇意将中国开源模型的发展划分为几个阶段:K2时代(强调dynamic model、性价比极高)、K2.5时代(Open Cloud/小龙虾热潮后,大家开始关注性价比,国内模型是好选择),以及K3时代的质变时刻。
嘉宾观点与解释
K3是真正的"Kimi Moment"——中国模型第一次不是在拼性价比,而是直接摸SoTA。 K3的训练过程中超越了当时所有SoTA模型(超过GPT-4o系列,直到最近Stable等模型才发布可能效果稍好的)。在K3之前,中国开源模型一直被认为是"平替"——性价比高、推理优化做得特别好,但本质上还是追赶者。K3改变了这个叙事。
今年的Kimi Moment跟去年的DeepSeek Moment震撼是不一样的。 叶奇意认为:去年DeepSeek带来的更多是"我们也能做到"的震撼;今年K3带来的震撼更有紧迫感——因为它证明了开源中国模型可以摸到SoTA,而不是仅仅在性价比上做文章。而且是开源的。
2025年最让人兴奋的:scaling从"存量数据"转向"审美拉动"。 2024年大家scale的是存量记录的data(pre训练端、SFT的data);2025年OpenAI o系列发布后,大家开始在强化学习路上——先预定好问题和reward,在reward奖励下去scale test time(测试时算力),得到下一波智能进步。这意味着存量的已被记录的数据范式开始迁移到"你可以通过自己审美去拉动模型往前走"的阶段。对资源不那么充足的厂商和应用层公司来说,涌现出了一波新机会。
四、上一代AI四小龙的集体困境:泛化不够导致"高级外包"模式
新的变化
AI 1.0时代(商汤、旷视、依图、云从)的集体困境是:模型泛化程度不够。这直接导致了商业模式的根本缺陷。
嘉宾观点与解释
每个新场景都要重新标注和训练——像一个"高级外包"。 叶奇意举了安防场景的具体例子:2017年把人脸识别卖到各省市公安机关时,东北省市的风雪天气多需要重新标注和训练模型;过一个省,摄像头覆盖空间更广、架的高度和角度不一样了,又得重新锚定。这种泛化能力不足导致:每scale一个下游应用就必须增加相应的研发投入——一群全中国最聪明的理科毕业生提供很贵的服务。结果就是业务体量越大,成本侧越高,管理复杂度越大,非常像一个to B服务型生意。跟互联网公司"标准统一系统、scale越大边际成本越趋近于零"完全不同。
这个困境的本质和今天大模型公司有区别。 大模型的business model底层有根本性不同——前提是模型真的具有足够泛化力。这也是叶奇意当年在依图感受到的"路径依赖失败":卖模型能力不是一个好生意(至少在AI 1.0时代不是)。
五、两代AI的人才传承:从MSRA/百度到四小龙到大模型六小龙
新的变化
中国AI的人才图谱有一条清晰的传承链:MSRA(微软亚洲研究院)和百度AI研究院培养了AI 1.0的founder们,AI 1.0的founder们又培养了AI 2.0的founder们。
嘉宾观点与解释
传承的核心是"对技术的信仰、好奇心、不计结果的探索",而不是功利主义。 叶奇意举例:本科时代CS系能力最强的人(打ACM的人)很喜欢去MSRA实习;依图的联创陈曦曾在MSRA短暂实习,后被王坚带去做阿里云。月之暗面的联创里有旷视过来的人,MiniMax有商汤、依图出来的人,智谱脱胎于清华实验室——这一代模型厂商的founder们很多在上一代四小龙实习过。
上一代四小龙的人才流向这轮的比例约10%+。 叶奇意身边的朋友中,超过10%已经流入这轮AI(即使2023年没流入,也逐渐流露进来了)。但很多不是站出来的founder/face,而是下面执行的leader——他们经历过周期,反而能摒弃短期噪音,持续推动事情发生。
约80%的人拒绝了这轮AI的邀请。 经历过一波理想主义破灭后,很多人把二十多岁到三十岁最激情澎湃的时间奉献给了AI 1.0,却没得到世俗意义上的好回报(没做出像互联网公司一样伟大的公司)。所以有了失败的路径依赖——“暂时先观望一下”。但剩下10%-20%的人"完全不计我会获得什么",只是觉得这个事情足够让他兴奋、有影响力。
DeepSeek是黑马,叶奇意自己都没cover到。 DeepSeek招的人更加年轻(杨植麟/量化公司背景触达的是每年搞ACM/NOI竞赛的最年轻人),所以叶奇意到2023年下半年才通过认识新一代researcher和engineer接触到DeepSeek的人。不同founder的背景决定了他们触达不同人群的效率——DeepSeek(量化背景)偏向最年轻的竞赛生;MiniMax、月之暗面(��小龙背景)偏向上一代人才供给;智谱(清华背景)偏向清华应届生。
六、2019年创新工场尝试做"中国版GPT-2":为什么失败了
新的变化
在创新工场AI工程院(鼎盛时期200多人),叶奇意团队在2019年就尝试做了"中国版GPT-2"——比ChatGPT发布早了三年。
嘉宾观点与解释
凑齐了data、卡、人,但模型效果很差。 有趣的机缘:一位中东LP盘点机房时发现几百台V100尘封了半年没人用,问创新工场要不要用——“我们要用!我们要用!“有了卡、有了NLP研究员(腾讯AI Lab的张潼老师团队离职后短暂驻留创新工场)、不缺中文data,训练出来的模型却非常糟糕——让回一封简单邮件,它连续输出三个逗号。
失败归因:数据工程没做扎实 + 没有理解Scaling Law。 第一次复盘归因是"中文数据质量不如英文语料”;到2020年再次尝试(孵化澜舟科技,搭配周明老师)时,才意识到核心问题是数据清洗没做好、没把"data非常踏踏实实清洗和处理干净"这件事做到位,以及自身对Scaling Law的认知没有到位——仍然在用AI 1.0的范式找to B垂直场景卖模型能力。
七、暴论:卖模型能力不是好生意,真正的super应用是"持续生产智能的环境”
嘉宾观点与解释
“卖模型能力不是一个好生意”——即使今天Claude证明了收入可以涨得很快。 叶奇意认为Claude是一个好产品,但好在其coding场景的封装(Harness脚手架、工具链、程序员即时反馈的reward环境),而不仅仅是模型能力本身。模型能力(不管是API还是SDK)最终都会commercialize(商品化)——就像云计算,是个不错的生意,但"不是一个可以得到非常高超额利润的生意"。
Model会吃进去很多东西,但人类智能不可穷尽。 叶奇意相信modelization(模型化)趋势——模型会逐步把共识性的行业标准东西吃进去,包括Harness层自己都会被吃进去。但他更坚信人类社会的智能探索永远是源源不断会产生的。真正的super应用/super app,会是一个"在人与AI的互动当中,源源不断持续产生新的智能的环境"——而不是单纯卖模型能力本身。
技术领先只能给你一个时间窗口,不是永恒壁垒。 在模型高速发展期,SOTA模型掌握定价权、有超额利润,追赶者只能贴近成本甚至亏着卖——这是事实。但"永远保持技术领先,在我看来是不可能的"。关键在于:能不能利用"人无你有"的时间窗口,建立一个能持续生产智慧数据、让模型不断evolution的飞轮?如果飞轮建立成功,更多智能发生在你的环境里,环境就会不停往上走,别人赶不上。如果飞轮没造出来,时间窗口一过,模型能力被拉平,你就变成commodity。
八、大厂角色与叶奇意的下一步:做面向普通人的AI工具
嘉宾观点与解释
字节打出了"模型生产-消费-分发闭环"的漂亮范式。 豆包2.0 + AI短剧 + 抖音内容孵化平台,甚至比Colo的有些闭环做得更往前一步——这是字节用上一代移动互联网积累的生态型打法结合AI的结果。
阿里是"全地域的支持者",给几乎所有国内大模型公司投了卡和资源,在搭基建。
腾讯/微信拥有最好的环境之一。 虽然暂时模型没进第一梯队,但一个好的大模型产品最重要的是环境——微信拥有目前整个社会里可能是最好的环境。
叶奇意自己的创业方向:for human interaction的小工具。 他从2022年底用超级App(ChatGPT等)到今天,一直觉得自己是"AI世界的二等公民"——在开放数据框里觉得自己不够聪明,不像那些prompt高手、能构建AI loop的人那样是"一等公民"。“一个产品如果让一波用户觉得自己是二等公民,它大概率不是一个好产品。” 他想做的是让智能更加普惠地、平等地让所有人享受。具体在做"人与人交流"方向的小工具——因为人与人交流不是简单的"编码-发送-解码",而是共同制造一个场域、重建意图的过程。
结语
这期对话最珍贵的地方在于叶奇意亲历者的视角——他不是从外部观察,而是在依图做过产品、在创新工场尝试过GPT、在美团投了Kimi。他讲述的四个月追杨植麟加微信、王兴那一句"我愿意支持一把"、2019年几百台V100尘封的机缘、以及"卖模型能力不是好生意"的暴论,都是只有局内人才能给出的细节和判断。而贯穿始终的主线是:中国AI从"拼性价比平替"到"直接摸SoTA且开源"的质变,背后是两代人十年间对技术信仰的传承——即使80%的人经历过理想主义破灭后选择了观望,那剩下的10%-20%不计回报的人,就是今天的DeepSeek、Kimi和智谱。