来源:「十字路口」对话 MiniMax 闫俊杰:M3、10X 计划、和智能的终局【视频播客】 活动:一场围绕AI编程的"圆桌交锋"闭门讨论 嘉宾:闫俊杰(MiniMax创始人),以及DeFlow开源项目作者、互联网金融公司AI负责人、AI观察者等多位嘉宾

本文整理自这场圆桌讨论。闫俊杰回顾了MiniMax从M1到M3的完整演进,并给出了他对10T模型、中美差距、模型与Agent关系、数据方法论转变、以及智能终局的系统判断。以下按主题组织,每个主题包含「新的变化」和「嘉宾观点与解释」两个维度,力求让未观看视频的读者快速理解核心内容与得出观点的原因。


一、从M1到M3:MiniMax模型的三代演进

新的变化

MiniMax的M系列模型经历了一个从"效果不太好但看到希望",到"明确聚焦coding顶着质疑",再到"token消耗量超预期十倍"的完整演进过程。这种演进不是平滑的——每一代都有明确的目标取舍,也有意外收获和未竟之事。

嘉宾观点与解释

闫俊杰用一个"经典的桥段"形容做M1时的感受:当时团队第一次跑通差异(diff)时,有一种"纸上画了什么、后边就发生了"的预感,这件事发生在今年五一假期前后。但M1模型本身"坦白说,效果不太好",真正让团队感受到方向正确的,是M2。

M2的策略是高度聚焦:去年下半年,行业最关心的评测是各类通用benchmark,但MiniMax"非常明确,只做coding的AI,不管那些不相关的对话场景"。这个决定在当时"让国内有很多质疑——为什么你不管这些东西"。但团队坚持做了,上线时定的目标是"一天消耗一万字的token我们就满意了"。结果到22.7版本时,token消耗量"变成了十万亿token",“基本就是想目标超了十倍”。

M3的目标更长,但"还没有完全实现"。闫俊杰坦承M2有两个未达成的目标:一是想在M2实现多模态,没实现;二是想做到"编程里面能够到主流模型",也没实现。M3的两大目标则是让用户可以不限制成本地使用3T、2T参数级别的模型——“如果到这个东西再加上整个行业的大盘增长,我觉得总量能到一个非常可观的量级”。

背景:“token消耗量"是衡量一个模型实际被使用程度的客观指标。闫俊杰认为,与其看各种benchmark分数,不如看用户真实消耗了多少token——这反映了模型在实际工作中的有用程度。一个只做coding、放弃通用对话的模型,token消耗量能超出目标十倍,说明垂直聚焦策略在产品层面是成立的。


二、10X计划:模型商品化与系统化弥补单模型不足

新的变化

当单一模型变得人人可用(“AI coding已被商品化”)后,新的问题浮现:不同模型各有优劣,没有哪个模型在所有场景都最优。一个明显的趋势是——用系统而非单一模型来拟合能力短板。

嘉宾观点与解释

圆桌上的嘉宾(嘉远)分享了一个实践中验证的方法:他们发现M3"有时会比较慢,或者新品时间会比较长,或者给你的结果里面不一定所有的点都是正确的”。解决方案不是等M3自己变好,而是用其他模型(如OpenAI的模型)给它做rebase,作为mentor,让M3作为主力co-pilot模型。

这种"用系统方式拟合单一模型能力不足"的思路,实践下来"确实能够达到token消耗与整个产出效果的平衡"。背后的逻辑是:未来公司里"token cost肯定是你需要考虑的一个目标",因此需要思考"怎么让不同的工作由不同的模型来完成"。

闫俊杰进一步从生产力角度解释了这种转变的根源。他认为AI的核心是生产力,模型的作用是"提供工具,就像发明汽车让赶路更快一样,AI让思考和验证的过程变得更快"。但生产力的本质是解决行业里的真实问题,“光靠模型或光靠research其实做不到”。这直接引出了他对数据方法论的根本反思(见第五节)。

背景:“10X计划"并非一个正式名称,而是概括了MiniMax在模型规模上的十倍跃迁目标(从更小的模型到3T、再到10T),以及在产品策略上让token消耗量达到"十万亿"级别(实际已超M2目标的十倍)的双重含义。闫俊杰强调,当模型足够便宜、用户不再关心成本时,真正的规模化应用才会发生。


三、10T模型:中美差距、Scaling Law的局限与数据挑战

新的变化

这是整场讨论中最技术性、也最"硬核"的部分。闫俊杰给出了一个清晰的判断:中美模型之间大约存在十倍的参数量差距,这等同于两代的技术差距。而通往10T模型的道路上,每一个环节都存在系统性挑战,“只能一代一代往上做”。

嘉宾观点与解释

闫俊杰从三个维度拆解了10T模型面临的挑战:

第一,Scaling Law(缩放定律)的外推局限。 他指出,每提升一代模型,参数量可以大3到5倍。但问题是:“四零六(scaling law)的外推其实不能外推那么多的,它只能外推一个几倍。如果大十倍之后,你会发现很多外推其实是失效了。“这意味着你无法简单地从一个小模型的实验结果,线性推导出一个大十倍的模型会怎样——经验必须靠实际训练积累。

第二,数据的数量与质量双重挑战。 一个10T参数的模型,按照"参数量平均二十倍"的经验法则,需要约200T的数据。“但全世界没有这么多数据。“同时,“越大的模型越容易拟合这些噪声,所以越大的模型对数据质量要求越高——先是数量要大很多,质量要求又高了很多。”

第三,系统性的工程挑战。 更大的模型意味着更大的参数量,对算力、训练效率、网络结构都会有很大的变化。比如M3"计算量其实比较低了,但它的KV cache还是比较大,所以接下来会进一步压它的KV cache,让推理会更好”。

关于中美差距,他给出了一个非常具体的判断:“现在美国的模型比中国的基本上是十倍,十倍其实意味着是两代。“因此国内每家公司"基本上都要再提升两代”:第一代把3T的模型真正做好,第二代基于这个积累经验再做10T。

背景:“3T"和"10T"指的是模型参数量级别(3万亿、10万亿参数)。目前最先进的模型(如GPT-5系列)参数量在万亿级别。“Scaling Law"是OpenAI提出的经验规律,描述模型性能随参数量、数据量、计算量增长的幂律关系,但它只能外推有限的倍数,超出后预测就会失效——这就是为什么"大十倍"的模型无法靠推算,只能靠真金白银地训练。“KV cache"是大语言模型推理时缓存注意力键值对以加速生成的技术,它的大小直接决定了推理的内存消耗和成本。


四、模型与Agent:不是互斥,而是共同进步

新的变化

一个常见的问题是:“模型越来越强了,Agent(智能体)还有意义吗?未来会不会被模型吞噬?“闫俊杰给出了一个明确的判断:两者是共同进步的关系,而非此消彼长。

嘉宾观点与解释

闫俊杰用历史来说明这一点。去年这个时候"想不到现在的模型是什么样的”——当时MiniMax还在做M系列,Cursor(他口误为"考的Q的”)也只有非常少的用户。在AI这个行业里,“一年经历的事儿,可能就等于其他行业好几年才能经历的事儿”。

他认为模型和Agent是"相互的关系”:如果没有Cursor这样的工具,AI模型可能不会这么火;但如果没有GPT 5.5这样的强模型,Cursor也做不起来。“一开始如果假设没有Cursor,可能AI的模型不会这么火。然后再假设,一开始OpenAI没有做出来GPT 5.5的时候,Cursor其实也做不起来,有了GPT 5.5 Cursor才真正起来的。”

由此他提出一个思考框架:“我们可以把模型加Agent都看成是我们能够实现更高智能的一个手段。” 虽然模型越来越强,但核心前提是"智能最终应该还是给人来服务的”。模型和Agent是服务于这个目标的两个手段,不是竞争关系。

圆桌嘉宾还补充了一个关键观点:Agent的定义"从来不是一个一次性交付的产品,而是一个可以长期交付且持续有生命力的东西”。目前的benchmark(如SWE-bench Pro)都是"一次性去解决一个问题”,这让模型容易变成"在特定任务上使命必达”——像一个非常努力的人,拼命很久完成了任务,但"后面接着你接他做根本做不了”。真正难的挑战是定义Agent如何在长程性任务上"持续维护一个code base,把它变更好”。

背景:“Agent”(智能体)指的是能够自主规划、使用工具、持续完成多步骤任务的AI系统。Cursor是一款基于AI的代码编辑器,是当前最流行的AI编程工具之一。SWE-bench是衡量模型解决真实软件工程问题的benchmark,SWE-bench Pro是其更难的版本。闫俊杰的核心观点是:刷benchmark解决一次性问题的能力,和持续维护一个长期项目的能力,是两个完全不同的维度。


五、数据的转变:从"标注"到"请专家来录”

新的变化

这是整场讨论中最出人意料、也最具操作性的部分。大约半年前,闫俊杰经历了一个认知转变:做好的模型,光靠算法和工程师不够,还需要第三种角色——真正的领域专家。他甚至研究了Amazon的招聘策略来验证这个判断。

嘉宾观点与解释

闫俊杰回忆说,去年这个时候,团队对数据的理解还停留在"数据标注"的层面。转变的触发点来自做coding的实践。他们发现:“开发工程师显然是比算法同学更理解什么叫好的coding。“算法同学构建了模型框架,但"如何做评测、如何做归类、如何构造相应的环境”——这些事情"真正的软件工程师实际上能做得更好”。

这让他意识到,做好一个领域的模型,需要从两个角色(research + engineer)扩展到三个角色:算法、开发工程师,以及真正的领域专家。“既然我们把两个角色合作走通了,那我们现在在里面再加一个角色,逻辑就是这样的。”

更出人意料的是,闫俊杰说他"仔细研究了Amazon是怎么招人的"。他发现Amazon公司内部有大量"非research和非engineer"的人:经济学家、心理学家,甚至还有核物理学家。为什么需要核物理学家?因为"每次做test的时候,都会来测试说,用这个东西测,这东西能不能用来制作核武器"。

这启发了MiniMax的招聘方向。闫俊杰表示,接下来在网络安全、金融、法律等领域都会引入这样深度专业的人。“在半年前我们是不意识到为什么需要有这么多人,我们现在其实就是在理解这样人,我们真的是需要这些人跟我们在就是在一起。”

背景:Amazon是云计算和电商巨头,也是AI服务的重要提供商。它拥有庞大的非技术专家团队,反映出AI落地的真实需求不是"更好的算法",而是"更准确理解行业问题的专家"。闫俊杰的判断是:模型的能力上限不取决于算法团队多聪明,而取决于"喂"给模型的专业知识有多深。这解释了为什么MiniMax开始跨界招聘——因为垂直领域的know-how无法被算法团队凭空创造。


六、AI Coding的工程化:Vibe Coding不等于Vibe Engineering

新的变化

当AI编程被商品化、人人都能写代码后,一个被忽视的问题浮出水面:写代码从来不是一个coding工作,而是一个engineering工作。圆桌嘉宾们围绕"如何防止AI写出来的代码变成屎山"展开了深入讨论。

嘉宾观点与解释

圆桌嘉宾提出了一个犀利的观点:“Vibe coding从来没有人说是Vibe engineering,但写代码从来都是一个engineering工作,不只是一个coding工作。“他特别讨厌被叫"码农”,因为"应该说你是一个软件工程师,你的职责是把它变成一个工程的东西”。

这个区分在AI时代变得尤其重要。当人人都能用AI写代码时,判断力的价值远高于执行力。嘉宾指出,第一代"Vibe coding"的用户其实是产品经理——他们过去也是写"Vibe coding"(用自然语言描述需求),只不过驱动的是程序员。现在人人都可以Vibe coding后,“人人都变成了产品经理这样一个角色”。而判断一个产品经理好坏的标准"从来都不是说他做了一百件事情,而是他怎么去判断要不要去做一件事情——或者说要不要不去做一件事情"。

嘉宾还推荐了两本书:一本是《代码大全》(Code Complete),讲的是"怎么在复杂的项目里面更好地做开发,避免架构变大后出现屎山代码";另一本是《Clean Code》(代码整洁之道),“讲的是代码的整洁之道,很多时候是被先知们已经全都列举出来了”。他的实践做法是把这些先知的智慧"蒸馏成一些skill",“配合你的Agent,给到Agent更多你的context和偏好”。

闫俊杰补充了一个非常实际的观察:他用Vibe coding开发训练系统时,也遇到了类似的问题——“有点像Monkey(指渐进式开发),从一个阶段一个阶段走,最后给搞定”。解决办法包括测试review、benchmark验证等,“有很多东西可以验证”。

另一位嘉宾(阿导)则指出了一个更尖锐的问题:Code Review在AI时代严重缺失。他去阿里分享时发现,系统能被"几百倍"地打死——一个人开Vibe coding同时提几十个仓库的代码,提交量是20倍,“但没有人敢review”。生产能力在极大提升,“但验证和交付,在review这方面无论模型还是Agent做的都不够”。他判断:“我们应该在验证上面投入,甚至和研发生产接近的能力——否则这个项目就会崩。“他回忆,去年Cursor 4.2/4.5出来时,一个项目到几千行代码就不玩了,今天可以到七十五万、十几万行,“但它终究会崩溃”,因为compute是有限的,人类的直觉也难以完全替代。

背景:“Vibe coding"是2025年流行的概念,指用自然语言描述需求让AI生成代码的开发方式。“屎山代码"指质量低下、难以维护的代码库。嘉宾的核心观点是:AI让"写出代码"变得容易,但"写出好代码"和"维护好一个项目"仍然是需要工程素养和判断力的高级工作。当生产能力暴涨而验证能力跟不上时,系统性的崩溃只是时间问题。


七、金融领域的AI应用:从筛选信息到"陪伴”

新的变化

在垂直行业落地方面,互联网金融公司AI负责人分享了两个关键判断:一是AI最基础的切入点是"筛选信息"和"降低门槛”;二是当模型能力进步到一定程度后,AI在金融场景中最不可替代的价值是"陪伴”。

嘉宾观点与解释

金融AI负责人首先描述了一个真实痛点:大多数用户打开金融应用时,“其实根本不知道他今天想干什么”。他们最常问的问题是"帮我选几个个股”——“这是说到最多最多最多的一个问题”。但这个问题连专家都很难回答。

因此AI的第一步是筛选信息——这是所有AI都在做的事。第二步是降低门槛:把"GTM是什么"“这个东西大了还是小了"这类专业术语,用AI解释清楚,“告诉你这个数字为什么是这样子,对于你的影响是什么”。

关于"AI炒股"这个敏感话题,他明确表示:由于合规原因,“不能直接炒股”。但内部有回测机制——“我们不带投资建议给用户,但内部可以根据自己的东西去做回测,大致胜率多少”。他强调,他们"有真真实实的数据能支撑着我们说这个东西我们胜率多少”。

他也指出了AI炒股的复杂性:它"不是一个文字的问题,里面会有很多步骤——你的信息要对,你的个人画像要对,整个分析的状态要对,而且这些东西都在变化"。炒股需要预测"这个东西到底是好还是不好"(哪种可能性重要),以及"当这个东西真的发生了以后,你要怎么做"——后者比前者更重要。

谈到2026年下半年最想突破的方向时,他给出了一个出人意料的答案:陪伴。“大多数人都有陪伴需求,包括在我们的领域,有一定有赚了钱的时候,也有一定有亏钱的时候,而且很有可能对于很多人来说,亏钱的时候可能更加多。“另一个方向是:当AI进步后,“我们要去引领模型,能够让它去思考,能够让它去做一些创造性的事情”。

背景:“回测”(backtesting)是用历史数据验证投资策略有效性的方法。“GTM”(General Timing Model)是金融领域常用术语。“陪伴"这个概念指向了AI的一个深层价值——当AI足够了解用户时,它可以在用户焦虑、亏损、需要倾诉时提供情感支持,这是传统金融工具无法做到的。


八、AI降临派与智能的终局:可解释性需要AI来解

新的变化

讨论的最后部分触及了最本质的问题:AI到底会发展到什么程度?人类该如何与越来越强的AI共处?闫俊杰和嘉宾们给出了截然不同但都值得深思的回答。

嘉宾观点与解释

闫俊杰对"AI会不会比人强"这个问题给出了明确的回答。当被问及是否是"AI降临派"时,他说:“我是一个AI降临派,认定AI的能力发展到后面一定会比人来的强。“他强调这不是空想,而是"在过去几年深度地和AI协作过程中越来越发现,你未来已经不是在和人去竞争,而是在和AI去竞争——你的智能其实没有办法去和AI做一个抗争”。

但他同时强调了一个重要的个人实践:“我会把思考这个最重要的部分都交给自己。” 他会和AI一起探索,但不外包核心的思考。这是对"人都有惰性思维,有了AI后喜欢把思考外包给AI"的一种警醒。

关于AI的可解释性,闫俊杰给出了一个深刻的技术判断。他认为AI目前"是一个非常黑盒”——“我们自己做的东西,我们也不知道它一年之后会怎么样,就只是知道它会进步,并且我们也坦白说,其实也不太理解,比如说为什么会用领导(指某种行为),为什么会问那样的东西。”

他进一步指出:“单纯靠人类也很难理解这件事儿,因为现有的数学工具其实也是不太够。” 他回忆大约十年前读博时看过一篇论文,大意是"一个超过三层的神经网络,用现有的数学工具其实也没法分析它的收敛性。但这个行业还在进步。”

他最关心的事情是:“什么时候是不是能够AI帮助人类理解AI?” 他认为这是一个"非常本质的事儿”,因为只有这样,“比如说AI会不会有安全的问题,AI到底能够走多远,这个事儿可能才会有一个答案”。

他看到了一些积极信号:生命科学的论文越来越发现"大脑跟神经网络之间有很强的相关性”——大脑里虽然不算矩阵乘法,但有些模块类似矩阵的概念,有些机制几乎可以等价成梯度的反向传播;海马体(负责记忆)的机制跟DeepSeek的记忆模块"很像"。由此他判断:“AI本身的可解释性,也得需要靠AI一起帮助它去解决。”

圆桌最后,一位嘉宾(AI观察者)分享了一个个人案例,为这场技术讨论增添了温度。他的妻子因掉头发焦虑去看中医,问了国内DAU最大的Chatbot后,“觉得缓解了焦虑,但一个方法让他头发掉得更多了,然后就更焦虑”。于是他自己用工具给妻子建了一个个人专属的知识库——把所有体检报告、检查单据、吃过的药、甚至那个Chatbot的聊天记录全都导进去,然后接到飞书上让她使用。结果"跟医生的沟通也跟上了"。

他用这个故事说明:“我们普通人每个人都是有机会能够用AI,让家人、身边人变得更好,只要我们愿意。” 他认为AI编程不是用来替代人或替代工作,而是"让更好的idea和想法能够绽放出来",“从冰冷的软件工程里面,最后能发展出来一种人类社会的温暖”。

背景:“AI降临派"指认为AI最终会全面超越人类智能的观点阵营。“可解释性”(interpretability)是AI安全研究的核心议题——理解模型为什么会做出某个决策。“反向传播"是训练神经网络的核心算法。“海马体"是大脑中负责记忆形成的关键区域。“DAU”(Daily Active Users)是日活跃用户数。闫俊杰的深层观点是:当AI复杂到连创造它的科学家都无法完全理解时,解决可解释性问题的工具,可能正是AI自己。


结语

这场"圆桌交锋"覆盖了从具体的产品策略(M系列演进、10X目标)到宏大的哲学命题(智能的终局、可解释性)的完整光谱。几个值得带走的判断:

  1. Token消耗量比benchmark更能说明问题。 M2只做coding、放弃通用对话,结果token消耗超目标十倍——垂直聚焦在产品层面是成立的。
  2. 中美差距约十倍参数,等于两代。 通往10T模型没有捷径,只能一代一代做——先做好3T,再做到10T。
  3. 数据方法论正在从"标注"转向"请专家来录”。 做好一个领域的模型,需要算法+工程师+领域专家三个角色,缺一不可。
  4. Vibe Coding不等于Vibe Engineering。 AI让写代码变容易,但维护一个好项目仍然需要工程素养和判断力——验证能力的提升必须跟上生产能力的暴涨。
  5. 模型和Agent是共同进步的两个手段,而非竞争关系。 智能最终应服务于人。
  6. AI的可解释性可能需要AI自己来解。 当模型复杂到超越现有数学工具的分析能力时,人类理解AI的路径,可能是让AI去理解自己。

这些判断来自一线从业者的实践与反思,而非理论推演。它们共同的底色是:AI的进步速度远超想象(“一年等于其他行业好几年”),但通往更强智能的道路上,每一个环节都充满需要耐心积累的真实挑战——没有捷径,也没有魔法棒。