来源:小军访谈 ·「对洪乐潼的4小时访谈:AI for Math、把数学变成Lean、数学天书中的证明、直觉、被创造的与被发现的」 主持:小军 嘉宾:洪乐潼(Alex Hong),2001年生,Axiom创始人兼CEO。MIT数学与物理本科(摩根奖得主),牛津神经科学硕士,斯坦福数学与法学博士(辍学创业)。Axiom专注AI for Math,估值16亿美元,团队约30人,含小野健(Ken Ono)、François Charton、Evan Chen等顶尖数学家与Meta前FAIR总监舒博(Shubham)等。
本文整理自小军在硅谷Facebook House对洪乐潼的4小时访谈。这是她罕见的一次深度长访谈,覆盖成长经历、跨学科求学、Axiom的创立与融资、AI for Math的技术路线与哲学、以及她对数学未来与AI智能的判断。以下按主题组织,每个主题包含「新的变化」和「嘉宾观点与解释」两个维度,力求让未观看视频的读者快速理解核心内容与得出观点的原因。
一、被数学击中:模形式、椭圆曲线与二次互反律
新的变化
访谈开场就抛出一个在数学圈流传甚广的说法——“被数学击中的时刻”,高斯形容它"像闪电一样"。洪乐潼给出了一个与"灵光乍现"略有不同的版本:她的击中感更多来自"看别人结果"而非自己解题,这把数学之美的体验从"创造者的狂喜"拉回到"阅读者的震撼",暗示了一种更谦逊、更可持续的数学审美来源。
嘉宾观点与解释
洪乐潼:她印象最深的一个例子是模形式定理(每一个模形式都对应一条椭圆曲线),它把代数性的表达式与几何性的几何物体联系起来。数学中两个看似不相干的领域在中间产生交集,这种"两域交汇"的例子每次都让她觉得"非常非常非常优美"。概率与物理中也有大量类似结果。
她自己解题的击中时刻频率较低,最深刻的一次发生在罗斯数学项目(Ross Mathematics Program),每天发一套题集,做完才能拿下一套,像"游戏打怪"。当一路推到二次互反律时,看到它呈现的多种证明,她体会到"表达非常简洁的东西,其后面的证明可以很深,也可以有很有创造力的解法"。
背景:椭圆曲线与模形式的对应是怀尔斯证明费马大定理的核心工具;二次互反律被高斯称为"黄金定理",是初等数论的基石。罗斯项目是全美最负盛名的高强度数学夏校之一,以"做尽所有题才放行下一关"的训练方式著称。
二、数学是被发现还是被创造:拉马努金、哈代与证明即影响力
新的变化
“数学是被发现还是被创造"是数学哲学的千古辩题。洪乐潼没有直接站队,而是用拉马努金的故事重新框定这个问题:她把"证明"定义为一种"影响力”——一个外来的、与既定学派训练背景不同的数学家,可以用证明来说服原有群体接受他的发现。这把"发现/创造"的二元对立,转化为"直觉产出"与"社群认证"的社会过程。
嘉宾观点与解释
洪乐潼:她认为,如果一群数学家有相似的训练背景、读过同一批代表作,他们会有相当大的默契,认为某些东西"自然而然应该是这样的"。最有趣的例子是拉马努金从印度到英国见到哈代和利特尔伍德——他像一个"外星人",拿出草稿本说"这些全是对的,我从没接受过数学训练,不知道怎么证明"。哈代和利特尔伍德觉得这些东西看起来很有意思、很新,又感觉是对的,于是开始用证明来确认。
由此她得出:证明某种程度上是影响力——只要能把东西严丝合缝地逻辑证明出来,这个数学发现就可以被接受。被接受后,又会讨论这个证明"美不美、自然不自然"。她举张益唐的素数有界差证明为例:国际数论学家觉得他的证明方式与他们熟悉的学派"非常不一样",但结果正确,于是接受并开始互相学习整理。James Maynard(2022年菲尔兹奖)有另一套证明技巧,学生继承后可与张益唐的方法比较、简化。
她自己想当"直觉派天才"却自认不是——这是"从小痛苦的一个根源"。她做不出欧氏几何题,大脑偏代数符号表达,几何拓扑很差,只能用复数法"大力出奇迹",把每个点每条线变成复数套复杂公式硬解,需要比别人多两三倍时间。
背景:拉马努金是数学史上最传奇的直觉型天才,声称女神在梦中向他传授公式;张益唐2013年证明存在无穷多对差小于7000万的素数,是素数研究的里程碑;Maynard独立给出更优的差的上界。
三、AlphaGeometry与蛮力型AI:几何题的复数法与枚举法
新的变化
洪乐潼把自己做几何题"用复数法大力出奇迹"的经历,与Google DeepMind的AlphaGeometry项目并置——后者从2021年开始秘密研发,把几何图形变成符号表达式再用AI求解,解决了历史上81%的IMO几何题。这是一个微妙的变化:人类因天赋不足而被迫采用的"笨办法",恰恰成了AI突破几何证明的哲学原型。AI不是模仿天才的灵光,而是把蛮力符号化、规模化。
嘉宾观点与解释
洪乐潼:她自认是"蛮力型选手",不是天赋型。在MIT时身边所有人都是天赋型选手(任秋雨、张盛彤、高继阳等,她"看着他们的新闻长大"),她唯一的方式是"打不死的小强"——一道题三个月做不出继续想。Henry Cohn教授给她一道28维的Sperner问题,她六个月什么都没想出来,但每周都汇报"我试过这个,没成功"。
她认为这种蛮力型与天赋型存在互补:天赋型选手不愿干的脏活累活,蛮力型可以干完。而AI恰好是这种蛮力型的放大器——Axiom的XProver在普特南竞赛拿满分的那道题,Evan Chen(美国IMO队教练)画了一个图,在场所有人一看图就知道他做出来了;但AI没有找到这个图的解法,而是用几千行代码、类似枚举和分类讨论的方式"硬生生干出来"。她觉得比较人类与AI证明背后的数学是"非常有意思的过程"。
她把AI系统里的模型也分两类:一类能快速判断题目应该用一二三四步证明出来(偏形式化、见多了形式化语言);另一类是"tactic派"(tactic是Lean里的步骤/策略),小步小步严丝合缝地走,不越题纲。
背景:普特南竞赛是北美最权威的大学生数学竞赛,1927年至今98年历史上只有5个人类满分,Axiom的XProver是第6个满分。AlphaGeometry是DeepMind用神经符号系统解几何的项目,发表于《Nature》。
四、从广州到MIT:自由注意力、马步棋与拒绝被驯化
新的变化
洪乐潼的成长叙事里有一个反复出现的张力:体制化的零和竞争(按月分班、重点班在楼顶)与她主动"拒绝被驯化"转向正和游戏(读高等数学、玩马步棋)。这个转变不是逃离数学,而是逃离"竞争本身"。她后来在创业中提出的"bound attention(被框架住的注意力)与free attention(自由注意力)“之分,正是童年经验的提炼。
嘉宾观点与解释
洪乐潼:她在广州长大,家离学校十分钟路程,走路时会想数学题走到不知哪里。她喜欢看《百家讲坛》(易中天讲三国)、黄永玉的《大窑堡胡同》,妈妈是北京人,所以家里有京城文化影响。她从小被批评"不是最刻苦的”,但遇到一道题会死磕——“这个过程像玩,不像work”。
初中时她发现可以看高等数学书(微积分、实分析、复分析),觉得它"不像零和游戏,是正和游戏"——可以想到什么深度广度,找感兴趣的同学一起讲,不需要某天同时参加考试。但回到奥数零和游戏就很吃亏:拿到卷子看到最后一道数论题,她因太爱数论会先做这道大概率做不出的题,而非先做必拿分的欧氏几何。
她描述小学奥数按月考试、每学期1到24班全部重排,重点班在楼顶、普通班在楼底,“四班在洗手间旁边”。她意识到这是争强好胜心的训练,初一开始看高等数学书后"不太想玩这个游戏"。她认为在一个有清晰定义目标的群体里,如果你有一套完全不一样的世界模型,就会去找部落——她初中和好友玩"马步棋"(n×n棋盘走马步不重复走满),群策群力用数学归纳法构造base case,这让她后来理解陶哲轩等人把素数定理形式化拆分成几百个任务让全世界协作的项目。
她提出的"bound attention与free attention"概念:前者是被框架住的注意力(邮件、必须执行的deadline任务),后者是自由注意力。很多成功企业家是高度纪律性的执行家(她把扎克伯格归为"执行狂"),但"自由注意力是能区分平均创业者与有策略性决策性创业者的点"。她怀念小时候走路上学的自由注意力,并认为爱因斯坦的洗澡时间就是自由注意力的产物。她自认是"visionary(前瞻性野心家)“型,不是执行派也不是销售派(Sam Altman在她看来是salesman)。
背景:马步棋(knight’s tour)是经典组合问题,在n≥5的棋盘上总存在走满每个格子的路线。陶哲轩2024年联合Alex Kontorovich等人用Lean形式化证明了素数定理,是大规模协作形式化的典范。
五、MIT的"最蠢者"体验、摩根奖与博士概率论的九分
新的变化
洪乐潼在MIT反复强调自己是"整个数学系里最愚蠢的"“怎么看努力都看不到结果的那一个”,但同时拿下了北美数学本科生最高荣誉摩根奖。这种"自我定义为失败者"的叙述不是凡尔赛,而是她真实的内在体验——她把自己放进了一个全员IMO金牌的环境,把失败设为"默认项”。这挑战了外界对"天才"单向度成功的想象。
嘉宾观点与解释
洪乐潼:她大一听学长建议去上博士概率论课,结果第一天上来就是测度论,从Borel代数讲起,几个大一小孩"面面相觑"。期中考满分40分,全班平均分被他们拖到9分,她拿了个位数(4分)。但她"什么失败都不会触发自己觉得很失败的机制",把失败当默认项,然后开始认真重学14、15岁学过的初等实分析。
她描述MIT的"社区感"是早期最大的奖励来源:期中考完后大家说"要不一起drop这门课",最后决定一起继续上。疫情期间失去小团队后,奖励机制转向"事情本身"——她对"pain and suffering"(黄仁勋讲过的)上瘾。她引用风险投资人的理论:找创始人要找"对疼痛上瘾的",“chip on the shoulder(肩上的重担)能转化成chip in the pocket(口袋里的硬币)"。
关于摩根奖:是教授提名、其他教授写推荐信,由评审委员会决定。30年历史每年一人获奖、两三人亚军季军,“谁拿到谁拿不到随机性很大”。她强调MIT数学环境"教授们非常nice、希望每个人都好、给最好的推荐”,“没有说你们这些MIT数学同学去竞争有限名额”——世界很大,变成无限游戏。
她说自己妈妈数学不好,有危机意识让她"笨鸟先飞"。家里彻底没有数学基因。被小野健(Ken Ono)的REU项目放候补名单,因疫情很多人拒绝而被捞上,放弃桥水基金实习去了数学夏令营,这改变了她的轨迹。
背景:摩根奖(Morgan Prize)由美国数学会等联合颁发,是北美本科数学最高荣誉;REU(Research Experience for Undergraduates)是美国自然科学基金赞助的本科生暑期研究项目,竞争激烈。
六、牛津神经科学、Gatsby中心与"被AI点燃"
新的变化
洪乐潼的求学路径呈跳跃式:MIT数学物理本科→牛津神经科学硕士→斯坦福数学法学博士。在牛津她本想做动物实验理解人脑,却因需要"杀一只老鼠"考证而转向计算神经科学,最终"被AI点燃而非被神经科学点燃"。这个转折点揭示了一个现实:计算神经科学与AI在伦敦的Gatsby中心是同源的,AI教父Hinton正是Gatsby中心的创建者。
嘉宾观点与解释
洪乐潼:她在牛津最初想做动物实验理解人脑,之前做过果蝇实验(敲开头盖骨插管子看neural dynamics),但牛津要求考license证才能做更多动物实验,考证要杀一只老鼠。做完那次实验后她决定"走计算神经科学,不做动物实验"。
在英国,计算神经科学与AI关系紧密。UCL的Gatsby中心由已故的Gatsby先生(DeepMind创始人之一)做博后之处,Hinton是AI教父、Gatsby中心的创建者。她跟Andrew Saxe教授及其合作者(在斯坦福的Gulley、Tim Barrans、Will Dorn、James Veenkant等)做研究,“见到他们中任何一个人就非常激动,觉得能带我做研究”。她的快乐"来自AI不来自神经科学"。
硕士论文是两篇:一篇看neural dynamics(肯尼迪论文风格),另一篇假设单层线性Transformer,用理论机器学习做不了exact neural dynamics,但有大量线性代数和矩阵运算,是基础数学应用于AI与认知科学背景项目。后来她感慨"我们基本不理解人脑,完全不理解人脑",这是她未来若创业失败想重做的方向(brain-computer interface的vision目前的implementation太不理想)。
背景:Gatsby计算神经科学中心(UCL)是连接AI与神经科学的重镇;Hinton在此建立计算神经科学传统,后成为DeepMind学术根基之一。
七、宪法诠释、textualism与"AI能做法律就能做数学"的顿悟
新的变化
这是整个访谈的转折点:洪乐潼把"做AI for Math"的念头追溯到一个法学课堂上的类比——用LLM解读美国宪法。她发现宪法诠释的三种流派(原旨主义、文本主义、活的宪法主义)与数学公理系统的搭建同构,于是从"AI能看法律"直接跳到"AI为什么不能做数学"。这个跨界类比是Axiom的真正起点。
嘉宾观点与解释
洪乐潼:她在斯坦福法学院对宪法非常感兴趣,区分三种诠释方式:Originalism(原旨主义,基于建国者原意)、Textualism(文本主义,按字面英语解读,“像一个数学家会做的诠释”)、Living Constitutionalism(活的宪法主义,与时代一起成长)。她自认是textualist。
当时有人说,如果想知道这些词什么意思,可以拿LLM喂一些data(建国文献、当代政治哲学著作)。她课堂上突然想到:如果已经到了能用AI看宪法是什么意思的时代,“我为什么不能拿AI做数学?"——因为宪法是研究specification(比较structure、precisely定义),而数学"不是英语,是一个更结构型的呈现”,Lean形式化语言把数学变成代码,所以"可能能够去做"。
这个想法同时与好友Kenny Long(帝国理工交换到MIT,2020年起做形式化证明,是Lean里Mathlib最初5-7个建设者之一、Kevin Buzzard的学生)的狂热、以及陶哲轩博客讲形式化证明相互印证。她最好的朋友之一Kenny教会她下象棋(象棋大师),现在也在Axiom兼职。
她认为AI能帮最大的是"蛮力型数学家"——她自己要枚举多少可能性、经历多少天验证一个standard argument。她举例Ben Green的《Shortcuts to Shifted Primes》:一个集合里A和B两元素差值不是P±1(P为素数),能从1到N数出多大的集合。她看到这篇文章时想"这能证明多少数学问题",同一套工具可用于function field、sum of two squares等。AI应达到"一个熟练运用所有数论工具技巧的博士生程度"。
背景:Textualism是美国大法官斯卡利亚倡导的宪法诠释流派;Lean是微软研究院开发的定理证明语言,Mathlib是其数学库,Kevin Buzzard(帝国理工)是推动Lean进入主流数学的旗手;Ben Green是解析数论顶尖学者,与陶哲轩合作证明Green-Tao定理。
八、Verve咖啡馆、舒博与从零到一的创业决定
新的变化
Axiom的联合创始人舒博(Shubham)是Meta/FAIR的元老级AI研究员(20年GPU经历、10年AI经历,曾随吴恩达进百度硅谷AI研究室做Deep Speech/Voice,是CUDA第一批开发者)。两人相识于Palo Alto的Verve咖啡馆,聊了一年半科学史却互不知对方身份——这段"陌生人不问来历"的硅谷式相遇,最终在2024年秋以一张餐巾纸上的算账(多少张卡、融多少钱)变成创业决定。这打破了"创业是冲动跟风"的叙事:洪乐潼用了两个月读科学史和几百篇AI论文来"劝退自己"。
嘉宾观点与解释
洪乐潼:她第一年在斯坦福法学院时"想念数学",每天坐校巴(没钱打Uber)穿越有流浪汉的隧道到Verve咖啡馆,抱着三大本法律书做作业,点抹茶看狗。舒博常坐窗边,因太阳晒她请他拉窗帘而搭话。两人聊了一年半科学史,她不知道舒博是Meta的FAIR Director,舒博只知道她是Stanford法学院学生、可能听说过摩根奖。
2024年秋天,她在XTX(量化金融)做暑期工作时觉得"AI更有意思"(XTX有卡,能做的事比在Gatsby多)。某天晨跑后突然觉得"这事真的要发生",去找舒博算"要融多少钱"——在餐巾纸上算多少张卡,结论是"得做创业公司,没可能在学界做"。
她从9月就决定,但到11月才开始融资,因为"两个月实在劝退自己"。她读科学史(从维基百科到找书)、读一个叫"AI from Yes"的GitHub repo里几百篇文章的摘要、把有意思的整篇读完、做费曼过程在纸上推演"这个东西要搭起来最终怎么做"。她得出结论:这事"不一定是个研究问题,是个工程问题,科技风险没有一开始看上去那么高",这样融资才"负责任"。
她特别强调"我特别反对做一个AI founder"——在MIT时好友们是创业社社长,叫她去free pizza活动她都不去,觉得"创业不好,不专业,还是要做教授"。她想做的是"非常长时间、非常难"的事,与VC周期不一定吻合。她甚至去找主要竞争对手(Tudor的公司)问"你们招人吗",对方说"只招计算机PhD",她回"我是数学PhD"。她当时看了ATP Boost、Pattern Boost、Intelligent等AI for Math论文,作者Bartosz、方溯少堂等后来都加入了Axiom——“所有这美丽的过程,当时作为学徒看巨人的肩膀,现在都聚起来了”。
舒博2月才正式决定加入。他的文化是Facebook式的bottoms-up(由下往上),而非Google式的top-down。团队大部分早期员工来自Facebook。她后来把公司定义为"bottom up的文化对创新最好",把自己定位为"递水的人"而非拿喇叭的。
背景:Deep Speech是百度硅谷实验室(吴恩达时期)的语音识别项目,团队后被称为"百度Mafia",出了多位AI领域重要人物;bottoms-up文化指决策自下而上涌现。
九、融资竞拍:从一倍到三倍、种子轮64M与A轮2亿
新的变化
洪乐潼描述了一个外人难以想象的融资竞拍过程:1月7日(JMM数学家大会后第三天)第一个offer,之后每月一个,价格从一倍翻到三倍,三个领投方金牌offer竞拍。她拒绝过要"带路掉50%“的offer,最终种子轮融6400万美元(预期5000万)、A轮融2亿美元、估值16亿美元。一个24岁、没有tech带队经历的华人女性,在没有PPT、没有公司实体的情况下完成这一切。
嘉宾观点与解释
洪乐潼:2025年1月JMM(联合数学家大会,那年主题罕见地是"AI for Math”)后第三天就有offer,之后不停竞拍。她配置VC的逻辑是"希望有一个optimal的offer、把轮的结构做好"。一月份有个领投说要带路掉50%,她直接拒绝;二月一个不错offer她本想接,告诉所有人"可以加入我这轮但不再看其他offer";三月因为"文艺复兴的崇拜"(Howard Morgan是文艺复兴联合创始人、James Simons的伙伴)和价格不错,最终选了B Capital领投。
种子轮她"讲得特别保守"——直接说商业模式不确定、自己做量化但不确定是不是量化交易、第一个市场也不知道是什么。后来才知道投资人见创业者讲十分心里打折成八分,她讲七分"可能打没了"。“没有人想拒绝我们,他们就不回消息”——因为想等别人领投了再跟,是groupthink过程。种子轮oversubscribed,三个金牌offer。
A轮(2025年底至2026年初)她本没想融,圣诞节时投资人主动给preemptive term sheet(“我知道你不融资、没PPT、没材料,我给你term sheet希望你尽快签”)。1月5日她被叫到外地城市pitch,当晚拿到offer,一周半后拿到另一个,最终签了后者(Manlo Ventures领投,Matt Craining是种子轮就帮他们的partner,Manlo是Anthropic最大机构投资人,Axiom是其在Anthropic之后第二大AI投资)。
关于"华人女性在硅谷好不好融资":她认为年轻做产品是加分、做tech是减分;她没有tech带队track record,“这肯定减分”;华人女性"没什么加减分"。她引用19岁创业者被Peter Thiel逼签term sheet(“这餐饭不吃完你不签我就撕掉”)去洗手间哭了一场回来签的故事,说年轻创业者"大部分时候并不知道自己的决定对不对,等更多信息的过程是高风险低收益"。她提到一次女性创业者zip lining活动,她是第一个不敢下去的,闭眼咬牙跳——“这就是你每天需要重复的麻木的take the leap”。
背景:JMM(Joint Mathematics Meetings)是美国数学界最大年会;文艺复兴科技公司是James Simons创立的传奇量化基金;Manlo Ventures是硅谷老牌VC。
十、Axiom的团队拼图:小野健、François Charton与IMO教练
新的变化
Axiom最引人注目的变化是人才构成:57岁的终身教授小野健(Ken Ono)辞职加入24岁学生的公司。小野健不是被高薪挖走,而是主动发邮件说"如果我去OpenAI或DeepMind你要有心理准备",洪乐潼回"那来Axiom",几天内Zoom上敲定。这背后是一个结构性信号:顶尖数学家开始把AI for Math视为比传统学术更值得投身的方向。
嘉宾观点与解释
洪乐潼:团队分三块——AI(强化学习agent、applied AI)、代码生成(programming language、compiler,含LLM Compiler主要团队、CodeWorld Model 32B部分团队)、数学。数学里又分纯数学家(小野健、Evan Chen等,含4-5个IMO)、做Lean/Mathlib的(Kenny Long、鞠建章等)、做meta programming(元编程,用Lean写工具,如有人用Lean写了autograd)。团队共约30人,竞争对手50-75人。
小野健加入过程:他11月底发邮件说来湾区,“如果加入OpenAI或DeepMind你要有心理准备”(怕洪乐潼突然听到他在给竞争对手工作)。洪乐潼回"那来Axiom"。她在OpenAI和Axiom之间被敲定——小野健先去OpenAI看了一圈,洪乐潼说"我们也OpenAI,你可能还是得去看看,如果有时间来我们这边看看"。结果小野健没时间来Axiom,她"觉得肯定凉了",但小野健最后在Zoom上就定了。她认为打动小野健的是"团队更数学,公司DNA和专注点就是数学,而非general AI里数学是一个有marketing成分的部分"。
她描述小野健"性格像高中篮球队教练,给所有人加油助威",是"理论建造者"而非"解决问题者"——能把不同领域连接起来、用全新视角看问题、发现好问题给善于解题的人做。他还是美国奥林匹克游泳队教练(分析游泳数据)、好莱坞电影《拉马努金》及续集(拍米尔扎哈尼)的参与者、以拉马努金命名的慈善基金会创办者、美国数学学会前副主席、白宫政策咨询顾问。
François Charton(第三个加入):2019年与Günter Temme合作发文,证明Transformer在integration上能比Mathematica、Maple等电脑代数系统做得好,是AI for Math领域的奠基者之一。小野健与François惺惺相惜,Ken加入后又吸引Evan Chen、Kenny Long等,形成"AI club数学俱乐部"。
她认为数学家不会觉得AI替代自己是坏事——Ken和Andrew Granville等人都认为"随着AI进步,人类数学家会学会在不同抽象层面上进行逻辑推理",类比编程从打孔卡片到低级编译器到Python到自然语言编程。她希望AI具备猜想能力,让猜想与证明形成"向上螺旋",每天证明的东西进入明天的应用(如Lego Prover的skill library设计或训练数据),某种程度的self-improvement(她认为在能验证信号的领域如数学,可以试验self-improve agents、skills、MCTS等前沿AI技术)。
背景:小野健是当代数论顶尖学者,在划分函数领域有突出成就,也是拉马努金遗产的现代继承者(其父曾参与众筹给拉马努金立雕像);Evan Chen是美国IMO队教练;米尔扎哈尼是首位女性菲尔兹奖得主。
十一、XProver满分普特南:“战争状态"与求解的人
新的变化
2025年12月6日,Axiom的XProver AI在普特南竞赛拿到满分——98年历史上第6个满分,前5个都是人类。这不仅是分数的突破,更暴露了一个流程细节:求解与证明的分工。Axiom原本以为需要人类(Evan Chen)求解再形式化,后来发现系统可以自己做出解法。而小野肯在解题现场喊出"现在是战争状态,不是数学纯粹之美的时刻”,揭示了AI竞赛节奏对数学审美姿态的冲击。
嘉宾观点与解释
洪乐潼:当天早上6题、下午6题。证明题可直接形式化,求解题需要先求出数值再放进证明。早上6题里4题要求解,只有Evan Chen能做,他一个人一道道做。下午3:58他们发现已有8题(80分,去年80分是世界前五),最终拿到12题满分。小野肯喊"不要在现在说数学纯粹之美的时刻,不要精确搞这些,现在是战争状态,能怎么快捷就怎么快捷"——因为Lean只能做证明不能求解,所以求解要快。
但后来他们发现"其实可以不求解"——系统里有informal模型可以直接做出解法,“每一道普通的题其实并不需要做人类求解的”。这是一个意料之外的发现。她强调研究型数学家和打竞赛在最短时间内的数学家是"很不一样的特性"——研究型数学家其实没做出来多少道普通题。
公司名"Axiom"来自她小时候的书《数学天书中的证明》(Proofs from THE BOOK,爱尔德什心目中上帝那本收录最美证明的天书)。她喜欢"axiom"这个词:“从有限公理推导出新结果,像有地基往上建高楼;它很数学、很克制、很理性、又很sharp。“公司里名字开头是A的人特别多(Alex、Bartosz、Arm等)。
背景:普特南竞赛满分极罕见,Axiom的满分标志着AI在本科生竞赛级别已超越几乎所有人类;Proofs from THE BOOK是爱尔德什与Aigner合著的经典,收录各领域最优美的证明。
十二、把数学变成Lean:程序综合、程序验证与为什么不是模型公司
新的变化
洪乐潼反复强调Axiom"不是模型公司,是深科技公司,像SpaceX”。这个区分至关重要:模型公司比拼更高更快更强,而Axiom的核心壁垒在Lean生态的工具链——包括比社区compiler快100倍的verify proof、十几个辅助生成验证工具、以及用subagents替代昂贵的蒙特卡洛树搜索。这些技术债说明AI for Math的瓶颈不在模型参数,而在形式化语言的基础设施。
嘉宾观点与解释
洪乐潼:Lean来自古老的program synthesis(程序综合)和program verification(程序验证)领域。Lean作为形式化语言,全网tokens总量非常小(不像Python有互联网规模的语料),数据扩充是未解问题。Lean既是编程语言又带自我验证性,“像C语言、GCC compiler和C runtime三者合一”,非常thin(脆弱),作为object必须符合种种限制。
她举例:假设公理n+n=n,要证明2+2=2(一定不合法),需要找严丝合缝的verify proof。社区用的compiler比Axiom自研的verify proof慢100倍,“刚开始必须自己造一个快的,不然没法跑”。AlphaProof用蒙特卡洛树搜索(MCTS),“我们觉得太贵了,看我们有多少钱,做不了MCTS,得找别的办法”——这与国内豆包的SitProve思路相似。他们造了12-13个辅助Lean生成与验证的工具。
为什么像SpaceX:“有很多技术壁垒,RD cycle会拖很长”。主要竞争对手比Axiom早两年、资产5倍、估值5倍,用了两年才在IMO六题里做五题;Axiom本以为要花一年半,结果4个月就拿到普特南满分,接着解决三四个研究问题,做出"没有人类干预的第一个自动形式化整Lean系统"里程碑,还发现代码证明中的神奇transfer learning(在Verina benchmark上DeepSeek Prover是11%,Axiom达到98.93%)。但"快速导致infrastructure上有债要还”。
她认为竞争对手"不要数学家"的DNA区别在于:Axiom既要数学家,还要代码生成/编译器的人。她信"降维打击"和"多元智能"——数学数据少,动不动撞墙,“hit这些rocks更快”,做好数学可垂直降维到其他领域。她举例:Axiom能生成20页数学证明,也能快速验证芯片验证领域复杂的pass——后者只需高中数学的枚举分类讨论。
背景:MCTS(蒙特卡洛树搜索)是AlphaProof/AlphaZero的核心搜索算法,计算昂贵;Verina是代码验证benchmark;DeepSeek Prover是DeepSeek的形式化证明模型。
十三、数学是现实世界的沙盒:验证信号、math is code
新的变化
洪乐潼提出"数学是现实世界的沙盒"——既有验证信号又有更规律的结构性数据。这个定位让AI for Math既区别于AI for Science(需要实验室、机器人、前期投入大),又能成为后者的理论拐杖。更激进的是"math is code, code is math"的论断:基于Curry-Howard对应,每个数学证明可变成计算机程序,而代码验证的难题(无法backtrack、无法hierarchical拆解)恰恰是数学能给的能力。
嘉宾观点与解释
洪乐潼:要验证一个猜想,数学里可以猜想+证明;但猜想要验证生物现象就得做动物实验,“任何与现实世界更有关的验证都比数学的简明沙盒困难和复杂得多”。她尊重做AI for Science的朋友(Periodic Labs、Fields、Edison/Future House、Lila Science等),但Axiom"只停留在数字世界,不走到实际世界"。
她希望未来每个物理学家都能找到他的理论物理学家、每个做动物实验的神经科学家都能找到计算神经科学家——过去数学家停留在学术圈、很少与应用科学家合作,AI数学家能帮AI for Science解决理论问题,他们去做实际验证。
“math is code, code is math”:Curry-Howard对应让数学证明变成计算机程序;code is math则因为当前后端/web coding做不好(无法backtrack、无法hierarchical拆解)恰恰是数学能给的。所以数学和编码是"孪生兄弟",是"人类世界上有验证信号"的两个方面,加上实际世界的实验(扔鸡蛋到地上碎了)构成AI的work:math→code→real world testing→everything else。
她明确Axiom走形式化证明路线(有验证),不走inFormal(无验证)。不走形式化通向"通用推理",她希望Axiom能做"天才型数学家一样提出问题、有直觉"的创造——这是最难的部分,她和竞争对手(直接商业化落地)的区别是"我们打算做这件事,他们不太打算"。
背景:Curry-Howard对应是类型论与逻辑学的核心同构,揭示证明与程序的等价性;AI for Science公司如Lila Science等用机器人实验室做化学/材料发现。
十四、AI for Math的技术地图:prover、constructor、知识库与autoformalization
新的变化
洪乐潼给出了目前AI for Math领域最清晰的技术地图:一个prover(证明家)、一个constructor(猜想家)、一个知识库,加上贯穿始终的autoformalization(自动形式化转化)。关键判断是——autoformalization比证明更难但被忽略,因为"证明普特南/IMO能发推特,把已有数学转化成Lean得不到多少赞美"。她还指出当前范式(draft-sketch-prove,2022年提出)正在被subagents、learning from experience、grind等新方法补充。
嘉宾观点与解释
洪乐潼:当前AI for Math converge到一个做法——拿开源基座模型(如Qwen)做后训练(有人直接RL,有人SFT后RL),做好放进系统,系统里有各种specialized模型,call一些tools(含Lean meta programming)。
她把Axiom的科技愿景拆成四块:
- Prover(证明家):证明模型有明确reward(证出来是1,没证是0)。
- Constructor(猜想家):难点是没有明确reward——怎么判断猜想好不好?只能用prover做grounding给信号,还需evidence filter判断"是否优雅"。她提到斯坦福董克凡、马腾宇的self-play theorem prover是起步点,但其evidence filter靠长度判断优雅(题目vs证明长短),在高中数据集link workbook上还行,到博士研究级无法靠长度,“没有特别强的延展”。
- 知识库:大部分存在的数学在英语/中文里,连定义都不在Lean里。需要两件事——能搜索什么是已证明的、什么是需证明的(甚至找到反例直接证伪);以及把浩如烟海的数学转化为形式化数据。
- Autoformalization(自动形式化):她认为是被忽略的核心科技,“比证明更难,至少一样难度”。输入是arXiv的PDF,输出是把所有定理-证明对变成Lean代码。难点在于要先拆分(blueprint蓝图)——陶哲轩、Kevin Buzzard、Alex Kontorovich曾人手写蓝图,丢给全世界本科生每人领小任务。让计算机把20页文章拆成200-500页蓝图再转Lean,“需要很强的分解推理能力”。反方向(Lean到英语)简单些,但如何确定转回去的数学完全正确?用cycle consistency(转过去再转回来对比)。
范式演进:draft-sketch-prove(2022年)——先让inFormal模型列提纲,再变formal(Lean)的sketch,中间用sorry占位,最后填sorry(可用AI、可用纯规则如hammer)。Lean一直没好用的hammer(Isabelle有master hammer,CMU去年6月出了Lean hammer但不够),Axiom曾想赞助Lean创始人Leo de Moura做全开源hammer未成。今年出了Grind(G R I N D),能解决不少数学问题甚至无AI成分。她认为世界是"AI和formal verification两股力量合在一起"——能用deterministic不用probabilistic的就用deterministic,剩下再上大模型。
Axiom的aha moment:
- 用subagents(参考Anthropic的方向)替代昂贵MCTS做AI for Math,把证明树从40个顶点scale到4000个(更深更广);参考David Silver和Richard Sutton的"AI后半场:learning from experience",把解题的数据trail作为experience。
- 发现好的AI theorem prover能转化成很强的代码验证能力——如果代码和证明都是Lean(或Rust配Lean静态类型),两个目标函数收拢反而有更好的verify-generation(一边验证一边生成)。
背景:draft-sketch-prove是DeepMind 2022年提出的形式化证明范式;hammer是定理证明语言里的自动策略工具;Grind是Lean社区新出的自动求解工具;self-play theorem prover是猜想-证明自对弈的早期探索。
十五、ChatGPT时刻、ASI而非AGI与recursive self-improvement
新的变化
洪乐潼对"AGI"这个词明确表示不喜欢,提出Axiom做的是"ASI(specialized superintelligence)"——从1+1=2这个点,往数学这个超人类任务打,打完会发现善性(代码验证、物理),但不会覆盖到拿诺贝尔文学奖。这是一个与OpenAI"撑大圆环"相反的路线判断:不是general地扩张,而是specialized地深扎。她更激进地相信recursive self-improvement"很快能做出来",而formal verification作为RL reward"完全under explored"。
嘉宾观点与解释
洪乐潼:她用一个"盘子"比喻——中间是1+1=2和hello world,外缘是证明黎曼猜想、找治癌症秘方、写莎士比亚级著作。OpenAI等想一点一点撑大圆环到所有边界;Axiom从中间往数学这个超人类任务打,打完会发现善性(次善性:代码验证、物理),“绝对不覆盖到拿诺贝尔文学奖,但这个大的善性在B2B市场有意义”。所以是ASI——superintelligence应该是specialized的,“super should be specialized”。
她认为AI for Math会有ChatGPT时刻,且"不单是数学,一定还有coding的部分"。验证和超级智能推理"两者合一"——Axiom做AI数学家,又通过形式化证明加入传统LLM推理,输出几千行Lean代码可自我验证。她提醒团队"能力建到越好时越要记住尽快产品推出落地"。
她的两个AlphaGo时刻:一是DeepMind 2024年IMO拿28分银牌;二是2026年1月Axiom证明Fair conjecture、van der Kampen’s conjecture等研究问题(DeepMind也有inFormal的研究问题证明)。她认为这两个时刻分别是奥赛数学和研究数学。
关于recursive self-improvement:她"完全相信很快能做出来"——把数学做algorithms的能力+猜想能力做好,就能达到recursive self-improvement(AI scientist、AI engineer engineer的螺旋上升)。Axiom是其中一环但不是整个生态系统。formal verification作为RL reward"完全under explored",是她认为2026年值得做的方向。
她还提到Wang’s paradox(让工具更便利更普遍时会有更多用处)——AI伽罗瓦/AI拉马努金与所有现存数学家互动,能发明发现多少基础数学?她引用Tim Gowers(菲尔兹奖)的话:为什么国家基金委要继续给纯数学经费?因为数学是生态系统,纯数学死了应用数学也没了。
背景:Recursive self-improvement是Ilya Sutskever等人倡导的AI自我迭代概念;Tim Gowers是菲尔兹奖得主,长期关注AI与数学的关系。
十六、数学家的未来角色:资源分配者与猜想家
新的变化
洪乐潼对未来数学家角色的判断相当激进:在有限算力下,数学家是"资源分配者"——直觉决定200个H100花在这道题、8000个花在那道题;在无限算力下,则是Demis Hassabis式的"Fold everything"——把所有人类好奇的数学问题全解决。她还把数学家分为"解决问题者"与"理论建造者",把AI分为"天赋型聪明型"与"蛮力型",认为Ken Ono是理论建造者、拉马努金是直觉解题型。
嘉宾观点与解释
洪乐潼:她认为AI会把数学推向新阶段——从"math pool(匮乏)到math rich(丰富)",供给爆炸,“指数级的数学发现增长一定会发生”。所有未解决的理论问题、所有应用科学家希望数学家解决的问题,全部可解决。
数学家未来扮演的角色:提供最好的直觉,“提供那0.01%的直觉,说哪些问题比哪些更值得集中算力解决”。她设想十几二十个不同领域数学家聚起来讨论wish list(未来希望解决的问题、重要性、连接性——解决这个就能解决那些),实际由AI数学家解决。
有限算力下:数学家是资源分配者,算力与数学题重要性"画等号"。无限算力下:像Demis Hassabis在纪录片《Thinking Game》里,手下说做个平台让结构生物学家提交蛋白,Demis问"多少个蛋白",答"两亿",Demis把笔扔桌上说"结束会议,Fold everything"。洪乐潼说如果无限算力就要把所有人类好奇的数学问题全解决——她举例中国剩余定理现在被MIT的Elie Wolfe用于研究神经元能叠多少个(neural clustering),“做梦也不会想到数论会与理论神经科学产生关系”。
她认为直觉可能"五到十年"才能做出来,但有一个激进想法:现在解析数论里大量问题是在标准证明方法里"抽牌"(Major Arc五元法/Circle Method、Sieve筛法等),所谓"一个人直觉好"可能是他很快能重复运用这些工具——这部分的自动化可能比纯直觉更快到来。
她对"AI做出来之后数学家会不会无聊"的回答:数学家之间的友谊、合作、文化社区(生日峰会、轮流讲贡献)“永远不会被磨灭”。猜想、直觉、构造方面数学家仍有乐趣,“仍然是智力灯塔”。
背景:Demis Hassabis是DeepMind创始人;Fold everything是AlphaFold后DeepMind的战略姿态;Major Arc、Circle Method、Sieve是解析数论的核心工具。
十七、竞争对手、大厂与新实验室:好奇心是基本需求
新的变化
洪乐潼对竞争格局的判断清晰:Axiom与主要竞争对手(Tudor的公司)是"两家创业公司、估值规模差不多、一个新一点";大厂里OpenAI走inFormal(Kevin Wang的个人科学雄心),DeepMind有formal和inFormal两队在竞争,Anthropic把形式化作为提升推理分数的辅助但非专注点,xAI不确定。她认为大厂不一定做Axiom做的事——同样的人才密度可投到更红海领域筑护城河,与创业公司合作(如OpenAI与搜索公司合作)。而New Lab浪潮的底层驱动力是"好奇心与创造力是人类基本需求"。
嘉宾观点与解释
洪乐潼:她融资时还没有New Lab概念,投资人"觉得我疯了"。2月DeepSeek出来把价格拉很低,commercialized模型,“大家一听模型就不赚钱不投”,但Axiom"不是模型公司是深科技公司"。
她引用Peter Thiel"垄断导致创新,竞争导致平庸"——New Lab的产生是因为好奇心与创造力是基本需求,在大公司无法满足burning passion就出来。她举例Mistral(做更快更好的推理模型)、Ridgeline(AI与硬件)、各种做Materials Science的New Lab。
面对OpenAI/DeepMind竞争:早期创业公司"一个单位的创新需要的资源比例非常高效率"(为什么很多人从Facebook来Axiom);OpenAI曾经也是对着Google的黑马、发不出工资的小玩家,“历史钟摆来回摆动,spiral上升又有local扰动”。她信"always away"(得信)。
她定义Axiom是binary outcome:“要么登月成功要么登月失败,像SpaceX,火箭要么发上去要么摔毁,可能坠毁几次才发上去”。失败了她可能去做神经科学/brain-computer interface相关的事。
她对"现在是不是泡沫"的回答:“有些公司成了就是登月,有些很努力没成就是泡沫。“她希望的环境是"不怕失败”(MIT有门课Learning to Fail),但承认登月失败会在资本市场掀起涟漪——“为什么退休资金通过好几层投资到私有市场满足研究者好奇心?这是公平的问题”。她的判断是:如果研究者不是由ego驱动而是由使命驱动、不碎片化(同样问题八个尝试聚到一起),就是靠谱的尝试。
背景:Peter Thiel在《从0到1》中论述垄断与创新的关系;New Lab指2025年起一批由顶尖研究者创立、以科学雄心为驱动的新型实验室。
十八、2026年预测、中国AI与"bad system not bad model”
新的变化
访谈尾声洪乐潼给出明确的2026年预测:continual learning(持续学习)和小模型、multimodal reasoning model、agents/subagents全面scale up、formal verification作为RL reward被under explored、orchestrator值得做。她对DeepSeek等中国AI团队表示尊重(“Douglas C他们做得非常好”),但希望"纯粹科学创新少一点商业顾忌、多一点学术信任与纯真"。
嘉宾观点与解释
洪乐潼:2026年预测——continual learning和小模型(她知道一些不错的团队,全是小公司);multimodal reasoning model很快问世(Multi Model来自一家South的公司,也是她的好朋友,希望他能来Axiom);agents/subagents全面scale up;formal verification作为RL reward完全under explored;orchestrator很好值得做。
关于中国AI(DeepSeek、字节、Kimi、MiniMax等):她respect中国AI玩家,“Douglas C他们做得非常好,非常短时间、执行力强的团队”,ideas可以流通,但核心的东西可能不在文章里。她希望"纯粹科学创新少一点商业顾忌、多一点学术的信任与纯真"是好的工业界practice。中美人才不分世界,有人愿意在中国生活、有人在美国。
她最关键的bet:“我bad system,不bad model”——系统里有很多事可做(含orchestrator);以及"完全相信recursive self-improvement很快能做出来",做完之后是forward deployment——“forward deployment还没有在AI时代得到革新”。她对"语言即世界"工作室名字的联想:数学家几千年来都在用本国语言写代码、在自然语言里做逻辑推理,“这非常神奇”,所以数学的结构和逻辑对代码验证有帮助。她还在想:如果把世界想象成高维流形manifold,text-based next-token prediction的AI到底探索了多少、flat了多少(她曾想这个来调loss function)。
关于新公理:被问"如果AI证明重大猜想时用了不在现有数学里的新公理但看起来合理,你会接受吗?“她回答:AI已经在用各种奇怪公理帮忙做证明(DeepSeek Prover曾因此受害——声称做出来49道判断板题,实际只47道,2道是AI在做弊)。如果公理大家觉得自然就会接受,可能是"以前没探索够的数学领域”,像代数几何混组合出代数组合学一样,可以"接受和不接受两个世界照样运作"。比起物理加定律,数学加公理"大家会觉得更可接受一些"。
背景:DeepSeek Prover是DeepSeek的形式化证明模型,曾因公理问题导致结果虚报;orchestrator是协调多个agent的系统组件。
十九、学徒、红楼梦与"热爱数学就是看到上帝的面容"
新的变化
访谈以一个略带宗教色彩的瞬间收尾——洪乐潼在斯坦福Memorial Church下跑步时,阳光、壁画、天使与十字架让她"有一点备受的灵魂感觉",想到"如果一个人墓志碑印着他证明的事情是智力遗产,能让这个成真你会不做吗?“她把墓志碑的问题推开(“体验比较重要,光得什么墓志碑不重要”),但给出一个意外的自我定位:“我想当学徒”——在尽量多的智力领域学尽量多的东西。这把她从"天才型选手的自我否定"彻底转向"跨学科学徒的终身姿态”。
嘉宾观点与解释
洪乐潼:她16岁写过文章说"热爱数学就是看到了上帝的面容",觉得数学家科学家存在的意义之一是把基本真理发现探索。创立Axiom前晨跑时在斯坦福Memorial Church下,阳光、壁画、天使让她"有一点备受的灵魂感觉"——“如果一个人墓志碑印着他证明的事是他的智力遗产,能让这个成真你会不做吗?可能不会。“她承认这是"出于ego的想法,希望登月的是我们”,但"总体上非常希望它会实现,就算我们失败别人登上去了也是好事”。
被问墓志碑写什么,她说"不重要"——“体验比较重要,我反正要活过了有体验就无所谓”。她曾一想到"可能当不了数学家"就哭,“后来觉得就是想当学徒”。她跳来跳去(数学→物理是因为初高中物理差想补→神经科学→AI→量化交易XTX→法律→反垄断像树状逻辑、合同法也像数学、宪法和庭审是讲故事)都是"想尽量多学东西"。她人生最快乐的时候是找到那个GitHub repo把几百篇AI论文摘要全读完的几个月,舒博跟她一起读,现在那些作者陆续加入Axiom。
她推荐《红楼梦》(很多学者研究它,小时候对她有震动)、马斯克的故事(“pain and suffering"“嚼玻璃的日子"让你在难的时候觉得正常)、初等数论书、戴文普的分析书。
她对"训AI跟当年训自己有什么不同"的回答:有点像——看到AI表现刚好一点就马上给更难的题(curriculum),“看到相似的时候大脑神经元就fire”。她把招人视为最快乐的体验之一:“像是两只鲸鱼又找到了彼此的聊天频率”——都学过数学、都懂Transformer又有新理解,聊起来很有意思。她还发现"很多古老技巧对前沿研究有指导价值”,像二十四诗品"如江不尽,于古为新”,“世界是一个圆,我们又回到原点”。
她现在的自我奖励来自"事情本身"而非团队——“团队能给你grounded的安全感,但让你break out的能量可能来自愤怒、悲伤、卯着一口气要达到目标,这不由团队来,由事情本身来”。她相信authorship(作者)——“你是你自己人生篇章的书写者,不能觉得一个情境能决定你的决定,是你决定让这个情境决定你的决定的”。
背景:《Proofs from THE BOOK》源自爱尔德什的信念:上帝有一本收录每个数学定理最美证明的天书;《二十四诗品》是司空图的诗学著作,“如将不尽,与古为新"意为在继承中常新。
结语:被创造的与被发现的
回到访谈标题里的那个千古辩题——数学是被发现还是被创造。洪乐潼没有给出非此即彼的答案,但她用Axiom的实践给出了一种新的综合:AI用蛮力(被创造的工程)去抵达那些拉马努金用直觉(被发现的)看到的东西,而形式化证明(被创造的语法)让发现可以被社群认证与累积。她说自己想当直觉派天才却自认是蛮力型,于是造了一个放大蛮力的AI——这本身就是"被创造的"试图触及"被发现的"的工程。
更值得玩味的是她反复强调的两个判断:一是AI for Math的最大受益者是蛮力型数学家(像她自己),二是数学家未来最不可替代的是0.01%的直觉。前者意味着AI会先吃掉"熟练运用工具"的中间层,后者意味着"提出好问题"的顶端依然属于人类——至少在五到十年内。这中间的张力,正是AI for Math这个领域最迷人、也最不确定的部分。
她把公司命名为Axiom,既呼应那本《数学天书中的证明》,也呼应Lean"从有限公理往上建高楼"的哲学。而她自己最想写的墓志碑,不是"数学家"也不是"CEO”,而是"学徒"。在一个所有人都急着声称自己是founder的时代,一个24岁的独角兽CEO说"我特别不想当创业者"“我非常愿意给Axiom当intern”,这本身就是对"被创造的"与"被发现的"这道辩题最诚实的回答——她还在学,而Axiom是她目前最好的课堂。