昨天早上可能会是人类时代的一个分水岭。以至于这篇文章在我即使有提前做了大量功课有一定的知识储备的情况下还是写了整整一天的时间完稿时间是今天的凌晨6点15无他还是因为这个事件的信息量过大历史意义过大那种宿命感在调研在写的过程中还是有无数次的巨大的情绪波动。这个事件大家比较关注新闻的都已经看过了。就是昨天10月7号早上OpenAI没有任何预兆的发布了巨量的数学研究成果他们直接在Github上发了一个新仓库名字非常的朴素叫openai/math。网址在此https://github.com/openai/math这里面躺着722份数学手稿372个相关成果覆盖数论、代数几何、实分析、组合数学、理论计算机、数学物理、偏微分方程等等方向全部出自OpenAI内部一个没有名字也还没有对外发布的模型。一夜之间722篇论文这个数量相当于啥概念呢。著名的arXiv有上传限制一个月每个人只能提交两篇论文。722篇如果是人做的手传的话光传论文就得传30年。而且这是数学数学可以说是科学的基础也是科学的皇后。那一刻你可以理解成命运的齿轮已经不是缓缓转动了是尼玛命运的齿轮直接钻出了火星子然后组装成了高达在你面前俯视你问你你看我是不是还挺牛逼的。接下来的24小时基本全世界都属于一种沸腾的状态有人欢喜有人愁。这哥们的评论是我觉得最感同身受的。这是一个混沌的时代也是一个底层科学指数级爆炸的时代。《三体》里面经历的技术大爆炸就目前来看极有可能在我们的有生之年发生。虽然在数学上我是一个绝对的门外汉但是也确实从2个月前就在恶补各种知识有了AI之后学习真的很快家人和朋友也有从事数学工作的帮我做了很多的补充现在也有了一些我自己的了解所以我也想尽可能用我的笔墨给大家写一篇小小的科普文章尽可能让大家也能理解这个震撼。那么系好安全带这趟旅程我们正式开始。一.发生了什么这722份数学手稿被归成了372个相关成果也可以说成是归成了372个成果组。成果组这个词得解释一下数学成果有点像生孩子一个主结果出来往往会顺带生出一串推论、补充论证或者换个思路的另一种证明那OpenAI就把这些沾亲带故的归到一起算一个组了。那这些成果是怎么来的呢OpenAI的说法是他们手上现有的数学评测已经被AI刷满了。其实已经能看出来如今的数学评测的Benchmark已经趋近于饱和了国际数学奥林匹克也就是全世界最聪明的高中生参加的那个比赛AI去年就拿到了金牌水平你像各种数学题库也刷得差不多了分数再往上涨已经说明不了什么东西了。那如何再去评估模型的真实数学能力呢于是OpenAI他们挑了大约4000个数学界的尚未解决的研究问题也就是数学里常说的“开放问题”一股脑的喂给了那个没公开的内部模型。最后从里面筛出有一定分量的结果就是这372组。这里大家可以不用怀疑OpenAI的模型在科研上的能力虽然编程这块被Claude杀穿了但是相比于编程GPT模型在科研能力上一直都是SOTA的。然后那个没公开的内部模型平均下来每个结果大约花了3小时ChatGPT Pro级别的思考算力。就是我们平时在ChatGPT上看到的这个模型。3小时很多人看到这个数字就已经坐不住了。要知道这里面有的问题真实就是人类数学家琢磨了几十年但依然没有解决的皇冠上的明珠。然后Altman当天发推发了自己的感慨。“你的海洋如此浩瀚我的船只如此渺小。”我相信每一个跟最前沿的AI对话过的人看着AI的无尽可能或多或少在内心里也迸发过这样的念头。二.数学是什么发布之后数学家们沸腾了这个沸腾人间百态尽显。罗格斯大学数学系主任、数论学家Alex Kontorovich看到“准黎曼猜想”那一条直接说“准黎曼你在逗我吗”随后他说如果这是人类数学家做出来的“直接就是菲尔兹奖毫无疑问”也有比较尴尬的。要理解数学家为什么这么激动我觉得还是得知道一个前提就是数学跟其他的学科不太一样在哪里。我自己浅薄的认知就是两个字证明。物理、化学、生物之类的很多时候靠的是实验。但是你实验做得再漂亮理论也可能被推翻就像牛顿力学统治了两百多年最后还是被相对论修正了。但数学不太一样数学是从几条最基本的公理出发每一步都严丝合缝地往下推导一旦证明成立在同样的公理和规则之下它就永远成立不会过时也不会被推翻。就像两千三百年前欧几里得在《几何原本》里证明过的那些结论今天依然成立。可能这么说还是太抽象咱们看一个真正的证明放心小学数学就够用了。问题是素数有没有最大的一个我们都知道素数就是只能被1和它自己整除的数比如2、3、5、7、11、13越往后素数越稀那它会不会在某个地方彻底断掉呢欧几里得是这么证明的。假设素数是有限的那我们就一定能把世界上所有素数全部写在一张清单上接着我们把清单里的所有素数全部乘起来再加1比如假设世界上只有2、3、5这三个素数那就算2×3×5131。这个新数除以2余1除以3余1除以5也余1也就是说你清单里的任何一个素数都除不尽它。那它要么自己就是个素数要么能被某个不在清单里的素数整除不管哪种情况都说明你的清单漏了。所以素数不可能有限它有无穷多个。这就是数学史上最著名的证明之一素数无穷定理。就这么几行字两千多年没有人能挑出毛病这就是数学的力量。那“猜想”又是啥呢就是大家都相信是对的但还没人证明出来的东西。咱们自己最熟悉的猜想大概是哥德巴赫猜想就是任何一个大于2的偶数都能写成两个素数之和。1978年的时候徐迟一篇报告文学让陈景润成了全民偶像就是因为他在这个问题上走得最远。早在十多年前计算机就已经把哥德巴赫猜想验证到了4后面跟18个零那么大的数这些年还在接着往上推一个反例都没找到但在数学家眼里这还是不太行。因为数学家要的是“所有”。数学史上吃过这种亏有个叫波利亚猜想的东西从1开始一路验证到几百万、几千万都是对的结果到了906150257好死不死的翻车了。所以验证一万亿个例子也比不上一个证明。但是这时候问题来了就是证明本身也会出错。1637年费马在一本书的页边上写了一个猜想还顺手留了句话大概的意是我想到了一个绝妙的证明可惜这里地方太小写不下。于是这句话折磨了数学家三百五十多年。1993年英国数学家怀尔斯在剑桥宣布他证明了费马大定理全场掌声雷动结果审稿的时候发现了一个漏洞他又闭关一年多才把这个坑给填上最后那份证明一百多页全世界能完整看懂的人屈指可数。于是这就带出了一个很现实的问题证明越来越长、越来越难人类的精力完全不够用了怎么办于是有人开始想能不能让机器来检查。这就是OpenAI这次新闻里反复出现的Lean。写代码的朋友可以这么理解Lean就是数学界的编译器你把证明一行一行翻译成Lean能读懂的代码如果编译通过就说明每一步推理都合规没有偷工减料。当然它也有局限主要是2个。第一如果你一开始就把题目抄错了或者偷偷换成了一个简单版本编译照样还是能过掉的因为机器只管你证得对不对但是不太会管你证明的是不是原来的那道题。第二它只能告诉你“对不对”没法告诉你“新不新”“重不重要”“漂不漂亮”。这两个局限也基本是后续所有数学家讨论的重点。三.这次的“眩晕瘫坐”这次372个成果组里最炸最让人眩晕瘫坐的一个成果那必然就是“准黎曼猜想”了。还是回到我们上面提到的素数复习一下前面我们讲过2、3、5、7、11、13……这些只能被1和自己整除的数字就是素数。它们是整数的原子也就是说任何一个大于1的整数都能拆成几个素数相乘而且拆法是唯一的今天你手机里的很多加密也是靠素数撑起来的。素数有一个很奇怪的特点就是单独看它们乱得一塌糊涂。两百多年前十几岁的高斯发现乱归乱但大趋势是有的就是越往后越稀。在100万附近大约每14个数里有一个素数到了1万亿附近大约每28个数里才有一个。但这也只是大概于是几百年来大家一直想搞明白的就是这个事这些看起来乱七八糟的素数背后到底藏着什么规律1859年33岁的黎曼换了个完全不同的思路他发表了一篇不到十页的论文给出了另一种思路不研究素数了研究一个叫ζ函数的东西但这个函数可以写成一种和所有素数直接相关的形式。我知道这可能有点绕你可以粗暴的理解成ζ函数像一个把所有素数信息压缩进去的公式机器。这里需要知道一个概念叫做“零点”这个“零点”是数学意义上的零点。那函数我们都知道它可以理解成一台机器就是你塞进去一个数它吐出来一个答案。比如这个公式大家肯定能看懂。塞进去3答案刚好等于0那么3就叫这个函数的零点。ζ函数也是一样只不过它肯定没有这么简单它的输入也不是普通数字是复数复数就不用理解了你只需要把它想成平面上的一个坐标。如果某个坐标塞进ζ函数以后结果刚好等于0那么这个点就是ζ函数的一个零点。而这些零点在哪里和素数到底怎么分布有着极深的关系。我们早就知道素数大概会按照什么速度越来越稀但是实际的素数数量会偏离这个平均规律多远而ζ函数零点的位置就控制着这种波动。然后黎曼提出了一个极其大胆的猜想所有重要的零点横坐标全部都是1/2。这就是黎曼猜想。但这个猜想黎曼自己没证出来后人也没有于是1900年希尔伯特把它列进了著名的23个问题2000年它又成了悬赏100万美元的千禧年七大难题之一。那正面证明不了数学家们就一点一点从边缘往里面怼数学家早就知道这些重要零点的横坐标全都落在0到1之间1/2正好在正中间。既然没法直接证明它们全在1/2上那就退一步从1这一侧开始一块一块地证明“这里没有零点”看看能往1/2推多远的距离。第一步是1896年迈出的阿达马和德拉瓦莱普桑两位数学家各自独立证明了横坐标正好等于1的地方一个零点都没有。千万不要小看了这一步高斯当年看出来的那个“越往后越稀”的大趋势就是靠它才被严格证明成了今天的“素数定理”。可接下来就卡住了此后一百多年数学家能证明的只是紧贴着1的一条细缝里没有零点这方面最好的纪录停在1958年之后将近七十年几乎没有实质进展。于是数学家们又退了一步定了个低配版的目标就是不用一口气证到1/2只要证明存在某个比1小的数比如0.99横坐标超过它的地方不管往上走多高都没有零点就行。这个低配版就叫“准黎曼猜想”可就连它一百多年来也没人做到。但OpenAI这次声称做到了而且一步推到了7/8也就是0.875。横坐标大于0.875的地方从下到上一个零点都没有。听着好像不多但分量极重因为这已经是这几十年来在黎曼猜想上最重大的突破了AI解决了人类无法推进之事。所以大佬才说这要是人类做出来的直接就是菲尔兹奖没有任何悬念。准黎曼只是其中一颗炸弹再举两个重磅的。1.矩阵乘法。矩阵就是一张数字表格。两张表相乘是计算机里最基础的运算之一大模型的训练和推理底层干的主要就是这个。教科书上的方法计算量大约是表格边长的3次方。1969年德国数学家施特拉森发现可以更快把这个指数压到了2.81。从那以后全世界顶尖的学者花了五十多年一点一点往下压然后压到了2.37左右这时候小数点后第三位、第四位动一动基本都能发一篇像样的论文。然后OpenAI声称在复数域上做到了2.25。2.挂谷猜想。1917年的时候日本数学家挂谷宗一问了一个看起来很幼稚的问题就是一根针放在桌上要让它原地掉个头最少需要扫过多大面积直觉上我们都知道应该有个最小值结果后来有人证明答案出人意料可以小到任意小小到几乎为零。这个问题后来又逐渐演变演变成了高维空间里的一个深刻猜想牵扯到好几个数学分支它的三维版本就是2025年由王虹和Joshua Zahl攻克被视为近年来最重要的突破之一。今年7月王虹拿到了菲尔兹奖基本火遍了全世界是这个奖九十年历史上第三位获奖的女性。这次OpenAI声称四维版本也解决了三维那边还往前推了一个更强的版本。。。除了这几个清单里还有唯一博弈猜想相关的重大结果、霍奇猜想的特殊情形、更快的整数乘法……随便拎一个出来我觉得放在过去都是能上头条的新闻。如果这些都成立说一句“数学史上前所未有”绝对算不上夸张。事实就是如此。四.AI和数学的纠缠其实这一次已经不是AI第一次去碰数学领域了。机器碰数学比很多人想象的要早得多。1956年也就是达特茅斯会议召开、“人工智能”正式登场的那一年有个叫“逻辑理论家”的程序证明出了罗素那部数学巨著《数学原理》里的几十条定理那时候大家都觉得机器证明数学指日可待。结果这一等就是几十年。1976年四色定理被证明了这个定理很多人都知道它说的是任何一张地图只用四种颜色就能让相邻的国家颜色都不一样。证明它的两位数学家让计算机跑了上千个小时挨个检查了上千种情况。数学界当场吵翻了一个人类根本看不完的证明到底算不算证明这是数学史上关于“机器证明算不算数”最著名的一场争论。1998年又来了一个更头疼的。美国数学家黑尔斯证明了开普勒猜想也就是水果摊上堆橙子的问题怎么堆最省地方。答案就是水果摊大爷早就会的那种堆法但证明极其复杂还用了大量计算机计算。审稿人看了好几年最后给出的意见大意是我们有99%的把握它是对的。99%在数学界是个很尴尬的数字。黑尔斯一咬牙干脆发起了一个项目用机器把整个证明从头到尾形式化验证一遍。这一验就是十几年2014年才完成。从那以后让机器验证这条路终于慢慢火了起来后来有了我们上面提到的Lean有了Mathlib这个全世界数学家一起往里填的开源库。但那个阶段的分工很清楚人负责想机器只负责算和验证。转折点出现在大模型时代。2024年夏天DeepMind的AI在国际数学奥林匹克上拿到了银牌水平。2025年夏天好几家的AI都拿到了金牌水平其中就包括OpenAI。竞赛题被刷满了AI公司开始盯上真正的研究问题。然后当时就闹了一个大笑话。2025年10月OpenAI的一位副总裁发推兴奋地说GPT-5解决了10个此前未解的埃尔德什问题。埃尔德什是匈牙利的一位传奇数学家这哥们一辈子没有固定住所拎着一个手提箱满世界跑到谁家就跟谁合作写论文一辈子发了一千五百篇左右他还喜欢给难题挂悬赏从几十美元到上万美元不等身后留下了上千个问题。结果没过多久就被扒出来GPT-5根本就不是自己去解出了这些题是他娘的在浩如烟海的文献里找到了早就有人解过、但被大家遗忘的答案。。。但塞翁失马焉知非福大家也很意外的发现那时候AI当超级搜索引擎那是真厉害于是很多被埋在角落里的老结果就这样被翻了出来。真正的拐点在2026年5月。OpenAI的模型推翻了埃尔德什在1946年提出的一个几何猜想这一次包括剑桥大学蒂莫西·高尔斯在内的九位外部数学家专门写了配套论文高尔斯是菲尔兹奖得主他说这个成果他会毫不犹豫地推荐给顶级期刊。这是到那时为止最受主流数学家认可的AI原创研究成果之一也成了一个分水岭。然后速度就起来了。5月1项8月一次发布10项9月宣布一百多项10月372组成果。5个月翻了两个数量级这搁谁都会懵逼的我觉得。还有一个非常容易被忽略的变化那就是成本。9月份OpenAI攻纳维–斯托克斯方程的时候动用了大约一万个Agent跑了88个小时烧了数百万美元的算力。到了10月OpenAI说几乎每个结果都是“一个提示词、一个Agent”跑出来的平均3小时。而且数学这条赛道上也远远不止有OpenAI这一家。DeepMind5月份发布的系统解出了几百个埃尔德什问题里的9个结果全部经得起机器检查Anthropic用11天把费马大定理的整个证明翻译成了Lean代码足足一千三百万行。整个行业都已经刹不住车了。五.数学家们的回击在今天之前其实还有数学家们和OpenAI之间更加轰轰烈烈的交锋。这是因为9月8号这一天OpenAI宣布他们在纳维–斯托克斯这个千禧年难题上取得了重大突破。纳维–斯托克斯方程是千禧年七大难题之一悬赏100万美元。本来是件天大的好事结果背后就有很多的瓜。OpenAI自己承认他们是9月1日听到一个传闻说有两道千禧年难题被人解决了才紧急启动了这个项目。后来才知道传闻跟两个人有关一位是纽约大学的教授Tristan Buckmaster另一位是Levent Alpöge他们死对头Anthropic的员工。在OpenAI发公告之前大约12个小时这两位抢先把自己的论文和Lean代码挂到了网上不过他们证的是欧拉方程在有外力情况下的结果跟OpenAI那篇纳维–斯托克斯证明不是同一个结果但方向非常接近。紧接着Buckmaster公开指称OpenAI的研究员Bubeck在一次通话里就论文署名的问题向他施压包括因为Alpöge在Anthropic工作要求把他排除在外之类还说了一些他理解为威胁的话。反正就是两边开骂了你要知道这可是一向安静的数学圈这事已经非常狗血了。三天后9月11日一封联名信发了出来。署名的是25位菲尔兹奖得主名单里有陶哲轩有德国的舒尔策有乌克兰的维亚佐夫斯卡有比利时的德利涅还有华人数学家邓煜。信的标题翻译过来大概是《AI在数学中的严重错位》。大概意思就是AI公司把“解题”当成衡量自家模型多强的尺子这跟数学本身的目标严重错位且正在伤害数学和数学共同体数学尤其是抽象数学真正珍贵的从来不只是得到一个答案它是为了让人类获得新的理解和洞见。注意他们没有说反对AI。信里也承认AI有潜力增强和加速真正的数学研究他们要的是给论文的撰写、署名和消化留出时间。一周之内七千多人联署。再往前翻还有一段更早的伏笔。据《连线》杂志报道8月份OpenAI曾经召集大约40位数学家开过一次闭门会。美国数学会前主席Bryna Kra回忆会上的气氛是极度兴奋和极度恐惧同时存在。与会的数学家恳求OpenAI“别一次性把东西全倒出来也别像网红一样只靠发推文来发布数学。”9月21日OpenAI放话说已经解决了100多个开放问题但没给任何细节开头提到的那个设在普林斯顿高等研究院的独立顾问组专门就这种情况向数学界征求了意见。9月29日这个顾问组收集了数学界600多份反馈发出了一套建议。然后非常严厉的说他们不认可AI实验室拿外界用不了的专有模型去测试前沿数学问题并要求立刻停止这种做法。对于那所谓的100多个做出来的结果他们要求放进不受实验室控制的学术存档公开模型名字、提示词、推理过程、花了多少时间和算力能形式化的尽量形式化失败的尝试也要报告。还特意加了一条别拿数学成果给你们自家模型打广告。然后OpenAI没有回复。一周后10月7日722份手稿上线。这是一个可怕的时代。但也绝对是一个极其激动人心的时代。六.技术大爆炸2016年3月首尔AlphaGo对李世石4比1。第二局AlphaGo下出了著名的“第37手”现场解说一开始以为是机器失误后来才发现是一步人类想不到的妙手。第四局李世石下出了被称为“神之一手”的第78手赢下了人类唯一的一局三年后李世石宣布退役他说AI是一个无法被打败的存在。2017年AlphaGo又在乌镇三比零赢了当时排名世界第一的柯洁柯洁在棋盘前落了泪。再往后事情就变得很安静了。今天AI赢了人类棋手已经不是新闻了更不会因为这种事上热搜。AI下棋比人强从一个震动世界的大新闻变成了一个今天根本不需要讨论的常识。我觉得未来所有的学科可能都会走上跟围棋一样的路。今天大家还在为一个准黎曼猜想吵翻天但可能用不了几年AI再证出一个什么猜想可能也无人在乎了。大家只会耸耸肩不然呢AI做数学本来就比人强啊。但至今为止我觉得人类最稀缺的从来不是智力是另一个东西注意力。AI的注意力几乎是无限的。于是这套打法可以复制。物理、化学、天文、生物会不会都像数学一样被一个领域接一个领域地迅速攻破人类会不会迎来真正意义上的技术大爆炸《三体》中恰好罗辑就经历了一次技术大爆炸。我们所有的学科都一定会技术大爆炸的一定会的只不过速度有先后这个速度只取决一个因素评判器或者说这个裁判到底有多贵。数学的裁判是Lean跑一遍几秒钟下棋的裁判是一盘棋几十分钟。这两个都很快。可化学的裁判是实验室一种新材料要合成、要测试几周、几个月。新药的裁判是临床试验一种药从发现到上市过去常常要十年。高能物理的裁判可能是一台造价几十亿美元的对撞机。天文学的裁判那也许得等下一台望远镜升空了。AI再快也快不过现实世界。所以技术大爆炸也必然遵循这个原则先大爆炸的一定是数学和代码因为裁判几乎免费然后是天气、蛋白质、材料筛选等等这些能在电脑里模拟的领域。最后才是必须动手做实验的硬科学以及一切跟人有关的事比如医学。而当AI能在每个领域源源不断地提出新想法时整条链条上最慢的会变成两样东西。一样是现实世界里的实验另一样是人。人要去核对要去理解要去决定哪个方向值得投钱、值得冒险。到那时候人类自己会成为科学进步里最慢的那一环。其实这一幕已经在数学里提前上演了。经常用Agent写代码的朋友应该肯定会深有体会AI现在写代码变得很便宜但真正的瓶颈变成了代码审查AI一天能写几十万行你一天能看几行或者说你现在还看AI写的代码吗数学现在就站在同一个路口生成证明变得便宜了但审核证明、理解证明成了最稀缺的东西。这372组成果大概需要整个数学界消化几个月。几个月以后呢谁知道模型又进化成什么样了呢七.尾声最后我想讲两个小故事。第一个故事发生在1900年的巴黎。那年夏天的国际数学家大会上德国数学家希尔伯特做了一场演讲提出了一批他认为新世纪最重要的数学问题后来整理发表就是著名的23个问题。这23个问题养活了整整一个世纪的数学家只要谁解决了其中一个谁就能名垂青史整个20世纪数学的走向很大程度上就是被这张清单塑造的。一个好问题有时候比一个好答案值钱得多。因为答案只有一个而问题会塑造整整一代人。第二个故事发生在1930年的柯尼斯堡。那年9月已经功成名就的希尔伯特在家乡发表了一场广播演讲。结尾那句话后来刻在了他的墓碑上我们必须知道我们必将知道。这是希尔伯特一生数学乐观主义最浓缩的一句话。但很少有人注意到就在他演讲的前一天在同一座城市的一个学术会议上一个24岁的年轻人哥德尔轻描淡写地宣布了一个结果。后来它被称为“不完备定理”。“只要一个数学体系的公理能被一条条明确地列出来强到足以描述最基本的算术而且自身不矛盾那它里面就一定存在一些命题光靠这套公理你既证明不了它对也证明不了它错。”希尔伯特当年的梦想之一就是给数学造一个坚不可摧的地基把数学公理化然后用严格的数学方法证明这整栋楼不会塌。哥德尔却说只要这栋楼足够复杂你就不能完全站在楼里面靠楼本身证明楼永远不会塌。你只有出去画一个更大的圈造一栋更大的楼。圈外一定还有新东西。数学用自己最严格的方法证明了自己的边界。我讲这两个故事是想说我做数学的家人和朋友告诉我数学在她们的理解里从来就不只是“为了知道答案”。如果只是为了答案那AI也许真的会比人做得更快、更多。可是数学这门手艺人类已经干了几千年从欧几里得到费马从高斯到黎曼它最迷人的地方更从来不是最后那个证毕。是那穷尽一生追寻和理解的过程。英国数学家哈代说过数学家跟画家、诗人一样是模式的创造者。卡帕西大神有一句话我最近也一直在提醒我自己“你可以外包思考但你没法外包理解。”所以AI时代人还剩下什么我想大概有三样东西。第一是提问。什么问题值得问往哪个方向走这背后是人的好奇心还有积累的审美。第二是理解。机器给出一个一百页的证明它是对的但它到底说明了什么和别的东西有什么联系第三是意义。你看有了汽车人还在跑马拉松有了缆车人还在爬山。AlphaGo之后棋手也没有消失他们开始跟AI学棋重新理解这门古老的游戏。很多时候我们做一件事从来不全是为了结果还有意义。最后用希尔伯特的那句话作为结尾吧。我们必须知道。我们也必将知道。原文链接AI让数学再也回不去那个旧世界了。-虎嗅网我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink