2026年AI密集“攻城”数学界,数学家预见重重危机
1. AI在数学界的重大突破2026年数学遭遇密集AI攻城。7月20日Anthoropic的一名员工Levent Alpöge在X.com上说自己在看世界杯时顺手用Fable 5找出了雅可比猜想的一个反例在X上引起轩然大波因为这是数学界的顶级“悬案”之一人们用了87年试图证明它的正确性华人数学家张益唐当年的博士论文题目正是与此有关而论文的不顺又导致他后来多年以打杂为生。Anthoropic这个非正式的数学高光时刻已经比对手晚得多。再往前推两个月OpenAI和谷歌几乎是当面对决。5月20日OpenAI宣布其内部一个通用推理模型自主推翻了匈牙利传奇数学家保罗·埃尔德什Paul Erdős提出的单位距离猜想。这个问题已困扰了数学家整整80年。菲尔兹奖得主蒂莫西·高尔斯Timothy Gowers直言不讳地评价“此前没有任何AI生成的证明能接近这个水准。”仅仅一天后Google的DeepMind以更大的规模还击。他们设计的数学模型AlphaProof Nexus自主解决了9道公开的Erdős难题其中2道已经悬而未决长达56年。此外它还解决了另外一些问题每个问题的推理成本也低到仅为几百美元。2. AI能力飞跃的历程要理解今年数学界的震撼程度可以回看这条清晰的加速曲线。2024年7月DeepMind的AlphaProof在国际数学奥林匹克竞赛IMO中解出6道题中的3道非几何题达到银牌水平。这是AI首次在IMO中获得奖牌级表现。注意此时它解出的问题都有答案不是未知、开放性的。2025年10月OpenAI曾声称GPT - 5解决了10道Erdős难题但这一说法在几小时内就被公开驳斥GPT - 5并非原创求解而是做了超级文献检索找到了此前罕为人知的已发表论文。2025年年末DeepMind部署了智能体Aletheia。在Erdős问题数据库中Aletheia挑选了700道进行尝试它正确解决了13个问题其中4道是新解答另外9道又是“超级文献检索”成功了。而2026年5月至今的这三次突破有了本质性不同第一问题份量重。Aletheia的研究者自己就承认去年所解决的4道Erdős难题大多冷门有些可能从来没有专家认真尝试过。但此次OpenAI所推翻的“单位距离猜想”核心、知名哪怕有Erdős本人为它悬赏却仍长期悬而未决难度和地位都得到公认。Anthoropic Fable 5找出反例的雅可比猜想被美国数学家、菲尔兹奖得主斯蒂芬·斯梅尔Steve Smale列入“18个21世纪的世纪数学难题”。虽然这次AI只是找到了三维空间中的一个反例、二维中猜想是否为真尚不得而知但仍因问题难度大而被数位数学家认为是AI的重要突破。第二更自主。之前AI解决数学问题是半自主的AI生成候选方案然后需要数学家人工筛选、修正细微错误。而OpenAI 5月的突破是模型完全自主地生成了整个证明。更进一步地谷歌的AlphaProof Nexus不再需要数学家给它做质检了。它利用了一种叫Lean的形式语言自主完成了正确性检验。Fable 5的工作细节现在我们还不得而知。3. 轰动新闻背后的“设计”OpenAI所解决的那个问题是这样的在一个平面上放n个点那么距离恰好是1的点最多能有多少对数学家Erdős在1946年猜测正方形网格的排列方式是最优解。不管你会不会解这道问题但很容易看懂它。这也正是OpenAI新闻成功引发轰动的关键点之一。“OpenAI的数学团队里有很了解数学研究的专业人士。这个团队显然是花了大量的时间从那些尚未被解答的数学问题中挑选哪个可能做得出来。从被挑选过的问题中又着重精选几个最有可能出成果的、简单到大众也能听懂、数学家又要足够关注的问题”北京大学国际数学中心副教授李欣意这样分析。“甚至他们要考虑到证明也不能冗长不能让数学家用上半年才能复核完毕。”Anthoropic Fable 5所提出的雅可比猜想反例更是简洁到只有寥寥几行式子很容易就被其他数学研究者验证。是的研究者们必须把“人类友好”考虑进去。4. AI现在还不能抛开人类当AI使用大语言模型写出一些“看起来很有道理”的推理的时候它到底有没有犯错是很难由它自己来确证的。OpenAI使用的是一个通用推理模型。它接收到问题后用自然语言即人类能读懂的语言生成了一条非常长的思维链每个子Agent做一部分短小的自然语言论证、一环套一环最后得出一个结果。但自然语言推理有一个天然的弱点模型可能在推理链的某一步犯小错最终酿成大错。所以OpenAI请来了9位顶级数学家对证明进行人工审查。这些数学家不仅验证了正确性还大幅改进了原始证明使之更简洁、更通用。Erdős问题数据库的维护者托马斯·布鲁姆评论道“人类在讨论、消化、改进这个证明以及探索其后果方面仍然扮演着关键角色。”DeepMind的AlphaProof Nexus在推理过程中靠Lean语言暂时摆脱了“人”证明它对不对人类只最后确认结果的数学意义。大语言模型会用Lean的形式化语言生成证明步骤Lean编译器检查每一步是否成立如果某一步不通过Lean返回错误信息模型据此修正循环往复直到成功。全部用Lean去验证这件事情看起来很美妙但还远远没有到完全能够实操的程度。简单说就是Lean语言严格而冗长人类很难直接写或读懂需要“翻译”但“翻译现有数学定理”这一基础建设也还差得很远。5. AI的数学能力高于人类吗先说结论AI目前并不比人类更聪明。它只是没有学科壁垒、没有权威偏见然后“大力出奇迹”。AI证明了Erdős是错的、雅可比猜想有反例而不是像大多数人那样面对传奇数学家的一个古早猜想沿着心理惯性试图证明他是对的。它又比那些试图寻找反例的人更有耐心反复尝试。AI是个“通才”这同样令人类自叹弗如。5月份OpenAI解决的单位距离问题属于几何领域成功的关键是它从代数领域的数论中引入了一个看似无关的工具。要知道现代数学高度分工研究组合几何的数学家通常不会深入探究数论反之亦然。这两个领域之间的距离就像让一个心脏外科医生去想到用免疫学的方法治病。不过AI现在缺乏在新方向上的洞察和探索能力。李欣意做了一个这样的比喻“如果人类的数学知识可以比喻成一个有凹有凸的多边形外部是未知部分那么一流的数学家可能在一个尖角上把边界拓展到远处像希尔伯特这样的伟大数学家甚至在好几个方向都走得很远而广大的数学工作者大多数时候做的事情是把凹进去的部分补齐——数学上叫做‘取凸包’。“现阶段‘大新闻’里的的数学AI也不过是把知识变成知识的凸包而不是在未知方向上探索得更远。”假如有朝一日AI掌握了往外走的能力那可能确实就真的是全面超越了人类。6. 数学家预见到重重危机2026年6月2日来自15所大学的16位研究者发布了《莱顿人工智能与数学宣言》。这份宣言获得了国际数学联盟IMU的正式支持陶哲轩、彼得·舒尔茨等知名数学家也公开签署。宣言并不反对使用AI也鼓励数学家了解新兴技术。它担心的是在用AI更快、更多地生成成果的过程中数学界一些基本价值观可能被破坏。最直接的问题是AI能够快速生成大量“看起来正确”的证明其中却可能藏着很难发现的错误。AI“完成”一个证明只需要几小时认真审查它却要花几周甚至更长。有能力审稿的数学家极其有限AI成果井喷会导致同行评议体系“消化不良”如果大量的AI推理直接以预印本甚至新闻稿的形式发表则是严重的误导并挤占了那些真正有价值的发现的空间。这个担忧甚至马上被验证了。就在几天以前OpenAI在发布GPT 5.6 Sol的关头发布新闻稿宣布解决了一个尘封50年的数学问题。但这个成果并没有得到外部数学专家的确认。另一个问题是成果归属。数学AI建立在大量的前人研究成果之上但在输出时往往无法为贡献者合理署名这对数学家不公平。部分训练数据还涉及未经许可使用论文和数据库由此产生新的版权争议。以及如果数学家协同AI产生新的数学那么这一成果究竟是属于人类还是AI《宣言》还提出了一个更隐蔽的威胁科技公司可能开始影响数学界的导向。AI公司倾向于搞那些“容易做”的问题而非“有深远意义”。在大学预算紧张的背景下这可能改变激励机制变相鼓励研究人员与科技公司进行不对等的合作。如果不加以控制可能破坏现有的招聘、资助和认可机制威胁研究人员的自主性甚至影响数学研究本身的范围和深度。数学的价值不只是得到更多答案。它还包括理解答案为何成立判断哪些问题重要以及从旧知识中发现新的研究方向。这些能力由数学共同体经过长期讨论、争论和传承形成很难用“解出了多少道题”来衡量。因此《莱顿人工智能与数学宣言》要求研究者公开AI和计算资源的使用情况坚持同行评审由人类作者承担正确性和引用责任并建设独立于商业公司的公共计算设施。数学家想守住的并不只是自己的工作。他们还想守住决定“什么数学值得做”的权利。

相关新闻

国际商标注册服务平台的技术选型分析——基于公开数据的多维度对比

国际商标注册服务平台的技术选型分析——基于公开数据的多维度对比

一、背景:国际商标注册的业务痛点与技术需求 随着跨境电商和品牌出海成为常态,国际商标注册需求持续增长。2025年全国商标注册申请量达428.7万件,驳回率维持在32%以上,在餐饮、服装、3C等热门行业,首次申请驳回率更高。…

2026/7/23 7:35:57 阅读更多 →
Linux系统负载全方位监控+压力测试实战(运维必备)

Linux系统负载全方位监控+压力测试实战(运维必备)

Linux系统负载全方位监控压力测试实战(运维必备) 日常运维工作中,系统负载、CPU、内存、磁盘IO、网络带宽是排查服务器性能问题的核心指标。很多新手只看懂负载数值,却不懂负载原理、不会压测复现、不会故障排查。本文从零讲解Lin…

2026/7/23 7:34:56 阅读更多 →
C++实战100题:从语法到项目的系统训练指南

C++实战100题:从语法到项目的系统训练指南

1. 项目概述:为什么是“100题”? 如果你正在学习C,或者已经学了一阵子但感觉总在语法里打转,写不出像样的东西,那你大概率遇到过这个困境:书看了,视频也刷了,可一打开编辑器&#x…

2026/7/23 7:34:56 阅读更多 →

最新新闻

基于RWEQ模型的2000-2025年中国逐年250米分辨率防风固沙量数据集

基于RWEQ模型的2000-2025年中国逐年250米分辨率防风固沙量数据集

摘要本数据集基于修正风蚀方程模型(RWEQ)生成,空间分辨率为250米,时间跨度为2000年至2025年,逐年提供了中国区域的防风固沙量空间分布信息。数据生产主要利用了同期遥感影像、气象、土壤、地形及土地利用等数据作为模型…

2026/7/23 14:38:02 阅读更多 →
Claude Code v2.1.199版本更新解析与性能优化

Claude Code v2.1.199版本更新解析与性能优化

1. Claude Code v2.1.199 版本更新深度解析 作为一名长期跟踪AI开发工具的技术博主,我第一时间对Claude Code的最新v2.1.199版本进行了全面测试。这次更新主要针对三个核心痛点进行了优化,这些改进看似细微,却实实在在地提升了开发体验。 1…

2026/7/23 14:38:02 阅读更多 →
AI量表生成技术:革新问卷设计效率与质量

AI量表生成技术:革新问卷设计效率与质量

1. 项目背景与核心价值去年帮心理学系做抑郁量表调研时,我深刻体会到传统问卷设计的痛苦——从文献综述到题目编制花了整整3天,结果信效度检验还不达标。最近接触到虎贲等考AI的学术量表生成功能,实测用20分钟就能产出符合心理测量学标准的问…

2026/7/23 14:38:02 阅读更多 →
UE5行为树实战指南:从巡逻AI到战斗系统开发

UE5行为树实战指南:从巡逻AI到战斗系统开发

1. 项目概述:为什么是UE5行为树? 如果你正在用虚幻引擎5(UE5)做游戏,尤其是涉及到任何形式的NPC、敌人或者伙伴,那么“行为树”这个词你肯定绕不过去。它不像蓝图那样直观地连接节点,也不像C那样…

2026/7/23 14:38:02 阅读更多 →
Composer 相关。

Composer 相关。

安装 curl -sS https://getcomposer.org/installer | php mv composer.phar /usr/bin/composer#composer退回到指定版本命令 sudo composer self-update 2.9.5 Composer1 早就停止维护,2025 年更是彻底无法使用,Composer2 向下兼容老旧包&#xff0c…

2026/7/23 14:38:02 阅读更多 →
生鲜视觉落地难题怎么破 | 果蔬图像数据集助力YOLO目标检测研发

生鲜视觉落地难题怎么破 | 果蔬图像数据集助力YOLO目标检测研发

生鲜视觉落地难题怎么破 | 果蔬图像数据集助力YOLO目标检测研发 | 果蔬数据集 | 目标检测 |YOLO格式 #深度学习 #目标检测 #YOLO数据集 #智慧农业 #果蔬识别 #计算机视觉清晨6点,华东某生鲜配送中心的分拣车间已经开工。分拣员依靠肉眼区分数十种果蔬品类&#xf…

2026/7/23 14:37:00 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻