深度 | OpenAI 甩出 722 篇数学论文,但黎曼猜想并没有被证明
深度 | OpenAI 甩出 722 篇数学论文但黎曼猜想并没有被证明OpenAI 这次放出的东西规模大到让「读」这件事本身成了问题722 篇手稿、372 个成果族、横跨 17 个数学方向全部塞进github.com/openai/math一个仓库。但翻完最受关注的那几篇你会发现一个更值得说的事被喊得最响的「黎曼、霍奇、BSD 全上阵」一个都没被真正证明。上图github.com/openai/math 仓库页面截图2026-10-08 —— 本文所有篇数与编号均可在此仓库核对图注日期为抓取日仓库内容以访问时为准。中文媒体的标题先给这件事定了调。量子位写「黎曼霍奇BSD全上阵」新智元跟着起哄还有一家直接写成「准黎曼猜想已被证明」。机器之心、今日头条、投中网这三家则老实得多标题里老老实实写着「准黎曼猜想」。这一个「准」字的差别就是整场风波的全部。那个「准」字才是关键先说被传得最神的那条。OpenAI 声称证明了黎曼 zeta 函数和所有狄利克雷 L 函数在 Re(s) 7/8 的右半平面里没有零点编号 F003据说已经用 Lean 4 形式化另有一篇独立证明给了更弱的 Re(s) 11/12 版本顺带排除了 Landau–Siegel 零点那篇经过人工编辑重写。而黎曼猜想要的是 Re(s) 1/2整条临界带。7/8 离 1/2 隔着好大一段最难啃的区域一点没碰。所以这条结果即便全对也只是朝黎曼猜想迈了一步。罗格斯大学的 Alex Kontorovich 在 X 上那句「如果是人做的这就是即时菲尔兹奖」恰恰是从反面说明问题这个「准」字里藏着的份量全压在一条弱化版上。BSD 是「条件版」。F002 声称对 Selmer 群余秩 0 或 1 的椭圆曲线证明了完整的 leading-term 公式连 Tate–Shafarevich 群有限性都包进去了F006 则声称证明了二次扭曲下的 Goldfeld 猜想。两者一拼覆盖的是「每个有理椭圆曲线里密度为一的那批二次扭曲」不是任意椭圆曲线所以完整 BSD 依旧开着而且这两篇都没形式化。霍奇更直接OpenAI 证的是 CM 阿贝尔簇和 K3 曲面乘积上的有理霍奇猜想F032未形式化。CM 阿贝尔簇是一类对称性极高的特殊对象离「任意光滑射影簇」的完整霍奇猜想隔得还很远。上图三大「全上阵」的猜想实际证到的都是更窄、更弱的版本。反倒是一些名气小得多的结果更值得信。机器之心和 36氪挑出的「最重 30 道名题」里有 LRLBPL、唯一博弈猜想、有理数域上的希尔伯特第十问题还有「π 的无理性测度等于 2」「卡塔兰常数是无理数」这种小而硬、且已经 Lean 形式化的结论。它们的话题性远不如黎曼霍奇但形式化完整、容易核对可信度反而最高。722 篇是怎么来的又怎么算「合格」这批手稿都出自一个没发布、没名字的内部模型。它被投喂了约 4000 个开放问题平均每个保留下来的结果花约 3 小时 ChatGPT Pro 级别的「思考」算力。产出之后OpenAI 给它们的「合格证」分了档仓库里的formalization.yaml列了 162 篇主结果经过 Lean 形式化按成果族算约六成附了 Lean 说明页。但几个最抓眼球的恰好都不在形式化名单里BSD 的 F002/F006、CM 霍奇的 F032、4D 挂谷的 F074、希尔伯特第十问题的 F004。OpenAI 自己也承认未形式化的结果「可能包含错误」只能算「声称」。这里有个容易被忽略的边界Lean 只证明「我证的那个命题成立」不证明「那个命题就是你嘴里那个著名猜想」。机器核对的是推理内部一致核对不了命题和原开放问题是不是一回事这步还是得人来。所以「Lean 通过」不等于「问题解决」尤其当模型可能把命题悄悄改弱的时候。至于独立验证答案是零722 篇没有一篇经过正式同行评审仓库关了 Issues、PR 只对协作者开放外部没有公开质疑的入口。数学界被要求接住的是一份七百多篇、大半未经机器校验、全部未经人工评审的「声称包」。上图从「声称」到「定理」中间隔着一整条还没走完的验证链。数学界为什么没有欢呼只有联名信一个月前的那桩前科把这次的信任提前透支了。9 月 8 日OpenAI 宣布内部模型「解决」了 Navier–Stokes 千禧年难题约一万个智能体跑了 88 小时结果被指出只解决了带外力的版本克雷数学研究所没发奖OpenAI 自己还拒领了那 100 万美元。NYU 的 Tristan Buckmaster 公开质疑 OpenAI「截胡」了他和 Anthropic 研究员 Levent Alpöge 近一年的未发表成果OpenAI 否认。Terence Tao 把这场竞赛说成「狂热的竞争」担心数学研究被逼进私人公司的黑箱。带着这段前科看 722数学界的反应就不难理解了。陶哲轩发起的公开信《人工智能在数学中的严重错位》9 月 11 日由 25 位菲尔兹奖得主联署邓煜、Peter Scholze 在首批到 9 月 12 日约 2500 名学者署名。陶哲轩的比喻是把未经核验的 AI 结果批量倒出来等于「把生肉尸骸倒在村庄公共餐桌上」哈佛的 Curtis McMullen 则把 OpenAI 说成「发现登山者营地后空投机械登山者抢先登顶」的人。最克制的评价来自 MIT 的 Andrew Sutherland在模型发布、可复现之前这些都该视为「未验证」。挂靠普林斯顿高等研究院的 AGMAI 咨询组成员有 Gowers、De Lellis、Hairer、Witten给这场发布定的调是「理解的开始而非完成」还建议 OpenAI 停止用前沿难题给私有模型当基准OpenAI 没听。上图一个月内从单点突破到批量放出数学界的警惕是逐步升级的。这件事对 AI4S 意味着什么把 722 篇放进 AI 做数学的谱系里位置很清楚。2024 年 DeepMind 的 AlphaProof AlphaGeometry 拿下 IMO 银牌证明 AI 能「做对题」今年 8 月 OpenAI 的「十道数学开放问题」只交 10 题但每题附完整 Lean 4 证书、单题成本约 200 美元。10 月的 722 篇是同一个策略的规模化从「10 题加完整证书」变成「722 篇加约六成形式化、大量未核验」。这里藏着一个产业级的转折。AI 把「提出一个候选证明」的成本压到了 3 小时算力一个但「判断它对不对」的成本一点没降反而因为供给爆炸变得更稀缺。我判断未来几年 AI-for-Math 的胜负手不在「谁的模型证得更多」而在「谁能建立一套让数学界愿意信的验证机制」。Lean 形式化只是半套剩下的半套命题对应、独立复核、可复现OpenAI 至今没交。这条线对国内也有映射。北京 7 月印发的《AI4S 十八条》圈定了高能物理、材料、生命科学等六大领域鼓励的是「AI 做实验、做发现」的实验范式OpenAI 展示的是「AI 做纯数学证明」的证明范式。两条腿里数学恰好是「可验证性」最弱的那条这也解释了 722 的争议为什么能爆到这个程度没有一个「跑个实验就能复现」的出口一切都要回到逐行读证明的人。至于那个「未发布模型」的策略动机值得拆不开放权重、不公开名称却把成果全摊出来一边用结果给模型做能力营销一边用热度招人再把验证成本转嫁给整个数学界。The Next Web 的标题点得最准722 篇论文来自一个它不肯发布的模型。上图AI-for-Math 的竞争重心正在从「能不能证」转向「能不能被信」。一个月前我还觉得「AI 攻克千禧难题」至少得等上几年结果 OpenAI 一下就把话题顶到了「黎曼猜想」的高度。但拆开看这次真正被打穿的其实不是数学本身而是证明的生产与验证分工产出爆炸了验证的人力一点没变多。看这类新闻我给自己定了三问它证的是不是完整版、有没有机器形式化、有没有人独立验过。三个里有一个是「否」就该标成「声称」而不是「定理」。参考来源OpenAI Math — GitHub 官方仓库一手The most interesting mathematical discoveries in OpenAI’s 722 new papers — New ScientistOpenAI maths release: 722 papers from a model it has not released — The Next Web突发OpenAI一次放出722篇数学成果准黎曼猜想、4D挂谷都在列 — 机器之心翻完OpenAI的722篇数学手稿我们挑出了最重的30道名题 — 36氪How an AI math breakthrough ignited a controversy — Science陶哲轩、邓煜等25位菲尔兹奖得主联名示警 — 知乎专栏

相关新闻

Conda与pip深度解析:环境隔离、依赖管理与面试高频考点

Conda与pip深度解析:环境隔离、依赖管理与面试高频考点

1. 从一次环境崩坏说起:为什么我要重新理解 Conda刚入行那会儿,我对环境管理的认知基本停留在“能跑就行”。项目A用Python 3.8加某个旧版数值库,项目B要Python 3.11配最新框架,我图省事全塞进系统Python里,结果就是某…

2026/10/9 6:16:10 阅读更多 →
测试工程师必备:软件缺陷定位的完整实战思路与方法

测试工程师必备:软件缺陷定位的完整实战思路与方法

测试群里最常看到的一句话,就是开发甩过来一个bug单截图,附一句“我这里复现不了”或者“你给的信息太少了,没法查”。软件测试这行,发现bug只是入门,能把bug分析清楚、定位到具体模块甚至具体代码行,才是拉…

2026/10/9 6:16:10 阅读更多 →
AnyPS5:跨平台应用打包与分发的新思路与实践指南

AnyPS5:跨平台应用打包与分发的新思路与实践指南

1. 项目缘起与核心定位AnyPS5 这个名字第一次出现在我视野里的时候,我正被一堆跨平台构建脚本折腾得焦头烂额。简单来说,这是一个把“任意项目”快速打包成可分发、可运行、可复现的独立产物的工具链思路。它要解决的问题非常具体:你手头有一…

2026/10/9 6:16:10 阅读更多 →

最新新闻

Serverless全栈架构与云服务器运维效率革命:从函数部署到Linux自动化排查

Serverless全栈架构与云服务器运维效率革命:从函数部署到Linux自动化排查

最近几年,只要聊到后端架构和运维,必然绕不开Serverless这个名字。我自己的感受是,很多团队起初只是拿Serverless跑一两个小脚本,但真正把它和全栈架构绑在一起,用一套完整的思路去替代部分云服务器运维工作&#xff0…

2026/10/9 6:44:34 阅读更多 →
基于Java的坦克大战毕业设计:Swing实现与碰撞检测避坑指南

基于Java的坦克大战毕业设计:Swing实现与碰撞检测避坑指南

简介:这是一份基于Java Swing的坦克大战游戏开发毕业设计资源,面向计算机相关专业毕业生、Java入门者及游戏开发爱好者,主要解决毕业设计选题、程序实现与论文撰写等需求。压缩包内含毕业论文、完整Java源码和答辩PPT,大小约1.46M…

2026/10/9 6:44:34 阅读更多 →
Serverless全栈架构实战:云服务器运维效率革命

Serverless全栈架构实战:云服务器运维效率革命

"Serverless全栈架构,云服务器运维效率革命"——说实话,我第一眼看到这个标题的时候,心里咯噔了一下。"革命"这个词在运维圈已经被用滥了,但真正把Serverless玩明白、从传统云服务器运维里跳出来的人&#xf…

2026/10/9 6:44:33 阅读更多 →
COMSOL复现平带合并BIC:光子晶体高Q模式仿真指南

COMSOL复现平带合并BIC:光子晶体高Q模式仿真指南

两个星期前,我在COMSOL里把一组光子晶体能带算完,盯着Q因子随孔半径的演化曲线看了很久。原因很简单:我复现的那个结构,在某个特定的几何参数下,两条原本各司其职的BIC在Γ点合并成一条,模式Q因子瞬间抬升了…

2026/10/9 6:44:33 阅读更多 →
铃木退出中国后的全球化翻身:小型车战略与市场选择的启示

铃木退出中国后的全球化翻身:小型车战略与市场选择的启示

铃木退出中国那年,很多人觉得它“混不下去了”。2018年,长安铃木股权变更尘埃落定,日方正式抽身,一家长安汽车代工,贴牌“铃木”卖了一段时间,最后彻底熄火。当时媒体标题清一色是“又一个日系品牌败走中国…

2026/10/9 6:44:33 阅读更多 →
Spring Boot抗疫资源调配平台毕设实战:从设计到部署全解析

Spring Boot抗疫资源调配平台毕设实战:从设计到部署全解析

先交代一下背景,我自己带了三年毕业设计,Spring Boot 这套东西接触得比较早,从早期的 SSM 一路走到 Spring Boot Vue 的前后端分离,踩过的坑不算少。这次拿到“Springboot抗疫资源调配平台”这个题目,第一反应是从需求…

2026/10/9 6:43:33 阅读更多 →

日新闻

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API这个话题,隔三差五就会在群里被翻出来讨论一次。上周还有个同事线上处理一个订单超时问题,排查到最后发现是ZonedDateTime序列化后时区丢了,用户在下单当天晚上看到的时间整整差了8个小时。这类问题几乎每个做Java开发的人都遇到过…

2026/10/9 0:00:49 阅读更多 →
EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

前几个月我手头有好几台机器需要互相访问:办公室台式机、家里 NAS、还有一台云主机。如果只是偶尔传个文件倒还好,问题是工作场景经常要在几处环境之间来回切换,每次都先登录跳板机再层层代理,实在折腾。我先后试过端口映射、自建…

2026/10/9 0:00:49 阅读更多 →
AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent 这个词在过去一年里被反复提及,但真正动手搭过一套能跑起来的 Agent 系统的人都知道,从"知道它是什么"到"让它稳定干活"之间隔着一整套工程决策。我前后参与过几个 Agent 项目的落地,从最初用现成框架拼装&…

2026/10/9 0:01:50 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:32 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:40 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 10:10:36 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 21:13:17 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:17 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 6:17:20 阅读更多 →