深度 | OpenAI 甩出 722 篇数学论文但黎曼猜想并没有被证明OpenAI 这次放出的东西规模大到让「读」这件事本身成了问题722 篇手稿、372 个成果族、横跨 17 个数学方向全部塞进github.com/openai/math一个仓库。但翻完最受关注的那几篇你会发现一个更值得说的事被喊得最响的「黎曼、霍奇、BSD 全上阵」一个都没被真正证明。上图github.com/openai/math 仓库页面截图2026-10-08 —— 本文所有篇数与编号均可在此仓库核对图注日期为抓取日仓库内容以访问时为准。中文媒体的标题先给这件事定了调。量子位写「黎曼霍奇BSD全上阵」新智元跟着起哄还有一家直接写成「准黎曼猜想已被证明」。机器之心、今日头条、投中网这三家则老实得多标题里老老实实写着「准黎曼猜想」。这一个「准」字的差别就是整场风波的全部。那个「准」字才是关键先说被传得最神的那条。OpenAI 声称证明了黎曼 zeta 函数和所有狄利克雷 L 函数在 Re(s) 7/8 的右半平面里没有零点编号 F003据说已经用 Lean 4 形式化另有一篇独立证明给了更弱的 Re(s) 11/12 版本顺带排除了 Landau–Siegel 零点那篇经过人工编辑重写。而黎曼猜想要的是 Re(s) 1/2整条临界带。7/8 离 1/2 隔着好大一段最难啃的区域一点没碰。所以这条结果即便全对也只是朝黎曼猜想迈了一步。罗格斯大学的 Alex Kontorovich 在 X 上那句「如果是人做的这就是即时菲尔兹奖」恰恰是从反面说明问题这个「准」字里藏着的份量全压在一条弱化版上。BSD 是「条件版」。F002 声称对 Selmer 群余秩 0 或 1 的椭圆曲线证明了完整的 leading-term 公式连 Tate–Shafarevich 群有限性都包进去了F006 则声称证明了二次扭曲下的 Goldfeld 猜想。两者一拼覆盖的是「每个有理椭圆曲线里密度为一的那批二次扭曲」不是任意椭圆曲线所以完整 BSD 依旧开着而且这两篇都没形式化。霍奇更直接OpenAI 证的是 CM 阿贝尔簇和 K3 曲面乘积上的有理霍奇猜想F032未形式化。CM 阿贝尔簇是一类对称性极高的特殊对象离「任意光滑射影簇」的完整霍奇猜想隔得还很远。上图三大「全上阵」的猜想实际证到的都是更窄、更弱的版本。反倒是一些名气小得多的结果更值得信。机器之心和 36氪挑出的「最重 30 道名题」里有 LRLBPL、唯一博弈猜想、有理数域上的希尔伯特第十问题还有「π 的无理性测度等于 2」「卡塔兰常数是无理数」这种小而硬、且已经 Lean 形式化的结论。它们的话题性远不如黎曼霍奇但形式化完整、容易核对可信度反而最高。722 篇是怎么来的又怎么算「合格」这批手稿都出自一个没发布、没名字的内部模型。它被投喂了约 4000 个开放问题平均每个保留下来的结果花约 3 小时 ChatGPT Pro 级别的「思考」算力。产出之后OpenAI 给它们的「合格证」分了档仓库里的formalization.yaml列了 162 篇主结果经过 Lean 形式化按成果族算约六成附了 Lean 说明页。但几个最抓眼球的恰好都不在形式化名单里BSD 的 F002/F006、CM 霍奇的 F032、4D 挂谷的 F074、希尔伯特第十问题的 F004。OpenAI 自己也承认未形式化的结果「可能包含错误」只能算「声称」。这里有个容易被忽略的边界Lean 只证明「我证的那个命题成立」不证明「那个命题就是你嘴里那个著名猜想」。机器核对的是推理内部一致核对不了命题和原开放问题是不是一回事这步还是得人来。所以「Lean 通过」不等于「问题解决」尤其当模型可能把命题悄悄改弱的时候。至于独立验证答案是零722 篇没有一篇经过正式同行评审仓库关了 Issues、PR 只对协作者开放外部没有公开质疑的入口。数学界被要求接住的是一份七百多篇、大半未经机器校验、全部未经人工评审的「声称包」。上图从「声称」到「定理」中间隔着一整条还没走完的验证链。数学界为什么没有欢呼只有联名信一个月前的那桩前科把这次的信任提前透支了。9 月 8 日OpenAI 宣布内部模型「解决」了 Navier–Stokes 千禧年难题约一万个智能体跑了 88 小时结果被指出只解决了带外力的版本克雷数学研究所没发奖OpenAI 自己还拒领了那 100 万美元。NYU 的 Tristan Buckmaster 公开质疑 OpenAI「截胡」了他和 Anthropic 研究员 Levent Alpöge 近一年的未发表成果OpenAI 否认。Terence Tao 把这场竞赛说成「狂热的竞争」担心数学研究被逼进私人公司的黑箱。带着这段前科看 722数学界的反应就不难理解了。陶哲轩发起的公开信《人工智能在数学中的严重错位》9 月 11 日由 25 位菲尔兹奖得主联署邓煜、Peter Scholze 在首批到 9 月 12 日约 2500 名学者署名。陶哲轩的比喻是把未经核验的 AI 结果批量倒出来等于「把生肉尸骸倒在村庄公共餐桌上」哈佛的 Curtis McMullen 则把 OpenAI 说成「发现登山者营地后空投机械登山者抢先登顶」的人。最克制的评价来自 MIT 的 Andrew Sutherland在模型发布、可复现之前这些都该视为「未验证」。挂靠普林斯顿高等研究院的 AGMAI 咨询组成员有 Gowers、De Lellis、Hairer、Witten给这场发布定的调是「理解的开始而非完成」还建议 OpenAI 停止用前沿难题给私有模型当基准OpenAI 没听。上图一个月内从单点突破到批量放出数学界的警惕是逐步升级的。这件事对 AI4S 意味着什么把 722 篇放进 AI 做数学的谱系里位置很清楚。2024 年 DeepMind 的 AlphaProof AlphaGeometry 拿下 IMO 银牌证明 AI 能「做对题」今年 8 月 OpenAI 的「十道数学开放问题」只交 10 题但每题附完整 Lean 4 证书、单题成本约 200 美元。10 月的 722 篇是同一个策略的规模化从「10 题加完整证书」变成「722 篇加约六成形式化、大量未核验」。这里藏着一个产业级的转折。AI 把「提出一个候选证明」的成本压到了 3 小时算力一个但「判断它对不对」的成本一点没降反而因为供给爆炸变得更稀缺。我判断未来几年 AI-for-Math 的胜负手不在「谁的模型证得更多」而在「谁能建立一套让数学界愿意信的验证机制」。Lean 形式化只是半套剩下的半套命题对应、独立复核、可复现OpenAI 至今没交。这条线对国内也有映射。北京 7 月印发的《AI4S 十八条》圈定了高能物理、材料、生命科学等六大领域鼓励的是「AI 做实验、做发现」的实验范式OpenAI 展示的是「AI 做纯数学证明」的证明范式。两条腿里数学恰好是「可验证性」最弱的那条这也解释了 722 的争议为什么能爆到这个程度没有一个「跑个实验就能复现」的出口一切都要回到逐行读证明的人。至于那个「未发布模型」的策略动机值得拆不开放权重、不公开名称却把成果全摊出来一边用结果给模型做能力营销一边用热度招人再把验证成本转嫁给整个数学界。The Next Web 的标题点得最准722 篇论文来自一个它不肯发布的模型。上图AI-for-Math 的竞争重心正在从「能不能证」转向「能不能被信」。一个月前我还觉得「AI 攻克千禧难题」至少得等上几年结果 OpenAI 一下就把话题顶到了「黎曼猜想」的高度。但拆开看这次真正被打穿的其实不是数学本身而是证明的生产与验证分工产出爆炸了验证的人力一点没变多。看这类新闻我给自己定了三问它证的是不是完整版、有没有机器形式化、有没有人独立验过。三个里有一个是「否」就该标成「声称」而不是「定理」。参考来源OpenAI Math — GitHub 官方仓库一手The most interesting mathematical discoveries in OpenAI’s 722 new papers — New ScientistOpenAI maths release: 722 papers from a model it has not released — The Next Web突发OpenAI一次放出722篇数学成果准黎曼猜想、4D挂谷都在列 — 机器之心翻完OpenAI的722篇数学手稿我们挑出了最重的30道名题 — 36氪How an AI math breakthrough ignited a controversy — Science陶哲轩、邓煜等25位菲尔兹奖得主联名示警 — 知乎专栏