MModelspectra独立 AI 模型情报
前沿研究简报 · 2026.09.10
前沿研究简报 · AI 与数学

88 小时、一万个智能体与一道千禧年难题
声明、Lean 证明,与其背后的功劳之争

2026 年 9 月 8 日上午,OpenAI 宣布:约一万个自主 AI 智能体,运行在一款其称“显著强于 GPT-6 Astra”的未发布内部模型上,找到了三维 Navier–Stokes(纳维–斯托克斯)方程的有限时间爆破,并用 Lean 完成形式化。席卷社交媒体的欢庆叙事只讲了故事的三分之一。本简报刻意补齐其余部分:这一结果当下的确切状态、同日爆发的优先权争议,以及这一事件对“研究如何被做出”、对前沿模型如今如何竞争,究竟释放了什么信号。

数据截至2026.09.10
来源一手材料 + 8 项交叉核对
阅读时长约 15 分钟
立场独立、不站队
01

摘要

三件事同时发生,必须分别打分:一项数学声明、一次优先权碰撞,以及一种全新研究生产方式的演示。

搜索规模
~10,000
Navier–Stokes 小组的并发智能体
此前约 100 个智能体先在无外力 Euler 热身任务上耗时约 50 小时
出结果 / 完成 Lean 用时
88h + 17h
9 月 5 日(周六)出结果,启动后约 88 小时
随后 GPT-6 Astra 用 17 小时完成 Lean 形式化
通信量
4.9M msgs
全部尝试问题合计约 3000 亿输出 token
仅 NS:270 万条消息、约 1300 亿 token

OpenAI 究竟声明了什么

一套内部系统产出了一份解析证明与一份 Lean 形式化,表明:一团初始光滑、静止的流体,在受到光滑外力时,可以在有限时间内发展出奇点,而全过程其总能量始终有界。OpenAI 称这确立了 Charles Fefferman 官方克雷表述中的命题 “C”(以及“D”)——即对全局正则性的反证,而非证明解永远保持光滑。它明确表示不会申领百万美元大奖。

本报告坚持的一条纪律:三种不同状态

状态层含义此处达到?依据
已声明团队/公司宣布一项结果OpenAI 公告 + 约 165 页论文,9 月 8 日
已机器核验证明在 Lean 中被逐步验证,在其选定定义/公理下无逻辑缺口是——但有限度(§04.3)公开 Lean 4 仓库,无 sorry,基于 Mathlib 与标准公理
已被共同体接受独立复现、同行评审、合格发表、成立两年、广泛接受尚未——且远未达到克雷官网仍将该题列为未解
请记住一句话:“能在 Lean 编译”只证明形式化论证自洽;它并不自动证明被形式化的命题就是克雷原题,不证明物理意义,也不代表共同体接受。可审计 ≠ 已被接受。

我们的判断

  • 若成立,其数学重要性:里程碑级——迄今涉及 AI 的最重大结果,也是继庞加莱猜想之后第二个被回应的千禧年难题。
  • 当前确定性:中等,偏向“待验证”。机器核验大幅抬高了下限,但命题等价性、两条团队路线之间的关系以及署名归属仍在厘清中。
  • 范式信号:强。无论这份具体证明能否站住、署名人是谁,“大规模并行智能体搜索 + 形式化验证”已被证明能作用于一道开放的前沿难题——而不只是有已知答案的题。
  • 近期可产品化程度:低。这是一次耗资数百万美元、资本密集、且外部无人能访问其模型的运行——是一台科学仪器,而非按次调用即可购买的 API 能力。
02

11 天时间线

不逐日重建,就无法理解这场争议。单方说法均如实标注。综合自 OpenAI 公告、Buckmaster 声明与 Quanta 报道。

日期(2026)Buckmaster–Alpöge 一方OpenAI 一方
8 月 15 日首次得到 Boussinesq 爆破解
8 月 22 日Euler 证明通过 Lean 验证
8 月 28 日新内部模型开始训练(至今仍在训练)
9 月 1 日听闻“两道千禧年难题已被解决、似乎出自 Anthropic”的传闻;随即对所有开放的千禧年难题启动评估
9 月 3 日Buckmaster 邮件联系 OpenAI 一位资深数学家,澄清这是个人项目、与 Anthropic 无关安排了一次通话
9 月 5 日约一万个智能体得到 NS 结果(周六),启动约 88 小时
9 月 6 日下午两次通话(Bubeck 加入、Alpöge 缺席);Buckmaster 称由此听说存在一份约 100 页的 NS 证明项目与 Lean 验证完成;OpenAI 称随后主动联系、提议同时发布
9 月 7 日午夜前被迫提前挂出 IPM / Boussinesq / 三维 Euler 预印本;Terence Tao(陶哲轩)同日背书该工作
9 月 8 日上午宣布 Navier–Stokes,发布论文与 Lean 仓库(比另一方晚约 12 小时)
9 月 8–9 日Buckmaster 声明提出数据使用与作者署名质疑Bubeck 与 Altman 回应;OpenAI 在受迫 Euler 上让出优先权,否认抄袭与删除署名
来源:OpenAI《On the Navier–Stokes Millennium Prize Problem》(2026-09-08);T. Buckmaster 声明(2026-09-07);Quanta Magazine(2026-09-08);Unite.AI;InfoQ/量子位对 Bubeck 与 Altman 回应的转述。
  • 并非“OpenAI 先发、他人追赶”:另一方关键的、经 Lean 核验的突破可追溯到 8 月中下旬;OpenAI 自己把起点定在 9 月 1 日的传闻。两支团队几乎同时撞上一条非常狭窄、小众的路线。
  • 即便在热身阶段,他们证明的也不是同一命题:在 Euler 上,Buckmaster–Alpöge 证明的是受迫(光滑外力)版本,OpenAI 智能体证明的是无外力版本。在 Navier–Stokes 层面,只有 OpenAI 声称得到完整结果;另一方得到一份未验证的亚耗散 NS 结果,并选择不发布。
  • 在“同期工作”一节,OpenAI 在三维 Euler 上让出优先权——“我们承认他们在受迫 Euler 上的优先权并向其祝贺”——同时把 Navier–Stokes 归于自己。
03

难题:九十年背景

“爆破”在物理上意味着什么,它为何难了九十年,以及为什么它不会让明天的天气预报更准。

3.1 一段话讲清问题

Navier–Stokes 方程把牛顿第二定律(F=ma)应用于被视为连续介质(而非一团分子)的流体,支撑着飞机设计、天气预报与血流研究。方程由 Navier(1822)与 Stokes(1845)写下,一个基本问题却始终未解:给定一团三维、初始无比光滑的不可压缩流体,解会永远规规矩矩,还是某个无穷小流块会在有限时间内无界加速——形成奇点?黏性通常会抑制运动,这正是难点所在:方程必须靠流体自身的动力学爆破,而不是被人为塞进一个无穷大力。OpenAI 的答案是:会——有限时间爆破。

3.2 为什么花了九十年

年份进展性质
1822 / 1845Navier / Stokes方程的现代形式奠基
1934Jean Leray弱解的全局存在性弱解是否光滑/唯一仍未解
1969Ladyzhenskaya维情形的完整解答三维仍开放
1982Caffarelli–Kohn–Nirenberg部分正则性:任何奇点集的一维测度必为零(奇点即便存在也极端稀有)差之毫厘,未竟全功
2000克雷研究所 / Fefferman列为千禧年难题;命题 A/B(光滑)对 C/D(爆破)制度化,百万美元
2013Hou(Caltech)–Luo有限圆柱内部(两半反向旋转)的计算机辅助 Euler 爆破首个严肃的奇点声明
2021–23Córdoba–Martínez-Zoroa不依赖计算机的解析“无限级联”;粗糙外力下的 Euler 爆破两支 AI 团队共同的思想根源
2026.9两支 AI 团队把构造推进到光滑外力;OpenAI 声称抵达 NS 命题 C/D本次事件

Quanta 把最后一道坎讲得最清楚:Córdoba 与 Martínez-Zoroa 构造出无穷序列的非奇异“层”,并把它们组合成一个包含奇点的无限级联。每一层都光滑,但过去把它们叠加后,外力函数会带上不理想的性质——不满足克雷对外力必须光滑的要求。两支 AI 团队都声称跨过的一步,正是造出一个既产生奇点、又仍留下光滑外力的级联。

3.3 爆破长什么样——以及它对工程意味着什么、不意味着什么

被构造出的对象是一个:它向内螺旋、像意面一样被沿轴拉伸;核心越来越细、越转越快,趋于无界,而总能量保持有限。技术上的惊人之处在于:加速度、压力梯度、动量输运与黏性都必须变得很大,却又以极高精度相互抵消,最终只留下一个光滑外力。

先堵住常见误读:这不会直接改进天气预报,也不会防止机翼失速。(1)爆破存在于理想化的连续介质世界;真实流体由分子构成、不可能运动得无限快——逼近奇点之处,恰恰是连续介质近似失效、必须回到粒子描述的地方,OpenAI 自己的公告也承认这一点。(2)它是一个存在性反例(存在某些光滑初值会爆破),并非声称一切流动都会失控。它的价值是概念性的:F=ma 这般简单的定律用到流体上竟如此反直觉——它精确划出了连续介质模型的边界。

04

OpenAI 的证明与方法

一份约 165 页的成文、一份 Lean 4 形式化,以及一群智能体——数字是多少、流水线如何运作,以及 Lean 究竟保证什么、不保证什么。

4.1 关键数字(官方数字与外部估算严格分开)

数值备注 / 口径
底层模型未发布,自 8 月 28 日起训练中,“显著强于 GPT-6 Astra”外部不可访问——过程是黑箱
Euler 热身约 100 个智能体、约 50 小时无外力 Euler 正则性反证
Navier–Stokes 搜索约一万个并发智能体、约 88 小时9 月 5 日周六出结果;运行中途切换到更新模型
Lean 形式化由 GPT-6 Astra 再花 17 小时9 月 6 日项目完成
消息 / token——全部问题490 万条消息、约 3000 亿输出 tokenOpenAI 官方
消息 / token——仅 NS270 万条消息、约 1300 亿输出 tokenOpenAI 官方
产出约 165 页解析证明 + Lean 4公开仓库;无 sorry;Mathlib;标准公理;另设独立“比较器”挑战
算力成本“数百万美元”(S. Bubeck 估算)网上流传的“1500 万美元量级”是个别评论者估算,非官方数字

4.2 方法中真正新颖之处

这不是“把问题敲进模型然后干等”。不同智能体小组被分派不同命题变体——A/B(会得到正则性证明)与 C/D(会得到爆破)——以此显式对冲“押错方向”的风险。智能体可读一份缓存的互联网副本、可运行代码、可在组内通信;Codex 随后在组间“交叉授粉”,整合最有用的中间结果,把更早的 Euler 解作为提示回灌。人的角色是设计搜索空间、分解问题、编排智能体群、判断哪条路有希望,而非亲自推导。OpenAI 甚至说,其团队整体缺乏流体力学的研究级专长,“无法对数学本身做出真正有意义的贡献”——这段自述本身也应带着几分审慎去读。

4.3 Lean 保证什么——以及它替你做不了的那一项核查

Lean 是一个交互式证明助手:命题与证明用形式语言写出,软件检查每一步推理。一份能编译、不用 sorry 占位、且只依赖 Mathlib 与标准公理的证明,在其所选定义与公理之内拥有闭合的逻辑链。这比一份等待评审的手写预印本可靠整整一个档次——也是它与 NS“证明墓地”的本质区别。

Quanta 精确点出要害:“仍须由人完成的那项关键验证,是确保 Lean 中被证明为真的命题,与数学家原本要证的东西逻辑等价。”
  • ① 命题正确性不会自动成立:“光滑外力”“有限能量”“整个 ℝ³ / 环面”的形式化编码,是否与 Fefferman 的 C/D 条件精确吻合,必须由外部专家逐行核查。OpenAI 声称在 ℝ³ 与三维环面上都覆盖了 C 和 D;这恰恰是需要审计之处。
  • ② 它既不证明物理意义,也不证明重要性:机器对结果意味着什么保持沉默,这要由人赋予。
  • ③ 它尚不是共同体接受:外部数学家还没有独立构建并审计该仓库。形式化让结果可审计;可审计 ≠ 已被接受。
还有一个不可复现的部分:产出证明的模型是个未发布的黑箱。世界可以审计产物(论文与 Lean 代码),却无法重跑生产过程。“公开产物 + 黑箱过程”与经典科学可复现性之间的张力是结构性的,它把“某实验室宣布突破”与传统数学发现区分开来。
05

另一半:Buckmaster–Alpöge 与功劳之争

欢庆的信息流里大多只有 OpenAI。另一半则是一场围绕署名、数据使用与学术伦理的公开冲突。我们把两方说法并排呈现、不站队,并标注证据强度。

5.1 另一支团队做了什么

纽约大学教授 Tristan Buckmaster 与数学家 Levent Alpöge——后者受雇于 Anthropic,却极力强调自己以个人身份参与、无机构项目、工具费用出自 Buckmaster 的科研经费——使用 Anthropic Claude、OpenAI Codex、GPT-5.6 Sol 以及后来的 Astra(Astra 仅用于成文与审计),为三个模型方程取得了经 Lean 核验的、带光滑外力的有限时间爆破:不可压缩多孔介质方程(IPM,另与 Matei P. Coiculescu 合作)、二维 Boussinesq 方程组、三维不可压缩 Euler。他们还相信自己得到了亚耗散 Navier–Stokes 的爆破,但因 Lean 验证未完成、也拿不出像样成文而拒绝发布

菲尔兹奖得主 Terence Tao(陶哲轩)在 9 月 7 日写道,称这是沿 Córdoba–Martínez-Zoroa 路线的一次“令人兴奋”/“非凡”进展,把次临界/粗糙外力一路推进到完全光滑,并判断推广到完整 Navier–Stokes“在不久的将来非常可行”、“没有根本性障碍”。他也补了一句值得记住的冷静话:求解只是代理目标,首要价值在于数学理解;缺了理解,NS 正则性问题“其内在意义……远不如大众媒体有时鼓吹的那么大”。

5.2 两支团队一览

维度OpenAI 团队Buckmaster–Alpöge
身份公司内部的企业化攻关个人合作(Alpöge 在 Anthropic,但称非职务行为;工具自费)
使用模型未发布的更强内部模型 + 用于 Lean 的 GPT-6 AstraClaude + Codex + GPT-5.6 Sol + Astra——均为公开可获取
覆盖范围声称完整 NS(C/D);另有无外力 Euler光滑外力 IPM / Boussinesq / 三维 Euler;亚耗散 NS 未完成、未发布
形式化Lean 4,公开仓库经 Lean 核验,公开仓库
成文状态约 165 页的完成稿作者承认仓促发布、有可见的“AI 注水”,并致歉
可复现性产物公开;过程依赖未发布模型全程使用可获取模型;过程相对可追溯
优先权主张让出三维 Euler;主张 NS主张该路线的先发位置;指被催逼

5.3 争议的三层,按证据强度排序

第一层——“OpenAI 是否在泄露后冲刺?”(时间线大体可核查,解读各异)。Buckmaster 称两人的进展一旦泄露便被迫提前发布;OpenAI 承认自己 9 月 1 日才因“Anthropic 解决了”的传闻启动,并在 9 月 6 日完成工作后联系对方、提议同时发布且让对方先发。时间线本身大体可验证——另一方关键结果在 8 月中下旬,OpenAI 的运行在 9 月 1–6 日。

第二层——他们的私人 Codex 草稿是否被用于训练?(核心;正反均无证据;OpenAI 未完全回答)。两人把每份草稿、提示与中间产物都留在 Codex。Buckmaster 的问题从来不是“模型有没有实时读我的会话”,而是“这些会话有没有进入训练/改进流水线”。他说对方告诉他“模型不会调取用户数据”,而他追问训练一事时“没有得到回答”。OpenAI 自己的措辞是:解题时没有访问任何特定用户数据,但“无法排除源自其使用我方产品的去标识化数据帮助改进了我方模型”,尽管其认为可能性很低。

为什么这个问题的意义超出谁对谁错:当研究者持续把未发表成果喂给商业 AI 工具,而其条款在某些设置下可能允许用输入改进模型时,“研究助手”与“潜在竞争者”之间的界线就模糊了。截至撰稿没有证据表明存在定向训练,Buckmaster 本人也说得很直白:“我没有指责任何人任何事。我只是陈述我在何时被告知了什么、又被提议了什么。”

第三层——署名与所谓施压(各执一词;双方都有声明或截图)。Buckmaster 称对方曾向他提出两个方案,其中一个要他单独署名一篇 NS 论文、因 Alpöge 受雇于 Anthropic 而将其排除,并转述了“你为什么要毁掉自己的职业生涯?”之类的话。Bubeck 公开否认曾要求去掉 Alpöge,承认出于知识产权考虑说过“如果 Levent 不是 Anthropic 员工,事情会简单些”,为“糟糕的措辞”道歉并称当场收回,同时反指通话一开始就有诽谤性指控与联系媒体的威胁。Sam Altman 同样表示他本想联合发布、主动提出让对方先发并去角逐大奖,只是无法把同样安排延伸给一名 Anthropic 员工。这一层目前由相互冲突的单方说法构成;诚实的做法是把它们并排放置。

“如果某个 OpenAI 模型确实逼近了 Navier–Stokes,那是件了不起的事,就该由他们大声说出来——同时把完整历史保留下来。”——Tristan Buckmaster,声明(2026-09-07)

5.4 被忽略的“真正英雄”

这场争吵真正澄清的是:两支 AI 团队都站在同样两位人类数学家的肩上——Diego Córdoba(马德里 ICMAT)与 Luis Martínez-Zoroa(CUNEF)。撰写克雷原题的 Fefferman 直言“这个故事的英雄是 Córdoba 和 Martínez-Zoroa”;Buckmaster 写道,Martínez-Zoroa 凭其系列工作配得上一枚菲尔兹奖;Córdoba 则开玩笑说“我不用 AI:我有 Luis”。这个提醒很直白:AI 是沿着人类开辟的小众路线,快速冲过了最后一道技术缺口——它并没有发明这套研究纲领。

06

“解决”了吗?三个层次与历史的耐心

千禧年大奖不会凭一次宣布就颁发。下面是一份重大 AI 证明必须攀登的可信度阶梯——以及它此刻所处的位置。

6.1 克雷规则

候选者必须同时满足三条:(i)在“合格载体”——享有世界声誉的同行评审期刊——发表;(ii)发表后至少成立两年;(iii)获得全球数学界的普遍接受。不接受直接投稿。作为参照:迄今唯一被解决的千禧年难题庞加莱猜想,从 Grigori Perelman 2002 年 11 月预印本到 2010 年 3 月授奖历时七年以上,且他本人拒领。截至撰稿,克雷官网仍把 Navier–Stokes 列为未解,研究所对 OpenAI 的声明既未接受也未拒绝;OpenAI 表示不会申请百万美元,把这次发布定位为“一个时间切片……而非终局”。

已声明——公司公告已达成

论文与公告于 2026 年 9 月 8 日发布。

已机器核验——Lean 验证当前位置

无 sorry、基于 Mathlib 与标准公理可编译。命题等价性仍待人审计。

3
独立复现待完成

外部团队构建该 Lean 仓库,确认形式化与克雷 C/D 吻合。

4
同行评审并在合格载体发表待完成

克雷研究所不接受直接投稿。

5
成立两年 + 共同体广泛接受待完成

到那时——且只有那时——才有 CMI 的认定/大奖(OpenAI 已表示不申领)。

6.2 为什么学界缓慢、程序化的谨慎是对的

Navier–Stokes 是著名的“证明墓地”:不止一份宣布过的解答后来在审视下崩塌——Otelbaev 2014 年的声明就被 Tao 等人公开追踪、最终判定无法挽救。面对一份来自非传统渠道、裹着商业与优先权争议的 165 页证明,学界“独立构建 Lean、慢慢读、暂不下结论”的本能不是保守,而是让数学保持可靠的机制。

应当使用的精确措辞:现在说“第二个千禧年难题已被解决”为时尚早。准确的句子是:“OpenAI 给出了一份有限时间爆破证明及其 Lean 形式化,尚待独立验证与同行评审。”
07

AI 做数学:三次跃迁,2024–2026

把这一事件放进 AI 做数学的短暂历史,就能看清跳跃发生在哪——它是问题类型的跳跃,而且跳了两次。

时间系统 / 实验室结果问题类型形式化?
2024.01AlphaGeometry(DeepMind)IMO-AG-30 几何 25/30有标准答案的竞赛题神经符号
2024.07AlphaProof + AlphaGeometry 2(DeepMind)解出 2024 IMO 六题中的四题;28/42、银牌水平(发表于 Nature竞赛题Lean
2025.07Gemini Deep Think(Google);OpenAI 纯 LLM 路线两者均达 IMO 金牌水准;后者不用 Lean/空间 RL竞赛题部分
2026.05AlphaProof Nexus(DeepMind)一次拿下九道开放的 Erdős 难题(一道沉寂 56 年),另提出 OEIS 猜想已知的开放研究问题已形式化
2026.09OpenAI 智能体群;Buckmaster–Alpöge声称抵达千禧年级别的开放 NS 难题;光滑外力模型方程无现成路径的开放前沿——构造反例并验证之Lean 4
  • 第一次跃迁(2024):有标准答案的奥赛题上达到奖牌级——考的是解题能力。
  • 第二次跃迁(2025–2026 上半年):开始碰已知的开放问题(Erdős 遗产)——考的是在人类已测绘的地形内推进。
  • 第三次跃迁(2026.09):面对没有现成路径的开放前沿,甚至要在相反方向(证光滑 vs 构造爆破)之间下注,以超大并行度搜索、再形式化验证——考的是帮助开辟新地形
每一次跃迁都适用 §05.4 的常量:AI 负责高速搜索与补全;人设定纲领、定义问题、判断价值并提供理解。无限级联这条路线,又是十年的人类工作。
08

范式与产业意涵

作为模型评估与选型机构,Modelspectra 最关心的部分:对研究、对前沿竞争、对采购分别改变了什么。

8.1 研究生产函数改变:稀缺性从“求解”移向“提问”与“编排”

当一万个智能体可以并行尝试数百条证明路径,稀缺资源便不再是苦熬冗长推导,而是另一端:把模糊的科学问题重述成机器可搜索、可验证的形态(Tao 所谓“好问题成为稀缺资源”);设计搜索空间(A/B/C/D 变体、更易的热身、跨组授粉);以形式化为兜底,同时由人完成最难的一步——确认“形式化问题=真实问题”;以及把机器产出的“AI 注水”改写成共同体可读、可继承的论证——Buckmaster 为粗糙草稿致歉,正说明这一步无法跳过。高价值研究角色越来越像研究产品经理 + 智能体群指挥 + 形式化审计员,而非孤独的推导者。

8.2 前沿竞争的新赛场:不是聊天分数,而是“真正前沿处谁被依赖”

  • 两条路线都重度依赖 Anthropic Claude 与 OpenAI Codex / GPT-5.6 Sol / GPT-6 Astra,外加 OpenAI 未发布的下一代模型。在最难的智能体长程任务——多文件、长链条、持续自我验证——上,研究者用脚投票真正选了哪些工具,比任何聊天基准都更说明问题。
  • 这一事件重新命名的决定性能力轴:长程智能体稳定性、大规模多智能体编排、与形式化/代码工具的协同、产出的可验证性,以及模型代际迭代速度(OpenAI 刻意点出一款“显著强于 GPT-6 Astra、仍在训练”的内部模型——既是能力预告,也是商业信号)。
  • 对模型选型:除静态分数外,还要评估长程任务完成度、工具/验证链协同,以及可控、可审计的产出。同时清醒认识到:顶级研究能力,与企业能买到的商用模型之间,隔着一个代际与一次发布滞后。

8.3 一台资本密集的科学仪器——尚非廉价 API 能力

数百万美元、约一万并发智能体、约 1300 亿输出 token、88 小时,再加一款你买不到的未发布模型:这更像在粒子对撞机上跑实验,而非调用 API。它短期内不会成为中小企业用得起的标准服务。最先、也远更确定被产品化的,是流水线被拆解后的部件:形式验证工具、代码/研究智能体编排框架、可审计的研究协作环境,以及垂直的“多智能体搜索 + 验证”工作流。

8.4 规则真空:署名、数据与可复现规范落后于能力

  • 作者与功劳:功劳如何在模型、造模型的公司、驾驭智能体的研究者,以及开辟路线的人之间分配?当参与者效力于竞争对手时,联合发布又如何可能?
  • 数据边界:厂商能否、以及在何种退出设置下,可用喂入其工具的未发表成果改进模型,这需要比现状清晰得多的默认规则与技术保障。
  • 可复现性:当关键结果依赖未发布模型,共同体如何独立重复?“公开产物 + 黑箱过程”足以构成一项发现吗?
  • 评价体系:当机器核验证明成为常态,同行评审、期刊、招聘与奖项都要被重新设计。

这些都不会因这一次事件而定论,但它像一次压力测试,提前把账单递到了整个学术与产业系统面前。

09

结论与观察清单

回到核心判断,再列出可证伪的跟踪信号。

2026 年 9 月第一周,真正跨过门槛的不是“AI 解决了一道千禧年难题”这个结果,而是生产方式本身——大规模并行智能体搜索、以形式化验证为兜底、由人定义问题——第一次在一道千禧年级别的开放问题上跑通完整闭环。

对数学结果本身,我们建议与学界同样的耐心与不可知:Lean 背书给了它很高的下限,但在独立复现、命题等价性审计、同行评审与两年考验之前,严谨措辞仍是“一份待验证的证明”,克雷页面仍写着未解。优先权与数据之争应交给证据;眼下它至多是两份并排而立的说法。

观察清单(可证伪)

  • 独立构建:是否有外部团队成功编译 OpenAI 的 Lean 仓库,并逐行验证其形式化定义与 Fefferman 官方 C/D 等价?
  • 专家解读:领域内数学家(Córdoba、Martínez-Zoroa、Silvestre、Tao 等)的公开判断。
  • 路线收敛:两人的受迫 Euler / 亚耗散 NS,与 OpenAI 的无外力 Euler / 完整 NS,最终会被证明是同一条路、还是实质不同?
  • 在公开模型上复现:这套智能体群攻势能在任何人都能访问的模型(而非 OpenAI 未发布模型)上重跑吗?这决定范式的可迁移性。
  • 克雷的立场:“未解”标签是否、何时改变。
  • 数据/署名的新证据:邮件、对 Codex 数据条款的权威解读,以及任何能把单方说法变成可核查事实的东西。
证伪条件:若发现形式化定义与克雷原题不符,或证明暗藏额外假设,“解决千禧年难题”的说法就必须大幅收回。若该过程无法在公开模型上复现,其“范式”地位就从一种新生产方式,降级为一次性、资本密集的演示。

给从业者三个更确定的结论:能力信号是真实的——“AI 只会做习题、不会做研究”已经过时;人的角色改变了,却更具决定性——好问题、搜索空间设计、等价性核查与人类可读的洞见才是护城河;面向市场则要拆解并管理预期——完整运行是资本密集的仪器,而验证、编排与审计才是最先产品化的部件,同时应以长程智能体、工具协同与可验证产出来评判模型。

附录

资料来源与方法

OpenAI 公告是一方的一手来源;Buckmaster 声明与 Tao 博客是另一方的一手来源;Quanta 是骨干第三方交叉核对。访问于 2026-09-09/10。

来源类型用于
OpenAI — On the Navier–Stokes Millennium Prize Problem (2026-09-08)厂商一手过程数字、命题 C/D、“同期工作”、去标识化数据措辞
T. Buckmaster — public statement (2026-09-07)第一人称一手接触时间线、数据使用与署名质疑、三份预印本范围
Terence Tao — blog post (2026-09-07)第一人称、顶尖数学家对路线的评估、“代理目标”提醒、Lean 可行性
Quanta Magazine — K. Kakaes (2026-09-08)独立第三方时间线、Córdoba–Martínez-Zoroa 路线、Lean 的边界、Fefferman/Córdoba 引述
Clay Mathematics Institute — Millennium Prize rules主管机构三项认定条件;两年规则
Unite.AI — Buckmaster/Alpöge preprints and disputed contacts (2026-09-08)行业媒体三份预印本技术细节;通话/署名时间线
InfoQ / 36Kr relay — "the AI-conquers-a-Millennium-Problem show becomes an OpenAI–Anthropic fight" (2026-09-09)媒体Bubeck 与 Altman 的完整回应
MIT Technology Review (Chinese); Scientific American; The Paper (Pengpai); National Business Daily relays媒体交叉核对页数、消息/token 数字、“另一方领先”的叙事框架
DeepMind (AlphaGeometry/AlphaProof, Nature 2024–25); Gemini Deep Think IMO-gold announcement (2025-07); AlphaProof Nexus coverage (2026-05)厂商 + 期刊§07 的 AI 做数学里程碑表