88 小时、一万个智能体与一道千禧年难题
声明、Lean 证明,与其背后的功劳之争
2026 年 9 月 8 日上午,OpenAI 宣布:约一万个自主 AI 智能体,运行在一款其称“显著强于 GPT-6 Astra”的未发布内部模型上,找到了三维 Navier–Stokes(纳维–斯托克斯)方程的有限时间爆破,并用 Lean 完成形式化。席卷社交媒体的欢庆叙事只讲了故事的三分之一。本简报刻意补齐其余部分:这一结果当下的确切状态、同日爆发的优先权争议,以及这一事件对“研究如何被做出”、对前沿模型如今如何竞争,究竟释放了什么信号。
摘要
三件事同时发生,必须分别打分:一项数学声明、一次优先权碰撞,以及一种全新研究生产方式的演示。
此前约 100 个智能体先在无外力 Euler 热身任务上耗时约 50 小时
随后 GPT-6 Astra 用 17 小时完成 Lean 形式化
仅 NS:270 万条消息、约 1300 亿 token
OpenAI 究竟声明了什么
一套内部系统产出了一份解析证明与一份 Lean 形式化,表明:一团初始光滑、静止的流体,在受到光滑外力时,可以在有限时间内发展出奇点,而全过程其总能量始终有界。OpenAI 称这确立了 Charles Fefferman 官方克雷表述中的命题 “C”(以及“D”)——即对全局正则性的反证,而非证明解永远保持光滑。它明确表示不会申领百万美元大奖。
本报告坚持的一条纪律:三种不同状态
| 状态层 | 含义 | 此处达到? | 依据 |
|---|---|---|---|
| 已声明 | 团队/公司宣布一项结果 | 是 | OpenAI 公告 + 约 165 页论文,9 月 8 日 |
| 已机器核验 | 证明在 Lean 中被逐步验证,在其选定定义/公理下无逻辑缺口 | 是——但有限度(§04.3) | 公开 Lean 4 仓库,无 sorry,基于 Mathlib 与标准公理 |
| 已被共同体接受 | 独立复现、同行评审、合格发表、成立两年、广泛接受 | 尚未——且远未达到 | 克雷官网仍将该题列为未解 |
我们的判断
- 若成立,其数学重要性:里程碑级——迄今涉及 AI 的最重大结果,也是继庞加莱猜想之后第二个被回应的千禧年难题。
- 当前确定性:中等,偏向“待验证”。机器核验大幅抬高了下限,但命题等价性、两条团队路线之间的关系以及署名归属仍在厘清中。
- 范式信号:强。无论这份具体证明能否站住、署名人是谁,“大规模并行智能体搜索 + 形式化验证”已被证明能作用于一道开放的前沿难题——而不只是有已知答案的题。
- 近期可产品化程度:低。这是一次耗资数百万美元、资本密集、且外部无人能访问其模型的运行——是一台科学仪器,而非按次调用即可购买的 API 能力。
11 天时间线
不逐日重建,就无法理解这场争议。单方说法均如实标注。综合自 OpenAI 公告、Buckmaster 声明与 Quanta 报道。
| 日期(2026) | Buckmaster–Alpöge 一方 | OpenAI 一方 |
|---|---|---|
| 8 月 15 日 | 首次得到 Boussinesq 爆破解 | — |
| 8 月 22 日 | Euler 证明通过 Lean 验证 | — |
| 8 月 28 日 | — | 新内部模型开始训练(至今仍在训练) |
| 9 月 1 日 | — | 听闻“两道千禧年难题已被解决、似乎出自 Anthropic”的传闻;随即对所有开放的千禧年难题启动评估 |
| 9 月 3 日 | Buckmaster 邮件联系 OpenAI 一位资深数学家,澄清这是个人项目、与 Anthropic 无关 | 安排了一次通话 |
| 9 月 5 日 | — | 约一万个智能体得到 NS 结果(周六),启动约 88 小时 |
| 9 月 6 日 | 下午两次通话(Bubeck 加入、Alpöge 缺席);Buckmaster 称由此听说存在一份约 100 页的 NS 证明 | 项目与 Lean 验证完成;OpenAI 称随后主动联系、提议同时发布 |
| 9 月 7 日午夜前 | 被迫提前挂出 IPM / Boussinesq / 三维 Euler 预印本;Terence Tao(陶哲轩)同日背书该工作 | — |
| 9 月 8 日上午 | — | 宣布 Navier–Stokes,发布论文与 Lean 仓库(比另一方晚约 12 小时) |
| 9 月 8–9 日 | Buckmaster 声明提出数据使用与作者署名质疑 | Bubeck 与 Altman 回应;OpenAI 在受迫 Euler 上让出优先权,否认抄袭与删除署名 |
- 并非“OpenAI 先发、他人追赶”:另一方关键的、经 Lean 核验的突破可追溯到 8 月中下旬;OpenAI 自己把起点定在 9 月 1 日的传闻。两支团队几乎同时撞上一条非常狭窄、小众的路线。
- 即便在热身阶段,他们证明的也不是同一命题:在 Euler 上,Buckmaster–Alpöge 证明的是受迫(光滑外力)版本,OpenAI 智能体证明的是无外力版本。在 Navier–Stokes 层面,只有 OpenAI 声称得到完整结果;另一方得到一份未验证的亚耗散 NS 结果,并选择不发布。
- 在“同期工作”一节,OpenAI 在三维 Euler 上让出优先权——“我们承认他们在受迫 Euler 上的优先权并向其祝贺”——同时把 Navier–Stokes 归于自己。
难题:九十年背景
“爆破”在物理上意味着什么,它为何难了九十年,以及为什么它不会让明天的天气预报更准。
3.1 一段话讲清问题
Navier–Stokes 方程把牛顿第二定律(F=ma)应用于被视为连续介质(而非一团分子)的流体,支撑着飞机设计、天气预报与血流研究。方程由 Navier(1822)与 Stokes(1845)写下,一个基本问题却始终未解:给定一团三维、初始无比光滑的不可压缩流体,解会永远规规矩矩,还是某个无穷小流块会在有限时间内无界加速——形成奇点?黏性通常会抑制运动,这正是难点所在:方程必须靠流体自身的动力学爆破,而不是被人为塞进一个无穷大力。OpenAI 的答案是:会——有限时间爆破。
3.2 为什么花了九十年
| 年份 | 谁 | 进展 | 性质 |
|---|---|---|---|
| 1822 / 1845 | Navier / Stokes | 方程的现代形式 | 奠基 |
| 1934 | Jean Leray | 弱解的全局存在性 | 弱解是否光滑/唯一仍未解 |
| 1969 | Ladyzhenskaya | 两维情形的完整解答 | 三维仍开放 |
| 1982 | Caffarelli–Kohn–Nirenberg | 部分正则性:任何奇点集的一维测度必为零(奇点即便存在也极端稀有) | 差之毫厘,未竟全功 |
| 2000 | 克雷研究所 / Fefferman | 列为千禧年难题;命题 A/B(光滑)对 C/D(爆破) | 制度化,百万美元 |
| 2013 | Hou(Caltech)–Luo | 有限圆柱内部(两半反向旋转)的计算机辅助 Euler 爆破 | 首个严肃的奇点声明 |
| 2021–23 | Córdoba–Martínez-Zoroa | 不依赖计算机的解析“无限级联”;粗糙外力下的 Euler 爆破 | 两支 AI 团队共同的思想根源 |
| 2026.9 | 两支 AI 团队 | 把构造推进到光滑外力;OpenAI 声称抵达 NS 命题 C/D | 本次事件 |
Quanta 把最后一道坎讲得最清楚:Córdoba 与 Martínez-Zoroa 构造出无穷序列的非奇异“层”,并把它们组合成一个包含奇点的无限级联。每一层都光滑,但过去把它们叠加后,外力函数会带上不理想的性质——不满足克雷对外力必须光滑的要求。两支 AI 团队都声称跨过的一步,正是造出一个既产生奇点、又仍留下光滑外力的级联。
3.3 爆破长什么样——以及它对工程意味着什么、不意味着什么
被构造出的对象是一个涡:它向内螺旋、像意面一样被沿轴拉伸;核心越来越细、越转越快,趋于无界,而总能量保持有限。技术上的惊人之处在于:加速度、压力梯度、动量输运与黏性都必须变得很大,却又以极高精度相互抵消,最终只留下一个光滑外力。
OpenAI 的证明与方法
一份约 165 页的成文、一份 Lean 4 形式化,以及一群智能体——数字是多少、流水线如何运作,以及 Lean 究竟保证什么、不保证什么。
4.1 关键数字(官方数字与外部估算严格分开)
| 量 | 数值 | 备注 / 口径 |
|---|---|---|
| 底层模型 | 未发布,自 8 月 28 日起训练中,“显著强于 GPT-6 Astra” | 外部不可访问——过程是黑箱 |
| Euler 热身 | 约 100 个智能体、约 50 小时 | 无外力 Euler 正则性反证 |
| Navier–Stokes 搜索 | 约一万个并发智能体、约 88 小时 | 9 月 5 日周六出结果;运行中途切换到更新模型 |
| Lean 形式化 | 由 GPT-6 Astra 再花 17 小时 | 9 月 6 日项目完成 |
| 消息 / token——全部问题 | 490 万条消息、约 3000 亿输出 token | OpenAI 官方 |
| 消息 / token——仅 NS | 270 万条消息、约 1300 亿输出 token | OpenAI 官方 |
| 产出 | 约 165 页解析证明 + Lean 4 | 公开仓库;无 sorry;Mathlib;标准公理;另设独立“比较器”挑战 |
| 算力成本 | “数百万美元”(S. Bubeck 估算) | 网上流传的“1500 万美元量级”是个别评论者估算,非官方数字 |
4.2 方法中真正新颖之处
这不是“把问题敲进模型然后干等”。不同智能体小组被分派不同命题变体——A/B(会得到正则性证明)与 C/D(会得到爆破)——以此显式对冲“押错方向”的风险。智能体可读一份缓存的互联网副本、可运行代码、可在组内通信;Codex 随后在组间“交叉授粉”,整合最有用的中间结果,把更早的 Euler 解作为提示回灌。人的角色是设计搜索空间、分解问题、编排智能体群、判断哪条路有希望,而非亲自推导。OpenAI 甚至说,其团队整体缺乏流体力学的研究级专长,“无法对数学本身做出真正有意义的贡献”——这段自述本身也应带着几分审慎去读。
4.3 Lean 保证什么——以及它替你做不了的那一项核查
Lean 是一个交互式证明助手:命题与证明用形式语言写出,软件检查每一步推理。一份能编译、不用 sorry 占位、且只依赖 Mathlib 与标准公理的证明,在其所选定义与公理之内拥有闭合的逻辑链。这比一份等待评审的手写预印本可靠整整一个档次——也是它与 NS“证明墓地”的本质区别。
- ① 命题正确性不会自动成立:“光滑外力”“有限能量”“整个 ℝ³ / 环面”的形式化编码,是否与 Fefferman 的 C/D 条件精确吻合,必须由外部专家逐行核查。OpenAI 声称在 ℝ³ 与三维环面上都覆盖了 C 和 D;这恰恰是需要审计之处。
- ② 它既不证明物理意义,也不证明重要性:机器对结果意味着什么保持沉默,这要由人赋予。
- ③ 它尚不是共同体接受:外部数学家还没有独立构建并审计该仓库。形式化让结果可审计;可审计 ≠ 已被接受。
另一半:Buckmaster–Alpöge 与功劳之争
欢庆的信息流里大多只有 OpenAI。另一半则是一场围绕署名、数据使用与学术伦理的公开冲突。我们把两方说法并排呈现、不站队,并标注证据强度。
5.1 另一支团队做了什么
纽约大学教授 Tristan Buckmaster 与数学家 Levent Alpöge——后者受雇于 Anthropic,却极力强调自己以个人身份参与、无机构项目、工具费用出自 Buckmaster 的科研经费——使用 Anthropic Claude、OpenAI Codex、GPT-5.6 Sol 以及后来的 Astra(Astra 仅用于成文与审计),为三个模型方程取得了经 Lean 核验的、带光滑外力的有限时间爆破:不可压缩多孔介质方程(IPM,另与 Matei P. Coiculescu 合作)、二维 Boussinesq 方程组、三维不可压缩 Euler。他们还相信自己得到了亚耗散 Navier–Stokes 的爆破,但因 Lean 验证未完成、也拿不出像样成文而拒绝发布。
菲尔兹奖得主 Terence Tao(陶哲轩)在 9 月 7 日写道,称这是沿 Córdoba–Martínez-Zoroa 路线的一次“令人兴奋”/“非凡”进展,把次临界/粗糙外力一路推进到完全光滑,并判断推广到完整 Navier–Stokes“在不久的将来非常可行”、“没有根本性障碍”。他也补了一句值得记住的冷静话:求解只是代理目标,首要价值在于数学理解;缺了理解,NS 正则性问题“其内在意义……远不如大众媒体有时鼓吹的那么大”。
5.2 两支团队一览
| 维度 | OpenAI 团队 | Buckmaster–Alpöge |
|---|---|---|
| 身份 | 公司内部的企业化攻关 | 个人合作(Alpöge 在 Anthropic,但称非职务行为;工具自费) |
| 使用模型 | 未发布的更强内部模型 + 用于 Lean 的 GPT-6 Astra | Claude + Codex + GPT-5.6 Sol + Astra——均为公开可获取 |
| 覆盖范围 | 声称完整 NS(C/D);另有无外力 Euler | 光滑外力 IPM / Boussinesq / 三维 Euler;亚耗散 NS 未完成、未发布 |
| 形式化 | Lean 4,公开仓库 | 经 Lean 核验,公开仓库 |
| 成文状态 | 约 165 页的完成稿 | 作者承认仓促发布、有可见的“AI 注水”,并致歉 |
| 可复现性 | 产物公开;过程依赖未发布模型 | 全程使用可获取模型;过程相对可追溯 |
| 优先权主张 | 让出三维 Euler;主张 NS | 主张该路线的先发位置;指被催逼 |
5.3 争议的三层,按证据强度排序
第一层——“OpenAI 是否在泄露后冲刺?”(时间线大体可核查,解读各异)。Buckmaster 称两人的进展一旦泄露便被迫提前发布;OpenAI 承认自己 9 月 1 日才因“Anthropic 解决了”的传闻启动,并在 9 月 6 日完成工作后联系对方、提议同时发布且让对方先发。时间线本身大体可验证——另一方关键结果在 8 月中下旬,OpenAI 的运行在 9 月 1–6 日。
第二层——他们的私人 Codex 草稿是否被用于训练?(核心;正反均无证据;OpenAI 未完全回答)。两人把每份草稿、提示与中间产物都留在 Codex。Buckmaster 的问题从来不是“模型有没有实时读我的会话”,而是“这些会话有没有进入训练/改进流水线”。他说对方告诉他“模型不会调取用户数据”,而他追问训练一事时“没有得到回答”。OpenAI 自己的措辞是:解题时没有访问任何特定用户数据,但“无法排除源自其使用我方产品的去标识化数据帮助改进了我方模型”,尽管其认为可能性很低。
第三层——署名与所谓施压(各执一词;双方都有声明或截图)。Buckmaster 称对方曾向他提出两个方案,其中一个要他单独署名一篇 NS 论文、因 Alpöge 受雇于 Anthropic 而将其排除,并转述了“你为什么要毁掉自己的职业生涯?”之类的话。Bubeck 公开否认曾要求去掉 Alpöge,承认出于知识产权考虑说过“如果 Levent 不是 Anthropic 员工,事情会简单些”,为“糟糕的措辞”道歉并称当场收回,同时反指通话一开始就有诽谤性指控与联系媒体的威胁。Sam Altman 同样表示他本想联合发布、主动提出让对方先发并去角逐大奖,只是无法把同样安排延伸给一名 Anthropic 员工。这一层目前由相互冲突的单方说法构成;诚实的做法是把它们并排放置。
5.4 被忽略的“真正英雄”
这场争吵真正澄清的是:两支 AI 团队都站在同样两位人类数学家的肩上——Diego Córdoba(马德里 ICMAT)与 Luis Martínez-Zoroa(CUNEF)。撰写克雷原题的 Fefferman 直言“这个故事的英雄是 Córdoba 和 Martínez-Zoroa”;Buckmaster 写道,Martínez-Zoroa 凭其系列工作配得上一枚菲尔兹奖;Córdoba 则开玩笑说“我不用 AI:我有 Luis”。这个提醒很直白:AI 是沿着人类开辟的小众路线,快速冲过了最后一道技术缺口——它并没有发明这套研究纲领。
“解决”了吗?三个层次与历史的耐心
千禧年大奖不会凭一次宣布就颁发。下面是一份重大 AI 证明必须攀登的可信度阶梯——以及它此刻所处的位置。
6.1 克雷规则
候选者必须同时满足三条:(i)在“合格载体”——享有世界声誉的同行评审期刊——发表;(ii)发表后至少成立两年;(iii)获得全球数学界的普遍接受。不接受直接投稿。作为参照:迄今唯一被解决的千禧年难题庞加莱猜想,从 Grigori Perelman 2002 年 11 月预印本到 2010 年 3 月授奖历时七年以上,且他本人拒领。截至撰稿,克雷官网仍把 Navier–Stokes 列为未解,研究所对 OpenAI 的声明既未接受也未拒绝;OpenAI 表示不会申请百万美元,把这次发布定位为“一个时间切片……而非终局”。
论文与公告于 2026 年 9 月 8 日发布。
无 sorry、基于 Mathlib 与标准公理可编译。命题等价性仍待人审计。
外部团队构建该 Lean 仓库,确认形式化与克雷 C/D 吻合。
克雷研究所不接受直接投稿。
到那时——且只有那时——才有 CMI 的认定/大奖(OpenAI 已表示不申领)。
6.2 为什么学界缓慢、程序化的谨慎是对的
Navier–Stokes 是著名的“证明墓地”:不止一份宣布过的解答后来在审视下崩塌——Otelbaev 2014 年的声明就被 Tao 等人公开追踪、最终判定无法挽救。面对一份来自非传统渠道、裹着商业与优先权争议的 165 页证明,学界“独立构建 Lean、慢慢读、暂不下结论”的本能不是保守,而是让数学保持可靠的机制。
AI 做数学:三次跃迁,2024–2026
把这一事件放进 AI 做数学的短暂历史,就能看清跳跃发生在哪——它是问题类型的跳跃,而且跳了两次。
| 时间 | 系统 / 实验室 | 结果 | 问题类型 | 形式化? |
|---|---|---|---|---|
| 2024.01 | AlphaGeometry(DeepMind) | IMO-AG-30 几何 25/30 | 有标准答案的竞赛题 | 神经符号 |
| 2024.07 | AlphaProof + AlphaGeometry 2(DeepMind) | 解出 2024 IMO 六题中的四题;28/42、银牌水平(发表于 Nature) | 竞赛题 | Lean |
| 2025.07 | Gemini Deep Think(Google);OpenAI 纯 LLM 路线 | 两者均达 IMO 金牌水准;后者不用 Lean/空间 RL | 竞赛题 | 部分 |
| 2026.05 | AlphaProof Nexus(DeepMind) | 一次拿下九道开放的 Erdős 难题(一道沉寂 56 年),另提出 OEIS 猜想 | 已知的开放研究问题 | 已形式化 |
| 2026.09 | OpenAI 智能体群;Buckmaster–Alpöge | 声称抵达千禧年级别的开放 NS 难题;光滑外力模型方程 | 无现成路径的开放前沿——构造反例并验证之 | Lean 4 |
- 第一次跃迁(2024):在有标准答案的奥赛题上达到奖牌级——考的是解题能力。
- 第二次跃迁(2025–2026 上半年):开始碰已知的开放问题(Erdős 遗产)——考的是在人类已测绘的地形内推进。
- 第三次跃迁(2026.09):面对没有现成路径的开放前沿,甚至要在相反方向(证光滑 vs 构造爆破)之间下注,以超大并行度搜索、再形式化验证——考的是帮助开辟新地形。
范式与产业意涵
作为模型评估与选型机构,Modelspectra 最关心的部分:对研究、对前沿竞争、对采购分别改变了什么。
8.1 研究生产函数改变:稀缺性从“求解”移向“提问”与“编排”
当一万个智能体可以并行尝试数百条证明路径,稀缺资源便不再是苦熬冗长推导,而是另一端:把模糊的科学问题重述成机器可搜索、可验证的形态(Tao 所谓“好问题成为稀缺资源”);设计搜索空间(A/B/C/D 变体、更易的热身、跨组授粉);以形式化为兜底,同时由人完成最难的一步——确认“形式化问题=真实问题”;以及把机器产出的“AI 注水”改写成共同体可读、可继承的论证——Buckmaster 为粗糙草稿致歉,正说明这一步无法跳过。高价值研究角色越来越像研究产品经理 + 智能体群指挥 + 形式化审计员,而非孤独的推导者。
8.2 前沿竞争的新赛场:不是聊天分数,而是“真正前沿处谁被依赖”
- 两条路线都重度依赖 Anthropic Claude 与 OpenAI Codex / GPT-5.6 Sol / GPT-6 Astra,外加 OpenAI 未发布的下一代模型。在最难的智能体长程任务——多文件、长链条、持续自我验证——上,研究者用脚投票真正选了哪些工具,比任何聊天基准都更说明问题。
- 这一事件重新命名的决定性能力轴:长程智能体稳定性、大规模多智能体编排、与形式化/代码工具的协同、产出的可验证性,以及模型代际迭代速度(OpenAI 刻意点出一款“显著强于 GPT-6 Astra、仍在训练”的内部模型——既是能力预告,也是商业信号)。
- 对模型选型:除静态分数外,还要评估长程任务完成度、工具/验证链协同,以及可控、可审计的产出。同时清醒认识到:顶级研究能力,与企业能买到的商用模型之间,隔着一个代际与一次发布滞后。
8.3 一台资本密集的科学仪器——尚非廉价 API 能力
数百万美元、约一万并发智能体、约 1300 亿输出 token、88 小时,再加一款你买不到的未发布模型:这更像在粒子对撞机上跑实验,而非调用 API。它短期内不会成为中小企业用得起的标准服务。最先、也远更确定被产品化的,是流水线被拆解后的部件:形式验证工具、代码/研究智能体编排框架、可审计的研究协作环境,以及垂直的“多智能体搜索 + 验证”工作流。
8.4 规则真空:署名、数据与可复现规范落后于能力
- 作者与功劳:功劳如何在模型、造模型的公司、驾驭智能体的研究者,以及开辟路线的人之间分配?当参与者效力于竞争对手时,联合发布又如何可能?
- 数据边界:厂商能否、以及在何种退出设置下,可用喂入其工具的未发表成果改进模型,这需要比现状清晰得多的默认规则与技术保障。
- 可复现性:当关键结果依赖未发布模型,共同体如何独立重复?“公开产物 + 黑箱过程”足以构成一项发现吗?
- 评价体系:当机器核验证明成为常态,同行评审、期刊、招聘与奖项都要被重新设计。
这些都不会因这一次事件而定论,但它像一次压力测试,提前把账单递到了整个学术与产业系统面前。
结论与观察清单
回到核心判断,再列出可证伪的跟踪信号。
2026 年 9 月第一周,真正跨过门槛的不是“AI 解决了一道千禧年难题”这个结果,而是生产方式本身——大规模并行智能体搜索、以形式化验证为兜底、由人定义问题——第一次在一道千禧年级别的开放问题上跑通完整闭环。
对数学结果本身,我们建议与学界同样的耐心与不可知:Lean 背书给了它很高的下限,但在独立复现、命题等价性审计、同行评审与两年考验之前,严谨措辞仍是“一份待验证的证明”,克雷页面仍写着未解。优先权与数据之争应交给证据;眼下它至多是两份并排而立的说法。
观察清单(可证伪)
- 独立构建:是否有外部团队成功编译 OpenAI 的 Lean 仓库,并逐行验证其形式化定义与 Fefferman 官方 C/D 等价?
- 专家解读:领域内数学家(Córdoba、Martínez-Zoroa、Silvestre、Tao 等)的公开判断。
- 路线收敛:两人的受迫 Euler / 亚耗散 NS,与 OpenAI 的无外力 Euler / 完整 NS,最终会被证明是同一条路、还是实质不同?
- 在公开模型上复现:这套智能体群攻势能在任何人都能访问的模型(而非 OpenAI 未发布模型)上重跑吗?这决定范式的可迁移性。
- 克雷的立场:“未解”标签是否、何时改变。
- 数据/署名的新证据:邮件、对 Codex 数据条款的权威解读,以及任何能把单方说法变成可核查事实的东西。
给从业者三个更确定的结论:能力信号是真实的——“AI 只会做习题、不会做研究”已经过时;人的角色改变了,却更具决定性——好问题、搜索空间设计、等价性核查与人类可读的洞见才是护城河;面向市场则要拆解并管理预期——完整运行是资本密集的仪器,而验证、编排与审计才是最先产品化的部件,同时应以长程智能体、工具协同与可验证产出来评判模型。
资料来源与方法
OpenAI 公告是一方的一手来源;Buckmaster 声明与 Tao 博客是另一方的一手来源;Quanta 是骨干第三方交叉核对。访问于 2026-09-09/10。
| 来源 | 类型 | 用于 |
|---|---|---|
| OpenAI — On the Navier–Stokes Millennium Prize Problem (2026-09-08) | 厂商一手 | 过程数字、命题 C/D、“同期工作”、去标识化数据措辞 |
| T. Buckmaster — public statement (2026-09-07) | 第一人称一手 | 接触时间线、数据使用与署名质疑、三份预印本范围 |
| Terence Tao — blog post (2026-09-07) | 第一人称、顶尖数学家 | 对路线的评估、“代理目标”提醒、Lean 可行性 |
| Quanta Magazine — K. Kakaes (2026-09-08) | 独立第三方 | 时间线、Córdoba–Martínez-Zoroa 路线、Lean 的边界、Fefferman/Córdoba 引述 |
| Clay Mathematics Institute — Millennium Prize rules | 主管机构 | 三项认定条件;两年规则 |
| Unite.AI — Buckmaster/Alpöge preprints and disputed contacts (2026-09-08) | 行业媒体 | 三份预印本技术细节;通话/署名时间线 |
| InfoQ / 36Kr relay — "the AI-conquers-a-Millennium-Problem show becomes an OpenAI–Anthropic fight" (2026-09-09) | 媒体 | Bubeck 与 Altman 的完整回应 |
| MIT Technology Review (Chinese); Scientific American; The Paper (Pengpai); National Business Daily relays | 媒体 | 交叉核对页数、消息/token 数字、“另一方领先”的叙事框架 |
| DeepMind (AlphaGeometry/AlphaProof, Nature 2024–25); Gemini Deep Think IMO-gold announcement (2025-07); AlphaProof Nexus coverage (2026-05) | 厂商 + 期刊 | §07 的 AI 做数学里程碑表 |