scripts and commands

OpenAI 声称解开 Navier–Stokes,但 100 万美元没人领

2026/09/09 20:12

OpenAI 声称用 10,000 个 agent、88 小时解出 Navier–Stokes 千禧年问题,Lean 形式化通过,但公司声明不领 100 万美元,模型未公开。几乎同时,人类团队 Buckmaster–Alpöge 用 Claude 与 Codex 工作近一年后发布零粘性版本,双方公开争优先权。把标题削掉的限定词补回去,剩下的才是可核事实。

9 月 8 日清晨,OpenAI 挂出一篇公告:约 10,000 个并发 agent,88 小时,解出 Navier–Stokes 存在性与光滑性问题的奇点构造,Lean 形式化另加 17 小时。9 月 7 日深夜,纽约大学数学教授 Tristan Buckmaster 先挂出自己的 statement:他和 Anthropic 的 Levent Alpöge 用 Claude 与 Codex 干了近一年,8 月 22 日已有 Lean 验证的零粘性方程证明。

两个数字并排放:88 小时对近一年;10,000 个 agent 对一个人类团队。同一道悬了约 90 年的题(1934 年 Leray 的广义解之后),两个几乎同时的答案,一场谁先谁后的公开争吵。

OpenAI 那篇公告里还有三行小字:公司不打算领那 100 万美元奖金;所用模型是 8 月 28 日才开始训练的内部原型,未公开;以及一句「虽然不太可能,我们不能排除,源自他们使用我们产品的去标识数据,帮助改进了我们的模型」。

新闻标题写的是「AI 解决了一个千禧年问题」。标题没写的是:这是声称,等价性还没人核,奖金没人领。这篇文章把这三个限定词逐个补回去,最后留一个下次看新闻时能用的盯法。

「解决」前面站着三个限定词:声称、等价性、不领奖

OpenAI 的公告标题是「On the Navier–Stokes Millennium Prize Problem」,正文第一句说「We're sharing a solution」。同页靠后的位置写着:「我们不打算为这个结果申领千禧年奖。」原话是 We do not intend to claim the Millennium Prize for this result。公告把证明的 writeup 和 Lean 文件都放了出来,链接就挂在正文里。

为什么不领。Clay 的规则里,奖金发给发表并被数学界接受的证明。这份成果没有投稿,没有同行评审,模型不公开,prompts 只对 Buckmaster–Alpöge 展示过。声明放弃,省掉一场注定走不完的流程。

Clay 的百万美元,是给「被接受」的证明准备的,接受的意思是经过同行评审。按这个定义,这份成果连入场券都没拿到。

2000 年 Clay 设立 7 个问题,每个 100 万美元。此前只有 Poincaré 猜想被 Perelman 解掉,那是 2003 年的事;OpenAI 这一下声称解决的是第二个。Nature 的报道标题用词比 OpenAI 自己克制:OpenAI claims huge maths breakthrough。Science 次日的标题直接写「ignited a controversy」——争议成了主新闻。Quanta 的版本是「AI Has Solved One of Math's $1 Million Millennium Prize Problems」,把「声称」也省了。

Perelman 当年拒绝领奖,理由是嫌流程不公,人去了圣彼得堡。OpenAI 拒绝领奖,理由写在公告里:「我们发布这个结果的目标,是报告 AI 模型的实质性进展。」前者的钱是拿得到不要,后者的钱是现在拿不到。Clay 的章程要求证明发表在同行评审期刊并被接受,一份没投稿、没评审、模型没公开的结果,走不完这条流程。

100 万美元的奖金,对着几百万美元的成本和 300B token 的账单。这笔账 OpenAI 自己先算过了:公告里那句「目标是报告 AI 模型的实质性进展」,另一面就是「为 100 万去走 Clay 流程,成本早超过奖金」。声明不领,既是姿态,也是算术。

三个限定词里,等价性那条最容易被忽略。Lean 验证通过,只说明一个形式陈述在 Lean 里成立。这个形式陈述是不是 Clay 官方表述里的「C」「D」,需要人类专家核。Quanta 把这步写得很直白:仍须由人类保证「被证明为真的陈述,在逻辑上等价于数学家打算证明的东西」。等价性这一步,机器帮不上忙:它需要数学家读两遍,一遍读证明,一遍读 Clay 的问题陈述。

把三个限定词删掉,剩下可核的事实是:一个未公开模型、一组 agent 的输出、一次 17 小时的 Lean 形式化、几百万美元的算力账单。这些都能被独立复查,复查的顺序决定了这条新闻最终是「解决」还是「声称」。

88 小时与近一年:同源的方法,不同量级的资源

两条路线的起点是同一个:马德里 ICMAT 的 Diego Córdoba 与 CUNEF 的 Luis Martínez-Zoroa。两人从 2021 年博士论文起家,2023 年证明带粗糙 forcing 的 Euler 方程有奇点(arXiv 2309.08495),方法是不靠计算机的「无限层叠」分析。

这套技术在思路上反主流。别人用计算机模拟寻找 blow up 的可能场景,他们用纯分析:造出无穷多个「层」,每层都是方程的一个非奇点解,再把这些解按无限级联的方式叠起来,得到一个含奇点的新解。难点在最后一步:单层解的光滑 forcing 可以很规整,叠起来之后,forcing 的光滑性会坏掉。Clay 官方问题的门槛,恰恰是 forcing 必须光滑。两边团队各自补上的,就是这最后一步。

10 年前没人相信 Navier–Stokes 存在奇点。2013 年,Caltech 的 Thomas Hou 与郭璐证明 Euler 方程在圆柱里可以 blow up——上下两半反向旋转,前提是存在边界。2019 年又有一篇 arXiv 1904.04795 跟进。这些结果都有边界,Clay 问题问的是无边界的三维全空间。Fefferman 解释过边界为什么重要:有边界时,奇点可以归咎于流体与边界的相互作用;没有边界,「是流体自己在发疯」(it's the fluid doing the crazy stuff)。

普林斯顿的 Charles Fefferman 是 Clay 官方问题描述的撰写人。他说:「这个故事的英雄是 Córdoba 和 Martínez-Zoroa。」Buckmaster 在自己的 statement 里更进一步:「我认为 Luis Martínez-Zoroa 配得上一枚 Fields 奖章。」

Buckmaster 与 Alpöge 的路是贴着方法走:近一年,草稿全存在 Codex 会话里,模型主要是 GPT-5.6 Sol 与 Claude。8 月 15 日突破,8 月 22 日 Euler 证明过 Lean。Buckmaster 形容收到的第一条 LLM 生成证明「是我读过最可怕的」(the most horrendous I have ever read),三篇论文里有一篇「只能叫 AI slop,我为此道歉」。他们用的模型是公开货架上的:Claude 与 Codex,任何人买得到。

OpenAI 的路是传闻驱动的并行:9 月 1 日听到「两个千禧年问题被解决」的传闻,给所有开放问题各派一组 agent。Euler 非受迫版先出来:约 100 个 agent、约 50 小时。接着 10,000 个 agent 压到 Navier–Stokes 上,88 小时出解,17 小时形式化。全部尝试问题合计 4.9M 条消息、约 300B 输出 token,NS 专项占 2.7M 条、约 130B。Euler 是 NS 把粘性项拿掉的极限情形,难度低一档,方向一致。

对每个问题,OpenAI 都按变体派组。官方公告:不同组的 agent 拿到同一问题的不同表述,NS 的 A/B 版本是「会得出证明」的方向,C/D 版本是「会得出否证」的方向。最后解出来的是 C/D 那一路——构造出奇点,证明方程会坏掉。连「该证明什么」都是分头押注,押中的那组拿到全部算力。

成本口径有两个:Bubeck 在发布会上说「几百万美元」;Simon Willison 按公开 API 价粗算,300B 输出 token 约合 1500 万美元。后者是内部模型的公开价估算,两个数字都只能当参考。人类团队一年的 compute 预算,大概率到不了这个数的零头。两个口径的差距本身也是信息:内部模型的真实成本,公司没说。

同一种方法,两种跑法:两个人加两个商业模型加一年;一万人份的 agent 并行加三天半。前者把中间产物留在自己的会话里,后者把中间产物留在公司的日志里。谁先到,取决于传闻什么时候走漏。

「不能排除」是公告里最重的一句话

原话引文:"While unlikely, we cannot rule out that de-identified data derived from their usage of our products helped improve our models." 这句话跟在「我们没有通过任何途径看过他们的工作」后面。

Buckmaster 在 statement 里记录了他问过的问题。问:你们的 agent 有没有访问过我们在 Codex 里的会话 transcripts?答:没有。问:模型有没有拿这些 transcripts 训练?答:没有回答——这段对话发生在 9 月 6 日之后,也就是 OpenAI 的 Lean 验证完成之后。

时间线摆在一起看:OpenAI 8 月 28 日开始训练内部模型,9 月 1 日听到传闻开工。Buckmaster–Alpöge 从去年秋天起把全部草稿放进 Codex 会话。训练窗口、传闻窗口、会话窗口,三段重叠。OpenAI 承认传闻「后来我们意识到与 Alpöge 和 Buckmaster 有关」。OpenAI 说「没有特定用户数据被访问」,但训练用的是另一个池子。

OpenAI 版的时间线是另一副样子。9 月 6 日 Lean 验证完成后,公司「相信传闻里他们也有 Navier–Stokes 的解,主动联系,提出联合发布、承认他们的优先权」,接触之后才发现对方完成的是 forced Euler。OpenAI 提出可以把全部 prompts 给对方看。Buckmaster 记下的却是另一个版本:两个选项,要么他们先发、OpenAI 次日发 NS,要么他与 OpenAI 合写一篇没有 Alpöge 的论文——因为 Alpöge 的雇主是 Anthropic,OpenAI 最大的对手。两边的陈述放在一起,只有一句是双方都承认的:传闻存在,且 OpenAI 听到了。

HN 上 Scea91 的评论代表了不少人的读法:「措辞听起来像承认进了训练数据——如果他们能轻易证明没有,早就证明了。」noir_lord 的角度更商业:「如果真是拿客户数据训练去赢那 100 万,这是给所有 AI 商业伙伴关系埋的一颗 IP 地雷。」两条评论指向同一个担心:公司握着数据管线的钥匙。

这句话对每个用 Codex 或 Claude 做研究的人都是一面镜子:你的草稿、你的失败尝试、你的未发表想法,都在一家公司的数据管线里。「不能排除」四个字是标准答案,也是免责声明。Simon Willison 把它改写成自己的新假想问题:如果我帮 ChatGPT 部分解出千禧年问题,我的工作会不会让另一个模型抢先解出剩下的部分?

Lean 证明的是形式陈述,人类核验那一步还没人做过

四天前,Anthropic 宣布 Claude 用 11 天把费马大定理形式化进 Lean 4,Nature 当天跟了报道。那次的里程碑是:把一条已知定理完整写进形式系统。这次的里程碑是:声称解决一条开放 90 年的未知问题。两步之间隔着的,恰恰是等价性核验——把数学家的意图翻译成形式陈述,那一步两边都没交给独立专家做过。

Lean 能验证的范围很硬:一个写进形式系统的命题,机器检查每个推理步骤。它验证不了的范围同样硬:这个形式命题是不是 Clay 官方问题。翻译那一步——把「光滑 forcing 下的奇点」写成 Lean 里的 statement——是建模,不是证明。

这次两边都声称自己的 Lean 验证过了,且都建立在 Córdoba–Martínez-Zoroa 方法上。方法来源单一的好处是可信度集中,代价是核验链条上最贵的一环还没发生:有资质的数学家逐行读证明,对照 Clay 的官方表述 C 和 D。

Clay 研究所主席 Martin Bridson 在 Nature 里表态:「这确实是令人兴奋的一天」(certainly an exciting day)。同一篇报道里,Bubeck 说这是「过去 12 个月那条弧线的壮观顶点」。一个机构的官方口径和一个当事人的自我评价,天然不同步:前者要等流程,后者已经在庆祝。

Tao 的态度值得单独记一笔。他称 Buckmaster–Alpöge 的成果「remarkable achievement」,但就在上周,他写过另一段话:纯 AI 方法过早解题、过程不透明,「会污染这个进程,以至于对整个数学的进步变成净负」。同一个人,两句都说了。

Fefferman 的话是另一个提醒:方法来自两位人类数学家,AI 完成了最后一步。Córdoba 开玩笑说自己不用 AI:「我有 Luis。」Martínez-Zoroa 则说以后得学着适应 AI 的工作流。英雄与工具的分界线,正在被这条新闻重新画。

给读者的检查单:下次看到「AI 证明」四个字,问三件事——形式陈述是谁写的;等价性有没有人类专家核过;模型权重和 prompts 公不公开。三件都答不上来的,按「声称」处理,不按「解决」处理。

传闻现在值几百万美元,数学的抢先战已经开场

安全圈最近流行一句话:Anil Madhavapeddy 写的「Just a rumour of a bug is enough to find a security exploit」——只要有人知道某个软件存在未修补漏洞,你就能让 agent 去把它找出来。Simon Willison 把这句话平移到了数学:只要有人知道某个问题已经被解出,就值得砸几百万美元让 agent 抢先。

传闻是这场竞赛的起跑枪声。OpenAI 自己的时间线就是证据:公告写明,9 月 1 日听到「两个千禧年问题被解决」的传闻,受传闻与内部模型性能跃升的鼓舞,启动了评估。枪声一响,10,000 个 agent 进场,三天半后出解。Buckmaster 那边,则是「进展走漏到 OpenAI 之后,他们觉得必须把时间表提前」——枪声是从别人靶场传来的。

对独立研究者,这意味着保密窗口从「投稿前」缩到了「开工前」。你的中间产物——存在 Codex 里的草稿、喂给 Claude 的半成品——既是资产也是负债。Buckmaster–Alpöge 被迫提前发布,一篇论文只能叫 AI slop,就是这个新规则的第一次公开演示。下一次,传闻可能来自你的 arXiv 草稿,也可能来自你的 Codex 会话。

MIT Tech Review 的作者点出一个反直觉的可能:如果 OpenAI 的 agent 走上 Córdoba–Martínez-Zoroa 这条路,是因为 Buckmaster–Alpöge 已经走通了同一段路,那么「研究品味」——选择正确问题与正确方向的能力——依然来自人类。学界一直把 research taste 当作 AI 做数学的最大障碍。这次事件里,人类品味以传闻的形式参与了竞争。

资源门槛同步抬升。Gómez-Serrano 说得直白:「很少数学家会有这种规模的资源。」10,000 个并发 agent、几百万美元、未公开的内部模型,这个组合目前只有两三家实验室凑得齐。过去几个月,多位研究者向 MIT Tech Review 描述数学家的沮丧:数学正在变成前沿 AI 公司的领地。数学的抢先战已经开场,参赛资格却在收紧。

公告的收尾段写着:「我们相信,我们现在正处于 AI 进步的下一个时期。」同页还写着,这是一张快照,不是终点(a snapshot in time)。公司的自我定性和数学界的审慎表态,隔着整整一个流程的距离。「快照」这个词选得准:模型还在训练中,数字还会变。

这次的「千禧年问题被 AI 解决」,可核的部分是一个未公开模型加一群 agent 的产出,附带一句「不能排除」和一份没人领的奖金。什么新事实出现,这个判断就作废:OpenAI 公开模型权重或完整 prompts;或者独立团队用一个训练截止早于 9 月 1 日传闻的模型,复现出同一个奇点构造。到那天,标题可以回到「解决」。在那之前,盯住三个限定词。