scripts and commands

同一天:OpenAI 发 722 份数学手稿,Erdős 题库冻结评论区

2026/10/07 20:26

Thomas Bloom 没有搞仪式。10 月 6 日,这位伦敦的数学家在 Erdős Problems 站的博客版块发了一篇公告,标题平得像记事:「Blog - Changes」。当天他管理的题库刚被数学圈之外的流量冲了几个星期:1221 道问题、九千多条评论、每天一到两万五千个访客,评论区里刷屏的内容只剩一个句式——贴上一条 AI 生成的证明,没有解释,没有讨论,只有一个越来越不值钱的优先权声明。他宣布冻结问题评论和证明声明,恢复时间未知。

同一时刻,地球另一端 OpenAI 的工程师在给一个新 GitHub 仓库补最后几个文件。仓库 21 点 47 分(UTC)创建,名叫 openai/math,722 份手稿、57,328 个 Lean 证明文件在接下来几个小时内推上去。发布页的口径经过打磨:这批结果「依据」了高等研究院一个咨询组的建议,附十份模型推理摘要、算力估算、尝试题数统计。三个星期前,同一家公司还在为 Navier–Stokes 的优先权跟人类数学家团队打口水仗。

三周,两件事。9 月 8 日那次发布让数学社区炸了锅:抢发、删改、谁引用了谁的争执行里,最后要靠 OpenAI 官方调查确认「Buckmaster 的 Codex prompt 不可能影响系统」。10 月 6 日这次发布,评论区最高赞的态度变成了「这次的处理比之前像样」。而 Bloom 的题库在同一天关上了门。

一开一关撞在同一天,这不是巧合。两件事是同一套协议的两面。实验室按规范把东西交出来,社区里的平台用退出表态。

数学界过去六周里发生的事,比过去五年加起来都多。一个千禧年问题先被十万个并发 agent 用 88 小时打穿。然后学术圈吵出一份规范。然后规范被执行,然后有人选择不玩了。下文拆三件事:发布成色、清单执行率、关闸逻辑。

七百二十二份手稿是一份合规声明,先于它出现的是九页白皮书

先看仓库里有什么。CONTENTS.md 首行写着:722 份手稿,覆盖 372 个结果族。一个结果族是一组相关论文——主结果、配套论证、推论或不同证明。前两个结果族就能看出分量:001 号证明了 Milne 有理性猜想(代数簇上 Hodge 类的配对在所有素数特征下有理化),002 号从低 Selmer 余秩证明了完整的 Birch–Swinnerton-Dyer 前导项公式,含 Tate–Shafarevich 群有限性——这是数论里几十年悬着的硬骨头,一次给出。

规模数字有三个口径。仓库文件树 57,739 个文件,其中 57,328 个是 .lean——Lean 形式化证明文件,机器可验证,占全部文件的 99.2%。preprints 目录下 722 个子目录,每个含论文 PDF、LaTeX 源码、BibTeX 引用块和构建说明。产出侧的口径来自 OpenAI 自己:模型被喂了约 4,000 道题,筛出这批结果,平均每个结果的算力「约等于三个小时的 ChatGPT Pro 思考」。4,000 道题产 372 个结果族,录取率不到十分之一——先跑量,再按「显著性」门槛聚合入库,这是一条流水线的形状。

发布时间线里藏着这次发布最关键的性质。9 月 8 日,Navier–Stokes 事件:OpenAI 宣布单个成果,数学家 Buckmaster–Alpöge 团队几乎同时公布人机协作版本,双方争优先权,社区挖出 prompt 疑云,OpenAI 被迫开调查自证清白。9 月 29 日,普林斯顿高等研究院(IAS)的数学与人工智能咨询组 AGMAI 发布九页白皮书《负责任发布 AI 生成的数学》,开头一句就很不客气:「我们不认可这种做法,我们要求他们停止在专有模型上测试前沿数学问题。」10 月 6 日,722 份手稿上线,发布页明说「借鉴了他们的建议」。

顺序是:先出事,再立规矩,再交东西。AGMAI 的问卷收了 600 多份回复,脚注里写明问卷针对的场景正是「OpenAI 宣布存在大量结果但不给细节」——白皮书就是为 9 月 8 日那类单点发布开的药方,10 月 6 日的批量发布是这剂药第一次被实验室吞下去。你可以把 722 份手稿读成一次能力炫技。但它的组织形式本身就是一份合规文件:每份手稿带引用协议、修订记录承诺、形式化目录。OpenAI 被规范驯化的速度,比它驯化模型的速度快。

算力口径用「ChatGPT Pro 小时」计价,因为模型还没发

这次发布里最诚实也最躲闪的一个数字,是「三个小时的 ChatGPT Pro 思考」。诚实在于它给了可锚定的口径。你花 20 美元订阅 Pro,让模型思考三小时,大概就是产出一个结果的算力。躲闪在于它绕开了另一个计量单位。训练这个内部前沿模型用了多少 GPU 小时、多少美元、什么架构,全部没有。发布页写的是「内部前沿模型」,脚注链接到 9 月 8 日的 Navier–Stokes 页,那页说过这模型「显著强于 GPT-6 Astra」,8 月 28 日才开始训练。训练成本,一个字没有。一个从零训练到能批量产出数论成果的模型,训练成本一个字不提,发布成本按零售价折算。

这不是抠字眼。发布越大,成本口径越模糊。AGMAI 白皮书第 3 节专门写了一段「确保广泛获取」:实验室用内部专有模型做数学研究,会造出两级体系——实验室跑得比整个学界快,数学社区被疏离于自己的学科之外。白皮书要求实验室向全球数学社区「广泛、公平地开放」公开发布的模型。OpenAI 的回应是「正在努力负责任地发布产生这些结果的模型」——「working to responsibly release」,进行时态,没有日期。模型不发,社区就只能用「Pro 小时」这种零售价标签,去遥想批发价的算力。

对比另一侧的同行。9 月 29 日,Anthropic 对竞品 GLM-5.3 的网络能力评估里,连「自购 2,200 GPU 小时、约 4,400 美元做 abliteration」这种自费攻击实验的成本都写进了报告。9 月 8 日的 Navier–Stokes 页至少给了「10,000 个并发 agent、88 小时」。到了 722 份手稿这个量级——这是目前所有 AI 数学发布里绝对量最大的一次——算力口径反而退到了「三个 Pro 小时」的零售比喻。发布越大,成本口径越模糊,这个方向值得记下来。

模型不发还有第二层后果:结果没法独立复现。手稿是 Lean 文件占 99% 的形式化产物,Lean 编译通过意味着证明内部自洽,这不假。但模型拿什么题、按什么顺序、用什么采样参数跑出来的 4,000 次尝试,全在不开源的黑箱里。AGMAI 要求「公布模型名、使用的 prompt、CoT 摘要、耗时、估算算力成本」——OpenAI 给了 CoT 摘要(十份,从 Mahler 猜想到三维相对论 Vlasov–Maxwell 方程)、给了 Pro 小时口径、没给模型。清单六项,做了五项,缺的那项恰好是最贵的一项。

AGMAI 的清单六成进了仓库,剩下的都卡在「实验室控制」这一条

把 AGMAI 白皮书的技术规范逐条对到 openai/math 仓库,得到一张可以打勾的表:

AGMAI 要求 openai/math 实际做法 打分
扫文献补引用,独立发现也要引 每份手稿带 BibTeX 块;NS 事件后补了调查 大体照做
写成传统论文体,定理陈述精确 722 份 PDF + LaTeX 源码 + 构建说明 照做
公布模型名、prompt、CoT 摘要、耗时、算力 给了 10 份 CoT 摘要 + Pro 小时口径;模型名与 prompt 未给 半做
尽可能 Lean 形式化,附元数据 57,328 个 .lean 文件、形式化目录、验证配置 照做(部分结果未形式化,README 自认可能有错)
存入实验室不控制的学术仓库 存在 openai 自己的 GitHub;「探索社区托管中」 没做
批量发布附总文档,说明失败数与选题方式 尝试总数(~4,000)给了;「多少同类题失败」「怎么选题」没有独立文档 半做
不把发布当营销工具 发布三周后紧跟着一条 983 分的 HN 热帖,营销效应溢出 存疑

七项里,完整照做的三项,半做的两项,没做的一项,存疑的一项。这就是「借鉴了建议」的真实含义。清单的低成本项全做了。高成本项——放弃对仓库和模型两者的控制——一项没动。白皮书说仓库「不应由任何实验室控制」,手稿就放在 openai 名下。白皮书说「停止在专有模型上测试」,模型继续捂着。执行的边界线,画在「不花钱的合规」和「花钱的合规」之间。

这张表还有个使用价值:它让「OpenAI 这次表现不错」变成一句可核对的判断,而非观感。社区确实给了正面评价——Hacker News 上 990 分、962 条评论的讨论里,高赞意见认为这次比 NS 事件审慎得多,「偷结果」的叙事在 722 份手稿面前站不住。转述 Unite.AI 的核对,两个具名例外也公开了:黎曼 zeta 函数零点自由区域的改进(Re(s)>11/12)由人类编辑润色过行文,CM 阿贝尔簇的 Hodge 猜想走了专项流程。例外公开是规范的胜利——白皮书要求「说清每个结果怎么用 AI 做的」,公开例外正是这一条的执行。

但「大体照做」和「照做」之间有空隙。空隙就是未来会被人钻的地方。半做的两项都留了活口:CoT 摘要只给 10 份,是 4,000 道题的千分之 2.5;「选题方式」塞在发布页一句话里。下次任何实验室发布 AI 科学成果,都可以照抄这套模板。给一小撮推理摘要,给一个零售价算力口径,把模型和仓库控制权留住。规范被执行了六成。剩下的四成,是下一轮谈判的筹码。

同一天,最大的 Erdős 题库宣布不再收 proof claims

现在看关闸那一侧。Erdős Problems 是 Thomas Bloom 2023 年 5 月建的个人站点,收录 Paul Erdős 名下 1,221 道开放问题,2025 年 8 月加了评论区。此后一年多,它长成数学界最活跃的公共讨论场之一:9,000 多条评论、近 2,000 注册用户、日 UV 一到两万五。Bloom 的本意是给人类读者建一座参考库,让「简单陈述、深不可测」的问题被更多人看见。他没打算做 AI 能力的跑分场,但题库「易陈述、难解决」的性质让它成了完美的跑分集。

变化分三个阶段。第一阶段是红利:AI 真的解出了一些题,人类也因为 renewed interest 多解了一些,站内出现合作与论文。第二阶段是挤占:评论区的主流内容变成「晒 AI 证明」——Bloom 的原话是「人们现在在这个站公开互动的主要方式,就是给自己的 AI 生成证明打广告,往往不做任何解释,只为记录一个(越来越没有意义的)优先权声明」。第三阶段是撤退:他试过 moderation(「实践中该站现在收到的评论绝大多数是 AI 证明公告,一个几乎拒绝所有评论的审核政策不可持续」),然后选择冻结。

10 月 6 日的公告做了四件事,一件比一件狠。第一件:冻结问题评论与证明声明,无限期,恢复时间他自己也说不知道。第二件:撤掉所有题目的状态显示。open/solved 的颜色区分和「已解决百分比」全部下架,所有题目同一个中性色。第三件:放弃 credit 语言。不再写「Bloom 证明了 X」,改写「X 已知,讲解见链接」,对人类和 AI 一视同仁。第四件:转向 exposition。接受人类或 AI 写的高质量讲解,判断标准是「能看出清晰理解」,考虑开线上研讨班。连反方预案都写了:「你可以自己建站,甚至可以用 AI 爬我的站做个更宽松的克隆。可以。这是个大实验时代。」

关闸的逻辑值得单独说。Bloom 写了一个比喻:没人会在屠宰场旁边开餐馆,AI 证明仓库和人类讨论站点需要物理分离。这个比喻精确对应他的三条行动。仓库功能(记录证明,防止别人浪费 token 重复算)应该存在,但去别处存在。讨论功能(人类理解、纠错、合作)留在原地,但不再给优先权声明盖章。他引用了 Po-Shen Loh 九月那篇《为什么我们还需要人类数学家》的公理变体:「这个站应该帮助 Erdős 风格数学的人类社区兴旺。」当站点的网络效应被证明声明灌满,继续开着门就是替免费的流量背书。

他不是没有代价。公告里承认:一些数学家已经把 Erdős 风格问题当成「简单/娱乐性的」。更多人因为「无法与 AI 竞争」而停止思考这些题。AI 解答无解释地涌入,挤走了原本的讨论。一个日 UV 两万的数学社区,主动撤掉了最有传播力的指标(solved 百分比)和参与入口(评论)。换回来的,是「讨论回来的可能性」。数学界第一次有一个公共平台,选择把自己降级成静态参考库来对抗流量结构。这不是失败主义——Bloom 明说「如果以后有办法在不变成 AI 仓库的前提下鼓励讨论回来,我会乐意恢复」——这是把社区的定义从「证明的记录处」改回「人的聚集处」。

一开一关是同一套制度:发布方按规矩来,平台用退出投票

把两件事放回一张图。9 月 8 日之前,数学界对 AI 发布没有共识规范。抢优先权的发,被抢的骂,平台两头受气。AGMAI 白皮书第一次给出可执行清单,自称拿到「clear plurality」的社区共识。10 月 6 日,清单同时测试了两种服从。实验室的服从是照着清单交东西。平台的服从是:清单管不了我的社区治理,我用退出执行我自己的规范。

两者共享同一个底层判断:AI 生成的数学结果,其稀缺性的锚点从「证明存在」移到了「人类理解」。AGMAI 三原则的第二条说实验室必须出钱资助人类理解——会议、暑期学校、博士后、专著,钱由既有非营利机构分发,实验室不得借资助指挥方向。Bloom 的四条变更说平台不再为「证明存在」记账——solved 状态、优先权声明、credit 语言全部下架。一个从供给侧掏钱,一个从需求侧撤章,两端往中间收的正是同一件事:让「Lean 编译通过」不再是终点线。

对做 agent 产业的人来说,这套协议是今天最值得抄的东西。它解决的是一个你们每天都在撞的问题:agent 产出物爆炸之后,评价体系怎么不被产出物本身淹没。AGMAI 的答案分三层。第一层,产出必须带可核元数据:引用、形式化、CoT 摘要、算力口径。第二层,产出方必须为下游的「理解成本」付费。第三层,理解过程必须社区主导,供给方不得借此控制叙事。这三层加起来,就是一个 agent 产出物进入专业社区前应该通过的接口。对照你们自己的场景——agent 批量生成的 PR、报告、分析——缺的往往就是第二层。产出方不为理解成本付费,接收方就只能像 Bloom 一样关闸。

值得注意的是缺席者。722 份手稿的作者署名是「OpenAI」,模型名未公布。AGMAI 的委员里有几位一线数学家联署,但没有任何一家实验室代表。Erdős 站的公告是 Bloom 个人署名,站是个人资产。整个协议体系没有任何强制力——AGMAI 是咨询组,OpenAI 的「borrowed advice」是自愿的,Bloom 的锁只锁他自己的门。强制力为零,支撑它的只有声誉账本。实验室违反规范,下次发布没人当真。平台执行规范,社区用脚投票。这套机制眼下只覆盖数学,因为数学有 Lean 这种机器可验证的载体。别的学科连「编译通过」这个锚都没有,规范化的时机也就还没到。

下次看到「AI 又解决 XX 猜想」,先查三样东西

第一样,查仓库在谁手里。成果放在实验室自己的 GitHub 上?还是在社区控制的学术仓库(arXiv、Zenodo 这类有持久标识符、修订留痕的)?AGMAI 白皮书把这条列为硬要求。10 月 6 日的 openai/math 没过这条。仓库在谁名下,决定了修订史能不能被篡改、撤回权在谁手里。

第二样,查三件套齐不齐:模型名(或至少模型量级)、推理摘要、算力口径。722 份手稿给了后两样的一部分(10 份摘要 + Pro 小时口径),没给第一样。三件套缺的每一项都有价格。缺模型名,结果无法独立复现。缺推理摘要,你不知道 4,000 次尝试里九成的失败长什么样——失败模式才是能力边界。缺算力口径,「三个 Pro 小时」可以遮住任何量级的训练成本。

第三样,查人类理解的资金链。发布方有没有为「让人类看懂」出钱——资助会议、委托 exposition、开放模型访问?OpenAI 承诺了「funding a series of workshops」,细节「近期公布」。这句承诺值多少钱,年底前就能核对:AGMAI 白皮书要求资助由既有非营利机构分发,如果 OpenAI 最后把钱发给了自己控制的机构,清单最后一项也破了功。

这三样查完花不了你十分钟。「AI 数学又赢了」这类标题新闻,会被拆成一堆可核对的具体声明。媒体口径已经出现过失真样本:10 月 7 日有个交易所内容号把 zeta 零点自由区域的结果直接写成「证明了准黎曼猜想」——那是一项条件性的区域改进,离黎曼猜想差着数量级。发布方越规范,转述方越放肆,这是新协议下的新失真。

最后是可证伪的边界,两个方向。如果 OpenAI 在未来几个月公开那个内部模型的权重(或至少开放学术访问),并把仓库迁出 openai 名下、补上选题方式与失败统计的独立文档,那么「选择性合规」这个判断作废——那将说明规范真的长进了实验室的决策流程,而不是停在对声誉有利的那 60%。反过来,如果 Erdős Problems 在冬天结束前恢复评论、并用新机制(比如 seminar + exposition 优先)重新长出人类讨论,那么「制度性撤退」的判读也作废——那将说明平台的关闸是重置而非放弃。哪个先发生,哪个就是这轮协议成色的最终读数。这个判断眼下只值这么多。能确定的是:数学界用六周时间跑完了一轮「事故—立规—执行—退出」的完整循环,其他学科连事故报告都还没写完。