OpenAI于周六发布了一篇论文,给出了数学和理论计算机科学中10个问题的解答,并将这些数学成果归功于的不是任何个人,而是Astra的一个内部版本,这是一个它尚未发布的模型。数小时前,这10项成果中的一项——群论中的一个构造——已在X上泄露。

最会被反复提及的数字将是$2,000。OpenAI估计,按其当前旗舰模型GPT-5.6 Sol的API费率,找出全部10个解所使用的token成本会是这个数。名单上的每个问题,其主要结果都至少已有十年没有进展,而且其中大多数停滞的时间远不止如此。

泄露先发生。群论章节的截图在一夜之间以“Nonsofic Groups Exist”为标题流传开来,而Epoch AI首席数学家Elliot Glazer回复称这些页面是真的,并称这项工作是迄今最重要的数学AI成果。完整出版物于同日上午发布。

这则公告中最重要的一句话并非关于任何定理。OpenAI写道,“将完全由AI系统生成的证明归为人类作者,会误述该系统的贡献以及真正的人类智力劳动的本质。” 到目前为止,AI辅助数学成果一直以人类名义发表,模型仅出现在致谢中。OpenAI的立场是,其员工整理了论文并对正确性负责,而论证本身属于机器。

这10项结果涵盖什么

群论这一项就是泄露的那一项,它终结了自Benjamin Weiss在2000年将该性质命名为“sofic”以来一直悬而未决的问题。群是一组操作以及将它们组合起来的规则,就像魔方的旋转。sofic的意思是,组合表中的任何有限片段,都可以用一副有限张牌的洗牌方式以你选择的任意精度来模拟。所有被检验过的群都符合这一性质,而直到周六此前尚无反例已知

其余成果的范围远不止群论。球堆积章节声称,自1978年以来首次改进了关于高维空间中球体能以多高密度填充的一般界限。另一项推翻了算子代数中的Connes刚性猜想。一项解决了Erdős问题183。还有一项为最接近向量问题证明了新的困难性结果,这个格问题是后量子密码学的底层基础之一。

哪些可以检验,哪些不行

与7月不同,这次工作附带了可供检验的机制。OpenAI发布了论文、模型推理过程的叙述,以及每个论证对应的一份Lean证书。Lean证书是一种以计算机可验证每一步的方式写成的证明,这排除了那些让多数著名猜想证明主张最终失败的隐蔽漏洞。但这并不能证明形式化后的陈述就是数学家真正关心的那个猜想,也不等同于同行评审。

7月的先例值得记住。OpenAI将一个关于Cycle Double Cover Conjecture的证明归功于GPT-5.6 Sol Ultra,时间是7月10日,而Jim Geelen和Sang-il Oum分别撰写了该论证的解说。Wolfram MathWorld记载,到当月月底,这一主张仍未进入经同行评审的正式发表。验证以月计,而不是按新闻周期推进。

OpenAI在这方面也并非孤例。借助Anthropic的Claude Fable 5找到的一个反例,终结了三变量情形下已有87年历史的Jacobian Conjecture,而Terence Tao公开推演了这一结果,时间是7月21日。

OpenAI相较竞争对手所拥有的,是一个公司外无人能测试的模型。Sam Altman本周一直在华盛顿预览Astra家族,它被定位用于跨越数小时或数天、并涉及多个智能体而非单次回答的工作。它没有发布日期,没有基准测试分数,没有价格,甚至连名称都还未最终确定,而这个$2,000也是按另一款模型费率估算得出的。

OpenAI从事AI工作的Sébastien Bubeck在谈到这次发布时指出,他原本预计AI会在2030年前后在数学上超过自己,结果提前到了2026年。该公司自己报告的数字此前也曾需要进一步拆解,例如其38.3%的自报ARC-AGI-3结果。而这一次,它交出了证明、Lean文件和推理轨迹。下一步轮到数学家了。