据有关 OpenAI 最新模型家族的报道,这一暂定名为 Astra 的最新模型系列将专门处理需要数小时或数天才能完成的中长期任务。它们旨在补充现有的 Sol、Terra 和 Luna 系列,而非取代它们。Sam Altman 本周一直在华盛顿向议员展示这些新模型。

为展示 Astra 解决复杂问题的能力,OpenAI 于本周六发布了一篇文章,介绍了 10 个计算机科学和数学问题的解决方案,其中大多数问题已经悬而未决多年。OpenAI 声称,这些解决方案是在测试期间由 Astra 的内部版本生成的。

该公司称,这些结果的预计总 token 成本约为 2,000 美元,按其当前旗舰模型 GPT-5.6 Sol 的 API 费率计算。该公司还表示:“如果将完全由 AI 系统生成的证明归于人类作者,就会歪曲该系统的贡献,也会误解真正人类智力劳动的本质。”

这是因为,过去有关 AI 数学解题成果的公告通常以人类作者署名,而模型仅被列为贡献者。然而,在 OpenAI 最新发表的文章中,模型本身被列为主要问题解决者,人类贡献者则负责准备论文稿件。

其中一个解决方案解决了抽象代数中称为群论的领域里的一个问题,并在官方公告前数小时被泄露到 X 上。Epoch AI 首席数学家 Elliot Glazer 很快这项工作称为迄今最重要的数学 AI 成果。

现就职于 OpenAI 的 AI 研究员 Sébastien Bubeck 开玩笑说,他原本预计 AI 要到 2030 年而不是 2026 年才会超越自己的数学能力。

解析 Astra 的解决方案

最先在 Twitter 上泄露的成果,解决了一个自数学家 Benjamin Weiss 于 2000 年创造“sofic”一词以来一直悬而未决的问题。简单来说,数学群是一组操作及其组合规则,有点类似于魔方的旋转。“sofic”群是这样一种群:如果放大观察系统的任意小部分,就能构建出一个有限版本,其行为几乎完全相同。

直到现在,还没有研究人员成功找出一个非 sofic 群;所有已知的群都表现出相同的性质。周六的披露标志着首个已知反例的出现。

其他九项成果则涉及数学的其他领域。其中一项推翻了数学家 Alain Connes 提出的一个长期存在的猜想,该猜想涉及某些数学结构的行为。另一项则为“在非常高维空间中能够将球体压紧到何种程度”这一问题找到了更优答案,刷新了自 1978 年以来一直保持的纪录。

为何有人对 OpenAI 的结果持怀疑态度

OpenAI 并不是唯一一家让其模型攻克未解数学问题的前沿 AI 开发商。据报道,由 Anthropic 开发的 Claude Fable 5 发现了一个反例,终结了存在 87 年之久的三变量 Jacobian 猜想。UCLA 数学家 Terence Tao 于 7 月 21 日公开验证了这一结果。

OpenAI 过去有关其模型数学能力的声明曾受到审查。7 月 10 日,该公司将一个循环双覆盖猜想的证明归功于 GPT-5.6 Sol Ultra。这是一个长期存在的数学问题,涉及网络中环路的排列。数学家 Sang-il Oum 和 Jim Geelen 分别撰写了对该论证的批评,而 Wolfram MathWorld 记录称,截至当月底,该声明尚未发表在经过同行评审的出版物中。

一些批评人士还对该公司过去自行报告并发布的基准测试结果表示怀疑。不过,最近的每项成果都附有 Lean证书——一种为计算机验证而编写的证明——以及论文稿件和对模型推理过程的叙述。尽管如此,必须注意的是,这些结果尚未经过传统的同行评审。