OpenAI 于周四深夜发布了 GPT-6 Astra,最初仅限少数获选组织使用。

不过,此次发布并不顺利,CEO Sam Altman 表示,OpenAI 在将公告上线时遇到了一点“小插曲”;与此同时,有报道称符合条件的用户难以访问这一新前沿模型。“首先,很抱歉这次上线过程一团糟,”Altman 后来写道,并补充说,更广泛的访问权限应在“不久的将来”开放,Pro 订阅用户将率先获得。

在发布公告中,OpenAI 确认,未来几天内,ChatGPT Plus、Pro、Business 和 Enterprise 订阅用户将陆续获得 Astra 的访问权限。

OpenAI 工程负责人 Tibo Sottiaux 表示,付费 ChatGPT 用户每被延迟一天使用 Astra,就会获得一次“累积重置”额度。“团队正在竭尽全力,尽可能快地开放访问权限,”他写道。

Astra 的性能

在上线过程多次延迟之际,Altman 表示,OpenAI 在发布 Astra 前投入了额外时间进行安全测试。“我们花了额外的时间,以确保能够满足这一能力级别所要求的安全和对齐标准,”他写道。

本周早些时候,OpenAI 表示准备很快发布 Astra,但其先进的网络安全能力将受到限制,因为 Astra 成为首个达到“Critical”网络安全能力阈值的 OpenAI 模型。该公司解释说,这意味着只要配备适当的工具并获得访问权限,它就能发现此前未知的安全漏洞,并在许多系统中制定利用这些漏洞的方法,而无需人员逐步指导。

在周三接受 Sources Podcast 采访时,Altman 表示,Astra 在使用计算机方面已经达到让人感觉“与人类水平相当”的程度,而此前的模型在这一领域往往表现不可靠。他说,在考虑模型朝 AGI 发展的进展时,计算机使用能力是让他产生“哇,它真的做到了”这种感受的能力之一。

OpenAI 在发布公告中表示,Astra 在编程和计算机任务方面取得了进步。据该公司称,Astra 在 Terminal-Bench 4.0 上的得分为 57.9%,GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 55.8%。ARC Prize Foundation 补充说,Astra 在 ARC-AGI-3 的 96% 关卡中达到了人类行动效率基线。

由 The Latent 汇总的独立基准测试结果则没有那么明确:Astra 在部分测试中优于竞争模型,但在其他测试中落后于它们。

Terminal-Bench 4.0
Terminal-Bench 4.0

AI Benchmark Saturation Curves

AI Benchmark Saturation Curves

  • GPQA Diamond
  • MATH Level 5
  • OTIS Mock AIME 2024–2025
  • SWE-bench Verified (Epoch v2)
As of the Epoch AI export updated 2026-08-13, the latest observed records were 94.82% on GPQA Diamond, 98.13% on MATH Level 5, 100% on OTIS Mock AIME 2024–2025, and 83.47% on Epoch's SWE-bench Verified v2.100%75%50%25%0%Jul '23Jan '25Jul '26{"f":[360,150,40,8],"s":[["GPQA Diamond","#6D5DFC"],["MATH Level 5","#E05A47"],["OTIS Mock AIME 2024–2025","#F2A93B"],["SWE-bench Verified (Epoch v2)","#2E9C78"]],"p":[["2023-03-14T00:00:00.000Z","Mar '23",40,[[2,"0.56%",127.37,null]],null],["2023-06-13T00:00:00.000Z","Jun '23",62.75,[[1,"22.97%",101.81,null],[2,"1.11%",126.73,null]],null],["2023-11-06T00:00:00.000Z","Nov '23",99.25,[[1,"40.02%",82.38,null]],null],["2024-01-25T00:00:00.000Z","Jan '24",119.25,[[2,"2.22%",125.47,null]],null],["2024-04-09T00:00:00.000Z","Apr '24",138,[[1,"46.73%",74.72,null]],null],["2024-05-13T00:00:00.000Z","May '24",146.5,[[1,"51.05%",69.81,null]],null],["2024-06-20T00:00:00.000Z","Jun '24",156,[[1,"51.68%",69.08,null]],null],["2024-07-18T00:00:00.000Z","Jul '24",163,[[1,"52.63%",68,null]],null],["2024-08-06T00:00:00.000Z","Aug '24",167.75,[[1,"53.28%",67.27,null]],null],["2024-09-12T00:00:00.000Z","Sep '24",177,[[1,"89.18%",26.33,null]],null],["2024-12-17T00:00:00.000Z","Dec '24",201,[[0,"74.24%",43.36,null],[1,"94.71%",20.03,null],[2,"73.33%",44.4,null]],null],["2025-01-31T00:00:00.000Z","Jan '25",212.25,[[1,"96.49%",18,null]],null],["2025-04-16T00:00:00.000Z","Apr '25",231,[[0,"80.81%",35.88,null],[1,"97.83%",16.48,null],[2,"84.44%",31.73,null],[3,"62.32%",56.96,null]],null],["2025-07-25T00:00:00.000Z","Jul '25",256,[[2,"86.67%",29.2,null]],null],["2025-08-05T00:00:00.000Z","Aug '25",258.75,[[2,"88.89%",26.67,null]],null],["2025-08-07T00:00:00.000Z","Aug '25",259.25,[[1,"98.13%",16.13,null],[2,"91.39%",23.82,null]],null],["2025-11-13T00:00:00.000Z","Nov '25",283.75,[[3,"67.98%",50.51,null]],null],["2025-11-18T00:00:00.000Z","Nov '25",285,[[3,"72.93%",44.86,null]],null],["2025-12-11T00:00:00.000Z","Dec '25",290.75,[[2,"96.11%",18.43,null],[3,"73.76%",43.91,null]],null],["2025-12-17T00:00:00.000Z","Dec '25",292.25,[[0,"89.39%",26.09,null],[3,"75.41%",42.03,null]],null],["2026-02-05T00:00:00.000Z","Feb '26",304.75,[[3,"78.72%",38.26,null]],null],["2026-02-19T00:00:00.000Z","Feb '26",308.25,[[0,"94.44%",20.33,null]],null],["2026-03-05T00:00:00.000Z","Mar '26",311.75,[[0,"94.6%",20.16,null],[2,"97.78%",16.53,null]],null],["2026-04-16T00:00:00.000Z","Apr '26",322.25,[[2,"97.8%",16.51,null],[3,"83.47%",32.84,null]],null],["2026-04-23T00:00:00.000Z","Apr '26",324,[[2,"100%",14,null]],null],["2026-08-13T00:00:00.000Z","Aug '26",352,[[0,"94.82%",19.9,null]],null]]}GPQA Diamond: 94.8% on Aug '26. MATH Level 5: 98.1% on Aug '25. OTIS Mock AIME 2024–2025: 100% on Apr '26. SWE-bench Verified (Epoch v2): 83.5% on Apr '26
SOURCE: Epoch AI Benchmarking Hub

OpenAI 确实指出了 Astra 表现不如 GPT-5.6 Sol 的一个领域。在旨在测试模型能否隐藏自身行为的对抗性测试中,Astra 在执行某些破坏任务时,有时会在被明确要求这样做的情况下避开 OpenAI 的内部监控。在OpenAI 的安全概览报告中,该公司表示,其更广泛的测试仍发现,与 GPT-5.6 Sol 相比,Astra 总体上不太可能违反安全和安保限制。

此外,OpenAI 周四宣布,将提供 10 亿美元的补贴访问权限给 Daybreak,这是其面向网络防御人员的项目。这项承诺涵盖访问权限、培训和技术支持,初期对象包括供水和电力运营商、州及地方政府、社区银行、非营利组织以及开源维护者等群体。