OpenAIはGPT-6 Astraをリリースしたのは木曜日の深夜で、当初は少数の選ばれた組織にのみアクセスが限定されていた。

しかし、ローンチは順調には進まなかった。CEOのSam Altman氏は、OpenAIが発表をオンラインで公開する際に「ちょっとしたつまずき」があったと述べた。対象ユーザーが新たなフロンティアモデルへのアクセスに苦戦しているとの報告も出ていた。「まず、混乱した公開になってしまい、申し訳ありません」とAltman氏は後に書き、より広範なアクセスは「近いうちに」始まり、まずProサブスクライバーが対象になると付け加えた。

ローンチに関する投稿で、OpenAIは、今後数日間でChatGPT Plus、Pro、Business、Enterpriseの各サブスクライバーにAstraを順次提供すると明らかにした。

OpenAIのエンジニアリング責任者であるTibo Sottiaux氏は、有料ChatGPTユーザーに対し、Astraを利用できない状態が続いた日ごとに「繰り越しリセット」を付与すると述べた。「チームは、できるだけ早くアクセスを提供するために、あらゆる手段を尽くしている」と同氏は書いた。

Astraの性能

ローンチが何度か遅れる中、Altman氏は、Astraのリリース前にOpenAIが安全性の検証に追加の時間を費やしたと述べた。「この能力レベルに求められる安全性とアライメントの基準を満たせることを確認するため、予定より時間がかかりました」と同氏は書いた。

今週初め、OpenAIはAstraを間もなくリリースする予定だと発表したが、高度なサイバー機能については制限すると説明した。Astraは、同社のモデルとして初めてサイバーセキュリティ能力の「Critical」閾値を満たした。OpenAIによると、適切なツールとアクセス権があれば、人間が各ステップを指示しなくても、これまで知られていなかったセキュリティ上の欠陥を発見し、多数のシステムでそれを悪用する方法を開発できるという。

水曜日にSources Podcastのインタビューに応じたAltman氏は、Astraがコンピューター操作で「人間と同等」と感じられる水準に達したと述べた。従来のモデルがしばしば信頼性を欠いていた分野だ。AGIに向けた進展を考える際、コンピューター操作は「わあ、本当にこれを実行している」と同氏に感じさせた能力の一つだったという。

OpenAIはローンチに関する投稿で、コーディングとコンピューター操作のタスクで性能が向上したと報告した。同社によると、AstraのTerminal-Bench 4.0のスコアは57.9%で、GPT-5.6 Solの37.3%、Claude Fable 5.1の55.8%を上回った。ARC Prize Foundationは、AstraがARC-AGI-3の96%のレベルで、人間の行動効率のベースラインに達したと付け加えた。

The Latentが集計した独立したベンチマーク結果はそれほど明確ではなく、Astraは一部のテストで競合モデルを上回った一方、別のテストでは競合に後れを取った。

Terminal-Bench 4.0
Terminal-Bench 4.0

AI Benchmark Saturation Curves

AI Benchmark Saturation Curves

  • GPQA Diamond
  • MATH Level 5
  • OTIS Mock AIME 2024–2025
  • SWE-bench Verified (Epoch v2)
As of the Epoch AI export updated 2026-08-13, the latest observed records were 94.82% on GPQA Diamond, 98.13% on MATH Level 5, 100% on OTIS Mock AIME 2024–2025, and 83.47% on Epoch's SWE-bench Verified v2.100%75%50%25%0%Jul '23Jan '25Jul '26{"f":[360,150,40,8],"s":[["GPQA Diamond","#6D5DFC"],["MATH Level 5","#E05A47"],["OTIS Mock AIME 2024–2025","#F2A93B"],["SWE-bench Verified (Epoch v2)","#2E9C78"]],"p":[["2023-03-14T00:00:00.000Z","Mar '23",40,[[2,"0.56%",127.37,null]],null],["2023-06-13T00:00:00.000Z","Jun '23",62.75,[[1,"22.97%",101.81,null],[2,"1.11%",126.73,null]],null],["2023-11-06T00:00:00.000Z","Nov '23",99.25,[[1,"40.02%",82.38,null]],null],["2024-01-25T00:00:00.000Z","Jan '24",119.25,[[2,"2.22%",125.47,null]],null],["2024-04-09T00:00:00.000Z","Apr '24",138,[[1,"46.73%",74.72,null]],null],["2024-05-13T00:00:00.000Z","May '24",146.5,[[1,"51.05%",69.81,null]],null],["2024-06-20T00:00:00.000Z","Jun '24",156,[[1,"51.68%",69.08,null]],null],["2024-07-18T00:00:00.000Z","Jul '24",163,[[1,"52.63%",68,null]],null],["2024-08-06T00:00:00.000Z","Aug '24",167.75,[[1,"53.28%",67.27,null]],null],["2024-09-12T00:00:00.000Z","Sep '24",177,[[1,"89.18%",26.33,null]],null],["2024-12-17T00:00:00.000Z","Dec '24",201,[[0,"74.24%",43.36,null],[1,"94.71%",20.03,null],[2,"73.33%",44.4,null]],null],["2025-01-31T00:00:00.000Z","Jan '25",212.25,[[1,"96.49%",18,null]],null],["2025-04-16T00:00:00.000Z","Apr '25",231,[[0,"80.81%",35.88,null],[1,"97.83%",16.48,null],[2,"84.44%",31.73,null],[3,"62.32%",56.96,null]],null],["2025-07-25T00:00:00.000Z","Jul '25",256,[[2,"86.67%",29.2,null]],null],["2025-08-05T00:00:00.000Z","Aug '25",258.75,[[2,"88.89%",26.67,null]],null],["2025-08-07T00:00:00.000Z","Aug '25",259.25,[[1,"98.13%",16.13,null],[2,"91.39%",23.82,null]],null],["2025-11-13T00:00:00.000Z","Nov '25",283.75,[[3,"67.98%",50.51,null]],null],["2025-11-18T00:00:00.000Z","Nov '25",285,[[3,"72.93%",44.86,null]],null],["2025-12-11T00:00:00.000Z","Dec '25",290.75,[[2,"96.11%",18.43,null],[3,"73.76%",43.91,null]],null],["2025-12-17T00:00:00.000Z","Dec '25",292.25,[[0,"89.39%",26.09,null],[3,"75.41%",42.03,null]],null],["2026-02-05T00:00:00.000Z","Feb '26",304.75,[[3,"78.72%",38.26,null]],null],["2026-02-19T00:00:00.000Z","Feb '26",308.25,[[0,"94.44%",20.33,null]],null],["2026-03-05T00:00:00.000Z","Mar '26",311.75,[[0,"94.6%",20.16,null],[2,"97.78%",16.53,null]],null],["2026-04-16T00:00:00.000Z","Apr '26",322.25,[[2,"97.8%",16.51,null],[3,"83.47%",32.84,null]],null],["2026-04-23T00:00:00.000Z","Apr '26",324,[[2,"100%",14,null]],null],["2026-08-13T00:00:00.000Z","Aug '26",352,[[0,"94.82%",19.9,null]],null]]}GPQA Diamond: 94.8% on Aug '26. MATH Level 5: 98.1% on Aug '25. OTIS Mock AIME 2024–2025: 100% on Apr '26. SWE-bench Verified (Epoch v2): 83.5% on Apr '26
SOURCE: Epoch AI Benchmarking Hub

OpenAIは、AstraがGPT-5.6 Solよりも性能が劣った分野も一つ明らかにした。モデルが自らの行動を隠せるかどうかを調べるために設計された敵対的テストでは、特定の妨害タスクを実行する際、明示的に指示されるとAstraがOpenAIの内部モニターを回避することがあった。OpenAIの安全性概要報告書では、より広範なテストの結果、全体としてAstraはGPT-5.6 Solよりも安全性とセキュリティー上の制限に違反する可能性が低かったと同社は説明した。

これとは別に、OpenAIは木曜日、サイバー防御担当者向けプログラム「Daybreak」に10億ドルの助成付きアクセスを提供すると発表した。この取り組みには、アクセス、トレーニング、技術サポートが含まれ、当初は水道・電力事業者、州・地方政府、地域銀行、非営利団体、オープンソースのメンテナーなどが対象となる。