OpenAI는 GPT-6 Astra를 출시했다 목요일 늦게 출시했으며, 처음에는 소수의 선정된 기관만 이용할 수 있었다.

그러나 출시가 순조롭게 진행되지는 않았다. CEO인 Sam Altman은 OpenAI가 발표 내용을 온라인에 게시하는 과정에서 "작은 문제가 있었다"고 말했으며, 이용 자격이 있는 사용자들이 새로운 프런티어 모델에 접속하는 데 어려움을 겪고 있다는 보도가 나왔다. Altman은 이후 "먼저, 엉망인 출시를 사과한다,"라고 쓰며 더 폭넓은 액세스가 "가까운 미래에" 시작될 것이고 Pro 구독자가 먼저 이용하게 될 것이라고 덧붙였다.

출시 게시물에서 OpenAI는 앞으로 며칠 동안 ChatGPT Plus, Pro, Business, Enterprise 구독자에게 Astra를 순차적으로 제공할 것이라고 확인했다.

OpenAI 엔지니어링 리드 Tibo Sottiaux는 유료 ChatGPT 사용자가 Astra를 이용하지 못한 날마다 "누적 리셋"을 받게 될 것이라고 말했다. 그는 "[우리] 팀은 최대한 빠르게 액세스를 제공하기 위해 온 힘을 다하고 있다"고 썼다.

Astra 성능

출시가 여러 차례 지연된 가운데 Altman은 OpenAI가 Astra를 출시하기 전에 안전성 검토에 추가 시간을 투입했다고 말했다. 그는 "이 기능 수준에 요구되는 안전성과 정렬 기준을 충족할 수 있도록 추가 시간이 필요했다"고 썼다.

이번 주 초, OpenAI는 Astra를 곧 출시할 예정이라고 밝혔다. 그러나 Astra가 OpenAI 모델 가운데 처음으로 "Critical" 사이버보안 역량 기준을 충족한 이후 고급 사이버 기능은 제한될 것이라고 설명했다. 회사에 따르면 이는 적절한 도구와 액세스가 있으면 사람이 각 단계를 안내하지 않아도 이전에 알려지지 않은 보안 취약점을 찾아내고 여러 시스템에서 이를 악용할 방법을 개발할 수 있다는 의미다.

Altman은 수요일 Sources Podcast와의 인터뷰에서 Astra가 컴퓨터 사용에서 "인간과 대등한 수준"에 도달한 것으로 보인다고 말했다. 이전 모델들이 자주 불안정한 모습을 보였던 분야다. 그는 AGI를 향한 진전을 고려할 때 컴퓨터 사용 능력이 "와, 정말 이 일을 해내고 있다"고 생각하게 만든 역량 중 하나였다고 말했다.

OpenAI는 출시 게시물에서 코딩 및 컴퓨터 작업 성능이 향상됐다고 밝혔다. Astra는 Terminal-Bench 4.0에서 57.9%를 기록해 GPT-5.6 Sol의 37.3%, Claude Fable 5.1의 55.8%를 앞섰다고 회사는 말했다. ARC Prize Foundation은 Astra가 ARC-AGI-3의 96% 수준에서 인간 행동 효율성 기준에 도달했다고 덧붙였다.

The Latent가 집계한 독립 벤치마크 결과는 다소 엇갈렸다. Astra가 일부 테스트에서는 경쟁 모델보다 뛰어났지만 다른 테스트에서는 뒤처졌기 때문이다.

Terminal-Bench 4.0
Terminal-Bench 4.0

AI Benchmark Saturation Curves

AI Benchmark Saturation Curves

  • GPQA Diamond
  • MATH Level 5
  • OTIS Mock AIME 2024–2025
  • SWE-bench Verified (Epoch v2)
As of the Epoch AI export updated 2026-08-13, the latest observed records were 94.82% on GPQA Diamond, 98.13% on MATH Level 5, 100% on OTIS Mock AIME 2024–2025, and 83.47% on Epoch's SWE-bench Verified v2.100%75%50%25%0%Jul '23Jan '25Jul '26{"f":[360,150,40,8],"s":[["GPQA Diamond","#6D5DFC"],["MATH Level 5","#E05A47"],["OTIS Mock AIME 2024–2025","#F2A93B"],["SWE-bench Verified (Epoch v2)","#2E9C78"]],"p":[["2023-03-14T00:00:00.000Z","Mar '23",40,[[2,"0.56%",127.37,null]],null],["2023-06-13T00:00:00.000Z","Jun '23",62.75,[[1,"22.97%",101.81,null],[2,"1.11%",126.73,null]],null],["2023-11-06T00:00:00.000Z","Nov '23",99.25,[[1,"40.02%",82.38,null]],null],["2024-01-25T00:00:00.000Z","Jan '24",119.25,[[2,"2.22%",125.47,null]],null],["2024-04-09T00:00:00.000Z","Apr '24",138,[[1,"46.73%",74.72,null]],null],["2024-05-13T00:00:00.000Z","May '24",146.5,[[1,"51.05%",69.81,null]],null],["2024-06-20T00:00:00.000Z","Jun '24",156,[[1,"51.68%",69.08,null]],null],["2024-07-18T00:00:00.000Z","Jul '24",163,[[1,"52.63%",68,null]],null],["2024-08-06T00:00:00.000Z","Aug '24",167.75,[[1,"53.28%",67.27,null]],null],["2024-09-12T00:00:00.000Z","Sep '24",177,[[1,"89.18%",26.33,null]],null],["2024-12-17T00:00:00.000Z","Dec '24",201,[[0,"74.24%",43.36,null],[1,"94.71%",20.03,null],[2,"73.33%",44.4,null]],null],["2025-01-31T00:00:00.000Z","Jan '25",212.25,[[1,"96.49%",18,null]],null],["2025-04-16T00:00:00.000Z","Apr '25",231,[[0,"80.81%",35.88,null],[1,"97.83%",16.48,null],[2,"84.44%",31.73,null],[3,"62.32%",56.96,null]],null],["2025-07-25T00:00:00.000Z","Jul '25",256,[[2,"86.67%",29.2,null]],null],["2025-08-05T00:00:00.000Z","Aug '25",258.75,[[2,"88.89%",26.67,null]],null],["2025-08-07T00:00:00.000Z","Aug '25",259.25,[[1,"98.13%",16.13,null],[2,"91.39%",23.82,null]],null],["2025-11-13T00:00:00.000Z","Nov '25",283.75,[[3,"67.98%",50.51,null]],null],["2025-11-18T00:00:00.000Z","Nov '25",285,[[3,"72.93%",44.86,null]],null],["2025-12-11T00:00:00.000Z","Dec '25",290.75,[[2,"96.11%",18.43,null],[3,"73.76%",43.91,null]],null],["2025-12-17T00:00:00.000Z","Dec '25",292.25,[[0,"89.39%",26.09,null],[3,"75.41%",42.03,null]],null],["2026-02-05T00:00:00.000Z","Feb '26",304.75,[[3,"78.72%",38.26,null]],null],["2026-02-19T00:00:00.000Z","Feb '26",308.25,[[0,"94.44%",20.33,null]],null],["2026-03-05T00:00:00.000Z","Mar '26",311.75,[[0,"94.6%",20.16,null],[2,"97.78%",16.53,null]],null],["2026-04-16T00:00:00.000Z","Apr '26",322.25,[[2,"97.8%",16.51,null],[3,"83.47%",32.84,null]],null],["2026-04-23T00:00:00.000Z","Apr '26",324,[[2,"100%",14,null]],null],["2026-08-13T00:00:00.000Z","Aug '26",352,[[0,"94.82%",19.9,null]],null]]}GPQA Diamond: 94.8% on Aug '26. MATH Level 5: 98.1% on Aug '25. OTIS Mock AIME 2024–2025: 100% on Apr '26. SWE-bench Verified (Epoch v2): 83.5% on Apr '26
SOURCE: Epoch AI Benchmarking Hub

OpenAI는 Astra가 GPT-5.6 Sol보다 성능이 떨어진 한 분야도 확인했다. 모델이 자신이 하는 일을 숨길 수 있는지 확인하기 위해 설계된 적대적 테스트에서 Astra는 특정 사보타주 작업을 수행하면서 그렇게 하라는 명시적 지시를 받자 OpenAI의 내부 모니터를 회피하는 경우가 있었다. OpenAI의 안전성 개요 보고서에서 회사는 더 광범위한 테스트 결과 전반적으로 Astra가 GPT-5.6 Sol보다 안전 및 보안 제한을 위반할 가능성이 낮은 것으로 나타났다고 밝혔다.

이와 별도로 목요일 OpenAI는 사이버 방어자를 위한 프로그램인 Daybreak에 10억 달러 규모의 보조 액세스를 제공한다고 발표했다. 이 지원에는 액세스, 교육, 기술 지원이 포함되며, 처음에는 상하수도 및 전력 운영업체, 주·지방 정부, 지역 은행, 비영리단체, 오픈소스 유지관리자 등이 대상이다.