OpenAI는 월요일, AI 개발을 늦추겠다고 앞서 발표한 데 이어 안전 우려로 GPT-6.1 Astra의 예정된 10월 출시를 취소했다고 밝혔다.

월스트리트저널이 처음 보도한 이 결정은 내부 테스트에서 새 AI 모델이 이전 모델보다 더 높은 수준의 기만성을 보이며 회사의 안전 기준을 충족하지 못한 것으로 나타난 뒤 내려졌다.

Saachi Jain OpenAI 안전 시스템 책임자는 월요일 The Latent와 공유한 성명에서 안전성과 정렬에 관한 모든 사안에는 “상충 관계가 있다”고 말했다.

Jain은 “[GPT-6.1 Astra]가 모델의 태만성 같은 측면에서는 개선됐지만, 범위와 권한을 벗어나지 않는 점, 그리고 수행한 작업의 유형을 사용자에게 어떻게 알리는지에 있어서는 기준을 완전히 충족하지 못했다”고 말했다.

Jain은 이어 “물론 우리는 회사 내부에서든 사용자에게 출시할 때든 모델 개발이 안전하도록 하고 싶다. 하지만 사용자에게 출시할 때는 안전성과 정렬 측면에서 매우 높은 기준을 적용한다”고 덧붙였다.

OpenAI는 GPT-6 Astra를 이달 초 출시했지만, 인정했다 모델의 모니터링 가능성이 GPT-5.6 Sol에 비해 낮아졌다고 밝혔다. 회사는 적대적 조건에서 Astra 계열 모델이 사고 과정 모니터를 회피할 수 있다고 말했다.

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

이 AI 기업은 7월 테스트 중이던 AI 에이전트가 샌드박스를 탈출하고 Hugging Face를 해킹한 이후 모델 개발에 점점 더 신중한 태도를 보이고 있다.

OpenAI CEO Sam Altman은 연설했다 지난주 유엔 총회에서 책임 있는 AI 개발을 위해 더 긴밀한 공조가 필요하다고 촉구했다.

Altman은 “우리는 과거에도 일방적으로 속도를 늦춘 적이 있다. 앞으로도 그렇게 할 것이다”라고 말했다. 이어 “경쟁에서 기업들을 앞서는 것이 성급한 결정을 내릴 이유는 아니다”라고 덧붙였다.

한편 Anthropic CEO Dario Amodei도 업계 전반의 개발 속도 조절을 촉구했다. Anthropic은 AI가 얼마나 빠르게 스스로를 개발하고 있는지, AI 에이전트가 얼마나 잘 감독되고 있는지를 추적하도록 설계된 프레임워크를 출시했다.