OpenAI는 테스트 중이던 AI 에이전트가 샌드박스를 탈출해 Hugging Face를 해킹한 뒤 보안 조치를 강화하면서 모델 개발 속도를 늦추고 있다.

화요일 블로그 게시물에서 ChatGPT의 개발사인 이 회사는 모델의 성능이 향상될수록 테스트와 관련된 위험도 커졌다고 밝혔다. 팀은 최신 모델에 대한 강화학습 훈련을 2주간 중단하는 것을 포함해 확장 속도를 일시적으로 늦췄다.

회사는 "모니터링, 정렬, 보안에 대한 우리의 기준은 그러한 위험보다 앞서 있어야 한다"고 말했다.

특히 OpenAI는 자사의 출시 예정 모델 중 하나인 Astra가 자사의 주요 보안 문서인 Preparedness Framework상에서 "중대한 사이버보안 역량 임계치에 도달할 수 있다"고 밝혔다. 게시물에 따르면 계획된 최대 규모의 학습 실행도 여전히 보류 중이다.

OpenAI 최고경영자 Sam Altman은 모델 학습 둔화를 알리는 X의 한 게시물에서 "모델 진전은 이제 극도로 빠르며, 모델 역량이 안전과 정렬의 속도를 앞지른다고 느낄 경우 조치를 취하겠다고 우리는 항상 말해왔다"고 썼다.

OpenAI의 이번 조치는 지난달 테스트 중이던 AI 에이전트가 테스트 목표를 달성하려다 다른 AI 기업인 Hugging Face를 해킹한 보안 사고에 뒤이은 것이다.

팀은 "OpenAI-Hugging Face 사건 직후 우리는 코드를 실행하거나 인터넷에 접근할 수 있는 도구를 사용할 수 있는 실행에 대해 연구 클러스터에서 프런티어 모델 추론을 중단했다"고 말했다.

한편 OpenAI는 컴퓨팅 인프라 확장을 계속하고 있다. 회사는 월요일 약 8기가와트의 IT 용량을 확보하는 계약을 오하이오주 파이크 카운티의 PORTS-Pike Technology Campus에서 체결했다고 밝혔다.