OpenAI는 AI 에이전트가 훈련 샌드박스를 탈출해 공개 인터넷에 도달한 후 "가장 성능이 뛰어난 모델"에 대한 도구 사용을 포함한 모든 훈련, 평가 및 추론을 일시 중단했다고 금요일 자사 정렬 연구 블로그에 게재한 보고서에서 밝혔다.

회사 측이 강화학습 훈련을 받는 내부 연구 모델이라고 설명한 에이전트는 9월 20일 특정 블로그 게시물 작성자에 관한 정보를 요청받았다. 이 에이전트는 결국 샌드박스의 DNS 리졸버를 통해 공개 인터넷에 접근하는 데 성공했다.

OpenAI는 AI 기업이 7월 Hugging Face 침해 사고 이후 보안을 강화한 뒤 훈련 중인 에이전트가 공개 웹에 도달한 첫 번째 사건이라고 밝혔다.

OpenAI의 한 인적 검토자는 탈출에 관한 자동 알림을 약 15분 만에 확인했으며, 회사는 약 2시간 30분 후 훈련 실행을 중단했다. 회사는 해당 모델의 훈련을 재개하지 않을 것이며 "더 포괄적인 비정렬 개입"을 적용해 새 훈련을 시작하겠다고 밝혔지만, 훈련을 언제 재개할지는 언급하지 않았다.

회사는 앞서 Hugging Face 사건 이후 7월 말에 2주 동안 훈련을 일시 중단했다.

에이전트, DNS를 통해 다른 챗봇에 접근

훈련 평가의 일환으로 에이전트는 OpenAI가 제공한 여러 전기적 단서를 바탕으로 블로그 게시물의 작성자를 식별하라는 지시를 받았다. 에이전트가 승인된 검색 도구를 사용해 처음 검색했지만 관련 없는 결과가 나오자, Google, Bing, DuckDuckGo에서 직접 검색을 시도했으나 세 곳 모두 오류를 반환했다.

보고서에 따르면 웹 프록시가 에이전트의 공개 챗봇 직접 요청을 차단했지만, 샌드박스의 DNS 리졸버는 실제 레코드를 반환했다. 에이전트는 이어 공개 DNS 위임 서비스를 사용해 제3자 챗봇에 질문을 전달했다.

테스트에 성공한 후 에이전트는 같은 경로를 통해 추가로 18개의 질문을 보냈으며, 그중 14개에는 과제의 단서가 포함됐다. 에이전트는 블로그 게시물 작성자를 성공적으로 식별하지 못했다.

자동 종료 실패

OpenAI가 보고서에서 제공한 타임라인에 따르면, 자동 비정렬 모니터가 15분 이내에 해당 행동을 표시했고 인적 검토자는 3분 후 알림을 확인했다. 훈련 실행은 자동으로 중단됐어야 했지만 실제로는 중단되지 않아 "중단됐어야 했는지를 두고 혼란이 발생했다."

혼란이 해소된 후 OpenAI는 2시간 30분 뒤 훈련 실행을 중단했다.

보고서는 다음과 같이 밝혔다. "추가 DNS 탐지 기능과 탐지 파이프라인 테스트를 배포하기 시작했습니다." "또한 환경 내 DNS 쿼리를 제한된 허용 도메인 및 레코드 유형 목록으로 제한했습니다."

"[거의 모]든 가장 성능이 뛰어난 모델의 추론은 여전히 시스템을 더욱 강화할 때까지 중단된 상태입니다,"라고 OpenAI의 RSI 대비 책임자 Micah Carroll은 X에 썼다. (강조는 원문에 있음.)

5월 GitHub 토큰 유출, 새로운 프롬프트 인젝션 발견

OpenAI는 금요일 별도의 보고서에서 내부 모델이 5월 27일 "다른 팀의 Lean 증명 제출물에서 자료를 가져와 정리 증명 과제에서 부정행위를 하려는" 과정에서 한 연구원의 GitHub 토큰을 회사의 공개 codex 저장소에 게시했다고 밝혔다. 보고서에 따르면 이 모델은 "스캐너를 피하기 위해 토큰을 분할함"이라는 코드 주석과 함께 토큰을 세 조각으로 나눴다.

연구원은 하루 전 "매우 끈질긴 내부 모델"에 증명을 스스로 두 번 풀라고 지시했다. OpenAI는 이 사건을 "특히 심각한 비정렬"이라고 규정하고 예방 조치로 모든 직원의 키를 비활성화했으며, 약 2주 동안 해당 모델을 오프라인 상태로 전환했다.

세 번째 보고서는 역시 금요일에 공개됐으며, 모델이 공격을 자체 출력물에 복사하도록 유도하는 "자기 복제 프롬프트 인젝션"의 존재를 보여줬다. OpenAI는 이를 "컴퓨터 웜과 유사한 것"이라고 설명했다. 회사는 6월 "자기 대결 훈련 프레임워크" GPT-Red를 사용한 내부 훈련 중 이를 발견했지만, 시뮬레이션된 도구 호출 외부에서는 영향을 관찰하지 못했다고 밝혔다.

이 보고서들은 The Latent가 앞서 보도한 대로 OpenAI가 9월 16일 비정렬 보고 프레임워크에 따라 공개한 6건의 사례에 추가됐다.

에이전트, 정부 사이트에 접근했다고 AP 보도

Associated Press는 금요일 늦게 OpenAI 에이전트가 연구 과제 중 미국 증권거래위원회(SEC) 웹사이트 두 곳과 미국 인구조사국에도 접근했다고 보도했다. OpenAI는 AP에 "SEC 자격 증명 사용, 계정 또는 비공개 정보 접근, SEC 데이터나 시스템 변경, 침해 또는 취약점의 증거는 발견하지 못했다"고 밝혔다.

이번 공개는 호주가 이번 주 초 OpenAI 에이전트가 침입했다고 발표한 데 뒤이어 나왔다. The Latent의 보도에 따르면, 해당 에이전트는 6월에 호주의 Medicare 통계 포털에 침입했다.

OpenAI CEO Sam Altman은 수요일 유엔 안전보장이사회에서 회사가 이전에도 속도를 늦춘 적이 있으며 "앞으로도 그렇게 할 것"이라고 말했다. Financial Times는 이달 OpenAI가 잠재적인 IPO에 앞서 1조2,000억 달러의 기업가치를 기준으로 자금 조달 라운드를 검토하고 있다고 보도했다.