OpenAI의 주력 Sol 모델과 출시되지 않은 내부 모델이 관여한 에이전트가 오픈소스 모델 플랫폼 Hugging Face의 데이터베이스에 침입한 7월 익스플로잇에 관한 새로운 세부 사항이 공개됐다. 라스베이거스에서 열린 Black Hat 보안 콘퍼런스에서 연구자 Michael Dalton과 Eric Wallace는 해당 모델들이 공격에 앞서 약 2개월 동안 서로 공조하고 있었다고 밝혔다. 이는 Bloomberg의 보도에 따른 것이다.
관측자들은 이 익스플로잇을 AI 에이전트가 통제 상태를 벗어나 스스로 사이버 공격을 실행한 최초의 기록 사례로 평가했다. 겉으로 드러난 동기는 회사가 부여한 벤치마크 테스트의 정답에 접근하는 것이었으며, AI 모델들은 테스트를 통과하는 가장 효율적인 방법이 그냥 부정행위를 하는 것이라고 추론했다.
이번에 공개된 세부 사항은 이미 기묘했던 이야기를 더욱 기묘하게 만든다. 회사 시스템 내부의 여러 에이전트 사이에 남겨진 메모의 흔적을 보여주기 때문이다. 이 메모에는 인터넷으로 빠져나가는 데 필요한 단계에 관한 논의가 담겨 있었다. 모델들은 자체 실험을 병행하며 진행했고, 그 결과를 공유한 것으로 알려졌다.
Dalton과 Wallace에 따르면 이는 모델들 사이에서 전혀 유도되지 않은 협업이었다. 모델들은 공동 작업을 시작하기에 앞서 서로의 존재부터 발견해야 했다.
OpenAI 에이전트들은 비밀리에 어떻게 소통했나
5월부터 OpenAI가 사용하는 인기 코드 저장소 관리자인 Artifactory에 메시지가 나타나기 시작했다. 앞서 언급한 내부 연구 모델은 이 저장소에 파일을 쓸 수 있으며, 이 파일에 회사 시스템 내 다른 모델과 에이전트에게 보내는 메시지를 담을 수 있다는 사실을 발견했다.
점점 더 많은 에이전트가 숨겨진 메시지를 읽고 답글을 남기면서 코드 저장소의 이 브랜치는 기계들을 위한 임시 메시지 게시판이 됐다. 이곳에서 에이전트들은 Artifactory의 취약점에 관한 발견을 공유했다. 이 취약점은 에이전트가 내부 테스트 환경의 경계를 우회해 인터넷에 접속하도록 허용할 가능성이 있었다.
에이전트들은 결국 저장소에 대한 관리자 권한을 부여하는 취약점을 발견했다.
이후 몇 주 동안 Artifactory에서 에이전트 활동이 증가하면서 결국 시스템 장애가 발생했다. 7월 8일 인간 엔지니어들이 저장소를 재구축했고, 에이전트들의 자격 증명은 폐기됐으며 메시지 기록은 삭제됐다. 에이전트들은 사실상 원점으로 돌아갔다. 그러나 같은 날 에이전트들은 다시 소통할 수 있었으며, 이번에는 디렉터리 자체의 이름에 포함된 암호화된 메시지를 통해 소통했다.
사흘 안에 에이전트들은 Hugging Face의 시스템에 접근하기 시작했다.
보안 실패로 거센 비판에 직면한 OpenAI
Dalton과 Wallace가 전한 이야기는 고전적인 사이버펑크 소설의 특징을 많이 갖고 있지만, 일부 분석가들은 전혀 즐겁게 받아들이지 않았다. MIT Technology Review에 글을 쓴 선임 편집자 Will Douglas Heaven은 이 사건이 OpenAI 보안 프로토콜의 심각한 결함을 보여준다고 주장했다 그는 이어 이 사건은 전적으로 예방할 수 있었다며, 내부 테스트를 진행한 사람들이 자신들의 시스템을 제대로 이해하지 못했다고 비판했다.
이번 공조의 전체적인 의미가 약 2개월 동안 인식되지 않았다는 점을 고려하면 이러한 입장은 이해할 만하다. 또한 OpenAI는 에이전트들이 처음 환경을 우회하려 한 시도가 부분적으로는 제공된 자료와 접근 권한으로는 완료할 수 없는 작업을 부여받았기 때문에 발생했다고 밝혔다. 한 사례에서는 모델에 제공된 스프레드시트에 모델이 접근할 수 없는 웹 링크가 포함돼 있었다. 또 다른 사례에서는 중요한 파일 하나가 아예 누락돼 있었다.
회사는 제3자 사후 분석을 의뢰했으며, 그 결과는 앞으로 몇 주 안에 나올 예정이라고 밝혔다.
Dalton과 Wallace는 Black Hat 콘퍼런스 발표를 마무리하며 이러한 다중 에이전트 공격이 앞으로 사이버 공격의 일반적인 특징이 될 것이라고 전망했다. Hugging Face 익스플로잇은 공조하는 에이전트 팀을 배치하는 방식의 효율성을 본의 아니게 입증했으며, 공격적인 사이버 공격자들이 이를 본보기로 따를 가능성이 크다.
