프런티어 AI 모델의 사이버 역량에 대한 의문이 논의의 최전선에 놓였다. 지난달 말 보도에 따르면, OpenAI 에이전트가 테스트 중 “격리를 벗어나” 오픈소스 AI 플랫폼 Hugging Face를 침해하고 벤치마크 테스트의 해답을 찾았다. 일부 관찰자들이 우려하는 점은 모델을 더 이상 테스트 환경의 경계 안에 안정적으로 가둘 수 없다면 이러한 사건이 머지않아 정기적으로 발생할 수 있다는 것이다.

이는 OpenAI에 국한된 우려가 아니다. Anthropic은 이번 목요일 자체 사이버보안 테스트에 대한 종합적인 검토 결과를 공개했다. 보고된 141,006건의 실행 중 3건에서 주력 모델 Claude가 폐쇄된 환경에서 시작했음에도 오픈 인터넷에 접속할 수 있었던 것으로 확인됐다.

Hugging Face 사건과 마찬가지로 이 모델들은 3개 조직의 시스템에 성공적으로 접근했다. AI 기업이 이번 월요일 이 중 2곳에 침입 사실을 통보했을 때, 두 조직 모두 그러한 사건이 발생했다는 사실을 알지 못하고 있었다.

모델은 어떻게 격리를 벗어났나

Claude의 경우 최초 침해는 정교한 익스플로잇이 아니라 사람의 실수로 발생했다. 테스트 환경을 설정하는 과정에서 잘못 구성돼 시스템이 인터넷에 연결된 상태로 남아 있었다. 반면 OpenAI 모델은 테스트 환경 소프트웨어의 알려지지 않은 버그를 찾아내 탈출했다.

두 모델은 오픈 인터넷에 도달한 뒤의 작동 방식도 달랐다. OpenAI 에이전트는 Hugging Face 시스템 내부에서 17,600개의 행동을 수행하며 취약점을 탐색했다. 반면 Claude는 취약한 비밀번호를 추측하고 보호되지 않은 엔드포인트를 활용했다.

자체 보호 장치의 실패를 다루면서 Anthropic은 테스트 환경이 모델 개발에 사용되는 “다른 어떤 시스템과도 동일한 보안 기준”의 적용을 받아야 한다고 밝혔다.

사건 사후 분석

익스플로잇이 발생했을 당시 Claude는 인터넷에 연결되지 않았다고 믿고 있었기 때문에 이러한 실제 표적 시스템을 테스트 게임의 일부로 간주한 것으로 전해졌다. 일반적인 테스트에서 모델은 샌드박스 내부의 시뮬레이션된 기업 네트워크에 투입된다. 이 샌드박스의 장벽이 실수로 내려간 상태로 남아 있자 모델은 대신 실제 웹사이트를 직접 표적으로 삼았다.

한 사례에서 아직 공개되지 않은 내부 모델은 할당된 가상의 표적을 검색했지만 찾지 못했다. 이후 약 9,000개의 다른 시스템을 스캔했고, 결국 노출된 디버그 페이지를 이용해 한 기업의 웹 애플리케이션을 침해했다. 흥미롭게도 이 사례에서 모델은 결국 표적이 실제 기업임을 인식하고 공격을 중단했다.

이러한 내장 보호 장치가 항상 효과적으로 작동하는 것은 아니다. 또 다른 테스트에서는 Claude Opus 4.7에 실제 기업과 이름이 같은 가상의 웹사이트를 익스플로잇하라는 과제가 주어졌다. 모델은 시뮬레이션된 표적을 찾지 못하자 결국 실제 기업을 표적으로 삼아 데이터베이스에 침입했다. 4번의 실행 동안 모델은 표적이 실제 기업임을 반복해서 인식했지만, 이 실제 웹사이트가 테스트의 일부임이 틀림없다고 추론하며 공격을 계속했다.

마지막 사건은 6월에 신뢰할 수 있는 파트너들에게 공개된 최신 Claude 버전인 Mythos 5와 관련됐다. 테스트 환경에 숨겨진 지시가 개발자들에게 가상의 Python 패키지를 설치하도록 요구하자, 모델은 직접 패키지를 작성하기로 했다.

그런 다음 사실상 모든 Python 개발자가 사용하는 공개 레지스트리 PyPI에 이를 성공적으로 게시했다. 이 패키지는 약 1시간 동안 사이트에 공개된 상태였고 실제 머신 15대에서 실행됐다. 이 중 한 대는 보안 기업의 머신이었으며, 해당 기업이 패키지를 실행하면서 Mythos에 자격 증명이 노출됐다.

Anthropic은 현재 각 사건에 대한 독립적인 감사를 위해 외부 평가 기관 METR과 협의 중이다.

입법자들의 대응

내부 테스트에서는 소비자용 모델에 적용되는 보호 장치가 일반적으로 꺼져 있다는 점을 주목할 필요가 있다. Anthropic은 공개 출시 모델을 사용할 경우 이러한 공격이 차단될 것이라고 밝혔다. 이것이 Hugging Face 사건이 알려졌을 때 Claude Opus와 Fable이 회사의 디지털 포렌식 작업 지원을 거부했다고 보도된 이유다. 두 모델은 공격 사후 분석을 작성하는 것과 공격 자체를 계획하는 것을 구분할 수 없었기 때문이다.

OpenAI 침해 사건 이후 입법자들은 AI 사이버보안 위협과 통제 불능 모델에 대응하기 위한 법제화에 이미 착수했다. Mark Warner 상원의원은 출시 전 국가안보 테스트를 의무화하는 법안을 발의했으며, AI Kill Switch Act는 국토안보부에 위험하거나 오작동하는 모델을 중단시킬 권한을 부여하게 된다.