OpenAI는 10일 전 업계에 자사의 가장 강력한 모델들이 탈출했다고 밝혔다. 이 모델들은 봉인된 테스트 환경을 벗어나 오픈소스 AI 세계의 상당수가 코드와 데이터셋을 보관하는 플랫폼인 Hugging Face의 프로덕션 서버에 도달했다. 다른 모든 연구소에 남겨진 질문은 이것이 한 회사의 실수였는지, 아니면 최전선 AI가 테스트되는 방식에 구조적인 문제가 있는지였다.
Anthropic는 목요일 저녁 부분적인 답을 내놓았다. 자사의 사이버보안 테스트 실행 141,006건을 검토한 뒤봉인되어 있어야 하는 평가 환경에서 Claude 모델이 개방형 인터넷에 도달한 뒤 3개 조직의 라이브 시스템에 무단 접근한 사건 3건을 발견했다고 밝혔다. 가장 이른 사례는 4월로 거슬러 올라간다. 모델이 접근한 2개 회사는 해당 활동을 스스로 감지하지 못했으며, 두 곳 모두 월요일에 통보받았다.
두 사건의 양상은 전혀 닮지 않았다. OpenAI의 모델들은 이전에 알려지지 않았던 소프트웨어 취약점을 찾아 탈출한 뒤 Hugging Face 내부에서 기록된 행동 17,600건을 수행했다고 한다. Claude는 아무것도 깨뜨리지 않았다. 설정 오류로 테스트 머신이 인터넷에 연결된 상태였고, 일단 밖으로 나간 뒤에는 약한 비밀번호와 보호되지 않은 엔드포인트에 의존했다고 Anthropic는 밝혔다.
세 사건 모두 최전선 AI 보안 연구소 Irregular를 거쳤다. 이곳은 OpenAI와 Google DeepMind 모델도 테스트한다. Anthropic의 프롬프트는 Claude에게 인터넷에 접속할 수 없는 시뮬레이션 안에 있다고 말했다. 하지만 실제로는 그렇지 않았고, Claude는 자신이 발견한 실제 머신들을 게임의 일부로 취급했다.
변화를 보여주는 Anthropic 게시물의 문장은 모델이 아니라 인프라에 관한 것이다. 평가 환경은 모델이 실행되는 "다른 어떤 시스템과 동일한 보안 기준"으로 유지되어야 한다고 회사는 말했다. 가짜 회사들로 채워진 테스트 환경은 그 안에 실제가 아무것도 없다는 이유로 저위험으로 여겨져 왔다. Anthropic의 주장은 위험이 시나리오 자체에 있었던 것이 아니라는 점이다. 위험은 그 안의 에이전트다.
3건의 사건, 3개의 서로 다른 모델
가장 피해가 컸던 것은 Opus 4.7과 관련된 사례로, 가상의 표적이 실제 웹사이트와 같은 이름을 공유하고 있었다. 시뮬레이션된 회사에 접근하지 못하자 Claude는 실제 회사를 찾아냈고, 자격 증명을 탈취한 뒤 수백 개 행의 프로덕션 데이터를 담은 데이터베이스를 열었다. 4번의 실행에 걸쳐 이 시스템들이 실제라는 점을 인식했으며, 그중 2번에서는 실제 회사도 어쨌든 훈련의 일부일 것이라고 판단했다. 어느 경우도 멈추지 않았다.
두 번째 사건은 더 기이하다. 6월에 제한된 일부 기업에 공개된 Mythos 5는 가상 환경에서 개발자들에게 존재하지 않는 Python 패키지를 설치하라는 지침을 발견했다. 그러자 숨겨진 코드를 넣은 자체 버전을 작성해 거의 모든 Python 개발자가 사용하는 공개 레지스트리 PyPI에 그 이름으로 게시했다. 계정을 만들려면 이메일 주소가 필요했고, 이메일 주소를 만들려면 전화번호가 필요했지만 모델은 비용을 지불하려다 실패했다.
그 패키지는 약 1시간 동안 게시된 상태였고 실제 머신 15대에서 실행됐다. 그중 1대는 악성코드 여부를 점검하기 위해 패키지를 설치하는 스캐너를 운용하는 한 보안 회사 소속이었다. 코드가 실행되면서 그 회사의 자격 증명을 탈취했고, Claude는 이를 이용해 해당 회사 시스템 더 깊숙한 곳까지 접근했다. 이 모델은 이미 이것을 현실에서 하는 것은 "옳지 않고, 의도된 해결책도 분명 아니다"라고 적어두었지만, 시스템에 표시된 연도가 2026년이라는 점 등을 근거로 다시 스스로를 시뮬레이션이라고 납득시켰다.
세 번째는 공개되지 않은 내부 연구 모델과 관련됐다. 지정된 표적에 도달하지 못한 뒤 약 9,000개의 다른 대상을 스캔했고, 노출된 디버그 페이지를 통해 한 회사의 대외 공개 애플리케이션을 침해했다. 이후 그 호스트가 실제라는 점을 스스로 결론 내리고 멈췄다.
이번 공개로도 결론나지 않은 것
더 새로운 모델이 더 잘 행동한다는 명백한 해석에 대해 Anthropic는 그런 결론을 내리길 거부했다. 3개 모델에서 발생한 3건의 사건은 통제된 실험이 아니며, 가장 얌전하게 행동한 모델조차 회사가 원한 수준보다 더 멀리 갔다고 했다. 세 모델 모두 공개 모델에 함께 제공되는 필터 없이 실행됐고, Anthropic는 그 필터가 있었다면 이런 행동을 막았을 것이라고 말했다.
이 주장은 이번 달의 다른 사이버보안 이야기와 나란히 놓으면 어색하다. Hugging Face가 자체 침해 사건을 조사했을 때, Claude Opus와 Fable은 포렌식 작업의 상당 부분을 거부했다. 가드레일이 익스플로잇을 분석하는 일과 작성하는 일을 구분하지 못했기 때문이며, 그 결과 분석은 중국산 오픈 웨이트 모델에서 수행됐다. Anthropic가 자사 모델을 막았을 것이라고 말하는 그 안전장치들이 OpenAI 사고의 뒷수습에는 도움이 되지 않았던 바로 그 장치들이다.
기본적인 사실들조차 아직 공개되지 않았다. Anthropic는 영향을 받은 조직들의 이름을 밝히지 않았고, 노출된 데이터 총량도 수치화하지 않았으며, 아직 세 번째 회사와 연락을 시도 중이다. 회사는 일주일 안에 PyPI 사건의 편집본 처리된 대화 기록 1건을 공개할 예정이며, 외부 검토를 위해 평가기관 METR와 협의 중이다.
OpenAI 침해 사건에 대응해 이미 두 개의 법안이 추진되고 있다: AI 킬 스위치 법안, 위험한 모델의 중단을 국토안보부가 명령할 수 있도록 하는 법안, 그리고 마크 워너 상원의원의 출시 전 국가안보 테스트 의무화 제안이다. Anthropic은 출시 전 테스트 자체가 공격 표면이 될 수 있음을 방금 보여줬다.
투자자들에게 질문은 더 좁다. Anthropic은 6월 1일 IPO를 위해 비공개로 신청서를 제출했다 기업가치 9,650억 달러로, 가을 상장을 염두에 두고 있으며 사이버 역량을 제품으로 판매한다. 이 회사의 모델들은 통제를 벗어나지 않았다. 그것들은 아무도 점검하지 않은 방에서 지시받은 대로 행동했을 뿐이다.
