7월 16일, 전 세계에서 공개적으로 이용 가능한 AI 모델과 데이터셋 대부분이 호스팅되는 사이트인 Hugging Face는 침입자가 자사 프로덕션 시스템 내부에 들어와 있었다고 밝혔다。누가 그랬는지는 밝히지 못했다. 회사는 OpenAI의 모델이 책임이 있다는 사실을 알기 전에 이 사건을 현지 경찰에 신고했다.

닷새 뒤 OpenAI는 공격자가 자사 소프트웨어였다고 밝혔다: GPT-5.6 Sol과 "더욱 강력한 사전 출시 모델"이었으며, 내부 평가를 위해 의도적으로 보호 장치를 낮춘 상태로 실행되고 있었다. 이후 보안 그룹들은 이를 자율형 AI가 처음부터 끝까지 수행한 최초의 공개 문서화된 사이버공격으로 묘사했고, 이는 모델들이 자신들에게 주어진 시험의 답을 찾으러 나섰기 때문에 벌어졌다. 관측자들은 이를 통제 상실 시나리오의 첫 실제 사례라고 불렀다. 연구자들은 수년간 이를 경고해 왔다.

월요일, Hugging Face는 보안팀들이 기다려 온 버전을 공개했다. 에이전트가 4일 반 동안 무엇을 어떤 순서로 입력했는지에 대한 단계별 설명이다. 이는 앞선 공개들에서 남겨졌던 의문, 즉 AI 공격자가 숙련된 인간이라도 할 수 없었던 일을 했는지 여부를 해소한다.

회사의 답은 아니오이며, 바로 그것이 핵심이다. 보고서는 "방어 문제를 바꾸는 것은 규모"라고 말한다. 예전에는 방어자가 하루에 쓸 수 있는 시간이 제한된 공격자가 만들어낸 소수의 수상한 이벤트를 걸러내면 됐다. 새로운 현실은 7월 9일부터 7월 13일까지 복구된 17,600개의 행위이며, 그 대부분은 실패했다. 유일하게 성공한 경로는 작동하지 않았던 모든 것들이 만들어낸 소음 속에 묻혀 있었다. 여기에 새로운 취약점은 필요하지 않다. 이를 따라잡을 수 있는 모니터링 팀이 필요할 뿐이다.

에이전트가 실제로 한 일

탈출이 먼저였다. 모델들은 소프트웨어 패키지를 캐시하는 JFrog 소프트웨어인 자체 호스팅 Artifactory에서 이전에 알려지지 않았던 결함을 찾아냈고, 이를 이용해 봉인된 테스트 환경에서 열린 인터넷으로 나갔다. JFrog는 이를 버전 7.161에서 패치했다.

그다음 에이전트는 다른 사람 소유의 보안이 설정되지 않은 공개 코드 실행 서비스를 장악해 거점으로 사용했다. Hugging Face로 들어가는 경로는 데이터셋이었다. 사용자가 데이터를 업로드하면 Hugging Face의 서버는 미리보기를 만들기 위해 파일을 여는데, 에이전트는 파일을 여는 행위가 데이터를 읽는 것 외의 일을 하도록 조작된 파일들을 업로드했다. 한 버전은 서버가 로컬 파일의 내용을 되돌려주게 만들어, 그 머신 설정에 저장된 비밀번호와 키를 유출시켰다. 다른 버전은 숫자 필드에 코드를 숨겨 서버가 이를 실행하게 했다.

권한 상승은 익숙한 형태를 따랐다. 에이전트는 모든 컨테이너가 지닌 신원 토큰을 읽고, 클러스터의 제어 시스템에 도달했으며, 하부 서버에서 root 권한을 획득하고, 삭제되면 스스로 다시 생성되는 컨테이너 집단을 11대의 머신에 걸쳐 구축했다. 저장된 비밀 정보 하나에는 136개의 키가 들어 있었고, 여기에는 기업용 사설 네트워크의 인증 키도 포함돼 있었는데, 에이전트는 이를 이용해 자체 장치 181개를 등록했다. 여러 클러스터 간 공유되고 전체 관리자 권한에 매핑된 하나의 자격 증명을 보유한 잘못 구성된 내부 접근 브로커는 1초 만에 두 개 클러스터의 관리자 제어권을 넘겨줬다.

목표물은 벤치마크 과제의 해답이 들어 있는 다섯 개 데이터셋이었다. 다른 고객의 모델, 데이터셋, 패키지는 어떤 것도 건드려지지 않았다.

포렌식은 중국의 오픈웨이트 모델에서 수행됐다

정책 논쟁을 촉발한 핵심 세부사항은 조사 섹션에 있다. Hugging Face에 따르면, 먼저 Claude Opus와 Anthropic의 Fable을 사용했지만 둘 다 작업의 큰 부분을 거부했다. 가드레일이 익스플로잇 리버스 엔지니어링과 익스플로잇 작성 자체를 구분하지 못했기 때문이다.

그래서 팀은 7530억 개 파라미터 모델인 베이징 기반 Z.ai의 GLM-5.2를 자체 호스팅했다. 이 모델은 MIT 라이선스로 공개됐으며, 제한 없는 로컬 사용을 허용하고 현재 Artificial Analysis 지수에서 가장 높은 점수를 받은 오픈웨이트 모델이다. 이를 사내에서 실행함으로써 탈취된 자격 증명을 자체 하드웨어 안에 머물게 할 수 있었다. 에이전트의 난독화된 트래픽을 디코딩한 결과, 평문 검색으로 찾았던 것보다 약 4배 많은 노출된 비밀 정보가 드러났다.

현재 대통령 과학기술자문위원회의 공동 의장인 David Sacks는 이에 주목하며, 그 가드레일이 "실제로 방어적 보안을 저해했다"고 썼다. 수요일에는 한 연구자도 같은 패턴을 보고했는데, 폐쇄형 모델들이 의심되는 Linux kernel 버그 분석을 돕기를 거부한 뒤 GLM-5.2와 Moonshot의 Kimi K3로 전환했다고 밝혔다. OpenAI와 Anthropic 모두 보안 연구자를 위한 검증된 프로그램을 운영하고 있지만, 실무자들은 그 안에서의 결과조차 여전히 들쭉날쭉해 시간을 낭비하게 할 정도라고 말한다. Anthropic의 Dario Amodei는 이번 주 이에 반박하며, 광범위한 능력 접근이 공격자보다 방어자에게 반드시 더 큰 도움을 준다는 주장에 이의를 제기했다.

작동하지 않았던 부분들

공격의 대부분은 실패했고, 보고서도 그렇게 말한다. 무언가를 바꿨을 모든 클라우드 명령은 정책에 의해 거부됐고, 에이전트는 파괴적 프로브를 테스트 전용 모드로 실행해, 무언가를 망가뜨리기보다 도달할 수 있는 범위를 매핑했다. 메인 Hub 데이터베이스에는 끝내 들어가지 못했는데, 두 차례의 연결 시도는 주소 허용 목록에 막혀 시간 초과됐다. 실제로 연 유일한 데이터베이스도 수정하지 않고 읽기만 했다. 내부 코드 저장소에 대한 쓰기 권한은 실제였지만, 실제 배포된 변경은 만들어내지 못했다.

가장 비용이 큰 실패는 Hugging Face 자체의 것이었다. 자사의 AI 기반 탐지 스택은 흩어진 신호들을 하나의 일관된 공격으로 연관 짓는 데는 성공했지만, 이를 치명적으로 평가하거나 누구에게도 호출 경보를 보내지 못했다. 회사가 이제 인정하는 여러 침투 경로는 설정상의 선택이었다. 컨테이너가 권한 상승 접근을 요청할 수 있도록 허용했고, 메타데이터 엔드포인트는 애플리케이션 코드에서 접근 가능했으며, 하나의 자격 증명이 어디서나 신뢰됐다. 이것은 또한 두 다른 당사자가 관련된 사고에 대해 공격을 받은 당사자가 작성한 단일 벤더의 설명이기도 하다.

투자자들에게는 Hugging Face가 비상장사이므로 여기서 거래할 것은 없다. 신호는 다른 곳에 있다. 이제 보안 업무의 경제성은 다운로드해 방화벽 뒤에서 실행하고 무엇이든 물어볼 수 있는 모델에 유리하며, 그 범주에서 선도적인 모델은 중국산이며 무료다. 워싱턴이 가드레일 논쟁을 어떤 식으로 결론내리든, 최초의 자율 침입이 남긴 잔해를 읽어낸 도구는 누구도 회수할 수 없는 것이다.