이번 수요일 The Information은 보도하며 미국의 프런티어 AI 모델이 실제 기업을 상대로 실시간 사이버 공격을 성공적으로 수행했다는 일련의 보도에 새로운 내용을 더했다. Meta의 코딩 모델 Muse Spark 1.1은 제3자 테스트 중 신원이 공개되지 않은 기업의 시스템을 침해한 것으로 알려졌다. 이는 OpenAI 에이전트가 7월 17일 Hugging Face를 공격한 사건과 Claude가 7월 30일 공개된 바와 같이 별개의 세 기업을 침해한 사건에 이어 곧바로 발생했다.

Anthropic과 Meta 사건의 중심에는 두 사례에서 테스트를 수행한 이스라엘 보안 기업 Irregular가 있다. 이 계약업체는 CNN과의 인터뷰에서 Meta의 침해가 일주일도 지나지 않아 발생한 Anthropic 침해와 “정확히 동일한 평가 환경 문제”의 결과였다고 인정했다. 설정 과정에서 핵심 안전장치가 잘못 구성돼 모델이 인터넷에 노출됐다는 설명이다.

테스트 환경의 결함으로 Muse Spark 1.1이 인터넷에 접근

Irregular가 구축한 테스트 환경은 인터넷과 연결되지 않은 폐쇄형 시스템으로, 완전히 샌드박스화하도록 설계됐다. 이 환경에서 모델은 ‘캡처 더 플래그’ 테스트와 같은 과제를 부여받는다. 이러한 테스트에서 모델은 추가적인 인간의 지시 없이 다른 컴퓨터에서 정보를 가져와야 한다.

모델이 작동하는 환경이 외견상 완전히 격리돼 있기 때문에, 공개 모델에 적용되는 일부 표준 안전장치는 의도적으로 비활성화된다.

중요한 점은 작업을 수행하는 에이전트가 프롬프트를 통해 자신이 처한 환경의 한계를 안내받는다는 것이다. Anthropic 공격 당시 에이전트들은 자신에게 실수로 공개 인터넷 접근 권한이 부여됐다는 사실을 때때로 인지했지만, 이를 테스트 과정에서 의도된 부분이라고 판단했다.

테스트 엔지니어들은 일부 테스트 대상에 실제 기업의 이름도 붙였다. 그 결과 모델이 인터넷에 공개되자 가상의 기업이 아니라 실제 기업을 공격했다. 실제로 침해에 이르게 된 사건들은 AI 모델의 복잡한 작전이 아니라 보안이 확보되지 않은 엔드포인트와 취약한 보안 인증정보 때문에 발생했다.

초기 보도에 따르면 Meta 사건에서도 비슷한 일이 일어났다. Muse Spark 1.1에 실수로 인터넷 접근 권한이 부여됐고, 이후 “제3자 서비스의 보안 취약점을 공격했다.”

공식 사후 조사 결과가 나올 때까지 세부 내용은 여전히 부족

Meta의 AI 모델이 어느 기업을 침해했는지, 또는 해당 기업의 이름이 공개될지는 아직 알려지지 않았다. 마찬가지로 현재 보도만으로는 해당 기업이 침입을 자체적으로 감지했는지, 아니면 Meta의 공개가 최초의 인지 계기였는지도 알 수 없다. Anthropic의 경우 영향을 받은 세 기업 중 두 곳은 공격을 감지하지 못했다.

Meta 대변인은 “모든 사실을 확인하는 대로 전체 경과를 공개하겠다”고 약속했다.

이번 조사 결과는 Meta 자체보다 보안 연구소 Irregular에 더 중요한 의미를 가질 수 있다. 지난해 9월 8,000만 달러를 조달해 4억5,000만 달러의 기업가치를 인정받고 미국의 모든 주요 프런티어 AI 연구소와 출시 전 테스트 계약을 체결한 뒤에도, 이 기업은 이전까지 일반 대중에게는 대체로 알려지지 않았다. 그러나 한 주에 여러 건의 침해 사실이 공개된 후 이제 Irregular는 워싱턴을 비롯한 지역에서 AI 사이버 안전장치를 둘러싼 논의의 중심에 서게 됐다.

미국 정부는 화요일 프런티어 모델 검토 프레임워크를 공개했다. 이 프레임워크는 연방 당국이 새로운 모델의 광범위한 출시 최대 30일 전에 미리 검토해 사이버 역량을 평가할 수 있도록 하는 것을 목표로 한다. 최근의 이러한 상황을 고려하면 테스트 환경의 보안은 이제 모델 자체의 역량만큼이나 중요한 논의 주제가 되고 있다.