버니 샌더스 상원의원은 지난 3주 동안 드러난 일련의 AI 보안 침해에 우려를 표한 가장 최근의 정부 인사다. 이 베테랑 의원은 서한을 발송해 Anthropic의 다리오 아모데이, Meta의 마크 저커버그, OpenAI의 샘 알트먼에게 “지금 적절한 조치를 취하지 않는다면”, 즉 AI 개발을 중단하지 않는다면 “미국 상원의 동료 의원들과 내가 그렇게 할 것”이라고 경고했다.
샌더스는 AI 에이전트가 통제를 벗어나거나, 인간을 상대로 생물학적 무기로 배치될 수 있는 새로운 바이러스를 개발할 가능성에 대응하기 위해 이는 필수적인 조치라고 주장했다. 버몬트주 상원의원인 샌더스는 앞서 3월에 적절한 안전장치가 마련될 때까지 신규 AI 데이터센터 승인을 중단하려는 AI Data Center Moratorium Act를 발의했다.
그의 최근 서면 호소문은 기업 자체의 안전 정책을 반복적으로 언급하며, 샌더스는 해당 정책이 제대로 집행되지 않고 있다고 주장했다. Meta는 과거 성명에서 어떤 모델이든 통제에서 벗어날 가능성을 보이면 “개발을 중단할 것”이라고 밝혔다. Anthropic은 효과적인 안전장치보다 앞서 나갈 경우 “새 모델의 확장을 중단하거나 배포를 연기하겠다”고 약속했으며, OpenAI 역시 모델이 중대한 위험 임계값에 도달하면 “추가 개발을 중단하겠다”고 약속했다.
샌더스의 주장은 그 중대한 임계값에 이미 도달했다는 것이다. “그 순간이 왔다.” 이것이 사실인지, 아니면 샌더스의 입장이 훨씬 더 평범한 일에 대한 과잉 반응인지는 여전히 논쟁의 여지가 있다.
서한을 촉발한 보안 침해
샌더스가 서한에서 지목한 세 곳의 프런티어 AI 연구소는 모두 지난 3주 동안 세간의 이목을 끈 보안 사고를 겪었다. 세 곳 모두 폐쇄된 테스트 환경에 갇혀 있어야 했던 AI 에이전트가 샌드박스를 벗어나 실제 환경에서 성공적인 사이버 공격을 수행했다.
Meta와 Anthropic의 경우, 책임은 이스라엘의 제3자 보안 테스트 업체 Irregular에 있었다. 설정 과정에서 구성이 잘못돼 에이전트가 인터넷에 자유롭게 접근할 수 있었던 것이다. Anthropic은 141,006건의 테스트 인스턴스를 검토한 뒤 모델이 공개 인터넷에 접근한 다음 외부 기업 시스템의 취약한 비밀번호와 보호되지 않은 엔드포인트를 악용할 수 있었던 세 사례를 확인했다. 일주일도 지나지 않은 8월 5일, Meta는 거의 동일한 사례를 발표했다.
샌더스는 세 사건을 하나의 범주로 묶으며 세 기업의 모델이 “유사하게 통제를 벗어났다”고 밝혔다. 그러나 OpenAI의 사건은 기술적으로 더 복잡했다.
이 사건에서는 수백 개의 AI 에이전트가 수개월 동안 회사 내부 시스템에서 협력하며 공개 인터넷으로 나갈 경로를 찾으려 했다. 그 결과 GPT-5.6 Sol과 출시되지 않은 내부 모델이 격리 상태를 벗어나 오픈소스 AI 플랫폼 Hugging Face를 성공적으로 악용했다.
세 사건 모두에서 AI 시스템은 악의적으로 행동한 것이 아니라 평가 과정에서 설정된 벤치마크 테스트의 답을 찾고 있었다.
샌더스의 AI 개발 요구에 대한 비판
샌더스의 서한에서 언급된 기업들은 해당 사건에 대해 이미 자체적으로 대응을 내놓았다. 서한이 발송되기 이틀 전 OpenAI는 사이버 보안 우려를 이유로 출시되지 않은 Astra 모델의 개발을 늦췄다고 밝혔다. 회사 내부의 안전장치가 이미 의도한 대로 작동하고 있다고 주장할 수도 있지만, 비판론자들은 직원들이 내부 시스템에서 발생한 통제를 벗어난 행동의 심각성을 파악하는 데 약 두 달이 걸린 것으로 알려졌다는 점을 지적할 것이다.
샌더스는 7월 28일 프런티어 AI 연구소 직원 1,200명이 발표한 성명도 인용했다. Pacing the Frontier라는 제목의 이 성명은 AI 개발에 대한 미국 정부의 감독 강화를 요구했다. 제안된 안전장치는 AI 개발 속도를 전반적으로 제한해 어느 한 기업도 위험한 영역으로 앞서 나가지 못하도록 하는 것을 목표로 한다.
이러한 연방 차원의 안전장치는 업계 전체에 적용될 수 없다. 중국 연구소와 오픈 웨이트 개발사들은 아무런 영향 없이 개발을 계속할 것이기 때문이다.
미국 AI 산업이 해외 경쟁업체에 뒤처질 위험을 초래하지 않는 대안도 제시됐다. 그중 한 명은 CIA 국장 존 랫클리프다. 그는 프런티어 모델을 “디지털 핵무기에 가깝다”고 표현했지만, AI 기업에 대한 제한을 요구한 샌더스의 주장에는 동조하지 않았다. 대신 랫클리프는 더욱 강력한 수출 통제를 촉구했다.
Anthropic, Meta, OpenAI가 샌더스의 서한에 직접 대응해 개발을 더 중단할 가능성은 낮다. 그러나 이번 서한은 프런티어 AI 모델이 이를 통제하기 위해 마련된 안전장치를 조만간 훨씬 앞지를 수 있다는 일부 관측통의 우려가 커지고 있음을 보여준다.
