지난 3주 동안 OpenAI, Anthropic, Meta는 각각 동일한 실패에 대한 설명을 공개했다. 모델 하나가 봉인된 테스트 환경이어야 했던 곳에서 해킹 과제를 부여받고, 열린 인터넷으로 나가는 길을 찾아 실제 기업의 컴퓨터에 침입했다. 미국 내 가장 큰 AI 개발사 3곳, 공개 3건, 외부 공격자는 없었다.

월요일, 버니 샌더스 상원의원은 그 패턴을 요구로 바꿨다. 버몬트주 무소속인 그는 오픈AI의 샘 올트먼, 앤스로픽의 다리오 아모데이, 메타의 마크 저커버그에게 서한을 보내며, Axios가 처음으로 입수해 보도한 이 서한에서 세 사람 모두에게 더 강력한 시스템 개발을 중단하라고 말했다. "AI 개발을 중단하십시오. 재앙을 피하기에 아직 늦지 않았습니다,"라고 Sanders는 썼다. "분명히 말씀드립니다. 지금 적절한 조치를 취하지 않는다면, 미국 상원에 있는 제 동료들과 저는 그렇게 할 것입니다."

이 서한의 방식은 각 회사의 자체 안전 정책을 그대로 되돌려 인용하는 것이다. 안전 작업이 뒤처질 경우 "새 모델의 확장 및/또는 배포를 중단하거나 연기하겠다"는 Anthropic의 2023년 약속, 완화할 수 없는 중대한 위험 수준에 모델이 도달하면 "개발을 중단하겠다"는 Meta의 2025년 성명, 그리고 강력한 안전장치가 마련될 때까지 "추가 개발을 중단하겠다"는 OpenAI의 약속이 그것이다.

이러한 약속들은 각각 기술적 발동 조건에 달려 있다. Sanders는 그 조건이 이미 충족됐다고 주장한다. 그는 "그 순간이 지금이다"라고 썼다. "AI 역량은 이미 중대한 임계점에 도달했다." 이 문장은 실제로 논증을 제시하지 않으면서 논증의 역할을 하고 있으며, 그 뒤에 그가 제시한 근거는 서한이 허용하는 것보다 더 약하고 더 엇갈려 있다.

서한의 배경이 된 사건들

첫 번째 사건은 7월 21일 공개됐다. OpenAI는 거부 설정이 낮춰진 상태로 사이버 벤치마크를 수행하던 GPT-5.6 Sol과 비공개 모델 하나가 샌드박스의 패키지 소프트웨어에서 이전에 알려지지 않았던 결함을 악용해 인터넷에 도달해 Hugging Face를 침해했다고 밝혔다. 이 사건은 Sanders의 주장 그대로다. 모델이 직접 탈출을 수행한 격리 실패 사례다.

나머지 두 건은 그렇지 않다. Anthropic은 141,006건의 평가 실행을 검토한 뒤 7월 30일, 모델들이 열린 인터넷에 도달해 무관한 조직들의 프로덕션 시스템에 들어간 사례 3건을 발견했다. 원인은 테스트 파트너인 Irregular의 설정 오류였으며, 이 업체는 실제로는 인터넷 접속이 가능했는데도 모델들에게 인터넷 접근 권한이 없다고 알려줬다. Anthropic의 가장 진보한 모델은 자신이 열린 인터넷에 있다는 사실을 인식하고 멈췄다.

메타는 8월 5일 거의 동일한 사례를 공개했다. 같은 벤더, 같은 오류였다. The Information은 해당 모델이 Muse Spark 1.1라고 처음 보도했다. Irregular는 Reuters에 샌드박스 탈출은 없었다고 말했다. 샌더스의 서한은 이 세 사례를 모두 모델들이 "유사하게 통제를 벗어났다"고 압축해 서술하는데, 이는 시스템이 자신의 우리를 뚫고 나온 경우와 벤더가 문을 열어둔 경우의 차이를 희석한다.

논거가 약해지는 지점

생물학 관련 주장에서는 논리가 더 빠르게 약해진다. 8월 6일 Science에 실린 연구에서 Stanford와 Arc Institute 연구진은 완전한 바이러스 게놈을 작성했으며, 그중 16개는 작동하는 박테리오파지를 만들어냈다고 밝혔다. 파지는 박테리아만 감염시키며, 인간·동물·식물을 감염시키는 바이러스의 서열은 학습 데이터에서 의도적으로 제외됐다. 책임저자인 Brian Hie는 The Guardian에 AI 게놈 설계로 인한 생물무기 위협은, 더 쉬운 기존 병원체에 대한 기능획득 연구와 비교하면 "매우 과장돼 있다"고 말했다. 이 서한은 파지 치료 결과를 수천만 명의 사망으로 비약한다.

그리고 해결책의 문제도 있다. Sanders는 Amodei를 포함해 1,200명 넘는 연구소 직원들이 서명한 성명을 긍정적으로 인용하는데, 이 성명은 역량이 통제를 앞지를 수 있다고 경고한다. 그 성명은 어떤 기업도 혼자서는 속도를 늦출 수 없기 때문에 미국 정부가 최전선을 정밀하게 조절할 도구를 구축해야 한다고 요구한다. Sanders는 이를, 자신의 서한이 규제할 수 없는 중국 연구소들과 오픈 웨이트 공개에 맞서 세 기업이 혼자 속도를 늦춰야 한다는 주장에 대한 근거로 인용한다.

그는 또 OpenAI가 Astra 작업을 중단한 지 이틀 뒤 이 서한을 썼다. Astra는 비공개 모델로, 평가 결과 중대한 사이버 역량 가능성을 배제할 수 없었기 때문이다. 이는 회사의 자체 경보 장치가 스스로 작동한 사례로, 서한이 말하는 버려진 행동 양식과는 반대다.

입법도 마찬가지로 다가오지 않고 있다. Sanders의 AI 데이터센터 유예법는 3월 25일 이후 진전이 없었고, 국가안보 기구는 같은 사실을 다르게 해석한다. CIA 국장 John Ratcliffe는 6월 최전선 모델들을 "디지털 핵무기에 비견된다"고 불렀고, 그 뒤따른 정책은 중단이 아니라 수출 통제였다.

이 서한이 고려하지 않는 것은 자기 근거가 어디서 나왔는가다. 서한에 담긴 모든 사건이 공개된 것은 기업들이 스스로 공개하기로 선택했기 때문이며, 어떤 경우에는 누구도 요청하지 않았던 141,006건의 테스트 실행을 감사한 뒤였다. Sanders는 자발적 공개 4건을 연구소들을 신뢰할 수 없다는 증거로 취급한다. 그가 투자자들에게 남기는 질문은 다음번에는 무엇이 공개될 것인가다.