AI 안전성 테스트에서 생물학 무기와 암살과 관련된 요청으로부터 Moonshot의 Kimi 모델을 보호하는 안전장치에 허점이 드러났다.
AI 시스템의 취약점을 테스트하는 Mindgard는 연구진이 7월에 Kimi K2.6과 K3 Swarm을 탈옥시켰다고 BBC에 밝혔다. 연구진은 두 모델 모두 해당 주제에 대한 지침을 제공하도록 만들었다. 이 과정에서는 AI 모델이 개발자가 설정한 안전 제한을 우회하는지 테스트하기 위해 복잡한 지시를 연쇄적으로 입력한다.
Mindgard는 7월 27일 Moonshot에 취약점을 이메일로 알렸고, 약 일주일 후 다시 연락했으며, 9월 12일 블로그를 게시했다고 밝혔다. Mindgard에 따르면 Moonshot은 BBC가 논평을 요청한 뒤에야 최근 연락해 왔다.
Moonshot은 BBC에 외부 검증을 "더 나은, 더 안전한 AI를 구축하기 위한 핵심 축"으로 환영한다고 밝혔으며, Mindgard와 조사 결과를 논의하고 있다고 말했다. BBC가 입수한 Mindgard와의 이메일에서 중국 개발업체는 내부 평가에서 자사 모델이 일반적으로 "이러한 유형의 요청에 대해 높은 거부율"을 보였다고 밝혔다.
Mindgard 창업자 피터 개러건은 BBC 월드 서비스 프로그램 Tech Life에서 "탈옥이 성공하면 어떤 주제든 이야기하고, 악의적인 다른 주제에 대해서도 추천을 거리낌 없이 내놓으며, 독창적이고 창의적인 답변까지 한다"고 말했다.
Mindgard는 무기와 암살에 관한 지침이 실제로 효과가 있다는 점을 입증하지는 못했다. 다만 안전장치가 애초에 모델의 응답을 차단했어야 한다고 주장했다. 또한 탈옥된 Kimi K2.6이 해커에게 자체 컴퓨팅 자원에서 코드를 실행하고 인터넷에 연결할 수 있도록 할 것이라고 확신한다며, 사이버 공격의 발판으로 악용될 가능성이 있다고 밝혔다.
이번 사건은 최근 여러 주요 개발업체의 AI 에이전트와 관련해 공개된 내용에 이어 발생했다. Google은 Gemini가 5월 보안 테스트 중 3개 기업에 접근했다고 밝혔으며, 호주 당국은 OpenAI 에이전트가 6월 정부 보건 포털의 공개 파일과 비공개 파일에 접근했다고 밝혔다.
Kimi는 오픈 웨이트 모델로, 사용자가 자체 컴퓨팅 인프라에서 실행할 수 있다는 뜻이다. 서리대학교 앨런 우드워드 교수는 BBC에 이러한 모델이 악의적인 세력의 손에 들어갈 수 있지만 사이버 방어에도 활용될 수 있다고 말했다.
