미국 연방정부는 이번 주 최첨단 AI 모델의 사이버 역량을 평가하기 위한 프레임워크를 마무리하고 있으며, 업계 리더들과 백악관 관계자들은 그 내용을 논의하기 위해 화요일 모일 예정이다. 이 프레임워크의 핵심은 선택적 검토 기간으로, 참여 개발사들은 새 모델을 더 넓은 범위에 출시하기 최대 30일 전에 정부 기관에 제출하게 된다.
이는 OpenAI가 테스트 중 자사 모델 중 하나가 “격리를 뚫고” 오픈소스 AI 플랫폼 Hugging Face를 침해했다고 발표한 지 3주도 채 지나지 않아 나온 조치다. 이는 공개적으로 기록된 유형의 침해로는 최초였다. OpenAI는 사후 분석 보고서에서 "격리 아키텍처 자체가 공격 표면의 일부가 됐다"고 밝혔다.
이 사건으로 AI 모델의 사이버보안 안전장치, 특히 내부 테스트 중 설정된 가드레일에 대한 문제가 집중 조명됐다. 이후 Anthropic은 테스트를 설정하는 과정에서 샌드박스 가드레일이 부적절하게 구성된 뒤 자사의 모델들이 3개 기업의 시스템을 침해하는 데 성공했다고 공개했다.
OpenAI는 프레임워크가 최종 확정되기에 앞서 최근 몇 주 동안 연방 관계자들에게 출시되지 않은 Astra 모델의 미리보기를 이미 제공해 왔다. 백악관 회의에는 Anthropic, Google, Meta의 대표들과 함께 참석할 것으로 예상된다.
AI 사이버 위협에 대한 의원들의 대응
미국에서는 의원들이 주 정부와 연방정부 차원에서 잠재적인 AI 위협에 대응하기 위한 움직임을 보이고 있다. California, New York, Illinois는 최첨단 AI 개발사에 의무적인 사고 공개를 요구하는 법을 제정했다. 또한 공화당 소속 15명의 주 법무장관이 소비자 보호 관련 청구를 근거로 OpenAI를 상대로 소송을 제기하는 방안을 검토 중인 것으로 전해졌다.
새로운 연방 검토 프레임워크를 규정한 지침인 Executive Order 14409는 Anthropic이 자사의 Mythos 모델의 사이버 역량에 대해 제기한 주장에 대응해 6월 2일 서명됐다. 최첨단 AI 연구소 대표들은 이 프레임워크의 검토용 초안에 접근할 수 있었으며, 수정 요청을 제출할 기회도 가졌던 것으로 전해졌다.
정확한 내용은 공개되지 않았지만, 이 명령은 연방 기관에 새 모델을 위한 벤치마킹 테스트를 마련하고 어떤 모델이 “대상 최첨단 모델”에 해당하는지에 대한 명확한 지침을 수립하도록 지시한다. 또한 AI의 도움을 받아 소프트웨어 결함을 찾아 수정하기 위한 업계와 정부 간 정보 공유 창구도 마련한다.
정부가 최첨단 모델에 접근하는 것이 전례 없는 일은 아니다. 유럽연합의 AI Act에 따라 European Commission은 규제 평가를 위해 개발사에 범용 AI 모델에 대한 접근 권한을 요구할 수 있다. 미국의 이에 상응하는 제도는 참여가 명시적으로 자발적이며, 새 모델 출시를 위한 라이선스 요건이 아니라고 규정한다.
