보안 기업 Hacktron AI의 연구자들은 Anthropic의 Claude를 이용해 취약점을 발견하고 여러 OpenAI 직원의 ChatGPT 계정에 접근했다. 연구팀은 이 중 한 계정에서 해당 AI 연구소의 내부 소프트웨어 저장소에 접근할 수 있음을 입증했다.

세 명의 연구자 Harsh Jaiswal, Mohan Pedhapati, Rahul Maini는 말했다. 이들은 7월 25일 OpenAI 커뮤니티 포럼의 Discourse 환경에서 원격 코드 실행(RCE) 및 관리자 권한을 확보했으며, 이를 이용해 ID 시스템의 결함을 악용했다고.

이로 인해 탈취된 포럼 세션으로 ChatGPT 및 Codex 계정을 장악할 수 있었다. 탈취된 계정 중 하나는 Codex가 GitHub에 연결돼 있었다.

연구팀은 "취약점의 실제 영향을 입증하기 위해 OpenAI 내부 모노레포에 무해한 개념증명 풀 리퀘스트를 생성했다"고 설명했다.

연구자들은 특히 Claude를 이용해 커뮤니티 포럼이 HEIC 및 HEIF 이미지 업로드를 처리하는 방식을 조사하고, 이미지 업로드 파이프라인의 버그를 겨냥한 익스플로잇을 작성했다. 연구자들에 따르면 Opus 4.8은 신뢰할 수 있는 익스플로잇을 만들지 못했지만, Opus 5는 테스트 환경에서 몇 시간 만에 익스플로잇을 성공적으로 생성했다. 최초 발견부터 저장소 접근까지 걸린 전체 시간은 72시간이 채 되지 않았다.

연구자들은 보고서에서 "두 달 전까지는 OpenAI의 자체 지원 포럼에 로그인한 모든 사용자나 OpenAI 직원의 ChatGPT 및 Codex 계정이 탈취될 수 있었다"고 썼다. 이어 "사람들이 다양한 서비스를 Codex와 ChatGPT에 연결할 수 있기 때문에, 이론적으로 접근할 수 있었던 범위는 GitHub, Slack, 이메일 등을 포함해 매우 넓었다"고 덧붙였다.

Hacktron AI 연구자들은 OpenAI와 Discourse에 취약점을 신고했으며, OpenAI 측 취약점 발견에 대해 6,500달러의 포상금을 받았다. OpenAI는 신고 후 약 14시간 만에 버그를 수정했다고 연구팀에 확인했다. Discourse도 이후 며칠 내에 버그를 패치했다.

보안은 '따라잡아야 한다'

이번 발견은 AI 개발로 인해 심각한 보안 익스플로잇을 실행하는 비용이 크게 낮아진 시점에 나왔다.

연구팀은 "이는 완전히 자율적인 해킹은 아니었고 숙련된 인간의 지도가 여전히 중요했지만, 소규모 팀이 수행할 수 있는 작업량은 크게 증가했다"고 지적했다.

Hacktron AI 연구팀은 AI가 과거에는 드문 전문 지식과 상당한 시간이 필요했던 온라인 보안 공격의 복잡성을 제거한 만큼, 보안에 대한 가정도 공격자의 역량을 "따라잡아야 한다"고 밝혔다.

연구팀은 "현실적인 위협 모델은 정교한 공격을 실행할 수 있는 주체에 대한 낡은 가정에 의존하는 대신, 오늘날 익스플로잇의 경제성을 고려해야 한다"고 말했다.

OpenAI vs. Anthropic Revenue Run Rate

OpenAI vs. Anthropic Revenue Run Rate

  • OpenAI
  • Anthropic
SOURCE: The Latent