OpenAI는 중국 Moonshot AI가 자사 모델에서 보호된 추론을 추출하는 증류 캠페인에서 핵심적인 역할을 했다고 비난했다.

OpenAI는 블로그 게시물에서 수천 명의 사용자가 다른 사람들이 모델의 기능을 재현하는 데 도움이 될 수 있는 정보를 추출하려 한 시도를 확인했다고 수요일 밝혔다.

지식 증류는 더 뛰어난 모델의 출력을 사용해 더 작은 AI 모델을 학습시키는 머신러닝 기법이다.

조직적인 캠페인은 7월 1일 소규모로 시작됐으며, OpenAI가 4,000명이 넘는 사용자로부터 관련 추출 패턴을 사용한 약 16,000건의 요청을 감지한 7월 24일과 25일에 정점에 달했다. 회사는 15,000명이 넘는 사용자가 배포한 관련 패턴을 확인한 뒤 7월 28일까지 캠페인을 차단했다고 밝혔다.

OpenAI는 모든 운영 주체가 단일 행위자에서 비롯됐는지는 불분명하지만, 활동의 핵심 군집은 중국의 주요 AI 기업인 Moonshot과 관련된 사람들이 주도했다고 밝혔다.

미국 AI 기업인 OpenAI는 운영 주체들이 대화 간에 출력을 전송하고 다른 모델에 숨겨진 추론 내용을 해독해 기록하도록 요청하는 등 새로운 방식으로 보호된 추론을 밝혀내려 했다고 밝혔다.

"이 활동은 시간이 지나면서 진화했으며, 이는 적대적 증류가 다층적이고 적응형인 방어가 필요한 더 광범위한 보안 과제라는 점을 재확인한다"고 팀은 밝혔다.

The Latent는 논평을 듣기 위해 Moonshot에 연락했다.

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

공동의 보안 과제

OpenAI는 이러한 증류 캠페인이 안전과 국가 안보에 위험을 초래한다고 밝혔다. 추출된 추론이 적절한 안전장치를 유지하지 않은 채 다른 모델을 학습시키는 데 사용될 수 있기 때문이다.

회사는 "이 위험은 OpenAI에만 국한되지 않는다"며 유사한 기법이 다른 첨단 AI 시스템에도 영향을 미칠 수 있어 "업계 전반의 공조가 필요한 공동의 보안 과제가 된다"고 밝혔다.

이번 주장은 중국 연구소들이 미국 모델을 사용하는 방식을 둘러싼 광범위한 분쟁이 벌어지는 가운데 나왔다. 지난달 Anthropic은 Moonshot과 DeepSeek을 비난했다고객 요청을 Claude 모델로 몰래 전달하고 그 응답을 자체 응답인 것처럼 사용자에게 표시했다는 것이다. Anthropic은 Alibaba와 Xiaomi도 자사 모델을 겨냥한 증류 캠페인을 벌였다고 비난했다.

미국 연방 기관들도 유사한 우려를 제기했다. 이들은 지난달 중국 AI 기업들이 증류를 통해 미국 AI 모델의 기능을 체계적으로 추출했다고 주장했다.

한편 The Information은 지난주중국 인터넷 규제 당국이 Anthropic으로의 잠재적 데이터 유출 가능성과 관련해 Moonshot과 DeepSeek을 조사하고 있었다고 보도했다.