OpenAIは、中国のMoonshot AIが、自社モデルから保護された推論を抽出する蒸留キャンペーンで重要な役割を果たしたと非難した。

水曜日に公開したブログ投稿で、OpenAIは、他者がモデルの能力を再現するのに役立つ可能性のある情報を抽出しようとするユーザーの試みを数千件特定したと記した。

知識蒸留は、より高性能なAIモデルの出力を使って、より小規模なAIモデルを訓練する機械学習の手法だ。

組織的なキャンペーンは7月1日に小規模で始まり、7月24日と25日にピークを迎えた。このときOpenAIは、4,000人超のユーザーから、関連する抽出パターンを使った約16,000件のリクエストを検知した。同社は、15,000人超のユーザーが展開した関連パターンを特定した後、7月28日までにキャンペーンを阻止したと述べた。

OpenAIは、すべての運用者が単一の攻撃主体に由来するかどうかは不明だとした一方、活動の中核となる一群については、中国の大手AI企業Moonshotに関係する人物によるものだと説明した。

米国のAI企業であるOpenAIは、運用者らが、会話間で出力を移すほか、別のモデルに隠された推論内容を復号して書き起こすよう促すなど、新たな手法で保護された推論を明らかにしようとしたと述べた。

「この活動は時間とともに進化しており、敵対的な蒸留が、階層的で適応型の防御を必要とする、より広範なセキュリティ上の課題であることを裏付けている」とチームは述べた。

The LatentはMoonshotにコメントを求めた。

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

共通のセキュリティ課題

OpenAIは、こうした蒸留キャンペーンは安全上および国家安全保障上のリスクをもたらすと述べた。抽出された推論が、適切な安全対策を維持せずに他のモデルの訓練に使われる可能性があるためだ。

「このリスクはOpenAIに固有のものではない」と同社は述べ、同様の手法が他の先進的なAIシステムにも影響を及ぼす可能性があり、「業界全体での連携を必要とする共通のセキュリティ課題となっている」と付け加えた。

今回の非難は、中国の研究所が米国のモデルをどのように利用しているかをめぐる、より広範な対立のさなかに出てきた。先月、AnthropicはMoonshotとDeepSeekを非難し、ユーザーのリクエストをひそかにClaudeモデルへ転送し、その応答を自社のものとしてユーザーに表示していたと指摘した。Anthropicはまた、AlibabaとXiaomiが自社モデルを標的とする蒸留キャンペーンを実施したと非難した。

米国の連邦機関も同様の懸念を示しており、先月、中国のAI企業が蒸留を通じて米国のAIモデルから能力を組織的に抽出したと主張した。

一方、The Informationは先週、中国のインターネット監督当局がMoonshotとDeepSeekをAnthropicへのデータ漏えいの可能性をめぐって調査していると報じた。