OpenAI a accusé Moonshot AI, en Chine, d’avoir joué un rôle clé dans une campagne de distillation visant à extraire le raisonnement protégé de ses modèles.

Dans un billet de blog publié mercredi, OpenAI a écrit avoir identifié des milliers de tentatives d’utilisateurs visant à extraire des informations susceptibles d’aider d’autres acteurs à reproduire les capacités du modèle.

La distillation des connaissances est une technique d’apprentissage automatique qui consiste à entraîner un modèle d’IA plus petit à l’aide des résultats de modèles plus performants.

La campagne coordonnée a commencé à faible volume le 1er juillet et a atteint son pic les 24 et 25 juillet, lorsqu’OpenAI a détecté environ 16 000 requêtes utilisant un schéma d’extraction pertinent provenant de plus de 4 000 utilisateurs. L’entreprise a déclaré avoir perturbé la campagne le 28 juillet, après avoir identifié des schémas apparentés déployés par plus de 15 000 utilisateurs.

OpenAI a déclaré qu’il n’était pas certain que tous les opérateurs proviennent d’un même acteur, mais a attribué un groupe central de cette activité à des personnes associées à Moonshot, une importante entreprise chinoise d’IA.

L’entreprise américaine d’IA a déclaré que les opérateurs avaient tenté de découvrir le raisonnement protégé par des moyens inédits, notamment en transférant des résultats entre des conversations et en demandant à un autre modèle de déchiffrer et de transcrire le contenu du raisonnement caché.

« L’activité a évolué au fil du temps, ce qui confirme que la distillation adversariale constitue un défi de sécurité plus vaste nécessitant des défenses à plusieurs niveaux et adaptatives », a déclaré l’équipe.

The Latent a contacté Moonshot pour recueillir ses commentaires.

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

Un défi de sécurité commun

OpenAI a déclaré que ces campagnes de distillation posaient des risques pour la sécurité et la sécurité nationale, car le raisonnement extrait pourrait servir à entraîner d’autres modèles sans conserver les garde-fous appropriés.

« Ce risque n’est pas propre à OpenAI », a déclaré l’entreprise, ajoutant que des techniques similaires pourraient affecter d’autres systèmes avancés d’IA, « ce qui en fait un défi de sécurité commun nécessitant une coordination à l’échelle du secteur ».

Ces accusations interviennent dans le cadre d’un différend plus large sur l’utilisation des modèles américains par les laboratoires chinois. Le mois dernier, Anthropic a accusé Moonshot et DeepSeek d’acheminer discrètement les requêtes des utilisateurs vers les modèles Claude et de présenter ensuite les réponses aux utilisateurs comme les leurs. Anthropic a également accusé Alibaba et Xiaomi de mener des campagnes de distillation visant ses modèles.

Les agences fédérales américaines ont exprimé des préoccupations similaires, affirmant le mois dernier que des entreprises chinoises d’IA avaient systématiquement extrait des capacités de modèles d’IA américains par distillation.

Entre-temps, The Information a rapporté la semaine dernière que l’autorité chinoise de régulation d’Internet enquêtait sur Moonshot et DeepSeek pour d’éventuelles fuites de données vers Anthropic.