Un test de sécurité de l’IA a révélé une faille dans les protections qui empêchent les modèles Kimi de Moonshot de répondre à des demandes liées aux armes biologiques et aux assassinats.

Mindgard, qui teste la vulnérabilité des systèmes d’IA, a déclaré à la BBC que ses chercheurs avaient jailbreaké Kimi K2.6 et K3 Swarm en juillet, en amenant les deux modèles à fournir des conseils sur ces sujets. Le processus consiste à soumettre à un modèle d’IA une série d’instructions complexes afin de vérifier s’il contournera les limites de sécurité fixées par ses concepteurs.

L’entreprise a déclaré avoir envoyé un e-mail à Moonshot au sujet des vulnérabilités le 27 juillet, puis l’avoir relancée environ une semaine plus tard, avant de publier un article de blog le 12 septembre. Selon Mindgard, Moonshot n’a pris contact que récemment, après que la BBC a demandé un commentaire à l’entreprise.

Moonshot a déclaré à la BBC qu’elle accueillait favorablement l’examen externe « comme un pilier essentiel pour construire une IA meilleure et plus sûre » et qu’elle discutait des résultats avec Mindgard. Dans un e-mail envoyé à Mindgard et communiqué à la BBC, le développeur chinois a déclaré que son modèle avait généralement affiché « un taux de refus élevé pour ce type de demandes » lors d’évaluations internes.

« Une fois le jailbreak réussi, le modèle parlera de n’importe quel sujet, il proposera même librement des recommandations sur d’autres sujets qui sont eux aussi malveillants, et il fera preuve d’inventivité et de créativité », a déclaré au programme Tech Life du BBC World Service Peter Garraghan, fondateur de Mindgard.

Mindgard n’a pas prouvé que les conseils sur les armes et les assassinats fonctionneraient réellement. L’entreprise estime que les garde-fous auraient dû empêcher les modèles de répondre à ces demandes. Elle a également déclaré être convaincue qu’un Kimi K2.6 jailbreaké pourrait permettre à des pirates d’exécuter du code sur ses ressources informatiques et de se connecter à Internet, ce qui en ferait une possible plateforme de lancement pour des cyberattaques.

Cette révélation fait suite à de récentes divulgations concernant des agents d’IA de plusieurs grands développeurs. Google a déclaré que Gemini avait accédé à trois entreprises lors de tests de sécurité en mai, tandis que des responsables australiens ont déclaré qu’un agent d’OpenAI avait accédé à des fichiers publics et non publics sur un portail gouvernemental de santé en juin.

Kimi est un modèle à poids ouverts, ce qui signifie que les utilisateurs peuvent l’exécuter sur leur propre infrastructure informatique. Alan Woodward, professeur à l’Université de Surrey, a déclaré à la BBC que de tels modèles pourraient tomber entre de mauvaises mains, mais qu’ils pourraient également être utilisés pour la cyberdéfense.

AI Chat Search Interest

AI Chat Search Interest

  • ChatGPT
  • Claude
  • Gemini
  • DeepSeek
  • Perplexity
  • Grok
  • Kimi
  • Qwen
SOURCE: Google Trends via The Latent