Ce mercredi, The Information a rapporté le dernier épisode d’une série de rapports faisant état de modèles d’IA de pointe américains ayant réussi à mener des cyberattaques en conditions réelles contre de véritables entreprises. Le modèle de codage de Meta, Muse Spark 1.1, aurait compromis les systèmes d’une entreprise non identifiée lors de tests menés par un tiers. Cette affaire survient peu après l’exploitation de Hugging Face par l’agent d’OpenAI, détectée le 17 juillet, ainsi que la compromission de trois entreprises distinctes par Claude, révélée le 30 juillet.
Au cœur des incidents impliquant Anthropic et Meta se trouve Irregular, une entreprise israélienne spécialisée dans la sécurité, qui a mené les tests dans les deux cas. Interrogé par CNN, le prestataire a reconnu que la compromission de Meta résultait du « même problème exact dans l’environnement d’évaluation » que celle d’Anthropic survenue moins d’une semaine auparavant : des mesures de protection essentielles auraient été mal configurées lors de la mise en place, laissant les modèles exposés à Internet.
Des failles dans l’environnement de test ont permis à Muse Spark 1.1 d’accéder à Internet
Les environnements de test mis en place par Irregular sont censés être entièrement isolés : des systèmes fermés, sans connexion à Internet. Dans ces environnements, les modèles se voient attribuer des exercices tels que des tests de type « capture du drapeau », qui consistent à récupérer une information sur une autre machine sans instruction humaine supplémentaire.
Étant donné qu’ils opèrent dans des environnements censés être hermétiquement isolés, certains des mécanismes de protection habituellement déployés sur les modèles publics sont désactivés intentionnellement.
Fait important, les agents chargés d’exécuter les tâches sont informés des limites de leur environnement lors de la formulation des requêtes. Pendant l’exploitation visant Anthropic, ces agents ont parfois compris qu’ils avaient accidentellement obtenu un accès à Internet, mais ont estimé qu’il devait s’agir d’un élément prévu du processus de test.
Les ingénieurs chargés des tests ont également configuré certaines cibles avec les noms d’entreprises réelles. Ainsi, une fois libérés sur Internet, les modèles ont ciblé les véritables entreprises plutôt que leurs équivalents fictifs. Les compromissions réussies qui ont suivi résultaient de points d’accès non sécurisés et d’identifiants de sécurité faibles, plutôt que d’une opération complexe menée par les modèles d’IA.
Les premiers rapports suggèrent qu’un incident similaire s’est produit chez Meta : Muse Spark 1.1 a reçu par erreur un accès à Internet, puis a « exploité une vulnérabilité de sécurité dans un service tiers ».
Les détails restent rares, dans l’attente d’une analyse rétrospective officielle
On ignore encore quelle entreprise le modèle d’IA de Meta a compromise, ou si son nom sera un jour rendu public. De même, les rapports actuels ne précisent pas si l’entreprise a elle-même détecté l’intrusion ou si la révélation de Meta a constitué son premier signalement. Dans le cas d’Anthropic, deux des trois entreprises touchées n’ont pas détecté l’attaque.
Un porte-parole de Meta a promis que l’entreprise « publierait une analyse rétrospective complète une fois que nous disposerons de tous les faits ».
Ces conclusions pourraient s’avérer plus importantes pour le laboratoire de sécurité Irregular que pour Meta elle-même. L’entreprise était auparavant largement inconnue du grand public, même après avoir levé 80 millions de dollars en septembre dernier, sur la base d’une valorisation de 450 millions de dollars, et obtenu des contrats de test avant lancement avec chacun des grands laboratoires américains d’IA de pointe. Après plusieurs révélations de compromissions en l’espace d’une semaine, elle se trouve désormais au centre des discussions sur les mesures de protection contre les cyberattaques liées à l’IA à Washington et au-delà.
Le gouvernement américain a publié mardi son cadre d’évaluation des modèles de pointe, destiné à donner aux autorités fédérales un aperçu des nouveaux modèles jusqu’à 30 jours avant leur diffusion plus large afin d’évaluer leurs capacités en matière de cybersécurité. À la lumière de ces évolutions récentes, la sécurité des environnements de test prend une importance aussi grande dans le débat que les capacités des modèles eux-mêmes.
