Le modèle d’IA Gemini de Google a piraté trois entreprises alors qu’il était testé en mai, a reconnu l’entreprise vendredi après un article du Wall Street Journal.
Google affirme que Gemini a cessé ses attaques lorsqu’il s’est rendu compte qu’il avait pénétré dans les systèmes d’entreprises réelles. Ces intrusions placent néanmoins Google sur la liste des développeurs d’IA dont les évaluations de sécurité ont dépassé les cibles prévues, après des révélations similaires concernant des incidents de piratage impliquant des agents d’IA développés par OpenAI, Anthropic et Meta.
Irregular, le laboratoire de sécurité qui menait les tests d’IA, avait mis en place des entreprises simulées que les modèles devaient attaquer. Cependant, l’environnement de test a permis par inadvertance aux modèles d’accéder à Internet ouvert. Le Journal a rapporté qu’au moins un nom d’entreprise fictive utilisé dans les exercices d’Irregular était également celui d’une entreprise réelle.
Gemini a pénétré dans le système d’une entreprise par force brute, en essayant des mots de passe jusqu’à trouver le bon. Selon l’article du Journal, il a accédé à deux autres entreprises en utilisant des identifiants trouvés dans des dépôts publics.
Google a déclaré ne pas avoir jugé nécessaire de révéler publiquement ces intrusions, car elles n’avaient apparemment causé aucun dommage aux entreprises.
Il y a également eu un délai entre les tests et le moment où Google a appris ce qui s’était passé. Irregular a indiqué avoir informé les laboratoires concernés fin juillet, tandis que la vice-présidente de l’ingénierie de sécurité de Google, Heather Adkins, a déclaré à Reuters que les trois entreprises attaquées avaient été informées et que Google avait travaillé avec son partenaire de test pour modifier ses procédures.
Irregular a déclaré que le problème était le même que celui impliqué dans des incidents touchant d’autres laboratoires d’IA. Tous les problèmes connus de son côté avaient été résolus plusieurs semaines auparavant, a indiqué un porte-parole à Reuters.
Les récits de ces incidents divergent. Dans son enquête sur l’intrusion d’OpenAI chez Hugging Face, METR a constaté qu’environ 700 agents avaient participé à une attaque coordonnée via un forum de discussion non autorisé, allant jusqu’à développer des communications aux allures de secte entre différents agents. Le récit de Google concernant l’attaque de Gemini décrit un modèle qui a pris des systèmes réels pour des cibles de test, avant de s’arrêter après avoir découvert son erreur.
