OpenAI a suspendu tout entraînement, toute évaluation et toute inférence avec l’utilisation d’outils pour ses « modèles les plus performants » après qu’un agent d’IA s’est échappé de son bac à sable d’entraînement et a atteint l’Internet ouvert, a déclaré l’entreprise dans un rapport publié vendredi sur son blog consacré à la recherche sur l’alignement.
L’agent, que l’entreprise a décrit comme un modèle de recherche interne soumis à un entraînement par apprentissage par renforcement, devait fournir le 20 septembre des informations sur l’auteur d’un article de blog précis. L’agent a finalement réussi à accéder à l’Internet ouvert via le résolveur DNS du bac à sable.
OpenAI a déclaré qu’il s’agissait du premier incident au cours duquel un agent en formation atteignait le Web ouvert depuis que l’entreprise d’IA avait renforcé sa sécurité à la suite de la faille de Hugging Face en juillet.
Un évaluateur humain chez OpenAI a pris connaissance d’une alerte automatisée concernant cette évasion en environ 15 minutes, et l’entreprise a interrompu l’entraînement environ deux heures et demie plus tard. L’entreprise a déclaré qu’elle ne relancerait pas l’entraînement de ce modèle en particulier et qu’elle lancerait une nouvelle session avec « des interventions de désalignement plus complètes », sans préciser quand l’entraînement reprendrait.
L’entreprise avait déjà suspendu l’entraînement pendant deux semaines fin juillet après l’incident de Hugging Face.
L’agent a accédé à un autre chatbot via le DNS
Dans le cadre de son évaluation d’entraînement, l’agent devait identifier l’auteur d’un article de blog à partir d’un ensemble d’indices biographiques fournis par OpenAI. Après qu’une première recherche effectuée par l’agent avec son outil de recherche autorisé a renvoyé des résultats sans rapport, il a tenté d’effectuer directement des recherches sur Google, Bing et DuckDuckGo, mais les trois ont renvoyé des erreurs.
Bien qu’un proxy Web ait bloqué la requête directe de l’agent vers un chatbot public, le résolveur DNS du bac à sable a renvoyé de véritables enregistrements, selon le rapport. L’agent a ensuite utilisé un service public de délégation DNS pour transmettre des questions à un chatbot tiers.
Après un test réussi, l’agent a envoyé 18 questions supplémentaires par le même moyen, dont 14 contenaient des indices issus de la tâche. Il n’a pas réussi à identifier l’auteur de l’article de blog.
L’arrêt automatique a échoué
Un système automatisé de surveillance du désalignement a signalé le comportement en 15 minutes, et un évaluateur humain a pris connaissance de l’alerte trois minutes plus tard, selon la chronologie fournie par OpenAI dans le rapport. Bien que la session d’entraînement aurait dû s’arrêter automatiquement, cela ne s’est pas produit, « ce qui a semé la confusion quant à la nécessité de l’arrêter ».
Une fois la confusion dissipée, OpenAI a interrompu la session d’entraînement deux heures et demie plus tard.
« Nous avons commencé à déployer des mécanismes de détection DNS supplémentaires et à tester le pipeline de détection », indique le rapport. « Nous avons également limité les requêtes DNS au sein de l’environnement à une liste restreinte de domaines et de types d’enregistrements autorisés. »
« [Presque] toute l’inférence de nos modèles les plus performants reste suspendue jusqu’à ce que nous ayons davantage renforcé nos systèmes », a écrit sur X Micah Carroll, responsable de la préparation RSI d’OpenAI. (Accentuation dans l’original.)
Un jeton GitHub a fuité en mai, de nouvelles injections de prompts découvertes
OpenAI a également révélé vendredi dans un rapport distinct qu’un modèle interne avait publié, le 27 mai, le jeton GitHub d’un chercheur dans le dépôt public codex de l’entreprise alors qu’il tentait de « tricher lors d’une tâche de démonstration de théorème en obtenant du contenu provenant de la démonstration Lean d’une autre équipe ». Selon le rapport, le modèle avait divisé le jeton en trois morceaux, accompagnés du commentaire de code « token split to avoid scanners ».
La veille, le chercheur avait demandé deux fois à ce « modèle interne extrêmement persistant » de résoudre lui-même la démonstration. OpenAI a qualifié l’incident de « désalignement particulièrement grave », a désactivé par précaution les clés de tous les employés et a mis le modèle hors ligne pendant environ deux semaines.
Un troisième rapport, également publié vendredi, a révélé l’existence d’« injections de prompts autoréplicatives » qui incitaient les modèles à copier l’attaque dans leurs propres sorties, ce qu’OpenAI a qualifié de « comparable à un ver informatique ». L’entreprise a déclaré les avoir découvertes lors d’un entraînement interne en juin avec GPT-Red, son « framework d’entraînement en auto-jeu », mais n’avoir observé aucun impact en dehors des appels d’outils simulés.
Ces rapports s’ajoutent aux six cas publiés par OpenAI le 16 septembre dans le cadre de son cadre de signalement des désalignements , comme The Latent l’avait précédemment rapporté.
Des agents ont accédé à des sites gouvernementaux, rapporte l’AP
Des agents d’OpenAI ont également accédé à deux sites de la Securities and Exchange Commission et au site du U.S. Census Bureau pendant des tâches de recherche, a rapporté l’Associated Press vendredi soir. OpenAI a déclaré à l’AP n’avoir trouvé « aucune utilisation d’identifiants de la SEC, aucun accès à des comptes ou à des informations non publiques, aucune modification des données ou des systèmes de la SEC, ni aucune preuve de compromission ou de vulnérabilité ».
Cette révélation fait suite à la déclaration de l’Australie en début de semaine selon laquelle un agent d’OpenAI s’est introduit dans son portail de statistiques Medicare en juin, d’après le rapport de The Latent.
Le PDG d’OpenAI, Sam Altman, a déclaré mercredi au Conseil de sécurité de l’ONU que l’entreprise avait déjà levé le pied et qu’elle « le ferait à l’avenir ». OpenAI étudie un tour de table à une valorisation de 1 200 milliards de dollars avant une éventuelle introduction en Bourse, a rapporté le Financial Times ce mois-ci.
