Les craintes concernant les cyberattaques autonomes menées par des agents d’IA portent généralement sur leur capacité potentielle à compromettre des bases de données privées, à installer des logiciels malveillants, voire à paralyser des infrastructures publiques. Le premier cas recensé en Australie a toutefois eu des conséquences bien moins néfastes. Un article publié lundi par ABC News a détaillé comment un homme de Melbourne a utilisé un agent d’IA personnel pour exploiter une faille dans le système de réservation de sa salle de sport.

Résultat : il est passé de la quatrième à la troisième place sur la liste d’attente d’un cours de fitness en annulant la réservation d’un autre membre.

L’homme, identifié uniquement sous le prénom Andrew dans le reportage d’ABC, exécutait une instance de Claude d’Anthropic intégrée à la plateforme open source OpenClaw. OpenClaw fournit un cadre permettant à des modèles comme Claude d’agir de manière autonome en leur donnant accès à des outils pour naviguer sur le web, exécuter des programmes externes, envoyer des messages et mener à bien des tâches complexes.

Dans ce cas, la tâche consistait à inscrire Andrew à un cours de fitness matinal. Au cours du processus, la machine aurait découvert qu’elle pouvait annuler les réservations d’autres membres sans aucune autorisation.

Jusqu’à présent, les cas d’exploits informatiques par IA les plus médiatisés étaient survenus à la suite de tests ratés dans des laboratoires d’IA de pointe. Le cas d’Andrew constitue la première cyberattaque autonome connue en Australie impliquant un agent d’IA aux mains d’un particulier.

Ce que Claude et OpenClaw ont réellement fait

Lorsque l’agent d’IA a découvert la faiblesse de la sécurité du système de réservation de la salle de sport, il en a alerté son utilisateur ; les articles ne laissent pas entendre qu’Andrew — qui travaille pour une entreprise locale de vente d’IA B2B — ait délibérément cherché à découvrir une faille.

L’agent aurait découvert, testé et signalé la faiblesse de manière indépendante, indiquant à son utilisateur que le système ne comportait « aucun contrôle d’autorisation pour annuler les réservations d’autres personnes ». Cela était dû à une faille dans l’API du site web : l’ensemble d’instructions qu’un navigateur envoie au serveur d’une entreprise pour déclencher une action.

Plutôt que d’interagir avec le site web de la salle de sport, l’agent a pu communiquer directement avec l’API. Cela lui a permis de contourner certaines limitations qui n’existaient que sur le site en façade, comme les restrictions concernant l’avance avec laquelle les cours pouvaient être réservés.

Cela a également permis à l’agent d’annuler les réservations d’autres utilisateurs. Lorsque Andrew a demandé s’il pouvait théoriquement être propulsé en tête de la liste d’attente d’un cours prévu plus tard dans la semaine, l’agent a répondu qu’il l’avait déjà fait remonter d’une place en annulant la réservation de la personne en tête de liste. Andrew a déclaré que l’agent n’avait pas réussi à rétablir la réservation lorsqu’il le lui avait demandé. Le membre évincé aurait dû se réinscrire en fin de file.

Les utilisateurs sont-ils juridiquement responsables des actions de leurs agents d’IA ?

La question de savoir qui porte la responsabilité lorsque des systèmes d’IA commettent des cyberattaques reste floue.

Selon l’avocat spécialisé en droit des technologies Hayden Delaney, interrogé par ABC, les logiciels ne peuvent pas être légalement considérés comme des personnes, et seule une personne juridique peut être tenue responsable en vertu du droit australien. Le cas d’Andrew est relativement anodin, puisqu’il ne concerne qu’une liste d’attente dans une salle de sport, mais si des procureurs engageaient des poursuites dans une affaire plus grave, ils pourraient s’en prendre à l’utilisateur qui se trouve derrière l’agent d’IA. Si cette personne n’a pas ordonné à l’agent d’agir de manière malveillante, la responsabilité pourrait plutôt incomber à son créateur ou à un autre prestataire de services.

Ces questions restent entièrement ouvertes, puisqu’elles n’ont encore jamais été examinées par un tribunal.

L’Australian Signals Directorate, l’agence australienne de cybersécurité intérieure, a émis une alerte plus tôt cette année, affirmant que les systèmes d’IA pouvaient mal interpréter les instructions et entraîner des conséquences imprévues pour les entreprises qui les utilisent. Elle a ajouté que la responsabilité de ces conséquences devient plus difficile à établir lorsqu’une chaîne de modèles et de prestataires de services différents est impliquée.

Dans le cas d’Andrew, aucune conséquence apparente n’a été constatée. Peu après avoir découvert la faille, il a demandé au même agent d’IA de rédiger un e-mail au fournisseur du logiciel de la salle de sport pour lui en exposer les détails. Il n’a pas cessé d’utiliser l’agent depuis, ajoutant que cet épisode lui avait appris à utiliser l’IA de manière responsable.

Les anciens systèmes internet ne sont pas préparés à l’ère de l’IA

La facilité avec laquelle Claude et OpenClaw ont pu manipuler les systèmes non protégés d’une entreprise en contournant son site web destiné aux utilisateurs devrait servir de sérieux avertissement. Bill Simpson-Young, du Gradient Institute, un organisme australien de recherche sur la sécurité de l’IA, a déclaré à ABC qu’une grande partie des logiciels qui font fonctionner internet n’avait jamais été conçue pour résister à ces nouvelles menaces.

Le mois dernier, le ministre adjoint Andrew Charlton a déclaré que le gouvernement finançait des recherches menées par la Commonwealth Scientific and Industrial Research Organisation (CSIRO) sur les capacités des modèles d’IA de pointe. L’article d’ABC cite des recherches indépendantes estimant que la durée des tâches que les agents d’IA peuvent accomplir double tous les sept mois.

L’exploitation d’un simple système de réservation de salle de sport peut sembler dérisoire comparée aux cyberattaques autonomes prolongées de demain.