OpenAI commencera à ajouter, au cours des prochaines semaines, des filigranes invisibles à certaines sorties textuelles des modèles de ChatGPT et de Codex pour les utilisateurs situés dans l’Union européenne, a déclaré lundi.
Le système de filigranage d’OpenAI est activable sur demande pour les clients de son API dans le monde entier. À partir du 5 octobre, le système signalera de manière invisible comme générés par une IA les textes produits par certains modèles d’IA, bien que la fonctionnalité reste désactivée par défaut. OpenAI a attribué le déploiement de cette fonctionnalité aux exigences de transparence de l’AI Act de l’UE, une initiative de l’organisation visant à réduire les hypertrucages et les textes manipulés « publiés dans le but d’informer le public sur des questions d’intérêt général ».
Le système de filigranage, que l’entreprise appelle textGrain, intègre un schéma statistique dans les choix linguistiques spécifiques du modèle, mais ne devrait pas modifier la fiabilité générale de ses sorties : le filigranage n’a produit aucune différence significative de performances dans les tests de référence d’OpenAI, a déclaré l’entreprise. OpenAI a indiqué prévoir de publier la technologie en open source, mais son détecteur ne sera dans un premier temps accessible qu’aux chercheurs agréés et aux organisations spécialisées.
Les tests internes de l’entreprise montrent toutefois que les modifications peuvent facilement perturber la détection du filigrane. Lors d’un test portant sur de courts passages de 400 tokens, remplacer seulement un mot sur dix par un synonyme a fait passer le taux de détection réussie d’environ 92 % à 66 %. Dans un autre test de l’entreprise, remplacer un quart des mots par des synonymes a ramené la détection à seulement 17 %.
Anthropic a déjà pris une mesure similaire en matière de filigranage. Comme l’a rapporté The Latent lors du lancement de Claude Fable 5.1, son système de filigranage, lui aussi invisible, a suscité les objections d’utilisateurs qui craignaient qu’une assistance, même minime, de l’IA puisse entraîner le signalement de leur travail, ou que le filigranage rende les sorties des modèles moins bonnes. Fable 5.1 est actuellement le troisième modèle le mieux classé selon le benchmark de The Latent, derrière GPT-6 Astra d’OpenAI et Opus 5.5 d’Anthropic.
Les courts passages et les sujets offrant peu de flexibilité dans le choix des mots, comme les mathématiques, se sont également révélés plus difficiles à détecter, selon les tests d’OpenAI, car il y a « moins de flexibilité dans le choix des mots ».
OpenAI a déclaré que ses filigranes ne peuvent pas établir « à qui appartient le texte, si son utilisation était légale, si sa divulgation était requise ou qui en est responsable ». Le système peut également ne pas reconnaître les textes générés par d’autres modèles ou par d’anciens modèles d’OpenAI ; par conséquent, l’absence de filigrane ne permet pas d’établir qu’un humain a écrit le passage, selon l’entreprise.
