Un modèle mental utile
Imaginez l’IA générative comme une carte apprise de ce qui pourrait plausiblement venir ensuite.
Pour le texte, cette carte décrit quelles continuations s’accordent avec l’entrée et avec le texte déjà produit. Pour une image, elle peut décrire quels changements visuels transformeraient du bruit en une image correspondant à une légende. Cette carte est stockée dans les paramètres appris d’un modèle d’IA, et non sous la forme d’un catalogue de réponses prêtes à l’emploi.
Un prompt réduit le champ des possibilités. « Écrivez une phrase » laisse une vaste gamme de résultats valides. « Écrivez une étiquette d’avertissement de six mots pour un sol mouillé » rend une région beaucoup plus restreinte de cette gamme appropriée.
Le modèle échantillonne ensuite parmi les possibilités qu’il a apprises. L’échantillonnage consiste à choisir une étape possible, souvent avec une part d’aléatoire contrôlée. Le choix devient une partie de l’entrée pour l’étape suivante. La répétition de ce processus produit le résultat final.
C’est le lien essentiel entre l’apprentissage de schémas et la création de contenu :
Training examples -> learning objective -> learned pattern model
|
Prompt + initial state -> repeated sampling --+-> generated outputLe diagramme est volontairement général. L’« état initial » peut être une séquence de texte de départ, une zone de bruit, une image existante à modifier ou une autre forme de données. L’« échantillonnage répété » peut consister à ajouter l’unité de texte suivante ou à retirer progressivement un peu de bruit à chaque étape.
Comment fonctionne l’IA générative
La plupart des systèmes génératifs comportent deux phases distinctes.
1. Apprendre une distribution
Pendant l’entraînement, le modèle observe de nombreux exemples du type de données qu’il doit représenter. Un objectif d’apprentissage mesure la capacité du modèle à accomplir une tâche qui met en évidence la structure de ces données. Les paramètres du modèle sont ajustés afin d’améliorer son score.
La tâche exacte dépend de la famille de modèles :
- Un modèle autorégressif prédit l’unité suivante d’une séquence à partir des unités qui la précèdent.
- Un modèle de diffusion apprend à inverser un processus qui ajoute progressivement du bruit.
- Un autoencodeur variationnel apprend un espace structuré de données possibles ainsi qu’une manière de décoder des échantillons issus de cet espace.
- Un réseau antagoniste génératif, ou GAN, entraîne un générateur à produire des échantillons qu’un second modèle, le discriminateur, ne peut pas distinguer de manière fiable des exemples d’entraînement.
Ces méthodes diffèrent, mais chacune donne au système un moyen de produire des échantillons qui ressemblent aux schémas présents dans ses données d’entraînement. Au sens formel de l’apprentissage automatique, c’est ce qui rend le modèle génératif.
2. Échantillonner un résultat
Lorsque vous utilisez le modèle entraîné, votre entrée conditionne le processus de génération. Le « conditionnement » signifie simplement que l’entrée modifie les résultats que le modèle considère comme plausibles.
La génération commence généralement par un état initial. Un modèle de texte dispose du prompt et du texte produit jusque-là. Un modèle de diffusion d’images commence souvent par du bruit. Le modèle prédit une étape suivante, la choisit ou la calcule, met à jour l’état, puis répète le processus jusqu’à atteindre un point d’arrêt.
Ce processus répété est important. Un générateur n’est pas assuré de choisir l’unique réponse complète la plus probable et, en général, il ne récupère pas non plus un élément fini dans un espace de stockage. De petits choix s’accumulent. Des choix différents peuvent produire des résultats valides différents à partir du même prompt.
Un exemple de génération de texte
Supposons qu’un générateur de texte reçoive :
Le sentier était fermé parce que la rivière avait
À l’étape suivante, imaginons que le modèle attribue les probabilités suivantes :
- monté — 54 %
- débordé — 21 %
- dépassé ses berges — 12 %
- toutes les autres continuations — 13 %
Ces chiffres sont illustratifs. Ils ne décrivent pas un modèle précis.
Si le modèle sélectionne « monté », le texte en cours devient :
Le sentier était fermé parce que la rivière avait monté
Le modèle calcule alors un nouvel ensemble de possibilités à partir du prompt et de « monté ». Il pourrait ensuite privilégier « pendant la nuit », « au-dessus » ou un signe de ponctuation. Le processus continue jusqu’à ce que la réponse soit terminée.
Deux détails expliquent une grande partie du comportement de l’IA générative.
Premièrement, la génération est conditionnelle. Remplacer « sentier » par « aéroport » modifie la continuation probable. Deuxièmement, plausible ne signifie pas factuel. Le modèle peut construire une phrase fluide à propos d’une fermeture même si aucun sentier ni aucune rivière n’existe. Son seul processus de génération ne vérifie pas l’affirmation par rapport au monde réel.
Le terme a un sens large et un sens étroit
En apprentissage automatique, un modèle génératif est tout modèle qui représente suffisamment bien la distribution des données pour estimer ou produire des exemples possibles. Cette catégorie est souvent opposée à celle des modèles discriminatifs, qui se concentrent sur la prédiction d’une étiquette ou la séparation de catégories. Un modèle qui apprend à quoi ressemblent les chiffres manuscrits est génératif ; un modèle qui décide seulement si une image représente un zéro ou un un peut être discriminatif.
Dans le langage courant des produits, « IA générative » a généralement un sens plus étroit : des systèmes pilotés par des prompts qui créent des contenus numériques complexes. Ces systèmes utilisent souvent de grands modèles polyvalents, mais la taille et la polyvalence ne sont pas requises par la définition technique large. Comme le souligne le NIST, toute l’IA générative ne provient pas de modèles de fondation.
C’est pourquoi les définitions peuvent sembler incohérentes. Certaines décrivent une classe de modèles statistiques. D’autres décrivent la génération actuelle de produits construits avec cette classe.
Pourquoi l’IA générative est importante
Un système de prédiction traditionnel renvoie souvent une étiquette parmi un ensemble fixe ou un nombre. Un système génératif peut construire un résultat dont le contenu exact n’a pas été spécifié à l’avance.
Cela rend un même modèle utile pour de nombreuses tâches qui peuvent être exprimées sous forme de génération. Un modèle de texte peut rédiger, résumer, traduire, reformater ou écrire du code, car chacune de ces tâches peut être formulée comme la production d’une séquence appropriée. Un modèle d’image peut créer, étendre ou modifier une image, car chacune de ces tâches peut être formulée comme la génération de données visuelles dans différentes conditions.
Cette flexibilité crée également le principal problème de fiabilité. De nombreux résultats peuvent sembler plausibles. Seuls certains répondent aux besoins implicites de l’utilisateur, correspondent aux faits externes, évitent les contenus nuisibles ou respectent les contraintes juridiques et sociales. La capacité du modèle à produire une forme convaincante ne garantit pas le contenu qu’elle renferme.
Idées reçues courantes
« Il cherche dans une base de données et assemble une réponse »
Un modèle génératif crée normalement un résultat en appliquant de manière répétée des paramètres appris, et non en sélectionnant une réponse stockée. Cela ne signifie pas que la mémorisation est impossible. Les modèles peuvent reproduire des parties de leurs données d’entraînement, en particulier les contenus répétés ou distinctifs. « Ce n’est pas une recherche dans une base de données » et « il ne reproduit jamais de contenu d’entraînement » sont deux affirmations différentes.
« Le contenu généré est vrai »
La génération favorise la conformité aux schémas appris et aux conditions d’entrée. La vérité exige un autre critère : des preuves, un calcul, une observation ou une source fiable. Une réponse fluide peut néanmoins contenir des noms, des citations, des événements ou des explications causales inventés.
« Le contenu généré doit être original »
Le résultat peut être nouveau dans un sens limité : le système l’a assemblé pendant cette exécution au lieu de récupérer un enregistrement complet stocké. Cela ne permet pas de déterminer s’il est original sur le plan créatif, susceptible d’être protégé juridiquement, dérivé d’une œuvre existante ou influencé par la mémorisation. Ces questions dépendent du résultat, du processus d’entraînement et des règles applicables.
« L’IA générative signifie les chatbots »
Un chatbot est une interface et un modèle d’application. L’IA générative est la catégorie sous-jacente de modèles et de systèmes qui produisent du contenu. Elle comprend également les générateurs spécialisés d’images, d’audio, de vidéos, de code et de données.
« Tous les systèmes d’IA générative sont du même type de modèle »
Les méthodes autorégressives, de diffusion, variationnelles, antagonistes et autres méthodes génératives utilisent des objectifs d’apprentissage et des processus d’échantillonnage différents. Elles partagent un objectif, et non une architecture universelle unique.
Sa place dans un système plus large
Le modèle n’est qu’une partie d’un produit d’IA générative. Une application complète peut lui ajouter des instructions, des contrôles utilisateur, des informations externes, des vérifications de sécurité, des filtres de contenu, des outils et une validation des résultats.
Ces éléments périphériques peuvent modifier le comportement sans changer la définition fondamentale. Une connexion à un moteur de recherche peut fournir à un générateur de texte des éléments factuels à jour. Un filtre peut bloquer certaines images. Un outil de programmation peut exécuter des tests sur du code généré. Le générateur fournit toujours le contenu candidat ; le reste du système fournit le contexte, les capacités et les vérifications.
Pour aller plus loin
Commencez par Qu’est-ce qu’un modèle d’IA ? si vous souhaitez comprendre ce que contient le modèle appris lui-même. Lisez ensuite Qu’est-ce qu’un modèle de fondation ? pour découvrir les modèles polyvalents et réutilisables qui sous-tendent de nombreux produits génératifs actuels, ou Qu’est-ce que l’IA multimodale ? pour les systèmes qui fonctionnent avec du texte, des images, de l’audio et des vidéos.