Glossaire

Des définitions claires des termes de l’IA moderne, des tokens et fenêtres de contexte à l’inférence, aux agents et aux benchmarks, chacune reliée à une explication complète.

  1. A
  2. C
  3. D
  4. E
  5. F
  6. H
  7. I
  8. J
  9. L
  10. M
  11. P
  12. R
  13. T
  14. U

A

Agent IA
Un agent IA est un système logiciel qui poursuit un objectif en utilisant un modèle d’IA pour choisir ses prochaines actions, observer les résultats et continuer jusqu’à ce qu’il ait terminé, qu’il ait besoin d’aide ou qu’il atteigne une limite. Contrairement à un modèle qui produit uniquement une réponse, un agent peut contrôler un processus en plusieurs étapes et agir au moyen d’outils dans le cadre d’autorisations définies.
Apprentissage automatique
L’apprentissage automatique est une manière de créer des logiciels qui apprennent des régularités à partir d’exemples ou de retours, puis utilisent ces régularités pour produire des prédictions, des décisions ou des résultats utiles sur des cas qu’ils n’ont encore jamais vus. Il s’agit d’une approche de l’intelligence artificielle, et non d’un synonyme de l’IA dans son ensemble.

C

Chatbot IA
Un chatbot IA est une application logicielle qui utilise l’intelligence artificielle pour converser avec une personne par texte ou par voix. Il reçoit des messages, utilise un modèle d’IA pour les interpréter ou y répondre, et gère le contexte, les règles, les données et les actions nécessaires à la poursuite de l’échange.

D

Date de coupure des connaissances de l’IA
La date de coupure des connaissances d’une IA est la date jusqu’à laquelle les connaissances intégrées d’un modèle sont censées refléter ses données d’entraînement. Il s’agit d’une limite approximative, et non d’une garantie que le modèle connaît tous les faits antérieurs ou qu’un produit d’IA ne peut pas récupérer des informations ultérieures.
Débit d’inférence
Le débit d’inférence correspond à la quantité de travail du modèle qu’un système d’inférence effectue par unité de temps pour l’ensemble des requêtes qu’il traite. Il peut être mesuré en requêtes terminées, en inférences, en échantillons ou en jetons par seconde.
Délai avant le premier token
Le délai avant le premier token, ou TTFT, est le temps écoulé entre le début d’une requête adressée à un modèle de langage et la réception du premier token de sa réponse. Il mesure l’attente initiale, et non la vitesse à laquelle le reste de la réponse arrive.

E

Entraînement en IA
L’entraînement en IA est le processus qui consiste à modifier les valeurs internes ajustables d’un modèle afin que ses sorties satisfassent mieux un objectif choisi. Le modèle s’améliore grâce à des retours et des mises à jour répétés, plutôt qu’en demandant à un programmeur d’écrire une règle pour chaque cas.

F

Fenêtre de contexte
Une fenêtre de contexte est la quantité maximale de contenu tokenisé qu’un modèle d’IA peut utiliser pour produire une réponse. Dans de nombreuses API de modèles de langage, ce budget couvre l’entrée et la sortie générée, bien que les fournisseurs puissent également imposer des limites distinctes pour l’entrée ou la sortie.

H

Harnais d’IA
Un harnais d’IA est le logiciel qui entoure un modèle d’IA et qui contrôle ce que le modèle reçoit, ce qui arrive à sa sortie et la façon dont il se connecte au reste d’une application. Il peut être aussi simple qu’un code qui gère un historique de conversation ou aussi complet qu’un environnement d’exécution qui gère des outils, la mémoire, les autorisations, les nouvelles tentatives et les tâches de longue durée.

I

IA générative
L’IA générative est une intelligence artificielle qui apprend les schémas présents dans des données existantes et utilise ces schémas pour produire de nouveaux contenus, tels que du texte, des images, de l’audio, des vidéos ou du code. Elle génère généralement ces contenus en réponse à une instruction ou à une autre entrée.
IA multimodale
L’IA multimodale est une IA capable de traiter et de mettre en relation des informations provenant de plusieurs types de données — texte, images, audio ou vidéo, par exemple — afin d’accomplir une même tâche. Un modèle multimodal peut accepter une image et une instruction écrite, puis ne produire que du texte ; « multimodal » ne signifie pas que chaque type de données fonctionne à la fois comme entrée et comme sortie.
Inférence en IA
L’inférence en IA est le processus qui consiste à exécuter un modèle entraîné sur une entrée pour produire une sortie, sans modifier ce que le modèle a appris. C’est la phase d’utilisation d’un modèle : une photo est fournie et une étiquette est renvoyée, ou une invite est fournie et du texte généré est renvoyé.
Intelligence artificielle
L’intelligence artificielle (IA) est le domaine qui consiste à concevoir des systèmes informatiques produisant des résultats orientés vers un objectif — comme des prédictions, du contenu, des recommandations ou des décisions — au moyen de méthodes associées à des capacités telles que l’apprentissage, le raisonnement, la perception et le langage. L’IA désigne également les systèmes créés par ce domaine.

J

Jeton en IA
Un jeton en IA est un élément du vocabulaire qu’un LLM utilise pour représenter et générer du texte. Selon le tokenizer du modèle, un jeton peut correspondre à un mot, à une partie de mot, à un signe de ponctuation, à un espace ou même à une partie d’un caractère encodé.
Jetons de sortie
Les jetons de sortie sont les unités qu’un modèle génère lorsqu’il produit une réponse. Ils constituent généralement le texte, le code, les données structurées ou les instructions d’appel d’outil que vous recevez, bien qu’un fournisseur puisse également comptabiliser le raisonnement masqué dans l’utilisation de sortie.

L

Latence d’inférence
La latence d’inférence est le temps écoulé entre le moment où un système d’IA reçoit une entrée et celui où il produit une sortie donnée. Une valeur de latence n’est significative que si l’on sait où démarre le chronomètre, où il s’arrête et quel type de sortie est considéré comme terminé.
LLM
Un grand modèle de langage (LLM) est un modèle d’IA entraîné sur de vastes collections de données linguistiques afin de traiter ou de générer des séquences de texte probables. La plupart des LLM utilisés pour générer du texte reçoivent une invite et produisent une réponse petit élément par petit élément.

M

Modèle d’IA
Un modèle d’IA est la partie d’un système d’IA qui transforme une entrée en sortie, par exemple une prédiction, une classification, une recommandation, une action ou un résultat généré. Dans l’usage actuel, ce terme désigne le plus souvent un modèle d’apprentissage automatique dont le comportement a été façonné par des données d’entraînement.
Modèle de fondation
Un modèle de fondation est un modèle d’apprentissage automatique entraîné sur des données variées afin de pouvoir être adapté à de nombreuses tâches différentes, plutôt que d’être conçu pour une seule. Il constitue un point de départ réutilisable, et non une application terminée.

P

Paramètres du modèle
Les paramètres du modèle sont les valeurs numériques stockées à l’intérieur d’un modèle ajusté qui déterminent la manière dont il transforme une entrée en sortie. Dans un réseau neuronal, ils comprennent généralement les poids et les biais, dont les valeurs sont choisies pendant l’entraînement puis réutilisées lorsque le modèle effectue des prédictions.
Poids du modèle
Les poids d’un modèle sont des nombres appris qui déterminent avec quelle intensité un modèle utilise chaque signal d’entrée ou intermédiaire lors du calcul d’une sortie. Ils sont généralement stockés en grands groupes appelés matrices ou tenseurs, et l’entraînement les modifie afin que les sorties du modèle correspondent mieux à son objectif.

R

Réseau neuronal
Un réseau neuronal est un modèle d’apprentissage automatique qui apprend à transformer des nombres d’entrée en nombres de sortie utiles en les faisant passer par des couches connectées de calculs simples. Ces couches forment une seule fonction mathématique entraînable, et non un cerveau électronique au sens littéral.

T

Tokens d’entrée
Les tokens d’entrée sont les tokens qu’un modèle reçoit et traite avant de commencer à générer la réponse suivante. Ils proviennent de la requête complète destinée au modèle, et pas seulement des derniers mots que vous avez saisis.
Tokens de raisonnement
Les tokens de raisonnement sont des tokens qu’un modèle d’IA génère en travaillant à une réponse, indépendamment du texte de réponse que vous voyez. Ils représentent des étapes générées supplémentaires, comme la planification, la vérification ou l’essai d’une approche, et peuvent être comptabilisés dans l’utilisation et les limites même si le service les masque.
Tokens par seconde
Les tokens par seconde (TPS ou tok/s) mesurent le nombre de tokens qu’un système d’IA produit en une seconde. Ce nombre peut décrire la vitesse de sortie d’une seule réponse ou le débit cumulé de l’ensemble d’un système de service ; le libellé seul est donc incomplet.

U

Utilisation d’outils par les LLM
L’utilisation d’outils par les LLM est un mécanisme qui permet à un modèle de langage de demander une opération externe — comme interroger une base de données, effectuer un calcul ou envoyer un message — puis d’utiliser le résultat obtenu dans sa réponse. Le modèle choisit généralement l’outil et fournit les entrées proposées ; les logiciels qui l’entourent décident d’exécuter ou non l’appel.