Apprendre
Inférence et déploiement
Inférence et déploiement
6- ComparaisonLatence vs TTFT vs tokens par seconde vs débit↗La latence correspond au temps nécessaire à une requête d’inférence, le TTFT au temps nécessaire à une requête diffusée en continu pour commencer à répondre, les tokens par seconde à un débit qui peut décrire un flux unique ou l’ensemble d’un système, et le débit à la quantité totale de travail accomplie par un système au fil du temps. La distinction la plus importante concerne la portée : la latence et le TTFT mesurent le temps d’une requête, tandis que le débit comptabilise le travail effectué pendant une fenêtre de mesure.
- ConceptQue sont les tokens par seconde ?↗Les tokens par seconde (TPS ou tok/s) mesurent le nombre de tokens qu’un système d’IA produit en une seconde. Ce nombre peut décrire la vitesse de sortie d’une seule réponse ou le débit cumulé de l’ensemble d’un système de service ; le libellé seul est donc incomplet.
- ConceptQu’est-ce que la latence d’inférence ?↗La latence d’inférence est le temps écoulé entre le moment où un système d’IA reçoit une entrée et celui où il produit une sortie donnée. Une valeur de latence n’est significative que si l’on sait où démarre le chronomètre, où il s’arrête et quel type de sortie est considéré comme terminé.
- ConceptQu’est-ce que le débit d’inférence ?↗Le débit d’inférence correspond à la quantité de travail du modèle qu’un système d’inférence effectue par unité de temps pour l’ensemble des requêtes qu’il traite. Il peut être mesuré en requêtes terminées, en inférences, en échantillons ou en jetons par seconde.
- ConceptQu’est-ce que le délai avant le premier token ?↗Le délai avant le premier token, ou TTFT, est le temps écoulé entre le début d’une requête adressée à un modèle de langage et la réception du premier token de sa réponse. Il mesure l’attente initiale, et non la vitesse à laquelle le reste de la réponse arrive.
- ConceptQu’est-ce que l’inférence en IA ?↗L’inférence en IA est le processus qui consiste à exécuter un modèle entraîné sur une entrée pour produire une sortie, sans modifier ce que le modèle a appris. C’est la phase d’utilisation d’un modèle : une photo est fournie et une étiquette est renvoyée, ou une invite est fournie et du texte généré est renvoyé.