Aprender
Inferencia y servicio
Inferencia y servicio
6- ComparaciónLatencia vs. TTFT vs. tokens por segundo vs. rendimiento↗La latencia es el tiempo que tarda una solicitud de inferencia, el TTFT es el tiempo que tarda una solicitud transmitida en comenzar a responder, los tokens por segundo son una tasa que puede describir un flujo individual o todo un sistema, y el rendimiento es la cantidad de trabajo total que un sistema completa a lo largo del tiempo. La distinción más importante es el alcance: la latencia y el TTFT cronometran una solicitud, mientras que el rendimiento cuenta el trabajo realizado durante una ventana de medición.
- Concepto¿Qué es el rendimiento de inferencia?↗El rendimiento de inferencia es la cantidad de trabajo del modelo que un sistema de inferencia completa por unidad de tiempo en el conjunto de solicitudes que atiende. Puede medirse en solicitudes completadas, inferencias, muestras o tokens por segundo.
- Concepto¿Qué es el tiempo hasta el primer token?↗El tiempo hasta el primer token, o TTFT, es el tiempo transcurrido entre el inicio de una solicitud a un modelo de lenguaje y la recepción del primer token de su respuesta. Mide la espera inicial, no la rapidez con la que llega el resto de la respuesta.
- Concepto¿Qué es la inferencia en IA?↗La inferencia en IA es el proceso de ejecutar un modelo entrenado sobre una entrada para producir una salida, sin actualizar lo que el modelo ha aprendido. Es la fase de uso de un modelo: entra una foto y sale una etiqueta, o entra un prompt y sale texto generado.
- Concepto¿Qué es la latencia de inferencia?↗La latencia de inferencia es el tiempo transcurrido entre el momento en que un sistema de IA recibe una entrada y el momento en que produce una salida específica. Una cifra de latencia solo es significativa si se sabe dónde empieza el temporizador, dónde termina y qué tipo de salida cuenta como completa.
- Concepto¿Qué son los tokens por segundo?↗Los tokens por segundo (TPS o tok/s) miden cuántos tokens produce un sistema de IA en un segundo. El número puede describir la velocidad de salida de una sola respuesta o el rendimiento combinado de todo un sistema de servicio, por lo que la etiqueta por sí sola es incompleta.