Un modelo mental útil
Piensa en los tokens de salida como partes de la respuesta y como pasos para elaborarla.
Un modelo de texto no escribe una respuesta completa entre bastidores para después dividirla en tokens. Construye la respuesta token a token. Después de cada token, la secuencia creciente pasa a formar parte de la información utilizada para elegir el siguiente.
Esta diferencia explica por qué una respuesta larga tarda más en generarse que una corta. Cada token de salida adicional requiere otro paso de generación.
Cómo se generan los tokens de salida
Después de procesar la entrada, el modelo asigna una puntuación a cada token que podría aparecer a continuación. La configuración de generación determina cómo se elige una de esas posibilidades. El token seleccionado se añade a la secuencia y el modelo repite el proceso.
process the input
|
v
score possible next tokens
|
v
choose one output token ----+
| |
v |
append it to the sequence --+
|
v
stop when a stopping condition is metEl ciclo puede terminar porque:
- el modelo llega a un final natural;
- genera una secuencia de parada configurada;
- alcanza un límite máximo de tokens de salida;
- cambia a una acción, como una llamada a una herramienta; o
- el servicio aplica otra condición de parada específica del modelo o de la política.
El recuento exacto de tokens depende del tokenizador del modelo. Una palabra corta puede ser un solo token. Una palabra más larga o menos familiar puede dividirse en varios. Los espacios, la puntuación, el código y el texto en idiomas distintos del inglés también pueden dividirse de forma diferente. Por eso, el número de caracteres y de palabras puede servir para estimar la longitud de salida, pero no puede determinarla con exactitud.
Qué cuenta como token de salida
En una respuesta de texto normal, la respuesta visible está formada por tokens de salida generados. El JSON generado y los argumentos de llamadas a herramientas también son salidas del modelo, aunque una aplicación los muestre como una acción de interfaz en lugar de mostrar el texto sin procesar.
Las categorías de uso del proveedor añaden una segunda capa. «Tokens de salida» puede referirse tanto a la secuencia generada visible como a un total contabilizado. Esos totales no están estandarizados:
- Algunas API llaman a los tokens generados tokens de completado.
- Algunas incluyen el razonamiento oculto en el total de salida y proporcionan un desglose separado.
- Algunas informan de los tokens visibles de las candidatas y de los tokens de pensamiento en campos separados.
- Los tipos especiales de salida pueden tener sus propios detalles o reglas de facturación.
La fuente fiable para una solicitud son los datos de uso que devuelve ese proveedor y endpoint. No infieras la salida facturada únicamente copiando la respuesta visible en un tokenizador. La documentación actual de OpenAI, Anthropic, y Google ilustra el motivo: sus etiquetas y desgloses difieren.
Un ejemplo práctico
Imagina una solicitud a una API con un máximo de 100 tokens de salida.
El modelo genera una respuesta completa y se detiene después de 24 tokens. Los datos de uso informan de lo siguiente:
{
"input_tokens": 18,
"output_tokens": 24,
"total_tokens": 42
}El recuento de tokens de salida es 24. La configuración de 100 tokens solo era un límite máximo. No obligó al modelo a producir 100 tokens y, por sí sola, tampoco significa que se facturaran 100 tokens.
Ahora supón que el modelo continúa hasta alcanzar el límite máximo de 100 tokens. La solicitud aún puede devolver una respuesta de API técnicamente correcta, pero la respuesta puede terminar a mitad de una frase o de una estructura. Una aplicación de producción debería comprobar el motivo de parada de la respuesta en lugar de asumir que el texto devuelto está completo.
Hay otra complicación. Un modelo de razonamiento puede generar razonamiento interno antes de la respuesta visible. Según el proveedor, el uso puede incluir esos tokens ocultos en output_tokens o informarlos en un campo de pensamiento separado. Por tanto, la respuesta visible y la salida contabilizada pueden tener recuentos de tokens diferentes.
Por qué importan los tokens de salida
Coste
Los servicios cuyo precio se basa en tokens suelen contabilizar la entrada y la salida por separado, y sus tarifas pueden diferir. Por tanto, el uso real de salida, no solo el límite máximo solicitado, forma parte del coste de cada solicitud. Los sistemas de cuota específicos del proveedor pueden reservar temporalmente capacidad basándose en el límite máximo, aunque la facturación utilice la generación real.
Tiempo de respuesta
Los tokens de salida se generan secuencialmente. Una salida más larga generalmente implica más pasos de generación y una espera mayor hasta completar la respuesta. La transmisión puede mostrar antes una parte de la salida, pero no elimina el trabajo necesario para generar los tokens restantes.
Completitud
Un límite máximo de salida ayuda a controlar la longitud, pero un límite demasiado bajo puede truncar prosa, código, JSON o argumentos de herramientas. Comprueba el motivo de parada siempre que la completitud sea importante.
Contexto disponible
Tanto la entrada como la salida consumen espacio en la ventana de contexto de un modelo. Una solicitud que utiliza la mayor parte del espacio disponible para la entrada puede dejar menos espacio para la generación, sujeto a los límites y las reglas de contabilización del modelo y del endpoint.
Malentendidos frecuentes
«Los tokens de salida son lo mismo que las palabras»
No lo son. Los tokens pueden ser palabras completas, partes de palabras, signos de puntuación, espacios u otras unidades. La misma oración puede tener diferentes recuentos de tokens con tokenizadores distintos.
«La configuración máxima de salida es la salida esperada»
Es un límite superior. El modelo puede detenerse antes de alcanzarlo. Los proveedores también pueden aplicar un límite inferior del modelo o un presupuesto compartido que incluya el razonamiento interno.
«Si la API devolvió texto, la respuesta está completa»
No necesariamente. Al alcanzar el límite de salida, se puede devolver texto parcial con un motivo de parada relacionado con la longitud. Esto es especialmente importante para el código y los datos estructurados, donde la falta de un solo carácter de cierre puede hacer que el resultado sea inutilizable.
«La respuesta visible equivale a la salida facturada»
A menudo, pero no siempre. El razonamiento oculto, varias candidatas generadas o la contabilización específica del endpoint pueden hacer que el uso sea mayor que el texto que ves. Considera autorizados los campos de uso devueltos por ese servicio.
«La longitud de salida está fijada por el prompt»
El prompt influye en la longitud, pero la generación sigue siendo condicional. El comportamiento del modelo, la configuración de muestreo, las secuencias de parada, el uso de herramientas y el comportamiento de seguridad pueden cambiar el punto en que termina la salida.
Cómo encajan los tokens de salida en una solicitud al modelo
Una solicitud comienza con tokens de entrada. Después, el modelo genera tokens de salida. Los modelos de razonamiento también pueden utilizar tokens de razonamiento, cuyo tratamiento en los informes y la facturación varía según el proveedor.
La diferencia se aprecia mejor lado a lado en Tokens de entrada vs. tokens de salida vs. tokens de razonamiento. Si estás midiendo el comportamiento del servicio, la generación de salida también se relaciona directamente con los tokens por segundo y la latencia de inferencia.
La regla práctica es sencilla: establece un límite máximo de salida razonable, lee el uso real y revisa el motivo de parada antes de considerar completa la respuesta.