Tokens de entrada
Tokens de entrada representan el contenido proporcionado para una solicitud. Esto puede incluir instrucciones del sistema y del desarrollador, el mensaje más reciente del usuario, turnos anteriores de la conversación, documentos recuperados, definiciones de herramientas, resultados de herramientas e imágenes o audio codificados cuando el modelo los admite.
“Entrada” describe la dirección de los datos, no quién los escribió. Un usuario puede escribir una sola frase breve mientras la aplicación envía silenciosamente una solicitud mucho más grande a su alrededor.
La entrada almacenada en caché sigue siendo entrada. El almacenamiento en caché puede cambiar su precio o la forma en que aparece en un informe de uso, pero no convierte el contenido en salida ni lo elimina del contexto de trabajo del modelo.
Tokens de salida
Tokens de salida se generan durante la respuesta. La prosa y el código visibles son salida, pero también lo son las estructuras generadas, como las llamadas a herramientas. Según la terminología del proveedor, el total de salida informado también puede incluir el razonamiento interno y otros tokens generados no visibles.
Por eso, el texto que aparece en pantalla no es un contador de tokens fiable. La respuesta puede mostrar 180 tokens de prosa mientras el registro de uso informa de un total generado mucho mayor.
Tokens de razonamiento
Tokens de razonamiento, a veces llamados tokens de pensamiento, se generan internamente mientras un modelo de razonamiento planifica, verifica o trabaja en una tarea. No son contenido adicional del prompt ni necesariamente se muestran al usuario.
Un proveedor puede ocultar el razonamiento, omitirlo o devolver un resumen. Un resumen es una presentación del proceso, no una prueba de que hayas recibido todos los tokens de razonamiento internos. La documentación actual de OpenAI, Anthropic y Google contabiliza todo el trabajo interno, aunque no se devuelva el texto completo.
No todos los modelos o las API exponen un recuento de tokens de razonamiento. Algunos modelos generan una respuesta sin una fase de razonamiento informada por separado. Otros admiten controles que influyen en el esfuerzo de razonamiento, pero esos controles no garantizan una cantidad exacta de pensamiento, a menos que el proveedor lo indique explícitamente.
La distinción real
Las tres etiquetas responden a preguntas diferentes:
| Token type | Defining question | Typical contents | Usually visible? | Accounting relationship |
|---|---|---|---|---|
| Input | What did this request send to the model? | Instructions, messages, context, tools, files | Mostly, though applications can add content | A top-level request category; cached input may be a priced subset |
| Output | What did the model generate? | Answer text, code, tool calls, and sometimes internal generated work | Partly | Can be an inclusive total or an answer-only field, depending on the API |
| Reasoning | What internal generated work helped produce the answer? | Planning, intermediate work, checks | Often hidden or summarized | Commonly a subset of generated output for billing, but sometimes reported beside output |
La entrada y la salida generada son lados opuestos de una solicitud. El razonamiento es un tipo de actividad generada. Por tanto, no constituye una tercera categoría universal junto a la entrada y la salida.
Esta distinción es importante al comparar los paneles de los proveedores. OpenAI documenta el razonamiento como un detalle incluido en el recuento total de salida. Anthropic también describe los tokens de pensamiento como parte de su total de salida autorizado. Google muestra por separado la salida del candidato y los recuentos de pensamiento, y afirma que el precio de la respuesta los combina. Los nombres de los campos difieren, pero los tres tratan el razonamiento como trabajo generado.
Un ejemplo práctico de uso
Considera esta solicitud simplificada:
- Las instrucciones, el mensaje del usuario, el historial y el contexto adjunto suman 1.200 tokens de entrada.
- El modelo genera 620 tokens de razonamiento.
- Después genera una respuesta visible de 180 tokens.
Una API podría informar de lo siguiente:
input_tokens: 1200
output_tokens: 800
output_details.reasoning_tokens: 620Aquí, output_tokens es inclusivo. No vuelvas a sumar los 620. La respuesta de 180 tokens es la parte sin razonamiento de los 800 tokens generados.
Otra API podría informar de lo siguiente:
input_tokens: 1200
output_tokens: 180
thought_tokens: 620
total_tokens: 2000Aquí, la salida de la respuesta y los tokens de pensamiento son campos separados. Debes incluir ambos al evaluar el uso generado. Los dos informes describen el mismo flujo simplificado:
1,200 input + 620 reasoning + 180 visible answer = 2,000 total tokensSi todos los tokens generados utilizan la tarifa de salida del proveedor, el cálculo de coste simplificado es:
(1,200 × input rate) + (800 × output rate)Las facturas reales pueden añadir tarifas separadas para la entrada almacenada en caché, las escrituras en caché, los lotes, las herramientas u otras funciones. Utiliza el esquema de uso y las reglas de precios de la API en lugar de suponer que todos los campos son aditivos.
Cuándo importa cada tipo de token
Los tokens de entrada importan cuando las solicitudes contienen mucho contexto. Los historiales extensos, los documentos, las definiciones de herramientas y las instrucciones repetidas pueden dominar el uso, aunque el último mensaje del usuario sea breve. Los recuentos de entrada también indican cuánto espacio queda en la ventana de contexto.
Los tokens de salida importan cuando las respuestas son largas o se generan repetidamente. La generación ocurre paso a paso, por lo que la salida suele tener características de rendimiento y precios diferentes de las de la entrada. Un flujo de trabajo que clasifica un documento con una sola etiqueta tiene un perfil de uso distinto del de uno que redacta un informe.
Los tokens de razonamiento importan cuando la tarea requiere trabajo interno. Una respuesta final breve puede seguir a un proceso de razonamiento extenso. Esto puede aumentar el coste, retrasar la respuesta visible y consumir capacidad de tokens generados sin hacer que la respuesta mostrada sea más larga.
En los modelos de razonamiento, un límite de salida puede abarcar tanto el razonamiento interno como la respuesta visible. Si el razonamiento consume primero la cuota, el modelo puede devolver una respuesta breve o incompleta. Consulta la documentación del endpoint antes de tratar un límite de salida como una longitud de respuesta garantizada.
Confusiones habituales
Los tokens de razonamiento no son entrada adicional
El modelo crea los tokens de razonamiento durante la generación. Pueden convertirse en entrada en un turno posterior si la aplicación vuelve a enviar el contenido de pensamiento conservado, pero eso constituye una nueva solicitud con un nuevo límite de medición.
Los tokens de razonamiento no siempre están separados de los tokens de salida
Si un objeto de uso indica que el razonamiento es un detalle incluido en la salida, sumar ambos campos produce un doble recuento. Si informa de los pensamientos junto a la salida de la respuesta, ignorar el campo de pensamiento produce un recuento insuficiente. Lee el esquema antes de hacer cálculos.
Los tokens de salida no siempre son palabras visibles
Los tokens no son lo mismo que las palabras, y el uso generado no se limita a la prosa mostrada. Los argumentos de las llamadas a herramientas, el razonamiento oculto y el formato gestionado por el proveedor pueden ampliar la diferencia entre lo que ves y lo que registra el medidor.
Una respuesta breve no es necesariamente una respuesta barata
La longitud visible es solo una parte del uso. Una solicitud puede tener una entrada grande, un razonamiento interno considerable o ambas cosas. El registro de uso de la respuesta es una base de medición mejor que el tamaño de la respuesta representada.
Qué leer a continuación
Lee ¿Qué son los tokens de entrada? para comprender qué colocan las aplicaciones en una solicitud. Lee ¿Qué son los tokens de salida? para conocer las respuestas generadas y los límites. Lee ¿Qué son los tokens de razonamiento? para conocer la capa de pensamiento dependiente del proveedor.