Cómo funcionan los tokens de razonamiento
Una solicitud normal tiene dos partes obvias: los tokens que envías y los tokens de salida que genera el modelo. Un modelo capaz de razonar puede dividir su salida generada en otra etapa funcional:
- Lee la entrada.
- Genera tokens de razonamiento para trabajar en la tarea.
- Genera la respuesta final.
Esta representación en tres pasos es útil, pero no es universal. Algunos modelos pueden razonar entre llamadas a herramientas o entre fragmentos de salida visible, en lugar de completar primero un único borrador privado e ininterrumpido.
La palabra razonamiento describe para qué se usan los tokens generados. No significa que se detenga el resto del procesamiento del modelo ni que los modelos ordinarios no realicen ningún razonamiento. Todos los modelos realizan cálculos numéricos para seleccionar su siguiente token. La característica especial aquí es que un modelo dedica tokens generados al trabajo intermedio antes o entre los tokens destinados al usuario.
El entrenamiento puede fomentar este comportamiento. Por ejemplo, el aprendizaje por refuerzo puede recompensar las respuestas finales correctas y llevar a un modelo a desarrollar patrones generados, como comprobar un resultado, cambiar de estrategia o revisar un paso anterior. Por lo tanto, más tokens de razonamiento significan más trabajo en el momento de la inferencia, no más entrenamiento ni un cambio en el conocimiento almacenado del modelo.
El razonamiento oculto y los resúmenes visibles son diferentes
«Token de razonamiento» es un término general, no un estándar compartido por todos los proveedores.
OpenAI informa de un recuento de tokens de razonamiento, pero no expone el razonamiento sin procesar a través de su API. Google puede devolver un resumen de sus pensamientos y una firma opaca que representa el estado del razonamiento. Las interfaces y los controles de Anthropic varían según el modelo: algunos exponen un resumen del pensamiento y otros usan un nivel de esfuerzo adaptativo en lugar de un presupuesto fijo de tokens.
Esto da lugar a tres elementos distintos:
- Tokens de razonamiento sin procesar: el trabajo intermedio generado.
- Resumen del razonamiento: una explicación más breve producida para el usuario o el desarrollador.
- Respuesta final: la respuesta destinada a completar la solicitud.
Un resumen no es una transcripción de cada token de razonamiento sin procesar. Ocultar el registro sin procesar tampoco significa que los tokens fueran gratuitos o que no existieran. Para saber qué utilizó una solicitud, consulta los metadatos de uso de la API en lugar de contar las palabras que se muestran en pantalla.
Un ejemplo de uso de tokens
Supón que un informe de uso indica:
- Tokens de entrada: 75
- Tokens de salida totales: 1.186
- Tokens de razonamiento dentro de la salida: 1.024
La parte de la salida generada que no corresponde al razonamiento es:
1.186 − 1.024 = 162 tokens
La solicitud no utilizó 1.186 tokens de respuesta más otros 1.024 tokens de razonamiento. Los 1.024 tokens de razonamiento ya están incluidos en el total de salida de 1.186 tokens.
Esta distinción explica cómo una respuesta concisa puede tener un recuento de salida mucho mayor de lo que su texto visible sugiere. Los nombres de los campos varían según la API, pero busca un recuento de razonamiento o pensamiento dentro de los detalles de uso de la respuesta.
Por qué importan los tokens de razonamiento
Costo
Por lo general, los principales proveedores cobran los tokens de razonamiento o pensamiento como salida generada. Por lo tanto, una respuesta final breve puede costar más de lo que estimarías según su longitud visible. Las tarifas y las reglas de contabilización actuales dependen del proveedor, así que consulta la documentación de precios y uso del proveedor para calcular el costo real.
Límites de salida y de contexto
El razonamiento necesita espacio. Por lo general, los proveedores contabilizan los tokens de razonamiento dentro del límite de salida, del presupuesto de contexto o de ambos. Si el límite de generación se agota durante el razonamiento, una solicitud puede terminar antes de producir una respuesta visible útil.
Por eso, una configuración de salida máxima no siempre puede interpretarse como «longitud máxima de la respuesta». Es posible que deba cubrir tanto el razonamiento intermedio como la respuesta final. La regla exacta varía según la API.
Tiempo de respuesta
Los tokens de razonamiento son trabajo generado. En general, cuantos más haya, más generación secuencial se necesita antes de que finalice la solicitud, lo que puede aumentar la latencia. Por lo tanto, las configuraciones de esfuerzo y los presupuestos de tokens controlan un equilibrio entre calidad, tiempo y costo; no son simplemente configuraciones de estilo.
Calidad de la tarea
El razonamiento adicional es más útil cuando la tarea se beneficia del trabajo intermedio: matemáticas de varios pasos, depuración de código, planificación, comprobación de restricciones o flujos de trabajo basados en herramientas. La extracción o el formato simples pueden obtener pocos beneficios.
Más no siempre significa mejor. Un modelo puede dedicar muchos tokens a un camino improductivo y aun así equivocarse. Evalúa el resultado final según la tarea que te importe, en lugar de tratar el recuento de tokens de razonamiento como una puntuación de calidad.
Conceptos erróneos frecuentes
«Los tokens de razonamiento son los pensamientos privados del modelo»
La frase es práctica, pero demasiado literal. Los tokens de razonamiento son secuencias intermedias generadas por el modelo. Pueden parecerse a una resolución de problemas escrita, pero su existencia no demuestra pensamiento, comprensión ni autoconciencia similares a los humanos.
«Si puedo ver el razonamiento, estoy viendo los tokens sin procesar»
No necesariamente. Un producto puede mostrar un resumen o una explicación filtrada. La documentación del proveedor distingue esas visualizaciones del registro interno completo utilizado para la contabilización.
«Una respuesta de 500 tokens utiliza 500 tokens de salida»
Solo si no hay otros tokens generados contabilizados en la salida. Con el razonamiento activado, el total de uso puede incluir tanto el razonamiento oculto como la respuesta.
«El presupuesto me indica exactamente cuántos tokens utilizará el modelo»
Depende del proveedor y del modelo. Una configuración puede ser un máximo estricto, un objetivo o un nivel de esfuerzo. Algunos modelos adaptan la cantidad de razonamiento a la tarea. Considera el recuento de uso devuelto como la medición y la configuración de la solicitud como un control.
Qué leer a continuación
Lee ¿Qué son los tokens de salida? para comprender la categoría contable más amplia que suele contener los tokens de razonamiento. Después, utiliza Tokens de entrada frente a tokens de salida y de razonamiento cuando necesites comparar las tres categorías en una misma solicitud.