Ventana de contexto frente a longitud de contexto

Los términos ventana de contexto y longitud de contexto suelen usarse como sinónimos. Cuando una fuente los distingue, la ventana es la capacidad máxima y la longitud es la cantidad que se está usando en ese momento.

Conviene separar tres cifras:

  1. Ventana de contexto máxima: la capacidad anunciada para un modelo o endpoint.
  2. Longitud de contexto actual: los tokens que ocupan una solicitud y una respuesta concretas.
  3. Contexto utilizable de forma fiable: la cantidad que el modelo puede usar correctamente para tu tarea.

La tercera cifra no es una especificación fija. Depende del modelo, la tarea, la ubicación de los detalles relevantes y la cantidad de material irrelevante que compite por la atención.

Cómo funciona una ventana de contexto

Una aplicación reúne el material de una solicitud. Esto puede incluir:

  • instrucciones del sistema y del desarrollador
  • mensajes anteriores del usuario y del asistente
  • el mensaje actual
  • pasajes recuperados o documentos adjuntos
  • descripciones y resultados de herramientas
  • formato y tokens especiales de control

Un tokenizador convierte ese material en los tokens que procesa el modelo. El modelo de lenguaje grande genera entonces su respuesta un token a la vez. Cada token generado pasa a formar parte de la secuencia disponible cuando se produce el token siguiente, por lo que la salida también necesita espacio.

En un turno posterior del chat, la aplicación normalmente vuelve a enviar parte del material anterior seleccionado. Puede conservar todo el historial, descartar los turnos antiguos, recuperar solo los pasajes relevantes o reemplazar el material anterior por un resumen. Una función de memoria independiente puede almacenar información entre solicitudes, pero ese almacenamiento no es la ventana de contexto en sí. La información debe incorporarse al contexto actual antes de que el modelo pueda usarla.

El comportamiento en los límites varía. Una API puede rechazar una solicitud demasiado grande. Un producto de chat puede eliminar el material más antiguo o resumirlo. Una generación puede detenerse al alcanzar un límite. Consulta la documentación del modelo y el endpoint exactos.

Un ejemplo práctico

Supongamos que un modelo tiene una ventana de contexto compartida hipotética de 12.000 tokens:

  • instrucciones ocultas: 700 tokens
  • definiciones de herramientas: 800 tokens
  • chat y documentos conservados: 6.500 tokens
  • solicitud actual: 1.000 tokens

El total de entrada es de 9.000 tokens. Como máximo, quedan 3.000 para la respuesta.

Ahora supongamos que el endpoint tiene un límite de salida independiente de 2.000 tokens. Aunque queden 3.000 tokens en la ventana compartida, la respuesta no puede usar más de 2.000. El límite práctico es la primera restricción aplicable que se alcance.

Si la aplicación comprime el historial de 6.500 tokens en un resumen de 1.500 tokens, la entrada se reduce a 4.000 tokens. Esto crea más espacio, pero no amplía la ventana de contexto. Es una representación diferente y más pequeña del material anterior, y los detalles omitidos del resumen ya no están en la solicitud.

Por qué importan las ventanas de contexto

La ventana limita cuánto material de origen puede considerar un modelo a la vez. Afecta a si puedes enviar un contrato largo en una sola solicitud, mantener la coherencia de una conversación extensa o proporcionar a un asistente de programación una parte suficiente de un repositorio para resolver un problema.

También afecta a la planificación de la salida. Si llenas casi toda la capacidad disponible con la entrada, puede quedar demasiado poco espacio para la respuesta. Las aplicaciones suelen reservar un presupuesto de salida antes de decidir cuánto historial o texto recuperado incluir.

Un mayor contexto también tiene costes. Las entradas más largas normalmente requieren más tiempo y cómputo para procesarse, y muchas API cobran por token. El contexto irrelevante puede dificultar la identificación de las pruebas útiles. La mejor solicitud no es necesariamente la más completa: contiene suficiente material relevante y deja espacio para la respuesta requerida.

Una ventana más grande no equivale a una mejor memoria

Una ventana de contexto mide capacidad, no memoria duradera, conocimiento ni inteligencia. Un modelo puede aceptar un pasaje sin usar todas sus partes con la misma eficacia.

Estudios controlados sobre contexto largo han descubierto que los modelos pueden rendir mejor cuando la información relevante está cerca del principio o del final que cuando la misma información está enterrada en el centro. Los resultados varían según el modelo y la tarea, pero la lección práctica es estable: un máximo anunciado indica qué puede caber, no qué recordará el modelo ni sobre qué podrá razonar a la perfección.

El almacenamiento en caché de prompts no cambia esa distinción. Puede reducir el trabajo o el precio de reutilizar un prefijo, pero el material almacenado en caché puede seguir contando para la capacidad de contexto del modelo.

Una ventana de contexto también es diferente de un corte de conocimiento. La ventana de contexto limita lo que está disponible durante esta respuesta. Un corte de conocimiento describe el límite temporal de la información aprendida durante el entrenamiento.

Qué leer a continuación

Consulta ¿Qué es un token en IA? para entender cómo se contabiliza el texto dentro del límite. Consulta ¿Qué es un LLM? para situar la ventana de contexto dentro del proceso del modelo de generar un token a la vez. Para conocer el límite que más se confunde con la capacidad de contexto, lee Ventana de contexto frente a corte de conocimiento.