No existe un tamaño oficial a partir del cual un modelo de lenguaje se convierta en «grande». La etiqueta es relativa. Por lo general, indica una combinación de muchos parámetros aprendidos, datos de entrenamiento amplios, requisitos informáticos considerables y la capacidad de realizar más de una tarea lingüística limitada.
Un modelo mental útil
Piensa en un LLM generativo como una función que acepta una secuencia y devuelve puntuaciones para posibles continuaciones.
La secuencia está compuesta por tokens: las unidades de texto que procesa el modelo, que pueden ser palabras completas, partes de palabras, signos de puntuación u otros símbolos. El modelo no redacta un párrafo oculto para luego revelarlo. Puntúa lo que podría venir a continuación, selecciona un token, añade ese token a la secuencia y vuelve a ejecutar el proceso.
Ese ciclo es la clave:
flowchart LR
A[Prompt and prior output] --> B[LLM scores possible next tokens]
B --> C[One token is selected]
C --> D[Selected token is appended]
D --> BPor tanto, la propia salida del modelo se convierte en parte de su siguiente entrada. Una elección temprana puede cambiar todas las elecciones posteriores.
Este modelo mental es más preciso que llamar a un LLM una base de datos. El entrenamiento puede hacer que un modelo reproduzca material que ha visto, pero la generación normal no funciona buscando en una colección de frases almacenadas y pegando la coincidencia más cercana. El modelo aplica relaciones numéricas aprendidas a la secuencia actual.
Cómo funciona un LLM
Un LLM tiene dos fases distintas: entrenamiento y uso.
Durante el preentrenamiento
El texto se divide en tokens. Al modelo se le presentan problemas de predicción creados a partir de ese texto. Un modelo de lenguaje causal predice el siguiente token a partir de los tokens anteriores. Otros modelos de lenguaje aprenden reconstruyendo tokens ocultos o transformando una secuencia en otra.
Cada predicción produce una señal de error. El entrenamiento ajusta repetidamente los pesos numéricos del modelo para que las mejores predicciones sean más probables. A través de muchos ejemplos, esos pesos capturan patrones reutilizables relacionados con la ortografía, la gramática, el estilo, los hechos, el código y las relaciones entre ideas.
La arquitectura transformer ayuda al modelo a combinar las partes relevantes de la secuencia disponible al calcular cada representación. Es la arquitectura dominante detrás de los LLM, pero no forma parte de una definición atemporal: también se pueden utilizar otras arquitecturas para crear modelos de lenguaje grandes.
El preentrenamiento crea un modelo base, no necesariamente un asistente útil. Un entrenamiento adicional puede hacer que el modelo sea mejor siguiendo instrucciones, prefiriendo determinados tipos de respuestas o rechazando ciertas solicitudes. Esos pasos cambian su comportamiento, pero no lo convierten en una base de datos ni garantizan que su salida sea verdadera.
Durante la generación
En el momento de la inferencia, los pesos entrenados permanecen fijos. El prompt y cualquier otro contexto proporcionado se convierten en tokens. El modelo calcula una puntuación para cada posible token siguiente. Después, el software selecciona un token mediante una regla de decodificación.
Elegir siempre el token con la puntuación más alta es una opción. Otra es muestrear entre varios tokens plausibles. El muestreo puede producir respuestas diferentes al mismo prompt, incluso cuando los pesos del modelo no cambian.
Después de seleccionar un token, este se añade a la secuencia. El modelo calcula una nueva distribución condicionada por el prompt y todo lo generado hasta ese momento. La generación termina cuando el modelo selecciona un token de parada, alcanza un límite de salida o el software que lo rodea la detiene.
Un ejemplo de generación paso a paso
Supongamos que el texto actual es:
La capital de Francia es
Para ilustrarlo, imagina que un modelo asigna estas probabilidades a cuatro posibles tokens siguientes:
| Possible next token | Illustrative probability |
|---|---|
| Paris | 91% |
| Lyon | 3% |
| located | 2% |
| a | 1% |
Las posibilidades omitidas comparten la probabilidad restante. Estas cifras son inventadas para mostrar el mecanismo; no son mediciones de un modelo concreto.
Si el sistema selecciona París, la secuencia se convierte en:
La capital de Francia es París
Ahora el modelo evalúa esa secuencia más larga. Entre los tokens siguientes plausibles puede haber signos de puntuación o palabras que continúen la afirmación. Una vez seleccionado uno, el ciclo se repite.
De este ejemplo se desprenden tres hechos útiles.
Primero, el modelo no necesita un programa independiente de «responder preguntas». Una pregunta, una solicitud de traducción, un ejemplo de código y una instrucción de resumen pueden representarse como texto cuya continuación implica la tarea.
Segundo, una continuación de alta probabilidad no equivale a un hecho verificado. El objetivo de entrenamiento recompensa el ajuste predictivo a los datos, no una comprobación directa contra la realidad. Una afirmación falsa puede ser una continuación fluida.
Tercero, la salida depende del camino seguido. Si se selecciona un token poco probable o erróneo, los tokens posteriores se generan en el contexto de esa elección. El modelo puede continuar de forma coherente a partir de una premisa incorrecta en lugar de volver atrás para corregirla.
Por qué los LLM pueden realizar muchas tareas
Un preentrenamiento amplio y variado expone al modelo a muchas estructuras recurrentes. Entre ellas se incluyen preguntas seguidas de respuestas, código seguido de comentarios, afirmaciones seguidas de evidencias e instrucciones seguidas de trabajos terminados. Aprender a predecir esas estructuras produce representaciones que pueden reutilizarse.
Un prompt también puede especificar una tarea en el momento de utilizar el modelo. Puedes describir el resultado deseado o proporcionar ejemplos, y el modelo condiciona su continuación a ellos. Esto suele llamarse aprendizaje en contexto porque la información sobre la tarea se proporciona en la entrada, en lugar de instalarse mediante una nueva ronda de actualización de los pesos.
Por tanto, «predecir el siguiente token» puede parecer más sencillo que el comportamiento que produce. El objetivo es sencillo. La función aprendida que lo realiza no lo es. El autocompletado ordinario y un LLM resuelven problemas de predicción relacionados, pero difieren considerablemente en capacidad del modelo, uso del contexto, amplitud del entrenamiento y variedad de patrones que pueden aplicar.
Por qué son importantes los LLM
Un solo modelo preentrenado puede servir para redactar, extraer, clasificar, traducir, resumir, responder preguntas y generar código mediante cambios en la entrada. Esto convierte el lenguaje en una interfaz flexible para el software.
La misma flexibilidad crea riesgos. La salida de un LLM se genera, no se consulta en una fuente autorizada. Los resultados pueden ser erróneos, sesgados, incoherentes o sensibles a la formulación del prompt. La pregunta adecuada no es simplemente si un LLM «conoce» un tema. La fiabilidad depende de la tarea, del entrenamiento y del contexto proporcionado, del método de decodificación y de las comprobaciones realizadas por el sistema que lo rodea.
Un LLM también es solo una capa de un producto de IA. No tiene automáticamente una cuenta de usuario, memoria persistente, acceso web, documentos privados ni permiso para realizar acciones. Esas capacidades provienen del software que rodea al modelo.
Ideas equivocadas frecuentes
«Un LLM es un chatbot»
Un LLM es el modelo que procesa o genera lenguaje. Un chatbot de IA es un producto que puede combinar un LLM con una interfaz conversacional, instrucciones, recuperación de información, moderación, memoria y otro software. El mismo LLM puede utilizarse sin una interfaz de chat.
«El modelo busca su respuesta»
Normalmente, el modelo calcula una continuación a partir de sus pesos y del contexto actual. Un producto puede buscar por separado en la web o recuperar documentos e introducir los resultados en el prompt, pero eso es una capacidad del sistema envolvente de IA, no una prueba de que el propio LLM haya realizado una consulta.
«El lenguaje fluido demuestra que el modelo comprende»
Los investigadores no coinciden en una única prueba de comprensión. Un LLM puede demostrar una competencia lingüística útil y formar representaciones internas que permiten realizar tareas complejas. Eso, por sí solo, no demuestra un significado, una experiencia, una intención o una conexión con el mundo similares a los humanos. Es más claro describir el comportamiento que se está midiendo que utilizar «comprende» como explicación universal.
«Solo es autocompletado, así que no puede hacer nada nuevo»
Un LLM es un predictor autorregresivo, pero «solo» oculta la parte importante: lo que el modelo aprendió y cuánto contexto puede utilizar como condición. Puede combinar patrones de formas que no estaban presentes como pasaje completo en sus datos de entrenamiento. Una salida novedosa tampoco demuestra que todas sus afirmaciones sean correctas.
«Grande tiene un límite preciso»
No existe una definición normativa que establezca un número mínimo de parámetros, tokens de entrenamiento o unidades de cómputo. La frontera entre un modelo de lenguaje pequeño y un LLM cambia con el uso y la tecnología. Una afirmación sobre el tamaño solo tiene sentido cuando especifica la cantidad que se está comparando.
Cómo encaja un LLM en un sistema más grande
Una arquitectura básica tiene este aspecto:
- El LLM transforma el contexto en posibles continuaciones lingüísticas.
- Un sistema envolvente prepara el contexto, llama al modelo y puede conectarlo con datos o herramientas.
- Un chatbot presenta ese sistema como una conversación.
- Un agente de IA añade un ciclo que puede elegir acciones, inspeccionar resultados y continuar hacia un objetivo.
Mantener separadas esas capas facilita evaluar las afirmaciones sobre el producto. «El asistente buscó en la web» describe el sistema completo. «El LLM generó la consulta de búsqueda e interpretó el texto devuelto» describe con mayor precisión el papel del modelo.
Qué leer a continuación
Lee ¿Qué es un token en IA? para comprender las unidades que procesa un LLM. Después, consulta ¿Qué es una ventana de contexto? para conocer el límite de información disponible durante una generación, ¿Qué es el entrenamiento en IA? para saber cómo se aprenden los pesos del modelo, y ¿Qué es la inferencia en IA? para entender qué sucede cuando se utiliza un modelo entrenado.