El modelo mental útil
La palabra «fundacional» describe la posición del modelo dentro de una cadena.
broad training data
↓
pretraining
↓
foundation model
↙ ↓ ↘
prompt task fine-tuned
layer derivative
↘ ↓ ↙
downstream models and applicationsLa base contiene patrones aprendidos durante un preentrenamiento amplio. Un paso posterior orienta esos patrones hacia una tarea concreta. Una adaptación podría clasificar tickets de soporte. Otra podría responder preguntas. Otra podría relacionar imágenes con descripciones escritas.
Esta es la distinción clave: un modelo puede tener capacidades amplias sin estar listo para un producto concreto. La «base» es valiosa porque distintos desarrolladores pueden reutilizarla en lugar de empezar desde cero para cada tarea.
Cómo funciona un modelo fundacional
Primero, los desarrolladores reúnen datos de entrenamiento amplios. «Amplios» es relativo al dominio previsto. Un modelo de lenguaje puede aprender de muchos tipos de texto, mientras que un modelo fundacional de imágenes médicas puede aprender de exploraciones variadas y distintos entornos clínicos. Amplio no tiene por qué significar todos los tipos de datos existentes.
Después, el modelo pasa por el preentrenamiento. Muchos modelos fundacionales utilizan aprendizaje autosupervisado: los propios datos proporcionan la señal de aprendizaje. Un modelo de texto puede aprender prediciendo fragmentos ocultos o siguientes de texto. Un modelo de imagen y texto puede aprender qué pies de imagen corresponden a qué imágenes. El objetivo exacto varía, pero la meta es aprender patrones que sigan siendo útiles más allá de una tarea limitada.
El preentrenamiento produce un punto de control: un conjunto guardado de los valores aprendidos por el modelo. Después, ese punto de control puede adaptarse de varias maneras:
- La ingeniería de prompts proporciona instrucciones o ejemplos en la entrada. Cambia el comportamiento inmediato, no los valores aprendidos por el modelo.
- Añadir una capa específica para la tarea incorpora un componente pequeño que convierte la salida interna del modelo en un resultado concreto, como un conjunto de categorías.
- El ajuste fino continúa el entrenamiento con un conjunto de datos más limitado. Cambia algunos o todos los valores aprendidos para mejorar el rendimiento en una tarea o dominio.
- La integración del sistema conecta el modelo con búsquedas, bases de datos, herramientas, reglas y una interfaz. Esto cambia lo que la aplicación puede hacer, aunque el modelo subyacente permanezca congelado.
Estos métodos pueden combinarse. Ninguno garantiza que el resultado adaptado sea preciso, seguro o adecuado para el uso previsto. Cada uso posterior necesita su propia evaluación.
Un ejemplo concreto
Imagina que una empresa parte de un modelo de lenguaje preentrenado ampliamente y quiere gestionar tickets de atención al cliente.
Para crear un prototipo rápido, el equipo proporciona al modelo un prompt que contiene las etiquetas de enrutamiento permitidas y algunos ejemplos. Los valores aprendidos por el modelo no cambian.
Para conseguir un enrutamiento más coherente, el equipo añade una capa de clasificación y ajusta el modelo con tickets anteriores. Esto crea un derivado específico para la tarea a partir del modelo original.
Para crear un asistente de soporte dirigido a clientes, el equipo conecta el modelo con artículos de ayuda aprobados, herramientas de cuentas, comprobaciones de permisos y una interfaz. El resultado es un sistema de IA construido alrededor del modelo, no simplemente el modelo fundacional en sí.
El mismo punto de control inicial permitió obtener tres resultados: comportamiento guiado por prompts, un modelo adaptado y una aplicación completa. Esa reutilización es lo que lo convierte en un modelo fundacional.
El patrón no es hipotético. El trabajo original sobre BERT adaptó un modelo de lenguaje preentrenado a 11 tareas lingüísticas, a menudo con solo una capa de salida añadida. Trabajos posteriores mostraron distintas formas de reutilización: GPT-3 realizaba tareas a partir de instrucciones y ejemplos de texto sin ajuste fino, mientras que CLIP utilizaba etiquetas en lenguaje natural para clasificar imágenes que no había sido entrenado específicamente para clasificar.
Por qué importan los modelos fundacionales
Los modelos fundacionales concentran gran parte del aprendizaje amplio y costoso en una etapa compartida de preentrenamiento. Después, los equipos que desarrollan aplicaciones pueden dedicar sus esfuerzos a los datos de la tarea, la evaluación, el diseño del producto y las medidas de protección.
Esa base compartida crea un efecto multiplicador. Una mejora en el modelo fundacional puede beneficiar muchos usos. También crea un riesgo de concentración. Si la base contiene un sesgo, una vulnerabilidad de seguridad o un fallo sistemático, muchos modelos adaptados y productos pueden heredarlo. Los investigadores llaman a esto homogeneización: muchos sistemas pasan a depender del mismo conjunto reducido de métodos o modelos subyacentes.
La adaptación puede reducir un problema en un caso de uso, pero no elimina automáticamente las limitaciones de la base. Una aplicación pulida puede ocultar el origen común sin eliminarlo.
Errores comunes
«Modelo fundacional» significa «modelo de lenguaje grande»
Un LLM se define por su enfoque en el lenguaje y por su escala. Un modelo fundacional se define por un preentrenamiento amplio y la reutilización posterior. Muchos LLM son modelos fundacionales, pero la categoría también incluye modelos para imágenes, audio, robótica, biología y combinaciones de tipos de datos.
Todo modelo fundacional genera contenido
La generación no es un requisito de la definición original. Un modelo fundacional puede producir características reutilizables, ordenar o clasificar entradas, o conectar texto e imágenes. Las páginas de los proveedores suelen utilizar «modelo fundacional» como abreviatura de modelos generativos porque esos son los modelos que venden sus productos, pero ese es un uso más limitado.
Un tamaño grande es suficiente
No existe un número universal de parámetros que separe los modelos fundacionales de otros modelos. Un modelo muy grande entrenado para una sola tarea fija no es automáticamente un modelo fundacional. La prueba más sólida es si aprendió a partir de datos amplios y puede servir como base significativa para diversas tareas posteriores.
Los documentos normativos pueden establecer umbrales numéricos para un subconjunto regulado, como un «modelo fundacional de doble uso». Esos umbrales definen el alcance de ese término normativo, no el de toda la categoría técnica.
La ingeniería de prompts entrena el modelo
Un prompt normal proporciona una entrada temporal para una interacción. El ajuste fino actualiza los valores aprendidos mediante entrenamiento adicional. Ambos pueden adaptar el comportamiento a una tarea, pero solo el segundo cambia el modelo en sí.
«Fundacional» significa fiable
El término no certifica la calidad. Sus autores originales lo eligieron, en parte, para recalcar que los sistemas posteriores dependen de lo que hay debajo. Una base débil puede propagar fallos con la misma eficacia con la que una base sólida propaga capacidades útiles.
«Modelo fundacional» indica cómo se licencia
No lo indica. Un modelo fundacional puede tener pesos descargables, pesos restringidos o acceso exclusivo mediante API. «Abierto», «con pesos abiertos» y «cerrado» describen el acceso y la licencia, no si el modelo cumple una función fundacional.
Cómo encaja en el sistema más amplio
Un modelo fundacional se sitúa entre el preentrenamiento amplio y el uso específico.
Antes de él están los datos, el objetivo de aprendizaje, la arquitectura, el cómputo y la evaluación utilizados para crear el punto de control. Después de él están los prompts, los derivados ajustados, los componentes específicos para la tarea, las fuentes de recuperación, los controles de seguridad, las herramientas y las interfaces de usuario.
Mantener separadas esas capas ayuda a evaluar las afirmaciones. Si un asistente recupera un dato actual, este puede proceder de un sistema de búsqueda conectado y no del preentrenamiento del modelo. Si un chatbot rechaza una solicitud, ese comportamiento puede proceder del entrenamiento del modelo, de una instrucción del sistema, de un filtro externo o de varias capas a la vez. El producto visible no revela qué capa realizó el trabajo.
Qué leer a continuación
Cuando encuentres la etiqueta «modelo fundacional», comprueba dos cosas: si el modelo se entrenó con la amplitud suficiente para admitir más de una tarea limitada y cómo se está adaptando en el producto que estás examinando. Una ficha del modelo o un informe técnico debería ayudarte a identificar el alcance del preentrenamiento, los usos posteriores previstos, los métodos de adaptación y las limitaciones conocidas.
Si faltan esos detalles, la etiqueta por sí sola dice muy poco sobre la capacidad, la fiabilidad, el acceso o la seguridad.
Lee ¿Qué es un modelo de IA? para conocer el concepto más amplio de modelo; ¿Qué es el entrenamiento en IA? para saber cómo se crean los parámetros aprendidos; y ¿Qué es la IA generativa? para conocer una de las principales familias de aplicaciones de los modelos fundacionales.