Un modelo mental útil

Piensa en la IA generativa como un mapa aprendido de lo que podría venir a continuación de manera verosímil.

En el caso del texto, el mapa describe qué continuaciones encajan con la entrada y con el texto producido hasta ese momento. En el caso de una imagen, puede describir qué cambios visuales convertirían el ruido en una imagen que corresponda a un pie de imagen. El mapa se almacena en los parámetros aprendidos de un modelo de IA, no como un catálogo de respuestas terminadas.

Un prompt reduce las posibilidades. «Escribe una oración» deja un conjunto enorme de resultados válidos. «Escribe una etiqueta de advertencia de seis palabras para un suelo mojado» hace que una región mucho más pequeña de ese conjunto sea apropiada.

Luego, el modelo muestrea entre las posibilidades que ha aprendido. Muestrear significa elegir un posible paso siguiente, a menudo con cierto grado de aleatoriedad controlada. La elección pasa a formar parte de la entrada del paso siguiente. Repetir este proceso produce el resultado final.

Ese es el puente clave entre aprender patrones y crear contenido:

Training examples -> learning objective -> learned pattern model
                                              |
Prompt + initial state -> repeated sampling --+-> generated output

El diagrama es deliberadamente general. El «estado inicial» puede ser una secuencia de texto inicial, una región de ruido, una imagen existente que se va a editar u otra forma de datos. El «muestreo repetido» puede significar añadir la siguiente unidad de texto o eliminar un poco de ruido en cada paso.

Cómo funciona la IA generativa

La mayoría de los sistemas generativos tienen dos fases distintas.

1. Aprender una distribución

Durante el entrenamiento, el modelo observa muchos ejemplos del tipo de datos que debe representar. Un objetivo de aprendizaje mide qué tan bien el modelo realiza una tarea que pone de manifiesto la estructura de esos datos. Los parámetros del modelo se ajustan para mejorar su puntuación.

La tarea exacta depende de la familia del modelo:

  • Un modelo autorregresivo predice la siguiente unidad de una secuencia a partir de las unidades anteriores.
  • Un modelo de difusión aprende a invertir un proceso que añade ruido gradualmente.
  • Un autocodificador variacional aprende un espacio estructurado de datos posibles y una forma de decodificar muestras de ese espacio.
  • Una red generativa antagónica, o GAN, entrena un generador para producir muestras que un segundo modelo, el discriminador, no pueda distinguir de manera fiable de los ejemplos de entrenamiento.

Estos métodos difieren entre sí, pero cada uno proporciona al sistema una forma de producir muestras que se parecen a los patrones de sus datos de entrenamiento. En el sentido formal del aprendizaje automático, eso es lo que hace que el modelo sea generativo.

2. Muestrear un resultado

Cuando utilizas el modelo entrenado, tu entrada condiciona el proceso de generación. «Condicionar» simplemente significa que la entrada cambia qué resultados considera verosímiles el modelo.

La generación suele comenzar con un estado inicial. Un modelo de texto tiene el prompt y el texto producido hasta ese momento. Un modelo de difusión de imágenes suele comenzar con ruido. El modelo predice el siguiente paso, lo elige o lo calcula, actualiza el estado y repite el proceso hasta alcanzar un punto de detención.

Este proceso repetido es importante. No se garantiza que un generador elija la única respuesta completa más probable y, normalmente, tampoco recupera un elemento terminado del almacenamiento. Las pequeñas elecciones se acumulan. Diferentes elecciones pueden producir distintos resultados válidos a partir del mismo prompt.

Un ejemplo de texto paso a paso

Supón que un generador de texto recibe:

El sendero se cerró porque el río había

En el siguiente paso, imagina que el modelo asigna estas probabilidades:

  • subido — 54 %
  • desbordado — 21 %
  • rebosado — 12 %
  • todas las demás continuaciones — 13 %

Estas cifras son ilustrativas. No describen un modelo específico.

Si el modelo selecciona «subido», el texto en proceso queda así:

El sendero se cerró porque el río había subido

Ahora el modelo calcula un nuevo conjunto de posibilidades basándose en el prompt más «subido». A continuación, podría dar preferencia a «durante la noche», «por encima» o a un signo de puntuación. Esto continúa hasta que la respuesta está completa.

Dos detalles explican gran parte del comportamiento de la IA generativa.

Primero, la generación es condicional. Cambiar «sendero» por «aeropuerto» cambia la continuación probable. Segundo, verosímil no significa factual. El modelo puede construir una oración fluida sobre un cierre aunque no exista ningún sendero ni río. Su proceso de generación, por sí solo, no comprueba la afirmación con respecto al mundo.

El término tiene un significado amplio y otro restringido

En aprendizaje automático, un modelo generativo es cualquier modelo que representa suficientemente bien cómo se distribuyen los datos como para estimar o producir ejemplos posibles. Esta categoría suele contrastarse con la de un modelo discriminativo, que se centra en predecir una etiqueta o separar categorías. Un modelo que aprende cómo son los dígitos escritos a mano es generativo; un modelo que solo decide si una imagen muestra un cero o un uno puede ser discriminativo.

En el lenguaje cotidiano de los productos, «IA generativa» suele tener un significado más restringido: sistemas dirigidos por prompts que crean contenido digital complejo. Estos sistemas suelen utilizar modelos grandes y de propósito general, pero el tamaño y la generalidad no son requisitos de la definición técnica amplia. Como señala el NIST, no toda la IA generativa proviene de modelos fundacionales.

Por eso las definiciones pueden parecer incoherentes. Algunas describen una clase de modelos estadísticos. Otras describen la generación actual de productos construidos con esa clase.

Por qué es importante la IA generativa

Un sistema de predicción tradicional suele devolver una etiqueta de un conjunto fijo o un número. Un sistema generativo puede construir un resultado cuyo contenido exacto no se especificó de antemano.

Eso hace que un mismo modelo sea útil para muchas tareas que pueden expresarse como generación. Un modelo de texto puede redactar, resumir, traducir, reformatear o escribir código porque cada tarea puede formularse como la producción de una secuencia adecuada. Un modelo de imágenes puede crear, ampliar o editar una imagen porque cada tarea puede formularse como la generación de datos visuales bajo distintas condiciones.

La misma flexibilidad crea el principal problema de fiabilidad. Hay muchos resultados que parecen verosímiles. Solo algunos satisfacen las necesidades no expresadas del usuario, coinciden con hechos externos, evitan material dañino o respetan las restricciones legales y sociales. La capacidad del modelo para generar una forma convincente no garantiza el contenido que hay dentro de esa forma.

Conceptos erróneos frecuentes

«Busca en una base de datos y pega una respuesta»

Normalmente, un modelo generativo crea un resultado aplicando repetidamente parámetros aprendidos, no seleccionando una respuesta almacenada. Eso no significa que la memorización sea imposible. Los modelos pueden reproducir partes de sus datos de entrenamiento, especialmente material que se repitió o que era distintivo. «No es una consulta a una base de datos» y «nunca reproduce material de entrenamiento» son afirmaciones diferentes.

«El contenido generado es verdadero»

La generación favorece la correspondencia con los patrones aprendidos y las condiciones de entrada. La verdad requiere otro estándar: evidencia, cálculo, observación o una fuente fiable. Una respuesta fluida aún puede contener nombres, citas, acontecimientos o explicaciones causales inventados.

«El contenido generado debe ser original»

El resultado puede ser nuevo en el sentido limitado de que el sistema lo ensambló durante esta ejecución, en lugar de recuperar un registro completo almacenado. Eso no determina si es creativamente original, susceptible de protección legal, derivado de una obra existente o afectado por la memorización. Estas cuestiones dependen del resultado, del proceso de entrenamiento y de las normas aplicables.

«La IA generativa significa chatbots»

Un chatbot es una interfaz y un patrón de aplicación. La IA generativa es la categoría subyacente de modelos y sistemas que producen contenido. También incluye generadores especializados de imágenes, audio, video, código y datos.

«Todos los sistemas de IA generativa son el mismo tipo de modelo»

Los métodos autorregresivos, de difusión, variacionales, adversariales y otros métodos generativos utilizan objetivos de aprendizaje y procesos de muestreo diferentes. Comparten un propósito, no una arquitectura universal.

Cómo encaja en un sistema más amplio

El modelo es solo una parte de un producto de IA generativa. Una aplicación completa puede añadir instrucciones, controles de usuario, información externa, comprobaciones de seguridad, filtros de contenido, herramientas y validación de resultados a su alrededor.

Esas partes que lo rodean pueden cambiar el comportamiento sin modificar la definición básica. Una conexión con un buscador puede proporcionar evidencia actual a un generador de texto. Un filtro puede bloquear determinadas imágenes. Una herramienta de código puede ejecutar pruebas sobre el código generado. El generador sigue proporcionando contenido candidato; el resto del sistema aporta contexto, capacidades y comprobaciones.

Qué leer a continuación

Empieza por ¿Qué es un modelo de IA? si quieres entender qué contiene el propio modelo aprendido. Después, lee ¿Qué es un modelo fundacional? para conocer los modelos amplios y reutilizables que están detrás de muchos productos generativos actuales, o ¿Qué es la IA multimodal? para conocer los sistemas que trabajan con texto, imágenes, audio y video.