Un modelo mental útil
Piensa en un modelo como una transformación ajustable, no como un cerebro digital ni como una base de datos de respuestas.
El modelo tiene una estructura que determina cómo puede fluir la información a través de él. También tiene valores aprendidos que determinan cuánto influyen las distintas partes de la entrada en la salida. En conjunto, la estructura y los valores aprendidos definen la transformación.
Si le das a un modelo meteorológico ciertas mediciones, podría generar una probabilidad de lluvia. Si le das a un clasificador de imágenes unos píxeles, podría generar puntuaciones para varias etiquetas. Si le das texto a un modelo de lenguaje, podría generar probabilidades para los posibles textos siguientes. Las entradas y salidas difieren, pero el papel del modelo es el mismo.
Un modelo no tiene que ser una red neuronal. Los modelos lineales, los árboles de decisión, los modelos probabilísticos y otros métodos también pueden proporcionar el modelo dentro de un sistema de IA. Las redes neuronales son una familia de modelos especialmente flexible.
Cómo se crea y se usa un modelo de IA
En un modelo de aprendizaje automático, el recorrido desde la idea hasta la salida tiene dos fases principales: entrenamiento e inferencia.
Durante el entrenamiento, los desarrolladores eligen una estructura de modelo y un objetivo. El modelo procesa ejemplos, sus salidas se comparan con ese objetivo y un procedimiento de entrenamiento ajusta sus valores aprendibles para reducir el error o mejorar una recompensa. Repetir este proceso produce un modelo entrenado: una estructura concreta con un estado aprendido concreto.
Después, el modelo se evalúa con datos o situaciones que no se usaron para ajustarlo. Esto comprueba si aprendió un patrón útil, en lugar de limitarse a coincidir con sus ejemplos de entrenamiento. Superar una evaluación no demuestra que funcionará para todas las poblaciones, contextos o usos.
Durante la inferencia, el modelo entrenado recibe una entrada nueva y calcula una salida sin repetir todo el proceso de entrenamiento. Un servicio desplegado puede ejecutar inferencias millones de veces mientras los valores aprendidos del modelo permanecen sin cambios. El modelo solo aprende de interacciones posteriores si un proceso separado recopila comentarios y lo actualiza o vuelve a entrenar.
La palabra modelo puede referirse a distintos artefactos a lo largo de este proceso:
- Antes del entrenamiento, puede significar la estructura propuesta.
- Después del entrenamiento, normalmente significa la estructura más los valores aprendidos a partir de los datos.
- En un framework, puede significar un objeto ajustado o un archivo que contiene el estado aprendido.
- En un catálogo de productos, puede significar una familia con nombre, una versión concreta o un endpoint que ejecuta esa versión.
Esos usos se solapan, pero no son idénticos. Cuando la precisión importa, pregunta si una afirmación se refiere al diseño del modelo, a su estado aprendido, a sus archivos o al servicio que lo rodea.
Un ejemplo práctico
Considera un modelo deliberadamente sencillo que marca posibles mensajes de spam. El software circundante convierte cada correo electrónico en dos entradas:
- el número de enlaces
- el número de palabras de una breve lista de términos «urgentes»
Supón que el entrenamiento aprende esta puntuación:
puntuación de spam = 1,4 × número de enlaces + 0,9 × número de palabras urgentes − 1,2
Para un correo con dos enlaces y una palabra urgente:
1,4 × 2 + 0,9 × 1 − 1,2 = 2,5
Para un correo sin enlaces ni palabras urgentes:
1,4 × 0 + 0,9 × 0 − 1,2 = −1,2
Si el producto considera que una puntuación positiva indica spam, marca el primer correo y permite el segundo.
El modelo es la transformación que produce la puntuación: su fórmula y sus valores numéricos aprendidos. El código que lee el correo, cuenta las características, elige el umbral, mueve un mensaje a una carpeta de spam y permite al usuario corregir un error forma parte del sistema más amplio.
Este modelo de juguete es fácil de inspeccionar. Una red neuronal moderna puede contener muchas capas y valores aprendidos, y un modelo generativo puede elegir entre varias salidas posibles en lugar de devolver una única etiqueta fija. La función esencial sigue siendo convertir una entrada adecuada en una salida según el patrón capturado por el modelo.
El modelo no es todo el sistema de IA
La distinción se entiende mejor como una canalización:
raw input
↓
input preparation
↓
AI model: structure + learned state
↓
raw model output
↓
rules, tools, storage, and presentation
↓
system result or actionPor ejemplo, un chatbot puede añadir instrucciones, historial de conversación, documentos recuperados, comprobaciones de seguridad, herramientas y una interfaz alrededor de un modelo de lenguaje. Cambiar cualquiera de esas capas puede modificar la experiencia del usuario aunque el modelo permanezca igual. Un sistema más grande también puede dirigir una solicitud a través de varios modelos.
El límite no siempre se presenta de la misma manera. Un umbral de clasificación puede estar integrado en un modelo, pero aplicarse mediante código circundante en otro sistema. La prueba práctica consiste en identificar el componente que realiza la transformación central aprendida de entrada a salida y, después, identificar qué prepara, restringe, interpreta o utiliza esa salida.
Por qué importa la distinción
Evita atribuir cada éxito o fallo al componente equivocado. Un resultado deficiente podría deberse al modelo, pero también a la falta de contexto, una preparación incorrecta de la entrada, un umbral inadecuado, un fallo de una herramienta o una regla aplicada después de la inferencia.
También facilita evaluar las afirmaciones sobre un modelo. Un modelo solo es útil en relación con una tarea, los tipos de entradas que recibirá, la forma en que se utilizará su salida y el coste de los errores. Por tanto, la documentación del modelo debería indicar los usos previstos, las condiciones de evaluación, las limitaciones conocidas y los usos que no se probaron. Una única cifra de precisión o una demostración del producto no puede responder a todas esas preguntas.
Por último, la distinción aclara qué nivel de acceso tienes. Descargar los pesos aprendidos, llamar a un modelo alojado mediante una API y utilizar una aplicación de IA terminada ofrecen distintos niveles de control. Pueden implicar la misma familia de modelos, pero no son lo mismo.
Ideas equivocadas frecuentes
«El modelo contiene sus datos de entrenamiento»
Un modelo entrenado normalmente contiene un estado numérico aprendido, no una copia de los ejemplos que se pueda buscar fila por fila. Ese estado captura patrones útiles para producir salidas. Aun así, los modelos pueden reproducir o revelar partes de los datos de entrenamiento en determinadas circunstancias, así que «no es una base de datos» no significa «no puede memorizar».
«El modelo aprende cada vez que lo uso»
La inferencia normalmente utiliza valores aprendidos fijos. Un producto puede guardar conversaciones, personalizar solicitudes posteriores o utilizar comentarios para entrenamientos futuros, pero esos son comportamientos separados del sistema. No demuestran que el modelo desplegado se haya actualizado durante la conversación.
«Un modelo de IA es lo mismo que un algoritmo»
Un algoritmo es un procedimiento. Un algoritmo de entrenamiento ajusta un modelo, mientras que un algoritmo de inferencia lo ejecuta. En el habla cotidiana, los términos se solapan, pero distinguir el procedimiento del resultado aprendido explica cómo el mismo método de entrenamiento puede producir modelos distintos a partir de datos diferentes.
«Todos los modelos de IA son modelos de lenguaje»
Un modelo de lenguaje grande (LLM) es un tipo de modelo de IA. Otros modelos clasifican imágenes, pronostican cantidades, ordenan resultados de búsqueda, detectan anomalías, recomiendan elementos, controlan máquinas o realizan otras tareas de entrada a salida.
«Un modelo mejor garantiza un producto mejor»
Un modelo más potente puede mejorar la capacidad básica del sistema, pero la calidad del producto también depende de los datos, las instrucciones, las herramientas, las salvaguardas, la latencia, el diseño de la interfaz y de si el modelo se ajusta a la tarea real. El modelo es central, pero no actúa por sí solo.
Cómo encajan los modelos de IA en el sistema más amplio
Un proyecto de IA comienza con una tarea y alguna forma de juzgar el comportamiento útil. El entrenamiento produce o adapta un modelo. La evaluación comprueba su comportamiento en condiciones determinadas. El despliegue proporciona la capacidad de cómputo y el software circundante necesarios para ejecutarlo. Después, la supervisión busca fallos, cambios en las entradas y motivos para actualizar el modelo o el sistema.
Este ciclo de vida explica por qué «¿Qué modelo utiliza esto?» es solo el inicio de una pregunta útil. También puede ser necesario saber qué versión se está ejecutando, qué entradas recibe, cómo se procesa su salida, para qué se evaluó y dónde una persona u otro programa toma la decisión final.
Qué leer a continuación
Lee ¿Qué es el entrenamiento en IA? para conocer el proceso que crea el estado aprendido de un modelo; después, lee ¿Qué es la inferencia en IA? para saber qué ocurre cuando un modelo entrenado procesa una entrada nueva. ¿Qué es un LLM? aborda la familia de modelos que sustenta muchos productos de texto y chat.