El término modalidad significa una forma distinta de representar o experimentar la información. Un párrafo, una fotografía, una grabación de voz y una lectura de un sensor de profundidad son modalidades diferentes. Tienen estructuras distintas, pero pueden describir el mismo evento.
Una tarea, varios tipos de evidencia
Supón que subes una foto de la cuenta de un restaurante y escribes:
Ana tomó la sopa, Bo tomó la pasta y compartieron la ensalada. Divide el impuesto proporcionalmente según el total de comida de cada uno.
Los precios aparecen en la imagen. Las reglas sobre quién consumió qué y qué compartieron aparecen en el texto. Ninguna de las dos entradas basta por sí sola. Para responder, el modelo debe conectar palabras como «sopa» y «ensalada» con las regiones correctas de la cuenta, incorporar sus precios al cálculo y seguir la regla escrita.
Esa conexión es la idea central. La IA multimodal no consiste simplemente en colocar varias entradas una junto a otra. La información de una modalidad debe cambiar la forma en que se interpreta o utiliza la información de otra.
Esto es más preciso que decir que la IA multimodal «funciona como los sentidos humanos». Las personas combinan la vista, el sonido y el lenguaje, pero un modelo de IA recibe datos codificados, no experiencia humana. La comparación solo resulta útil en el nivel de combinar distintos canales de evidencia.
Cómo funciona la IA multimodal
Distintas arquitecturas implementan la multimodalidad de diferentes maneras. Una canalización habitual tiene cuatro etapas.
1. Codificar cada entrada
Los píxeles sin procesar, las ondas sonoras y el texto tienen formas diferentes. Un componente específico de cada modalidad, llamado codificador, convierte cada entrada en matrices de números que capturan características aprendidas.
En una imagen de una cuenta, las características pueden conservar patrones visuales relacionados con los caracteres, las líneas de productos y la disposición. Para la instrucción, el texto se divide en unidades procesables y se convierte en representaciones numéricas. El modelo no necesita que las dos entradas comiencen con la misma forma.
2. Alinear la información relacionada
El modelo debe aprender qué partes se corresponden entre las modalidades. Los pies de foto emparejados con imágenes, el habla emparejada con transcripciones y los videos emparejados con descripciones proporcionan ejemplos de estas conexiones durante el entrenamiento.
La alineación no requiere una correspondencia perfecta uno a uno. Una oración puede describir una imagen completa, una palabra puede referirse a una región pequeña y un sonido puede continuar durante muchos fotogramas de video. El modelo aprende correspondencias estadísticas útiles, no un mapa simbólico completo.
CLIP, por ejemplo, entrena codificadores de imágenes y texto para que las imágenes y descripciones coincidentes reciban representaciones compatibles. Esto permite tareas como elegir qué descripción textual encaja mejor con una imagen. Es un enfoque para la multimodalidad, no una plantilla que utilice todo modelo multimodal.
3. Combinar la evidencia
Las representaciones necesitan un lugar donde interactuar. Este paso suele llamarse fusión.
Algunos sistemas combinan las características al principio y las procesan juntas. Otros permiten que cada modalidad avance por gran parte de su propia canalización antes de combinar los resultados. Muchos modelos modernos mezclan información entre esos extremos y permiten que determinadas características de imagen, audio o video influyan en el procesamiento del lenguaje.
Flamingo demostró un diseño: conectar componentes de visión y lenguaje preentrenados por separado mediante capas aprendidas. El informe técnico de Gemini describe una decisión de entrenamiento diferente, con modelos entrenados conjuntamente en distintas modalidades desde el principio. Ambos son multimodales. «Multimodal» nombra la capacidad, no una arquitectura concreta.
4. Producir la salida solicitada
Después de combinar la evidencia, el modelo o sistema produce una salida. Puede ser texto, una imagen, audio, una categoría, una ubicación en una imagen o una señal de control.
La compatibilidad con entradas y salidas son decisiones de capacidad independientes. Un modelo puede:
- aceptar texto e imágenes y producir texto;
- aceptar texto, audio y video y producir texto;
- aceptar texto y producir imágenes;
- aceptar entradas mixtas y producir más de una modalidad de salida.
La etiqueta por sí sola no indica cuál de estas opciones se aplica.
Image ──> image encoder ──┐
│
Audio ──> audio encoder ──┼─> alignment and fusion ─> task output
│
Text ───> text encoder ───┘Los diseños reales pueden combinar estas etapas, repetirlas o utilizar modelos separados. El diagrama muestra la función, no una disposición obligatoria.
Un ejemplo práctico
Volvamos a la cuenta y a las instrucciones escritas para dividirla.
- La entrada visual se convierte en características que conservan el texto y la disposición de la cuenta.
- La instrucción escrita se convierte en representaciones de texto.
- Las conexiones aprendidas durante el entrenamiento ayudan a asociar «sopa», «pasta» y «ensalada» con las entradas correspondientes de la cuenta.
- El modelo combina esos precios con la regla sobre quién consumió cada cosa.
- Produce una respuesta textual que muestra el subtotal y la parte del impuesto de cada persona.
Pueden producirse varios fallos. Un dígito borroso puede alterar un precio. El modelo puede alinear «ensalada» con la línea equivocada. Puede leer correctamente todas las líneas, pero aplicar mal la regla del impuesto. La multimodalidad elimina la necesidad de transcribir manualmente la imagen; no elimina los errores de percepción, alineación o razonamiento.
La implementación también afecta a qué afirmación es exacta. Si un componente utiliza primero el reconocimiento óptico de caracteres —software que extrae caracteres escritos de una imagen— y un modelo que solo trabaja con texto procesa la transcripción resultante, la aplicación es un sistema multimodal. El modelo de texto que contiene no se convierte por ello en un modelo multimodal. Si un modelo combina directamente características de imagen aprendidas con la instrucción, el propio modelo es multimodal.
Por qué importa la IA multimodal
Muchas tareas útiles contienen evidencia que no puede reducirse a texto limpio sin perder algo importante. La disposición transmite significado en un formulario. El tono y el ritmo transmiten información en el habla. El movimiento distingue un video de una pila desordenada de imágenes. Las relaciones espaciales importan en diagramas y escenas.
Combinar modalidades puede resolver ambigüedades. Una pregunta escrita como «¿Por qué gotea esta pieza?» no indica a qué pieza se refiere «esta». Una imagen asociada puede aportar esa referencia. Una pista de audio puede distinguir entre un motor que parece funcionar y suena normal y otro que produce un ruido inusual.
Las interfaces multimodales también pueden reducir la conversión manual. Puedes señalar algo con una foto, dar una instrucción por voz o adjuntar un diagrama, en lugar de traducirlo todo primero a una descripción escrita detallada.
Son oportunidades, no garantías. Una modalidad adicional solo ayuda cuando contiene evidencia relevante y el modelo puede alinearla correctamente. Las entradas contradictorias o de baja calidad pueden introducir nuevos errores.
Conceptos erróneos frecuentes
«Multimodal» significa que puede hacer cualquier cosa con cualquier tipo de contenido
No. La capacidad tiene dos aspectos: qué puede entrar y qué puede salir. Comprueba las modalidades compatibles en cada dirección y las limitaciones para combinarlas en una misma solicitud.
Cualquier generador de imágenes es un modelo multimodal general
Un modelo de texto a imagen traduce de una modalidad a otra, por lo que es multimodal según algunas definiciones amplias. Eso no significa que pueda inspeccionar una imagen, comparar dos imágenes, entender audio o razonar sobre entradas mixtas. El contrato específico de entradas y salidas resulta más útil que la etiqueta.
La IA multimodal y la IA generativa son lo mismo
Describen ejes diferentes. La IA generativa produce contenido nuevo. La IA multimodal procesa o relaciona más de una modalidad. Un sistema puede ser ambas cosas, una de ellas o ninguna.
Un modelo que analiza una imagen y lecturas de sensores para elegir una categoría de seguridad fija es multimodal, pero no necesariamente generativo. Un modelo de escritura que solo trabaja con texto es generativo, pero unimodal. Muchos asistentes actuales son ambas cosas.
La IA multimodal debe ser un único modelo unificado
No siempre. Los investigadores pueden usar el término para un único modelo aprendido, mientras que los equipos de producto pueden usarlo para un sistema de componentes conectados. Pregunta dónde interactúan las modalidades. Si componentes separados producen respuestas de forma independiente y una aplicación simplemente las muestra juntas, el sistema no necesariamente ha realizado razonamiento entre modalidades.
Más modalidades siempre mejoran la precisión
La evidencia adicional puede ayudar, pero también puede ser irrelevante, ruidosa o contradictoria. El rendimiento depende de la calidad de los datos, la alineación, la tarea y la forma en que se entrenó el modelo. Una respuesta segura no demuestra que el modelo haya conectado correctamente las modalidades.
Cómo encaja la IA multimodal en el sistema más amplio
La multimodalidad puede aparecer en varios niveles:
- Datos: los ejemplos de entrenamiento emparejan o intercalan distintas modalidades.
- Modelo: los componentes aprendidos alinean y combinan las representaciones de las modalidades.
- Aplicación: un producto dirige archivos, flujos de sensores o salidas de modelos entre distintos componentes.
- Interfaz: una persona puede comunicarse mediante texto, voz, imágenes o video.
Estos niveles no deben confundirse en una sola afirmación. Una interfaz multimodal puede ocultar una canalización de modelos especializados. Un modelo multimodal puede estar detrás de una interfaz que solo utiliza texto. Un modelo entrenado con imágenes y textos emparejados puede admitir únicamente una tarea limitada de correspondencia, en lugar de una conversación abierta.
Al evaluar un producto o modelo, utiliza tres preguntas:
- ¿Qué modalidades puede aceptar en una misma tarea?
- ¿Qué modalidades puede producir?
- ¿Dónde y cómo interactúa la información de esas modalidades?
Esas respuestas te dicen más que «multimodal» por sí solo.
Qué consultar a continuación
Consulta ¿Qué es un modelo de IA? para conocer el concepto más amplio de modelo y ¿Qué es la IA generativa? para distinguir la capacidad de crear contenido de la capacidad de combinar modalidades. Al leer la ficha técnica de un modelo o la página de un producto, enumera por separado sus entradas y salidas y luego busca pruebas de que se haya evaluado en tareas que requieren información de más de una modalidad.