O termo modalidade significa uma forma distinta de representar ou vivenciar informações. Um parágrafo, uma fotografia, uma gravação de voz e uma leitura de um sensor de profundidade são modalidades diferentes. Elas têm estruturas diferentes, mas podem descrever o mesmo evento.

Uma tarefa, vários tipos de evidência

Suponha que você envie uma foto de um recibo de restaurante e digite:

Ana comeu a sopa, Bo comeu a massa, e os dois dividiram a salada. Divida o imposto proporcionalmente aos totais de consumo de cada um.

Os preços estão na imagem. As regras de propriedade e divisão estão no texto. Nenhuma das duas entradas é suficiente por si só. Para responder, o modelo precisa conectar palavras como “sopa” e “salada” às regiões corretas do recibo, incluir seus preços no cálculo e seguir a regra escrita.

Essa conexão é a ideia central. IA multimodal não é simplesmente ter várias entradas lado a lado. As informações de uma modalidade precisam mudar a forma como as informações de outra modalidade são interpretadas ou usadas.

Isso é mais preciso do que dizer que a IA multimodal “funciona como os sentidos humanos”. As pessoas combinam visão, som e linguagem, mas um modelo de IA recebe dados codificados, não experiências humanas. A comparação só é útil no nível da combinação de diferentes canais de evidência.

Como a IA multimodal funciona

Diferentes arquiteturas implementam a multimodalidade de maneiras diferentes. Um pipeline comum tem quatro etapas.

1. Codificar cada entrada

Pixels brutos, ondas sonoras e texto têm formatos diferentes. Um componente específico da modalidade, chamado codificador, converte cada entrada em matrizes de números que capturam características aprendidas.

Para a imagem de um recibo, as características podem preservar padrões visuais relacionados a caracteres, itens e layout. Para a instrução, o texto é dividido em unidades processáveis e convertido em representações numéricas. O modelo não precisa que as duas entradas tenham a mesma forma inicialmente.

2. Alinhar informações relacionadas

O modelo precisa aprender quais partes correspondem entre as modalidades. Legendas associadas a imagens, fala associada a transcrições e vídeos associados a descrições fornecem exemplos dessas conexões durante o treinamento.

O alinhamento não exige uma correspondência perfeita de um para um. Uma frase pode descrever uma imagem inteira, uma palavra pode se referir a uma pequena região, e um som pode continuar por vários quadros de vídeo. O modelo aprende correspondências estatísticas úteis, e não um mapa simbólico completo.

O CLIP

3. Combinar as evidências

As representações precisam de um espaço para interagir. Essa etapa costuma ser chamada de fusão.

Alguns sistemas combinam as características logo no início e as processam juntas. Outros permitem que cada modalidade avance por grande parte de seu próprio pipeline antes de combinar os resultados. Muitos modelos modernos misturam informações entre esses extremos, permitindo que características selecionadas de imagem, áudio ou vídeo influenciem o processamento da linguagem.

O Flamingo demonstrou um projeto: conectar componentes de visão e linguagem pré-treinados separadamente por meio de camadas aprendidas. O relatório técnico do Gemini

4. Produzir a saída solicitada

Depois de combinar as evidências, o modelo ou sistema produz uma saída. Ela pode ser texto, imagem, áudio, uma categoria, uma localização em uma imagem ou um sinal de controle.

O suporte a entradas e saídas envolve decisões de capacidade separadas. Um modelo pode:

  • aceitar texto e imagens e produzir texto;
  • aceitar texto, áudio e vídeo e produzir texto;
  • aceitar texto e produzir imagens;
  • aceitar entradas mistas e produzir mais de uma modalidade de saída.

O rótulo, por si só, não informa qual dessas opções se aplica.

Image ──> image encoder ──┐
                          │
Audio ──> audio encoder ──┼─> alignment and fusion ─> task output
                          │
Text ───> text encoder ───┘

Projetos reais podem combinar essas etapas, repeti-las ou usar modelos separados. O diagrama mostra a função, não uma disposição obrigatória.

Um exemplo detalhado

Voltemos ao recibo e às instruções escritas para dividir a conta.

  1. A entrada visual é convertida em características que preservam o texto e o layout do recibo.
  2. A instrução escrita é convertida em representações textuais.
  3. As conexões aprendidas durante o treinamento ajudam a associar “sopa”, “massa” e “salada” aos itens correspondentes no recibo.
  4. O modelo combina esses preços com a regra de propriedade.
  5. Ele produz uma resposta textual mostrando o subtotal e a parcela do imposto de cada pessoa.

Vários erros são possíveis. Um dígito borrado pode corromper um preço. O modelo pode alinhar “salada” à linha errada. Ele pode ler todas as linhas corretamente, mas aplicar a regra do imposto de forma incorreta. A multimodalidade elimina a necessidade de você transcrever manualmente a imagem; ela não elimina erros de percepção, alinhamento ou raciocínio.

A implementação também afeta a precisão da afirmação. Se um componente primeiro usa reconhecimento óptico de caracteres — um software que extrai caracteres escritos de uma imagem — e um modelo somente de texto processa a transcrição resultante, o aplicativo é um sistema multimodal. O modelo somente de texto dentro dele não se torna, por isso, um modelo multimodal. Se um único modelo combina diretamente características visuais aprendidas com a instrução, o próprio modelo é multimodal.

Por que a IA multimodal é importante

Muitas tarefas úteis contêm evidências que não podem ser reduzidas a texto limpo sem perder algo importante. O layout transmite significado em um formulário. O tom e o timing transmitem informações na fala. O movimento diferencia um vídeo de uma pilha desordenada de imagens. Relações espaciais são importantes em diagramas e cenas.

A combinação de modalidades pode resolver ambiguidades. Uma pergunta escrita como “Por que esta parte está vazando?” não indica a que parte “esta” se refere. Uma imagem associada pode fornecer essa referência. Uma faixa de áudio pode diferenciar um motor visivelmente em funcionamento que soa normal de outro que produz um ruído incomum.

Interfaces multimodais também podem reduzir a conversão manual. Você pode apontar usando uma foto, falar uma instrução ou anexar um diagrama, em vez de primeiro traduzir tudo para uma descrição escrita detalhada.

Essas são oportunidades, não garantias. Uma modalidade adicional só ajuda quando contém evidências relevantes e o modelo consegue alinhar essas evidências corretamente. Entradas conflitantes ou de baixa qualidade podem introduzir novos erros.

Equívocos comuns

“Multimodal” significa que ele faz tudo com qualquer tipo de mídia

Não. A capacidade tem dois lados: o que pode entrar e o que pode sair. Verifique as modalidades compatíveis em cada direção e quaisquer limites para combiná-las em uma mesma solicitação.

Qualquer gerador de imagens é um modelo multimodal geral

Um modelo de texto para imagem traduz de uma modalidade para outra, portanto é multimodal segundo algumas definições amplas. Isso não significa que ele consiga inspecionar uma imagem, comparar duas imagens, compreender áudio ou raciocinar sobre entradas mistas. O contrato específico de entrada e saída é mais útil do que o rótulo.

IA multimodal e IA generativa são a mesma coisa

Elas descrevem eixos diferentes. IA generativa produz conteúdo novo. IA multimodal processa ou relaciona mais de uma modalidade. Um sistema pode ser ambos, um deles ou nenhum dos dois.

Um modelo que analisa uma imagem e leituras de sensores para escolher uma categoria fixa de segurança é multimodal, mas não necessariamente generativo. Um modelo de escrita somente de texto é generativo, mas unimodal. Muitos assistentes atuais são ambos.

A IA multimodal precisa ser um único modelo unificado

Nem sempre. Pesquisadores podem usar o termo para um único modelo aprendido, enquanto equipes de produto podem usá-lo para um sistema de componentes conectados. Pergunte onde as modalidades interagem. Se componentes separados produzirem respostas independentemente e um aplicativo apenas as exibir em conjunto, o sistema não necessariamente realizou raciocínio entre modalidades.

Mais modalidades sempre melhoram a precisão

Evidências adicionais podem ajudar, mas também podem ser irrelevantes, ruidosas ou contraditórias. O desempenho depende da qualidade dos dados, do alinhamento, da tarefa e da forma como o modelo foi treinado. Uma resposta confiante não prova que o modelo conectou as modalidades corretamente.

Como a IA multimodal se encaixa no sistema mais amplo

A multimodalidade pode aparecer em vários níveis:

  • Dados: exemplos de treinamento associam ou intercalam diferentes modalidades.
  • Modelo: componentes aprendidos alinham e combinam representações das modalidades.
  • Aplicação: um produto encaminha arquivos, fluxos de sensores ou saídas de modelos entre componentes.
  • Interface: uma pessoa pode se comunicar por texto, fala, imagens ou vídeo.

Esses níveis não devem ser reduzidos a uma única afirmação. Uma interface multimodal pode ocultar um pipeline de modelos especializados. Um modelo multimodal pode estar por trás de uma interface somente de texto. Um modelo treinado com imagens e textos associados pode oferecer apenas uma tarefa restrita de correspondência, em vez de conversas abertas.

Ao avaliar um produto ou modelo, use três perguntas:

  1. Quais modalidades ele consegue aceitar na mesma tarefa?
  2. Quais modalidades ele consegue produzir?
  3. Onde e como as informações dessas modalidades interagem?

Essas respostas informam mais do que “multimodal” por si só.

Próximos passos

Consulte O que é um modelo de IA? para conhecer o conceito mais amplo de modelo e O que é IA generativa? para separar a capacidade de criar conteúdo da capacidade de combinar modalidades. Ao ler um model card ou uma página de produto, liste as entradas e saídas separadamente e procure evidências de que ele foi testado em tarefas que exigem informações de mais de uma modalidade.