Um modelo mental útil

Pense na IA generativa como um mapa aprendido do que poderia plausivelmente vir a seguir.

Para texto, o mapa descreve quais continuações se ajustam à entrada e ao texto já produzido. Para uma imagem, ele pode descrever quais mudanças visuais transformariam ruído em uma imagem compatível com uma legenda. O mapa fica armazenado nos parâmetros aprendidos de um modelo de IA, e não em um catálogo de respostas prontas.

Um prompt restringe as possibilidades. “Escreva uma frase” deixa uma enorme variedade de resultados válidos. “Escreva um aviso de seis palavras para um piso molhado” torna apropriada uma região muito menor dessa variedade.

Em seguida, o modelo faz uma amostragem entre as possibilidades que aprendeu. Amostragem significa escolher um possível próximo passo, geralmente com algum grau de aleatoriedade controlada. A escolha passa a fazer parte da entrada para o passo seguinte. A repetição desse processo produz o resultado final.

Essa é a ponte fundamental entre aprender padrões e criar conteúdo:

Training examples -> learning objective -> learned pattern model
                                              |
Prompt + initial state -> repeated sampling --+-> generated output

O diagrama é deliberadamente geral. “Estado inicial” pode ser uma sequência inicial de texto, uma região de ruído, uma imagem existente a ser editada ou outra forma de dados. “Amostragem repetida” pode significar adicionar a próxima unidade de texto ou remover um pouco de ruído a cada etapa.

Como a IA generativa funciona

A maioria dos sistemas generativos tem duas fases distintas.

1. Aprender uma distribuição

Durante o treinamento, o modelo vê muitos exemplos do tipo de dados que precisa representar. Um objetivo de aprendizagem mede quão bem o modelo executa uma tarefa que revela a estrutura desses dados. Os parâmetros do modelo são ajustados para melhorar sua pontuação.

A tarefa exata depende da família do modelo:

  • Um modelo autorregressivo prevê a próxima unidade de uma sequência a partir das unidades anteriores.
  • Um modelo de difusão aprende a reverter um processo que adiciona ruído gradualmente.
  • Um autoencoder variacional aprende um espaço estruturado de dados possíveis e uma forma de decodificar amostras desse espaço.
  • Uma rede adversarial generativa, ou GAN, treina um gerador para produzir amostras que um segundo modelo, o discriminador, não consiga distinguir de forma confiável dos exemplos de treinamento.

Esses métodos são diferentes, mas cada um oferece ao sistema uma forma de produzir amostras semelhantes aos padrões de seus dados de treinamento. No sentido formal do aprendizado de máquina, é isso que torna o modelo generativo.

2. Fazer a amostragem de um resultado

Quando você usa o modelo treinado, sua entrada condiciona o processo de geração. “Condicionamento” significa simplesmente que a entrada muda quais resultados o modelo considera plausíveis.

A geração geralmente começa com um estado inicial. Um modelo de texto tem o prompt e o texto produzido até o momento. Um modelo de difusão de imagens normalmente começa com ruído. O modelo prevê um próximo passo, escolhe ou calcula esse passo, atualiza o estado e repete o processo até chegar a um ponto de parada.

Esse processo repetido é importante. Um gerador não tem a garantia de escolher a única resposta completa mais provável e normalmente não recupera um item pronto do armazenamento. Pequenas escolhas se acumulam. Escolhas diferentes podem produzir resultados válidos diferentes a partir do mesmo prompt.

Um exemplo textual detalhado

Suponha que um gerador de texto receba:

A trilha foi fechada porque o rio havia

Na etapa seguinte, imagine que o modelo atribua estas probabilidades:

  • subido — 54%
  • transbordado — 21%
  • extravasado — 12%
  • todas as outras continuações — 13%

Esses números são ilustrativos. Eles não descrevem um modelo específico.

Se o modelo selecionar “subido”, o texto em elaboração se torna:

A trilha foi fechada porque o rio havia subido

Agora, o modelo calcula um novo conjunto de possibilidades com base no prompt mais “subido”. Em seguida, pode dar preferência a “durante a noite”, “acima” ou a uma pontuação. Isso continua até que a resposta esteja completa.

Dois detalhes explicam grande parte do comportamento da IA generativa.

Primeiro, a geração é condicional. Trocar “trilha” por “aeroporto” muda a continuação provável. Segundo, plausível não é o mesmo que factual. O modelo pode construir uma frase fluente sobre um fechamento mesmo que nenhuma trilha ou rio exista. Seu processo de geração, por si só, não verifica a afirmação em relação ao mundo.

O termo tem um significado amplo e outro restrito

No aprendizado de máquina, um modelo generativo é qualquer modelo que represente suficientemente bem como os dados estão distribuídos para estimar ou produzir exemplos possíveis. Essa categoria costuma ser contrastada com um modelo discriminativo, que se concentra em prever um rótulo ou separar categorias. Um modelo que aprende como são os dígitos manuscritos é generativo; um modelo que apenas decide se uma imagem mostra um zero ou um um pode ser discriminativo.

Na linguagem cotidiana de produtos, “IA generativa” geralmente tem um significado mais restrito: sistemas orientados por prompts que criam conteúdo digital complexo. Esses sistemas costumam usar modelos grandes e de propósito geral, mas tamanho e generalidade não são requisitos da definição técnica ampla. Como observa o NIST, nem toda IA generativa vem de modelos de fundação.

É por isso que as definições podem parecer inconsistentes. Algumas descrevem uma classe de modelos estatísticos. Outras descrevem a geração atual de produtos construídos com essa classe.

Por que a IA generativa é importante

Um sistema tradicional de previsão geralmente retorna um rótulo de um conjunto fixo ou um número. Um sistema generativo pode construir um resultado cujo conteúdo exato não foi especificado antecipadamente.

Isso torna um único modelo útil para muitas tarefas que podem ser expressas como geração. Um modelo de texto pode redigir, resumir, traduzir, reformatar ou escrever código porque cada tarefa pode ser formulada como a produção de uma sequência adequada. Um modelo de imagem pode criar, ampliar ou editar uma imagem porque cada tarefa pode ser formulada como a geração de dados visuais sob diferentes condições.

A mesma flexibilidade cria o principal problema de confiabilidade. Há muitos resultados que parecem plausíveis. Apenas alguns atendem às necessidades não declaradas do usuário, correspondem a fatos externos, evitam material prejudicial ou respeitam restrições legais e sociais. A capacidade do modelo de gerar uma forma convincente não garante o conteúdo dentro dessa forma.

Equívocos comuns

“Ela pesquisa um banco de dados e junta uma resposta”

Um modelo generativo normalmente cria um resultado aplicando parâmetros aprendidos repetidamente, e não selecionando uma resposta armazenada. Isso não significa que a memorização seja impossível. Os modelos podem reproduzir partes de seus dados de treinamento, especialmente materiais que foram repetidos ou que têm características marcantes. “Não é uma consulta a um banco de dados” e “nunca reproduz material de treinamento” são afirmações diferentes.

“O conteúdo gerado é verdadeiro”

A geração recompensa a compatibilidade com padrões aprendidos e condições de entrada. A verdade exige outro padrão: evidências, cálculo, observação ou uma fonte confiável. Uma resposta fluente ainda pode conter nomes, citações, eventos ou explicações causais inventados.

“O conteúdo gerado precisa ser original”

O resultado pode ser novo no sentido limitado de que o sistema o montou durante esta execução, em vez de recuperar um registro completo armazenado. Isso não resolve se ele é criativamente original, passível de proteção legal, derivado de uma obra existente ou afetado por memorização. Essas questões dependem do resultado, do processo de treinamento e das regras aplicáveis.

“IA generativa significa chatbots”

Um chatbot é uma interface e um padrão de aplicação. IA generativa é a categoria subjacente de modelos e sistemas que produzem conteúdo. Ela também inclui geradores de imagens, áudio, vídeo, código e dados especializados.

“Todo sistema de IA generativa é o mesmo tipo de modelo”

Métodos autorregressivos, de difusão, variacionais, adversariais e outros métodos generativos usam objetivos de aprendizagem e processos de amostragem diferentes. Eles compartilham um propósito, não uma arquitetura universal.

Como ela se encaixa em um sistema mais amplo

O modelo é apenas uma parte de um produto de IA generativa. Um aplicativo completo pode adicionar instruções, controles do usuário, informações externas, verificações de segurança, filtros de conteúdo, ferramentas e validação dos resultados ao seu redor.

Essas partes adjacentes podem mudar o comportamento sem alterar a definição básica. Uma conexão com uma ferramenta de busca pode fornecer evidências atuais a um gerador de texto. Um filtro pode bloquear determinadas imagens. Uma ferramenta de código pode executar testes no código gerado. O gerador ainda fornece conteúdo candidato; o restante do sistema fornece contexto, recursos e verificações.

Para onde ir em seguida

Comece por O que é um modelo de IA? se quiser entender o que o próprio modelo aprendido contém. Depois, leia O que é um modelo de fundação? para conhecer os modelos amplos e reutilizáveis por trás de muitos produtos generativos atuais, ou O que é IA multimodal? para conhecer sistemas que trabalham com texto, imagens, áudio e vídeo.