O modelo mental útil
A palavra “fundação” descreve a posição do modelo em uma cadeia.
broad training data
↓
pretraining
↓
foundation model
↙ ↓ ↘
prompt task fine-tuned
layer derivative
↘ ↓ ↙
downstream models and applicationsA fundação contém padrões aprendidos durante um pré-treinamento amplo. Uma etapa posterior direciona esses padrões para uma tarefa específica. Uma adaptação pode classificar chamados de suporte. Outra pode responder a perguntas. Outra pode associar imagens a descrições escritas.
Esta é a distinção fundamental: um modelo pode ter capacidades amplas sem estar pronto para um produto específico. A “fundação” é valiosa porque diferentes desenvolvedores podem reutilizá-la, em vez de começar cada tarefa do zero.
Como funciona um modelo de fundação
Primeiro, os desenvolvedores reúnem dados de treinamento amplos. “Amplo” é relativo ao domínio pretendido. Um modelo de linguagem pode aprender com muitos tipos de texto, enquanto um modelo de fundação para imagens médicas pode aprender com exames variados e diferentes contextos clínicos. Amplo não precisa significar todo tipo de dado existente.
Em seguida, o modelo passa pelo pré-treinamento. Muitos modelos de fundação usam aprendizado autossupervisionado: os próprios dados fornecem o sinal de aprendizado. Um modelo de texto pode aprender prevendo partes ocultas ou seguintes do texto. Um modelo de imagem e texto pode aprender quais legendas correspondem a quais imagens. O objetivo exato varia, mas a finalidade é aprender padrões que continuem úteis além de uma única tarefa restrita.
O pré-treinamento produz um checkpoint: um conjunto salvo dos valores aprendidos pelo modelo. Esse checkpoint pode então ser adaptado de várias maneiras:
- O prompting fornece instruções ou exemplos na entrada. Ele altera o comportamento imediato, não os valores aprendidos pelo modelo.
- Adicionar uma camada específica da tarefa conecta um pequeno componente que converte a saída interna do modelo em um resultado específico, como um conjunto de categorias.
- Fine-tuning continua o treinamento com um conjunto de dados mais restrito. Ele altera parte ou todos os valores aprendidos para melhorar o desempenho em uma tarefa ou domínio.
- Integração de sistemas conecta o modelo a mecanismos de busca, bancos de dados, ferramentas, regras e uma interface. Isso muda o que a aplicação pode fazer, mesmo que o modelo subjacente permaneça congelado.
Esses métodos podem ser combinados. Nenhum deles garante que o resultado adaptado será preciso, seguro ou adequado ao uso pretendido. Cada uso posterior ainda precisa de sua própria avaliação.
Um exemplo concreto
Imagine que uma empresa comece com um modelo de linguagem pré-treinado de forma ampla e queira lidar com chamados de suporte ao cliente.
Para criar um protótipo rapidamente, a equipe fornece ao modelo um prompt contendo os rótulos de encaminhamento permitidos e alguns exemplos. Os valores aprendidos pelo modelo não mudam.
Para obter um encaminhamento mais consistente, a equipe adiciona uma camada de classificação e faz fine-tuning com chamados anteriores. Isso cria um derivado específico da tarefa a partir do modelo original.
Para criar um assistente de suporte voltado ao cliente, a equipe conecta o modelo a artigos de ajuda aprovados, ferramentas de conta, verificações de permissão e uma interface. O resultado é um sistema de IA construído em torno do modelo, não apenas o modelo de fundação em si.
O mesmo checkpoint inicial possibilitou três resultados: comportamento orientado por prompt, um modelo adaptado e uma aplicação completa. Essa reutilização é o que faz dele um modelo de fundação.
Esse padrão não é hipotético. O trabalho original com BERT adaptou um modelo de linguagem pré-treinado a 11 tarefas de linguagem, muitas vezes com apenas uma camada de saída adicionada. Trabalhos posteriores mostraram outras formas de reutilização: o GPT-3 executava tarefas a partir de instruções e exemplos em texto sem fine-tuning, enquanto o CLIP usava rótulos em linguagem natural para classificar imagens que não haviam sido especificamente usadas em seu treinamento para classificação.
Por que os modelos de fundação são importantes
Os modelos de fundação transferem grande parte do aprendizado amplo e caro para uma etapa compartilhada de pré-treinamento. As equipes responsáveis pelas etapas posteriores podem então concentrar seus esforços nos dados da tarefa, na avaliação, no design do produto e nas salvaguardas.
Essa base compartilhada cria alavancagem. Uma melhoria na fundação pode beneficiar muitos usos. Ela também cria um risco de concentração. Se a fundação contiver um viés, uma vulnerabilidade de segurança ou uma falha sistemática, muitos modelos adaptados e produtos poderão herdá-los. Pesquisadores chamam isso de homogeneização: muitos sistemas passam a depender do mesmo pequeno conjunto de métodos ou modelos subjacentes.
A adaptação pode reduzir um problema em um caso de uso, mas não elimina automaticamente as limitações da fundação. Uma aplicação refinada pode ocultar a origem comum sem removê-la.
Conceitos equivocados comuns
“Modelo de fundação” significa “modelo de linguagem grande”
Um LLM é definido por seu foco em linguagem e por sua escala. Um modelo de fundação é definido pelo pré-treinamento amplo e pela reutilização posterior. Muitos LLMs são modelos de fundação, mas a categoria também inclui modelos para imagens, áudio, robótica, biologia e combinações de tipos de dados.
Todo modelo de fundação gera conteúdo
A geração não é exigida pela definição original. Um modelo de fundação pode produzir características reutilizáveis, classificar ou ordenar entradas, ou conectar texto e imagens. As páginas de fornecedores costumam usar “modelo de fundação” como abreviação para modelos generativos porque esses são os modelos que seus produtos comercializam, mas esse é um uso mais restrito.
Um tamanho grande é suficiente
Não existe uma quantidade universal de parâmetros que separe modelos de fundação de outros modelos. Um modelo muito grande treinado para uma única tarefa fixa não é automaticamente um modelo de fundação. O teste mais forte é verificar se ele aprendeu com dados amplos e pode servir como uma base significativa para diversas tarefas posteriores.
Documentos de políticas podem estabelecer limites numéricos para um subconjunto regulamentado, como um “modelo de fundação de uso dual”. Esses limites definem o escopo desse termo na política, não toda a categoria técnica.
O prompting treina o modelo
Um prompt normal fornece uma entrada temporária para uma interação. O fine-tuning atualiza os valores aprendidos por meio de treinamento adicional. Ambos podem adaptar o comportamento a uma tarefa, mas apenas o segundo altera o próprio modelo.
“Fundação” significa confiável
O termo não certifica a qualidade. Os autores originais o escolheram, em parte, para enfatizar que os sistemas posteriores dependem do que está abaixo deles. Uma fundação fraca pode disseminar falhas com a mesma eficácia com que uma fundação forte dissemina capacidades úteis.
“Modelo de fundação” informa como ele é licenciado
Não informa. Um modelo de fundação pode ter pesos para download, pesos restritos ou acesso apenas por API. “Aberto”, “com pesos abertos” e “fechado” descrevem acesso e licenciamento, não se o modelo desempenha um papel de fundação.
Como ele se encaixa no sistema mais amplo
Um modelo de fundação fica entre o pré-treinamento amplo e o uso específico.
Antes dele estão os dados, o objetivo de aprendizado, a arquitetura, o poder computacional e a avaliação usados para criar o checkpoint. Depois dele estão prompts, derivados ajustados por fine-tuning, componentes específicos da tarefa, fontes de recuperação, controles de segurança, ferramentas e interfaces de usuário.
Manter essas camadas separadas ajuda a avaliar afirmações. Se um assistente recupera um fato atual, isso pode vir de um sistema de busca conectado, e não do pré-treinamento do modelo. Se um chatbot recusa uma solicitação, esse comportamento pode vir do treinamento do modelo, de uma instrução de sistema, de um filtro externo ou de várias camadas em conjunto. O produto visível não revela qual camada realizou o trabalho.
Por onde continuar
Quando encontrar o rótulo “modelo de fundação”, verifique duas coisas: se o modelo foi treinado de forma ampla o suficiente para oferecer suporte a mais de uma tarefa restrita e como ele está sendo adaptado no produto que você está examinando. Um model card ou relatório técnico deve ajudar a identificar o escopo do pré-treinamento, os usos posteriores pretendidos, os métodos de adaptação e as limitações conhecidas.
Se esses detalhes estiverem ausentes, o rótulo, por si só, informa muito pouco sobre capacidade, confiabilidade, acesso ou segurança.
Leia O que é um modelo de IA? para conhecer o conceito mais amplo de modelo, O que é treinamento em IA? para entender como os parâmetros aprendidos são criados, e O que é IA generativa? para conhecer uma das principais famílias de aplicações de modelos de fundação.