Um modelo mental útil

Treinamento é correção controlada de erros.

Imagine um modelo com reguladores ajustáveis em seu interior. Um exemplo é fornecido, e o modelo produz uma saída. Uma regra de pontuação informa quão boa ou ruim foi essa saída. O treinamento determina em que direção girar os reguladores, faz um pequeno ajuste e tenta novamente.

Esses “reguladores” são os parâmetros do modelo. A regra de pontuação é chamada de objetivo. Quando valores menores são melhores, sua pontuação costuma ser chamada de perda.

Essa descrição é mais precisa do que dizer que o modelo “absorve” seus dados. Os dados fornecem exemplos. O objetivo fornece uma direção para a melhoria. O algoritmo de treinamento altera o modelo.

training examples
       |
       v
model makes outputs
       |
       v
objective measures loss or reward
       |
       v
calculate each parameter's contribution
       |
       v
update parameters
       |
       +---------- repeat ----------+

held-out validation data checks whether the result transfers

Como funciona o treinamento de IA

O método exato depende do modelo e do objetivo, mas o treinamento de redes neurais geralmente segue este ciclo:

  1. Prepare os exemplos e um objetivo.Os dados de treinamento podem associar entradas a rótulos, ocultar parte de uma entrada para que o modelo a preveja ou incluir feedback sobre saídas preferidas.
  2. Escolha um modelo inicial.O treinamento pode começar com parâmetros recém-inicializados ou com um modelo que já tenha sido treinado.
  3. Execute um lote pelo modelo.Um lote é um pequeno grupo de exemplos processados em conjunto. Essa passagem direta se assemelha à inferência: o modelo atual transforma entradas em saídas.
  4. Avalie as saídas.Uma função de perda pode medir a distância em relação às respostas-alvo. Outro objetivo pode atribuir uma recompensa maior a comportamentos preferidos.
  5. Atribua crédito ou culpa.Em uma rede neural, a retropropagação calcula um gradiente para cada parâmetro. Um gradiente indica como uma pequena alteração nesse parâmetro provavelmente mudaria a perda.
  6. Atualize os parâmetros.Um otimizador usa esses gradientes para escolher as alterações efetivas. A taxa de aprendizado controla o tamanho de uma atualização típica.
  7. Repita e verifique.O treinamento continua ao longo de mais lotes. Dados de validação separados verificam se a melhoria se estende para além dos exemplos que produziram as atualizações.

Uma época é uma passagem pelo conjunto de dados de treinamento. O treinamento pode usar parte de uma época ou muitas épocas. Uma época é uma unidade de progresso, não uma garantia de que ocorreu aprendizado útil.

O ciclo descreve o significado técnico restrito de treinamento. Na prática, as pessoas também usam treinamento para se referir ao fluxo de trabalho mais amplo ao redor dele: coletar e filtrar dados, selecionar um objetivo, realizar experimentos, avaliar checkpoints e decidir quando parar.

O feedback nem sempre tem a mesma forma

A frase “compare a previsão com a resposta correta” é um ponto de partida útil, mas é restrita demais como definição.

  • No aprendizado supervisionado, os exemplos incluem rótulos-alvo, como a categoria atribuída a uma imagem.
  • No aprendizado autossupervisionado, os próprios dados fornecem os alvos. Um modelo de linguagem pode aprender prevendo um trecho oculto ou o próximo trecho de texto.
  • No aprendizado por reforço, os resultados recebem recompensas, e o treinamento aumenta a probabilidade de ações que levam a recompensas maiores.

Esses métodos diferem quanto à origem do sinal de treinamento. Eles compartilham a mesma ideia central: usar feedback para alterar os parâmetros do modelo em direção a um objetivo.

Um exemplo de treinamento em uma etapa

Considere um modelo com um parâmetro, w. Ele prevê:

output = w × input

O modelo começa com w = 0,5. Seu exemplo de treinamento tem uma entrada de 2 e uma saída-alvo de 4.

A primeira previsão é:

0.5 × 2 = 1

Use o erro quadrático como perda:

(prediction - target)²
(1 - 4)² = 9

Para este exemplo, o gradiente da perda em relação a w é -12. O sinal negativo significa que aumentar w deve reduzir a perda. Com uma taxa de aprendizado de 0,1 a descida do gradiente faz esta atualização:

new w = old w - learning rate × gradient
new w = 0.5 - 0.1 × (-12)
new w = 1.7

Agora a previsão é 1,7 × 2 = 3,4, e o erro quadrático é 0,36. Uma atualização fez com que este exemplo se ajustasse melhor.

Modelos reais podem ter muitos parâmetros, e o treinamento geralmente combina sinais de um lote. O otimizador precisa encontrar alterações que funcionem em exemplos variados. Melhorar um lote não é suficiente. O modelo também precisa ter um bom desempenho em dados não utilizados no treinamento.

Por que o treinamento é importante

O treinamento determina quais comportamentos estarão disponíveis quando um modelo for usado posteriormente.

A arquitetura define os tipos de cálculos que o modelo pode realizar. O treinamento seleciona valores específicos de parâmetros dentro dessa arquitetura. Esses valores moldam os padrões aos quais o modelo responde e as saídas que ele tende a produzir.

O objetivo é importante porque o modelo é otimizado para o sinal que recebe, não para todas as qualidades que uma pessoa possa considerar importantes. Um modelo de linguagem treinado para prever texto pode se tornar útil em muitas tarefas de linguagem, mas a perda de previsão não garante diretamente veracidade, segurança ou obediência a instruções. Treinamentos posteriores podem visar alguns desses comportamentos com demonstrações ou feedback de preferências.

Os dados são importantes pelo mesmo motivo. Um modelo só pode receber sinais de treinamento dos exemplos e do feedback disponíveis. Lacunas, erros, duplicações e vieses nesse material podem afetar o resultado treinado.

Equívocos comuns

O treinamento armazena uma cópia de cada exemplo

O treinamento altera os parâmetros. Normalmente, ele não cria no modelo um banco de dados pesquisável, linha por linha, do conjunto de treinamento.

Ainda assim, um modelo pode memorizar alguns exemplos, especialmente quando os dados são repetidos ou quando o modelo é treinado de forma excessivamente ajustada a eles. Porém, memorização e generalização útil são resultados diferentes. A avaliação com dados realmente separados ajuda a distingui-los.

Uma perda de treinamento menor significa que o modelo é bom

Uma perda menor significa que o modelo se ajusta melhor ao seu objetivo de treinamento nos dados medidos. Isso não prova que o modelo funciona em casos novos ou que o objetivo representa a meta real.

Se a perda de treinamento cair enquanto o desempenho na validação piora, o modelo pode estar superajustado: tornando-se mais especializado em seus exemplos de treinamento em detrimento de exemplos novos.

Mais treinamento sempre melhora um modelo

Atualizações adicionais podem ajudar, fazer pouca diferença, desestabilizar o treinamento ou aumentar o superajuste. O resultado depende dos dados, do objetivo, das configurações do otimizador, da capacidade do modelo e da decisão de quando parar.

O modelo aprende com você enquanto você conversa com ele

Durante a inferência comum de IA, o modelo implantado usa parâmetros fixos para responder a uma entrada. As informações da conversa atual podem influenciar a próxima saída sem alterar esses parâmetros.

Um provedor pode usar posteriormente as interações coletadas em um processo de treinamento separado, dependendo do produto e de sua política de dados. Isso não é o mesmo que o modelo se atualizar durante a conversa.

Todo modelo é treinado do zero

O treinamento pode começar com um modelo existente. O pré-treinamento desenvolve capacidades amplas a partir de um conjunto de dados grande e geral. O ajuste fino dá continuidade ao treinamento para uma tarefa ou domínio mais específico. O pós-treinamento é um termo mais amplo para etapas posteriores destinadas a moldar o comportamento, que podem incluir ajuste fino e métodos baseados em preferências.

As fronteiras entre esses rótulos não são totalmente padronizadas. O teste confiável é verificar se o processo atualiza os parâmetros do modelo. Fornecer exemplos em um prompt pode alterar uma saída sem treinar o modelo.

Como o treinamento se encaixa em um sistema de IA

Aprendizado de máquina é a abordagem mais ampla na qual os sistemas melhoram seu comportamento a partir de dados ou experiência. O treinamento é o processo que produz ou adapta um modelo dentro dessa abordagem.

O resultado de uma execução de treinamento geralmente é um checkpoint salvo, contendo os pesos aprendidos e outros estados. Os desenvolvedores avaliam checkpoints candidatos e selecionam um para treinamento adicional ou implantação.

A implantação inicia uma fase operacional diferente. Na inferência, as entradas passam pelo modelo treinado para produzir previsões, classificações ou conteúdo gerado. Uma passagem direta aparece nas duas fases. O treinamento acrescenta feedback, cálculo de gradientes e atualizações de parâmetros.

Para onde ir em seguida

Leia O que é inferência em IA? para ver o que muda quando o ciclo de atualização de parâmetros para e um modelo treinado passa a ser usado. Depois, consulte Treinamento vs. inferência para uma comparação direta entre as duas etapas do ciclo de vida.