Glossário

Definições em linguagem simples dos termos por trás da IA moderna, de tokens e janelas de contexto a inferência, agentes e benchmarks, cada uma ligada a uma explicação completa.

  1. A
  2. C
  3. H
  4. I
  5. J
  6. L
  7. M
  8. P
  9. R
  10. T
  11. U

A

Agente de IA
Um agente de IA é um sistema de software que busca alcançar um objetivo usando um modelo de IA para escolher suas próximas ações, observar os resultados e continuar até concluir a tarefa, precisar de ajuda ou atingir um limite. Diferentemente de um modelo que apenas produz uma resposta, um agente pode controlar um processo de várias etapas e agir por meio de ferramentas dentro das permissões definidas.
Aprendizado de máquina
Aprendizado de máquina é uma forma de criar software que aprende padrões a partir de exemplos ou feedback e usa esses padrões para fazer previsões, tomar decisões ou produzir resultados úteis em casos que não viu antes. É uma abordagem dentro da inteligência artificial, não um sinônimo de toda a IA.

C

Chatbot de IA
Um chatbot de IA é um aplicativo de software que usa inteligência artificial para manter uma conversa com uma pessoa por texto ou voz. Ele recebe mensagens, usa um modelo de IA para interpretá-las ou respondê-las e gerencia o contexto, as regras, os dados e as ações necessários para dar continuidade à conversa.

H

Harness de IA
Um harness de IA é o software ao redor de um modelo de IA que controla o que o modelo recebe, o que acontece com sua saída e como o modelo se conecta ao restante de uma aplicação. Ele pode ser tão pequeno quanto um código que gerencia um histórico de conversa ou tão grande quanto um runtime que gerencia ferramentas, memória, permissões, novas tentativas e trabalhos de longa duração.

I

IA generativa
IA generativa é a inteligência artificial que aprende padrões em dados existentes e usa esses padrões para produzir novos conteúdos, como texto, imagens, áudio, vídeo ou código. Normalmente, ela gera esse conteúdo em resposta a uma instrução ou a outra entrada.
IA multimodal
IA multimodal é uma IA capaz de processar e relacionar informações de mais de um tipo de dado — como texto, imagens, áudio ou vídeo — para realizar uma tarefa. Um modelo multimodal pode aceitar uma imagem e uma instrução escrita, mas produzir apenas texto; “multimodal” não significa que todo tipo de dado funcione tanto como entrada quanto como saída.
Inferência em IA
Inferência em IA é o processo de executar um modelo treinado com uma entrada para produzir uma saída, sem atualizar o que o modelo aprendeu. É a fase de uso de um modelo: uma foto entra e um rótulo sai, ou um prompt entra e um texto gerado sai.
Inteligência Artificial
Inteligência artificial (IA) é o campo de projetar sistemas computacionais que produzem resultados orientados a objetivos — como previsões, conteúdo, recomendações ou decisões — usando métodos associados a capacidades como aprendizado, raciocínio, percepção e linguagem. IA também se refere aos sistemas criados por esse campo.

J

Janela de contexto
Uma janela de contexto é a quantidade máxima de material tokenizado que um modelo de IA pode usar ao produzir uma resposta. Em muitas APIs de modelos de linguagem, esse orçamento abrange a entrada e a saída gerada, embora os provedores também possam impor limites separados para entrada ou saída.

L

Latência de inferência
Latência de inferência é o tempo decorrido entre o recebimento de uma entrada por um sistema de IA e a produção de uma saída especificada. Um valor de latência só é significativo quando se sabe onde o cronômetro começa, onde termina e que tipo de saída é considerada completa.
Limite de conhecimento da IA
O limite de conhecimento de uma IA é a data até a qual se espera que o conhecimento integrado de um modelo reflita seus dados de treinamento. É uma fronteira aproximada, não uma garantia de que o modelo conheça todos os fatos anteriores ou de que um produto de IA não possa buscar informações posteriores.
LLM
Um modelo de linguagem de grande escala (LLM) é um modelo de IA treinado com grandes coleções de dados linguísticos para processar ou gerar sequências prováveis de texto. A maioria dos LLMs usados para geração de texto recebe um prompt e produz uma resposta uma pequena parte por vez.

M

Modelo de fundação
Um modelo de fundação é um modelo de aprendizado de máquina treinado com dados amplos para que possa ser adaptado a muitas tarefas diferentes, em vez de ser desenvolvido para apenas uma. Ele é um ponto de partida reutilizável, não uma aplicação pronta.
Modelo de IA
Um modelo de IA é a parte de um sistema de IA que transforma uma entrada em uma saída, como uma previsão, classificação, recomendação, ação ou resultado gerado. No uso atual mais comum, o termo significa um modelo de aprendizado de máquina cujo comportamento foi moldado por dados de treinamento.

P

Parâmetros do modelo
Os parâmetros do modelo são os valores numéricos armazenados dentro de um modelo ajustado que determinam como ele transforma uma entrada em uma saída. Em uma rede neural, eles geralmente incluem pesos e vieses, cujos valores são escolhidos durante o treinamento e reutilizados quando o modelo faz previsões.
Pesos do modelo
Os pesos do modelo são números aprendidos que determinam com que intensidade um modelo usa cada entrada ou sinal intermediário ao calcular uma saída. Eles geralmente são armazenados em grandes grupos chamados matrizes ou tensores, e o treinamento os modifica para que as saídas do modelo se ajustem melhor ao seu objetivo.

R

Rede neural
Uma rede neural é um modelo de aprendizado de máquina que aprende a transformar números de entrada em números de saída úteis, passando-os por camadas conectadas de cálculos simples. Essas camadas formam uma única função matemática treinável, não um cérebro eletrônico literal.

T

Tempo até o primeiro token
O tempo até o primeiro token, ou TTFT, é o tempo decorrido entre o início de uma solicitação a um modelo de linguagem e o recebimento do primeiro token da resposta. Ele mede a espera inicial, não a velocidade com que o restante da resposta chega.
Throughput de inferência
Throughput de inferência é a quantidade de trabalho do modelo que um sistema de inferência conclui por unidade de tempo, considerando todas as solicitações que está atendendo. Ele pode ser medido em solicitações concluídas, inferências, amostras ou tokens por segundo.
Token em IA
Um token em IA é um item do vocabulário que um LLM usa para representar e gerar texto. Dependendo do tokenizador do modelo, um token pode corresponder a uma palavra, parte de uma palavra, pontuação, espaço em branco ou até parte de um caractere codificado.
Tokens de entrada
Tokens de entrada são os tokens que um modelo recebe e processa antes de começar a gerar a próxima resposta. Eles vêm da solicitação completa voltada ao modelo, não apenas das últimas palavras que você digitou.
Tokens de raciocínio
Tokens de raciocínio são tokens que um modelo de IA gera enquanto trabalha para chegar a uma resposta, separados do texto da resposta que você vê. Eles representam etapas geradas adicionais, como planejar, verificar ou tentar uma abordagem, e podem ser contabilizados no uso e nos limites mesmo quando o serviço os oculta.
Tokens de saída
Tokens de saída são as unidades que um modelo gera ao produzir uma resposta. Eles geralmente compõem o texto, o código, os dados estruturados ou as instruções de ferramentas que você recebe, embora um provedor também possa contabilizar o raciocínio oculto como uso de saída.
Tokens por segundo
Tokens por segundo (TPS ou tok/s) mede quantos tokens um sistema de IA produz em um segundo. O número pode descrever a velocidade de saída de uma única resposta ou o throughput combinado de um sistema de serving inteiro, portanto o rótulo, por si só, é incompleto.
Treinamento em IA
Treinamento em IA é o processo de alterar os valores internos ajustáveis de um modelo para que suas saídas atendam melhor a um objetivo escolhido. O modelo melhora por meio de feedback e atualizações repetidos, em vez de um programador escrever uma regra para cada caso.

U

Uso de ferramentas em LLMs
O uso de ferramentas em LLMs é um mecanismo que permite a um modelo de linguagem solicitar uma operação externa — como pesquisar em um banco de dados, executar um cálculo ou enviar uma mensagem — e usar o resultado retornado em sua resposta. Em geral, o modelo escolhe a ferramenta e fornece as entradas propostas; o software ao redor do modelo decide se deve executar a chamada.