Tokens de entrada

Tokens de entrada representam o conteúdo fornecido em uma solicitação. Isso pode incluir instruções do sistema e do desenvolvedor, a mensagem mais recente do usuário, turnos anteriores da conversa, documentos recuperados, definições de ferramentas, resultados de ferramentas e imagens ou áudios codificados, quando o modelo os aceita.

“Entrada” descreve a direção dos dados, não quem os escreveu. Um usuário pode digitar uma frase curta enquanto o aplicativo envia, sem que isso fique evidente, uma solicitação muito maior ao redor dela.

A entrada armazenada em cache continua sendo entrada. O cache pode alterar seu preço ou a forma como ela aparece em um relatório de uso, mas não transforma o conteúdo em saída nem o remove do contexto de trabalho do modelo.

Tokens de saída

Tokens de saída são gerados durante a resposta. Texto e código visíveis são saída, mas também são saída estruturas geradas, como chamadas de ferramentas. Dependendo da terminologia do provedor, o total de saída relatado também pode incluir o raciocínio interno e outros tokens gerados não visíveis.

É por isso que o texto exibido na tela não é um contador de tokens confiável. A resposta pode mostrar 180 tokens de prosa, enquanto o registro de uso informa um total gerado muito maior.

Tokens de raciocínio

Tokens de raciocínio, às vezes chamados de tokens de pensamento, são gerados internamente enquanto um modelo de raciocínio planeja, verifica ou trabalha em uma tarefa. Eles não são conteúdo adicional do prompt e não são necessariamente mostrados a você.

Um provedor pode ocultar o raciocínio, omiti-lo ou retornar um resumo. Um resumo é uma apresentação do processo, não uma prova de que você recebeu cada token de raciocínio interno. As documentações atuais da OpenAI, da Anthropic e do Google contabilizam todo o trabalho interno, mesmo quando o texto completo não é retornado.

Nem todo modelo ou API expõe uma contagem de tokens de raciocínio. Alguns modelos geram uma resposta sem uma fase de raciocínio informada separadamente. Outros oferecem controles que influenciam o esforço de raciocínio, mas esses controles não prometem uma quantidade exata de pensamento, a menos que o provedor declare isso explicitamente.

A distinção real

Os três rótulos respondem a perguntas diferentes:

Token typeDefining questionTypical contentsUsually visible?Accounting relationship
InputWhat did this request send to the model?Instructions, messages, context, tools, filesMostly, though applications can add contentA top-level request category; cached input may be a priced subset
OutputWhat did the model generate?Answer text, code, tool calls, and sometimes internal generated workPartlyCan be an inclusive total or an answer-only field, depending on the API
ReasoningWhat internal generated work helped produce the answer?Planning, intermediate work, checksOften hidden or summarizedCommonly a subset of generated output for billing, but sometimes reported beside output

A entrada e a saída gerada são lados opostos de uma solicitação. O raciocínio é um tipo de atividade gerada. Portanto, ele não constitui uma terceira categoria universal ao lado da entrada e da saída.

Essa distinção é importante ao comparar painéis de provedores. A OpenAI documenta o raciocínio como um detalhe dentro de uma contagem inclusiva de saída. Da mesma forma, a Anthropic descreve os tokens de pensamento como parte do total de saída oficial. O Google expõe separadamente a saída do candidato e as contagens de pensamento, e afirma que o preço da resposta combina as duas. Os nomes dos campos diferem, mas os três tratam o raciocínio como trabalho gerado.

Um exemplo prático de uso

Considere esta solicitação simplificada:

  • As instruções, a mensagem do usuário, o histórico e o contexto anexado totalizam 1.200 tokens de entrada.
  • O modelo gera 620 tokens de raciocínio.
  • Em seguida, gera uma resposta visível de 180 tokens.

Uma API poderia informar:

input_tokens: 1200
output_tokens: 800
output_details.reasoning_tokens: 620

Aqui, output_tokens é inclusivo. Não some os 620 novamente. A resposta de 180 tokens é a parte que não corresponde ao raciocínio dos 800 tokens gerados.

Outra API poderia informar:

input_tokens: 1200
output_tokens: 180
thought_tokens: 620
total_tokens: 2000

Aqui, a saída da resposta e os tokens de pensamento são campos separados. Você deve incluir ambos ao avaliar o uso gerado. Os dois relatórios descrevem o mesmo fluxo simplificado:

1,200 input + 620 reasoning + 180 visible answer = 2,000 total tokens

Se todos os tokens gerados usarem a tarifa de saída do provedor, o cálculo de custo simplificado será:

(1,200 × input rate) + (800 × output rate)

As cobranças reais podem adicionar tarifas separadas para entrada armazenada em cache, gravações no cache, lotes, ferramentas ou outros recursos. Use o esquema de uso e as regras de preços da API, em vez de presumir que todos os campos são aditivos.

Quando cada tipo de token importa

Os tokens de entrada importam quando as solicitações carregam muito contexto.Históricos longos, documentos, definições de ferramentas e instruções repetidas podem dominar o uso, mesmo quando a mensagem mais recente do usuário é curta. As contagens de entrada também informam quanto espaço ainda resta na janela de contexto.

Os tokens de saída importam quando as respostas são longas ou geradas repetidamente.A geração ocorre passo a passo, portanto a saída geralmente tem características de desempenho e preço diferentes das da entrada. Um fluxo de trabalho que classifica um documento em um único rótulo tem um perfil de uso diferente daquele que redige um relatório.

Os tokens de raciocínio importam quando a tarefa exige trabalho interno.Uma resposta final curta pode resultar de um longo processo de raciocínio. Isso pode aumentar o custo, atrasar a resposta visível e consumir a capacidade de tokens gerados sem tornar a resposta exibida mais longa.

Para modelos de raciocínio, um limite de saída pode abranger tanto o raciocínio interno quanto a resposta visível. Se o raciocínio consumir primeiro essa margem, o modelo poderá retornar uma resposta curta ou incompleta. Consulte a documentação do endpoint antes de tratar um limite de saída como uma garantia do tamanho da resposta.

O que as pessoas confundem

Tokens de raciocínio não são entrada adicional

O modelo cria tokens de raciocínio durante a geração. Eles podem se tornar entrada em um turno posterior se o aplicativo enviar de volta o conteúdo de pensamento preservado, mas isso será uma nova solicitação com um novo limite de medição.

Tokens de raciocínio nem sempre são separados dos tokens de saída

Se um objeto de uso informa que o raciocínio é um detalhe dentro da saída, somar os dois campos resulta em uma contagem duplicada. Se ele informa os pensamentos ao lado da saída da resposta, ignorar o campo de pensamentos resulta em uma contagem inferior à real. Leia o esquema antes de fazer cálculos.

Tokens de saída nem sempre são palavras visíveis

Tokens não são o mesmo que palavras, e o uso gerado não se limita à prosa exibida. Argumentos de chamadas de ferramentas, raciocínio oculto e formatação gerenciada pelo provedor podem aumentar a diferença entre o que você vê e o que o medidor registra.

Uma resposta curta não é necessariamente uma resposta barata

O comprimento visível é apenas uma parte do uso. Uma solicitação pode ter uma entrada grande, um raciocínio interno substancial ou ambos. O registro de uso da resposta é uma base de medição melhor do que o tamanho da resposta renderizada.

O que ler em seguida

Leia O que são tokens de entrada? para entender o que os aplicativos colocam em uma solicitação. Leia O que são tokens de saída? para saber mais sobre respostas geradas e limites. Leia O que são tokens de raciocínio? para conhecer a camada de pensamento, que depende do provedor.