Como funcionam os tokens de raciocínio

Uma solicitação normal tem dois lados óbvios: os tokens que você envia e os tokens de saída que o modelo gera. Um modelo capaz de raciocinar pode dividir sua saída gerada em outra etapa funcional:

  1. Ele lê a entrada.
  2. Ele gera tokens de raciocínio para trabalhar na tarefa.
  3. Ele gera a resposta final.

Essa representação em três etapas é útil, mas não é universal. Alguns modelos podem raciocinar entre chamadas de ferramentas ou entre partes da saída visível, em vez de primeiro concluir um bloco privado e ininterrupto de raciocínio.

A palavra raciocínio descreve para que os tokens gerados estão sendo usados. Isso não significa que os demais cálculos do modelo parem, nem que modelos comuns não realizem raciocínio algum. Todo modelo executa cálculos numéricos para selecionar seu próximo token. O recurso especial aqui é que um modelo usa tokens gerados para um trabalho intermediário antes ou entre os tokens destinados ao usuário.

O treinamento pode incentivar esse comportamento. Por exemplo, o aprendizado por reforço pode recompensar respostas finais corretas e levar um modelo a desenvolver padrões gerados, como verificar um resultado, mudar de estratégia ou revisar uma etapa anterior. Portanto, mais tokens de raciocínio significam mais trabalho no momento da inferência, não mais treinamento nem uma mudança no conhecimento armazenado do modelo.

Raciocínio oculto e resumos visíveis são diferentes

“Token de raciocínio” é um termo abrangente, não um padrão compartilhado por todos os provedores.

A OpenAI informa uma contagem de tokens de raciocínio, mas não expõe o raciocínio bruto por meio de sua API. O Google pode retornar um resumo dos pensamentos e uma assinatura opaca que representa o estado do raciocínio. As interfaces e os controles da Anthropic variam conforme o modelo: alguns expõem um resumo do raciocínio, enquanto outros usam um nível de esforço adaptativo em vez de um orçamento fixo de tokens.

Isso cria três elementos distintos:

  • Tokens de raciocínio brutos: o trabalho intermediário gerado.
  • Um resumo do raciocínio: uma descrição mais curta produzida para o usuário ou desenvolvedor.
  • A resposta final: a resposta destinada a concluir a solicitação.

Um resumo não é uma transcrição de cada token de raciocínio bruto. Ocultar o rastreamento bruto também não significa que os tokens foram gratuitos ou que não existiram. Para saber o que uma solicitação utilizou, verifique os metadados de uso da API em vez de contar as palavras exibidas na tela.

Um exemplo de uso de tokens

Suponha que um relatório de uso informe:

A parte não relacionada ao raciocínio da saída gerada é:

1.186 − 1.024 = 162 tokens

A solicitação não utilizou 1.186 tokens de resposta mais 1.024 tokens de raciocínio. Os 1.024 tokens de raciocínio já estão incluídos no total de 1.186 tokens de saída.

Essa distinção explica como uma resposta concisa pode ter uma contagem de saída muito maior do que o texto visível sugere. Os nomes dos campos variam entre as APIs, mas procure uma contagem de raciocínio ou pensamento aninhada nos detalhes de uso da resposta.

Por que os tokens de raciocínio são importantes

Custo

Os principais provedores geralmente cobram tokens de raciocínio ou pensamento como saída gerada. Portanto, uma resposta final curta pode custar mais do que você estimaria com base apenas no seu tamanho visível. As tarifas e regras de contabilização atuais são específicas de cada provedor; para calcular o custo real, consulte a documentação de preços e uso do provedor.

Limites de saída e de contexto

O raciocínio precisa de espaço. É comum que os provedores contabilizem tokens de raciocínio no limite de saída, no orçamento de contexto ou em ambos. Se o limite de geração for esgotado durante o raciocínio, uma solicitação poderá terminar antes de produzir uma resposta visível útil.

É por isso que uma configuração de saída máxima nem sempre pode ser tratada como “comprimento máximo da resposta”. Ela talvez precise abranger tanto o raciocínio intermediário quanto a resposta final. A regra exata varia conforme a API.

Tempo de resposta

Tokens de raciocínio são trabalho gerado. Em geral, quanto mais tokens houver, mais geração sequencial será necessária antes que a solicitação termine, o que pode aumentar a latência. Portanto, configurações de esforço e orçamentos de tokens controlam um equilíbrio entre qualidade, tempo e custo — não são simplesmente configurações de estilo.

Qualidade da tarefa

O raciocínio adicional é mais útil quando a tarefa se beneficia de um trabalho intermediário: matemática em várias etapas, depuração de código, planejamento, verificação de restrições ou fluxos de trabalho baseados em ferramentas. Tarefas simples de extração ou formatação podem obter pouco benefício.

Mais não é automaticamente melhor. Um modelo pode gastar muitos tokens em um caminho improdutivo e ainda assim estar errado. Avalie o resultado final com base na tarefa que importa para você, em vez de tratar a contagem de tokens de raciocínio como uma pontuação de qualidade.

Equívocos comuns

“Tokens de raciocínio são os pensamentos privados do modelo”

Essa frase é conveniente, mas literal demais. Tokens de raciocínio são sequências intermediárias geradas pelo modelo. Elas podem se assemelhar à resolução escrita de problemas, mas sua existência não comprova pensamento, compreensão ou autoconsciência semelhantes às humanas.

“Se consigo ver o raciocínio, estou vendo os tokens brutos”

Não necessariamente. Um produto pode mostrar um resumo ou uma explicação filtrada. A documentação do provedor distingue essas exibições do rastreamento interno completo usado para a contabilização.

“Uma resposta de 500 tokens usa 500 tokens de saída”

Somente se não houver outros tokens gerados contabilizados na saída. Com o raciocínio habilitado, o total de uso também pode incluir o raciocínio oculto, além da resposta.

“O orçamento me informa exatamente quantos tokens o modelo usará”

Isso depende do provedor e do modelo. Uma configuração pode ser um máximo rígido, uma meta ou um nível de esforço. Alguns modelos adaptam a quantidade de raciocínio à tarefa. Trate a contagem de uso retornada como a medição e a configuração da solicitação como um controle.

Próximos passos

Leia O que são tokens de saída? para entender a categoria de contabilização mais ampla que geralmente contém tokens de raciocínio. Em seguida, use Tokens de entrada vs. saída vs. raciocínio quando precisar comparar as três categorias em uma única solicitação.