A indústria de IA passou a primeira metade de 2026 discutindo qual modelo era o mais inteligente. Seus maiores clientes têm feito uma pergunta mais restrita, aquela que aparece em suas faturas: quanto custa uma unidade dessa inteligência?

A OpenAI respondeu parte disso na quinta-feira, cortando o preço do GPT-5.6 Luna, o modelo mais rápido e de menor custo de sua família mais recente, em cerca de 80%. Luna agora custa US$ 0,20 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. O modelo intermediário, GPT-5.6 Terra, cai 20%, para US$ 2 e US$ 12. O carro-chefe, GPT-5.6 Sol, permanece inalterado em US$ 5 e US$ 30. Os cortes chegam três semanas após a família se tornar amplamente disponível em 9 de julho.

A rapidez é o que torna isso incomum. Ina Fried, que reportou as reduções para o Axios, destacou que descontos como esses normalmente chegam meses após o lançamento de um modelo, e não semanas.

Tokens são a unidade de cobrança para modelos de IA, cada um equivalendo a cerca de três quartos de uma palavra. Tokens de entrada são o que você envia; tokens de saída são o que o modelo devolve por escrito. Uma única tarefa automatizada de programação pode empurrar milhões de tokens por uma interface em uma tarde. Essa é a pressão por trás das notícias de preços dos últimos meses, já que OpenAI e Anthropic ambas reformularam tarifas, limites de taxa e políticas de uso enquanto modelos de raciocínio mais novos consomem muito mais tokens em tarefas de longa duração do que seus antecessores.

OpenAI diz que seu próprio modelo ajudou a reduzir o custo de operá-lo

Na quarta-feira, um dia antes da mudança de preço, a OpenAI publicou um post de engenharia explicando de onde vieram as economias. Até agora, o custo de servir um modelo grande caía principalmente por meio de duas alavancas: hardware melhor e engenheiros humanos ajustando manualmente o software que roda nele. A alegação da OpenAI é que uma terceira alavanca foi aberta.

A empresa escreve que, trabalhando dentro de sua ferramenta de programação Codex, "o GPT-5.6 Sol reescreveu e otimizou de forma autônoma nossos kernels de produção". Kernels são o código de baixo nível que executa as operações matemáticas de um modelo em um chip gráfico. A OpenAI diz que esse trabalho, combinado com mudanças relacionadas, reduziu os custos de operação de ponta a ponta em 20%.

Para um leitor de fora da área, o significado não está na engenharia. Está no ciclo. Se um modelo de fronteira pode reduzir de forma significativa o custo de operar modelos de fronteira, a curva de preços se acentua sozinha, sem esperar pela próxima geração de chips. Essa é uma história econômica diferente da contada pelos US$ 700 bilhões em gastos de infraestrutura anunciados para 2026.

Luna é mais barato, mas não é o mais barato

Mesmo após um corte de 80%, Luna não fica abaixo do piso do mercado. DeepSeek V4 Flash, um modelo chinês de pesos abertos, custa US$ 0,14 de entrada e US$ 0,28 de saída. O Gemini 2.5 Flash-Lite, do Google, fica em US$ 0,10 e US$ 0,40. O preço de saída do Luna continua sendo mais de 4x o do DeepSeek, e é na saída que a maioria das cargas de trabalho de agentes gasta dinheiro.

Os novos US$ 2 e US$ 12 do Terra ficam exatamente em as tarifas publicadas do Gemini 3.1 Pro, o que dificilmente é coincidência. A Anthropic, por sua vez, está oferecendo Claude Sonnet 5 por US$ 2 e US$ 10 em promoção até 31 de agosto, voltando a US$ 3 e US$ 15 em 1º de setembro. As faixas barata e intermediária estão convergindo para os mesmos números. A faixa principal, não.

Os números que a OpenAI não publicou

A melhora de 20% no custo de operação é uma medição de produção da própria OpenAI. Nenhuma parte externa a auditou, e a empresa não divulgou a margem bruta em inferência em nenhuma faixa, portanto não há forma pública de saber se Luna é lucrativo a US$ 0,20 ou se está sendo precificado para manter participação contra rivais de pesos abertos mais baratos.

Vários detalhes também jogam contra o número de manchete. As três faixas do GPT-5.6 têm um medidor de contexto longo que aproximadamente dobra as tarifas quando uma solicitação excede a janela padrão. Escrever novo conteúdo no cache de prompt custa 1,25x o preço de entrada sem cache, embora ler a partir dele renda um desconto de 90%. E Sol, o modelo com maior probabilidade de estar lidando com as caras execuções de agentes de várias horas que motivaram as reclamações sobre preços em primeiro lugar, não recebeu nada.

O que a OpenAI demonstrou é um piso que continua caindo e um teto que não se move. Inteligência barata está ficando mais barata em um cronograma agora medido em semanas. Inteligência de fronteira ainda custa US$ 30 por milhão de palavras que escreve, e a empresa acabou de recusar a chance de mudar isso.