A DeepSeek colocou a versão oficial de seu modelo V4-Flash em beta público na sexta-feira, e testes independentes rapidamente confirmaram algo incomum: o modelo pequeno e barato do laboratório chinês agora supera em pontuação seu próprio carro-chefe. A empresa de benchmarking Artificial Analysis deu à atualização, rotulada DeepSeek-V4-Flash-0731, uma pontuação de 50 em seu Intelligence Index, um salto de 10 pontos em relação à versão lançada em abril de 2026 e 6 pontos à frente do DeepSeek V4 Pro, maior e muito mais caro.
O momento aumenta a pressão. O lançamento ocorreu um dia depois de a OpenAI cortar o preço do GPT-5.6 Luna, seu modelo de fronteira econômico, em 80% sob pressão de clientes preocupados com custos. Mesmo após esse corte, a Artificial Analysis estima que o novo modelo da DeepSeek fica apenas 1 ponto atrás do Luna em inteligência, enquanto custa cerca de 60% menos por tarefa na própria API da DeepSeek.
A camada econômica alcança o carro-chefe
Quando a DeepSeek lançou sua linha V4 em abril, seguiu a lógica padrão de dois níveis do setor: Pro, um modelo com 1.6T parâmetros, para capacidade máxima, e Flash para velocidade e baixo custo. Três meses depois, essa hierarquia se inverteu, ao menos temporariamente. A API do V4 Pro e os modelos por trás do app de consumo da DeepSeek não mudaram; apenas a API Flash recebeu a atualização.
A própria empresa é direta ao descrever o que mudou. Seu registro de atualização afirma que a versão "melhorou significativamente as capacidades de agente, com resultados de benchmark muito acima do V4-Pro-Preview." Tarefas de agente são trabalhos que um modelo conclui sozinho ao longo de muitas etapas, operando um terminal, editando código e chamando outros softwares, em vez de responder a uma única pergunta. Essa é a categoria em que o setor atualmente acredita estar o dinheiro, razão pela qual um modelo econômico superar uma prévia carro-chefe nisso é mais do que uma curiosidade de ranking.
Tão impressionante quanto isso é o que não mudou. O modelo mantém exatamente a arquitetura e o tamanho da versão de abril: 284B parâmetros totais, as configurações internas que armazenam o que um modelo sabe, com apenas 13B ativos para qualquer palavra, o que mantém baixos os custos de execução. A DeepSeek diz que os ganhos vieram inteiramente do pós-treinamento, a etapa de refinamento aplicada depois que o conhecimento central de um modelo é construído. O preço permanece inalterado em $0.14 por 1M tokens de entrada e $0.28 por 1M tokens de saída, e a DeepSeek desconta em 98% a entrada em cache, texto que o sistema já processou, contra os 90% oferecidos pela maioria dos rivais.
Números independentes sustentam a alegação sobre agentes. No GDPval-AA v2, teste da Artificial Analysis de tarefas de trabalho no mundo real, a classificação do modelo subiu para 1559, ante 1189, e o Terminal-Bench 2.1, que mede quão bem um modelo opera uma linha de comando, subiu 17 pontos, para 79% nos testes da empresa.
O que a pontuação não resolve
O modelo ainda inventa respostas em uma taxa alta. No teste de conhecimento da Artificial Analysis, quando não sabe algo, ele fabrica uma resposta 84% das vezes. Isso é 12 pontos melhor do que seu antecessor, mas toda a melhora veio de recusar-se a chutar com mais frequência; a parcela de perguntas que ele realmente acerta não mudou.
Ele também é verboso. O modelo produziu cerca de 206M tokens de saída para concluir o Intelligence Index, 12% menos do que a versão de abril, mas ainda algo em torno do dobro da mediana de modelos comparáveis. Em longos loops de agente, isso significa que as contas reais ficam significativamente mais altas do que o preço baixíssimo por token sugere.
E o teto ainda não foi alcançado. O Claude Opus 4.8 da Anthropic ainda lidera em todos os benchmarks que a própria DeepSeek publicou, e entre os modelos abertos o Kimi K3 segue 7 pontos à frente no índice. O modelo lida apenas com texto, sem imagens, e seus pesos, os arquivos que permitiriam a qualquer um executá-lo por conta própria, são esperados, mas ainda não foram lançados, então por enquanto ele existe apenas como uma API paga.
A DeepSeek diz que a versão oficial do V4-Pro "virá em breve." Se apenas uma etapa de pós-treinamento elevou o modelo pequeno em 10 pontos, a questão em aberto é o que o mesmo tratamento fará com um modelo quase 6 vezes maior. O preço de uma inteligência próxima à fronteira caiu duas vezes nesta semana. Apenas uma dessas quedas exigiu mexer em uma tabela de preços.
