A empresa de avaliação comparativa de modelos de IA Artificial Analysis publicou nesta semana sua pontuação para a mais recente iteração do modelo leve V4-Flash da DeepSeek, depois que ele entrou em beta público na sexta-feira. Surpreendentemente, o modelo mais barato da desenvolvedora chinesa marcou 50 no Intelligence Index da plataforma, ficando 6 pontos acima do modelo topo de linha DeepSeek V4 Pro-Preview.
A DeepSeek também continua significativamente mais barata que os principais modelos dos EUA. Concorrentes americanos tomaram medidas para tentar diminuir essa diferença nos últimos meses, principalmente a OpenAI, que reduziu em 80% o custo de seu próprio modelo econômico apenas alguns dias após o lançamento. Ainda assim, a US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de tokens de saída, o modelo da DeepSeek continua 60% mais barato que o GPT-Luna.
Como o Flash superou o Pro-Preview em inteligência
Os registros de atualização publicados pela DeepSeek mostram que a versão mais recente do Flash tem a mesma arquitetura fundamental e o mesmo tamanho de sua iteração anterior, lançada em abril deste ano.
A variável que mudou foi o refinamento pós-treinamento. Enquanto a API do modelo topo de linha V4-Pro-Preview continua a mesma, a API do Flash passou por uma grande reformulação. O resultado são "capacidades de agente significativamente aprimoradas, com resultados em benchmarks muito superiores aos do V4-Pro-Preview."
A capacidade de agente está se tornando um benchmark cada vez mais importante para modelos de IA, refletindo sua expansão muito além dos recursos básicos de chatbot. Isso se refere à capacidade de um modelo de lidar com tarefas complexas e divididas em várias etapas, como escrever e testar código.
A empresa de avaliação comparativa de IA Artificial Analysis corroborou as descobertas da DeepSeek sobre seu modelo mais recente. Em testes independentes, o Flash subiu 17 pontos em relação ao antecessor no Terminal-Bench 2.1, um teste que mede o desempenho de um modelo ao operar uma linha de comando.
No GDPval-AA v2 — teste da Artificial Analysis sobre tarefas de trabalho do mundo real em setores como finanças, engenharia e saúde — a pontuação do modelo subiu de 1.189 para 1.559.
Essas descobertas sugerem que as capacidades agênticas do V4-Flash representam, de fato, um grande avanço.
Onde o DeepSeek V4-Flash ainda fica aquém
Embora o modelo da DeepSeek tenha apresentado melhorias significativas, ele ainda está longe de ser líder de mercado. O Claude Opus 4.8, da Anthropic, continua liderando em todos os benchmarks publicados pela própria DeepSeek, enquanto a também chinesa Moonshot continua na liderança entre os modelos de pesos abertos com seu modelo Kimi K3.
O relatório da Artificial Analysis também incluiu um alerta de que o V4-Flash apresenta uma alta taxa de alucinação, de 84%, entre as respostas incorretas. Isso significa que, nos casos em que não consegue fornecer a resposta correta, o V4-Flash geralmente prefere responder de forma incorreta a se recusar a responder. A empresa de avaliação observou que a iteração mais recente inventou respostas baseadas no melhor palpite com menos frequência que as versões anteriores, mas a taxa ainda assim continua alta.
Outra possível desvantagem é a natureza prolixa do modelo. Durante os testes, ele teria gerado cerca de 206 milhões de tokens de saída ao longo de toda a série de testes do Intelligence Index. Isso representa mais que o dobro da mediana, o que significa que os custos reais de uso do modelo podem subir além do que seus valores anunciados sugerem.
