A DeepSeek lançou seu modelo V4.1-Flash na quinta-feira, introduzindo uma arquitetura de mistura de especialistas com 552B de parâmetros, sendo 8B de parâmetros ativos para entrada e 16B para saída.

O modelo usa uma nova arquitetura Causal Encoder-Decoder e oferece suporte nativo a entradas multimodais, incluindo compreensão visual, de acordo com um comunicado. A DeepSeek afirmou que o V4.1-Flash é o menor modelo de sua nova família de arquiteturas.

Uma mudança importante é a redução da utilização do cache KV pelo modelo, observou a empresa, acrescentando que o V4.1-Flash requer um quarto da HBM e um oitavo do armazenamento SSD usados pela geração anterior.

Segundo a empresa, o cache menor reduz as necessidades de armazenamento para cargas de trabalho agênticas, nas quais os custos de acertos de cache podem representar uma parcela significativa dos custos gerais de uso.

O V4.1-Flash já está disponível por meio da API da DeepSeek, enquanto os modelos antigos V4-Flash e V4-Flash-Vision-Exp foram descontinuados. Seus nomes de API encaminharão temporariamente as solicitações para o V4.1-Flash por motivos de compatibilidade.

Vale destacar que o V4.1-Flash superou o V4-Pro em desempenho, custo, velocidade e tempo total de execução em testes realizados por várias partes, e a empresa está, portanto, eliminando gradualmente o último.

A partir da próxima semana, em 14 de setembro, às 04:00 UTC, todas as solicitações feitas ao V4 Pro serão encaminhadas pela DeepSeek ao V4.1-Flash e cobradas de acordo com as tarifas do modelo mais recente. O acordo permanecerá em vigor até que a DeepSeek lance o V4.1-Pro, segundo o comunicado.

A empresa ajustou os preços da API do V4.1-Flash, com tarifas fora do horário de pico definidas em metade do preço de pico. A nova tabela de preços entrou em vigor às 04:00 UTC de 10 de setembro. O WorkBuddy e o CodeBuddy, da Tencent, juntamente com o OpenCode, agora oferecem suporte ao modelo.