Na sexta-feira, a DeepSeek lançou um modelo de visão experimental que, segundo a startup chinesa de IA, aproxima seu desempenho multimodal de agentes do Opus-4.8 da Anthropic em benchmarks de agentes.
O modelo, DeepSeek-V4-Flash-Vision-Exp, já está disponível por meio da DeepSeek API Platform, disse a empresa em um anúncio. O modelo iguala o V4 Flash em capacidades de texto, incluindo agentes, raciocínio e conhecimento de mundo, ao mesmo tempo que adiciona entradas de imagem, acrescentou.
A empresa afirmou que o novo modelo deu um “grande salto” em relação ao V4 Flash em benchmarks de agentes multimodais, aproximando seu desempenho do Opus-4.8. A DeepSeek não forneceu pontuações de benchmark em seu anúncio.
Vale destacar que o modelo pode analisar imagens junto com texto, incluindo descrever fotos, ler texto de capturas de tela e analisar gráficos. Ele oferece suporte a imagens JPEG, PNG, GIF e WebP.
A DeepSeek disse que o V4 Flash Vision oferece suporte às APIs Chat Completions, Messages e Responses. As imagens podem ser aceitas por meio de dados base64, URLs externas ou de sua recém-lançada Files API.
As imagens são tokenizadas para fins de cobrança, com cada imagem consumindo até 384 tokens nos preços do V4 Flash. O modelo pode processar até 600 imagens em uma única solicitação, enquanto imagens individuais podem ter até 32 megabytes por meio de base64 ou URLs externas e 64 megabytes quando referenciadas por meio da Files API.
A Files API permite que os usuários enviem uma imagem uma única vez e a referenciem por meio de um ID de arquivo em várias solicitações. A DeepSeek disse que o serviço é gratuito e também pode reduzir a largura de banda quando a mesma imagem é reutilizada.
O lançamento ocorre enquanto a DeepSeek retomou sua segunda rodada de financiamento, buscando perto de US$ 8 bilhões, com a Monolith Management em negociações para participar, informou a Bloomberg no início deste mês. A empresa busca uma avaliação próxima de 500 bilhões de yuans (US$ 74,3 bilhões).
