DeepSeek a lancé son modèle V4.1-Flash jeudi, introduisant une architecture de mélange d’experts de 552B paramètres, avec 8B paramètres actifs pour l’entrée et 16B pour la sortie.

Selon une déclaration, le modèle utilise une nouvelle architecture Causal Encoder-Decoder et prend en charge les entrées multimodales natives, notamment la compréhension visuelle. DeepSeek a déclaré que V4.1-Flash était le plus petit modèle de sa nouvelle famille d’architectures.

L’entreprise a souligné que le modèle se distingue notamment par une empreinte réduite de son cache KV, ajoutant que V4.1-Flash nécessite un quart de la HBM et un huitième du stockage SSD utilisés par la génération précédente.

Selon l’entreprise, la réduction du cache diminue les besoins de stockage pour les charges de travail agentiques, où les coûts liés aux accès au cache peuvent représenter une part importante des coûts d’utilisation globaux.

V4.1-Flash est désormais disponible via l’API de DeepSeek, tandis que les anciens modèles V4-Flash et V4-Flash-Vision-Exp ont été arrêtés. Leurs noms d’API achemineront temporairement les requêtes vers V4.1-Flash pour assurer la compatibilité.

Fait notable, V4.1-Flash a dépassé V4-Pro en matière de performances, de coût, de vitesse et de durée d’exécution totale lors de tests menés par plusieurs parties, et l’entreprise abandonne donc progressivement ce dernier.

À partir de la semaine prochaine, le 14 sept. à 04:00 UTC, DeepSeek acheminera vers V4.1-Flash toutes les requêtes adressées à V4 Pro, qui seront facturées aux tarifs du dernier modèle. Cette disposition restera en vigueur jusqu’au lancement de V4.1-Pro par DeepSeek, selon la déclaration.

L’entreprise a ajusté la tarification de l’API de V4.1-Flash, les tarifs en heures creuses étant fixés à la moitié du prix en heures de pointe. La nouvelle tarification est entrée en vigueur à 04:00 UTC le 10 sept. Tencent's WorkBuddy et CodeBuddy, ainsi qu’OpenCode, prennent désormais en charge le modèle.