DeepSeek a fait passer la version officielle de son modèle V4-Flash en bêta publique vendredi, et des tests indépendants ont rapidement confirmé quelque chose d'inhabituel : le petit modèle chinois, bon marché, du laboratoire surpasse désormais son propre vaisseau amiral. La société de benchmarking Artificial Analysis a attribué à cette mise à jour, baptisée DeepSeek-V4-Flash-0731, un score de 50 sur son Intelligence Index, soit un bond de 10 points par rapport à la version publiée en avril 2026 et 6 points de plus que le DeepSeek V4 Pro, plus grand et bien plus coûteux.
Le timing renforce l'enjeu. La sortie est intervenue un jour après qu'OpenAI a réduit le prix de GPT-5.6 Luna, son modèle frontier économique, de 80% sous la pression de clients attentifs aux coûts. Même après cette baisse, Artificial Analysis estime que le nouveau modèle de DeepSeek se situe à seulement 1 point derrière Luna en intelligence tout en coûtant environ 60% de moins par tâche sur l'API de DeepSeek.
L'entrée de gamme rattrape le vaisseau amiral
Quand DeepSeek a lancé sa gamme V4 en avril, il a suivi la logique standard à deux niveaux du secteur : Pro, un modèle de 1.6T paramètres, pour la capacité maximale, et Flash pour la vitesse et le faible coût. Trois mois plus tard, cette hiérarchie s'est inversée, au moins temporairement. L'API V4 Pro et les modèles derrière l'application grand public de DeepSeek n'ont pas changé ; seule l'API Flash a reçu la mise à niveau.
La manière dont l'entreprise présente elle-même ce qui a changé est directe. Son journal des mises à jour indique que la publication a « considérablement renforcé les capacités d'agent, avec des résultats de benchmark dépassant largement V4-Pro-Preview ». Les tâches d'agent sont des travaux qu'un modèle accomplit seul en de nombreuses étapes, en utilisant un terminal, en modifiant du code et en appelant d'autres logiciels, plutôt qu'en répondant à une seule question. C'est la catégorie dans laquelle le secteur pense actuellement que se trouve l'argent, ce qui explique qu'un modèle économique surpassant un aperçu du vaisseau amiral sur ces tâches soit plus qu'une simple curiosité de classement.
Tout aussi frappant est ce qui n'a pas changé. Le modèle conserve exactement l'architecture et la taille de la version d'avril : 284B paramètres au total, les réglages internes qui stockent ce qu'un modèle sait, avec seulement 13B actifs pour chaque mot donné, ce qui maintient les coûts d'exécution à un niveau bas. DeepSeek affirme que les gains proviennent entièrement du post-entraînement, l'étape de raffinement appliquée après la construction des connaissances de base d'un modèle. Les prix restent inchangés à 0.14 $ par 1M de tokens en entrée et 0.28 $ par 1M de tokens en sortie, et DeepSeek applique une remise de 98% sur les entrées mises en cache, du texte que le système a déjà traité, contre 90% chez la plupart des concurrents.
Des chiffres indépendants étayent l'affirmation sur les agents. Sur GDPval-AA v2, le test d'Artificial Analysis portant sur des tâches de travail réelles, l'évaluation du modèle est passée de 1189 à 1559, et Terminal-Bench 2.1, qui mesure dans quelle mesure un modèle utilise une ligne de commande, a grimpé de 17 points à 79% dans les tests de la société.
Ce que le score ne tranche pas
Le modèle invente encore des réponses à un rythme élevé. Dans le test de connaissances d'Artificial Analysis, lorsqu'il ne sait pas quelque chose, il fabrique une réponse 84% du temps. C'est 12 points de mieux que son prédécesseur, mais l'intégralité de l'amélioration provient du fait qu'il refuse plus souvent de deviner ; la part des questions auxquelles il répond effectivement correctement n'a pas bougé.
Il est aussi verbeux. Le modèle a produit environ 206M de tokens en sortie pour compléter l'Intelligence Index, soit 12% de moins que la version d'avril mais encore environ le double de la médiane des modèles comparables. Dans de longues boucles d'agent, cela signifie que les factures réelles sont sensiblement plus élevées que ne le laisse penser le prix plancher par token.
Et le plafond n'a pas encore été atteint. Claude Opus 4.8 d'Anthropic reste en tête sur tous les benchmarks publiés par DeepSeek lui-même, et parmi les modèles ouverts, Kimi K3 conserve 7 points d'avance sur l'index. Le modèle ne gère que le texte, sans images, et ses pondérations, les fichiers qui permettraient à n'importe qui de l'exécuter lui-même, sont attendues mais pas encore publiés, donc pour l'instant il n'existe que comme API payante.
DeepSeek affirme que la version officielle de V4-Pro « suivra bientôt ». Si un simple passage de post-entraînement a à lui seul fait gagner 10 points au petit modèle, la question ouverte est de savoir ce que le même traitement peut apporter à un modèle presque 6 fois plus grand. Le prix d'une intelligence proche de la frontière a baissé deux fois cette semaine. Une seule de ces baisses a nécessité de toucher à une grille tarifaire.
