Artificial Analysis, une entreprise spécialisée dans l’évaluation comparative des modèles d’IA, a publié cette semaine le score de la dernière version du modèle léger V4-Flash de DeepSeek, après son lancement public en bêta vendredi. Étonnamment, le modèle le moins cher du développeur chinois a obtenu un score de 50 sur l’Intelligence Index de la plateforme, soit 6 points de plus que son modèle phare DeepSeek V4 Pro-Preview.

DeepSeek reste également nettement moins cher que les principaux modèles américains. Les concurrents américains ont pris des mesures ces derniers mois pour tenter de réduire cet écart, notamment OpenAI, qui a abaissé de 80 % le coût de son propre modèle d’entrée de gamme quelques jours seulement après sa sortie. Quoi qu’il en soit, à $0.14 par million de jetons d’entrée et $0.28 par million de jetons de sortie, le modèle de DeepSeek reste 60 % moins cher que GPT-Luna.

Comment Flash a dépassé Pro-Preview en intelligence

Les journaux de mise à jour publiés par DeepSeek montrent que la dernière version de Flash conserve la même architecture fondamentale et la même taille que la version précédente, lancée en avril cette année.

La variable qui a changé est le perfectionnement post-entraînement. Alors que l’API phare V4-Pro-Preview reste inchangée, l’API Flash a bénéficié d’une refonte majeure. Le résultat est constitué de « capacités agentiques considérablement renforcées, avec des résultats aux tests largement supérieurs à ceux du V4-Pro-Preview ».

Les capacités agentiques deviennent une référence de plus en plus importante pour les modèles d’IA, reflétant leur développement bien au-delà des capacités de base des chatbots. Il s’agit de la capacité d’un modèle à s’attaquer à des tâches complexes en plusieurs étapes, comme écrire et tester du code.

Artificial Analysis, spécialisée dans l’évaluation comparative des modèles d’IA, a confirmé les conclusions de DeepSeek concernant son dernier modèle. Lors de tests indépendants, Flash a gagné 17 points sur son prédécesseur dans Terminal-Bench 2.1, un test qui mesure la capacité d’un modèle à utiliser une ligne de commande.

Dans GDPval-AA v2 — le test d’Artificial Analysis portant sur des tâches professionnelles du monde réel dans des secteurs comme la finance, l’ingénierie et la santé — la note du modèle est passée de 1,189 à 1,559.

Ces résultats suggèrent que les capacités agentiques du V4-Flash représentent véritablement une avancée majeure.

Les points faibles persistants de DeepSeek V4-Flash

Bien que le modèle de DeepSeek ait enregistré des améliorations notables, il reste encore loin d’être un leader du marché. Le Claude Opus 4.8 d’Anthropic reste en tête sur tous les tests publiés par DeepSeek elle-même, tandis que Moonshot, un autre développeur chinois, reste en tête parmi les modèles à poids ouverts avec son modèle Kimi K3.

Le rapport d’Artificial Analysis comprenait un avertissement : le V4-Flash affiche également un taux élevé d’hallucinations, de 84 %, parmi les réponses incorrectes. Cela signifie que lorsqu’il ne peut pas fournir la bonne réponse, le V4-Flash préfère généralement répondre de manière incorrecte plutôt que de s’abstenir. L’entreprise spécialisée dans l’évaluation comparative a noté que la dernière version inventait des réponses fondées sur sa meilleure estimation à un taux inférieur à celui des versions précédentes, mais ce taux reste néanmoins élevé.

Un autre inconvénient potentiel est la tendance du modèle à être verbeux. Lors des tests, il aurait généré environ 206 millions de jetons de sortie sur l’ensemble de la série de tests de l’Intelligence Index. C’est plus du double de la médiane, ce qui signifie que les coûts réels d’utilisation du modèle peuvent être supérieurs aux tarifs affichés.