Les scores proches demandent de la prudence.
La plage de stabilité reflète les preuves disponibles, pas une garantie de capacité réelle. De petits écarts de score ne prouvent pas un avantage significatif.
LA MÉTHODE, SIMPLIFIÉE
Nous transformons les résultats de benchmarks d’IA publiés en un score comparable unique. Pour que vous voyiez comment les modèles se situent.
Explorer les scoresSept domaines à poids égal
COMMENT ÇA MARCHE
Nous collectons les résultats publiés et vérifions leurs sources, les versions des modèles et les conditions de test. Nous n’exécutons pas les benchmarks nous-mêmes.
Voir les preuvesChaque benchmark compte une fois, avec son meilleur réglage de raisonnement comparable. Les tests apparentés partagent leur influence ; celle d’un même évaluateur est plafonnée.
Sept domaines ont la même importance. Une méthode de notation fixe les combine en un seul score, avec une plage indiquant sa stabilité.
LIRE LE CHIFFRE
100 est la moyenne de référence fixe.Les modèles de référence d’origine fixent l’échelle, avec un écart-type de 15. Ce n’est pas la moyenne des modèles actuels.
L’échelle peut dépasser ces valeurs.
À GARDER EN TÊTE
La plage de stabilité reflète les preuves disponibles, pas une garantie de capacité réelle. De petits écarts de score ne prouvent pas un avantage significatif.
Les résultats manquants restent manquants. Les domaines non mesurés sont estimés, et des preuves rares ou contradictoires peuvent élargir la plage.
Le prix et la vitesse restent à part. Les résultats peuvent favoriser les modèles testés dans plus de réglages. Les benchmarks ne garantissent pas les performances sur votre travail.