LA MÉTHODE, SIMPLIFIÉE

Beaucoup de benchmarks.
Une image plus claire.

Nous transformons les résultats de benchmarks d’IA publiés en un score comparable unique. Pour que vous voyiez comment les modèles se situent.

Explorer les scores
DES PREUVES AU SCORE
92benchmarks dans la méthode

Sept domaines à poids égal

1The Latent Score
Plus il est élevé, meilleures sont les performances aux benchmarks.

COMMENT ÇA MARCHE

Des résultats à un classement.

  1. 01

    Partir des preuves.

    Nous collectons les résultats publiés et vérifions leurs sources, les versions des modèles et les conditions de test. Nous n’exécutons pas les benchmarks nous-mêmes.

    Voir les preuves
  2. 02

    Rendre les résultats comparables.

    Chaque benchmark compte une fois, avec son meilleur réglage de raisonnement comparable. Les tests apparentés partagent leur influence ; celle d’un même évaluateur est plafonnée.

  3. 03

    Tout rassembler.

    Sept domaines ont la même importance. Une méthode de notation fixe les combine en un seul score, avec une plage indiquant sa stabilité.

LES SEPT DOMAINES
  • Raisonnement
  • Programmation
  • Utilisation d’outils
  • Travail professionnel
  • Vision
  • Cybersécurité
  • Communication

LIRE LE CHIFFRE

Un point de référence.
Pas un test de QI.

100 est la moyenne de référence fixe.Les modèles de référence d’origine fixent l’échelle, avec un écart-type de 15. Ce n’est pas la moyenne des modèles actuels.

L’ÉCHELLE DES SCORESPlus haut, c’est mieux →
7085100Moyenne de référence115130

L’échelle peut dépasser ces valeurs.

À GARDER EN TÊTE

Un contexte utile. Des limites honnêtes.

Les scores proches demandent de la prudence.

La plage de stabilité reflète les preuves disponibles, pas une garantie de capacité réelle. De petits écarts de score ne prouvent pas un avantage significatif.

Manquant n’est pas zéro.

Les résultats manquants restent manquants. Les domaines non mesurés sont estimés, et des preuves rares ou contradictoires peuvent élargir la plage.

La capacité n’est qu’une partie.

Le prix et la vitesse restent à part. Les résultats peuvent favoriser les modèles testés dans plus de réglages. Les benchmarks ne garantissent pas les performances sur votre travail.