Las puntuaciones cercanas requieren cautela.
El rango de estabilidad refleja la evidencia disponible, no una garantía de capacidad real. Las diferencias pequeñas no demuestran una ventaja significativa.
EL MÉTODO, SIMPLIFICADO
Convertimos los resultados de benchmarks de IA publicados en una sola puntuación comparable. Así puedes ver cómo se comparan los modelos.
Explorar las puntuacionesSiete dominios con el mismo peso
CÓMO FUNCIONA
Recopilamos resultados publicados y comprobamos sus fuentes, versiones de modelo y condiciones de prueba. No ejecutamos los benchmarks nosotros mismos.
Ver la evidenciaCada benchmark cuenta una vez, con su mejor configuración de razonamiento comparable. Las pruebas relacionadas comparten influencia; la de un solo evaluador está limitada.
Los siete dominios tienen la misma importancia. Un método de puntuación fijo los combina en una sola puntuación, con un rango que muestra su estabilidad.
CÓMO LEER EL NÚMERO
100 es la media de referencia fija.Los modelos de referencia originales fijan la escala, con una desviación estándar de 15. No es la media de los modelos actuales.
La escala puede extenderse más allá de estos valores.
TEN EN CUENTA
El rango de estabilidad refleja la evidencia disponible, no una garantía de capacidad real. Las diferencias pequeñas no demuestran una ventaja significativa.
Los resultados que faltan siguen faltando. Los dominios no medidos se estiman, y la evidencia escasa o contradictoria puede ampliar el rango.
El precio y la velocidad se tratan aparte. Los resultados pueden favorecer a los modelos probados en más configuraciones. Los benchmarks no garantizan el rendimiento en tu trabajo.