EL MÉTODO, SIMPLIFICADO

Muchos benchmarks.
Una imagen más clara.

Convertimos los resultados de benchmarks de IA publicados en una sola puntuación comparable. Así puedes ver cómo se comparan los modelos.

Explorar las puntuaciones
DE LA EVIDENCIA A LA PUNTUACIÓN
92benchmarks en el método

Siete dominios con el mismo peso

1The Latent Score
Más alto significa mejor rendimiento en los benchmarks.

CÓMO FUNCIONA

De los resultados a un ranking.

  1. 01

    Empezar por la evidencia.

    Recopilamos resultados publicados y comprobamos sus fuentes, versiones de modelo y condiciones de prueba. No ejecutamos los benchmarks nosotros mismos.

    Ver la evidencia
  2. 02

    Hacer comparables los resultados.

    Cada benchmark cuenta una vez, con su mejor configuración de razonamiento comparable. Las pruebas relacionadas comparten influencia; la de un solo evaluador está limitada.

  3. 03

    Unirlo todo.

    Los siete dominios tienen la misma importancia. Un método de puntuación fijo los combina en una sola puntuación, con un rango que muestra su estabilidad.

LOS SIETE DOMINIOS
  • Razonamiento
  • Programación
  • Uso de herramientas
  • Trabajo profesional
  • Visión
  • Ciberseguridad
  • Comunicación

CÓMO LEER EL NÚMERO

Un punto de referencia.
No un test de CI.

100 es la media de referencia fija.Los modelos de referencia originales fijan la escala, con una desviación estándar de 15. No es la media de los modelos actuales.

LA ESCALA DE PUNTUACIÓNMás alto es mejor →
7085100Media de referencia115130

La escala puede extenderse más allá de estos valores.

TEN EN CUENTA

Contexto útil. Límites honestos.

Las puntuaciones cercanas requieren cautela.

El rango de estabilidad refleja la evidencia disponible, no una garantía de capacidad real. Las diferencias pequeñas no demuestran una ventaja significativa.

Ausente no es cero.

Los resultados que faltan siguen faltando. Los dominios no medidos se estiman, y la evidencia escasa o contradictoria puede ampliar el rango.

La capacidad es solo una parte.

El precio y la velocidad se tratan aparte. Los resultados pueden favorecer a los modelos probados en más configuraciones. Los benchmarks no garantizan el rendimiento en tu trabajo.