Pontuações próximas pedem cuidado.
O intervalo de estabilidade reflete as evidências disponíveis, não uma garantia de capacidade real. Pequenas diferenças não provam uma vantagem significativa.
O MÉTODO, SIMPLIFICADO
Transformamos resultados de benchmarks de IA publicados em uma única pontuação comparável. Assim você vê como os modelos se comparam.
Explorar as pontuaçõesSete domínios com peso igual
COMO FUNCIONA
Coletamos resultados publicados e verificamos suas fontes, versões de modelo e configurações de teste. Não executamos os benchmarks nós mesmos.
Ver as evidênciasCada benchmark conta uma vez, usando sua melhor configuração de raciocínio comparável. Testes relacionados compartilham influência; a influência de um único avaliador é limitada.
Sete domínios têm a mesma importância. Um método de pontuação fixo os combina em uma única pontuação, com um intervalo que mostra sua estabilidade.
LENDO O NÚMERO
100 é a média de referência fixa.Os modelos de referência originais definem a escala, com desvio padrão de 15. Não é a média dos modelos atuais.
A escala pode ir além desses valores.
TENHA EM MENTE
O intervalo de estabilidade reflete as evidências disponíveis, não uma garantia de capacidade real. Pequenas diferenças não provam uma vantagem significativa.
Resultados ausentes continuam ausentes. Domínios não medidos são estimados, e evidências escassas ou conflitantes podem ampliar o intervalo.
Preço e velocidade ficam separados. Os resultados podem favorecer modelos testados em mais configurações. Benchmarks não garantem desempenho no seu trabalho.