방법론, 간단하게

많은 벤치마크.
더 선명한 하나의 그림.

공개된 AI 벤치마크 결과를 하나의 비교 가능한 점수로 바꿉니다. 모델들이 어떻게 견주어지는지 볼 수 있도록.

점수 살펴보기
근거에서 점수로
92개의 벤치마크가 방법론에 포함

동일한 가중치의 일곱 영역

1The Latent Score
높을수록 벤치마크 성능이 강합니다.

작동 방식

결과에서 순위로.

  1. 01

    근거에서 출발합니다.

    공개된 결과를 수집하고 출처, 모델 버전, 테스트 설정을 확인합니다. 벤치마크를 직접 실행하지는 않습니다.

    근거 보기
  2. 02

    결과를 비교 가능하게 만듭니다.

    각 벤치마크는 비교 가능한 최상의 추론 설정으로 한 번만 계산됩니다. 관련 테스트는 영향력을 나누고, 한 평가 기관의 영향력에는 상한이 있습니다.

  3. 03

    모두 합칩니다.

    일곱 영역은 동일한 중요도를 갖습니다. 고정된 채점 방식이 이를 하나의 점수로 합치고, 안정성을 보여주는 범위를 함께 제시합니다.

일곱 영역
  • 추론
  • 코딩
  • 도구 사용
  • 전문 업무
  • 시각
  • 사이버보안
  • 커뮤니케이션

숫자 읽는 법

기준점입니다.
IQ 테스트가 아닙니다.

100은 고정된 기준 평균입니다.최초의 기준 모델들이 표준편차 15로 척도를 정했습니다. 오늘날 모델들의 평균이 아닙니다.

점수 척도높을수록 좋음 →
7085100기준 평균115130

척도는 이 값들을 넘어 확장될 수 있습니다.

유의 사항

유용한 맥락. 솔직한 한계.

근소한 점수 차는 신중하게.

안정성 범위는 가용한 근거를 반영할 뿐 실제 능력을 보장하지 않습니다. 작은 점수 차이는 의미 있는 우위를 증명하지 않습니다.

누락은 0이 아닙니다.

누락된 테스트 결과는 누락된 채로 남습니다. 측정되지 않은 영역은 추정되며, 드물거나 상충하는 근거는 범위를 넓힐 수 있습니다.

역량은 일부일 뿐입니다.

가격과 속도는 별도로 다룹니다. 결과는 더 많은 설정에서 테스트된 모델에 유리할 수 있습니다. 벤치마크는 여러분의 업무에서의 성능을 보장하지 않습니다.