方法を、シンプルに

多くのベンチマーク。
より明快なひとつの像。

公開されたAIベンチマークの結果を、ひとつの比較可能なスコアに変換します。モデルの位置づけが見えるように。

スコアを見る
エビデンスからスコアへ
92件のベンチマークが方法に含まれる

等しく重み付けされた7つの領域

1The Latent Score
高いほどベンチマーク性能が強いことを意味します。

仕組み

結果からランキングへ。

  1. 01

    エビデンスから始める。

    公開された結果を収集し、出典、モデルのバージョン、テスト設定を確認します。ベンチマークを自ら実行することはありません。

    エビデンスを見る
  2. 02

    結果を比較可能にする。

    各ベンチマークは、比較可能な最良の推論設定で一度だけ数えます。関連するテストは影響力を分け合い、ひとつの評価者の影響力には上限があります。

  3. 03

    すべてをまとめる。

    7つの領域は同じ重要度を持ちます。固定されたスコアリング方法がそれらをひとつのスコアにまとめ、安定性を示す範囲を添えます。

7つの領域
  • 推論
  • コーディング
  • ツール利用
  • 専門業務
  • 視覚
  • サイバーセキュリティ
  • コミュニケーション

数字の読み方

基準点であって、
IQテストではない。

100 は固定された基準平均です。当初の基準モデルが標準偏差15でスケールを定めました。今日のモデルの平均ではありません。

スコアのスケール高いほど良い →
7085100基準平均115130

スケールはこれらの値を超えて広がることがあります。

留意点

役立つ文脈。正直な限界。

僅差のスコアには注意。

安定性の範囲は利用可能なエビデンスを反映するもので、真の能力を保証するものではありません。小さなスコア差は意味のある優位を証明しません。

欠測はゼロではない。

欠けているテスト結果は欠けたままです。測定されていない領域は推定され、少ない、あるいは矛盾するエビデンスは範囲を広げることがあります。

能力は一要素にすぎない。

価格と速度は別に扱います。結果は、より多くの設定でテストされたモデルに有利になることがあります。ベンチマークはあなたの業務での性能を保証しません。