僅差のスコアには注意。
安定性の範囲は利用可能なエビデンスを反映するもので、真の能力を保証するものではありません。小さなスコア差は意味のある優位を証明しません。
等しく重み付けされた7つの領域
仕組み
公開された結果を収集し、出典、モデルのバージョン、テスト設定を確認します。ベンチマークを自ら実行することはありません。
エビデンスを見る各ベンチマークは、比較可能な最良の推論設定で一度だけ数えます。関連するテストは影響力を分け合い、ひとつの評価者の影響力には上限があります。
7つの領域は同じ重要度を持ちます。固定されたスコアリング方法がそれらをひとつのスコアにまとめ、安定性を示す範囲を添えます。
数字の読み方
100 は固定された基準平均です。当初の基準モデルが標準偏差15でスケールを定めました。今日のモデルの平均ではありません。
スケールはこれらの値を超えて広がることがあります。
留意点
安定性の範囲は利用可能なエビデンスを反映するもので、真の能力を保証するものではありません。小さなスコア差は意味のある優位を証明しません。
欠けているテスト結果は欠けたままです。測定されていない領域は推定され、少ない、あるいは矛盾するエビデンスは範囲を広げることがあります。
価格と速度は別に扱います。結果は、より多くの設定でテストされたモデルに有利になることがあります。ベンチマークはあなたの業務での性能を保証しません。