方法,化繁为简

众多基准测试。
一幅更清晰的图景。

我们把已发布的 AI 基准测试结果转化为一个可比较的分数,让您看清各模型的高下。

查看分数
从证据到分数
92项方法中的基准测试

七个权重相同的领域

1The Latent Score
分数越高,基准测试表现越强。

运作方式

从结果到排名。

  1. 01

    从证据出发。

    我们收集已发布的结果,核查其来源、模型版本和测试设置。我们不自行运行基准测试。

    查看证据
  2. 02

    让结果可比较。

    每项基准测试只计一次,采用其最佳的可比推理设置。相关测试共享影响力;单一评测方的影响力设有上限。

  3. 03

    汇总起来。

    七个领域同等重要。固定的评分方法把它们合成一个分数,并附上显示其稳定性的区间。

七个领域
  • 推理
  • 编程
  • 工具使用
  • 专业工作
  • 视觉
  • 网络安全
  • 沟通

如何解读数字

一个参考点。
不是智商测试。

100 是固定的参考平均值。最初的参考模型确定了量表,标准差为 15。它不是当今模型的平均值。

分数量表越高越好 →
7085100参考平均值115130

量表可以延伸到这些数值之外。

请注意

有用的背景。诚实的局限。

接近的分数需要谨慎。

稳定性区间反映的是可用证据,而非真实能力的保证。微小的分差不能证明有意义的优势。

缺失不等于零。

缺失的测试结果仍是缺失。未测量的领域是估算的,稀疏或矛盾的证据会扩大区间。

能力只是一部分。

价格和速度另行考量。结果可能有利于在更多设置下测试的模型。基准测试不保证在您的工作中的表现。