接近的分数需要谨慎。
稳定性区间反映的是可用证据,而非真实能力的保证。微小的分差不能证明有意义的优势。
七个权重相同的领域
运作方式
我们收集已发布的结果,核查其来源、模型版本和测试设置。我们不自行运行基准测试。
查看证据每项基准测试只计一次,采用其最佳的可比推理设置。相关测试共享影响力;单一评测方的影响力设有上限。
七个领域同等重要。固定的评分方法把它们合成一个分数,并附上显示其稳定性的区间。
如何解读数字
100 是固定的参考平均值。最初的参考模型确定了量表,标准差为 15。它不是当今模型的平均值。
量表可以延伸到这些数值之外。
请注意
稳定性区间反映的是可用证据,而非真实能力的保证。微小的分差不能证明有意义的优势。
缺失的测试结果仍是缺失。未测量的领域是估算的,稀疏或矛盾的证据会扩大区间。
价格和速度另行考量。结果可能有利于在更多设置下测试的模型。基准测试不保证在您的工作中的表现。