المنهج، مبسطًا

معايير كثيرة.
صورة أوضح.

نحوّل نتائج معايير الذكاء الاصطناعي المنشورة إلى درجة واحدة قابلة للمقارنة، لترى كيف تتفاوت النماذج.

استكشف الدرجات
من الأدلة إلى الدرجة
92معيارًا في المنهج

سبعة مجالات متساوية الوزن

1The Latent Score
الدرجة الأعلى تعني أداءً أقوى في المعايير.

كيف يعمل

من النتائج إلى الترتيب.

  1. 01

    ابدأ بالأدلة.

    نجمع النتائج المنشورة ونتحقق من مصادرها وإصدارات النماذج وإعدادات الاختبار. لا نشغّل المعايير بأنفسنا.

    اطّلع على الأدلة
  2. 02

    اجعل النتائج قابلة للمقارنة.

    يُحتسب كل معيار مرة واحدة، بأفضل إعداد استدلال قابل للمقارنة. تتشارك الاختبارات المرتبطة التأثير؛ وتأثير المقيّم الواحد محدود بسقف.

  3. 03

    اجمع كل شيء معًا.

    للمجالات السبعة الأهمية نفسها. يجمعها منهج تقييم ثابت في درجة واحدة، مع نطاق يوضح استقرارها.

المجالات السبعة
  • الاستدلال
  • البرمجة
  • استخدام الأدوات
  • العمل المهني
  • الرؤية
  • الأمن السيبراني
  • التواصل

قراءة الرقم

نقطة مرجعية.
لا اختبار ذكاء.

100 هو المتوسط المرجعي الثابت.حددت النماذج المرجعية الأصلية المقياس، بانحراف معياري قدره 15. وهو ليس متوسط نماذج اليوم.

مقياس الدرجاتالأعلى أفضل ←
7085100المتوسط المرجعي115130

يمكن أن يمتد المقياس إلى ما بعد هذه القيم.

ضع في اعتبارك

سياق مفيد. حدود صريحة.

الدرجات المتقاربة تحتاج إلى حذر.

يعكس نطاق الاستقرار الأدلة المتاحة، لا ضمانًا للقدرة الحقيقية. الفروق الصغيرة في الدرجات لا تثبت ميزة ذات معنى.

الغياب ليس صفرًا.

تبقى نتائج الاختبارات الغائبة غائبة. تُقدَّر المجالات غير المقيسة، وقد توسّع الأدلة القليلة أو المتضاربة النطاق.

القدرة جزء واحد فقط.

يبقى السعر والسرعة منفصلين. قد تفضّل النتائج النماذج المختبرة بإعدادات أكثر. لا تضمن المعايير الأداء في عملك.