نشرت شركة Artificial Analysis المتخصصة في قياس أداء نماذج الذكاء الاصطناعي هذا الأسبوع نتيجتها لأحدث نسخة من نموذج V4-Flash الخفيف من DeepSeek، بعد طرحه للاستخدام العام التجريبي يوم الجمعة. وعلى نحو مفاجئ، سجل النموذج الأرخص من المطور الصيني 50 نقطة على مؤشر الذكاء التابع للمنصة، متقدمًا بـ6 نقاط على نموذج DeepSeek V4 Pro-Preview الرائد.
لا تزال DeepSeek أيضًا أرخص بكثير من النماذج الأمريكية الرائدة. وقد اتخذ المنافسون في الولايات المتحدة خطوات لمحاولة سد هذه الفجوة خلال الأشهر الأخيرة، وعلى رأسهم OpenAI، التي خفضت تكلفة نموذجها الاقتصادي بنسبة 80% بعد أيام قليلة من إطلاقه. وبغض النظر عن ذلك، بسعر 0.14 دولار لكل مليون رمز إدخال و0.28 دولار لكل مليون رمز إخراج، لا يزال نموذج DeepSeek أرخص بنسبة 60% من GPT-Luna.
كيف تفوق Flash على Pro-Preview في الذكاء
تُظهر سجلات التحديث التي نشرتها DeepSeek أن أحدث إصدار من Flash يمتلك البنية الأساسية والحجم نفسيهما اللذين اتسمت بهما نسخته السابقة من أبريل هذا العام.
أما المتغير الذي طرأ فكان صقل ما بعد التدريب. وفي حين ظلت واجهة برمجة التطبيقات الخاصة بالنموذج الرائد V4-Pro-Preview كما هي، خضعت واجهة Flash لعملية تطوير شاملة. وكانت النتيجة «قدرات محسّنة بشكل كبير للوكلاء، مع نتائج في الاختبارات المعيارية تتجاوز بكثير V4-Pro-Preview».
تزداد أهمية قدرة الوكلاء باعتبارها معيارًا لتقييم نماذج الذكاء الاصطناعي، في ظل توسع قدراتها إلى ما يتجاوز بكثير إمكانات روبوتات الدردشة الأساسية. ويشير ذلك إلى قدرة النموذج على التعامل مع مهام معقدة ومتعددة المراحل، مثل كتابة التعليمات البرمجية واختبارها.
أكدت شركة Artificial Analysis المتخصصة في قياس أداء الذكاء الاصطناعي نتائج DeepSeek المتعلقة بأحدث نماذجها. وفي اختبارات مستقلة، ارتفع أداء Flash بمقدار 17 نقطة مقارنة بسلفه في اختبار Terminal-Bench 2.1، الذي يقيس مدى جودة تشغيل النموذج لسطر الأوامر.
وفي اختبار GDPval-AA v2 - وهو اختبار Artificial Analysis لمهام العمل الواقعية في قطاعات مثل التمويل والهندسة والرعاية الصحية - ارتفع تقييم النموذج إلى 1,559 من 1,189.
تشير هذه النتائج إلى أن قدرات V4-Flash الوكيلة تمثل بالفعل قفزة كبيرة.
المجالات التي لا يزال DeepSeek V4-Flash متأخرًا فيها
رغم التحسينات الملحوظة التي حققها نموذج DeepSeek، فإنه لا يزال بعيدًا عن صدارة السوق. فما زال Claude Opus 4.8 من Anthropic يتصدر في كل معيار نشرته DeepSeek نفسها، في حين لا يزال المطور الصيني الآخر Moonshot متفوقًا بين النماذج ذات الأوزان المفتوحة بفضل نموذجه Kimi K3.
تضمن تقرير Artificial Analysis تحذيرًا من أن V4-Flash لديه أيضًا معدل هلوسة مرتفع يبلغ 84% بين الاستجابات غير الصحيحة. وهذا يعني أنه في الحالات التي لا يستطيع فيها تقديم الإجابة الصحيحة، يفضل V4-Flash عمومًا الإجابة بشكل خاطئ بدلًا من الامتناع عن الإجابة. وأشارت شركة قياس الأداء إلى أن أحدث نسخة اخترعت إجابات مبنية على أفضل التخمينات بمعدل أقل من الإصدارات السابقة، لكن المعدل لا يزال مرتفعًا رغم ذلك.
ومن أوجه القصور المحتملة الأخرى ميل النموذج إلى الإسهاب. فخلال الاختبار، أفادت التقارير بأنه ولّد نحو 206 ملايين رمز إخراج عبر سلسلة اختبارات مؤشر الذكاء بأكملها. وهذا يزيد على الوسيط بأكثر من الضعف، ما يعني أن تكاليف الاستخدام الفعلية للنموذج قد ترتفع إلى مستويات أعلى مما توحي به رسومه المعلنة.
