دفعت DeepSeek النسخة الرسمية من نموذج V4-Flash الخاص بها إلى نسخة تجريبية عامة يوم الجمعة، وسرعان ما أكدت الاختبارات المستقلة أمرًا غير معتاد: نموذج المختبر الصيني الصغير والرخيص يتفوق الآن على نموذجه الرئيسي نفسه. ومنحت شركة القياس المرجعي Artificial Analysis التحديث، الذي يحمل اسم DeepSeek-V4-Flash-0731، درجة 50 على مؤشر الذكاء الخاص بها، بزيادة 10 نقاط عن النسخة التي أُطلقت في أبريل 2026 وبفارق 6 نقاط أمام DeepSeek V4 Pro الأكبر حجمًا والأعلى تكلفة بكثير.

ويزيد التوقيت من حدة المنافسة. فقد جاء الإصدار بعد يوم واحد من أن OpenAI خفضت سعر GPT-5.6 Luna، وهو نموذجها الحدودي الاقتصادي، بنسبة 80% تحت ضغط العملاء الحريصين على التكلفة. وحتى بعد هذا الخفض، تقدّر Artificial Analysis أن نموذج DeepSeek الجديد يتأخر بنقطة واحدة فقط عن Luna في الذكاء، بينما يكلّف أقل بنحو 60% لكل مهمة على واجهة API الخاصة بـ DeepSeek.

الفئة الاقتصادية تلحق بالنموذج الرئيسي

عندما أطلقت DeepSeek مجموعة V4 الخاصة بها في أبريل، اتبعت المنطق القياسي الثنائي المستويات في الصناعة: Pro، وهو نموذج يضم 1.6T من المعاملات، لتحقيق أقصى قدرة، وFlash للسرعة وانخفاض التكلفة. بعد ثلاثة أشهر، انقلب هذا الترتيب الهرمي، ولو مؤقتًا على الأقل. لم تتغير واجهة API الخاصة بـ V4 Pro ولا النماذج التي تقف وراء تطبيق DeepSeek للمستهلكين؛ وحدها واجهة Flash API حصلت على الترقية.

وصياغة الشركة نفسها لما تغيّر مباشرة. فـسجل التحديث الخاص بها ينص على أن الإصدار قد "عزّز قدرات الوكلاء بشكل كبير، مع نتائج معيارية تتجاوز V4-Pro-Preview بفارق واضح." ومهام الوكلاء هي الأعمال التي ينجزها النموذج بنفسه عبر خطوات عديدة، مثل تشغيل الطرفية، وتحرير الشيفرة، واستدعاء برمجيات أخرى، بدلًا من الإجابة عن سؤال واحد. وهذه هي الفئة التي تعتقد الصناعة حاليًا أن الأموال تكمن فيها، ولهذا فإن تفوق نموذج اقتصادي على معاينة نموذج رئيسي فيها هو أكثر من مجرد مفارقة على لوحة الصدارة.

ولا يقل لفتًا للنظر ما لم يتغير. إذ يحتفظ النموذج بالبنية والحجم نفسيهما تمامًا لنسخة أبريل: 284B من المعاملات الإجمالية، وهي الإعدادات الداخلية التي تخزن ما يعرفه النموذج، مع تفعيل 13B فقط لأي كلمة معينة، ما يُبقي تكاليف التشغيل منخفضة. وتقول DeepSeek إن المكاسب جاءت بالكامل من مرحلة ما بعد التدريب، وهي مرحلة الصقل التي تُطبّق بعد بناء المعرفة الأساسية للنموذج. ولم تتغير الأسعار عند $0.14 لكل 1M من رموز الإدخال و$0.28 لكل 1M من رموز الإخراج، كما تمنح DeepSeek خصمًا بنسبة 98% على الإدخال المخزّن مؤقتًا، أي النص الذي سبق للنظام معالجته، مقابل 90% يقدّمها معظم المنافسين.

وتدعم الأرقام المستقلة مزاعم الوكلاء. ففي GDPval-AA v2، وهو اختبار Artificial Analysis لمهام العمل الواقعية، ارتفع تقييم النموذج إلى 1559 من 1189، وفي Terminal-Bench 2.1، الذي يقيس مدى جودة تشغيل النموذج لسطر الأوامر، ارتفع 17 نقطة إلى 79% في اختبارات الشركة.

ما الذي لا يحسمه هذا التقييم

لا يزال النموذج يختلق الإجابات بمعدل مرتفع. ففي اختبار المعرفة لدى Artificial Analysis، عندما لا يعرف شيئًا ما، فإنه يختلق استجابة في 84% من الوقت. وهذا أفضل بـ 12 نقطة من سابقه، لكن التحسن بأكمله جاء من امتناعه عن التخمين على نحو أكبر؛ أما نسبة الأسئلة التي يجيب عنها بشكل صحيح فعلًا فلم تتغير.

وهو أيضًا مطوّل في الإجابات. فقد أنتج النموذج نحو 206M من رموز الإخراج لإكمال مؤشر الذكاء، أي أقل بـ 12% من نسخة أبريل، لكنه لا يزال يقارب ضعف الوسيط بين النماذج المماثلة. وفي حلقات الوكلاء الطويلة، يعني ذلك أن الفواتير الفعلية ترتفع بشكل ملموس أكثر مما توحي به كلفة الرمز المنخفضة للغاية.

ولم يُبلَغ السقف بعد. فما زال Claude Opus 4.8 من Anthropic يتصدر كل معيار نشرته DeepSeek نفسها، وبين النماذج المفتوحة لا يزال Kimi K3 متقدمًا بـ 7 نقاط على المؤشر. ويتعامل النموذج مع النص فقط، من دون صور، كما أن أوزانه، وهي الملفات التي تتيح لأي شخص تشغيله بنفسه، متوقعة ولكنها لم تُصدر بعد، لذا فهو موجود حاليًا فقط كواجهة API مدفوعة.

وتقول DeepSeek إن النسخة الرسمية من V4-Pro "ستتبع قريبًا." وإذا كان مرور واحد فقط في مرحلة ما بعد التدريب قد رفع النموذج الصغير 10 نقاط، فالسؤال المفتوح هو ما الذي سيفعله العلاج نفسه بنموذج يزيد حجمه بنحو 6 مرات. لقد انخفض سعر الذكاء القريب من الحدود القصوى مرتين هذا الأسبوع. واحد فقط من هذين الانخفاضين تطلّب تعديل قائمة الأسعار.