أطلقت DeepSeek يوم الجمعة نموذج رؤية تجريبيًا قالت الشركة الصينية الناشئة في مجال الذكاء الاصطناعي إنه يجعل أداء وكيلها متعدد الوسائط قريبًا من Opus-4.8 التابع لشركة Anthropic على معايير الوكلاء.
وأفادت الشركة بأن النموذج، DeepSeek-V4-Flash-Vision-Exp، أصبح متاحًا الآن عبر منصة DeepSeek API، وذلك في إعلان، مضيفة أن النموذج يضاهي V4 Flash في القدرات النصية، بما في ذلك الوكلاء والاستدلال والمعرفة بالعالم، مع إضافة مدخلات الصور.
وقالت الشركة إن النموذج الجديد حقق «قفزة كبيرة» مقارنةً بـ V4 Flash على معايير الوكلاء متعددي الوسائط، ما جعل أداءه قريبًا من Opus-4.8. ولم تقدم DeepSeek درجات المعايير في إعلانها.
ومن اللافت أن النموذج يستطيع تحليل الصور إلى جانب النص، بما في ذلك وصف الصور، وقراءة النص من لقطات الشاشة، وتحليل الرسوم البيانية. وهو يدعم صور JPEG وPNG وGIF وWebP.
وقالت DeepSeek إن V4 Flash Vision يدعم واجهات Chat Completions API وMessages API وResponses API. ويمكن قبول الصور عبر بيانات base64 أو عناوين URL خارجية أو Files API التي أُطلقت حديثًا.
تُحوَّل الصور إلى رموز لأغراض الفوترة، إذ تستهلك كل صورة ما يصل إلى 384 رمزًا وفق تسعير V4 Flash. ويمكن للنموذج معالجة ما يصل إلى 600 صورة في طلب واحد، بينما يمكن أن يصل حجم الصور الفردية إلى 32 ميغابايت عبر base64 أو عناوين URL خارجية و64 ميغابايت عند الإشارة إليها عبر Files API.
وتتيح Files API للمستخدمين تحميل صورة مرة واحدة والإشارة إليها عبر معرّف ملف في الطلبات المختلفة. وقالت DeepSeek إن الخدمة مجانية الاستخدام ويمكنها أيضًا تقليل استهلاك النطاق الترددي عند إعادة استخدام الصورة نفسها.
ويأتي هذا الإصدار في وقت استأنفت فيه DeepSeek جولة التمويل الثانية، سعيًا لجمع ما يقارب 8 مليارات دولار، مع إجراء Monolith Management محادثات للمشاركة، بحسب ما أفادت Bloomberg في وقت سابق من هذا الشهر. وتسعى الشركة إلى تقييم يقترب من 500 مليار يوان (74.3 مليار دولار).
