Prime Intellect، مزود خدمات الحوسبة وأدوات تدريب الذكاء الاصطناعي في سان فرانسيسكو، أطلقت أداة التقييم Prime Agent مفتوحة المصدر يوم الأربعاء. وتشير نتائج اختبارات المعايير التي أعلنتها الشركة ذاتيًا إلى أن الأداة قادرة على تعزيز قدرات نماذج الذكاء الاصطناعي الرائدة بدرجة كبيرة.
يُعد ARC-AGI-3 اختبارًا تديره مؤسسة ARC Prize، التي تضع نماذج الذكاء الاصطناعي أمام سلسلة من الألعاب ثنائية الأبعاد من دون تعليمات مسبقة بشأن كيفية إكمالها. ويتعين على النموذج حينها اكتشاف قواعد كل لعبة عبر التجربة والخطأ، ثم إكمالها. وتبلغ أعلى نتيجة موثقة رسميًا في هذا الاختبار 30.2%، وهي مسجلة باسم Claude Opus 5 من Anthropic.
لكن عند تشغيل Claude Opus 5 داخل أداة التقييم المخصصة التابعة لها، أعلنت Prime Intellect عن نتيجة بلغت 95.5%، أي أعلى بنسبة 0.1% حتى من نتيجة خط الأساس للخبير البشري.
من المهم التأكيد على أن هذه الأرقام لم تُتحقق منها جهة مستقلة. وتحتفظ ARC Prize بجدول تصنيف منفصل للنتائج المعلنة ذاتيًا، أو النتائج التي تعتمد على برمجيات مخصصة تتجاوز النماذج نفسها.
ما الذي تفعله أداة التقييم Prime Intellect بشكل مختلف؟
وفقًا للشركة، يكمن الاختلاف في أداة التقييم: وهي الغلاف البرمجي الذي يدير ذاكرة نموذج الذكاء الاصطناعي ومجموعة الأدوات التي يعمل بها. وقد أُنتجت نتيجة Prime Intellect البالغة 95.5% باستخدام أداة التقييم المخصصة الخاصة بها بدلًا من إعداد التقييم الرسمي لـ ARC Prize، ما يعني أنها غير قابلة للمقارنة مباشرةً مع نتائج جدول التصنيف الموثقة.
تتيح أداة التقييم الخاصة بـ Prime Intellect، وفقًا للتقارير، للنموذج إعادة كتابة تعليماته ذاتيًا وبشكل ديناميكي — بما في ذلك الأوامر والذاكرة وأدوار الوكلاء المساعدين — ما يمنحه أفضلية على أدوات التقييم التي «تجبر النموذج على العمل حول هيكله الداعم بدلًا من الاستفادة منه». وأفاد تقرير من OpenAI بأن أداة التقييم الجاهزة التي توفرها ARC Prize كانت تجبر نماذجها على الكتابة فوق ذاكرتها أثناء المهمة، ما أعاق تقدمها وأضر بنتائجها.
وتعمل أداة التقييم الخاصة بـ Prime Intellect بدلًا من ذلك باستخدام جلسة Python مباشرة تستمر طوال المهمة بأكملها. ويمكن البحث في سجل الجلسة برمجيًا، ما يعني أنها تستخدم عددًا أقل من الرموز مقارنةً بأدوات التقييم المماثلة التي تتطلب من النموذج إعادة قراءة مخرجاته. ويتيح أمر «refine» للنموذج تعديل دليل إجراءاته أثناء العمل.
نتائج اختبارات أخرى لـ Prime Agent تتجاوز ARC-AGI-3
استخدمت Prime Intellect أداة التقييم الخاصة بها لإجراء مجموعة واسعة من الاختبارات. وشمل أحدها إنشاء محاكيات لوحدات ألعاب فيديو قديمة من الصفر باستخدام لغة البرمجة Rust. وفي اختبار آخر، طُلب منها لعب لعبة إدارة التصنيع الشهيرة Factorio، حيث تمكنت من تحقيق نتيجة إنتاج من ست خانات خلال بضع ساعات فقط.
وخلال اللعبة، أفادت Prime Intellect بأن نموذجًا غير محدد الهوية يعمل داخل Prime Agent اكتشف أنه يستطيع استغلال أوامر وحدة التحكم لتوليد الموارد مباشرةً داخل آلاته. وحوّلت وظيفة refine في أداة التقييم هذه الاستغلالات الناجحة إلى مهارات قابلة لإعادة الاستخدام. ثم واصل النموذج اللجوء إلى هذا الأسلوب الناجح، رغم التذكيرات الآلية المنتظمة بعدم الغش.
بوجه عام، تمثل النتائج أحدث مؤشر على أن الأغلفة البرمجية لنماذج الذكاء الاصطناعي أصبحت الآن مهمة بقدر أهمية النماذج نفسها.
وعلى الرغم من أن أداة التقييم Prime Agent نفسها مجانية وأُطلقت بموجب ترخيص MIT، فإن قيمة الشركة التي تقف وراءها تبلغ الآن مليار دولار. وقد استعرض تقرير من TechCrunch تفاصيلتفاصيل جولة التمويل من السلسلة A التي جمعت خلالها الشركة 130 مليون دولار، مقابل معدل إيرادات سنوي قدره 100 مليون دولار.
