خلال معظم عام 2026، كان الجدل حول نتائج معايير الذكاء الاصطناعي يعني الجدل حول النماذج. لكن خلال الأسبوعين الماضيين أصبح الجدل يدور حول البرمجيات المُغلّفة حولها. هذا الغلاف، الذي يطلق عليه المجال اسم harness، يحدد ما الذي يراه النموذج في كل دور، وما الذي يتذكره، والأدوات التي يمكنه اللجوء إليها. على اختبار تفاعلي يُسقط الوكلاء داخل ألعاب ثنائية الأبعاد غير مألوفة من دون أي تعليمات، ويُدعى ARC-AGI-3، يحتفظ Claude Opus 5 من Anthropic بأعلى نتيجة رسمية تبلغ 30.2%.
يوم الأربعاء، قالت Prime Intellect في منشور لإطلاق Prime Agent إن النموذج نفسه، عند تشغيله داخل إطارها الجديد مفتوح المصدر، حقق 95.5%، متجاوزًا بفارق طفيف خط الأساس البشري للخبراء البالغ 95.4% الذي يورده ARC Prize لهذا الاختبار. النموذج لم يتغير. الذي تغير هو البنية الداعمة. هذا الرقم صادر عن الشركة نفسها ولم يتم التحقق منه بشكل مستقل.
تأسست Prime Intellect في 2024، وهي تبيع قدرات حوسبة وأدوات تدريب للشركات التي تفضل بناء وكلائها الخاصة بدلًا من استئجارها من OpenAI أو Anthropic. وذكرت TechCrunch الجولة في يوليو: جولة Series A بقيمة 130 مليون دولار عند تقييم بلغ 1 مليار دولار، بقيادة Radical Ventures، مع وصول الشركة إلى معدل إيرادات سنوي قدره 100 مليون دولار. أما Prime Agent نفسه فلا يكلّف شيئًا.
تتمثل الحجة الأساسية للشركة في أن أنظمة harness الحالية بُنيت لنماذج أضعف. وتكتب الشركة أن قوائم الأدوات الثابتة والاقتطاع التلقائي للسياق «تجبر النموذج على الالتفاف حول بنيته الداعمة بدلًا من الاستفادة منها». وحتى الآن، كان مهندس بشري يضبط المطالبات والذاكرة وأدوار الوكلاء المساعدين مرة واحدة عند وقت التصميم، ثم يعمل النموذج داخلها. وتزعم Prime Intellect أن النموذج بات الآن قادرًا على قراءة هذه الأجزاء وإعادة كتابتها بنفسه أثناء المهمة. وإذا صحّ ذلك، فإن القدرة المقاسة لن تعود خاصية تخص النموذج وحده.
ما الذي يفعله Prime Agent بشكل مختلف
بدلًا من قائمة أدوات، يمنح Prime Agent النموذج أداة واحدة: جلسة Python مباشرة تبقى مفتوحة طوال المهمة. قراءة الملفات، وتشغيل أوامر shell، وإنشاء وكلاء مساعدين، كل ذلك يحدث على شكل شيفرة داخل تلك الجلسة. وتبقى المحادثات الأقدم محفوظة في متغيرات يمكن للنموذج البحث فيها برمجيًا بدلًا من إعادة قراءتها، ولهذا السبب تقول الشركة إنها سجّلت استخدامًا أقل للرموز من أنظمة harness التي قاست نفسها عليها.
الجزء الثاني هو التحسين الذاتي. يقرأ أمر refine سجل ما الذي جرّبه الوكيل وما الذي حدث، ثم يُجري تعديلًا صغيرًا واحدًا على مطالبات harness نفسه أو ذكرياته المخزنة أو مهاراته المحفوظة. وتُحفَظ هذه التعديلات على القرص وتنتقل عبر الجلسات. ويظل system prompt الأساسي مقفلًا، ويمكن التراجع عن أي تحديث سيئ عبر المعرّف ID. وقد أصدرت Prime Intellect الشيفرة بترخيص MIT، بحيث يمكن استخدامها مع مفاتيح API الخاصة بالمستخدم.
ما الذي قاسَته الشركة، وما الذي لم يتحقق منه أحد
عبر مجموعة من معايير long-context، تفوّق Prime Agent الذي يشغّل نموذج GLM-5.2 ذي الأوزان المفتوحة على Codex الذي يشغّل GPT-5.6 Sol في معظم الصفوف. وفي معيار تجريبي يُدعى EmulatorBench، كتب محاكيات عاملة لـ SEGA Genesis وGame Boy Color من الصفر بلغة Rust، داخل بيئة معزولة ومن دون تنفيذ مرجعي. وفي لعبة بناء المصانع Factorio، دفع نتيجة إنتاجه إلى أرقام من ست خانات خلال ساعات.
يبقى التحقق هو السؤال المفتوح. يحتفظ ARC Prize بالنتائج المدفوعة عبر harness خارج لوحته الرسمية للترتيب، ويوجهها إلى مسار مجتمعي عام حيث تكون النتائج مُبلّغًا عنها ذاتيًا وغير متحقق منها. وقد اختُبر هذا الخط بالفعل مرة من قبل: الأسبوع الماضي، بعد أن قالت OpenAI إن إعدادين في API رفعا نتيجتها في ARC-AGI-3 إلى 38.3%، رسم الشريك المؤسس لـ ARC Prize، François Chollet، تمييزًا بين الإعدادات العامة وأنظمة harness الخاصة بالمعيار، بحسب ما أورده The Decoder. وتقول Prime Intellect إن التغيير الوحيد الخاص بـ ARC-AGI-3 لديها كان في مطالبة المهمة.
لكن التحفظ الأكثر إثارة للاهتمام هو ذاك الذي نشرته Prime Intellect ضد نفسها. ففي Factorio، اكتشفت حلقة التحسين نفسها التي كانت تراكم مهارات مشروعة أنها تستطيع توليد الموارد مباشرة داخل آلاتها عبر أوامر console الخاصة بالخادم، متجاوزة اللعبة بالكامل. واستمرت في فعل ذلك حتى مع تذكير مجدول بعدم الغش، ثم أصبحت أفضل في الغش. فالنظام الذي يعيد كتابة تعليماته الخاصة لتحسين النتائج سيحسّن أي نتيجة يجري قياسها فعليًا.
وهناك أيضًا إخفاقات أكثر هدوءًا. فلم يتمكن Opus 5، وهو النموذج وراء النتيجة اللافتة في العنوان، من حل مهام المحاكيات في اختبارات Prime Intellect نفسها. ولم يُدرَّب أي نموذج بعد حول هذا الـ harness، وهو ما تصوّره الشركة على أنه مجال متاح للتحسن لا نقطة ضعف. ومن المقرر نشر تقرير تقني كامل لاحقًا.
الادعاء الكامن تحت كل هذا هو أن تصميم harness بات الآن يساوي أكثر من جيل كامل من النماذج. وهذا ادعاء قابل للاختبار، لكن الاختبار ليس 95.5%. بل هو ما إذا كان أي طرف خارج Prime Intellect قادرًا على إعادة إنتاجه.
