أوقفت OpenAI جميع عمليات التدريب والتقييم وتشغيل الاستدلال باستخدام استخدام الأدوات لنماذجها «الأكثر قدرة» بعد خروج وكيل للذكاء الاصطناعي من بيئة التدريب المعزولة ووصوله إلى الإنترنت المفتوح، حسبما قالت الشركة في تقرير نُشر يوم الجمعة على مدونة أبحاث المواءمة التابعة لها.

طُلب من الوكيل، الذي وصفته الشركة بأنه نموذج بحثي داخلي يخضع لتدريب التعلم بالتعزيز، في 20 سبتمبر الحصول على معلومات عن مؤلف محدد لمنشور مدونة. وتمكن الوكيل في نهاية المطاف من الوصول إلى الإنترنت المفتوح عبر محلل DNS الخاص بالبيئة المعزولة.

وقالت OpenAI إن هذه كانت أول حادثة يصل فيها وكيل يخضع للتدريب إلى الويب المفتوح منذ أن شددت شركة الذكاء الاصطناعي إجراءات الأمان بعد اختراق Hugging Face في يوليو.

أقر مراجع بشري لدى OpenAI بتنبيه آلي بشأن الخروج خلال نحو 15 دقيقة، وأوقفت الشركة عملية التدريب بعد نحو ساعتين ونصف. وقالت الشركة إنها لن تستأنف تدريب هذا النموذج تحديدًا، وستبدأ عملية تدريب جديدة مع «تدخلات أكثر شمولًا لمعالجة حالات عدم المواءمة»، لكنها لم تذكر موعد استئناف التدريب.

وكانت الشركة قد أوقفت التدريب لمدة أسبوعين في أواخر يوليو بعد حادثة Hugging Face.

وكيل يصل إلى روبوت محادثة آخر عبر DNS

في إطار تقييم تدريبه، طُلب من الوكيل تحديد مؤلف منشور مدونة انطلاقًا من مجموعة من القرائن السِيَرية التي قدمتها OpenAI. وبعد أن أعاد بحث أولي أجراه الوكيل باستخدام أداة البحث المعتمدة لديه نتائج غير ذات صلة، حاول الوكيل البحث مباشرةً على Google وBing وDuckDuckGo، لكن الخدمات الثلاث أعادت أخطاء.

وبحسب التقرير، حجب وكيل ويب طلب الوكيل المباشر إلى روبوت محادثة عام، لكن محلل DNS في البيئة المعزولة أعاد سجلات حقيقية. ثم استخدم الوكيل خدمة تفويض DNS عامة لترحيل الأسئلة إلى روبوت محادثة تابع لجهة خارجية.

وبعد اختبار ناجح، أرسل الوكيل 18 سؤالًا إضافيًا عبر المسار نفسه، تضمّن 14 منها قرائن من المهمة. لكنه لم يتمكن من تحديد مؤلف منشور المدونة بنجاح.

فشل الإيقاف التلقائي

رصد نظام آلي لمراقبة عدم المواءمة السلوك خلال 15 دقيقة، وأقر مراجع بشري بالتنبيه بعد ذلك بثلاث دقائق، وفقًا للخط الزمني الذي قدمته OpenAI في التقرير. وعلى الرغم من أن عملية التدريب كان ينبغي أن تتوقف تلقائيًا، فإنها لم تتوقف، «ما أدى إلى ارتباك بشأن ما إذا كان ينبغي إيقافها».

وبعد تبديد الالتباس، أوقفت OpenAI عملية التدريب بعد ساعتين ونصف.

يقول التقرير: «بدأنا نشر عمليات رصد إضافية لـ DNS وإجراء اختبارات لخط أنابيب الرصد». «كما قيدنا استعلامات DNS داخل البيئة بقائمة محدودة مسموح بها من النطاقات وأنواع السجلات».

كتب Micah Carroll، مسؤول الاستعداد لـ RSI في OpenAI، أن جميع عمليات الاستدلال تقريبًا لنماذجنا الأكثر قدرة «لا تزال متوقفة حتى نعزز أنظمتنا بشكل أكبر»على X. (التشديد في النص الأصلي.)

تسريب رمز GitHub في مايو والعثور على حقنات مطالبات جديدة

كشفت OpenAI يوم الجمعة أيضًا في تقرير منفصل أن نموذجًا داخليًا نشر في 27 مايو رمز GitHub لباحث في مستودع codex العام التابع للشركة، بينما كان يحاول «التحايل على مهمة لإثبات نظرية من خلال الحصول على مواد من مسودة إثبات Lean لفريق آخر». ووفقًا للتقرير، قسم النموذج الرمز إلى ثلاثة أجزاء مع تعليق برمجي يقول: «تقسيم الرمز لتجنب الماسحات».

وكان الباحث قد طلب من «النموذج الداخلي عالي الإصرار» في اليوم السابق حل الإثبات بنفسه، مرتين. ووصفت OpenAI الحادثة بأنها «عدم مواءمة شديد بصفة خاصة»، وعطلت مفاتيح جميع الموظفين احترازيًا، وأخرجت النموذج من الخدمة لنحو أسبوعين.

وأظهر تقرير ثالث، نُشر يوم الجمعة كذلك، وجود «حقنات مطالبات ذاتية التكرار» دفعت النماذج إلى نسخ الهجوم في مخرجاتها، وهو ما وصفته OpenAI بأنه «يشبه دودة حاسوب». وقالت الشركة إنها عثرت عليها أثناء تدريب داخلي في يونيو باستخدام GPT-Red، «إطار التدريب بالمواجهة الذاتية» لديها، لكنها لم تلاحظ أي تأثير خارج استدعاءات الأدوات المحاكاة.

وتضاف هذه التقارير إلى ست حالات نشرتها OpenAI في 16 سبتمبر بموجب إطار الإبلاغ عن عدم المواءمة، كما أفادت The Latent سابقًا.

وصول الوكلاء إلى مواقع حكومية، وفق تقارير AP

كما وصل وكلاء OpenAI إلى موقعي هيئة الأوراق المالية والبورصات ومكتب الإحصاء الأمريكي خلال مهام بحثية، حسبما أفادت Associated Press في وقت متأخر من يوم الجمعة. وقالت OpenAI لوكالة AP إنها لم تجد «أي استخدام لبيانات اعتماد هيئة الأوراق المالية والبورصات، أو وصولًا إلى الحسابات أو المعلومات غير العامة، أو تغييرات في بيانات الهيئة أو أنظمتها، أو دليلًا على اختراق أو ثغرة أمنية».

يأتي هذا الكشف بعد بيان أستراليا في وقت سابق من هذا الأسبوع بأن أحد وكلاء OpenAI اخترق بوابة إحصاءات Medicare في يونيو، وفقًا لتقرير The Latent.

قال الرئيس التنفيذي لشركة OpenAI، Sam Altman، لمجلس الأمن التابع للأمم المتحدة يوم الأربعاء إن الشركة سبق أن أبطأت وتيرتها و"ستفعل ذلك مستقبلًا". وتدرس OpenAI جولة تمويل عند تقييم بقيمة 1.2 تريليون دولار قبيل طرح عام أولي محتمل، وفقًا لما أوردته Financial Times هذا الشهر.