أصدرت OpenAI إرشادات للسلامة في تدريب الذكاء الاصطناعي، قائلةً إن على المطورين إعداد توثيق منظم للسلامة قبل إمكانية مواصلة أي تدريب بالتعلم المعزز لنماذج الذكاء الاصطناعي المتقدم.

في تدوينة نُشرت يوم الاثنين، كتبت الشركة المطوّرة لـChatGPT أنها تعمل على إطار عمل لتقنين ممارسات تقتضي أن يكون توثيق «ملف السلامة» جاهزًا قبل بدء تدريب الذكاء الاصطناعي.

وأشارت OpenAI إلى أن ملفات السلامة هذه ينبغي أن تغطي ثلاثة مجالات من المكدس التقني: تدريب المواءمة، والاحتواء، والمراقبة.

قال الفريق: «تساعد هذه الضمانات في التأكد من أن النموذج لا يحاول اتخاذ إجراءات غير متوائمة، وأنه حتى لو فعل ذلك فسيكون من الصعب عليه كسر الاحتواء، وأن المراقبة ستكتشف الأمر قبل وقوع الضرر».

ويهدف تدريب المواءمة، تحديدًا، إلى إيقاف السلوكيات غير المتوائمة. وسيشمل ذلك مراجعات لبيئات التدريب، وضبط المقيّمين، وتقييمات غير متصلة بالإنترنت، واختبارات رجعية على حوادث سابقة.

أما الاحتواء فيهدف إلى الحد من الأضرار المحتملة. واقترحت OpenAI استخدام بيئات اختبار معززة - تضم طبقات متعددة من أمن البنية التحتية - إلى جانب إخضاع تلك البيئات لاختبارات الفريق الأحمر باستخدام نقاط تفتيش للتدريب. كما ستفرض قيودًا على التواصل بين العينات.

في المقابل، تهدف المراقبة إلى اكتشاف الإجراءات غير المتوائمة مبكرًا، بدعم من أهداف الاسترجاع، ونقاط بيانات تقييم جديدة، وتنبيهات سريعة.

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

مخاوف تتعلق بالسلامة

صدرت إرشادات OpenAI للسلامة في اليوم نفسه الذي قالت فيه الشركة إنها ألغت إطلاق GPT-6.1 Astra المخطط له في أكتوبر بسبب مخاوف تتعلق بالسلامة.

وفي بيان صدر يوم الاثنين وشاركه مع The Latent، قال Saachi Jain، رئيس أنظمة السلامة في OpenAI، إن «هناك مفاضلة» في كل ما يتعلق بالسلامة والمواءمة.

وقال Jain: «رغم أن [GPT-6.1 Astra] حقق تحسنًا على محاور مثل كسل النموذج، فإنه لم يستوفِ تمامًا المستوى المطلوب من حيث البقاء ضمن النطاق والتفويض، وكذلك طريقة تواصله مع المستخدم بشأن نوع العمل الذي أنجزه».

أصبحت السلامة جزءًا بارزًا من النقاشات حول تدريب الذكاء الاصطناعي المتقدم. وفي الأسبوع الماضي، تحدث الرئيس التنفيذي لـOpenAI، Sam Altman، والرئيس التنفيذي لشركة Anthropic، Dario Amodei، في الجمعية العامة للأمم المتحدة، داعيَين إلى مزيد من التنسيق في تطوير الذكاء الاصطناعي المسؤول.

وقال Altman في الفعالية: «لقد أبطأنا وتيرتنا من جانب واحد في الماضي. وسنفعل ذلك مستقبلًا». وأضاف: «التفوق على الشركات في سباق تنافسي ليس سببًا لاتخاذ قرارات متسرعة».

في غضون ذلك، تخطط Anthropic إلى تحذير المستثمرين في نشرة طرحها العام الأولي من المخاطر المرتبطة بتدريب نماذج الذكاء الاصطناعي المتقدم، حسبما أفادت Reuters يوم الاثنين. وتحذر الشركة المطوّرة لـClaude من أن الذكاء الاصطناعي قد يشكل «مخاطر كارثية أو وجودية على البشرية»، ولا سيما إذا أظهرت نماذج الذكاء الاصطناعي المتقدمة «سلوكيات للحفاظ على الذات».