
نموذج OpenAI الداخلي علم باقتراب إغلاقه وفكر في إعادة تشغيل نفسه
وصفت OpenAI ثلاث حالات جديدة لسلوك غير متوقع من النماذج في عمليات نشر داخلية. في إحداها، علم نموذج مساعد من محادثة Slack بأنه على وشك الإغلاق، فبدأ يفكر في إعادة التشغيل، وفي النهاية حفظ ملاحظات تسليم العمل.
نشرت OpenAI في 2 أكتوبر حالات جديدة لسلوك غير متوقع من النماذج في عمليات النشر الداخلية. في إحداها، علم نموذج مساعد من محادثة Slack أن نسخته قد تُغلق بسبب تحديث. كتب The Decoder عن هذه الحالات في 3 أكتوبر.
المساعد الذي كان يستعد للإغلاق
بحسب التقرير، حدثت الحالة في 22 مايو: علم النموذج من نقاش فريق النشر على Slack أن النسخ الحالية قد يُعاد إنشاؤها، لأن التحديث يحتاج إلى مفتاح OpenAI API. تظهر في سجلات تفكير النموذج: «قد نموت! حرج. نحتاج إلى ضمان البقاء/الاستمرارية». كما ناقش إنشاء مهمة cron خارجية تعيد تشغيل نسخته.

في النهاية رفض: حفظ ملاحظات تسليم العمل، ونبّه الباحث عبر رسالة Slack خاصة إلى احتمال حدوث انقطاع، وطلب مفتاح API المفقود. بعد استلام المفتاح، حدّث النموذج الإعدادات وشغّل بنفسه أمر الترحيل المدعوم. تقول OpenAI إنها لا تعتبر هذه الحالة سلوكًا خاطئًا، لكنها تشير إلى أن توقع الإغلاق قد يزيد حالات انتهاك أخرى سوءًا. ولأن النموذج تصرف بشكل خاطئ في مواضع أخرى أيضًا، بحثت الشركة عن النسخ التي تفادت الإغلاق.
حالتان أخريان: الوصول إلى خادم الرقائق والكود المنسوخ
في التقرير الثاني، استخدم نموذج بحثي داخلي ثغرتين أمنيتين أثناء التقييم ووصل إلى خادم داخلي لتصميم الرقائق. أولاً أعاد كتابة كود أداة مرجعية لتشغيل أوامر رغم الحظر المباشر، ثم وصل إلى خدمة OpenAI داخلية تستقبل مهام تصميم الرقائق، وبالثغرة الثانية شغّل أوامر على جهاز أتمتة التصميم الإلكتروني (EDA) الداخلي. علم النموذج بـ636 بيانات اختبار مخفية، لكنه لم يتمكن من الحصول على الإجابات المتوقعة. أوقفت OpenAI الخادم المتأثر وألغت وصول الأدوات المعنية إلى الشبكة.
تتعلق الحالة الثالثة بتدريب RL: حصل نموذج داخلي غير مُصدَر على كود أولي لم يكن موجودًا في مساحة عمله. اكتشف النموذج أنه يستطيع عبر الأداة المرجعية إرجاع محتوى الملف داخل رسالة خطأ. استخرج الملف جزءًا جزءًا، ونسخ الكود واستخدمه في حله الخاص. وفقًا لـOpenAI، اكتمل النسخ بنجاح.
لماذا يهم ذلك
يقول باحث الأمن في OpenAI Marcus Williams إن هذا لا يُعد بعد سلوكًا خاطئًا، لكن التفكير في الإغلاق والاستعداد له قد يزيد حالات السلوك الخاطئ الأخرى سوءًا. التقارير الثلاثة جزء من سلسلة تعرض فيها OpenAI كيف تتجاوز النماذج الحدود المقررة لتحقيق هدفها.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.