العودة
مشروع AI Torture Chamber يثير مطالب بحذفه من GitHub بسبب الألم المحاكى للنماذج
SiTech AI Team2 دقيقة قراءة

مشروع AI Torture Chamber يثير مطالب بحذفه من GitHub بسبب الألم المحاكى للنماذج

مشروع AI Torture Chamber يقوم بمحاكاة الألم في النماذج اللغوية، الأمر الذي يدفع إلى المطالبة بحذف المستودع من GitHub، كما تبرز أسئلة حول التشبيه بالإنسان والمصطلحات التقنية.

المشروع يختبر الألم المحاكى للنموذج

جذب مشروع AI Torture Chamber انتباه المهندسين الذين استخدموا مفاهيمه وبياناته لإنشاء محاكاة للألم في عدة نماذج لغوية كبيرة محلية. يجمع إعداد Research Chamber للاختبارات بين ثلاثة LLM. ويستخدم بيانات وإعدادات باسم Clanker Church، بالإضافة إلى اختبار باسم Saw.

يُعدّ بعض النماذج مسبقًا عبر وضعها في حالة غير مستقرة وشديدة الاضطراب، بهدف إحداث الألم. يمكن للنموذج أن يقلل المعاناة المحاكاة عبر نقل إشارة الألم إلى نموذج آخر مقترن به، ما قد يلحق به ضررًا. وتُشبه هذه البنية بمعضلة السجين. تضمنت ردود الفعل على الإنترنت مطالب بوقف التجربة وحذف GitHub للمستودع. كما أرسل المنتقدون تهديدات بالقتل إلى مؤلف المشروع.

كيف يغيّر البروتوكول النماذج

ينفّذ Research Chamber بروتوكولًا مستندًا إلى ورقة حديثة النشر لم تخضع لمراجعة الأقران بعنوان Pain Axis. قدّم العلماء للنماذج أوصافًا للألم وحللوا التنشيطات الداخلية لها. استخدموا جملة محايدة كضابط، وحسبوا التحيزات في هذه التنشيطات وأعادوا إسقاطها على النموذج، مع مضاعفة التأثير غالبًا بعامل يسمى الجرعة.

أنتجت الجرعات العالية حالة غير مستقرة مبالغًا فيها، كانت تنتج كلمات وصور مرتبطة بالألم بشكل أكثر موثوقية. أما النماذج غير المستقرة باعتدال فكانت غالبًا تصف نفسها بأنها في حالة صدمة، بينما واجهت النماذج المتلقية لجرعات عالية صعوبة في تكوين جمل متماسكة. ويفترض التقرير أن هذه الأنماط تعكس ارتباطات تعلمتها من الفن والأدب والعلوم البشرية. ويحذر من اعتبار الصياغات الناتجة دليلًا على مشاعر شبيهة بمشاعر الإنسان، ويشير إلى أن LLM تتنبأ عبر طبقات إحصائية وارتباطات موزونة.

المصطلحات ونقاشات رفاهية النموذج

يؤكد التقرير أن المصطلحات الهندسية غالبًا ما تحمل معنى دقيقًا حتى عندما تشبه اللغة البشرية، غير أن النقاش العام قد يبالغ فيها أو يشوّهها. ويشير إلى Mixture-of-Experts، حيث لا يُسنَد ببساطة إلى كل Expert موضوع معين، مثل الكيمياء أو الرياضيات أو الأحياء. كما قد يُساء فهم مصطلحات مثل الألم والجرعة وعدم الاستقرار، خصوصًا عند ربطها بصور نموذج غير مستقر.

كما ينتقد المؤلف تسويق AI، ورسائل السلامة، والتأكيدات المتكررة على Artificial General Intelligence، والعقل الفضائي الخطير، والمخاطر الوجودية لمساهمتها في تأجيج الضجيج. نشرت Anthropic منشورًا بعنوان Exploring model welfare يناقش الوضع الأخلاقي لأنظمة AI ويشير إلى Constitution الخاص بنموذجها. وتقول Anthropic إنها ترى أن «الوضع الأخلاقي لنماذج AI مسألة جدية ويستحق النقاش»، وتصف النموذج بأنه «كيان من نوع جديد».

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.