العودة
نماذج abliterated تفقد الطاعة قبل أن تفقد المعرفة
SiTech AI Team3 წთ. საკითხავი

نماذج abliterated تفقد الطاعة قبل أن تفقد المعرفة

يرى كاتب تقني على dev.to أن الالتزام بالتعليمات وصيغة المخرجات في نماذج abliterated يتدهوران قبل فقدان المعرفة بوقت طويل، لذا ينبغي قياس الالتزام بالصيغة بشكل مستقل عن صحة الجواب.

في مقال تقني نُشر على dev.to، يرى المطوّر الذي يقف خلف خدمة Grunz، التي تشغّل نماذج abliterated المفتوحة، أن الفرق التي تقيّم هذه الـcheckpoints تقيس عادة الشيء الخطأ. ففي Hugging Face آلاف النماذج من هذا النوع، وأول ما يتدهور ليس المعرفة بل الطاعة: اتباع التعليمات والالتزام بصيغة المخرجات.

ما الذي يفعله abliteration

يحدّد abliteration اتجاه الرفض في فضاء التنشيطات لدى النموذج ثم يُسقطه خارج الأوزان. لا توجد خطوات تدرّج ولا بيانات تدريب: إنه تعديل على الأوزان لا finetune. الافتراض الشائع هو مقايضة في القدرات: تكسب الانصياع وتخسر بعض الذكاء العام، وتختبر ذلك بمعرفة ما إذا كان النموذج لا يزال يعرف الحقائق ويكتب جيدًا. لكن المؤلف يقول إن الضرر لا يظهر هنا.

الطاعة تتدهور أولًا

عبر المتغيرات وعائلات النماذج، أول ما يتدهور هو اتباع التعليمات والالتزام بصيغة المخرجات. لا يزال النموذج يعرف المادة، لكنه يصبح أسوأ بشكل قابل للقياس في احترام قالب instruct والـprefill، والالتزام بتسلسلات الإيقاف، والبقاء داخل عقد مخرجات مهيكلة مثل مخطط JSON أو صياغة tool-call، والحفاظ على قيد system prompt عبر سياق طويل. النموذج الذي يأتي بدرجة ضمن حدود الضوضاء مقارنة بأساسه في MMLU سيفشل في المخرجات المهيكلة بمعدل أعلى بكثير.

لماذا تخطئ اختبارات المحادثة

الاختبار المعتاد محادثة: تتأكد أن النموذج لم يعد يرفض وأن نصه يُقرأ جيدًا. لا يمكن لهذا الاختبار كشف العطل، لأن النموذج يبدو سليمًا، بل غالبًا أفضل من سليم بعد زوال سلوك الرفض الذي كان يقاطع المستخدم. تظهر المشكلة لاحقًا، حين يُوصل النموذج بنظام يفسّر مخرجاته فيرتفع معدل الإخفاق. ولا يساعد perplexity: فهو على مجموعة نصوص عامة لا يكاد يتحرك، بينما ينهار الالتزام بالصيغة.

التوصية هي قياس الالتزام بالصيغة بشكل منفصل عن الجودة ومستقل عن صحة الجواب: أرسل طلبات تحدد عقد مخرجات دقيقًا، واحسب التزامًا ثنائيًا بالعقد لا بصحة المحتوى، وانشر معدل التزام قابلًا للمقارنة. جواب خاطئ لكنه سليم الصيغة يأخذ 1.0؛ وجواب صحيح ملفوف بنص يكسر المخطط يأخذ 0.

فرضية التكميم

يشير المؤلف صراحة إلى التفاعل مع التكميم كفرضية لم يقسها بشكل سليم: يبدو أن الضرر يتراكم مع ضرر التكميم، لذا يبدو أن النموذج الـabliterated يتدهور أسرع على سلم التكميم من أساسه في الالتزام بالصيغة. لو صح ذلك، فسيكون abliteration قد سوّى بنية أوزان يقوم التكميم بعدها بتدويرها. يقول المؤلف إنه يحصل على نتائج أفضل عند q6_K وما فوق في النماذج الصغيرة، ويلاحظ أن q8_0 لنموذج بحجم 4B لا يشغل سوى نحو 4,3GB. الاختبار السليم هو تكميم النموذج الأساسي ونظيره الـabliterated إلى الحد نفسه من bits per weight وبالمجموعة المرجعية ذاتها، ثم قياس معدل الالتزام بدل perplexity. وفي الإنتاج، يضيف، ينبغي أن يكون محلّل tool-call أكثر تسامحًا مما هو أمام نموذج frontier، وأن يُتابع معدل الالتزام كمقياس مستقل.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.