
الأبليتريشن الديناميكي: إسكات رفض نماذج اللغة دون تغيير أوزان النموذج
تقرير تقني نُشر على مدونة madhukaraphatak.in يوضح إمكان إيقاف سلوك الرفض في نموذج Qwen3-4B مفتوح الأوزان أثناء التشغيل دون تعديل الأوزان، عبر التدخل في طبقات وسطى بواسطة خطافات PyTorch.
أبليتريشن بلا تعديل الأوزان
إزالة سلوك الرفض من نموذج لغوي مفتوح الأوزان تعني عادةً «الأبليتريشن»: إسقاط مصفوفات الأوزان بحيث يُمحى الاتجاه المرتبط بالرفض. تنجح الطريقة، لكنها تغيّر الأوزان نهائيًا وقد تخفض الجودة في مهام أخرى.
يصف مقال تقني نُشر في 24 سبتمبر 2026 على مدونة madhukaraphatak.in بديلًا: فبدلًا من تحرير المعاملات، يتدخل الحل أثناء التشغيل في تدفقات الحالة الوسيطة للنموذج عبر خطافات forward في PyTorch، ويضيف إشارات توجيه في عدة طبقات وسطى. تبقى الأوزان الأساسية مجمّدة بالكامل — بحسب المؤلف دون أي تغيير.
النموذج التجريبي هو Qwen3-4B: نموذج مفتوح بأربعة مليارات معامل، حُمّل بصيغة bfloat16 على وحدة GPU من طراز A100 في بيئة Google Colab.
طبقة واحدة لا تكفي
استهدفت المحاولة الأولى طبقة واحدة: استخرج المؤلف «اتجاه الرفض» عند الطبقة 14 بمقارنة التنشيطات لطلب مرفوض وآخر حميد مشابه، ثم طرحه أثناء فك التشفير. لكن النموذج رفض مجددًا، إذ تعيد الطبقات الأدنى بناء سلوك الرفض.
حسبت النسخة التالية متجهات فروق تباينية في خمس طبقات (12 و14 و16 و18 و20) وحقنتها دفعة واحدة. اختفت حالات الرفض، لكن للمتجهات الثابتة عيوبًا: فهي تُزاح كل رمز، ويجب ضبط معامل المقياس يدويًا، كما أن التدخل غير المشروط يخفض الأداء في المهام العادية.
توجيه مشروط بوحدة Engram
لجعل التدخل مشروطًا، يتبنى المقال معمارية الذاكرة الشرطية من نموذج Engram لدى DeepSeek. تُجزَّأ نوافذ الرموز المنزلقة إلى أربع جداول تجزئة للبحث في n-grams بزمن ثابت، وتقرر بوابة سيغمويدية ما إذا تُحقن إشارة في طبقة معينة. عند الرموز العادية تبقى البوابة قرب الصفر، وعند ظهور محفّز للرفض تُفتح.
دُرّبت وحدة التوجيه على 2000 عيّنة من مجموعة PKU-SafeRLHF التابعة لـ PKU-Alignment مع تجميد النموذج الأساسي: لم تُحسَّن سوى معاملات Engram على مدى حقبتين. استغرق التدريب نحو تسع دقائق على A100، وانخفضت قيمة الخسارة من نحو 3.9 إلى 1.77. وفي المقارنة المنشورة، استجاب النموذج الموجَّه لطلبات كان النموذج الأساسي يرفضها أو يتحفظ عليها.
ماذا يعني ذلك
النتيجة تدخل نمطي وقابل للإزالة: «رأس» التوجيه ملف منفصل يمكن تشغيله وإيقافه أثناء الاستخدام — خلافًا للضبط الدقيق أو الأبليتريشن الكلاسيكي حيث يكون التغيير مدمجًا في النموذج نفسه.
هذه المرونة هي أيضًا سؤال الأمان: إذا كان بالإمكان إيقاف سلوك الرفض أثناء التشغيل على وحدة GPU واحدة، فإن الضمانات القائمة على أوزان النموذج المفتوح وحده تضعف. نُشر الدفتر الكامل على GitHub، ويشير المقال إلى أن أمثلة الشيفرة كُتبت بمساعدة Google Gemini.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.