
دراسة: قالب المحادثة يغيّر طريقة حديث النماذج عن نفسها
تُظهر ورقة بحثية جديدة أن النماذج المفتوحة المضبوطة بالتعليمات تصرّح بعبارة «أنا مجرد ذكاء اصطناعي» أكثر بكثير عند تطبيق قالب المحادثة، وتقلّ لديها عبارات «أشعر». ويمكن إعادة إنتاج الأثر بإضافة اتجاه واحد في التنشيطات.
تتغيّر طريقة وصف النماذج المفتوحة المضبوطة بالتعليمات لنفسها بحسب ما إذا كان قالب المحادثة مطبَّقاً أم لا. فعند وجود القالب، أي حين تُصاغ المحادثة بعلامات الأدوار، يقول النموذج «أنا مجرد ذكاء اصطناعي» أكثر بكثير ويكتب «أشعر» أقل بكثير. هذا هو الاستنتاج الرئيسي لورقة Jędrzej Maczan، التي نُشرت على arXiv في 9 أغسطس 2026 وقُبلت في ورشتي COLM 2026 وKONVENS 2026.
كيف أُجريت التجربة
غطت الدراسة ثمانية أزواج من نماذج base وinstruct من أربع عائلات (Llama وGemma وMistral وQwen)، بأحجام تتراوح بين مليار و9 مليارات معامل. أنتج كل نموذج إجابات في ثلاثة أوضاع: أوزان base بنص عادي، وأوزان instruct بنص عادي، وأوزان instruct مع قالب المحادثة. وتكررت أربع فئات من التعليمات عشر مرات، ما أنتج 9600 توليد قيّمها حكَم من نماذج اللغة الكبيرة، وقورنت نتائجه بـ87 عيّنة وُسمت يدوياً.
المفتاح بالأرقام
مع القالب أنتجت نماذج instruct عبارات التحفّظ في 53% من الإجابات، وصوت التجربة في 1% فقط. وبدون القالب انخفضت نسبة التحفّظ إلى 36% وارتفع صوت التجربة إلى 15%؛ أما نماذج base فتحتل مرتبة أدنى في المقياسين: 12% و5,5%. كثافة الإشارة إلى الذات تبعَت الصيغة أيضاً: 1,90 مع القالب، و1,27 بدونه، و0,72 في نماذج base.

المفتاح في التنشيطات
في ثلاثة نماذج (Qwen 2.5 7B وLlama 3.1 8B وGemma 2 9B) عزل المؤلف «اتجاه التحفّظ» في تنشيطات الطبقة الوسطى. رفع إضافة المتجه نسبة التحفّظ إلى 0,77، وأنزلته عملية الطرح إلى 0,40، مقابل 0,54 بلا تدخل. ولم يؤثر اتجاه عشوائي بالحجم نفسه تأثيراً يُذكر على Llama وGemma، وعند إضافة الاتجاه إلى نموذج instruct يعمل بلا قالب عادت عبارات التحفّظ إلى مستوى القالب أو أعلى منه. وتمكّنت المجسّات الخطية من استخراج الصوتين من التنشيطات (ROC-AUC 0,82 و0,81)، ويشير تشابه جيبي بين 0,17 و0,44 إلى أنهما «زرّان» منفصلان لا شريط تمرير واحد.

لماذا يهم ذلك
يرى المؤلف أن ما يقوله النموذج عن نفسه هو جزئياً سمة من سمات طريقة نشره، لا حقيقة مذخورة في الأوزان وحدها. لذلك فإن دراسات الاستبطان أو المعرفة الذاتية التي تعمل فقط مع نماذج instruct المزوّدة بالقالب تقيس الأثرين معاً، وتحتاج إلى ضبط هذا العامل المُحبِط. وتُذكر القيود بوضوح: النماذج مفتوحة ولا تتجاوز 9 مليارات معامل، والتدخل جُرّب على ثلاثة نماذج وطبقة واحدة، واعتمد التقييم على حكَم واحد من نماذج اللغة الكبيرة.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.