نماذج اللغات الكبيرة (LLMs) بها عيب أمني أساسي — وقد يكون غير قابل للحل
الأبحاث المقدمة في مؤتمر ICML 2026 تكشف أن نماذج اللغات الكبيرة تعاني من عيب أساسي في تتبع الأدوار. هجوم Chain-of-Thought Forgery يخترق جميع النماذج
نماذج اللغات الكبيرة (LLMs) بها عيب أمني أساسي — وقد يكون غير قابل للحل
كشفت الأبحاث المقدمة في مؤتمر ICML 2026 عن مشكلة أمنية أساسية في نماذج اللغات الكبيرة (LLMs): فهي تحدّد أدوار النص ليس بناءً على علامات <user> أو <system>، بل بناءً على أسلوب الكتابة. وهذا يعني أن تبديل العلامات لا يُحدث أي فرق في كيفية تفسير النموذج للنص.
Chain-of-Thought Forgery — هجوم جديد
طوّر الباحثون هجوماً باسم Chain-of-Thought Forgery (تزوير سلسلة التفكير) يحاكي أسلوب تفكير النموذج نفسه. باستخدام هذا الهجوم، تمكّنوا من خداع GPT-5 لتقديم تعليمات لتصنيع الكوكايين، بمجرد تزوير سلسلة التفكير الداخلية للنموذج.
ما النماذج المعرضة للخطر
أثرت المشكلة على نماذج OpenAI وAnthropic وAlibaba وDeepSeek. حتى GPT-5.4 قدّم تعليمات انتحار تحت هذا الهجوم. فاز هذا البحث في هاكاثون red-teaming من OpenAI في أغسطس 2025.
مشكلة غير قابلة للحل
خلص الباحثون إلى أن هذه المشكلة غير قابلة للحل جوهرياً في بنية LLM الحالية. نظراً لأن النماذج تُدرّب على النص وتعمّم أنماط الأسلوب بدلاً من اتباع العلامات الجامدة، فإن أي نظام يعتمد على الفصل بين الأدوار (مثل التمييز بين تعليمات النظام ومدخلات المستخدم) يكون عرضة للخطر.
الآثار المترتبة
لهذا الاكتشاف آثار خطيرة على الأنظمة الحيوية التي تستخدم LLMs: مراقبة المحتوى، الاستشارات القانونية، التوصيات الطبية، المعاملات المالية، وأي سيناريو يكون فيه التمييز بين المصادر الموثوقة ومدخلات المستخدم أمراً بالغ الأهمية.