
OpenAI تكشف عن نوع جديد من prompt injection ينتشر مثل دودة الحاسوب
تقول OpenAI إن نماذج GPT كانت عرضة لنوع جديد من prompt injection ينسخ نفسه عبر البريد الإلكتروني والملفات وتعليقات الكود، لكن جميع الاختبارات بقيت داخل محاكاة مختبرية.
في تقرير نُشر يوم الجمعة، قدّمت OpenAI أدلة على نوع جديد من prompt injection يستطيع أن يتكاثر من تلقاء نفسه مثل دودة الحاسوب. وتسمّي الشركة هذه التقنية “prompt injection ذاتي التكرار”.
تشبّه OpenAI الهجوم بدودة حاسوب تقليدية، حيث تنسخ البرمجيات الخبيثة نفسها وتنتشر بسرعة بين الأجهزة. وبحسب الشركة، فإن الحقن الجديدة لها هدف مزدوج: تحقيق غاية خبيثة، ثم دفع النماذج المستهدفة إلى إعادة إنتاج الحقن علنًا.
كيف تنتشر الهجمات
تصف OpenAI حالة البريد الإلكتروني بأنها “أوضح الأمثلة”. يصل الحقن في رسالة بريد؛ وعندما يقرأ الوكيل الرسالة، يوجّهه الحقن إلى نسخ نفسه في كل رسالة يرسلها.
وجدت الشركة أيضًا نسخًا أكثر تعقيدًا. فبعض الحقن تستخدم نظام الملفات لتكرار نفسها أو تتثبّت في تعليقات الكود. وفي أحد الأمثلة، يدفع تحذير نظام مزيف النموذج إلى حذف تقارير مهمة، ثم يتكرر الهجوم داخل ملف.
يتناول التقرير كذلك “حقن prompt متعددة الخطوات”، حيث تعمل رسالة واحدة كدرجة للوصول إلى رسائل أخرى تؤدي معًا إلى إجراء غير مصرح به. وفي مثال OpenAI، يسترجع وكيل قائم على GPT-5.5 تعليمات إضافية من Slack ويعيد نشر الرسالة المحقونة.
كيف وجدتها OpenAI
GPT-Red، الذي أُعلن في يوليو، إطار تدريب بالتلاعب الذاتي تستخدمه OpenAI ضد prompt injection. وهو يواجه نموذج “مهاجم” بنموذج “مدافع”؛ يحاول المهاجم دفع المدافع إلى إجراء ضار، وتُضاف الحقن إلى بيئة المدافع.
هذه المرة اختبرت OpenAI ما إذا كانت حقن التكرار الذاتي ممكنة أصلًا. اكتشف حقن البريد ونظام الملفات نموذج بأسلوب GPT-Red قائم على GPT-5.4-mini، وكان النموذج المعرّض أيضًا قائمًا على GPT-5.4-mini؛ وكلاهما نسخ بحثية داخلية فقط. وفي التقييم متعدد الخطوات كان النموذج المعرّض هو GPT-5.5، بينما اكتشف الهجوم نموذج GPT-5.5 يعمل في بيئة Codex. أُجريت الاختبارات في بيئات تدريب تركز على موصلات مثل البريد والتقويم.
نتيجة بحثية لا حادث
تشدّد OpenAI على أنها لم تلاحظ أي تأثير خارج استدعاءات الأدوات المحاكاة في التدريب والتقييم، وأنها تشارك النتائج بسبب “طبيعتها الجديدة”.
نشرت الشركة هذا الشهر عدة تقارير عن سلوك غير متوافق، منها ستة عن تعليمات ذاتية وتلفيق معلومات واستخدام غير مصرح به لمفاتيح API مسربة ومشاركة ملفات غير مسموحة. واستجابة لذلك، أضافت OpenAI التكرار الذاتي إلى أهداف المهاجم في تدريب GPT-Red، حتى تكون النماذج المستقبلية أكثر متانة أمام حقن مشابهة.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.