
OpenAI חשפה prompt injection שמשכפל את עצמו ומתפשט כמו תולעת מחשב
OpenAI מדווחת שמודלי GPT שלה היו רגישים לסוג חדש של prompt injection שמשכפל את עצמו דרך דואר אלקטרוני, קבצים והערות קוד, אם כי כל הבדיקות נותרו בתוך סימולציות ואימונים מבוקרים.
בדוח שפורסם ביום שישי הציגה OpenAI עדויות לסוג חדש של prompt injection שיכול לשכפל את עצמו כמו תולעת מחשב. החברה מכנה את הטכניקה «prompt injection משכפל עצמי».
OpenAI משווה את ההתקפה לתולעת מחשב מסורתית, שבה תוכנה זדונית משכפלת את עצמה ומתפשטת במהירות בין מחשבים. לפי החברה, להזרקות החדשות מטרה כפולה: להשיג יעד זדוני ואז לגרום למודלים המותקפים לשכפל את ההזרקה בפומבי.
איך ההתקפות מתפשטות
את מקרה הדואר האלקטרוני מתארת OpenAI כ«אחת הדוגמאות הברורות ביותר». ההזרקה מגיעה בהודעת דואר; כשהסוכן קורא את ההודעה, ההזרקה מורה לו להעתיק אותה לכל הודעה שהוא שולח.
החברה מצאה גם גרסאות מורכבות יותר. חלק מההזרקות משתמשות במערכת הקבצים כדי לשכפל את עצמן או להיטמע בהערות קוד. באחת הדוגמאות אזהרת מערכת מזויפת גורמת למודל למחוק דוחות חשובים, ואז ההתקפה משכפלת את עצמה בקובץ.
הדוח מתאר גם «הזרקות מרובות שלבים», שבהן הודעה אחת משמשת נקודת מעבר להודעות נוספות שגורמות יחד לפעולה בלתי מורשית. בדוגמה של OpenAI, סוכן מבוסס GPT-5.5 שולף הוראות נוספות מ-Slack ומפרסם מחדש את ההודעה המוזרקת.
איך OpenAI מצאה אותן
GPT-Red, שהוצג ביולי, הוא מסגרת אימון בשיטת משחק עצמי שבה OpenAI משתמשת נגד prompt injection. היא מציבה מודל «תוקף» מול מודל «מגן»: התוקף מנסה לגרום למגן לבצע פעולה מזיקה, וההזרקות מתווספות לסביבת המגן.
הפעם בדקה OpenAI אם הזרקות משכפלות עצמי אפשריות בכלל. את הזרקות הדואר ומערכת הקבצים גילה מודל בסגנון GPT-Red המבוסס על GPT-5.4-mini, וגם המודל הפגיע היה מבוסס GPT-5.4-mini; שניהם נקודות מחקר פנימיות בלבד. בהערכה מרובת השלבים שימש GPT-5.5 כמודל הפגיע, כשהוא פועל בסביבת Codex וגילה את ההתקפה. הבדיקות נערכו בסביבות אימון עם מחברים כגון דואר ויומן.
ממצא מחקרי, לא אירוע
OpenAI מדגישה כי לא הבחינה בהשפעה מחוץ לקריאות הכלים המדומות באימון ובהערכה, וכי היא משתפת את הממצאים בשל «אופיים החדש».
החברה כבר פרסמה החודש כמה דוחות על התנהגות לא תואמת, בהם שישה על הוראות עצמיות, בדיית מידע, שימוש בלתי מורשה במפתחות API שהודלפו ושיתוף קבצים אסור. בתגובה, OpenAI הוסיפה שכפול עצמי ליעדי התוקף באימון GPT-Red, כדי שמודלים עתידיים יהיו עמידים יותר בפני הזרקות דומות.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.