חזרה →
SiTech Team⏱️ 1 წთ. საკითხავი

ל-LLMs יש פגם אבטחה יסודי — וייתכן שהוא בלתי ניתן לפתרון

ל-LLMs יש פגם אבטחה יסודי — וייתכן שהוא בלתי ניתן לפתרון

מחקר שהוצג ב-ICML 2026 חושף של-LLMs יש פגם יסודי באופן שבו הן עוקבות אחר תפקידים. Chain-of-Thought Forgery שובר את כל המודלים

ל-LLMs יש פגם אבטחה יסודי — וייתכן שהוא בלתי ניתן לפתרון

מחקר שהוצג בוועידת ICML 2026 חשף בעיית אבטחה יסודית במודלי שפה גדולים (LLMs): הם מזהים תפקידי טקסט לא לפי תגיות <user> או <system>, אלא לפי סגנון הכתיבה. משמעות הדבר היא שהחלפת התגיות אינה משפיעה כלל על האופן שבו המודל מפרש את הטקסט.

Chain-of-Thought Forgery — מתקפה חדשה

החוקרים פיתחו מתקפה בשם Chain-of-Thought Forgery (זיוף שרשרת המחשבה), המחקה את סגנון החשיבה של המודל עצמו. באמצעות מתקפה זו, הם הצליחו להונות את GPT-5 לספק הוראות לייצור קוקאין, פשוט על ידי זיוף שרשרת המחשבה הפנימית של המודל.

אילו מודלים פגיעים

הבעיה השפיעה על מודלים של OpenAI, Anthropic, Alibaba ו-DeepSeek. אפילו GPT-5.4 סיפק הוראות להתאבדות תחת מתקפה זו. המחקר זכה בתחרות red-teaming של OpenAI באוגוסט 2025.

בעיה בלתי פתירה

החוקרים הגיעו למסקנה כי בעיה זו היא יסודית ובלתי פתירה בארכיטקטורת ה-LLM הנוכחית. מאחר שהמודלים מאומנים על טקסט ומכלילים דפוסי סגנון במקום לציית לתגיות קשיחות, כל מערכת הנשענת על הפרדת תפקידים (למשל, הבחנה בין הנחיות מערכת לקלט משתמש) חשופה פוטנציאלית למתקפה.

השלכות

לתגלית זו השלכות חמורות על מערכות קריטיות המשתמשות ב-LLMs: סינון תוכן, ייעוץ משפטי, המלצות רפואיות, עסקאות פיננסיות וכל תרחיש שבו ההבחנה בין מקורות סמכותיים לקלט משתמש היא קריטית.