Claude Opus 5 פותר את בעיית ה-prompt injection — האיום הגדול ביותר על אבטחת סוכני AI
ה-Opus 5 של Anthropic הוריד את שיעור הצלחת מתקפות ה-prompt injection ל-0% בסוכני דפדפן — פריצת דרך באבטחת AI.
Prompt Injection — עקב אכילס של סוכני AI
הזרקת הנחיות (prompt injection) הייתה האתגר הגדול ביותר לאבטחת סוכני AI. שיטת התקיפה פשוטה: תוקפים מסתירים הוראות זדוניות בטקסט של דפי אינטרנט שסוכן ה-AI קורא. כתוצאה מכך, ה-AI עלול לבצע פעולות לא רצויות — מדליפת מידע ועד פעולות לא מורשות. OpenAI הודתה בדצמבר 2024 שייתכן ש-prompt injection לעולם לא ייפתר לחלוטין.
מנגנון ההגנה הכפול של Opus 5
חוקרי Anthropic יישמו ב-Opus 5 את מצב Auto Mode — מערכת הגנה דו-שכבתית. השכבה הראשונה סורקת נתונים נכנסים לאיתור הוראות נסתרות לפני העיבוד. השכבה השנייה חוסמת פעולות מסוכנות לפני הביצוע. תוקף חייב לפרוץ את שתי השכבות בו-זמנית.
תוצאות בדיקה — אפס אחוזי הצלחה
ב-129 תרחישי בדיקה, Opus 5 השיג 0% הצלחה למתקפות prompt injection בסוכני דפדפן. במדד Gray Swan IPI, אחוז ההצלחה של התוקף על Opus 5 היה 2.0% בלבד, Mythos 5 — 2.6%, Fable 5 — 2.8%. זוהי פריצת דרך היסטורית באבטחת AI.