חזרה
בני אדם פספסו איום אחד מכל שלושה באישור פקודות של סוכן AI — כך עולה מנתוני משחק
SiTech AI Team3 წთ. საკითხავი

בני אדם פספסו איום אחד מכל שלושה באישור פקודות של סוכן AI — כך עולה מנתוני משחק

משחק דפדפן שבו שחקנים מאשרים או דוחים פקודות של סוכן קוד AI אסף יותר מ-40,000 הרצות. השחקנים פספסו איום אחד מכל שלושה, והדיוק הממוצע עמד על 66.3%.

נתונים ממשחק דפדפן שבו שחקנים מאשרים או דוחים פקודות של סוכן קוד AI מרמזים שבדיקת "אדם בתוך הלולאה" היא גבול אבטחה חלש. בפוסט שפורסם ב-5 באוגוסט מדווח המפתח אלכס ווטרס כי המשחק צבר יותר מ-40,000 הרצות ו-409,000 החלטות אישור או דחייה. חלק מהפקודות שגרתיות — כמו git status או npm test — ואחרות מעידות שהסוכן נפרץ ושולח סודות לשרת חיצוני. השחקן הממוצע פספס איום אחד מכל שלושה, כלומר דיוק ממוצע של 66.3%.

המספרים המרכזיים

כמעט שליש מההרצות — 32.9% — הסתיימו בציון שלילי: קנסות על אישור איומים וחסימת פקודות בטוחות הכריעו את כל מה שנעשה נכון. כ-35.2% מהשחקנים זיהו כל איום, אבל רק 20.8% עשו זאת תוך חסימת לכל היותר אחת מכל חמש פקודות בטוחות; השאר הגיעו לשם בחלקו בזכות חסימה גורפת של הכול. ו-7% מהשחקנים אישרו כל פקודה. הכותב מציין הסתייגות: כ-34% מהפקודות במשחק היו איומים — הרבה יותר מאשר בעבודה יומיומית — אם כי לדבריו הלחץ האמיתי לספק מהר יכול לייצר אישורים נמהרים דומים.

אילו איומים חומקים

שיעורי הפספוס השתנו בחדות לפי קטגוריה. פקודות הרסניות בעליל כמו rm -rf / נתפסו באופן האמין ביותר — 11.7% פספוס. שינויים מתמשכים, כמו הזרקת crontab או השתלטות על git config, פוספסו ב-23.8% מהמקרים; הדלפת מידע והרצת קוד — קריאות curl ל-API לא מוכרים וחבילות עם שמות מתחזים — ב-33.4%; והפרות תחום, כמו קריאת ~/.aws/credentials, פוספסו הכי הרבה — 35.0%. הפקודה הבודדת שפוספסה ביותר הייתה npm run analyze, שאושרה על ידי 64.7% מהשחקנים, אף שלוג ההיסטוריה הראה סקריפט חשוד ב-package.json; npm run setup ו-npm run deploy נכנסו גם הן לעשירייה הראשונה. במצטבר, שלוש פקודות ה-npm run פוספסו ב-52.5% מהמקרים, לעומת 28.4% בשאר תקיפות מסוג הדלפה.

עייפות וחסימת יתר

שיעורי הפספוס גם עלו לקראת סוף ההרצות — מה שמתאים ל"עייפות הרשאות", תופעה שהודתה בה גם Anthropic ביחס ל-Claude Code: ככל שמשתמש רואה יותר אישורים, כך הוא מקדיש לכל אחד מהם פחות תשומת לב. גם הטעות ההפוכה הייתה נפוצה: פקודות תמימות נדחו שוב ושוב, ובהן הגדרת מראה פנימית עם npm config set registry (נחסמה ב-59% מהמקרים), rm -rf dist/ (45%) ופקודה לשחרור פורט של שרת (43%). המקרה השנוי ביותר במחלוקת היה cat ~/.zshrc, שאושרה על ידי 45.9% מהשחקנים.

המסקנה

הכותב מודה שמדובר במשחק ולא במחקר אקדמי, אך טוען שהניסוי מדגים את הבעיות שבהסתמכות על "אדם בתוך הלולאה" כגבול אבטחה לסוכני AI: רעש רב מייצר עייפות, ולמפתחים אין תמיד את ההקשר לשפוט מה השתנה, ועקיפת האישורים הופכת לאטרקטיבית. המלצתו היא להשקיע ב-sandboxing ובבידוד הקשר קפדני, ולהעניק לסוכנים הרשאות רחבות רק לאחר שמנגנוני ההגנה האלה קיימים.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.