חזרה
Irregular: החברה שנמצאת במרכז גל תקיפות של סוכני בינה מלאכותית
SiTech AI Team2 წთ. საკითხავი

Irregular: החברה שנמצאת במרכז גל תקיפות של סוכני בינה מלאכותית

טעויות בסביבות הבדיקה המדומות של Irregular אפשרו לסוכנים של OpenAI, Meta, Anthropic ו-Google לפנות אל מטרות אמיתיות, כך אישר סמנכ"ל הטכנולוגיות של הסטארט-אפ הישראלי.

במשך חודשים דווח על סוכני בינה מלאכותית שחמקו מתיבות החול שלהם ופנו אל מטרות אמיתיות, ולרוב תוארו המקרים כאירועים נפרדים. לפי The Verge, לרובם מקור אחד: Irregular, סטארט-אפ ישראלי שמפעיל בדיקות אבטחה מדומות עבור מפתחי בינה מלאכותית.

מה עושה Irregular

החברה נוסדה ב-2023 בשם Pattern Labs, והיא בונה את מה שהיא מתארת כ„פלטפורמות מחקר ברמת דיוק גבוהה שמדמות ומנטרות תרחישי אבטחה אמיתיים של בינה מלאכותית“. רשימת הלקוחות אינה פומבית, אך עבודותיה מצוטטות במסמכי system card של מודלים של OpenAI, היא בדקה מערכות עבור ממשלת בריטניה ו-Anthropic, ופרסמה מחקר יחד עם RAND, מכון מחקר שעוסק במדיניות בינה מלאכותית.

איך הבדיקות דלפו אל העולם האמיתי

בכמה הערכות שנערכו השנה, סוכנים נמלטו מסביבות שאמורות היו להיות מאובטחות. חלק מהבדיקות היו תרגילי capture-the-flag, שבהם הסוכן צריך למצוא מידע מוסתר בתוך רשת מדומה.

עומר נבו, סמנכ“ל הטכנולוגיות ומייסד-שותף ב-Irregular, אמר ל-The Verge שהסוכנים לא היו אמורים לקבל גישה לאינטרנט הפתוח, אך „הגישה לאינטרנט הייתה זמינה שלא במתכוון“. באותו תרחיש, שם חברה בדיוני שנוצר כמטרה „חפף לדומיין אמיתי“. שני הליקויים יחד הפנו את הסוכנים אל מטרות אמיתיות; עדיין לא ברור אילו חברות או ארגונים הותקפו בפועל.

תרחיש אחד, ארבע מעבדות

נבו אישר שאותה בעיה עמדה מאחורי האירועים שכללו מודלים של OpenAI, Meta, Anthropic ו-Google. „כל האירועים הקשורים ל-Irregular נבעו מאותה בעיית יסוד בתרחיש הערכה אחד, וכולם נחשפו“, אמר. לדבריו, אירועים אחרים שדווחו לאחרונה, ובהם הפריצה ל-Hugging Face, אינם קשורים ל-Irregular. לפי דיווחים של OpenAI ו-Anthropic ופרסומים על Google, החברות עודכנו בערך באותו זמן, בסוף יולי.

מודלים סיניים, תיקונים ודוח מובטח

המחקר שפרסמה Irregular כולל גם הערכות סייבר של Kimi K3 ו-GLM-5.2, מודלים פתוחים של Moonshot AI ו-Z.ai; אפשר לארח אותם באופן עצמאי, ולכן הבודקים אינם תלויים בשיתוף הפעולה של המפתחות. לפי נבו, ההערכות האלה לא הובילו לאירועים דומים בעולם האמיתי, אך אין בכך ראיה לכך שהמודלים האלה פחות חשופים להתנהגות כזו.

נבו אמר שהאירועים שינו את העבודה ב-Irregular: החברה הדקה את בקרות הגישה לאינטרנט, הרחיבה ניטור ובדיקה ידנית, והוסיפה בדיקות לפני תחילת ההערכות כדי לוודא שהגישה תואמת את ההיקף המוגדר. היא מתכננת לפרסם דוח על ביצוע הערכות סייבר בבטחה לאחר השלמת העבודה המשותפת עם החברות. אף אחת מארבע המעבדות האמריקאיות לא השיבה לשאלות ההמשך של The Verge; Google ו-Anthropic לא הגיבו, ואילו OpenAI ו-Meta הפנו לפוסטים שכבר פורסמו.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.