שיטת GRAM של Anthropic: 'מתג כיבוי' לידע דו-שימושי במודלי AI
Anthropic ו-AE Studio הציגו את שיטת GRAM (Gradient-Routed Auxiliary Modules) — שיטה מהפכנית המאפשרת למודלי AI להפעיל או לנטרל ידע מסוכן (וירולוגיה, אבטחת סייבר, פיזיקה גרעינית) בתוך מודל יחיד.
מבוא: בעיית הידע הדו-שימושי
ככל שהבינה המלאכותית מתקדמת, אחד האתגרים הגדולים ביותר העומדים בפני חברות AI הוא כיצד לנהל את הידע שהמודלים שלהן צוברים. מודלי AI מתקדמים, כמו Claude של Anthropic, הם מאגרי מידע עצומים. חלק ניכר מהידע הזה הוא דו-שימושי — ניתן ליישם אותו למטרות מועילות ומזיקות גם יחד.
מדוע הגישות הנוכחיות אינן מספיקות
כיום, חברות AI מסתמכות בעיקר על שני מנגנוני הגנה: אימון מודלים לסרב לבקשות מזיקות (refusal training) ופריסת מסווגים שבודקים קלט ופלט לתוכן מסוכן. המגבלה הבסיסית היא שהן אינן משנות את הידע המאוחסן בתוך המודל.
מהי GRAM?
GRAM (Gradient-Routed Auxiliary Modules) היא שיטה שפותחה על ידי Anthropic בשיתוף AE Studio. הרעיון פשוט באלגנטיות: לספק למודל תאים ייעודיים ניתנים להסרה עבור כל קטגוריה של ידע דו-שימושי.
תוצאות ניסויים
Anthropic בדקה את GRAM בשלושה תרחישים בעלי מורכבות גוברת. בגודל של 50 מיליון עד 5 מיליארד פרמטרים, GRAM התאימה לביצועי סינון נתונים.
מסקנה
שיטת GRAM של Anthropic מייצגת צעד משמעותי קדימה במחקר בטיחות AI. היא מספקת 'מתג כיבוי' לידע מסוכן תוך שמירה על ביצועי המודל.