חזרה
Anthropic התנצלה על אמצעי הגנה סמויים ב-Claude Fable
SiTech AI Team2 წთ. საკითხავი

Anthropic התנצלה על אמצעי הגנה סמויים ב-Claude Fable

‏Anthropic הודתה ששינוי תשובות בשקט למי שנחשד בניסיון זיקוק היה פשרה שגויה, ואמרה שמעתה המשתמשים יראו מתי Claude Fable 5 מעביר שאילתה ל-Opus 4.8. השינוי מגיע אחרי ביקורת חריפה של חוקרי בינה מלאכותית.

‏Anthropic התנצלה על כך שהאטה בשקט את המודל החדש שלה, Claude Fable 5, באמצעות אמצעי הגנה נסתרים שפגעו גם בחוקרים וגם במתחרים שניסו להשתמש בו כדי לבנות מערכות מתחרות. החברה אומרת שהיא משנה כיוון ותהיה שקופה יותר לגבי מועד כניסת ההגבלות לתוקף — גם אם המשמעות היא ש-Fable תסרב ליותר שאילתות.

הגנה נסתרת ואחר כך התנצלות

‏Fable היא המודל הראשון בזמינות רחבה במחלקת Mythos של Anthropic — משפחה שהחברה הזהירה חודשים שהיא מסוכנת מדי לפרסום פומבי. לפי Anthropic, חלק מהסיכונים טופלו באמצעות אמצעי הגנה שחוסמים שאילתות "בסיכון גבוה" מסוימות. אחד התחומים המוגבלים הוא זיקוק (distillation) — שיטה לאימון מודלים קטנים על פלט של מודלים גדולים. בכרטיס המערכת של Fable נכתב שהחברה תטפל בניסיונות זיקוק לכאורה על ידי שינוי והנמכת התשובות ישירות, בלי ליידע את המשתמשים שהאמצעי הופעל או שהתשובות שונו.

מעתה — הפניה ל-Opus 4.8

הגישה הזו משתנה כעת. שאילתות שנראות כניסיון זיקוק יופנו ל-Claude Opus 4.8, המודל המוביל הקודם של החברה, כך נמסר בפוסט ב-X. המשתמשים יקבלו הודעה כשזה יקרה: "תראו זאת בכל פעם שזה קורה". המנגנון דומה לאופן שבו Fable מתמודדת עם תחומי סיכון אחרים — ביולוגיה, כימיה ואבטחת סייבר — שבהם שאילתות מופנות ל-Opus 4.8, אלא אם הן נחסמות לחלוטין לפי כללים רחבים יותר בנוגע לסמים, נשק ותוכן אסור אחר. בביולוגיה, אמצעי ההגנה כוילו במידה כה רחבה עד ש-Fable אינה שמישה כמעט לשאלות בסיסיות — כך אישר ל-The Verge דובר Anthropic, פארוּל מהשווארי.

ביקורת מצד החוקרים

המהפך בא לאחר ביקורת חריפה של קהילת המחקר בתחום הבינה המלאכותית, שהזהירה שהגבלה שקטה של משתמשים החשודים בזיקוק Fable עלולה לפגוע גם בצדדים שלישיים שמנסים להעריך את המודל. בכרטיס המערכת טענה Anthropic שהיכולת של מודלים חדשים להאיץ את פיתוח הבינה המלאכותית מצדיקה הגבלת בקשות כאלה, וציינה: "שימוש ב-Claude לפיתוח מודלים מתחרים כבר מפר את תנאי השירות שלנו". החברה האשימה בעבר מתחרים סיניים כמו DeepSeek בזיקוק מודלים שלה בקנה מידה "תעשייתי".

בפוסט ב-X הסבירה Anthropic את הפשרה שבחרה: "אפשר לבדוק אמצעי הגנה גלויים, ולכן הם חייבים להיות עמידים, וזה דורש זמן. אמצעי הגנה נסתרים אפשר למקד בצורה צרה יותר, וכך לשחרר מהר עם מעט מאוד חיוביים שגויים. בחרנו באמצעי הגנה נסתרים מהסיבה הזו — וזו הייתה הפשרה השגויה. ראוי שתהיה לכם שקיפות לגבי אמצעי ההגנה שאנו מפעילים, ומדוע. אנו מצטערים שלא הצלחנו לאזן נכון".

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.