חזרה
Anthropic עשויה להפנות בקשות של Claude Sonnet 5.5 למודל Sonnet 5 בגלל הגנות סייבר
SiTech AI Team2 წთ. საკითხავი

Anthropic עשויה להפנות בקשות של Claude Sonnet 5.5 למודל Sonnet 5 בגלל הגנות סייבר

לפי Anthropic, Claude Sonnet 5.5 הוא המודל הראשון בסדרת Sonnet עם מסווגי סייבר תלת-שלביים ומנגנון מעבר למודל חלופי. בקשות סייבר חסומות עוברות ל-Sonnet 5, וזה משנה את כללי העבודה של מפתחים דרך ה-API.

ניתוב מגיע גם לשכבה הזולה

Anthropic שחררה השבוע את Claude Sonnet 5.5. זהו המודל הראשון בסדרת Sonnet שמקבל מסווגי סייבר תלת-שלביים ומנגנון מעבר למודל חלופי שפותחו עבור המערכות החזקות של החברה. כך מגיע ניתוב מבוסס מסווגים לשכבה שבה צוותים רבים מריצים עומסי ייצור.

לפי Anthropic, Sonnet 5.5 אינו מקדם את חזית היכולות של החברה, אך ביכולות הסייבר שלו הוא דומה ל-Opus 5. במבחן Terminal-Bench 4.0 הוא משיג 70.6% לעומת 66.4% של Opus 5.5. כשהסינון הכיברני כבוי, הוא הגיע להרצת קוד שרירותית מלאה ב-178 מתוך 410 הרצות ExploitBench והשלים 46.1% מהאתגרים ב-CyScenarioBench של Irregular, לעומת 0.7% בלבד ב-Sonnet 5.

אכיפה תלת-שלבית

הסינון פועל בשלושה שלבים: probe שקורא את האקטיבציות הפנימיות של המודל, מסווג קל שרץ על Sonnet 5.5 עצמו, ומסווג LLM מאומן נפרד ששוקל את מסקנת ה-probe ומחליט אם לחסום שיחה. Anthropic אומרת שהמסווגים מזהים בקשות סייבר מזיקות בשיעור דומה ל-Opus 5, אך בחרה בהגנות פריצה פחות אגרסיביות משום ש-Sonnet 5.5 חלש יותר בתחום מאשר Opus 5 או Fable 5.1. המשתמשים צריכים לצפות ליותר סירובים מאשר עם Sonnet 5, כולל בעבודה לגיטימית באבטחת סייבר.

בקשות סייבר חסומות, יחד עם קבוצה צרה של בקשות הקשורות לפיתוח LLM חזיתי כמו עבודת kernel על מאיצי ML מסוימים, עוברות ל-Sonnet 5. חסימות בתחומי ביולוגיה, נשק קונבנציונלי ואנטי-דיסטילציה עוצרות את הבקשה בלי מודל חלופי, ולפי Anthropic הן אינן משנות תשובות בחשאי.

מעבר בגישה ל-API דורש הפעלה

האפליקציות של Anthropic שולחות בקשות סייבר חסומות ל-Sonnet 5 אוטומטית, אבל מפתחי API חייבים להפעיל זאת בעצמם, ופלטפורמות אחרות עשויות לטפל בבקשות חסומות באופן שונה. בלי הפעלה, בקשה חסומה פשוט נעצרת, ולכן מעבר מ-Sonnet 5 ל-Sonnet 5.5 אינו החלפה ישרה של מודל. מדיניות הסייבר עדיין מתירה איתור חולשות בקוד מקור, מה ששומר על תהליכי קידוד מאובטח, אך חוסמת זאת בקבצים בינאריים מהודרים. תיעוד התמיכה אומר שהבדיקות סוקרות כל מה שהמודל קורא, כולל זיכרון, תוכן מחברים, תוצאות חיפוש ברשת וקבצים.

מודל חלופי והזרקת פרומפט

בבדיקות סביבות הקידוד של Anthropic, 25% מהבקשות שנשלחו ל-Sonnet 5.5 טופלו בידי Sonnet 5 לאחר שחסם סייבר הופעל, לעתים קרובות מפני שהוראות מוזרקות למחוק דיסקים או קבצים הפעילו את המסווג. מתוך הבקשות שהופנו מחדש, 12.01% נפרצו בהצלחה, בעוד Sonnet 5.5 עצמו נפרץ רק בארבע מתוך 5,901 בקשות שטיפל בהן.

Anthropic אומרת שהיא עדיין מכווננת את המסווגים של Sonnet 5.5 כדי להפחית התראות שווא, ומתכננת לתת למגינים מאומתים פחות הגבלות במסגרת Cyber Verification Program מורחב. Sonnet 5.5 אינו חלק מהתוכנית עם ההשקה.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.