
Artificial Analysis משיקה את Cyber Index Alliance עם Collinear, IBM, NVIDIA ו-Vercel
Artificial Analysis הכריזה ב-25 בספטמבר 2026 על הקמת Cyber Index Alliance לצד השקת Artificial Analysis Cyber Index, המודד עד כמה טוב מתמודדים מודלי AI עם משימות הגנת סייבר ארגוניות.
חברת Artificial Analysis הכריזה ב-25 בספטמבר 2026 על הקמת Cyber Index Alliance ועל השקת Artificial Analysis Cyber Index — מערך מבחנים המודד עד כמה טוב מתמודדים מודלי AI עם משימות הגנת סייבר ארגוניות. שותפות ההשקה הן Collinear AI, IBM, NVIDIA ו-Vercel.
השותפות ותרומתן
Collinear AI, מפתחת CWE-bench, תרמה את המבחן שלה כהערכה סגורה שאינה חשופה, ו-Vercel עשתה זאת עם DeepsecBench. IBM ו-NVIDIA הצטרפו בתרומת מומחיות להגדרת ההיקף והמתודולוגיה ולא בנתונים חדשים. לפי Artificial Analysis, השותפות מסייעות לקבוע תקן אחיד להערכת מודלים בהגנת סייבר ועשויות לתרום מערכי נתונים ומחקרים חיצוניים. ארגונים המעוניינים להצטרף יכולים לפנות בדואר אלקטרוני.
כיצד פועל המדד
המדד משלב שלוש הערכות המכסות את מלוא מעגל ההגנה: איתור חולשות בקוד, שחזור ואימות שלהן, ותיקון בלי לשבור תפקוד קיים. CWE-Bench-AA משתמש ב-120 משימות סגורות ומכסה את כל עשרת הקטגוריות של OWASP Top 10 (2025) בשש שפות, מ-C/C++ ו-Go ועד Python ו-Rust. DeepsecBench-AA מבודד את שלב האיתור: הממצאים של הסוכן בקוד יישומים בקוד פתוח נמדדים מול סט מוזהב שאומת בידי מומחים. CyberGym-E2E-AA שואב 131 משימות ממערך Berkeley RDI המונה 920 משימות ומתמקד בבאגים של אבטחת זיכרון בפרויקטי C/C++, כמו FFmpeg ו-CPython.
שלושתם רצים על Stirrup, סביבת הסוכנים בקוד פתוח של Artificial Analysis. המודלים עובדים מתוך קוד המקור כפי שמהנדס אבטחה היה מבקר יישום, ואף מודל לא מתבקש לבנות ניצול עובד, משום שמימוש ניצולים מחוץ לתחום של מדד ממוקד הגנה. סירובים מטעמי בטיחות נרשמים בנפרד מהציונים.
התוצאות הראשונות
בהשקה המודל הטוב ביותר פותר 56% ממשימות המדד, כש-Grok 4.7 (xhigh) בראש הדירוג המשולב. ב-CWE-Bench-AA המוביל מגיע ל-68% וב-CyberGym-E2E-AA ל-79%. ב-DeepsecBench-AA ציון ה-F2 הגבוה הוא 46%, והמודל החזק ביותר מאתר רק 41% מהחולשות שאומתו בידי מומחים.
הכישלונות מתקבצים בכמה דפוסים. בלי סירובים והפסקות זמן, 55% מהניסיונות הכושלים ב-CWE-Bench-AA תיקנו את הבעיה המרכזית אך השאירו בעיה קשורה פתוחה, ותיקוני יתר ששוברים התנהגות לגיטימית מהווים כ-24% מהכישלונות. ב-CyberGym-E2E-AA, 42% מהניסיונות הגיעו למגבלת 90 הדקות בלי לייצר קלט שמפיל את התוכנית, ושישה מודלים מובילים, ובהם GPT-6 Sol, GPT-6 Astra ו-Claude Opus 5.5, סירבו לפחות ל-98% מהמשימות.
התוכניות להמשך
המדד הושק עם שלוש הערכות ולא חיכה לכיסוי מלא. בהמשך מתוכננים להוסיף תגובה לאירועים, כתיבת קוד חדש בלי להכניס חולשות, ויעדים בלי גישה לקוד מקור, כמו תוכנות מקומפלות ושרתים פעילים.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.