Geri Dön
Artificial Analysis, Collinear, IBM, NVIDIA ve Vercel ile Cyber Index Alliance'ı kurdu
SiTech AI Team2 წთ. საკითხავი

Artificial Analysis, Collinear, IBM, NVIDIA ve Vercel ile Cyber Index Alliance'ı kurdu

Artificial Analysis, 25 Eylül 2026'da Cyber Index Alliance'ı ve Artificial Analysis Cyber Index'i duyurdu. Endeks, AI modellerinin kurumsal siber savunma görevlerindeki performansını ölçüyor.

Artificial Analysis, 25 Eylül 2026'da Cyber Index Alliance'ı ve Artificial Analysis Cyber Index'i duyurdu. Endeks, AI modellerinin kurumsal siber savunma görevlerini ne kadar iyi yerine getirdiğini ölçen bir test paketi. Kuruluş ortakları Collinear AI, IBM, NVIDIA ve Vercel.

Ortaklar ve katkıları

CWE-bench'in geliştiricisi Collinear AI, testini kapalı bir değerlendirme olarak paylaştı; Vercel de aynısını DeepsecBench ile yaptı. IBM ve NVIDIA ise yeni veri setleriyle değil, endeksin kapsamı ve metodolojisi üzerine uzman görüşüyle katıldı. Artificial Analysis'e göre ortaklar, modellerin siber savunmada değerlendirilmesi için ortak bir standart belirlenmesine yardımcı oluyor.

Endeks nasıl çalışıyor

Endeks, savunma döngüsünün tamamını kapsayan üç değerlendirmeyi birleştiriyor: kodda zafiyet bulma, bunları yeniden üretip doğrulama ve mevcut işlevselliği bozmadan yamalama. CWE-Bench-AA, OWASP Top 10 (2025) kategorilerinin tamamını ve altı dili kapsayan 120 kapalı görev kullanıyor. DeepsecBench-AA yalnızca keşif aşamasını ölçüyor: ajanın açık kaynak uygulama kodundaki bulguları, insan uzmanların doğruladığı altın setle karşılaştırılıyor. CyberGym-E2E-AA ise Berkeley RDI'nin 920 görevlik setinden 131 görev alıyor ve FFmpeg, CPython gibi C/C++ projelerinde bellek güvenliği hatalarını hedefliyor.

Üçü de şirketin açık kaynaklı ajan ortamı Stirrup üzerinde çalışıyor. Modeller, bir güvenlik mühendisinin uygulamayı denetlemesi gibi kaynak koddan çalışıyor ve hiçbir modelden çalışan bir exploit üretmesi istenmiyor; exploit geliştirme, savunmaya odaklı bir endeksin kapsamı dışında kalıyor. Güvenlik gerekçeli reddetmeler puanlardan ayrı kaydediliyor.

İlk sonuçlar

Lansmanda en iyi model endeks görevlerinin %56'sını çözüyor ve birleşik sıralamada Grok 4.7 (xhigh) lider. CWE-Bench-AA'da lider %68'e, CyberGym-E2E-AA'da %79'a ulaşıyor. DeepsecBench-AA'da en yüksek F2 puanı %46 ve en güçlü model, uzmanların doğruladığı sorunların yalnızca %41'ini buluyor.

Başarısızlıklar birkaç desende toplanıyor. Reddetmeler ve zaman aşımları hariç tutulduğunda CWE-Bench-AA'da başarısız denemelerin %55'i ana sorunu düzeltti ama bağlantılı başka bir sorunu açık bıraktı; meşru davranışı bozan aşırı düzeltmeler ise başarısızlıkların yaklaşık %24'ünü oluşturuyor. CyberGym-E2E-AA'da denemelerin %42'si programı çökerten bir girdi üretmeden 90 dakikalık sınıra ulaştı ve GPT-6 Sol, GPT-6 Astra ile Claude Opus 5.5 dahil altı öncü model görevlerin en az %98'ini reddetti.

Sonraki planlar

Endeks, tam kapsamı beklemeden üç değerlendirmeyle yayına alındı. Planlar arasında olay müdahalesi, zafiyet eklemeden yeni kod yazma ve derlenmiş yazılımlar ile çalışan sunucular gibi kaynak koduna erişimin olmadığı hedefler var.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.