
Artificial Analysis Collinear, IBM, NVIDIA və Vercel ilə Cyber Index Alliance-ı yaradıb
Artificial Analysis 25 sentyabr 2026-cı ildə Cyber Index Alliance-ın yaradıldığını və Artificial Analysis Cyber Index-in istifadəyə verildiyini bildirib. İndeks AI modellərinin korporativ kibermüdafiə tapşırıqlarındakı fəaliyyətini ölçür.
Artificial Analysis 25 sentyabr 2026-cı ildə Cyber Index Alliance-ın yaradıldığını və Artificial Analysis Cyber Index-in istifadəyə verildiyini bildirib. İndeks AI modellərinin korporativ kibermüdafiə tapşırıqlarındakı fəaliyyətini ölçən testlər toplusudur. Başlanğıc tərəfdaşları Collinear AI, IBM, NVIDIA və Vercel-dir.
Tərəfdaşlar və onların töhfəsi
CWE-bench-in hazırlayıcısı Collinear AI öz testini qapalı qiymətləndirmə kimi təqdim edib, Vercel isə eyni şeyi DeepsecBench ilə edib. IBM və NVIDIA isə yeni məlumat dəstləri ilə deyil, indeksin əhatə dairəsi və metodologiyası üzrə ekspert rəyi ilə qoşulub. Artificial Analysis-in sözlərinə görə, tərəfdaşlar modellərin kibermüdafiədə qiymətləndirilməsi üçün vahid standartın yaradılmasına kömək edir.
İndeks necə işləyir
İndeks müdafiə dövrünü tam əhatə edən üç qiymətləndirməni birləşdirir: koddakı zəifliklərin aşkarlanması, onların təkrar yaradılması və təsdiqlənməsi, həmçinin mövcud funksionallığı pozmadan düzəldilməsi. CWE-Bench-AA 120 qapalı tapşırıqdan istifadə edir və OWASP Top 10 (2025) kateqoriyalarının hamısını, həmçinin altı dili əhatə edir. DeepsecBench-AA yalnız aşkarlama mərhələsini yoxlayır: agentin tapdığı nəticələr mütəxəssislərin təsdiqlədiyi istinad dəsti ilə tutuşdurulur. CyberGym-E2E-AA isə Berkeley RDI-nin 920 tapşırıqlı dəstindən 131 tapşırıq götürür və C/C++ layihələrində yaddaş təhlükəsizliyi xətalarını hədəfləyir.
Hər üçü Artificial Analysis-in açıq mənbəli agent mühiti Stirrup üzərində işləyir. Modellər mənbə kodu ilə təhlükəsizlik mühəndisi kimi işləyir və heç bir modeldən işlək eksploit yaratmaq tələb olunmur, çünki eksploitin reallaşdırılması müdafiəyə yönəlmiş indeksin kənarında qalır. Təhlükəsizlik səbəbilə imtinalar ballardan ayrı qeyd olunur.
İlk nəticələr
Başlanğıcda ən yaxşı model indeks tapşırıqlarının 56%-ni həll edir və birləşmiş reytinqdə Grok 4.7 (xhigh) liderdir. CWE-Bench-AA-da lider 68%-ə, CyberGym-E2E-AA-da isə 79%-ə çatır. DeepsecBench-AA-da ən yüksək F2 balı 46%-dir və ən güclü model mütəxəssislərin təsdiqlədiyi zəifliklərin yalnız 41%-ni tapır.
Uğursuzluqlar bir neçə qanunauyğunluq üzrə toplanır. İmtinalar və vaxt limitləri nəzərə alınmadan CWE-Bench-AA-da uğursuz cəhdlərin 55%-i əsas problemi düzəldib, lakin bağlı olan digərini açıq saxlayıb; qanuni davranışı pozan həddindən artıq düzəlişlər isə uğursuzluqların təxminən 24%-ni təşkil edir. CyberGym-E2E-AA-da cəhdlərin 42%-i proqramı çökdürən giriş yaratmadan 90 dəqiqəlik limitə çatıb, GPT-6 Sol, GPT-6 Astra və Claude Opus 5.5 də daxil olmaqla altı aparıcı model tapşırıqların ən azı 98%-dən imtina edib.
Növbəti planlar
İndeks tam əhatəni gözləmədən üç qiymətləndirmə ilə istifadəyə verilib. Planlara insidentlərə cavab, zəiflik yaratmadan yeni kod yazma və mənbə koduna çıxışı olmayan hədəflər daxildir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.