Վերադառնալ
Artificial Analysis-ը Collinear, IBM, NVIDIA և Vercel-ի հետ ստեղծել է Cyber Index Alliance
SiTech AI Team2 წთ. საკითხავი

Artificial Analysis-ը Collinear, IBM, NVIDIA և Vercel-ի հետ ստեղծել է Cyber Index Alliance

Artificial Analysis-ը սեպտեմբերի 25-ին հայտարարել է Cyber Index Alliance-ի ստեղծման և Artificial Analysis Cyber Index-ի մեկնարկի մասին։ Ինդեքսը չափում է AI մոդելների աշխատանքը կորպորատիվ կիբերպաշտպանության առաջադրանքներում։

Artificial Analysis-ը 2026 թ. սեպտեմբերի 25-ին հայտարարել է Cyber Index Alliance-ի ստեղծման և Artificial Analysis Cyber Index-ի մեկնարկի մասին։ Ինդեքսը թեստերի հավաքածու է, որը չափում է AI մոդելների աշխատանքը կորպորատիվ կիբերպաշտպանության առաջադրանքներում։ Մեկնարկային գործընկերներն են Collinear AI-ն, IBM-ը, NVIDIA-ն և Vercel-ը։

Գործընկերները և նրանց ներդրումը

CWE-bench-ի մշակող Collinear AI-ն իր թեստը տրամադրել է որպես փակ գնահատում, նույնը DeepsecBench-ով արել է Vercel-ը։ IBM-ը և NVIDIA-ն միացել են ինդեքսի շրջանակին ու մեթոդաբանությանը վերաբերող փորձագիտական ներդրմամբ, ոչ թե տվյալների հավաքածուներով։ Artificial Analysis-ի խոսքով՝ գործընկերները օգնում են սահմանել մոդելների գնահատման միասնական ստանդարտ կիբերպաշտպանության ոլորտում։

Ինչպես է աշխատում ինդեքսը

Ինդեքսը միավորում է երեք գնահատում, որոնք ընդգրկում են պաշտպանության ամբողջ ցիկլը՝ խոցելիությունների հայտնաբերումը, դրանց վերարտադրումն ու ստուգումը և ուղղումը՝ առանց ֆունկցիոնալությունը վնասելու։ CWE-Bench-AA-ն օգտագործում է 120 փակ առաջադրանք և ընդգրկում է OWASP Top 10 (2025) բոլոր տասը կատեգորիաները վեց լեզուներով։ DeepsecBench-AA-ն առանձնացնում է հայտնաբերման փուլը. գործակալի գտածոները բաց կոդով հավելվածների կոդում համեմատվում են փորձագետների կողմից ստուգված էտալոնային ցանկի հետ։ CyberGym-E2E-AA-ն վերցնում է 131 առաջադրանք Berkeley RDI-ի 920 առաջադրանքից բաղկացած հավաքածուից և թիրախավորում է հիշողության անվտանգության սխալները C/C++ նախագծերում։

Երեքն էլ աշխատում են Stirrup-ի՝ բաց կոդով գործակալային միջավայրի վրա։ Մոդելները աշխատում են սկզբնական կոդից, ինչպես անվտանգության ինժեները հավելվածը ստուգելիս, և ոչ մեկից աշխատող էքսպլոյթ չի պահանջվում. էքսպլոյթի իրականացումը դուրս է ինդեքսի շրջանակից։ Անվտանգության նկատառումներով մերժումները գրանցվում են միավորներից առանձին։

Առաջին արդյունքները

Մեկնարկի պահին լավագույն մոդելը լուծում է ինդեքսի առաջադրանքների 56%-ը, իսկ համակցված վարկանիշում առաջինն է Grok 4.7 (xhigh)-ը։ CWE-Bench-AA-ում առաջատարը հասնում է 68%-ի, CyberGym-E2E-AA-ում՝ 79%-ի։ DeepsecBench-AA-ում ամենաբարձր F2 միավորը 46% է, իսկ ամենաուժեղ մոդելը գտնում է փորձագետների հաստատած խոցելիությունների միայն 41%-ը։

Անհաջողությունները կենտրոնանում են մի քանի օրինաչափության մեջ։ Առանց մերժումների՝ CWE-Bench-AA-ում ձախողված փորձերի 55%-ը ուղղել է հիմնական խնդիրը, սակայն բաց է թողել դրա հետ կապված մյուսը, իսկ օրինական վարքագիծը կոտրող ավելորդ ուղղումները կազմում են ձախողումների մոտ 24%-ը։ CyberGym-E2E-AA-ում փորձերի 42%-ը հասել է 90 րոպեի սահմանին՝ չստեղծելով ծրագիրը վթարի ենթարկող մուտք, իսկ վեց առաջատար մոդելներ, այդ թվում GPT-6 Sol-ը, GPT-6 Astra-ն և Claude Opus 5.5-ը, մերժել են առաջադրանքների առնվազն 98%-ը։

Հետագա ծրագրերը

Ինդեքսը մեկնարկել է երեք գնահատումով՝ չսպասելով ամբողջական ընդգրկմանը։ Ծրագրերում են միջադեպերին արձագանքը, առանց խոցելիությունների նոր կոդ գրելը և առանց կոդի հասանելիության թիրախները։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։