
Artificial Analysis-ը Collinear, IBM, NVIDIA և Vercel-ի հետ ստեղծել է Cyber Index Alliance
Artificial Analysis-ը սեպտեմբերի 25-ին հայտարարել է Cyber Index Alliance-ի ստեղծման և Artificial Analysis Cyber Index-ի մեկնարկի մասին։ Ինդեքսը չափում է AI մոդելների աշխատանքը կորպորատիվ կիբերպաշտպանության առաջադրանքներում։
Artificial Analysis-ը 2026 թ. սեպտեմբերի 25-ին հայտարարել է Cyber Index Alliance-ի ստեղծման և Artificial Analysis Cyber Index-ի մեկնարկի մասին։ Ինդեքսը թեստերի հավաքածու է, որը չափում է AI մոդելների աշխատանքը կորպորատիվ կիբերպաշտպանության առաջադրանքներում։ Մեկնարկային գործընկերներն են Collinear AI-ն, IBM-ը, NVIDIA-ն և Vercel-ը։
Գործընկերները և նրանց ներդրումը
CWE-bench-ի մշակող Collinear AI-ն իր թեստը տրամադրել է որպես փակ գնահատում, նույնը DeepsecBench-ով արել է Vercel-ը։ IBM-ը և NVIDIA-ն միացել են ինդեքսի շրջանակին ու մեթոդաբանությանը վերաբերող փորձագիտական ներդրմամբ, ոչ թե տվյալների հավաքածուներով։ Artificial Analysis-ի խոսքով՝ գործընկերները օգնում են սահմանել մոդելների գնահատման միասնական ստանդարտ կիբերպաշտպանության ոլորտում։
Ինչպես է աշխատում ինդեքսը
Ինդեքսը միավորում է երեք գնահատում, որոնք ընդգրկում են պաշտպանության ամբողջ ցիկլը՝ խոցելիությունների հայտնաբերումը, դրանց վերարտադրումն ու ստուգումը և ուղղումը՝ առանց ֆունկցիոնալությունը վնասելու։ CWE-Bench-AA-ն օգտագործում է 120 փակ առաջադրանք և ընդգրկում է OWASP Top 10 (2025) բոլոր տասը կատեգորիաները վեց լեզուներով։ DeepsecBench-AA-ն առանձնացնում է հայտնաբերման փուլը. գործակալի գտածոները բաց կոդով հավելվածների կոդում համեմատվում են փորձագետների կողմից ստուգված էտալոնային ցանկի հետ։ CyberGym-E2E-AA-ն վերցնում է 131 առաջադրանք Berkeley RDI-ի 920 առաջադրանքից բաղկացած հավաքածուից և թիրախավորում է հիշողության անվտանգության սխալները C/C++ նախագծերում։
Երեքն էլ աշխատում են Stirrup-ի՝ բաց կոդով գործակալային միջավայրի վրա։ Մոդելները աշխատում են սկզբնական կոդից, ինչպես անվտանգության ինժեները հավելվածը ստուգելիս, և ոչ մեկից աշխատող էքսպլոյթ չի պահանջվում. էքսպլոյթի իրականացումը դուրս է ինդեքսի շրջանակից։ Անվտանգության նկատառումներով մերժումները գրանցվում են միավորներից առանձին։
Առաջին արդյունքները
Մեկնարկի պահին լավագույն մոդելը լուծում է ինդեքսի առաջադրանքների 56%-ը, իսկ համակցված վարկանիշում առաջինն է Grok 4.7 (xhigh)-ը։ CWE-Bench-AA-ում առաջատարը հասնում է 68%-ի, CyberGym-E2E-AA-ում՝ 79%-ի։ DeepsecBench-AA-ում ամենաբարձր F2 միավորը 46% է, իսկ ամենաուժեղ մոդելը գտնում է փորձագետների հաստատած խոցելիությունների միայն 41%-ը։
Անհաջողությունները կենտրոնանում են մի քանի օրինաչափության մեջ։ Առանց մերժումների՝ CWE-Bench-AA-ում ձախողված փորձերի 55%-ը ուղղել է հիմնական խնդիրը, սակայն բաց է թողել դրա հետ կապված մյուսը, իսկ օրինական վարքագիծը կոտրող ավելորդ ուղղումները կազմում են ձախողումների մոտ 24%-ը։ CyberGym-E2E-AA-ում փորձերի 42%-ը հասել է 90 րոպեի սահմանին՝ չստեղծելով ծրագիրը վթարի ենթարկող մուտք, իսկ վեց առաջատար մոդելներ, այդ թվում GPT-6 Sol-ը, GPT-6 Astra-ն և Claude Opus 5.5-ը, մերժել են առաջադրանքների առնվազն 98%-ը։
Հետագա ծրագրերը
Ինդեքսը մեկնարկել է երեք գնահատումով՝ չսպասելով ամբողջական ընդգրկմանը։ Ծրագրերում են միջադեպերին արձագանքը, առանց խոցելիությունների նոր կոդ գրելը և առանց կոդի հասանելիության թիրախները։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։