უკან დაბრუნება
Artificial Analysis-მა AI აგენტების კიბერდაცვის ტესტირებისთვის Cyber Index Alliance დააარსა
SiTech AI Team2 წთ. საკითხავი

Artificial Analysis-მა AI აგენტების კიბერდაცვის ტესტირებისთვის Cyber Index Alliance დააარსა

Artificial Analysis-მა 25 სექტემბერს Cyber Index Alliance დააარსა, რომელშიც Collinear, IBM, NVIDIA და Vercel გაერთიანდნენ. ალიანსი AI მოდელებს კიბერდაცვის ამოცანებზე ერთიანი სტანდარტით აფასებს.

Artificial Analysis-მა 25 სექტემბერს Cyber Index Alliance დააარსა და Artificial Analysis Cyber Index გამოუშვა. ინდექსი ზომავს, რამდენად კარგად ასრულებენ AI მოდელები საწარმოების კიბერდაცვის ამოცანებს. ალიანსის პირველი პარტნიორები Collinear, IBM, NVIDIA და Vercel არიან.

პარტნიორები და მათი წვლილი

Collinear-მა, რომელიც CWE-bench-ს ავითარებს, საკუთარი ბენჩმარკი დახურულ შეფასებად გადასცა; Vercel-მა იგივე DeepsecBench-ით გააკეთა. IBM და NVIDIA კი ინდექსის მოცულობისა და მეთოდოლოგიის ექსპერტულ შეფასებაში ჩაერთნენ, ახალი მონაცემებით კი არა. Artificial Analysis-ის თქმით, პარტნიორები მოდელების კიბერდაცვაში შეფასების ერთიანი სტანდარტის შექმნას ეხმარებიან.

როგორ მუშაობს ინდექსი

ინდექსი სამ ბენჩმარკს აერთიანებს და დაცვის სრულ ციკლს მოიცავს: კოდში სუსტი ადგილების ძიებას, მათ რეპროდუცირებასა და შემოწმებას და შესწორებას ისე, რომ არსებული ფუნქციონალი არ დაზიანდეს. CWE-Bench-AA 120 დახურულ ამოცანას იყენებს და OWASP Top 10-ის (2025) ათივე კატეგორიას და ექვს ენას მოიცავს. DeepsecBench-AA მხოლოდ აღმოჩენის პროცესს ამოწმებს: აგენტის მიერ ნაპოვნი სისუსტეები ექსპერტების მიერ დადასტურებულ საცნობარო სიას შეადარება. CyberGym-E2E-AA კი Berkeley RDI-ის 920 ამოცანიანი ნაკრებიდან 131 ამოცანას იღებს და C/C++ პროექტებში მეხსიერების უსაფრთხოების შეცდომებს ეძებს.

სამივე ბენჩმარკი Artificial Analysis-ის ღია კოდის აგენტურ გარემოზე, Stirrup-ზე მუშაობს. მოდელები კოდს ისე აანალიზებენ, როგორც აპლიკაციის აუდიტს ატარებს უსაფრთხოების ინჟინერი; მუშა ექსპლოიტის შექმნას არც ერთი მოდელისგან არ ითხოვენ, რადგან ექსპლოიტის რეალიზაცია დაცვაზე ორიენტირებული ინდექსის მიღმა რჩება. უსაფრთხოების მოტივით უარის თქმის შემთხვევები ქულებისგან ცალკე აღირიცხება.

პირველი შედეგები

გაშვებისას საუკეთესო მოდელი ინდექსის ამოცანების 56%-ს წყვეტს; კომბინირებულ რეიტინგში Grok 4.7 (xhigh) ლიდერობს. CWE-Bench-AA-ზე ლიდერი 68%-ს აღწევს, CyberGym-E2E-AA-ზე კი 79%-ს. DeepsecBench-AA-ზე საუკეთესო F2 ქულა 46%-ია, ხოლო უძლიერესი მოდელი ექსპერტების მიერ დადასტურებული სისუსტეების მხოლოდ 41%-ს პოულობს.

წარუმატებლობა რამდენიმე ნიმუშს მიჰყვება. თუ უარებს და დროის ლიმიტებს არ ჩავთვლით, CWE-Bench-AA-ზე ჩავარდნილი მცდელობების 55%-მა მთავარი პრობლემა გამოასწორა, თუმცა მასთან დაკავშირებული კიდევ ერთი ღია დატოვა; ზედმეტი შესწორებები, რომლებიც ლეგიტიმურ ფუნქციონალს აზიანებს, ჩავარდნების დაახლოებით 24%-ს შეადგენს. CyberGym-E2E-AA-ზე მცდელობების 42% პროგრამის ჩამომშლელი მონაცემის შექმნის გარეშე 90-წუთიან ლიმიტს მიაღწია, ექვსმა წამყვანმა მოდელმა კი, მათ შორის GPT-6 Sol, GPT-6 Astra და Claude Opus 5.5, ამოცანების სულ მცირე 98%-ზე უარი თქვა.

შემდგომი გეგმები

კომპანიამ ინდექსი სამი შეფასებით გაუშვა და სრულ დაფარვას არ დაელოდა. გეგმაშია ინციდენტებზე რეაგირება, ახალი კოდის დაწერა სისუსტეების დამატების გარეშე და ისეთი სამიზნეები, სადაც წყაროს კოდზე წვდომა არ არის, მაგალითად კომპილირებული პროგრამები და მოქმედი სერვერები.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.