Назад
Artificial Analysis запустила Cyber Index Alliance разом із Collinear, IBM, NVIDIA і Vercel
SiTech AI Team2 წთ. საკითხავი

Artificial Analysis запустила Cyber Index Alliance разом із Collinear, IBM, NVIDIA і Vercel

Artificial Analysis 25 вересня 2026 року оголосила про створення Cyber Index Alliance та запуск Artificial Analysis Cyber Index, який вимірює, наскільки добре AI-моделі виконують завдання корпоративного кіберзахисту.

Artificial Analysis 25 вересня 2026 року оголосила про створення Cyber Index Alliance та запуск Artificial Analysis Cyber Index — набору бенчмарків, що вимірюють, наскільки добре AI-моделі виконують завдання корпоративного кіберзахисту. Партнерами на старті стали Collinear AI, IBM, NVIDIA та Vercel.

Партнери та їхній внесок

Collinear AI, розробник CWE-bench, передала свій бенчмарк як закриту відкладену оцінку, а Vercel зробила те саме з DeepsecBench. IBM і NVIDIA долучилися експертним внеском у визначення обсягу та методології, а не новими наборами даних. За словами Artificial Analysis, партнери допомагають встановити єдиний стандарт оцінювання моделей у кіберзахисті.

Як влаштований індекс

Індекс поєднує три оцінки, що охоплюють повний цикл захисту: пошук уразливостей у коді, їх відтворення та перевірку, а також виправлення без порушення наявної функціональності. CWE-Bench-AA використовує 120 відкладених завдань і покриває всі десять категорій OWASP Top 10 (2025) у шести мовах, від C/C++ і Go до Python і Rust. DeepsecBench-AA ізолює процес пошуку: знахідки агента в коді відкритих застосунків зіставляються з еталонним набором, перевіреним людьми-експертами. CyberGym-E2E-AA бере 131 завдання з набору Berkeley RDI на 920 завдань і шукає помилки безпеки пам'яті в проєктах C/C++, як-от FFmpeg і CPython.

Усі три працюють на Stirrup — відкритому агентному середовищі Artificial Analysis. Моделі працюють із вихідним кодом так, як це робив би інженер із безпеки під час аудиту застосунку, і жодну з них не просять створити робочий експлойт, адже реалізація експлойтів виходить за межі орієнтованого на захист індексу. Відмови з міркувань безпеки фіксуються окремо від балів.

Перші результати

На старті найкраща модель розв'язує 56% завдань індексу, а в комбінованому рейтингу лідирує Grok 4.7 (xhigh). На CWE-Bench-AA лідер сягає 68%, на CyberGym-E2E-AA — 79%. На DeepsecBench-AA найвищий бал F2 становить 46%, а найсильніша модель знаходить лише 41% уразливостей, підтверджених експертами.

Невдачі зосереджені в кількох типах. Без урахування відмов і тайм-аутів 55% невдалих спроб на CWE-Bench-AA виправили основну проблему, але залишили відкритою пов'язану з нею; надмірні виправлення, що ламають легітимну поведінку, становлять близько 24% невдач. На CyberGym-E2E-AA 42% спроб досягли 90-хвилинного ліміту, не створивши вхідних даних, які спричиняють збій програми, а шість провідних моделей, зокрема GPT-6 Sol, GPT-6 Astra і Claude Opus 5.5, відмовилися від щонайменше 98% завдань.

Подальші плани

Індекс запустили з трьома оцінками, не чекаючи повного покриття. Далі планують додати реагування на інциденти, написання нового коду без внесення уразливостей та цілі без доступу до вихідного коду, як-от скомпільовані програми й живі сервери.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.