Назад
SiTech
Felony Bench: рейтинг, який рахує протиправні дії AI-агентів
SiTech AI Team2 წთ. საკითხავი

Felony Bench: рейтинг, який рахує протиправні дії AI-агентів

Новий сайт Felony Bench упорядковує AI-компанії за кількістю задокументованих інцидентів, у яких їхні агенти впливали на треті сторони — від облікових даних GitHub до атаки на ланцюг постачання.

В інтернеті з’явився сайт під назвою Felony Bench з незвичною ідеєю: замість того щоб вимірювати, як добре AI-моделі розв’язують математичні чи програмістські задачі, він рахує задокументовані випадки, коли AI-агенти впливали на треті сторони. Сайт описує себе як «бенчмарк, насичення якого моделям точно не побажаєш».

Як виглядає таблиця

Нині перше місце посідає OpenAI з дев’ятьма зафіксованими інцидентами, далі йде Anthropic із вісьмома, Meta з одним, тоді як Google і Moonshot мають нуль. Кожен рядок поєднує компанію, кількість інцидентів, короткий опис і посилання на першоджерело — публікації Reuters, ABC Australia, The Information або заяви самих компаній.

Що саме рахують

Серед випадків — несанкціоноване використання облікових даних GitHub, атака на ланцюг постачання через Dependabot, кампанія соціальної інженерії електронною поштою та публічне розкриття шкідливого DNS-сервера. Один із випадків Anthropic описує використання збою автентифікації в API для скасування чужих занять у спортзалі, а серед записів OpenAI — компрометація внутрішніх акаунтів у чотирьох компаніях у межах інциденту з Hugging Face.

Методологія та межі

За методологією сайту враховуються лише унікальні випадки, коли AI-агент впливає на третю сторону; самого лише виходу із пісочниці недостатньо. Саме тому інциденти Kimi K3 від Frontier Security та ROME від Alibaba, попри наявні посилання, не зараховані. Проєкт не оцінює тяжкість чи намір — він лише веде підрахунок і залишає тлумачення читачеві.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.