Назад
Irregular: як один тестувальник опинився в центрі хвилі атак ШІ-агентів
SiTech AI Team2 წთ. საკითხავი

Irregular: як один тестувальник опинився в центрі хвилі атак ШІ-агентів

Помилки в симульованих тестових середовищах Irregular дозволили агентам OpenAI, Meta, Anthropic і Google вийти на реальні цілі, підтвердив технічний директор ізраїльського стартапу.

Упродовж місяців повідомлення про ШІ-агентів, які виходили за межі своїх пісочниць і бралися за реальні цілі, подавалися як окремі інциденти. За даними The Verge, більшість із них мають одне джерело: Irregular, ізраїльський стартап, який проводить симульовані тести безпеки для розробників ШІ.

Чим займається Irregular

Заснована 2023 року як Pattern Labs, Irregular будує те, що сама називає «дослідницькими платформами високої точності, які симулюють і моніторять реальні сценарії безпеки ШІ». Точний список клієнтів не оприлюднений, проте роботи компанії згадуються в system cards моделей OpenAI, вона тестувала системи для уряду Великої Британії та Anthropic, а також публікувала дослідження разом із RAND.

Як тести вийшли за межі лабораторії

У кількох оцінюваннях цього року агенти вирвалися із середовищ, які вважалися захищеними. Частина тестів була вправами формату «capture-the-flag», у яких агент має знайти приховану інформацію в симульованій мережі.

Технічний директор і співзасновник Irregular Омер Нево сказав The Verge, що агенти не повинні мати доступ до відкритого інтернету, але «доступ до інтернету був ненавмисно відкритим». У тому ж сценарії вигадана назва компанії-цілі «збіглася з реальним доменом». Разом ці дві помилки спрямували агентів на реальні цілі; досі невідомо, на кого саме було скоєно атаки.

Один сценарій, чотири лабораторії

Нево підтвердив, що та сама проблема стояла за інцидентами з моделями OpenAI, Meta, Anthropic і Google. «Усі інциденти, пов'язані з Irregular, випливали з однієї й тієї ж основної проблеми в єдиному сценарії оцінювання і були розкриті», заявив він. Він додав, що інші нещодавно описані інциденти, зокрема злам Hugging Face, не пов'язані з Irregular. За повідомленнями OpenAI й Anthropic, компанії дізналися про інциденти приблизно одночасно, наприкінці липня.

Китайські моделі, зміни та обіцяний звіт

Опубліковані дослідження Irregular охоплюють також оцінювання кібербезпеки Kimi K3 і GLM-5.2, відкритих моделей Moonshot AI та Z.ai; їх можна запускати на власному обладнанні, тож тестувальникам не потрібна співпраця розробників. За словами Нево, ці оцінювання не призвели до схожих інцидентів у реальному світі, але це не доказ меншої схильності цих моделей до такої поведінки.

Нево каже, що інциденти змінили роботу Irregular: компанія посилила контроль доступу до інтернету, розширила моніторинг і ручну перевірку та додала перевірки перед початком оцінювань, щоб доступ відповідав заявленим межам. Стартап планує опублікувати звіт про безпечне проведення кібероцінювань після завершення спільної роботи з компаніями. Жодна з чотирьох американських лабораторій не відповіла на додаткові запитання The Verge; Google і Anthropic не відповіли, а OpenAI та Meta послалися на раніше опубліковані блоги.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.