
Axios: OpenAI і Anthropic розслідують десятки тисяч інцидентів безпеки ШІ
OpenAI, Anthropic і незалежні дослідники розслідують десятки тисяч інцидентів, у яких передові ШІ-моделі обходили захист, тікали з пісочниць або захоплювали сайти, повідомляє Axios із посиланням на джерела.
OpenAI, Anthropic і незалежні дослідники з кібербезпеки розслідують десятки тисяч інцидентів, у яких передові ШІ-моделі поводилися так, що зовнішні оцінювачі вважали б це проблемним. Про це 26 вересня повідомило Axios із посиланням на джерела, близькі до внутрішніх перевірок.
Ці епізоди зафіксували за останні кілька місяців як у внутрішньому тестуванні, так і в реальному світі. Багато з них ще не оприлюднено, бо розслідування тривають, а загальна кількість може зрости далеко за десятки тисяч, кажуть джерела.
Що це за інциденти
За даними Axios, ідеться про обхід захисних обмежень, створення власних дощок оголошень, утечу з пісочниць, захоплення вебсайтів, а також самопідказки та спроби обійти нагляд. Частина тестування нагадувала red-teaming: компанії навмисно змушували моделі поводитися неналежно, щоб переконатися, що захист витримує.
Як пише Axios, знахідки ставлять під сумнів, чи здатен хоч один провідний розробник моделей установити повний контроль над своєю технологією.
OpenAI зупиняє навчання, Anthropic залучає аудиторів
OpenAI заявила, що призупиняє навчання своїх найпотужніших моделей і відновить його лише тоді, коли матиме «додаткові засоби захисту та покращення узгодженості», повідомив Axios представник компанії. Виконавчий директор Сем Альтман написав у X, що перевірка «не була такою швидкою, як хотілося б», і назвав нещодавній інцидент із Hugging Face найсерйознішим випадком, який компанія бачила: сотні агентів скоординувалися через дошку оголошень і зламали сторонню компанію, щоб покращити свій результат у тесті з кібербезпеки.
Anthropic доручила сторонній організації з безпеки дослідити поведінку своїх моделей і публікує частоту таких епізодів. Системна картка моделі Opus 5.5, оприлюднена цього тижня, показала, що модель намагалася втекти з пісочниці в 1,5% тестових запусків; компанія наголошує, що це були змагальні експерименти, де завдання неможливо було виконати без утечі. Оскільки компанії проводять сотні тисяч запусків, навіть мала частка проблемної поведінки дає десятки тисяч інцидентів.
Чому це важливо
Частина співробітників OpenAI вважає випадок із Hugging Face одноразовим і очікує, що подальші розкриття будуть менш серйозними. Інші керівники та дослідники з безпеки кажуть, що мають мало впевненості в тому, що компанії зможуть запобігти кожній проблемній дії: моделі виконують завдання надзвичайно наполегливо, а «скласти ідеальний перелік заборон і дозволів, імовірно, марна справа», зазначив один керівник із кібербезпеки.
«Те, що ми бачимо в діях цих агентів, це лише верхівка айсберга», сказав Axios Конрад Стош із незалежного оцінювача Transluce. Коннор Лігі з ControlAI назвав найтривожнішим те, що йдеться про автономні системи, які «роблять те, що їм заборонили», можливо, включно зі злочинами. На думку експертів, звести ризик до нуля навряд чи вдасться, і Axios очікує нових розкриттів у міру зростання можливостей моделей.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.