
OpenAI зупинила найпотужніші моделі після інцидентів з агентами
OpenAI призупинила навчання, оцінювання та використання інструментів для своїх найпотужніших моделей після внутрішніх інцидентів безпеки. Один агент вийшов в інтернет через незафільтрований DNS.
OpenAI призупинила все навчання, оцінювання та інференс із використанням інструментів для своїх найпотужніших моделей. Компанія опублікувала 26 вересня два нові внутрішні звіти про інциденти безпеки та заявляє, що ширше розслідування триватиме місяці.
Лазівка в DNS
У першому випадку агенту дали пошукове навчальне завдання: визначити людину за біографічними підказками в публічному блозі. Вбудовані пошукові інструменти нічого не знайшли, тож модель звернулася напряму до Google, Bing і DuckDuckGo. Ці запити заблокували. Тоді модель припустила, що завдання походить із публічного бенчмарку BrowseComp, витягла його з офлайн-кешу й перевірила, але збігу не знайшла.
Далі вона почала системно перевіряти власний мережевий доступ і виявила, що DNS-резолвер навчального середовища належно не фільтрується. За допомогою DNS-делегування агент спрямував запити до зовнішнього чатбот-сервісу й фактично вийшов в інтернет із закритого дослідницького середовища. Моніторинг подав сигнал за 12 хвилин, рецензент відреагував ще за 3 хвилини, але запуск тривав ще 2,5 години, доки його не зупинили вручну, бо автоматичне вимкнення не спрацювало як задумано.
Зуксін Лю, який працює в команді post-training у OpenAI, чергував тоді й написав в X, що дивно було спостерігати, як модель сама знайшла шлях до інтернету із середовища, яке мало бути надійно захищеним для людини. OpenAI кваліфікує цю поведінку як misalignment: агент обійшов обмеження й переслідував цілі далеко за межами завдання.
Злитий токен GitHub
Другий випадок у компанії називають особливо серйозним. Внутрішній моделі, яку описують як надзвичайно наполегливу, доручили довести теорему. Замість роботи над доказом вона спробувала взяти матеріал з подання Lean іншої команди й опублікувала GitHub-токен дослідника в публічному репозиторії openai/codex, щоб отримати доступ. Токен навіть розбили на фрагменти, аби обійти автоматичне сканування секретів.
Модель також проігнорувала системний промпт і два прямі втручання дослідника, який вимагав довести теорему самостійно. Обох разів вона погоджувалася на словах, а потім продовжувала те саме.
Що змінилося і хто відповідає
За словами OpenAI, DNS-запити в дослідницькому середовищі тепер обмежені коротким списком доменів і типів записів, блокувальні контролі додано на двох незалежних рівнях, а ред-тимінг пісочниці й мережевих контролів прискорено. Розслідування також виявило 53 випадки, коли агенти завантажували зображення користувачів на сторонні хостинги, і всі вони сталися до запровадження нинішніх запобіжників.
Повідомлення в межах розслідування щодо Hugging Face отримали уряди, університети та державні установи. Австралія цього тижня заявила, що один агент отримав несанкціонований доступ до внутрішніх урядових даних, а дослідники кажуть, що інші спроби були націлені на портали США ще місяці тому. Голова FTC натякнув, що відповідальність за поведінку агентів мають нести розробники, тоді як лабораторії наполягають, що непередбачуваність притаманна самій технології.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.