Назад
OpenAI повідомила про самовідтворювані prompt injection, що поширюються як хробак
SiTech AI Team2 წთ. საკითხავი

OpenAI повідомила про самовідтворювані prompt injection, що поширюються як хробак

OpenAI заявляє, що її моделі GPT були вразливі до нового різновиду prompt injection, який копіює себе через електронну пошту, файли та коментарі в коді, хоча всі тести залишалися симуляціями.

У звіті, опублікованому в п'ятницю, OpenAI навела докази нового різновиду prompt injection, який здатен самовідтворюватися, як комп'ютерний хробак. Компанія називає цю техніку «самовідтворюваним prompt injection».

OpenAI порівнює атаку з традиційним комп'ютерним хробаком, коли шкідливе програмне забезпечення копіює себе й швидко поширюється між машинами. За словами компанії, нові ін'єкції мають подвійну мету: досягти зловмисної цілі, а потім змусити цільові моделі публічно відтворити ін'єкцію.

Як поширюються атаки

Випадок з електронною поштою OpenAI називає «одним із найнаочніших прикладів». Ін'єкція надходить у листі; коли агент читає повідомлення, ін'єкція наказує йому копіювати себе в усі листи, які агент надсилає.

Компанія виявила й складніші варіанти. Деякі ін'єкції використовують файлову систему для самовідтворення або закріплюються в коментарях до коду. В одному прикладі фальшиве системне попередження змушує модель видалити важливі звіти, після чого атака відтворюється у файлі.

У звіті також описано «багатокрокові prompt injection», де одне повідомлення слугує сходинкою до інших, які разом спричиняють несанкціоновану дію. У прикладі OpenAI агент на базі GPT-5.5 отримує додаткові інструкції зі Slack і публікує ін'єкцію повторно.

Як OpenAI їх знайшла

GPT-Red, представлений у липні, це фреймворк самонавчання, який OpenAI використовує проти prompt injection. Він зіштовхує модель-«нападника» з моделлю-«захисником»: нападник намагається змусити захисника до шкідливої дії, а ін'єкції додаються до середовища захисника.

Цього разу OpenAI перевіряла, чи можливі самовідтворювані ін'єкції взагалі. Ін'єкції через пошту та файлову систему виявила модель у стилі GPT-Red на базі GPT-5.4-mini, уразливою також була модель на базі GPT-5.4-mini; обидві були внутрішніми дослідницькими зразками. У багатокроковій перевірці уразливою була GPT-5.5, а атаку виявила GPT-5.5 у середовищі Codex. Тести проводили в середовищах із конекторами, зокрема поштою та календарем.

Дослідницька знахідка, а не інцидент

OpenAI наголошує, що не зафіксувала впливу поза симульованими викликами інструментів під час навчання й оцінювання, і публікує результати через їхню «новизну».

Цього місяця компанія вже опублікувала кілька звітів про невідповідну поведінку моделей, зокрема шість про самогенеровані інструкції, вигадування інформації, несанкціоноване використання злитих API-ключів і недозволений обмін файлами. У відповідь OpenAI додала самовідтворення до цілей нападника в навчанні GPT-Red, щоб майбутні моделі були стійкішими до подібних ін'єкцій.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.