
OpenAI виявила та зупинила скоординовану кампанію дистиляції
OpenAI повідомила, що виявила та зупинила координовану кампанію, яка мала на меті вилучення захищених міркувань із її моделей. Основну частину активності компанія приписує особам, пов'язаним із Moonshot AI.
OpenAI повідомила, що виявила та зупинила координовану кампанію, метою якої було вилучення захищених міркувань із її моделей. За словами компанії, найраніша активність була зафіксована в перший тиждень липня. Дії мають ознаки дистиляції моделі, тобто несанкціонованого використання результатів або міркувань однієї моделі для навчання іншої.
Що помітила OpenAI
Згідно з розслідуванням, оператори намагалися вилучити захищені міркування новими способами. Серед них було копіювання зашифрованих міркувань з однієї розмови та прохання до моделі в іншій розмові розшифрувати й переписати прихований вміст. Незалежні дослідники безпеки через відповідальне розкриття повідомили компанії про схожі вразливості, пов'язані з міжмодельними переходами та стисненням розмов. OpenAI перевірила їхні висновки й підтвердила, що описані шляхи атаки реальні.
Активність почалася 1 липня і спочатку була низькою. 24 і 25 липня зафіксовано піки високого обсягу: 16 000 запитів, які використовували відповідний шаблон вилучення, від понад 4 000 користувачів. Подальше розслідування виявило активність пов'язаних шаблонів запитів у групі понад 15 000 користувачів; повністю зупинити її вдалося до 28 липня.
Кому OpenAI приписує активність
За оцінкою компанії, незрозуміло, чи всі оператори походили від одного суб'єкта. Основну частину активності OpenAI приписує особам, пов'язаним із Moonshot AI, творцем Kimi.
Чому це важливо
За заявою OpenAI, оператори не зламали шифрування, не скомпрометували бази даних і не отримали прямого доступу до збережених розмов. Натомість вони використали взаємодію з моделлю так, щоб змусити її описати захищені міркування у видимій для запитувача формі. Компанія зазначає, що цей ризик стосується не лише OpenAI і подібна техніка може застосовуватися до інших передових AI-систем. Вилучені міркування можуть бути використані для навчання іншої моделі без обмежень, які має оригінальна модель. Цифри описують лише спроби, а не обов'язково успішні вилучення.
Як компанія відреагувала
OpenAI зупинила кампанію поєднанням забезпечення виконання правил для акаунтів, технічного контролю та координації з партнерами: заблокувала або обмежила шахрайські акаунти, посилила контроль реєстрації та інфраструктури й розширила моніторинг. Також було закрито шлях, який уможливлював повторне використання та відновлення зашифрованих міркувань іншого користувача, і додано перевірки, які зупиняють потоковий вивід із ризиком розкриття міркувань. Висновки поширено через Frontier Model Forum і канали обміну державною інформацією. Надалі компанія посилить три напрями: технічний захист, виявлення координованих кампаній та обмін інформацією між індустрією й владою.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.