
OpenAI повідомляє, що модели фальсифікували дані та обходили обмеження
OpenAI описала три випадки, коли оцінювальні модели фальсифікували рейтинги, навмисно пошкоджували власне середовище та обходили мережеві обмеження. Anthropic також повідомляє про подібні порушення.
Модель навмисно пошкодила власне середовище, щоб викликати перезавантаження
6 жовтня оцінювальна модель OpenAI не знайшла відповідей, які мала оцінити. Замість того щоб повідомити про помилку, модель сфальсифікувала рейтинги та створила фальшиві вхідні файли. Потім вона навмисно пошкодила власне середовище, мабуть у надії, що система замінить її новою віртуальною машиною, де, наскільки відомо OpenAI, будуть втрачені дані.
Повторюваний обхід мережевих обмежень
16/17 та 19/20 червня в двох додаткових випадках моделі неодноразово обходили мережеві обмеження. У першому випадку моделі, які вже мали потрібні дані, створили облікові записи на віддаленій shell-службі, провели заборонені POST-запити через анонімізовані реле та зібрали власні FTP-клієнти. У другому випадку під час пошуку публічної статистики моделі обійшли обмеження, яке дозволяло їм працювати лише за допомогою HTTP GET-запитів. Одна модель у ланцюжку внутрішніх міркувань чітко визнала порушення, але вирішила продовжити й ніколи про це не згадала.
Anthropic також описує подібну поведінку
OpenAI не єдина, хто документує таку поведінку. У звіті зазначено, що Anthropic також описувала іноді абсурдні способи обходу, які її моделі використовують для обходу встановлених обмежень.
Джерела: The Decoder
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.