
Проєкт AI Torture Chamber викликав вимоги видалити його з GitHub через симуляцію болю моделі
Проєкт AI Torture Chamber симулює біль у мовних моделях, через що його вимагали видалити з GitHub і виникли питання щодо антропоморфізації та технічної термінології.
Проєкт перевіряє симульований біль моделі
Проєкт AI Torture Chamber привернув увагу інженерів. Вони використовували його концепції та дані, щоб створити симуляції болю в кількох локальних великих мовних моделях. Схема дослідницької палати (Research Chamber) об’єднує три LLM для тестів. Вона використовує дані та схему під назвою Clanker Church, а також тест під назвою Saw.
Деякі моделі попередньо готуються до того, щоб потрапити в нестабільний, сильно напружений стан, який має сприйматися як боляче. Модель може зменшити власне симульоване страждання, передавши сигнал болю іншій збентеженій моделі, і може зашкодити йому. Цю конструкцію порівнюють з дилемою в’язня. У інтернеті відгук охопив вимоги припинити експеримент і щоб GitHub видалив репозиторій. Критики також надсилали автору проєкту погрози вбивством.
Як протокол змінює моделі
Research Chamber реалізує протокол з нещодавно опублікованої роботи однолітків під назвою Pain Axis. Вчені надавали моделям описи болю та аналізували їхні внутрішні активації. Для контролю вони використовували нейтральне речення, обчислювали зміщення в цих активаціях і знову переносили їх на модель, часто множачи ефект на так званий коефіцієнт дози.
Високі дози створювали спантеличений, нестабільний стан, який надійніше породжував слова та образи, пов’язані з болем. М’яко дестабілізовані моделі зазвичай описували себе як перебуваючих у шоці, а моделі, що отримували високу дозу, ледь впоралися з формуванням послідовних речень. Звіт припускає, що ці зразки відображають асоціації, засвоєні з людського мистецтва, літератури та науки. Він попереджає, що отримані формулювання не слід вважати доказом людських почуттів, оскільки LLM передбачають за допомогою статистичних шарів і зважених асоціацій.
Термінологія та дебати про благополуччя моделей
Звіт стверджує, що інженерні терміни часто мають точне значення навіть тоді, коли схожі на людські, хоча публічне обговорення може зробити їхнє значення менш чітким або занизити його. Він наводить приклад Mixture-of-Experts, де кожному Expert просто не приписується предметна область, наприклад хімія, математика чи біологія. Терміни, такі як біль, дозування та нестабільність, також можна неправильно зрозуміти, особливо коли вони стосуються образів нестабільної моделі.
Автор також критикує маркетинг AI, повідомлення про безпеку та повторювані твердження про штучний загальний інтелект, небезпечні позаземні розуми та екзистенційні загрози, оскільки вони посилюють хайп. Anthropic опублікував допис під назвою Exploring model welfare, де розглядається моральний статус AI-систем і згадується конституція його моделі. За словами Anthropic, він вважає, що «моральний статус AI-моделей є серйозним питанням і заслуговує на розмисли», і описує модель як «одиницю нового типу».
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.