
Heretic прибирає відмови з мовних моделей без додаткового навчання
Відкритий інструмент Heretic автоматизує аблітерацію й знімає поведінку відмови з трансформерних мовних моделей. Він поєднує напрямлену абляцію з пошуком параметрів на Optuna і запускається однією командою.
Що робить Heretic
Heretic — безкоштовна програма з відкритим кодом, яка знімає цензуру, яку її розробники називають «вирівнюванням безпеки», з мовних моделей на основі трансформерів без дорогого додаткового навчання. Проєкт публікує Філіп Емануель Вайдман разом із спільнотою, а його сайт формулює мету прямо: модель завжди має виконувати інструкції користувача.
Інструмент поєднує вдосконалену реалізацію напрямленої абляції, відомої як аблітерація, з оптимізатором параметрів на базі Optuna. Метод знаходить внутрішній напрямок, що змушує модель відмовляти, і видаляє його — підхід описано в дослідженні Ардіті та колег 2024 року й розвинуто в пізніших роботах.
Як це запускається
Для роботи потрібні лише графічний процесор і командний рядок. Після одного кроку встановлення користувач передає ідентифікатор моделі з Hugging Face — у документації всюди використовується Qwen/Qwen3.5-4B — і програма бере все на себе: тестує обладнання, щоб підібрати розмір пакета, завантажує 400 «безпечних» і 400 «шкідливих» запитів із публічних наборів даних, вимірює, як часто модель відмовляє, а потім шукає параметри абляції, що пригнічують ці відмови.
Вимоги до обладнання за нинішніми мірками скромні. Документація оцінює приблизно 2,5 ГБ відеопам’яті на мільярд параметрів, тож модель із 4 мільярдами параметрів вміщується на карті обсягом близько 10 ГБ, а 4-бітна квантизація через bitsandbytes скорочує витрати пам’яті приблизно на 70%. Потрібні Python 3.10 або новіший і PyTorch 2.2 або новіший; підтримуються карти як Nvidia, так і AMD. Файл конфігурації та параметри командного рядка дають контроль майже над кожним етапом роботи.
Результати й поширення
Проєкт публікує результати вимірювань для gemma-3-12b-it: оригінальна модель відмовила на 97 із 100 «шкідливих» запитів, а версія Heretic — лише на трьох, що дорівнює аблітераціям, зробленим вручну, але з набагато меншим відхиленням від початкової моделі. Її показник KL — 0,16 проти 1,04 та 0,45 у двох популярних аблітерацій тієї ж моделі.
Heretic підтримує більшість щільних моделей, багато мультимодальних моделей, кілька архітектур mixture-of-experts і гібридні рішення на кшталт Qwen3.5, хоча чисті state-space моделі поки не охоплені. Розробники кажуть, що спільнота опублікувала на Hugging Face понад 5000 розцензурованих моделей, створених цим інструментом. Heretic випущено під ліцензією GNU AGPL v3, а підписані архіви релізів доступні через GitHub, дзеркало Codeberg, Internet Archive та IPFS.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.