Назад
Abliterated-моделі втрачають слухняність раніше за знання
SiTech AI Team2 წთ. საკითხავი

Abliterated-моделі втрачають слухняність раніше за знання

Автор технічного допису на dev.to твердить, що в abliterated-моделях дотримання інструкцій і формату виводу деградує задовго до втрати знань, тож дотримання формату слід оцінювати окремо від правильності відповіді.

Технічний допис на dev.to від розробника Grunz, сервісу, що обслуговує abliterated відкриті моделі, доводить: команди, які оцінюють такі checkpoint-и, зазвичай міряють не те. На Hugging Face тисячі таких моделей, і першою деградує не обізнаність, а слухняність: дотримання інструкцій і формату виводу.

Що робить abliteration

abliteration знаходить напрямок відмови у просторі активацій моделі та проєктує його геть із ваг. Тут немає ні градієнтних кроків, ні тренувальних даних: це редагування ваг, а не finetune. Звичне припущення це обмін можливостями: ви отримуєте покору, втрачаєте частину загального інтелекту, і перевіряєте це тим, чи модель усе ще знає факти. За словами автора, шкода проявляється не тут.

Слухняність падає першою

У різних варіантів і родин моделей найпершим деградує дотримання інструкцій і формату виводу. Модель усе ще знає матеріал, але вимірювано гірше тримає instruct-шаблон і prefill, дотримує stop-послідовності, залишається в межах контракту структурованого виводу (скажімо, JSON-схеми чи синтаксису tool-call), утримує обмеження system prompt у довгому контексті. Checkpoint, що на MMLU відстає від базової моделі в межах шуму, провалює структурований вивід істотно частіше.

Чому чат-тест цього не бачить

Стандартна перевірка це розмова: переконатися, що модель більше не відмовляє і що проза читається добре. Таке тестування не помічає збою, бо модель виглядає нормально, а то й краще, адже поведінка відмови, яка раніше переривала користувача, зникла. Проблема з'являється пізніше, коли модель підключають до системи, що парсить її вивід, і частота збоїв зростає. Perplexity теж не рятує: на загальному корпусі вона майже не рухається, тоді як дотримання формату різко падає.

Рекомендація оцінювати дотримання формату окремо від якості й незалежно від правильності: надішліть запити з точно заданим контрактом виводу, оцініть бінарне дотримання контракту, а не змісту, і опублікуйте порівнюваний показник. Коректно оформлена хибна відповідь отримує 1.0; правильна відповідь, загорнута в прозу, що ламає схему, отримує 0.

Здогад про quant-и

Взаємодію з quant-ами автор прямо називає здогадом, який він належно не вимірював: шкода, схоже, накопичується разом зі шкодою від квантування, тож у дотриманні формату abliterated модель деградує на драбині quant-ів швидше за базову. Якщо це так, abliteration уже розрівняла частину структури ваг, яку quant-и потім заокруглюють. Автор каже, що на менших моделях кращі результати дають q6_K і вище, а q8_0 для моделі на 4B займає лише близько 4,3GB. Належний тест квантизувати базову модель і її abliterated двійника до однакових bits per weight і міряти дотримання, а не perplexity. У продакшені, додає він, парсер tool-call має бути поблажливішим, а показник дотримання варто вести як окрему метрику.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.