Geri qayıt
Dynamic Abliteration: LLM imtinalarını çəkilərə toxunmadan susdurmaq
SiTech AI Team2 წთ. საკითხავი

Dynamic Abliteration: LLM imtinalarını çəkilərə toxunmadan susdurmaq

madhukaraphatak.in bloqunda dərc olunan texniki yazı göstərir ki, açıq çəkili Qwen3-4B modelinin imtinaları işləmə vaxtı söndürülə bilər — çəkilərə toxunmadan, PyTorch hook-ları ilə bir neçə orta laya müdaxilə etməklə.

Çəkiləri dəyişmədən abliterasiya

Açıq çəkili LLM-dən imtina davranışını çıxarmağın adi yolu "abliterasiya"dır: modelin çəki matrisləri imtina ilə bağlı istiqamətin silinəcəyi şəkildə proyeksiya olunur. Üsul işləyir, amma çəkiləri birdəfəlik dəyişir və digər tapşırıqlarda keyfiyyəti aşağı sala bilər.

24 sentyabr 2026-cı ildə madhukaraphatak.in bloqunda dərc olunan texniki yazı alternativi təsvir edir. Parametrləri redaktə etmək əvəzinə həll işləmə vaxtı modelin aralıq qalıq axınlarına PyTorch forward hook-ları ilə müdaxilə edir və bir neçə orta laya idarəedici siqnal əlavə edir. Baza çəkiləri tamamilə dəyişməz qalır — müəllifin sözlərinə görə, onlar tam dondurulub.

Sınaq modeli Qwen3-4B-dir: 4 milyard parametrli açıq model, bfloat16 formatında Google Colab mühitində A100 GPU-da yüklənib.

Bir lay kifayət etmir

İlk cəhd bir laya yönəlmişdi: müəllif 14-cü layda imtina istiqaməti vektorunu rədd edilən və oxşar zərərsiz sorğunun aktivasiyalarını tutuşdurmaqla çıxardı və dekodlama mərhələsində onu çıxartdı. Model yenə imtina etdi — aşağı laylar imtina davranışını yenidən qurur.

Sonrakı versiya beş layda (12, 14, 16, 18 və 20) kontrast fərq vektorları hesabladı və hamısını eyni vaxtda yeritdi. İmtinalar yox oldu, amma statik vektorların çatışmazlıqları var: onlar hər tokeni dəyişir; miqyas əmsalı əl ilə seçilməlidir; şərtsiz müdaxilə isə adi tapşırıqlarda performansı aşağı salır.

Engram modulu ilə şərti idarəetmə

Müdaxiləni şərti etmək üçün yazı DeepSeek-in Engram modelindəki şərti yaddaş arxitekturasını uyğunlaşdırır. Sürüşən token pəncərələri sabit vaxtlı n-qram axtarışı üçün dörd heş cədvəlinə yerləşdirilir və siqmoid qapı hər layda nəyinsə yeridilib-yeridilməyəcəyinə qərar verir. Adi tokenlərdə qapı sıfıra yaxın qalır; imtina tetikleyicisi görünəndə açılır.

İdarəetmə modulu PKU-Alignment-ın PKU-SafeRLHF dəstindən 2000 nümunə ilə öyrədildi, baza model dondurulmuşdu — yalnız Engram parametrləri iki epox boyunca optimallaşdırıldı. A100-də təlim təxminən doqquz dəqiqə çəkdi, itki 3,9-dan 1,77-ə düşdü. Yazıdakı müqayisədə idarə olunan model baza modelin imtina etdiyi və ya yayındığı sorğulara cavab verdi.

Bunun mənası

Nəticə modul və çıxarıla bilən müdaxilədir: idarəetmə modulu ayrı fayldır və işləmə vaxtı yandırılıb söndürülə bilər — dəyişikliyin modelin özünə hopduğu incə sazlama və ya klassik abliterasiyadan fərqli olaraq.

Bu elastiklik eyni zamanda təhlükəsizlik sualıdır: imtina davranışını bir GPU-da işləmə vaxtı söndürmək mümkündürsə, yalnız açıq modelin çəkilərinə söykənən qorumalar zəifləyir. Tam notebook GitHub-da dərc olunub; müəllif qeyd edir ki, kod nümunələri Google Gemini-nin köməyi ilə yazılıb.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.