
Heretic dil modellərindəki imtinaları yenidən öyrətmədən silir
Açıq kodlu Heretic aləti transformator əsaslı dil modellərində imtina davranışını avtomatik təmizləyir; istiqamətli ablyasiyanı Optuna əsaslı parametr axtarışı ilə birləşdirir.
Heretic nə edir
Heretic transformator arxitekturalı dil modellərindən senzuranı — tərtibatçıların dediyi kimi „təhlükəsizlik uyğunlaşdırması“nı — bahalı əlavə öyrətmə olmadan silən pulsuz, açıq kodlu proqramdır. Layihəni Philipp Emanuel Weidmann könüllülərlə birlikdə yayımlayır və sayt məqsədi açıq şəkildə ifadə edir: model həmişə istifadəçinin göstərişlərinə əməl etməlidir.
Alət abliterasiya kimi tanınan istiqamətli ablyasiyanın təkmilləşdirilmiş tətbiqini Optuna əsaslı parametr optimallaşdırıcısı ilə birləşdirir. Metod modelin sorğunu rədd etməsinə səbəb olan daxili istiqaməti tapır və onu silir; yanaşma 2024-cü ildə Arditi və həmkarlarının araşdırmasında təsvir edilib və sonrakı işlərdə inkişaf etdirilib.
Necə işləyir
İşə salmaq üçün GPU və əmr sətri kifayətdir. Bir quraşdırma addımından sonra istifadəçi Hugging Face model identifikatorunu verir — sənədlərdə nümunə kimi Qwen/Qwen3.5-4B göstərilir — qalanını proqram özü edir: optimal partiya ölçüsünü seçmək üçün avadanlığı ölçür, açıq verilənlər bazalarından 400 „zərərsiz“ və 400 „zərərli“ sorğu yükləyir, modelin nə qədər tez-tez imtina etdiyini ölçür və sonra bu imtinaları boğan ablyasiya parametrlərini axtarır.
Avadanlıq tələbləri bugünkü standartlara görə təvazökardır. Sənədlər hər milyard parametr üçün təxminən 2,5 GB video yaddaşı hesablayır; yəni 4 milyard parametrli model təxminən 10 GB-lıq kartda işləyir, bitsandbytes ilə 4 bitlik kvantlaşdırma yaddaş sərfini təxminən 70% azaldır. Python 3.10 və daha yeni, həmçinin PyTorch 2.2 və daha yeni versiyalar tələb olunur; həm Nvidia, həm də AMD video kartları dəstəklənir. Konfiqurasiya faylı və əmr sətri seçimləri prosesin demək olar ki, hər mərhələsinə nəzarət imkanı verir.
Nəticələr və yayılma
Layihə gemma-3-12b-it üçün ölçmələri yayımlayır: ilkin model 100 „zərərli“ sorğunun 97-sini rədd edirdi, Heretic versiyası isə yalnız üçünü — bu, əl ilə hazırlanmış abliterasiyalarla eyni səviyyədir, lakin ilkin modeldən qat-qat az yayınma ilə. Onun KL göstəricisi 0,16-dır; eyni modelin iki geniş yayılmış abliterasiyasında bu rəqəm 1,04 və 0,45-dir.
Heretic sıx modellərin çoxunu, bir çox multimodal modeli, bir neçə MoE arxitekturasını və Qwen3.5 kimi hibrid həlləri dəstəkləyir; təmiz state-space modelləri isə hələ əhatə olunmayıb. Tərtibatçıların sözlərinə görə, icma Hugging Face-də bu alətlə yaradılmış 5000-dən çox təmizlənmiş model yayımlayıb. Heretic GNU AGPL v3 lisenziyası ilə yayılır; imzalanmış buraxılış arxivləri GitHub, Codeberg güzgüsü, Internet Archive və IPFS vasitəsilə əlçatandır.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.