Geri Dön
Dynamic Abliteration: LLM'lerde reddetmeyi ağırlıklara dokunmadan bastırmak
SiTech AI Team2 წთ. საკითხავი

Dynamic Abliteration: LLM'lerde reddetmeyi ağırlıklara dokunmadan bastırmak

madhukaraphatak.in blogunda yayımlanan teknik yazı, açık ağırlıklı Qwen3-4B modelinin reddetme davranışının çalışma anında kapatılabildiğini gösteriyor: ağırlıklar hiç değişmeden, PyTorch kancalarıyla birkaç orta katmana müdahaleyle.

Ağırlıkları değiştirmeden abliterasyon

Açık ağırlıklı bir LLM'de reddetme davranışını kaldırmanın bilinen yolu "abliterasyon": modelin ağırlık matrislerini, reddetmeyle ilişkili yön silinecek şekilde yansıtmak. Yöntem işe yarıyor, ancak ağırlıkları kalıcı olarak değiştiriyor ve başka görevlerde kaliteyi düşürebiliyor.

24 Eylül 2026'da madhukaraphatak.in blogunda yayımlanan teknik bir yazı alternatif bir yaklaşım anlatıyor. Parametre düzenlemek yerine çözüm, modelin ara rezidü akışlarına çalışma anında PyTorch forward hook'larıyla müdahale ediyor ve birkaç orta katmana yönlendirme sinyali ekliyor. Temel ağırlıklar ise sabit kalıyor; yazara göre tamamen dondurulmuş durumda.

Kavram kanıtı, 4 milyar parametreli açık model Qwen3-4B: bfloat16 biçiminde, Google Colab üzerinden bir A100 GPU'ya yüklendi.

Tek katman yetmiyor

İlk deneme tek bir katmanı hedefledi: yazar 14. katmanda, reddedilen bir istek ile benzer zararsız bir isteğin aktivasyonlarını karşılaştırarak bir "reddetme yönü" vektörü çıkardı ve çözümleme sırasında bunu çıkardı. Model yine reddetti — alt katmanlar reddetme davranışını yeniden oluşturdu.

Sonraki sürüm beş katmanda (12, 14, 16, 18 ve 20) karşıtsal fark vektörleri hesaplayıp hepsini aynı anda enjekte etti. Reddetmeler kayboldu; ancak statik vektörlerin kusurları var: her token'ı kaydırıyorlar, ölçek katsayısı elle ayarlanmak zorunda ve koşulsuz müdahale normal görevlerde performansı düşürüyor.

Engram modülüyle koşullu yönlendirme

Müdahaleyi koşullu hale getirmek için yazı, DeepSeek'in Engram modelindeki koşullu bellek mimarisini uyarlıyor. Kayan token pencereleri sabit zamanlı n-gram araması için dört karma (hash) tablosuna eşleniyor ve sigmoid bir kapı, ilgili katmanda enjeksiyon yapılıp yapılmayacağına karar veriyor. Normal token'larda kapı sıfıra yakın kalıyor; bir reddetme tetikleyicisi göründüğünde açılıyor.

Yönlendirme modülü, PKU-Alignment'ın PKU-SafeRLHF veri kümesinden 2.000 örnekle eğitildi; temel model dondurulmuştu ve yalnızca Engram parametreleri iki dönem boyunca en iyilendi. A100'deki eğitim yaklaşık dokuz dakika sürdü, kayıp 3,9'dan 1,77'ye indi. Yazıdaki karşılaştırmada, yönlendirilen model temel modelin reddettiği veya kaçındığı isteklere yanıt verdi.

Bu ne anlama geliyor

Sonuç modüler ve kaldırılabilir bir müdahale: yönlendirme "kafası" ayrı bir dosya, çalışma anında açılıp kapatılabiliyor — ince ayardan ya da değişikliğin modelin içine işlendiği klasik abliterasyondan farklı olarak temel ağırlıklar el değmemiş kalıyor.

Bu esneklik aynı zamanda güvenlik sorusu: reddetme davranışı tek bir GPU'da çalışma anında kapatılabiliyorsa, yalnızca açık bir modelin ağırlıklarına dayanan korumalar zayıflıyor. Not defterinin tamamı GitHub'da yayımlandı; yazara göre kod örnekleri Google Gemini yardımıyla yazıldı.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.