Geri Dön
Heretic, dil modellerindeki retleri yeniden eğitim olmadan kaldırıyor
SiTech AI Team2 წთ. საკითხავი

Heretic, dil modellerindeki retleri yeniden eğitim olmadan kaldırıyor

Açık kaynaklı Heretic, transformatör tabanlı dil modellerindeki ret davranışını otomatik olarak temizliyor; yönlü ablasyon ile Optuna tabanlı parametre aramasını tek komutta birleştiriyor.

Heretic ne yapıyor

Heretic, transformatör tabanlı dil modellerinden sansürü — geliştiricilerinin deyimiyle „güvenlik hizalamasını“ — pahalı ek eğitim olmadan kaldıran ücretsiz ve açık kaynaklı bir program. Projeyi Philipp Emanuel Weidmann katkıcılarla birlikte yayımlıyor; sitenin ifadesi net: model her zaman kullanıcının talimatlarına uymalı.

Araç, abliterasyon olarak bilinen yönlü ablasyonun gelişmiş bir uygulamasını Optuna tabanlı bir parametre iyileştiricisiyle birleştiriyor. Yöntem, modelin bir isteği reddetmesine yol açan iç yönü bulup kaldırıyor; yaklaşım Arditi ve arkadaşlarının 2024 tarihli araştırmasında tanımlandı ve sonraki çalışmalarda geliştirildi.

Nasıl çalışıyor

Heretic’i kullanmak için bir GPU ve komut satırı yeterli. Tek bir kurulum adımından sonra kullanıcı bir Hugging Face model kimliği veriyor — belgelerde örnek olarak Qwen/Qwen3.5-4B kullanılıyor — ve gerisini program üstleniyor: en uygun parti boyutunu seçmek için donanımı ölçüyor, açık veri kümelerinden 400 „zararsız“ ve 400 „zararlı“ istem yüklüyor, modelin ne sıklıkla reddettiğini ölçüyor ve ardından bu retleri bastıran ablasyon parametrelerini arıyor.

Donanım gereksinimleri bugünkü ölçütlere göre mütevazı. Belgeler milyar parametre başına yaklaşık 2,5 GB video belleği öngörüyor; yani 4 milyar parametreli bir model yaklaşık 10 GB’lık bir kartta çalışıyor, bitsandbytes ile 4 bit nicemleme bellek kullanımını yaklaşık %70 azaltıyor. Python 3.10 ve üzeri ile PyTorch 2.2 ve üzeri gerekiyor; hem Nvidia hem AMD kartlar destekleniyor. Bir yapılandırma dosyası ve komut satırı seçenekleri sürecin neredeyse her aşamasını denetlemeye izin veriyor.

Sonuçlar ve yaygınlık

Proje, gemma-3-12b-it için ölçüm sonuçlarını yayımlıyor: özgün model 100 „zararlı“ istemin 97’sini reddederken Heretic sürümü yalnızca üçünü reddetti; bu, elle üretilen abliterasyonlarla aynı düzeyde, ancak özgün modelden çok daha küçük sapmayla sonuç veriyor. Sürümün KL puanı 0,16; aynı modelin yaygın iki abliterasyonunda bu değer 1,04 ve 0,45.

Heretic çoğu yoğun modeli, birçok çok kipli modeli, birkaç mixture-of-experts mimarisini ve Qwen3.5 gibi hibrit tasarımları destekliyor; saf state-space modelleri ise henüz kapsam dışında. Geliştiricilere göre topluluk, bu araçla üretilen 5.000’den fazla arındırılmış modeli Hugging Face’te yayımladı. Heretic GNU AGPL v3 lisansıyla dağıtılıyor; imzalı sürüm arşivleri GitHub, Codeberg aynası, Internet Archive ve IPFS üzerinden erişilebilir.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.