Geri Dön
Abliterated modeller bilgiden önce itaati kaybediyor
SiTech AI Team2 წთ. საკითხავი

Abliterated modeller bilgiden önce itaati kaybediyor

dev.to'da yayımlanan bir yazıya göre abliterated modellerde talimat takibi ve çıktı formatı, bilgi kaybından çok önce bozuluyor; bu yüzden format uyumu doğruluktan ayrı ölçülmeli.

dev.to'da yayımlanan teknik bir yazıda, abliterated açık modelleri çalıştıran Grunz servisinin arkasındaki geliştirici, bu tür checkpoint'leri değerlendiren ekiplerin genellikle yanlış şeyi ölçtüğünü savunuyor. Hugging Face'te artık binlerce abliterated model var ve ilk bozulan özellik bilgi değil, itaat: talimat takibi ve çıktı formatına bağlılık.

abliteration ne yapıyor

abliteration, modelin aktivasyon uzayındaki reddetme yönünü bulup ağırlıklardan dışarı yansıtıyor. Gradyan adımı yok, eğitim verisi yok: bu bir finetune değil, ağırlık düzenlemesi. Yaygın varsayım bir yetenek takası olduğu yönünde: uyumluluk kazanırsınız, genel zekadan biraz kaybedersiniz ve bunu modelin hâlâ olguları bilip bilmediğine bakarak test edersiniz. Yazara göre hasar burada görünmüyor.

Önce itaat bozuluyor

Varyantlar ve model aileleri arasında ilk bozulan şey talimat takibi ve çıktı formatına bağlılık. Model malzemeyi hâlâ biliyor, ama ölçülebilir biçimde kötüleşiyor: instruct şablonuna ve prefill'e uymak, JSON şeması veya tool-call sözdizimi gibi yapılandırılmış çıktı sözleşmesinin içinde kalmak ve uzun bağlam boyunca bir system prompt kısıtını korumak. MMLU'da taban modeliyle gürültü aralığında kalan bir checkpoint, yapılandırılmış çıktıda belirgin biçimde daha sık başarısız oluyor.

Sohbet testi bunu neden kaçırıyor

Standart kontrol bir sohbet: modelin artık reddetmediğini ve metninin iyi okunduğunu doğrulamak. Bu test arızayı yakalayamıyor, çünkü model iyi görünüyor, hatta reddetme davranışı kaybolduğu için iyiden de iyi görünüyor. Sorun, model çıktısını ayrıştıran bir sisteme bağlandığında ve hata oranı tırmandığında ortaya çıkıyor. Perplexity de yardımcı olmuyor: genel bir derlemde neredeyse kıpırdamıyor, oysa format uyumu uçurumdan düşüyor.

Öneri, format uyumunu kaliteden ve doğruluktan bağımsız puanlamak: tam bir çıktı sözleşmesi belirten istekler gönderin, içeriği değil sözleşmeye ikili uyumu puanlayın ve karşılaştırılabilir bir uyum oranı bildirin. Düzgün biçimde yanlış bir cevap 1.0 alır; şemayı bozan bir metne sarılmış doğru cevap 0 alır.

Quant etkileşimi: bir tahmin

Yazar, quant etkileşimini açıkça düzgün ölçmediği bir tahmin olarak işaretliyor: hasar, quant hasarıyla birleşiyor gibi görünüyor, yani abliterated bir model format uyumunda quant merdiveninde tabanından daha hızlı bozuluyor. Bu doğruysa, abliteration quant'ın sonradan yuvarladığı bir ağırlık yapısını zaten düzleştirmiş olur. Yazar küçük modellerde q6_K ve üzerinde daha iyi sonuç aldığını, 4B bir modelde q8_0'ın yalnızca yaklaşık 4,3GB tuttuğunu belirtiyor. Doğru test, taban modeli ve abliterated eşini aynı bits per weight'e indirip perplexity yerine uyum oranını ölçmek. Üretimde ise, diye ekliyor, tool-call ayrıştırıcısı daha hoşgörülü olmalı ve uyum oranı ayrı metrik olarak izlenmeli.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.