Geri Dön
Qwen3-1.7B'yi kalibre edilmiş olasılıklarla tek geçişli karar modeline dönüştürmek
SiTech AI Team2 dk okuma

Qwen3-1.7B'yi kalibre edilmiş olasılıklarla tek geçişli karar modeline dönüştürmek

Bu pratik kılavuz, bir dil modelinin çıktısını önceden tanımlanmış yanıtlarla nasıl sınırlayacağınızı, ardından CommonsenseQA üzerinde nasıl değerlendireceğinizi ve aşırı güven puanlarını sıcaklık ölçeklemesiyle nasıl düzelteceğinizi gösterir.

Sınırlı kod çözme, genellikle bir dil modelini karar motoruna dönüştürür; bu motor tek geçişte sabit seçenekler arasından seçim yapar, serbest metnin token token üretimi yerine. Qwen/Qwen3-1.7B üzerinde gösterilen yaklaşım, sözlüğü yalnızca birkaç izinli tokena indirger, böylece model yalnızca önceden tanımlanmış yanıtlardan birini üretir.

Tek geçişli kilit nasıl çalışır

Standart System one karar modelleri, tüm izinli yanıtlar için kalibre edilmiş olasılıklarla yanıt verir. Genel bir dil modelinden Structured Output ile JSON çıktısı istendiğinde, model yine de üretilen her token için geçiş yapmak zorunda; gösterilen örnekte nihai çıktı 11 geçiş gerektirdi. Jev gibi bir karar modeli, sabit seçenekler kümesini daraltır, geri kalanını sözlükten gizler ve ilk geçişte en yüksek olasılıklı yanıtı okur. Bu, doğru yanıtın garantisini vermez ve seyrek token olasılıkları, yanıtın doğru olma gerçek olasılığını değil, bir sonraki tokenin güvenini yansıtabilir.

CommonsenseQA sonuçları ve aşırı güven

CommonsenseQA üzerinde rastgele seçilmiş test örneğinde 1,7B model, 1221 sorunun 725'ine doğru yanıt verdi; bu, 0,5844 makro F1 ile 0,5938 doğruluk. Veri seti üzerinde hızlı ince ayar bunu 1221'den 762'ye yükseltti, yani 0,6241 doğruluk ve 0,6234 makro F1. Sorun belirsiz sorularda ortaya çıktı. En olası şekilde bir yarasaya ya da beyzbol sopasına nerede bulacağı sorulduğunda; seçenekler: mağara, beyzbol maçı, diğer, hayvanat bahçesi ve spor malzemesi dükkanı, model açık bir yanıt olmasına rağmen 0,9978 olasılıkla mağarayı seçti. Kutulara ayrılmış değerlendirme aşırı güveni doğruladı: 0,90-1,00 güven kutusunda 809 örnek vardı ve doğruluk yalnızca 0,7009 iken, 0,80-0,90 kutusunda 121 örnekle bu 0,4711'e düştü.

Sıcaklık ölçeklemesiyle kalibrasyon

Güveni doğrulukla uyumlu hale getirmek için yazar sıcaklık ölçeklemesini kullandı ve sıcaklık parametresini modelin doğruluk eğrisine göre ayarladı. Ayarlanan değer 3,797280788421631 idi. Ölçeklemeden sonra kutulara ayrılan güven doğruluğa çok daha yaklaştı: üst kutu 0,9541 doğruluğa karşılık 0,9333 güven gösterirken, orta kutular ölçülen doğruluğa birkaç puan yakındı. Yazar, veri setini oluşturmak, modeli değerlendirmek, ince ayar yapmak ve kalibre etmek için scriptler içeren GitHub deposunu yayımladı ve herkesi bu iş akışını daha büyük modellerde de denemeye çağırdı.

Kaynaklar: nishtahir.com

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.