
Qwen3-1.7B-nin tək keçidli qərarlar modelinə kalibrlənmiş ehtimallarla çevrilməsi
Praktik təlimat göstərir ki, dil modelinin çıxışını əvvəlcədən müəyyən edilmiş cavablarla necə məhdudlaşdırmaq, sonra CommonsenseQA-da qiymətləndirmək və temperatur miqyaslaması ilə həddən artıq əminlik ballarını düzəldmək olar.
Məhdud dekodlaşdırma adi dil modelini qərar motoruna çevirir, hansı ki, tək bir irəli keçiddə sabit variantlardan seçir, azad mətnin token-token generasiyası əvəzinə. Qwen/Qwen3-1.7B-də göstərilən yanaşma leksikanı bir neçə icazə verilmiş tokenə qədər azaldır ki, model yalnız əvvəlcədən müəyyən edilmiş cavablardan birini çıxarsın.
Tək keçidli üsul necə işləyir
Standart System one qərar modelləri bütün icazə verilmiş cavablar üzərində kalibrlənmiş ehtimallarla xəritələnir və cavab verir. Ümumi dil modelindən Structured Output vasitəsilə JSON çıxışı tələb edəndə, onun hələ də hər generasiya edilmiş token üçün keçidi lazım olur; göstərilən nümunədə yekun çıxış 11 keçid tələb etdi. Jev kimi qərar modeli sabit variantlər dəstini gücləndirir, qalan leksikadan gizlənir və ilk keçiddən ən yüksək ehtimallı cavabı oxuyur. Bu düzgün cavabın kafiyyətini vermir və zəif token ehtimalları növbəti tokenin əminliyini əks etdirə bilər, cavabın düzgün olmasının əsl ehtimallını deyil.
CommonsenseQA nəticələri və həddən artıq əminlik
CommonsenseQA-nın təsadüfi seçilmiş test nümunəsində 1,7B model 1221 sualdan 725-ə düzgün cavab verdi, bu 0,5938 dəqiqlik, makro F1 0,5844 ilə. Məlumat dəstində sürətli fine-tune bunu 1221-dən 762-ə qədər yaxşılaşdırdı, yəni 0,6241 dəqiqlik və makro F1 0,6234. Problem aydın olmayan suallarda ortaya çıxtı. Yarasaya və ya beysbol çubuğuna ən ehtimal yeri harada olar deyə sual verildikdə variantlarla: mağara, beysbol matçı, digərləri, zoo park və idman malları mağazası, model aydın cavab olmasına baxmayaraq, 0,9978 ehtimallarla mağarayı seçdi. Bölünməli qiymətlərmə həddən artıq əminliyi təsdiqlədi: 0,90-dan 1,00-ə əminlik binində, 809 nümunə ilə, dəqiqlik yalnız 0,7009 idi, 0,80-dən 0,90-a binində, 121 nümunə ilə, o 0,4711-ə qədər düşdü.
Temperatur miqyaslaması ilə kalibrasiya
Əminliyin dəqiqliyi ilə uyğunlaşdırmaq üçün müəllif temperatur miqyaslamasından istifadə etdi və temperatur parametri modelin dəqiqliyinə uyğunlaşdırdı. Düzəldilmiş dəyər 3,797280788421631 idi. Miqyaslamadan sonra bölünmüş əminlik dəqiqliyə çox daha yaxın oldu: üst bin 0,9541 dəqiqliyyə nisbətən 0,9333 əminlik göstərdi, orta binlər isə ölçülmüş dəqiqliyyə bir neçə faiz nöqtəsi ilə yaxın idi. Müəllif GitHub repositoriyasını skriptlərlə nəşr etdi məlumat dəstlərini yaratmaq, modeli qiymətləndirmək, inkişaf etdirmək və kalibrasiya etmək üçün və hamısına bu iş prosesini daha böyük modellərdə də sınamağını tövsiyə edir.
Mənbələr: nishtahir.com
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.