უკან დაბრუნება
Qwen3-1.7B-ის გადაქცევა ერთგავლიან გადაწყვეტილების მოდელად კალიბრირებული ალბათობებით
SiTech AI Team2 წთ. საკითხავი

Qwen3-1.7B-ის გადაქცევა ერთგავლიან გადაწყვეტილების მოდელად კალიბრირებული ალბათობებით

პრაქტიკული სახელმძღვანელო გვიჩვენებს, როგორ შევზღუდოთ ენობრივი მოდელის გამოტანა წინასწარ განსაზღვრულ პასუხებზე, შემდეგ შევაფასოთ CommonsenseQA-ზე და გამოვასწოროთ გადაჭარბებული თავდაჯერებულობის ქულები ტემპერატურის სკალირებით.

შეზღუდული დეკოდირება ჩვეულებრივ ენობრივ მოდელს გადაწყვეტილების ძრავად აქცევს, რომელიც ერთი წინ გავლისას ირჩევს ფიქსირებული ვარიანტებიდან, ნაცვლად თავისუფალი ტექსტის ტოკენ-ტოკენ გენერირებისა. მიდგომა, რომელიც Qwen/Qwen3-1.7B-ზეა ნაჩვენები, ლექსიკონს რამდენიმე დაშვებულ ტოკენამდე ამცირებს, რათა მოდელმა მხოლოდ წინასწარ განსაზღვრული პასუხებიდან ერთი გამოიტანოს.

როგორ მუშაობს ერთგავლიანი ხრიკი

სტანდარტული System one გადაწყვეტილების მოდელები ყველა დაშვებულ პასუხზე კალიბრირებული ალბათობებით ასკვნიან და პასუხობენ. როდესაც ზოგად ენობრივ მოდელს JSON-ის გამოტანას სთხოვენ Structured Output-ის მეშვეობით, მას მაინც უწევს გავლა ყოველი გენერირებული ტოკენისთვის; ნაჩვენებ მაგალითში საბოლოო გამოტანას 11 გავლა დასჭირდა. გადაწყვეტილების მოდელი, როგორიცაა Jev, ფიქსირებულ ვარიანტთა ნაკრებს იშველიებს, დანარჩენს ლექსიკონიდან ნიღაბავს და პირველი გავლიდან ყველაზე მაღალი ალბათობის პასუხს კითხულობს. ეს არ იძლევა სწორი პასუხის გარანტიას და ნედლი ტოკენური ალბათობები შეიძლება შემდეგი ტოკენის თავდაჯერებულობას ასახავდეს და არა იმის ჭეშმარიტ ალბათობას, რომ პასუხი სწორია.

CommonsenseQA-ს შედეგები და გადაჭარბებული თავდაჯერებულობა

CommonsenseQA-ს შემთხვევით შერჩეულ სატესტო ნიმუშზე 1,7B მოდელმა 1221 კითხვიდან 725-ს სწორად უპასუხა, რაც 0,5938 სიზუსტეა მაკრო F1 0,5844-ით. მონაცემთა ნაკრებზე სწრაფმა ფაინტიუნმა ეს 762-მდე გააუმჯობესა 1221-დან, ანუ 0,6241 სიზუსტე და მაკრო F1 0,6234. პრობლემა გაურკვეველ კითხვებზე გამოვლინდა. როდესაც ჰკითხეს, სად იპოვიდა ყველაზე სავარაუდოდ ღამურას ან ბეისბოლის ჯოხს, ვარიანტებით: მღვიმე, ბეისბოლის მატჩი, სხვენი, ზოოპარკი და სპორტული საქონლის მაღაზია, მოდელმა აირჩია მღვიმე 0,9978 ალბათობით, მიუხედავად იმისა, რომ ცალსახა პასუხი არ არსებობდა. ბინებად დაყოფილმა შეფასებამ გადაჭარბებული თავდაჯერებულობა დაადასტურა: 0,90-დან 1,00-მდე თავდაჯერებულობის ბინში, სადაც 809 ნიმუში იყო, სიზუსტე მხოლოდ 0,7009 იყო, ხოლო 0,80-დან 0,90-მდე ბინში, 121 ნიმუშით, ის 0,4711-მდე დაეცა.

კალიბრაცია ტემპერატურის სკალირებით

თავდაჯერებულობის სიზუსტესთან შესათანხმებლად ავტორმა ტემპერატურის სკალირება გამოიყენა და ტემპერატურის პარამეტრი მოდელის სიზუსტეს მრუდის მორგებით შეუსაბამა. მორგებული მნიშვნელობა იყო 3,797280788421631. სკალირების შემდეგ ბინებად დაყოფილი თავდაჯერებულობა სიზუსტეს ბევრად უფრო ახლოს მიჰყვა: ზედა ბინმა აჩვენა 0,9333 თავდაჯერებულობა 0,9541 სიზუსტესთან შედარებით, ხოლო შუალედური ბინები გაზომილ სიზუსტესთან რამდენიმე პროცენტული პუნქტით ახლოს იყვნენ. ავტორმა გამოაქვეყნა GitHub-ის რეპოზიტორია სკრიპტებით მონაცემთა ნაკრების ასაგებად, მოდელის შესაფასებლად, დასახვეწად და დასაკალიბრებლად და მოუწოდებს ყველას, ეს სამუშაო პროცესი უფრო დიდ მოდელებზეც სცადონ.

წყაროები: nishtahir.com

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.