უკან დაბრუნება
Jeff: Jev-ის თავსებადი 0,8B მოდელი გადაწყვეტილებას 22 მილიწამში იღებს
SiTech AI Team2 წთ. საკითხავი

Jeff: Jev-ის თავსებადი 0,8B მოდელი გადაწყვეტილებას 22 მილიწამში იღებს

GitHub-ზე ღია პროექტი Jeff გამოქვეყნდა: Qwen3.5-ისა და Gemma 4-ის მცირე მოდელები Jev-ის იგივე ფორმატით, ერთი გავლის შედეგად, თითოეული ვარიანტის კალიბრირებულ ალბათობას 22 მილიწამში აბრუნებენ.

GitHub-ზე ღია პროექტი Jeff გამოქვეყნდა: ის Qwen3.5-ისა და Gemma 4-ის მცირე მოდელებს (0,8B და 2B) zero-shot კლასიფიკატორებად აქცევს და Jev-ის იგივე მოთხოვნის ფორმატს იყენებს. მომხმარებელი სიტუაციასა და ვარიანტებს სიტყვებით აღწერს, პასუხად კი ერთი გავლის შედეგად თითოეული ვარიანტის კალიბრირებული ალბათობა მოდის. ტექსტი არ გენერირდება, დამატებითი დამუშავება საჭირო არ არის. გადაწყვეტილებას Jeff RTX PRO 6000-ზე დაახლოებით 22 მილიწამში იღებს, Apple-ის M4 Max-ზე კი MLX-ით 28 მილიწამში.

რა არის Jeff

zero-shot რეჟიმში ვარიანტები ნებისმიერი შეიძლება იყოს: მხარდაჭერის რიგები, მომხმარებლის მიზნები, მოდერაციის ჭდეები ან თამაშის სვლები. კატეგორიები სასწავლო მონაცემებში არ უნდა იყოს წარმოდგენილი, რადგან მათ მოთხოვნაში აღწერენ. Hugging Face-ზე სამი მოდელია გამოქვეყნებული: Jeff-Qwen3.5-0.8B, Jeff-Qwen3.5-2B და Jeff-Gemma4-E2B. მოთხოვნა სამი ტიპის შეკითხვას იღებს: არჩევანი 255 ვარიანტამდე, დიახ/არა ალბათობის სახით და ქულა აღწერილ სკალაზე.

შედეგები ბენჩმარკებზე

მოდელები ხუთი საჯარო ბენჩმარკის 4 599 შეკითხვაზე შემოწმდა, ცალკე კი JevBench-ის რთული დონე, 105 ერთეული. საერთო ქულით Jeff-Qwen3.5-2B 83,1-ს აღწევს, Jeff-Gemma4-E2B 81,6-ს, Jeff-Qwen3.5-0.8B კი 79,1-ს, მაშინ როცა Jev-ის გამოქვეყნებული მაჩვენებელი 83,0-ია. Financial PhraseBank-ზე პატარა მოდელები 96,4-მდე ადიან 77,0-ის წინააღმდეგ, მსჯელობაზე დამოკიდებულ ტესტებზე კი უკან იწევიან: BBH 64,0 94,3-ის წინააღმდეგ. ავტორები წერენ, რომ საერთო ქულას კლასიფიკაციის ტიპის ამოცანები იძლევა, სადაც მცირე მოდელები დიდს არ ჩამორჩებიან.

Jeff-ის სიზუსტე ბენჩმარკებზე Jev-ის მაჩვენებლებთან შედარებით

ერთ ლოკალურ GPU-ზე გაწვრთნილი

მთელი პროექტი ლოკალურ ტექნიკაზე შეიქმნა: 0,8B მოდელი ერთი RTX PRO 6000 სამუშაო სადგურის GPU-ზე ორ საათში იწვრთნება, 2B კი სამნახევარში. სინთეზური მონაცემები ღია მოდელმა Qwen3.8-Flash-Next-მა ორ DGX Spark-ზე დაწერა, ტესტირება MacBook-ზე ჩატარდა. ღრუბლოვანი GPU არ გამოუყენებიათ და სასწავლო მონაცემებში დახურული მოდელის შედეგი არ მოხვედრილა. Jeff დამოუკიდებელი პროექტია და TypeSafe-თან, Jev-ის შემქმნელ კომპანიასთან, არ არის დაკავშირებული. კოდი MIT ლიცენზიით ვრცელდება, წონები კი Apache 2.0-ით.

თამაშები და შეზღუდვები

zero-shot შესაძლებლობის შესამოწმებლად Jeff-მა სამი თამაში ითამაშა, სადაც ყოველი სვლა სიტყვებით აღწერილი იყო: Doom-ში 6,55 მოკლული, იგივე შედეგი, რაც ხელით დაწერილმა წესების ბოტმა, Frogger-ში 10,3 გადაკვეთა გაუწვრთნელი მოდელის 1,0-ის წინააღმდეგ, Pac-Man-ში კი 98-დან 57,0 ბურთულა 25,8-ის წინააღმდეგ. M4 Max-ზე ის სვლას 29-49 მილიწამში იღებს. ავტორები შეზღუდვებსაც ჩამოთვლიან: მოდელები არ მსჯელობენ და მხოლოდ ინგლისურ ტექსტზე მუშაობენ. საკუთარ მაგალითებზე მოკლე დახვეწა ბევრს ცვლის: ხმოვანი ნავიგაციისთვის გაწვრთნილმა ვერსიამ 11 ათასამდე მაგალითზე სიზუსტე 31,7%-დან 95,8%-მდე აწია ნახევარ საათზე ნაკლებ დროში.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.