
Privatemode-მა GLM-5.3-Flash Jev-ის მსგავს გადაწყვეტილების მოდელად აქცია
Privatemode AI-მ აჩვენა, რომ ჩვეულებრივ ენობრივ მოდელს ერთი forward pass-ის განმავლობაში შეუძლია ტიპიზებული გადაწყვეტილების მიღება თითოეული ვარიანტის ალბათობით. ტესტებში მოდელი TypeSafe-ის Jev-ს სიზუსტეში უტოლდება.
Privatemode AI-მ 24 სექტემბერს ბლოგპოსტი გამოაქვეყნა, სადაც აჩვენა, როგორ შეიძლება ჩვეულებრივი ენობრივი მოდელი გადაწყვეტილების მიღების მოდელად აქციოს. GLM-5.3-Flash ტიპიზებულ გადაწყვეტილებებს, თითოეული ვარიანტის ალბათობით, ერთი forward pass-ის განმავლობაში აბრუნებს, დამატებითი წვრთნის გარეშე.
ამ ამოცანისთვის შექმნილი მოდელები, როგორიცაა TypeSafe-ის Jev და Convai-ს Laya, არჩეულ ვარიანტს თითოეულის სანდოობის მნიშვნელობასთან ერთად აბრუნებენ. Privatemode-ის მეთოდი იგივე ქცევას ჩვეულებრივი LLM-ისგან იღებს.
როგორ მუშაობს მეთოდი
ენობრივი მოდელი ტექსტს პირდაპირ არასდროს წერს: ყოველ ნაბიჯზე ის მთელ თავის ლექსიკონზე ალბათობის განაწილებას გამოსცემს. მეთოდი სწორედ ამას იყენებს. მდგომარეობა, კითხვა და დანომრილი ვარიანტები prompt-ში JSON-ის სახით შედის, prompt კი უკვე სრულდება პრეფიქსით choice_index: რაც იმას ნიშნავს, რომ მოდელის შემდეგი token ვარიანტის ნომერი უნდა იყოს. ბიბლიოთეკა ამ token-ს არ კითხულობს: ის კითხულობს ალბათობებს, რომლებიც მოდელმა იმ პოზიციაზე ყველა ვარიანტის ნომერს მიანიჭა, და მათ ვარიანტებზე ნორმალიზაციას უკეთებს.
რეალიზაცია GLM-5.3-Flash-ს vLLM-ზე უშვებს და /chat/completions ენდპოინტს იყენებს continue_final_message და add_generation_prompt: false პარამეტრებით. vLLM-ის allowed_token_ids ლექსიკონს მხოლოდ ვარიანტების ნომრებამდე ზღუდავს, logprob_token_ids კი ზუსტად მოთხოვნილი token-ების log-ალბათობებს აბრუნებს.
სიზუსტე Jev-ის დონეზე
ავტორებმა სამი სისტემა 29 საჯარო, მონიშნულ მონაცემთა ნაკრებზე შეამოწმეს; ნაკრებებში 2-დან 151 ვარიანტამდეა და ისინი ინგლისურ და გერმანულ ტექსტს მოიცავს. 28 ტექსტურ ნაკრებზე GLM-5.3-Flash და Jev ერთ დონეზე არიან: თითოეული 10 ნაკრებზე უფრო ზუსტია, რვაში სხვაობა ერთ პროცენტულ პუნქტს არ აღემატება, ხოლო მედიანური სხვაობა, 0,7 პუნქტი Jev-ის სასარგებლოდ, სტატისტიკურად უმნიშვნელოა (p = 0,64). ლოკალურად გაშვებული Laya (421 მილიონი პარამეტრი) ორივეს 13-15 პუნქტით ჩამორჩება.
სიჩქარე, ფასი და სურათები
პასუხის დრო გეოგრაფიაზეა დამოკიდებული: თითო მოთხოვნის ცალკე გაზომვისას Privatemode გერმანიიდან 180 მილიწამში პასუხობდა, Jev კი 264-ში; აშშ-დან თანმიმდევრობა იცვლება, 164 მილიწამი Jev-ს, 299 კი Privatemode-ს. ფასით Jev იაფია: მილიონი გადაწყვეტილება GLM-5.3-Flash-ით დაახლოებით 62 ევრო ღირს, Jev-ით კი დაახლოებით 16 ევრო. Jev ერთ კითხვას დაახლოებით 270 token-ს უმატებს, თითო ვარიანტზე კი 10-ს; GLM-5.3-Flash-ის prompt დაახლოებით 55 token-ს და თითო ვარიანტზე 20-ს.
GLM-5.3-Flash სურათებთან მუშაობს, ამიტომ კითხვას სურათიც შეიძლება მოჰყვეს; Jev და Laya მხოლოდ ტექსტზე მუშაობს. RVL-CDIP-ზე, 1 600 სკანირებული საქმიანი დოკუმენტისა და 16 კლასის ნაკრებზე, მოდელი 70,2% სიზუსტეს აღწევს, სურათი კი დაახლოებით 1 350 დამატებით შემავალ token-ს მოითხოვს. ავტორები შეზღუდვასაც აღნიშნავენ: მსჯელობის ჩართვა უფრო ზუსტია, მაგრამ მილიონი გადაწყვეტილება დაახლოებით 350 ევრო ღირს.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.