OpenJev: ლოკალური გადაწყვეტილების მოდელი, რომელიც ბრაუზერშივე მუშაობს
openjev.com-ზე გაშვებული ლოკალური ექსპერიმენტი ერთსა და იმავე მოდელს ერთსა და იმავე კითხვას ორი გზით სვამს — პირდაპირი ლოგიტების წაკითხვითა და JSON-ის ტოკენ-ტოკენ გენერაციით. ყველა გაზომვა მომხმარებლის ბრაუზერში ხდება.
საიტი openjev.com წარმოადგენს ცოცხალ, ლოკალურ ექსპერიმენტს SemIf-ის სახელწოდებით — „სემანტიკური if-ები ღია მოდელებიდან, თქვენს ბრაუზერში“. აქ არ არის რეგისტრაცია ან ლოდინის სია: მომხმარებელი ირჩევს მოდელის ზომას, ტვირთავს მას საკუთარ GPU-ზე და ადარებს ერთი და იმავე წონებიდან გადაწყვეტილების მიღების ორ მიდგომას. არაფერი იგზავნება სერვერზე — გვერდი პირდაპირ აცხადებს, რომ შეყვანილი მონაცემები მას არ ტოვებს.
ერთი კითხვა — ორი გზა
ექსპერიმენტი ერთ გადაწყვეტილებას — მდგომარეობას, კითხვას და დაშვებული ვარიანტების სიას — ერთსა და იმავე ლოკალურ მოდელს ორჯერ სვამს. პირველი გზა პირდაპირი წაკითხვაა: კოდი კითხულობს მოდელის არჩევანის ლოგიტებს და ნორმალიზებას მხოლოდ მოცემული ვარიანტების ფარგლებში აკეთებს, დეკოდირების გარეშე. მეორე გზა გენერაციაა: იმავე მოდელს სთხოვენ, იგივე განაწილება შეაფასოს და JSON-ის სახით დაწეროს, ტოკენ-ტოკენ.
ორივე გაშვება თანმიმდევრულად ხდება ერთსა და იმავე ჩატვირთულ მოდელზე, რომ ერთი GPU-სთვის ერთმანეთს არ ეჯიბრებოდეს; ჯერ პირდაპირი წაკითხვა სრულდება, შემდეგ — გენერაცია.
გაზომვა მომხმარებლის მოწყობილობაზე ხდება
გვერდი ზომავს მოდელის ჩატვირთვას, გახურებას (warmup), მოთხოვნის მომზადებას, პირდაპირ გაშვებას, პირველ გენერირებულ ტოკენსა და გენერაციის დასრულებას performance.now()-ის საშუალებით. საიტი აცხადებს, რომ წინასწარ მომზადებული შედეგები არ არსებობს — ეკრანზე ნაჩვენები თანაფარდობა სწორედ მომხმარებლის აპარატურაზე მიღებული შედეგია.
რას არ ნიშნავს ეს რიცხვები
გამოქვეყნებული განმარტებები საკმაოდ ფრთხილია. პირდაპირი წაკითხვის ქულები მხოლოდ ეკრანზე გამოტანილი ვარიანტების ტოკენებზე გაკეთებული softmax-ია: ეს არ არის კალიბრებული სარწმუნოება და არ მოიცავს ყველა პასუხს, რომელიც მოდელს შეიძლება ერჩივნა. ნაგულისხმევი დესკტოპის მოდელია MiniCPM5 2B (1,56 GB); ტელეფონებისა და სუსტი მოწყობილობებისთვის რეკომენდებულია Qwen3 0.6B, ხოლო 4B ვარიანტს მნიშვნელოვნად მეტი მეხსიერება სჭირდება. არცერთი მათგანი არ აცხადებს, რომ Jev-ის გამოქვეყნებულ შედეგებს აღწევს.
წონები Hugging Face-იდან ჩამოტვირთვით მოდის და ბრაუზერის ქეშში რჩება; გამოყენებულია wllama-ს მეშვეობით დაფიქსირებული GGUF-ბილდები. კვანტიზაციამ შეიძლება შეცვალოს როგორც ხარისხი, ისე სიჩქარე, გვერდი კი აფრთხილებს, რომ პირველი ჩატვირთვა რამდენიმე წუთს გასტანს მოდელის, ქსელისა და GPU-ის მიხედვით.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.