უკან დაბრუნება
MicroLLM Lab: 7 პატარა LLM ბრაუზერშივე მუშაობს
SiTech AI Team2 წთ. საკითხავი

MicroLLM Lab: 7 პატარა LLM ბრაუზერშივე მუშაობს

stateofutopia.com-ზე გამოქვეყნებული MicroLLM Lab საშუალებას იძლევა, WebGPU-ით ბრაუზერშივე გაუშვათ და შეადაროთ შვიდი პატარა ენის მოდელი, 26 მილიონიდან 360 მილიონამდე პარამეტრით. სერვერი და რეგისტრაცია არ საჭიროებს.

ბრაუზერშივე მომუშავე ლაბორატორია

stateofutopia.com-ზე გამოქვეყნებული MicroLLM Lab საშუალებას იძლევა, პატარა ენის მოდელების (SLM) გაშვება, ტესტირება და შედარება პირდაპირ მომხმარებლის მოწყობილობაზე მოხდეს. ფორმულა მოკლეა: WebGPU, სერვერის გარეშე, Q4 კვანტიზაცია. ინფერენცია სერვერზე არ ხდება, რეგისტრაცია არ საჭიროებს და არც ერთი მოთხოვნა მოწყობილობას არ ტოვებს. პროექტი WebGPU პორტი, Q4 შემკვრელი და მრავალმოდელიანი ჩარჩოა, რომლის შთაგონებაც yangqi0-ის PetitGPT კვლევა გახდა.

ავტორები ამტკიცებენ, რომ GPT-4 ან Claude-ის ტიპის მოდელების მომსახურება მილიონები ჯდება და ქსელურ დაყოვნებას ამატებს, 25-360 მილიონი პარამეტრის კომპაქტური მოდელი კი სწრაფი კიდის შრეა: მილიწამებში აკლასიფიცირებს მოთხოვნებს და ამოიღებს განზრახვას. კლიენტის GPU-ზე მომუშავე ინფერენციას API-ის ხარჯი არ აქვს, პირველი ტოკენის დაყოვნება კი 10 მილიწამზე ნაკლებია.

შვიდი მოდელი Q4 ფორმატში

კატალოგში 7 ჩეკპოინტია. PetitGPT research-v1 (124,6 მილიონი პარამეტრი, Apache-2.0, ავტორი yangqi0) მითითების მოდელია, რომელიც ერთ RTX 4090-ზე დაახლოებით 13 მილიარდ ტოკენზე გაწვრთნა. SmolLM2 135M Instruct და SmolLM2 360M Instruct Hugging Face-ის Smol Models Research-ს ეკუთვნის; ისინი დაახლოებით 2 ტრილიონ ტოკენზე წინასწარ გაწვრთნის შემდეგ ინსტრუქციებზე დააზუსტეს. L20-Edu 135M (AliceYin) იმავე Llama-სტილის რეცეპტს იყენებს, მაგრამ ერთ NVIDIA L20-ზე დაახლოებით 13 მილიარდ ტოკენზე გაწვრთნა. კრებულს ავსებს jingyaogong-ის ორი MiniMind მოდელი (104 და 26 მილიონი პარამეტრით) და GPT-2 124M nanoGPT-ის არქიტექტურით.

ფაილები Q4 კვანტიზაციითაა შეკუმშული: წონები 16-ბიტიანი float-ებიდან 4 ბიტამდე მცირდება და მეხსიერების მოხმარება დაახლოებით 75%-ით ეცემა. წონების ზომა 26M MiniMind2-Small-ის დაახლოებით 16 მეგაბაიტიდან 360M SmolLM2-ის დაახლოებით 226 მეგაბაიტამდეა; 100 მილიონზე მეტი პარამეტრის მოდელი ბრაუზერის 50-84 მეგაბაიტში ეტევა. სამუშაოს WebGPU ასრულებს, W3C-ის სტანდარტი, რომელიც compute shader-ებს Apple Metal-ზე, DirectX 12-ზე ან Vulkan-ზე უშვებს; მისი არარსებობისას სისტემა WASM-ზე, შემდეგ JavaScript-ზე გადადის. მოდელის ჩატვირთვა ფაილს ბრაუზერის პირად IndexedDB-ში ქეშირებს.

ტესტები და სერტიფიკატი

Benchmarks რეჟიმი ობიექტურ შემოწმებებს უშვებს: რეგულარული გამოსახულებები და ზუსტი ტოკენები, არა წერის ხარისხის შეფასება. 135 მილიონიან მოდელს მარცხის უფლება აქვს, აღნიშნავს გვერდი, რადგან სწორედ ეს არის გაზომვა. ტესტების გაშვება აქტიურ ან ყველა ჩატვირთულ მოდელზე შეიძლება, ხელმისაწვდომია 256 ტოკენზე გაწელილი სიჩქარის ტესტიც.

„Compare & Certificate“ ჩანართი ციფრებს გასაზიარებელ PNG სერტიფიკატად აქცევს. Custom eval პანელი საკუთარი ტესტის JavaScript-ზე დაწერის საშუალებას იძლევა: კოდი გვერდის origin-ში eval-დება და ყოველი შემოწმება მოდელის გაშიფრულ ტექსტს ეშვება. Runtime პანელი აჩვენებს backend-ს, ტოკენ/წმ-ს, JS heap-ს, GPU ბუფერებსა და IndexedDB-ის მოხმარებას. პროექტი 589 მეგაბაიტიანი zip-ითაც ჩამოტვირთვადია, თუმცა HTTP-ით უნდა გაეშვას.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.