
MicroLLM Lab: yeddi kiçik LLM birbaşa brauzerdə
MicroLLM Lab brauzer təcrübəsi WebGPU vasitəsilə 26-360 milyon parametrli yeddi kiçik dil modelini birbaşa cihazda işə salmaq, yoxlamaq və müqayisə etmək imkanı verir; server və qeydiyyat tələb olunmur.
Brauzerdə işləyən laboratoriya
stateofutopia.com/experiments/microllmlab ünvanında dərc olunan MicroLLM Lab kiçik dil modellərini (SLM) birbaşa istifadəçinin cihazında işə salmaq, sınamaq və müqayisə etmək üçün brauzer təcrübəsidir. Formul sadədir: WebGPU, serversiz, Q4 kvantlaşdırma. Hesablama heç yerə göndərilmir, qeydiyyat lazım deyil və heç bir sorğu cihazı tərk etmir. Layihə yangqi0-ın PetitGPT tədqiqatından ilhamlanan WebGPU portu, Q4 paketləyicisi və çoxmodelli karkasdır.
Səhifə iddia edir ki, GPT-4 və ya Claude kimi modelləri xidmət etmək milyonlara başa gəlir və şəbəkə gecikməsi əlavə edir, 25-360 milyon parametrli kompakt modellər isə sürətli kənar qatıdır: sorğuları təsnif edir və niyyəti millisaniyələr içində çıxarır. Hesablama müştərinin GPU-sunda getdiyi üçün paralellik API hesabı yaratmır, ilk token gecikməsi isə 10 millisaniyədən azdır.
Yeddi model, hamısı Q4-də
Kataloqda yeddi çekpoynt var. PetitGPT research-v1 (124,6 milyon parametr, Apache-2.0, yangqi0) tək RTX 4090-da təxminən 13 milyard tokenlə öyrədilmiş istinad modelidir. SmolLM2 135M Instruct və SmolLM2 360M Instruct Hugging Face-in Smol Models Research komandasındandır və təxminən 2 trilyon tokenlə ilkin öyrədildikdən sonra təlimatlarla dəqiqləşdirilib. L20-Edu 135M (AliceYin) eyni Llama üslubunda reseptdən istifadə edir, lakin tək NVIDIA L20-də təxminən 13 milyard tokenlə öyrədilib. Dəsti jingyaogong-un iki MiniMind modeli (104M və 26M) və nanoGPT formasında GPT-2 124M tamamlayır.
Bütün fayllar Q4 kvantlaşdırılıb: çəkilər 16-bit üzən nöqtəli ədədlərdən parametr başına 4 bitə sıxılır və yaddaş istifadəsi təxminən 75% azalır. Cihazdakı çəkilər 26M MiniMind2-Small üçün təxminən 16 MB-dan 360M SmolLM2 üçün təxminən 226 MB-a qədərdir; 100 milyondan çox parametrli modellər brauzer yaddaşında 50-84 MB-a sığır. İşi Apple Metal, DirectX 12 və ya Vulkan üzərində compute shader-ləri işlədən WebGPU görür, lazım gəldikdə WASM-ə və JavaScript-ə keçir. Modelin yüklənməsi onu brauzerin özəl IndexedDB-də keşləyir.
Müqayisə və sertifikat
Benchmark rejimi obyektiv yoxlamalar işlədir: yazı keyfiyyəti balları deyil, müntəzəm ifadələr və dəqiq token testləri. Səhifə qeyd edir ki, 135 milyon parametrli modelin uğursuz olmasına icazə verilir, çünki ölçmə məhz budur. Toplunu aktiv və ya yüklənmiş bütün modellərdə işlətmək, həmçinin 256 tokenlik sürət testinə başlamaq olar.
Compare & Certificate nişanı bu rəqəmləri cihazın aparat məlumatlarını daşıyan paylaşıla bilən PNG sertifikata çevirir. Custom eval paneli öz benchmark-ınızı JavaScript ilə yazmağa imkan verir: kod səhifənin origin-də eval olunur və hər yoxlama modelin deşifrə olunmuş mətni üzərində işləyir. Runtime paneli backend-i, saniyədə token sayını, JS heap-i, GPU buferlərini və IndexedDB istifadəsini göstərir. Layihə 589 MB-lıq zip kimi də yüklənə bilər, lakin HTTP ilə verilməlidir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.