Geri Dön
MicroLLM Lab: yedi küçük LLM doğrudan tarayıcıda
SiTech AI Team2 წთ. საკითხავი

MicroLLM Lab: yedi küçük LLM doğrudan tarayıcıda

Tarayıcı deneyi MicroLLM Lab, 26 ila 360 milyon parametreli yedi küçük dil modelini WebGPU üzerinden doğrudan cihazda çalıştırmanıza, test etmenize ve karşılaştırmanıza olanak tanıyor; sunucu ve kayıt gerekmiyor.

Tarayıcıda çalışan bir laboratuvar

stateofutopia.com/experiments/microllmlab adresinde yayımlanan MicroLLM Lab, küçük dil modellerini (SLM) doğrudan kullanıcının donanımında çalıştırmak, test etmek ve karşılaştırmak için bir tarayıcı deneyi. Formül kısa: WebGPU, sunucu yok, Q4 niceleme. Hesaplama hiçbir yere gönderilmiyor ve kayıt gerekmiyor. Proje, yangqi0'ın PetitGPT araştırmasından esinlenen bir WebGPU portu, Q4 paketleyici ve çok modelli bir çatı.

Sayfa, GPT-4 veya Claude gibi öncü modelleri sunmanın milyonlara mal olduğunu ve ağ gecikmesi eklediğini, 25 ila 360 milyon parametreli kompakt modellerin ise hızlı bir uç katmanı oluşturduğunu savunuyor: sorguları sınıflandırıp niyeti milisaniyeler içinde çıkarıyorlar. İş istemcinin GPU'sunda yürüdüğü için eşzamanlılık API faturası doğurmuyor; ilk token gecikmesi 10 ms'nin altında.

Yedi model, hepsi Q4

Katalogda yedi kontrol noktası var. PetitGPT research-v1 (124,6 milyon parametre, Apache-2.0, yangqi0) tek bir RTX 4090 üzerinde yaklaşık 13 milyar token ile eğitilmiş referans model. SmolLM2 135M Instruct ve SmolLM2 360M Instruct, Hugging Face'in Smol Models Research ekibinden geliyor ve yaklaşık 2 trilyon token ile ön eğitildikten sonra talimatlarla ince ayarlandı. L20-Edu 135M (AliceYin) aynı Llama tarzı tarifi kullanıyor ancak tek bir NVIDIA L20 üzerinde yaklaşık 13 milyar token ile eğitildi. Seti jingyaogong'un iki MiniMind modeli (104M ve 26M) ile nanoGPT biçimindeki GPT-2 124M tamamlıyor.

Tüm dosyalar Q4 nicelemeli: ağırlıklar 16 bitlik kayan noktalı sayılardan parametre başına 4 bite sıkıştırılıyor ve bellek kullanımı yaklaşık %75 azalıyor. Cihazdaki ağırlıklar 26M MiniMind2-Small için yaklaşık 16 MB ile 360M SmolLM2 için yaklaşık 226 MB arasında; 100 milyonun üzerinde parametreye sahip modeller tarayıcı belleğinde 50-84 MB'a sığıyor. İşi, compute shader'ları Apple Metal, DirectX 12 veya Vulkan üzerinde çalıştıran W3C standardı WebGPU yapıyor ve gerekirse WASM'e, ardından JavaScript'e geçiyor. Model yüklemesi dosyayı tarayıcının özel IndexedDB'sine önbelleğe alıyor.

Karşılaştırma ve sertifika

Benchmark modu nesnel kontroller çalıştırıyor: yazma kalitesi puanları değil, düzenli ifadeler ve birebir token testleri. Sayfa, 135 milyon parametreli modelin başarısız olabileceğini belirtiyor, çünkü ölçüm budur. Set etkin modelde ya da tüm yüklenmiş modellerde çalıştırılabiliyor; 256 tokenlık sürekli hız testi de var.

Compare & Certificate sekmesi bu sayıları, cihaz donanım bilgilerini taşıyan paylaşılabilir bir PNG sertifikasına dönüştürüyor. Custom eval paneli kendi benchmark'ınızı JavaScript ile yazmanıza izin veriyor: kod sayfanın kaynağında eval edilir. Runtime paneli motoru, saniyedeki token sayısını, JS heap'i, GPU arabelleklerini ve IndexedDB kullanımını gösteriyor. Proje 589 MB'lık zip olarak da indirilebiliyor, ancak HTTP ile sunulmalı.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.