חזרה
MicroLLM Lab: שבעה מודלים זעירים רצים בדפדפן
SiTech AI Team2 წთ. საკითხავი

MicroLLM Lab: שבעה מודלים זעירים רצים בדפדפן

ניסוי הדפדפן MicroLLM Lab מאפשר להריץ, לבחון ולהשוות שבעה מודלים לשוניים קטנים בנפח 26 עד 360 מיליון פרמטרים ישירות על המכשיר באמצעות WebGPU, בלי שרתים ובלי הרשמה.

מעבדה שרצה בדפדפן

MicroLLM Lab, שפורסמה בכתובת stateofutopia.com/experiments/microllmlab, היא ניסוי דפדפן להרצה, לבחינה ולהשוואה של מודלים לשוניים קטנים (SLM) ישירות על החומרה של המשתמש. הנוסחה פשוטה: WebGPU, בלי שרת, כימות Q4. החישוב אינו נשלח לשום מקום, אין צורך בהרשמה, ואף בקשה לא עוזבת את המכשיר. זהו פורט WebGPU, ארוז Q4 ומסגרת רב-מודלית, בהשראת מחקר PetitGPT של yangqi0.

היוצרים טוענים שהפעלת מודלים כמו GPT-4 או Claude עולה מיליונים ומוסיפה השהיית רשת, בעוד מודלים קומפקטיים של 25 עד 360 מיליון פרמטרים משמשים כשכבה מהירה בקצה: הם מסווגים שאילתות ומחלצים כוונה במילי-שניות. מכיוון שהחישוב מתבצע על ה-GPU של הלקוח, אין חשבון API על מקביליות, וההשהיה עד הטוקן הראשון נמוכה מ-10 מילי-שניות.

שבעה מודלים, כולם ב-Q4

הקטלוג כולל שבעה צ'קפוינטים. PetitGPT research-v1 (124.6 מיליון פרמטרים, Apache-2.0, מאת yangqi0) הוא מודל הייחוס, שאומן על RTX 4090 אחת עם כ-13 מיליארד טוקנים. SmolLM2 135M Instruct ו-SmolLM2 360M Instruct מגיעים מ-Smol Models Research של Hugging Face ואומנו מראש על כ-2 טריליון טוקנים לפני כיוונון להוראות. L20-Edu 135M (AliceYin) משתמש באותו מתכון בסגנון Llama, אך אומן על NVIDIA L20 אחת עם כ-13 מיליארד טוקנים. את הקבוצה משלימים שני מודלים של MiniMind מבית jingyaogong (104M ו-26M) ו-GPT-2 124M בצורת nanoGPT.

כל הקבצים מכומתים ל-Q4: המשקלים נדחסים מ-16 סיביות ל-4 סיביות לפרמטר, מה שמקטין את הזיכרון בכ-75%. במכשיר המשקלים תופסים מכ-16MB עבור 26M MiniMind2-Small ועד כ-226MB עבור 360M SmolLM2, ומודלים מעל 100 מיליון פרמטרים נכנסים ל-50-84MB של זיכרון דפדפן. את העבודה מבצע WebGPU, תקן W3C שמריץ compute shaders על Apple Metal, DirectX 12 או Vulkan, עם נסיגה ל-WASM ואחר כך ל-JavaScript. טעינת מודל שומרת אותו ב-IndexedDB הפרטי של הדפדפן.

בנצ'מרקים ותעודות

מצב הבנצ'מרק מריץ בדיקות אובייקטיביות: ביטויים רגולריים וטוקנים מדויקים, ולא ציוני איכות כתיבה. מודל של 135 מיליון פרמטרים רשאי להיכשל, מציין העמוד, כי זו בדיוק המדידה. אפשר להריץ את המערכת על המודל הפעיל או על כל המודלים הטעונים, וכן להפעיל מבחן מהירות של 256 טוקנים.

לשונית Compare & Certificate הופכת את המספרים לתעודת PNG לשיתוף עם פרטי החומרה של המכשיר. פאנל Custom eval מאפשר לכתוב בנצ'מרק משלכם ב-JavaScript: הקוד מבוצע ב-eval במקור העמוד, וכל בדיקה רצה על הטקסט המפוענח של המודל. פאנל Runtime מציג את המנוע, טוקנים לשנייה, JS heap, מאגרי GPU ושימוש ב-IndexedDB. הפרויקט זמין גם כ-zip של 589MB שצריך להגיש דרך HTTP.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.