
MicroLLM Lab: сім крихітних LLM працюють у браузері
Браузерний експеримент MicroLLM Lab дозволяє запускати, тестувати й порівнювати сім малих мовних моделей від 26 до 360 мільйонів параметрів на пристрої через WebGPU, без серверів і реєстрації.
Лабораторія, що працює у браузері
MicroLLM Lab, опублікована за адресою stateofutopia.com/experiments/microllmlab, це браузерний експеримент для запуску, тестування й порівняння малих мовних моделей (SLM) безпосередньо на пристрої користувача. Формула проста: WebGPU, ані сервера, Q4-квантизація. Обчислення нікуди не передаються, реєстрація не потрібна, жоден запит не залишає пристрій. Це WebGPU-порт, пакувальник Q4 та багатомодельний каркас, натхненний дослідженням PetitGPT від yangqi0.
Автори твердять, що обслуговування моделей на кшталт GPT-4 чи Claude коштує мільйони і додає мережеву затримку, тоді як компактні моделі від 25 до 360 мільйонів параметрів працюють як швидкий периферійний шар: класифікують запити й витягують намір за мілісекунди. Оскільки обчислення йде на GPU клієнта, паралельність не має рахунку за API, а затримка до першого токена менша за 10 мс.
Сім моделей, усі у Q4
У каталозі сім чекпойнтів. PetitGPT research-v1 (124,6 млн параметрів, Apache-2.0, автор yangqi0) це базовий орієнтир, навчений на одній RTX 4090 приблизно на 13 млрд токенів. SmolLM2 135M Instruct і SmolLM2 360M Instruct походять від Smol Models Research компанії Hugging Face і були попередньо навчені на 2 трлн токенів, після чого донавчені на інструкціях. L20-Edu 135M (AliceYin) використовує той самий рецепт у стилі Llama, але навчався на одній NVIDIA L20 приблизно на 13 млрд токенів. Набір доповнюють дві моделі MiniMind від jingyaogong (104M і 26M) та GPT-2 124M в архітектурі nanoGPT.
Усі файли квантизовані до Q4: ваги стискаються з 16-бітних чисел із плаваючою комою до 4 біт на параметр, що скорочує пам'ять приблизно на 75%. На пристрої ваги займають від 16 МБ для 26M MiniMind2-Small до 226 МБ для 360M SmolLM2, а моделі понад 100 млн параметрів уміщаються у 50-84 МБ пам'яті браузера. Роботу виконує WebGPU, стандарт W3C, який запускає обчислювальні шейдери на Apple Metal, DirectX 12 чи Vulkan, із переходом на WASM, а потім на JavaScript. Завантаження моделі кешує її у приватній IndexedDB браузера.
Бенчмарки та сертифікати
Режим бенчмарків виконує об'єктивні перевірки: регулярні вирази та точні токени, а не оцінка якості письма. Моделі на 135 млн параметрів дозволено провалюватися, зазначає сторінка, бо саме це і є вимірюванням. Набір можна запустити на активній моделі чи на всіх завантажених, а також пройти тест тривалої швидкості на 256 токенів.
Вкладка Compare & Certificate перетворює ці цифри на PNG-сертифікат із характеристиками пристрою, готовий для поширення. Панель Custom eval дозволяє написати власний бенчмарк на JavaScript: код виконується через eval у джерелі сторінки, а кожна перевірка застосовується до декодованого тексту моделі. Панель Runtime показує бекенд, токени за секунду, JS heap, буфери GPU та використання IndexedDB. Проєкт доступний і як zip-архів на 589 МБ, який слід запускати через HTTP.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.