Назад
Двигун від творця Redis ds4 запускає провідні відкриті моделі локально
SiTech AI Team2 хв читання

Двигун від творця Redis ds4 запускає провідні відкриті моделі локально

DwarfStar 4 (ds4) — це локальний рушій інференсу від творця Redis Сальваторе Санфіліппо (antirez), написаний на C; завдяки асиметричній 2-бітній квантизації та SSD-стрімінгу він запускає 284-мільярдну модель DeepSeek на машинах з 96-128 ГБ пам'яті.

DwarfStar 4 (ds4) — це локальний рушій інференсу, який написав на мові C творець Redis Сальваторе Санфіліппо (antirez). Проєкт поширюється з ліцензією MIT на GitHub і запускає провідні відкриті моделі на Mac із великою пам'яттю, системах NVIDIA CUDA та машинах AMD ROCm, без залежності від хмарних сервісів.

ds4 — це свідомо вузький рушій, а не універсальний запуск GGUF: він підтримує лише кілька сімейств моделей. У списку є DeepSeek V4 Flash та V4.1 Flash, GLM 5.x, Qwen3.8 Flash Next і візуальні моделі; на системах із дуже великою пам'яттю працює також DeepSeek V4 PRO. За даними блогу проєкту, у вересні ds4 отримав 165-комітне оновлення, яке додало ширшу підтримку DeepSeek V4.1 Flash, Qwen3.8 Flash Next, візуальних моделей і батчинг сервера, налаштований на модель. На GitHub проєкт має понад 22 тисячі зірок.

Як 284-мільярдна модель поміщається на одній машині

Головна модель, DeepSeek V4 Flash, — це архітектура mixture-of-experts із 284 мільярдами параметрів. ds4 розміщує її на машинах із 96-128 ГБ уніфікованої пам'яті завдяки асиметричній 2-бітній квантизації: маршрутизовані експерти, де зосереджена більшість параметрів, стискаються до формату Q2, тоді як загальні експерти та критичні для прийняття рішень тензори зберігають високу точність. Квантизація налаштована на даних imatrix і перевіряється порівняно з еталонними результатами.

SSD-стрімінг та KV-кеш, що зберігається на диску

Великі моделі завантажують ваги з SSD через стрімінг, тому машині з 128 ГБ також вдається запустити версію, яка інакше не помістилася б. Проєкт розглядає KV-кеш як стійкі дані: записи прив'язані до хешу промпта, зберігаються на диску та залишаються після перезавантаження процесу, тому довгі агентні сесії більше не платять повну вартість prefill. Виклики інструментів мають детермінований журнал реплеїв, який виживає разом із кешем.

Апаратне забезпечення, інтерфейси та швидкість

ds4 пропонує три інтерфейси: розмовний CLI, сервер із сумісними API OpenAI та Anthropic і власний агент для кодування. Сервер працює з Claude Code, Codex CLI та OpenCode. На M5 Max із 128 ГБ проєкт фіксує 39,4 токени/с генерації та 790 токенів/с prefill на контексті з 2048 токенів; на DGX Spark ці показники становлять 18,1 та 825,8. Мікробатчинг CUDA перетворює сервери з відеокарт старого покоління Ada Lovelace на багатокористувацькі LLM-сервери: на восьми картах L40S виміряно 120 токенів/с загальної генерації та 2000 токенів/с prefill.

Проєкт спирається на llama.cpp та GGML. Його теза — протилежність універсальному запуску: малий, перевірений стек, який обробляє відкриті моделі провідного класу на вже наявному у людей апаратному забезпеченні.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.