
Redis-in yaradıcısının ds4 mərkəzi aparıcı açıq modelləri yerli işə salır
DwarfStar 4 (ds4) Redis-in yaradıcısı Salvatore Sanfilippo-nun (antirez) C-də yazdığı yerli inferensiya mərkəzidir; asimmetrik 2-bit kvantləşdirmə və SSD-streaming ilə o, 284 milyard parametrik DeepSeek modelini 96-128 GB maşınlarda işə salır.
DwarfStar 4 (ds4) yerli inferensiya mərkəzidir ki, Redis-in yaradıcısı Salvatore Sanfilippo (antirez) tərəfindən C dilində yazılıb. Layihə MIT lisenziyası ilə GitHub-da yayılır və aparıcı açıq modelləri yüksək yaddaşlı Mac-lar, NVIDIA CUDA sistemləri və AMD ROCm maşınlarında bulud xidmətlərinə asılı olmadan işə salır.
ds4 qəsdən dar mərkəzdir və universal GGUF runner deyil: o yalnız bir neçə model ailəsini dəstəkləyir. Siyahıda DeepSeek V4 Flash və V4.1 Flash, GLM 5.x, Qwen3.8 Flash Next və vizual modellər var; çox yüksək yaddaşlı sistemlərdə DeepSeek V4 PRO da işləyir. Layihənin bloguna görə, sentyabrda ds4 165 komitlik yeniləmə aldı ki, bu da DeepSeek V4.1 Flash, Qwen3.8 Flash Next, vizual modellərin daha geniş dəstəyi və modelə uyğunlaşdırılmış server batching əlavə etdi. GitHub-da layihənin 22 mindən çox ulduzu var.
284 milyardlık model bir maşında necə işə salınır
Əsas model, DeepSeek V4 Flash, 284 milyard parametrik mixture-of-experts arxitekturasına malikdir. ds4 onu 96-128 GB vahid yaddaşlı maşınlarda asimmetrik 2-bit kvantləşdirmə köməyi ilə yerləşdirir: marshrutlaşdırılmış ekspertlər, parametrərin əksər hissəsi yığılmış, Q2 formatına qədər sıxılır, ümumi ekspertlər və qərarlar üçün kritik tenserlər isə yüksək dəqiqliyi saxlayır. Kvantləşdirmə imatrix məlumatları ilə tənzəmlənir və nəticələr etalon nəticələrlə müqayisə olunur.
SSD-streaming və diskdə saxlanılan KV keş
RAM-da böyük modellər SSD-dən streaming ilə yüklənir, buna görə 128 GB maşında belə versiya işə salına bilər ki, başqa cür mümkün olmaz. KV keş layihə tədavül məlumatı kimi qəbul edir: qeydlər prompt heşinə bağlıdır, diskdə saxlanılır və proses yenidən yükləndikdən sonra da qalır, buna görə uzun agent sessiyaları prefill-in tam xərcini yenidən ödəmir. Alətlərin çağırışları üçün deterministik replay xəritəsi var ki, bu da keşlə birlikdə qalır.
Apparat, interfeyslər və sürət
ds4 üç interfeys təklif edir: söhbət CLI, OpenAI və Anthropic uyğun API-ləri olan server və öz kodlaşdırma agenti. Server Claude Code, Codex CLI və OpenCode ilə işləyir. 128 GB M5 Max-da layihə 2048 tokenlik kontekstdə 39,4 token/s generasiya və 790 token/s prefill qeyd edir; DGX Spark-da bu göstəricilər 18,1 və 825,8-dır. CUDA mikrobatching köhnə Ada Lovelace nəsilindəki video kartların serverlərini çox istifadəçili LLM serverinə çevirir: səkkiz L40S kartda 120 token/s ümumi generasiya və 2000 token/s prefill ölçülüb.
Layihə əsas kimi llama.cpp və GGML-a istinad edir. Onun tezi universal runner-ın əksidir: kiçik, yoxlanılmış stek ki, aparıcı sinfin açıq modellərini insanların artıq mövcud olan apparatında işlədir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.