
Redis'in yaratıcısının motoru ds4, önde gelen açık modelleri yerel olarak çalıştırıyor
DwarfStar 4 (ds4), Redis'in yaratıcısı Salvatore Sanfilippo'nun (antirez) C ile yazdığı yerel çıkarım motorudur; asimetrik 2-bit kuantizasyon ve SSD akışı ile 284 milyar parametreli DeepSeek modelini 96-128 GB makinelerde çalıştırır.
DwarfStar 4 (ds4), Redis'in yaratıcısı Salvatore Sanfilippo (antirez) tarafından C dilinde yazılmış bir yerel çıkarım motorudur. Proje MIT lisansı ile GitHub'da dağıtılıyor ve önde gelen açık modelleri yüksek bellekli Mac'lerde, NVIDIA CUDA sistemlerinde ve AMD ROCm makinelerinde, bulut hizmetlerine bağımlı olmadan çalıştırıyor.
ds4 bilinçli olarak dar bir motor, evrensel bir GGUF çalıştırıcı değildir: yalnızca birkaç model ailesini destekler. Listede DeepSeek V4 Flash ve V4.1 Flash, GLM 5.x, Qwen3.8 Flash Next ve görsel modeller yer alıyor; çok yüksek bellekli sistemlerde DeepSeek V4 PRO da çalışıyor. Projenin bloguna göre, Eylül ayında ds4 165 commitlik bir güncelleme aldı; bu güncelleme DeepSeek V4.1 Flash, Qwen3.8 Flash Next, görsel modeller için daha geniş destek ve modele göre sunucu toplu işlemleme ekledi. GitHub'da projenin 22 binden fazla yıldızı var.
284 milyar parametreli model tek makinede nasıl sığıyor
Ana model olan DeepSeek V4 Flash, 284 milyar parametreli mixture-of-experts mimarisine sahiptir. ds4, asimetrik 2-bit kuantizasyon yardımıyla onu 96-128 GB birleşik belleğe sahip makinelerde barındırıyor: yönlendirilmiş uzmanlar, parametrelerin büyük kısmı Q2 formatına kadar sıkıştırılırken, toplam uzmanlar ve karar verme için kritik tensörler yüksek hassasiyette korunuyor. Kuantizasyon imatrix verileri ile ayarlanıyor ve referans sonuçlarla karşılaştırılarak doğrulanıyor.
SSD akışı ve diskte saklanan KV önbelleği
RAM'de büyük modeller SSD'den akış ile yüklenir, bu yüzden 128 GB'lık bir makine başka türlü sığmayacak bir versiyonu bile çalıştırabilir. Projesi KV önbelleğini dayanıklı veri olarak ele alıyor: kayıtlar istem hash'ine bağlanır, diskte saklanır ve işlem yeniden yüklendikten sonra da kalır, bu yüzden uzun ajan oturumları prefill'in tam maliyetini yeniden ödemez. Araç çağrıları, önbellekle birlikte hayatta kalan deterministik bir oynatma haritasına sahiptir.
Donanım, arayüzler ve hız
ds4 üç arayüz sunuyor: sohbet CLI'si, OpenAI ve Anthropic uyumlu API'lerine sahip sunucu ve kendi kodlama ajanı. Sunucu Claude Code, Codex CLI ve OpenCode ile çalışıyor. 128 GB'lık M5 Max'ta proje 2048 tokenlik bağlamda 39,4 token/sn üretim ve 790 token/sn prefill hızı kaydediyor; DGX Spark'ta bu değerler 18,1 ve 825,8'dir. CUDA mikro toplu işlemleme, eski Ada Lovelace nesil ekran kartlarına sahip sunucuları çok kullanıcılı LLM sunucusuna dönüştürüyor: sekiz L40S kartında 120 token/sn toplam üretim ve 2000 token/sn prefill ölçülmüştür.
Proje temelini llama.cpp ve GGML'den alır. Tezi evrensel çalıştırıcılara karşıt: önde gelen sınıf açık modelleri, insanların zaten sahip olduğu donanımda işleyen küçük, doğrulanmış bir yığındır.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.