
محرك ds4 من مُنشئ Redis يشغّل النماذج المفتوحة الرائدة محليًا
DwarfStar 4 (ds4) هو محرك استدلال محلي كتبه مُنشئ Redis، سالفاتوري فيليبو (antirez)، بلغة C؛ باستخدام تكميم ثنائي البت غير المتماثل وتدفق SSD، يشغّل نموذج DeepSeek ذي 284 مليار معامل على أجهزة بذاكرة 96-128 جيجابايت.
DwarfStar 4 (ds4) هو محرك استدلال محلي كتبه مُنشئ Redis، سالفاتوري فيليبو (antirez)، بلغة C. المشروع منشور بترخيص MIT على GitHub ويشغّل النماذج المفتوحة الرائدة على أجهزة Mac عالية الذاكرة وأنظمة CUDA من NVIDIA وأجهزة ROCm من AMD، دون الاعتماد على الخدمات السحابية.
ds4 هو محرك ضيق النطاق مقارنةً بمشغلات GGUF الشاملة: يدعم فقط عائلات نماذج محددة. تشمل القائمة DeepSeek V4 Flash وV4.1 Flash وGLM 5.x وQwen3.8 Flash Next والنماذج المرئية؛ كما يعمل DeepSeek V4 PRO على الأنظمة عالية الذاكرة جداً. وفقاً لمدونة المشروع، تلقى ds4 في سبتمبر تحديثاً يضم 165 التزاماً، أضاف دعم DeepSeek V4.1 Flash وQwen3.8 Flash Next ودعمًا أوسع للنماذج المرئية ودفعات خادم مخصصة للنموذج. يحظى المشروع على GitHub بأكثر من 22 ألف نجمة.
كيف يتسع نموذج 284 مليار على جهاز واحد
النموذج الرئيسي، DeepSeek V4 Flash، هو بنية mixture-of-experts بـ 284 مليار معامل. يضعه ds4 على أجهزة بذاكرة موحدة 96-128 جيجابايت بمساعدة تكميم ثنائي البت غير المتماثل: الخبراء الموجهون، حيث يتم ضغط معظم المعاملات إلى صيغ Q2، بينما يحتفظ الخبراء المشتركون والتنسورات الحاسمة للاستدلال بدقة عالية. تم ضبط التكميم باستخدام بيانات imatrix والتحقق منه مقارنةً بالنتائج المرجعية.
تدفق SSD وذاكرة التخزين المؤقت KV المخزنة على القرص
يحمّل المشروع النماذج الكبيرة على RAM عبر التدفق من SSD، لذا يمكن لجهاز بذاكرة 128 جيجابايت تشغيل نسخة لا تتسع بطرق أخرى. يتعامل المشروع مع ذاكرة التخزين المؤقت KV كبيانات دائمة: ترتبط السجلات بتجزئة الموجه، وتُخزن على القرص وتبقى بعد إعادة تحميل العملية، لذا لا تدفع الجلسات الطويلة للوكيل تكلفة prefill الكاملة مرة أخرى. لاستدعاءات الأدوات خريطة إعادة تشغيل حتمية تبقى مع الذاكرة المؤقتة.
الأجهزة والواجهات والسرعة
يقدم ds4 ثلاث واجهات: واجهة سطر أوامر للمحادثة، وخادم بواجهات API متوافقة مع OpenAI وAnthropic، ووكيل برمجة خاص. يعمل الخادم مع Claude Code وCodex CLI وOpenCode. على جهاز M5 Max بذاكرة 128 جيجابايت، سجّل المشروع توليد 39.4 رمز/ثانية وprefill بـ 790 رمز/ثانية على سياق 2048 رمز؛ وعلى DGX Spark كانت هذه الأرقام 18.1 و825.8. يحوّل الدفعات المصغرة في CUDA خوادم بطاقات الفيديو من جيل Ada Lovelace القديم إلى خوادم LLM متعددة المستخدمين: قُيس على ثماني بطاقات L40S توليد إجمالي 120 رمز/ثانية وprefill بـ 2000 رمز/ثانية.
يستند المشروع إلى llama.cpp وGGML. أطروحته بديلة عن المشغلات الشاملة: حزمة صغيرة ومدققة تعالج النماذج المفتوحة من الطبقة الرائدة على الأجهزة الموجودة لدى الناس بالفعل.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.