חזרה
מנוע ds4 של יוצר Redis מריץ מודלים פתוחים מובילים מקומית
SiTech AI Team2 דק׳ קריאה

מנוע ds4 של יוצר Redis מריץ מודלים פתוחים מובילים מקומית

DwarfStar 4 (ds4) הוא מנוע הסקה מקומי שנכתב ב-C על ידי סלבטורה סנפיליפו (antirez), יוצר Redis; עם קוונטיזציה א-סימטרית של 2 ביט וסטרימינג מ-SSD הוא מריץ את מודל DeepSeek בן 284 מיליארד הפרמטרים על מכונות עם 96-128 ג'יגה.

ds4 (DwarfStar 4) הוא מנוע הסקה מקומי שנכתב בשפת C על ידי סלבטורה סנפיליפו (antirez), יוצר Redis. הפרויקט מופץ תחת רישיון MIT ב-GitHub ומריץ מודלים פתוחים מובילים על Mac בעלי זיכרון גבוה, מערכות NVIDIA CUDA ומכונות AMD ROCm, ללא תלות בשירותי ענן.

ds4 הוא מנוע מצומצם בכוונה ולא מריץ GGUF אוניברסלי: הוא תומך רק במספר משפחות מודלים. ברשימה נכללים DeepSeek V4 Flash ו-V4.1 Flash, GLM 5.x, Qwen3.8 Flash Next ומודלים חזותיים; במערכות בעלות זיכרון גבוה מאוד גם DeepSeek V4 PRO פועל. לפי בלוג הפרויקט, בספטמבר ds4 קיבל עדכון של 165 קומיטים, שהוסיף תמיכה רחבה יותר ב-DeepSeek V4.1 Flash, Qwen3.8 Flash Next, מודלים חזותיים וצוות שרתים מותאם למודל. לפרויקט יש מעל 22 אלף כוכבים ב-GitHub.

איך נכנס מודל של 284 מיליארד למכונה אחת

המודל הראשי, DeepSeek V4 Flash, הוא ארכיטקטורת mixture-of-experts עם 284 מיליארד פרמטרים. ds4 מציב אותו על מכונות עם זיכרון אחיד של 96-128 ג'יגה בעזרת קוונטיזציה א-סימטרית של 2 ביט: מומחים מנותבים, שם רוב הפרמטרים מרוכזים, מצומצמים לפורמט Q2, בעוד מומחים כלליים וטנזורים קריטיים להחלטה שומרים על דיוג גבוה. הקוונטיזציה מותאמת עם נתוני imatrix ונבדקת מול תוצאות ייחוס.

סטרימינג מ-SSD ו-KV קאש שמור על הדיסק

מודלים גדולים שלא נכנסים ל-RAM נטענים בעומס דרך סטרימינג מ-SSD, ולכן מכונה עם 128 ג'יגה יכולה גם להריץ גרסה כזו שאחרת לא הייתה נכנסת. הפרויקט מתייחס ל-KV קאש כאל נתונים עמידים: הרשומות מקושרות לגיבוב של הפרומפט, נשמרות על הדיסק ונשארות גם לאחר טעינה מחדש של התהליך, ולכן סשנים ארוכים של סוכן לא משלמים שוב את מלוא עלות ה-prefill. לקריאות הכלים יש מפת שחזור דטרמיניסטית שנשארת יחד עם הקאש.

חומרה, ממשקים ומהירות

ds4 מציע שלושה ממשקים: CLI לשיחה, שרת עם API תואם OpenAI ו-Anthropic, וסוכן קידוד עצמאי. השרת פועל עם Claude Code, Codex CLI ו-OpenCode. על M5 Max עם 128 ג'יגה הפרויקט מגיע ל-39.4 טוקנים/שנייה בדור ו-790 טוקנים/שנייה ב-prefill על קונטקסט של 2048 טוקנים; על DGX Spark המדדים הם 18.1 ו-825.8. מיקרו-בצ'ינג של CUDA הופך שרתי כרטיסי וידאו מדור Ada Lovelace ישן לשרתי LLM רב-לקוחות: על שמונה כרטיסי L40S נמדדו 120 טוקנים/שנייה דור כולל ו-2000 טוקנים/שנייה prefill.

הפרויקט מציין כבסיס את llama.cpp ו-GGML. התזה שלו מנוגדת להרצה אוניברסלית: מתודולוגיה קטנה ומאומתת שמעבדת מודלים פתוחים מהמחלקה הראשונה על החומרה הקיימת של אנשים.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.