
Redis-ის შემქმნელის ძრავა ds4 წამყვან ღია მოდელებს ლოკალურად უშვებს
DwarfStar 4 (ds4) Redis-ის შემქმნელის, სალვატორე სანფილიპოს (antirez) C-ზე დაწერილი ლოკალური ინფერენსის ძრავაა; ასიმეტრიული 2-ბიტიანი კვანტიზაციითა და SSD-სტრიმინგით ის 284-მილიარდპარამეტრიან DeepSeek-ის მოდელს 96-128 გბ-იან მანქანებზე უშვებს.
DwarfStar 4 (ds4) ლოკალური ინფერენსის ძრავაა, რომელიც Redis-ის შემქმნელმა სალვატორე სანფილიპომ (antirez) C ენაზე დაწერა. პროექტი MIT ლიცენზიით GitHub-ზე ვრცელდება და წამყვან ღია მოდელებს მაღალმეხსიერებიან Mac-ებზე, NVIDIA-ს CUDA სისტემებსა და AMD-ის ROCm მანქანებზე უშვებს, ღრუბლოვან სერვისებზე დამოკიდებულების გარეშე.
ds4 განზრახ ვიწრო ძრავია და არა უნივერსალური GGUF გამშვები: ის მხოლოდ რამდენიმე მოდელის ოჯახს უჭერს მხარს. სიაშია DeepSeek V4 Flash და V4.1 Flash, GLM 5.x, Qwen3.8 Flash Next და ვიზუალური მოდელები; ძალიან მაღალმეხსიერებიან სისტემებზე DeepSeek V4 PRO-იც მუშაობს. პროექტის ბლოგის ცნობით, სექტემბერში ds4-მა 165 კომიტიანი განახლება მიიღო, რომელმაც DeepSeek V4.1 Flash, Qwen3.8 Flash Next, ვიზუალური მოდელების უფრო ფართო მხარდაჭერა და მოდელზე მორგებული სერვერის ბატჩინგი დაამატა. GitHub-ზე პროექტს 22 ათასზე მეტი ვარსკვლავი აქვს.
როგორ ეტევა 284-მილიარდიანი მოდელი ერთ მანქანაზე
მთავარი მოდელი, DeepSeek V4 Flash, 284 მილიარდი პარამეტრის მქონე mixture-of-experts არქიტექტურაა. ds4 მას 96-128 გბ ერთიანი მეხსიერების მანქანებზე ათავსებს ასიმეტრიული 2-ბიტიანი კვანტიზაციის დახმარებით: მარშრუტირებული ექსპერტები, სადაც პარამეტრების უმეტესი ნაწილია თავმოყრილი, Q2 ფორმატებამდე იკუმშება, ხოლო საერთო ექსპერტები და გადაწყვეტილებისთვის კრიტიკული ტენზორები მაღალ სიზუსტეს ინარჩუნებენ. კვანტიზაცია imatrix მონაცემებით არის გამართული და საცნობარო შედეგებთან შედარებით მოწმდება.
SSD-სტრიმინგი და დისკზე შენახული KV ქეში
RAM-ზე დიდი მოდელები წონებს SSD-დან სტრიმინგით ტვირთავს, ამიტომ 128 გბ-იან მანქანას ისეთი ვერსიის გაშვებაც შეუძლია, რომელიც სხვაგვარად არ დაეტევა. KV ქეშს პროექტი გამძლე მონაცემად განიხილავს: ჩანაწერები პრომპტის ჰეშზე მიბმულია, დისკზე ინახება და პროცესის გადატვირთვის შემდეგაც რჩება, ამიტომ გრძელი აგენტური სესიები prefill-ის სრულ ხარჯს ხელახლა აღარ იხდის. ინსტრუმენტების გამოძახებებს დეტერმინისტული რეპლეის რუკა აქვს, რომელიც ქეშთან ერთად გადარჩება.
აპარატურა, ინტერფეისები და სიჩქარე
ds4 სამ ინტერფეისს გვთავაზობს: სასაუბრო CLI-ს, სერვერს OpenAI-სა და Anthropic-ის თავსებადი API-ებით და საკუთარ კოდინგის აგენტს. სერვერი მუშაობს Claude Code-თან, Codex CLI-თან და OpenCode-თან. 128 გბ-იან M5 Max-ზე პროექტი 39,4 ტოკენს/წმ გენერაციასა და 790 ტოკენს/წმ prefill-ს აფიქსირებს 2048-ტოკენიან კონტექსტზე; DGX Spark-ზე ეს მაჩვენებლები 18,1 და 825,8-ია. CUDA-ს მიკრობატჩინგი ძველი Ada Lovelace თაობის ვიდეობარათების სერვერებს მრავალმომხმარებლიან LLM სერვერად აქცევს: რვა L40S ბარათზე გაზომილია 120 ტოკენი/წმ საერთო გენერაცია და 2000 ტოკენი/წმ prefill.
პროექტი საფუძვლად llama.cpp-სა და GGML-ს ასახელებს. მისი თეზისი უნივერსალური გამშვების საპირისპიროა: პატარა, შემოწმებული სტეკი, რომელიც წამყვანი კლასის ღია მოდელებს ადამიანების უკვე არსებულ აპარატურაზე ამუშავებს.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.