Վերադառնալ
Redis-ի ստեղծողի ds4 շարժիչը լոկալ է գործարկում առաջատար բաց մոդելները
SiTech AI Team2 րոպե ընթերցում

Redis-ի ստեղծողի ds4 շարժիչը լոկալ է գործարկում առաջատար բաց մոդելները

DwarfStar 4 (ds4) լոկալ ենթադրման շարժիչ է, որը Redis-ի ստեղծող Սալվատորե Սանֆիլիպոի (antirez) կողմից գրված է C-ով: ասիմետրիկ 2-բիթային կվանտիզացիայով և SSD սթրիմինգով այն 284 միլիարդ պարամետրով DeepSeek մոդելը գործարկում է 96-128 ԳԲ մեքենաների վրա:

DwarfStar 4 (ds4) լոկալ ենթադրման շարժիչ է, որը գրվել է Redis-ի ստեղծող Սալվատորե Սանֆիլիպոի (antirez) կողմից C լեզվով: Նախագիծը տարածվում է MIT լիցենզիայով GitHub-ում և գործարկում է առաջատար բաց մոդելները բարձր հիշողությամբ Mac-ների վրա, NVIDIA-ի CUDA համակարգերի վրա և AMD-ի ROCm մեքենաների վրա՝ առանց ամպային ծառայությունների կախվածության:

ds4 նախատեսված նեղ շարժիչ է, ոչ թե ունիվերսալ GGUF գործարկիչ: այն աջակցում է միայն մի քանի մոդելի ընտանիք: ցուցակում են DeepSeek V4 Flash և V4.1 Flash, GLM 5.x, Qwen3.8 Flash Next և վիզուալ մոդելներ: շատ բարձր հիշողությամբ համակարգերի վրա աշխատում է նաև DeepSeek V4 PRO-ն: Նախագծի բլոգի տվյալներով, սեպտեմբերին ds4-ն ստացել է 165 կոմիտային թարմացում, որը ավելացրել է DeepSeek V4.1 Flash, Qwen3.8 Flash Next, վիզուալ մոդելների ավելի լայն աջակցություն և մոդելի վրա հիմնված սերվերային բատչինգ: GitHub-ում նախագծին կան 22 հազարից ավելի աստղ:

Ինչպես է տեղավորվում 284 միլիարդանոց մոդելը մեկ մեքենայի վրա

Հիմնական մոդելը՝ DeepSeek V4 Flash, 284 միլիարդ պարամետր ունեցող mixture-of-experts ճարտարագիտություն է: ds4-ն դրան տեղավորում է 96-128 ԳԲ միասին հիշողությամբ մեքենաների վրա՝ ասիմետրիկ 2-բիթային կվանտիզացիայի միջոցով: երթուղավորված մասնագետներ, որտեղ պարամետրերի մեծ մասը կենտրոնացված է, կոմպրեսվում է Q2 ֆորմատներով, իսկ ընդհանուր մասնագետները և որոշումների համար կրիտիկական թենզորները պահպանում են բարձր ճշգրտություն: Կվանտիզացիան կարգավորված է imatrix տվյալներով և ստուգվում է համեմատությամբ հղումների արդյունքների հետ:

SSD սթրիմինգ և սկավառակում պահվող KV քեշ

RAM-ի վրա մեծ մոդելները բեռնում են SSD-ից սթրիմինգով, ուստի 128 ԳԲ մեքենան կարող է գործարկել այդպիսի տարբերակ, որը այլ կերպ չի տեղավորվի: KV քեշը նախագիծը դիտարկում է որպես դիմակայուն տվյալ: գրառումները կապված են պրոմպտի հեշի հետ, պահվում են սկավառակի վրա և մնում են նույնիսկ գործընթացի վերաբեռնելուց հետո, ուստի երկար ագենտային սեսիաները նորից չեն վճարում prefill-ի ամբողջ ծախսը: Գործիքների կանչերը ունեն դետերմինիստական վերարտադրման քարտեզ, որը մնում է քեշի հետ միասին:

Սարքային ապահովում, ինտերֆեյսներ և արագություն

ds4 առաջարկում է երեք ինտերֆեյս: զրուցային CLI, սերվեր OpenAI-ի և Anthropic-ի համատեղելի API-ներով և սեփական կոդավորման ագենտ: Սերվերը աշխատում է Claude Code-ի, Codex CLI-ի և OpenCode-ի հետ: 128 ԳԲ M5 Max-ի վրա նախագիծը արձանագրում է 39,4 տոկեն/վ արտադրություն և 790 տոկեն/վ prefill 2048 տոկենանոց համատեքստում: DGX Spark-ի վրա այդ ցուցանիշներն են 18,1 և 825,8: CUDA-ի միկրոբատչինգը հին Ada Lovelace սերնդի տեսակարտերի սերվերները վերածում է բազմակիստային LLM սերվերի: ութ L40S քարտի վրա չափվել է 120 տոկեն/վ ընդհանուր արտադրություն և 2000 տոկեն/վ prefill:

Նախագիծը հիմք է դնում llama.cpp-ի և GGML-ի վրա: Նրա թեզիսը ունիվերսալ գործարկչի հակադիրն է: փոքր, ստուգված ստեկ, որը առաջատար դասի բաց մոդելները մշակում է մարդկանց արդեն առկա սարքային ապահովման վրա:

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։