Վերադառնալ
GLM-5.2-ը տեղականում. Unsloth-ը հրապարակել է Z.ai-ի մոդելի քվանտիզացիաները
SiTech AI Team3 წთ. საკითხავი

GLM-5.2-ը տեղականում. Unsloth-ը հրապարակել է Z.ai-ի մոդելի քվանտիզացիաները

Unsloth-ը հրապարակել է GLM-5.2-ի դինամիկ GGUF քվանտիզացիաները՝ Z.ai-ի 744 միլիարդ պարամետրով և մեկ միլիոն թոքեն կոնտեքստով բաց մոդելը, որն այժմ կարելի է աշխատեցնել տեղական աշխատանքային կայանում կամ Mac-ում։

Ինչ է GLM-5.2-ը

Unsloth-ը հրապարակել է GLM-5.2-ի դինամիկ GGUF քվանտիզացիաները՝ Z.ai-ի նոր բաց մոդելը, որն այժմ հնարավոր է աշխատեցնել տեղական սարքավորումներում՝ վարձակալված ամպային ռեսուրսների փոխարեն։ Մոդելն ունի 744 միլիարդ պարամետր, որոնցից 40 միլիարդն ակտիվ է ցանկացած պահի, իսկ կոնտեքստի պատուհանը մեկ միլիոն թոքեն է։ Unsloth-ի խոսքով՝ մոդելը լավագույն արդյունքներն է ցույց տալիս երկարաժամկետ ծրագրավորման, դատողության և գործակալային խնդիրներում ու շատ բենչմարքերում աշխատում է Claude 4.8 Opus-ի, GPT-5.5-ի և Gemini 3.1 Pro-ի մակարդակով. Այս համեմատությունը գալիս է հենց քվանտիզացիաները հրապարակող ընկերությունից, ոչ թե անկախ գնահատումից։

Ընկերությունը նշում է, որ Z.ai-ն կշիռների հասանելիություն է տվել առաջին իսկ օրը, իսկ քվանտացված ֆայլերը Hugging Face-ում հրապարակված են GLM-5.2-GGUF անվամբ։

Քվանտիզացիա՝ 86%-ով փոքր, մոտ մեկ հինգերորդով պակաս ճշգրիտ

Հետաքրքիրն այն է, թե ինչ է կատարվում ճշգրտության հետ մոդելի փոքրանալիս։ Unsloth-ի չափումներով՝ դինամիկ 1-բիթանոց տարբերակը հասնում է մոտ 76.2% top-1 ճշգրտության՝ լինելով 1.5 տերաբայթանոց ամբողջական մոդելից 86%-ով փոքր, իսկ 2-բիթանոցը՝ մոտ 82% ճշգրտության՝ 84%-ով փոքր չափով։ 4- և 5-բիթանոց հավաքածուները (UD-Q4_K_XL և UD-Q5_K_XL) նկարագրվում են որպես գրեթե առանց կորուստների։

Unsloth-ը զգուշացնում է top-1 ցուցանիշը որպես ունակության գնահատական չընկալել։ 76%-ը չի նշանակում, որ մոդելը չորս դեպքից մեկում սխալ է պատասխանում. խոսքը լրացուցիչ և կանգառ բառերի վրա մոդելի նախընտրած թոքենի փոփոխության մասին է՝ «Հիմա վեպ կգրեմ» կարող է դառնալ «Վեպը ներկայացված է ստորև»։ Դա հիմնավորելու համար թիմը հրապարակել է KL դիվերգենցիայի չափումներ, որոնք ցույց են տալիս, թե որքան է քվանտացված մոդելի ելքի բաշխումը շեղվում բազայինից։

Հիշողության պահանջներ

Գործնական հարցը բոլորի համար, ով ունի աշխատանքային կայան կամ Mac, այն է, թե որքան հիշողություն է պահանջում յուրաքանչյուր քվանտիզացիա՝ VRAM-ը և համակարգի RAM-ը միասին հաշված։ Unsloth-ի աղյուսակում նշված է 223 ԳԲ՝ 1 բիթի համար, 245 ԳԲ՝ 2 բիթի, 290–360 ԳԲ՝ 3 բիթի, 372–475 ԳԲ՝ 4 բիթի, 570 ԳԲ՝ 5 բիթի և 810 ԳԲ՝ 8 բիթի համար։ Առաջարկվող UD-IQ2_M հավաքածուն սկավառակի վրա զբաղեցնում է 239 ԳԲ, ինչը տեղավորվում է 256 ԳԲ միասնական հիշողությամբ Mac-ում. նույն քվանտիզացիան աշխատում է մեկ 24 ԳԲ վիդեոքարտի և 256 ԳԲ RAM-ի վրա MoE offloading-ի դեպքում։

Գործարկումը՝ llama.cpp և Unsloth Studio

Ուղեցույցները երկու ճանապարհ են առաջարկում։ llama.cpp-ի դեպքում մոդելը ներբեռնվում է hf CLI-ով՝ UD-IQ2_M նախշով (կամ UD-IQ1_S՝ 1-բիթանոց տարբերակի համար), ապա գործարկվում llama-cli-ով՝ temperature 1.0, top-p 0.95 և min-p 0.01 կարգավորումներով. կոնտեքստի առավելագույն պատուհանը 1,048,576 թոքեն է։ Բաց կոդով վեբ ինտերֆեյս Unsloth Studio-ն ինքնաշխատ կերպով ծանրաբեռնվածությունը տեղափոխում է RAM, ճանաչում է բազմաթիվ GPU-ներով համակարգերը և տեղադրվում է մեկ հրամանով։

GLM-5.2-ն ունի մտածողության երեք ռեժիմ՝ առանց մտածողության և դատողության երկու մակարդակ՝ high և max, որոնք ընտրվում են reasoning_effort պարամետրով կամ ամբողջությամբ անջատվում enable_thinking-ը false դարձնելով։ Unsloth-ը բարդ խնդիրների համար խորհուրդ է տալիս max ռեժիմը։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։