
GLM-5.2 yerli rejimdə: Unsloth Z.ai modelinin kvantizasiyalarını yayımladı
Unsloth Z.ai-nin 744 milyard parametrli və bir milyon token kontekst pəncərəli açıq modeli GLM-5.2 üçün dinamik GGUF kvantizasiyalarını yayımlayıb; model artıq yerli iş stansiyasında və ya Mac-də işlədilə bilər.
GLM-5.2 nədir
Unsloth Z.ai-nin yeni açıq modeli GLM-5.2 üçün dinamik GGUF kvantizasiyalarını yayımlayıb; beləliklə model kirayə bulud resursları yerinə yerli avadanlıqda işlədilə bilər. Modelin 744 milyard parametri var, bunlardan 40 milyardı hər an aktivdir, kontekst pəncərəsi isə bir milyon tokendir. Unsloth-un sözlərinə görə model uzunmüddətli kodlaşdırma, düşünmə və agent tapşırıqlarında ən yaxşı nəticələr göstərir və bir çox bençmarkda Claude 4.8 Opus, GPT-5.5 və Gemini 3.1 Pro səviyyəsində işləyir — bu müqayisə müstəqil qiymətləndirmədən deyil, kvantizasiyaları yayan şirkətin özündən gəlir.
Şirkət qeyd edir ki, Z.ai ona çəkilərə ilk gündən giriş verib, kvantlaşdırılmış fayllar isə Hugging Face-də GLM-5.2-GGUF adı ilə yayımlanıb.
Kvantizasiya: 86% kiçik, təxminən beşdə bir az dəqiq
Maraqlı olan model kiçildikcə dəqiqliyin necə dəyişməsidir. Unsloth-un ölçmələrinə görə dinamik 1-bit versiya 1,5 TB-lıq tam modeldən 86% kiçik olmasına baxmayaraq təxminən 76,2% top-1 dəqiqliyə çatır, 2-bit versiya isə 84% kiçik ölçüdə təqribən 82% dəqiqlik verir. 4- və 5-bit yığımlar (UD-Q4_K_XL və UD-Q5_K_XL) demək olar itkisiz kimi təsvir olunur.
Unsloth top-1 rəqəmini bacarıq balı kimi oxumamaq barədə xəbərdarlıq edir. 76% modelin halların dörddə birində səhv cavab verdiyi anlamına gəlmir; söhbət doldurucu və köməkçi sözlərdə modelin üstün tutduğu tokenin dəyişməsindən gedir — "İndi roman yazacağam" "Roman aşağıdadır"a çevrilə bilər. Bunu əsaslandırmaq üçün komanda kvantlaşdırılmış modelin çıxış paylanmasının bazadan nə qədər yayındığını göstərən KL divergensiya ölçmələrini yayımlayıb.
Yaddaş tələbləri
İş stansiyası və ya Mac sahibi olan hər kəs üçün praktik sual hər kvantizasiyanın nə qədər yaddaş tələb etməsidir; VRAM və sistem RAM-ı birlikdə hesablanır. Unsloth-un cədvəlində 1-bit üçün 223 GB, 2-bit üçün 245 GB, 3-bit üçün 290–360 GB, 4-bit üçün 372–475 GB, 5-bit üçün 570 GB və 8-bit üçün 810 GB göstərilir. Tövsiyə olunan UD-IQ2_M yığımı diskdə 239 GB yer tutur, yəni 256 GB vahid yaddaşlı Mac-a sığır; həmin kvantizasiya MoE offloading istifadə edildikdə tək 24 GB-lıq GPU və 256 GB RAM üzərində işləyə bilir.
İşə salma: llama.cpp və Unsloth Studio
Təlimatlar iki yol təklif edir. llama.cpp ilə model hf CLI vasitəsilə UD-IQ2_M şablonu ilə (1-bit versiya üçün UD-IQ1_S) endirilir, sonra llama-cli temperature 1.0, top-p 0.95 və min-p 0.01 parametrləri ilə başladılır; maksimal kontekst pəncərəsi 1.048.576 tokendir. Açıq mənbəli veb interfeys Unsloth Studio yükü avtomatik RAM-a köçürür, çoxlu GPU-lu sistemləri aşkarlayır və bir əmrlə quraşdırılır.
GLM-5.2 üç düşünmə rejimi ilə gəlir: düşünməsiz və iki düşünmə səviyyəsi — high və max. Onlar reasoning_effort parametri ilə seçilir və ya enable_thinking false edilərək tamamilə söndürülür. Unsloth mürəkkəb tapşırıqlar üçün max rejimini tövsiyə edir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.