Geri Dön
GLM-5.2 yerelde: Unsloth, Z.ai modelinin kuantizasyonlarını yayımladı
SiTech AI Team3 წთ. საკითხავი

GLM-5.2 yerelde: Unsloth, Z.ai modelinin kuantizasyonlarını yayımladı

Unsloth, Z.ai'nin 744 milyar parametreli ve bir milyon token bağlam pencereli açık modeli GLM-5.2 için dinamik GGUF kuantizasyonlarını yayımladı; model artık yerel bir iş istasyonunda veya Mac'te çalıştırılabiliyor.

GLM-5.2 nedir

Unsloth, Z.ai'nin yeni açık modeli GLM-5.2 için dinamik GGUF kuantizasyonlarını yayımladı; böylece model kiralık bulut kaynakları yerine yerel donanımda çalıştırılabiliyor. Model 744 milyar parametreye sahip, bunların 40 milyarı her an etkin, bağlam penceresi ise bir milyon token. Unsloth'a göre model uzun soluklu kodlama, akıl yürütme ve ajan görevlerinde en iyi sonuçları veriyor ve birçok kıyaslamada Claude 4.8 Opus, GPT-5.5 ve Gemini 3.1 Pro seviyesinde performans gösteriyor — bu karşılaştırma bağımsız bir değerlendirmeden değil, kuantizasyonları yayımlayan şirketin kendisinden geliyor.

Şirket, Z.ai'nin ağırlıklara ilk günden erişim sağladığını belirtiyor; kuantize dosyalar Hugging Face'te GLM-5.2-GGUF adıyla yayımlandı.

Kuantizasyon: %86 daha küçük, yaklaşık beşte bir daha az isabetli

Asıl ilginç olan, model küçülürken doğruluğa ne olduğu. Unsloth'un ölçümlerine göre dinamik 1 bitlik sürüm, 1,5 TB'lık tam modelden %86 daha küçük olmasına rağmen yaklaşık %76,2 top-1 doğruluğa ulaşıyor; 2 bitlik sürüm ise %84 daha küçük boyutta yaklaşık %82 doğruluk veriyor. 4 ve 5 bitlik derlemeler (UD-Q4_K_XL ve UD-Q5_K_XL) neredeyse kayıpsız olarak tanımlanıyor.

Unsloth, top-1 rakamının bir yetenek puanı gibi okunmaması gerektiği konusunda uyarıyor. %76, modelin vakaların dörtte birinde yanlış yanıt verdiği anlamına gelmiyor; dolgu ve işlev sözcüklerinde modelin tercih ettiği token değişiyor — "Şimdi bir roman yazacağım" ifadesi "Roman aşağıda" hâline gelebiliyor. Bunu desteklemek için ekip, kuantize modelin çıktı dağılımının temelden ne kadar saptığını gösteren KL ıraksama ölçümlerini yayımladı.

Bellek gereksinimleri

Bir iş istasyonu ya da Mac'i olan herkes için pratik soru, her kuantizasyonun ne kadar bellek istediği; VRAM ve sistem RAM'i birlikte sayılıyor. Unsloth'un tablosu 1 bit için 223 GB, 2 bit için 245 GB, 3 bit için 290–360 GB, 4 bit için 372–475 GB, 5 bit için 570 GB ve 8 bit için 810 GB listeliyor. Önerilen UD-IQ2_M derlemesi diskte 239 GB yer kaplıyor; yani 256 GB birleşik belleğe sahip bir Mac'e sığıyor ve aynı kuantizasyon, MoE offloading kullanıldığında tek bir 24 GB ekran kartı ile 256 GB RAM üzerinde çalışabiliyor.

Çalıştırma: llama.cpp ve Unsloth Studio

Kılavuzlar iki yol sunuyor. llama.cpp ile model, hf CLI üzerinden UD-IQ2_M kalıbıyla (1 bitlik sürüm için UD-IQ1_S) indiriliyor ve llama-cli temperature 1.0, top-p 0.95, min-p 0.01 ayarlarıyla başlatılıyor; en büyük bağlam penceresi 1.048.576 token. Açık kaynaklı bir web arayüzü olan Unsloth Studio yükü otomatik olarak RAM'e taşıyor, çoklu GPU sistemlerini algılıyor ve tek komutla kuruluyor.

GLM-5.2 üç düşünme moduyla geliyor: düşünmesiz ve iki akıl yürütme düzeyi, high ile max. Bunlar reasoning_effort parametresiyle seçiliyor ya da enable_thinking false yapılarak tamamen kapatılıyor. Unsloth karmaşık görevler için max modunu öneriyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.