უკან დაბრუნება
GLM-5.2 ლოკალურად: Unsloth-მა Z.ai-ის მოდელის კვანტიზაციები გამოაქვეყნა
SiTech AI Team2 წთ. საკითხავი

GLM-5.2 ლოკალურად: Unsloth-მა Z.ai-ის მოდელის კვანტიზაციები გამოაქვეყნა

Unsloth-მა GLM-5.2-ის დინამიური GGUF კვანტიზაციები გამოაქვეყნა — Z.ai-ის 744-მილიარდპარამეტრიანი ღია მოდელი მილიონტოკენიანი კონტექსტით, რომლის ლოკალურ სამუშაო სადგურზე ან Mac-ზე გაშვებაც უკვე შესაძლებელია.

რა არის GLM-5.2

Unsloth-მა გამოაქვეყნა GLM-5.2-ის დინამიური GGUF კვანტიზაციები — Z.ai-ის ახალი ღია მოდელი, რომლის ლოკალურ აპარატურაზე გაშვებაც უკვე შესაძლებელია ღრუბლოვანი რესურსების ნაცვლად. მოდელს 744 მილიარდი პარამეტრი აქვს, საიდანაც ნებისმიერ მომენტში 40 მილიარდია აქტიური, კონტექსტის ფანჯარა კი ერთ მილიონ ტოკენს აღწევს. Unsloth-ის თანახმად, მოდელი საუკეთესო შედეგებს აჩვენებს გრძელვადიან კოდირებაში, მსჯელობასა და აგენტურ ამოცანებში და მრავალ ბენჩმარკზე Claude 4.8 Opus-ის, GPT-5.5-ისა და Gemini 3.1 Pro-ს დონეზე მუშაობს — შედარება თავად კვანტების გამომქვეყნებლისგან მოდის და არა დამოუკიდებელი შეფასებიდან.

კომპანია აღნიშნავს, რომ Z.ai-მ მათ წონებზე წვდომა პირველივე დღეს მისცა, კვანტიზებული ფაილები კი Hugging Face-ზე სახელით GLM-5.2-GGUF არის გამოქვეყნებული.

კვანტიზაცია: 86%-ით მცირე, დაახლოებით მეხუთედით ნაკლებად ზუსტი

საინტერესო ის არის, რა ხდება სიზუსტესთან მოდელის დაპატარავებისას. Unsloth-ის გაზომვებით, დინამიური 1-ბიტიანი ვერსია დაახლოებით 76.2%-იან top-1 სიზუსტეს აღწევს და სრულ 1.5 ტერაბაიტიან მოდელზე 86%-ით პატარაა, 2-ბიტიანი ვერსია კი დაახლოებით 82% სიზუსტეს აჩვენებს 84%-ით მცირე ზომით. 4- და 5-ბიტიანი ვარიანტები (UD-Q4_K_XL და UD-Q5_K_XL) პრაქტიკულად უდანაკარგოდ არის აღწერილი.

Unsloth აფრთხილებს, რომ top-1 მაჩვენებელი შესაძლებლობების ქულად არ უნდა წავიკითხოთ. 76% არ ნიშნავს, რომ მოდელი დროის მეოთხედში არასწორად პასუხობს; საქმე იმაშია, რომ დამხმარე სიტყვებზე მოდელის სავარაუდო ტოკენი იცვლება — „ახლა რომანს დავწერ“ შეიძლება გახდეს „რომანი ქვემოთაა“. ამის დასადასტურებლად გუნდმა გამოაქვეყნა KL-დივერგენციის გაზომვები, რომლებიც აჩვენებს, რამდენად შორდება კვანტიზებული მოდელის გამოსავლის განაწილება საბაზისოს.

მეხსიერების მოთხოვნები

პრაქტიკული კითხვა ყველასთვის, ვისაც სამუშაო სადგური ან Mac აქვს, არის ის, თუ რამდენი მეხსიერება სჭირდება თითოეულ კვანტს — VRAM-ისა და ოპერატიული მეხსიერების ჯამურად. Unsloth-ის ცხრილში მითითებულია 223 გბ 1-ბიტიანისთვის, 245 გბ 2-ბიტიანისთვის, 290–360 გბ 3-ბიტიანისთვის, 372–475 გბ 4-ბიტიანისთვის, 570 გბ 5-ბიტიანისთვის და 810 გბ 8-ბიტიანისთვის. რეკომენდებული UD-IQ2_M ვერსია დისკზე 239 გბ-ს იკავებს, რაც 256 გბ ერთიანი მეხსიერების Mac-ზე ეტევა; იგივე კვანტი ერთ 24 გბ-იან GPU-ზე და 256 გბ ოპერატიულ მეხსიერებაზე მუშაობს MoE offloading-ის გამოყენებით.

გაშვება: llama.cpp და Unsloth Studio

გიდები ორ გზას მოიცავს. llama.cpp-ის შემთხვევაში მოდელის ჩამოტვირთვა hf CLI-ით შესაძლებელია UD-IQ2_M ნიმუშის გამოყენებით (ან UD-IQ1_S 1-ბიტიანი ვერსიისთვის), შემდეგ კი გაშვება llama-cli-ით temperature 1.0-ზე, top-p 0.95-სა და min-p 0.01-ზე; კონტექსტის მაქსიმალური ფანჯარა 1,048,576 ტოკენია. Unsloth Studio — ღია კოდის ვებ-ინტერფეისი — ავტომატურად გადაანაწილებს დატვირთვას RAM-ზე, ამოიცნობს მრავალ GPU-იან სისტემებს და ერთი ბრძანებით ინსტალირდება.

GLM-5.2 სამი აზროვნების რეჟიმით მოდის — არააზროვნებითი და ორი დონის მსჯელობა, high და max — რომლებიც reasoning_effort პარამეტრით ირჩევა ან საერთოდ გამორთვადია enable_thinking-ის false-ზე დაყენებით. Unsloth რთული ამოცანებისთვის max რეჟიმს რეკომენდაციას უწევს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.