Назад
GLM-5.2 локально: Unsloth опублікувала квантизації моделі Z.ai
SiTech AI Team3 წთ. საკითხავი

GLM-5.2 локально: Unsloth опублікувала квантизації моделі Z.ai

Unsloth опублікувала динамічні GGUF-квантизації GLM-5.2 — відкритої моделі Z.ai з 744 мільярдами параметрів і контекстом на мільйон токенів, яку тепер можна запускати на локальній робочій станції чи Mac.

Що таке GLM-5.2

Unsloth опублікувала динамічні GGUF-квантизації GLM-5.2 — нової відкритої моделі від Z.ai, яку тепер можна запускати на локальному обладнанні, а не на орендованих хмарних ресурсах. Модель має 744 мільярди параметрів, з яких 40 мільярдів активні в кожен момент, а вікно контексту становить один мільйон токенів. За словами Unsloth, вона досягає найкращих результатів у тривалому програмуванні, міркуваннях та агентних задачах і працює на рівні Claude 4.8 Opus, GPT-5.5 та Gemini 3.1 Pro за багатьма бенчмарками — це порівняння походить від самого видавця квантизацій, а не від незалежного оцінювання.

Компанія зазначає, що Z.ai надала їй доступ до ваг у день релізу, а квантизовані файли опубліковані на Hugging Face під назвою GLM-5.2-GGUF.

Квантизація: на 86% менше, приблизно на п'яту частину менш точно

Найцікавіше — те, що відбувається з точністю, коли модель стискається. За вимірюваннями Unsloth, динамічна 1-бітна версія сягає приблизно 76,2% точності top-1, будучи на 86% меншою за повну модель обсягом 1,5 ТБ, а 2-бітна версія показує близько 82% точності за 84% меншого розміру. 4-бітна та 5-бітна збірки (UD-Q4_K_XL і UD-Q5_K_XL) описані як майже без втрат.

Unsloth також застерігає від читання показника top-1 як оцінки спроможностей. 76% не означає, що модель помиляється в чверті випадків; ідеться про те, що на службових і стоп-словах бажаний токен моделі змінюється — «Тепер я напишу роман» може стати «Роман наведено нижче». На підтвердження команда опублікувала вимірювання KL-дивергенції, які показують, наскільки розподіл виходів квантизованої моделі відхиляється від базового.

Вимоги до пам'яті

Практичне питання для кожного, хто має робочу станцію чи Mac, — скільки пам'яті потрібно кожній квантизації, рахуючи VRAM і системну RAM разом. У таблиці Unsloth вказано 223 ГБ для 1-бітної, 245 ГБ для 2-бітної, 290–360 ГБ для 3-бітної, 372–475 ГБ для 4-бітної, 570 ГБ для 5-бітної та 810 ГБ для 8-бітної. Рекомендована збірка UD-IQ2_M займає 239 ГБ на диску, тож уміщається на Mac із 256 ГБ уніфікованої пам'яті; та сама квантизація працює на одному 24-гігабайтному GPU разом із 256 ГБ RAM, якщо використовувати MoE offloading.

Запуск: llama.cpp і Unsloth Studio

Посібники описують два шляхи. З llama.cpp модель завантажують через CLI hf за шаблоном UD-IQ2_M (або UD-IQ1_S для 1-бітної збірки), а потім запускають llama-cli з температурою 1.0, top-p 0.95 і min-p 0.01; максимальне вікно контексту — 1 048 576 токенів. Unsloth Studio, вебінтерфейс із відкритим кодом, автоматично переносить обчислення в RAM, розпізнає системи з кількома GPU та встановлюється однією командою.

GLM-5.2 має три режими мислення — без міркувань і два рівні reasoning, high та max, — які вибираються параметром reasoning_effort або вимикаються повністю через enable_thinking зі значенням false. Для складних завдань Unsloth радить режим max.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.