חזרה
GLM-5.2 מקומית: Unsloth פרסמה כימותים של המודל של Z.ai
SiTech AI Team2 წთ. საკითხავი

GLM-5.2 מקומית: Unsloth פרסמה כימותים של המודל של Z.ai

Unsloth פרסמה כימות GGUF דינמיים של GLM-5.2, המודל הפתוח של Z.ai עם 744 מיליארד פרמטרים וחלון הקשר של מיליון טוקנים, כך שאפשר להריץ אותו על תחנת עבודה מקומית או Mac.

מהו GLM-5.2

חברת Unsloth פרסמה כימות GGUF דינמיים של GLM-5.2, המודל הפתוח החדש של Z.ai, כך שאפשר להריץ אותו על חומרה מקומית במקום על משאבי ענן בשכירות. למודל 744 מיליארד פרמטרים, מתוכם 40 מיליארד פעילים בכל רגע, וחלון הקשר של מיליון טוקנים. לפי Unsloth הוא מגיע לתוצאות המובילות בקידוד ארוך טווח, בהיסק ובמשימות סוכנים, ופועל ברמה של Claude 4.8 Opus, GPT-5.5 ו-Gemini 3.1 Pro במבחנים רבים — השוואה שמגיעה ממי שמפרסמת את הכימותים עצמה ולא מהערכה בלתי תלויה.

החברה מציינת ש-Z.ai נתנה לה גישה למשקולות ביום הראשון, וקבצי הכימות פורסמו ב-Hugging Face תחת השם GLM-5.2-GGUF.

כימות: קטן ב-86%, מדויק פחות בכחמישית

החלק המעניין הוא מה קורה לדיוק כשהמודל מתכווץ. לפי המדידות של Unsloth, הגרסה הדינמית של סיבית אחת מגיעה לדיוק top-1 של כ-76.2% בהיותה קטנה ב-86% מהמודל המלא בגודל 1.5 טרה-בייט, וגרסת שתי הסיביות מגיעה לכ-82% דיוק בגודל קטן ב-84%. גרסאות 4 ו-5 סיביות (UD-Q4_K_XL ו-UD-Q5_K_XL) מתוארות ככמעט ללא אובדן.

Unsloth מזהירה מפני קריאת נתון ה-top-1 כציון יכולת. 76% אינם אומרים שהמודל טועה ברבע מהמקרים; הכוונה היא שבמילות מילוי ומילות עצירה הטוקן המועדף משתנה — "כעת אכתוב רומן" עשוי להפוך ל"הרומן מובא להלן". כדי לבסס זאת פרסמה הקבוצה מדידות של דיברגנציית KL, שמראות עד כמה התפלגות הפלט של המודל המכומת סוטה מהבסיס.

דרישות זיכרון

השאלה המעשית לכל מי שיש לו תחנת עבודה או Mac היא כמה זיכרון דורש כל כימות, בספירת VRAM וזיכרון מערכת יחד. הטבלה של Unsloth מפרטת 223 ג'יגה-בייט לסיבית אחת, 245 לשתי סיביות, 290–360 לשלוש, 372–475 לארבע, 570 לחמש ו-810 לשמונה סיביות. גרסת UD-IQ2_M המומלצת תופסת 239 ג'יגה-בייט בדיסק, כך שהיא נכנסת ב-Mac עם 256 ג'יגה-בייט זיכרון מאוחד, ואותו כימות יכול לרוץ על כרטיס מסך אחד של 24 ג'יגה-בייט יחד עם 256 ג'יגה-בייט RAM בשימוש ב-MoE offloading.

הרצה: llama.cpp ו-Unsloth Studio

המדריכים מכסים שתי דרכים. עם llama.cpp אפשר להוריד את המודל בכלי hf בתבנית UD-IQ2_M (או UD-IQ1_S לגרסת הסיבית הבודדת), ואז להפעיל llama-cli עם temperature 1.0, top-p 0.95 ו-min-p 0.01; חלון ההקשר המרבי הוא 1,048,576 טוקנים. Unsloth Studio, ממשק ווב בקוד פתוח, מעביר עומסים ל-RAM אוטומטית, מזהה מערכות עם כמה כרטיסי מסך ומותקן בפקודה אחת.

GLM-5.2 מגיע עם שלושה מצבי חשיבה — ללא חשיבה ושתי רמות היסק, high ו-max — שנבחרים בפרמטר reasoning_effort או מכובים לגמרי כשמגדירים enable_thinking ל-false. Unsloth ממליצה על מצב max במשימות מורכבות.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.