
GLM-5.2 הופך למודל המשקולות הפתוח המוביל ב-Artificial Analysis
המודל GLM-5.2 של Z.ai מקבל 51 נקודות במדד Intelligence Index v4.1 של Artificial Analysis, לפני MiniMax-M3, DeepSeek V4 Pro ו-Kimi K2.6, ונמצא על חזית פארטו של אינטליגנציה מול עלות למשימה.
GLM-5.2 של Z.ai הוא כעת המודל המוביל בקרב מודלים עם משקולות פתוחות במדד Artificial Analysis Intelligence Index, עם 51 נקודות בגרסה 4.1 של המדד. לפי חברת הניתוח, המודל שומר על אותו גודל של קודמו GLM-5.1 — 744 מיליארד פרמטרים בסך הכול ו-40 מיליארד פעילים — אך מוסיף 11 נקודות במדד.
מיקומו בדירוג
התוצאה מציבה את GLM-5.2 לפני שחרורים פתוחים אחרים: MiniMax-M3 ו-DeepSeek V4 Pro (max) מקבלים 44 נקודות, ו-Kimi K2.6 מגיע ל-43. במדד GDPval-AA v2, המדד המרכזי של Artificial Analysis לביצועים אגנטיים בעולם האמיתי, GLM-5.2 מקבל 1,524 נקודות, לפני MiniMax-M3 (1,418) ו-DeepSeek V4 Pro (max, 1,328), ובפועל באותה רמה של GPT-5.5 במצב xhigh (1,514).
שיפורים במבחנים
השיפור לעומת GLM-5.1 ניכר ברוב המבחנים, ובראשם חשיבה מדעית. CritPt עולה ב-16 נקודות ל-21 אחוזים, HLE מוסיף 12 נקודות ל-40 אחוזים, ו-SciCode עולה ב-7 נקודות ל-50 אחוזים. AA-LCR מטפס ב-9 נקודות ל-71 אחוזים, מבחן tau3 בבנקאות מוסיף 15 נקודות ל-27 אחוזים, ו-TerminalBench v2.1 משתפר ב-16 נקודות ל-78 אחוזים. GPQA Diamond עולה ב-3 נקודות ל-89 אחוזים.
עלות ואמינות
GLM-5.2 נמצא גם על חזית פארטו של תרשים האינטליגנציה מול עלות למשימה, כלומר עלות המשימה הנמוכה ביותר בקרב מודלים ברמת האינטליגנציה שלו. במדד AA-Omniscience הוא מקבל 4 נקודות לעומת 2 ב-GLM-5.1: הדיוק עולה מ-24.2 ל-25.1 אחוזים, ושיעור ההזיות יורד מ-29.4 ל-28.1 אחוזים, בעוד שיעור הניסיונות נשאר 47 אחוזים. המודל צורך כ-43 אלף טוקנים בפלט לכל משימה במדד, מהם 37 אלף טוקני חשיבה.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.