Z.ai משיקה את GLM-5.3-Flash: בינה ברמת החזית בעשירית מהמחיר

מעבדת Z.ai הסינית השיקה את GLM-5.3-Flash — מודל רב-מודלי עם 320 מיליארד פרמטרים ורק 18 מיליארד פעילים. הוא עוקף את GLM-5.2 בעשירית מהמחיר ומתקרב ל-Claude Opus 4.8 בקוד ובסוכנים.
מה קרה
ב-26 באוגוסט השיקה מעבדת הבינה המלאכותית הסינית Z.ai את GLM-5.3-Flash — המודל הרב-מודלי הראשון בסדרת GLM-5. למודל 320 מיליארד פרמטרים בסך הכול, אך רק 18 מיליארד פרמטרים פעילים לכל טוקן. הוא עוקף את קודמו GLM-5.2 במבחני ביצועים בעשירית מהמחיר, ומתקרב ל-Claude Opus 4.8 במשימות קוד וסוכנים.
ארכיטקטורה לאינפרנס זול
המודל משלב קשב דליל (sparse) וקשב לינארי (linear) במבנה היברידי, ומוסיף Manifold-Constrained Hyper-Connections (mHC) לשיפור יעילות ההרחבה. לעומת סדרת GLM-4.5, מספר השכבות נחתך כמעט בחצי (45 לעומת 92), כך שעלויות ההרצה נשארות נמוכות גם בהקשר של מיליון טוקנים.
מספרים והרצה אנונימית
לפני ההשקה רץ המודל בעילום שם כ"ox-alpha" בפלטפורמות OpenCode ו-OpenRouter והפך למודל הפופולרי של השבוע — כל התעבורה הוגשה על שבבי AI סיניים. הוא משיג 57 נקודות במדד Artificial Analysis Intelligence Index v4.1.1 בכ-0.045 דולר למשימה, וב-DeepSWE v1.1 מגיע ל-63.4 לעומת 46.2 של GLM-5.2.
למה זה חשוב
הפער בין מודלי חזית למודלים חסכוניים ממשיך להצטמצם: ביצועי קוד וסוכנים מהשורה הראשונה בשבריר מהמחיר משנים מה באמת אפשר להפוך לאוטומטי.