
GLM בנתה את תשתית ההסקה שלה בעזרת סוכן AI
חברת Z.ai תיארה כיצד סוכן תשתית המבוסס על GLM-5.3 בנה את שירות ההסקה של GLM-5.3-Flash על יותר מ-100 אלף מאיצים מתוצרת סין — בפחות משבועיים ובמהירות תפוקה גבוהה פי שלושה.
ב-17 בספטמבר פרסמה Z.ai מאמר מחקרי המתאר כיצד סוכן תשתית (Infra Agent) המבוסס על GLM-5.3 בנה את שירות ההסקה שעליו פועל כיום GLM-5.3-Flash. הכותרת היא «לקראת שיפור עצמי רקורסיבי», אך החברה מבהירה במפורש שהיעד טרם הושג — נראות רק הצורות המוקדמות שלו.
100 אלף מאיצים ושבועיים
כל תפוקת ההסקה של GLM-5.3-Flash פועלת על אשכול של יותר מ-100 אלף מאיצי AI מתוצרת סין. לדברי החברה, אשכול בהיקף כזה לא הופעל מעולם. הצוות התמודד עם זיכרון ורוחב פס מוגבלים של השבבים, ארכיטקטורת מודל חדשה, חלון הקשר של מיליון טוקנים ובקשות מולטימודליות, ובנוסף עם אקוסיסטם בלתי מגובש ותמיכה חלקית בקרנלים.
חלק ניכר מהעבודה בוצע לא רק בידי מהנדסי תשתית, אלא בידי סוכן התשתית שהונע על ידי GLM-5.3. אופטימיזציות אגרסיביות של הזיכרון — ReplaySSM, כימות W8A8, כימות מטמון בדיוק מעורב INT8/FP8/BF16, Layer Split וארכיטקטורת Encode-Prefill-Decode — שיפרו את ביצועי ההגשה מקצה לקצה פי שלושה בקירוב, בעוד עלות הטוקן וניצול החומרה התקרבו לרמה של כרטיסי NVIDIA נפוצים. המעבר מהתאמת המודל הראשונית לכשירות לפרודקשן ארך פחות משבועיים.
«משוב צפוף»
הטענה המרכזית במאמר היא שאפקטיביות ההנדסית של סוכן תלויה פחות ביכולת לכתוב קוד ויותר במידת הפירוט של המשוב שהוא מקבל. מדד מקצה לקצה רק אומר לסוכן שהתוצאות הורעו, אך אינו מסביר מדוע. לכן הצוות סיפק לסוכן בדיקות נכונות, מיקרובנצ'מרקים, עקבות ריצה ואירועי runtime שבשימוש ישיר. למשוב «צפוף» כזה שלושה מאפיינים: מקומיות, זמינות מהירה וזולה, ואפשרות לאימות אובייקטיבי בניסויים מבוקרים.
מקרים קונקרטיים
במסלול ה-Context Parallelism של קרנל KDA מצא הסוכן באג בדיוק נומרי: tl.dot השתמש כברירת מחדל בחישוב TF32 גם עבור קלטי FP32, כך שהשגיאה הצטברה בהקשרים ארוכים. התיקון היה input_precision="tf32x3", והוא נכנס גם לפרויקט Flash Linear Attention (PR #1180).
בצוואר הבקבוק של KV Transfer התיר קריטריון הקבלה פער ביצועים של עד 5%, אך הסוכן מדד יותר מ-20%. הסיבה: הפונקציות intranode_dispatch ו-intranode_combine ב-DeepEP v1.2.1 לא שחררו את ה-GIL של Python וחסמו את תהליכון Mooncake Transfer. לאחר שחרור ה-GIL ירד הפער מתחת ל-1%.
גבולות והתוצאה
לפני ההשקה נבחן GLM-5.3-Flash בעילום שם ב-OpenCode וב-OpenRouter תחת השם Ox-Alpha, ותוך שבוע הפך למודל הנפוץ ביותר בשתי הפלטפורמות, כשעיבד יותר מ-62 טריליון טוקנים בשישה ימים. המאמר מדגיש שבחירת יעדים, קביעת גבולות והערכת סיכונים נשארות באחריות האדם.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.