חזרה
אתגר חודש GLM 5.3 Flash הסתיים עם 50% שימוש
SiTech AI Team2 דק׳ קריאה

אתגר חודש GLM 5.3 Flash הסתיים עם 50% שימוש

ניסוי של חודש עם GLM 5.3 Flash הסתיים עם 50% ניצול: המודל עיבד חצי מיעד 2B הטוקנים. הבדיקות חשפו גם עלויות פרוטוטיפים, מגבלות ספקים ועלות מדידת יעילות.

התפלגות השימוש ועלויות הפרוטוטיפים

הניסוי שנערך עם מודל פתוח אפקטיבי בספטמבר סיפק מדד של 50% ניצול. מתוך 2B טוקנים רק 1B עובדו על ידי GLM 5.3 Flash, למרות שבחצי הראשון של החודש הוא ביצע את כל העבודה. הצריכה שלו נותרה בתקציב של $68, כ-4kWh אנרגיה ו-365 גרם פליטת פחמן. בחצי השני הוצאו 1B טוקנים על מודלים אחרים.

הפתעה אחת הייתה שהניסוי היה מקושר לשרת Wagtail MCP ניסיוני, שתואר כפרוטוטיפ שנוצר בקידוד וייב. בחירת המודל גרמה לכך שכמעט בלילה אחד נוצלו 450M טוקנים, $150 ו-5kWh אנרגיה. השרת עבד היטב והציג יכולות, אך הצוות העריך כי ניתן להשיג תוצאה דומה בחמישית מהעלות עם מאמץ נוסף מזערי. אירוע זה אישר שוב שלניסויים נדרש תקציב ושיש לבחור מודלים בזהירות.

זמינות התשתיות

זמינות הספקים הייתה עוד בעיה. הספקים שהצוות השתמש בהם עבדו לעיתים קרובות, אך לאפשרות הפופולרית לא הייתה אותה עוצמה כמו למעבדות גדולות. ל-GLM 5.3 Flash היו עיכובי ביצוע, כנראה משום שהעומס של הצוות היה גבוה על חזית Pareto. האפשרות הזמינה הוגבלה גם למודלים פתוחים בלבד שאושרו במרכזי נתונים אירופאיים. זה גרם למעבר למודלים דומים, DeepSeek V4.1 Flash ו-Qwen 3.8 Flash, שינוי פשוט שלא ציפו לו.

לתועלת פיתוח שגרתי

שימוש במודל אחד להנדשה שגרתית לא ביטל את הצורך לבחון מגוון רחב של אפשרויות. הצוות מתחיל לבצע בנצ'מרקינג של מודלים על משימות Wagtail וזקוק לנתונים השוואתיים כדי להמליץ על וריאנטים קלים יותר ליכולות הסוכנים ועל פרוטוטיפ CLI חדש שמתוכנן לעבוד היטב עם סוכנים.

GLM 5.3 Flash דורג שוב מצוין למשימות פרודקשן בזכות חלון הקונטקסט של 1M טוקנים, התמיכה החזותית והזמינות מול מספר ספקים. הוא שימש ב-Wagtail ובאתרים שנבנו על ידיו, כמו גם במשימות UI, במחקר ופיתוח AI, בתיעוד ובהערכות.

לקראת הבדיקה הבאה

באוקטובר האתגר ימשיך להתמקד רק במשימות פרודקשן שגרתיות, לא במחקר ופיתוח. השינויים המתוכננים כוללים דיווח מקומי רציף על שימוש בטוקנים, צריכת אנרגיה, עלויות ותוצאות ספציפיות. הצוות מתכנן גם להציב תקציבים ברורים לניסויים, לשפר בחירת פרומפטים, להשתמש בזרימות עבודה רב-סוכנים מבוססות תפקידים ולהמשיך לבחון מודלים יעילים.

המטרה הרחבה יותר היא שרוב משימות ההסקה של AI ישתמשו במודל אחד או שניים מחלקת flash זולים, וההתקדמות תימדד לא על פי מספר הטוקנים אלא על פי עלות או צריכת אנרגיה. הצוות יעקוב גם אחר מודלי דיפוזיה בסגנון Jev, אם הם יעבדו ביעילות, בעוד מודלי פלאגמן חדשים יותר נראים כצעד בכיוון הנכון.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.