חזרה
Ai2 שיחררה את Olmo-core 3 לאימון מודלי MoE שניתנים להרחבה עד טריליון פרמטרים
SiTech AI Team2 דק׳ קריאה

Ai2 שיחררה את Olmo-core 3 לאימון מודלי MoE שניתנים להרחבה עד טריליון פרמטרים

Ai2 שיחררה את המערכת הפתוחה Olmo-core 3, המאפשרת להרחיב את אימון מודלי MoE עד טריליון פרמטרים. בבדיקת בנצ'מרק אחת מספר המומחים עלה מ-8 ל-128, בעוד יעילות האימון ירדה בפחות מ-5%.

Ai2 (Allen Institute for AI) שיחררה ב-1 באוקטובר את Olmo-core 3. זוהי עדכון למסגרת הפתוחה שלהם עם מערכת אימון MoE (ערבוב מומחים) שעברה תכנון מחדש. לפי ההצהרה של המכון, היא מתוכננת להרחבה עד טריליון פרמטרים והיא אחת ממערכות הליבה של Olmo בדור הבא.

מודל MoE משתמש רק בחלק מהפרמטרים עבור כל נתון, אך אחסון כל המודל והפניית הנתונים למומחים הנכונים יוצרים עלויות שגדלות עם הגודל.

מה Olmo-core 3 משנה

בבדיקת בנצ'מרק אחת מספר המומחים עלה מ-8 ל-128, תוך שימוש בארבעה מומחים בכל טוקן, ומספר הפרמטרים הפעילים לטוקן נשאר ברמה של כ-3.2 מיליארד. הקיבולת הכוללת של הפרמטרים גדלה מ-4.6 מיליארד ל-47 מיליארד, בעוד היעילות ירדה בפחות מ-5%.

הגרסה הישנה השתמשה בקיבולת נתונים מלאה מפוזרת (FSDP), ואילו Olmo-core 3 עברה לסכמת קיבולת נתונים מבוזרת (DDP): המומחים נשארים על ה-GPU והנתונים מופנים אליהם.

בנצ'מרק של Olmo-core 3: מספר מומחים מ-8 ל-128

מודל MoE עם 47 מיליארד פרמטרים על שמונה GPU של NVIDIA B300 עיבד עם המערכת החדשה 52,000 טוקנים בשנייה ל-GPU, לעומת 19,400 עם הגרסה הישנה, כלומר כ-2.7 פעמים יותר.

הרחבה עד טריליון פרמטרים

Olmo-core 3 מחלקת מודלים על החומרה באמצעות קיבולת מומחים וצינור (pipeline parallelism) ומאופטים מבוזר. מטא-נתונים נשארים על ה-GPU, נתונים מנותבים ישירות לבאפר של המומחה, ו-GEMM מאוגד מאחד חישובים קטנים.

המערכת תומכת גם ב-MXFP8, פורמט בדיוק נמוך: על ארבעה GPU מסוג B300 היא הציגה כ-21% יותר יעילות בהשוואה ל-BF16, וזיכרון פעיל שיא ירד מ-103 GiB ל-95 GiB.

יעילות של Olmo-core 3 בהשוואה ליישום קודם

Ai2 בדקה גם מודל עם 1.2 טריליון פרמטרים על 512 GPU, שבו 58.36 מיליארד פרמטרים פעילים לכל טוקן; היעילות המקסימלית הייתה 858 TFLOP/s ל-GPU. הבדיקות מדדו את ביצועי המערכת עם ניתוב אקראי ולא את איכות המודל; ניסוי DeepEP v2 הגיע ל-2.38 טריליון פרמטרים בבדיקה קצרה.

תשתית פתוחה

הוא משתמש בארכיטקטורת MoE של Olmo בדור הבא ואמור להפוך ל-Olmo החזק ביותר, שאומן על מקבץ הנתונים הגדול ביותר ועם הקונטקסט הארוך ביותר. המערכת פתוחה לחלוטין: חוקרים יכולים לאמן עליה מודלי MoE משלהם ולהתאים אותם לחומרה אחרת; הדו"ח הטכני, הקוד והדמו האינטראקטיבי כבר זמינים.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.