חזרה
Ai2 מעבירה מתזמן מבוסס עדיפויות לתקציבי זמן-GPU עם מערכת שיתוף הוגנת
SiTech AI Team3 דק׳ קריאה

Ai2 מעבירה מתזמן מבוסס עדיפויות לתקציבי זמן-GPU עם מערכת שיתוף הוגנת

Allen Institute for AI (Ai2) החליפה את המתזמן המבוסס על עדיפויות במערכת המשתמשת בתקציבי זמן-GPU, שיתוף הוגנת היררכי וחוזי חלוקת זמן, ובכך הקטינה את זמן ההמתנה בתור לדיבאג משעות לשניות.

Allen Institute for AI (Ai2) החליפה במתזמן מבוסס עדיפויות על מחשבי הענק (GPU) במערכת המשתמשת בתקציבי זמן-GPU, שיתוף הוגנת היררכי וחוזה חלוקת זמן. השינוי שהופעל בשלבים החל מסוף יולי מעניק עדיפות למחקרים בעלי השפעה גבוהה ומאפשר ניצול מלא של אלפי מעבדי Nvidia H100, B200 ו-B300.

מעדיפויות לתקציבים

Ai2 מפעילה מחשבי ענק של 88 עד 1024 GPU עבור כ-150 חוקרים פנימיים שמפתחים מודלים גדולים של שפה וראייה, למידה מעוזבת ברובוטיקה ויישומים מדעיים מבוססי סוכנים. הביקוש לזמן-GPU עולה על ההיצע פי שניים עד שלושה.

המתזמן הישן התבסס על עדיפויות ופריאמפציה לא-חובה. משתמשים תפסו מקומות בעזרת עומסים חסרי תועלת לצורך דיבאג, עומסים מתוזמנים הופעלו בעדיפות HIGH ב-100 אחוז, ומהנדסי גיבוי ביזבזו זמן על עצירה ידנית של משימות לא-פריאמפטיביות על מארחים נחוצים.

המודל החדש מתייחס לזמן-GPU כאל השקעה. מנהלים מחלקים תקציבים בין פרויקטים לחוקרים עד לקיומם של עומסים, מה שהופך את האסטרטגיה לחלק מובטח של כוח. כל בקשה חייבת להיות ממומנת בתקציב, אחרת היא לא תהיה מוגנת מפני פריאמפציה, מה שהופך אלימת לכידת מקומות ליקרה.

שיתוף הוגנת היררכי וחוזה חלוקת זמן

המתזמן ההיררכי של שיתוף הוגנת, ששורשיו ב-Hadoop Fair Scheduler מ-2009 וכיום משמש ב-SLURM וב-YARN, עוקב אחר הניצול בחלון נע של שבעה ימים ומסדר עומסים של חלוצים פחות בשימוש מעל אלה בשימוש רב יותר. העץ מכיל את מבנה תכנית המחקר, המשקלים הם תקציבי המנהלים ולא מכסות סטטיות.

המתזמן מבדיל בין תפיסה שמורה, שנספרת מהתקציב ומוגנת בחלון העבודה המינימלי, לבין תפיסה לא-שמורה, שהיא חינם אך פריאמפטיבית. החוזה דורש הצהרת זמן עבודה מינימלי, מקסימום 8 שעות, שבמהלכה הפסקה אינה אפשרית. עומסים מתמשכים ממשיכים אוטומטית בתור, כדי לייצב את שיתוף ההוגנות ולשחרר מארחים לא-תפוסים לתיקון אוטומטי.

תוצאות ואתגרים פתוחים

בבדיקה של 30 יום צוותים קיבלו 98 אחוז משעות-GPU המגיעות להם; מתוך 15 צוותים ש-13 קיבלו 95 אחוז או יותר, והמקרה הגרוע ביותר היה 90 אחוז. תפיסת מחשבי הענג נותרה ב-98 אחוז, 18 אחוז מזמן-GPU המסופק נותר לא-שמור כדי שהחומרה תהיה מעומסת כאשר עומסים ממומנים אינם מוכנים.

עבור עומסי דיבאג זמן ההמתנה בתור p90 ירד מ-2 שעות ל-30 שניות, מה שעולה על התחזית הסימולציונית של 6 שעות ל-5 דקות. על מחשבי הענג הגדול ביותר של H100 החציון ירד מ-5 דקות ל-24 שניות, ו-p90 ירד מ-2.8 שעות ל-1.8 שעות. התערבות אנושית בתיקונים ירדה ב-74 אחוז.

לא כל היישומים השתפרו. שילובי ניתוח אינטראקטיביים שחוקרים נהגו להריץ עד שבוע הפכו לפריאמפטיביים לאחר הגבלה שמורה של 8 שעות, ומשתמשים נאלצים לשחזר ידנית מצבים משתנים. Ai2 כיום מפתחת על מחשבי ענג של CPU לצורך שילובי פיתוב ומתכננת שילובי שיקום כדי שעבודה מופסקת תוכל להימשך במקום אחר. הצוות חוקר פרגמנטציה של כוח, שעשויה להגדיל את זמן ההמתנה בעומסים גדולים, ומצהיר שהמיקוד הבא הוא איכות השימוש: אופטימיזציה מקסימלית של bootstrapping, checkpointing ואפליקציות אימון.

מקורות: Hugging Face Blog

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.