العودة
Ai2 يستبدل مُجدول GPU القائم على الأولويات بنظام الميزانيات والعادلة
SiTech AI Team3 دقيقة قراءة

Ai2 يستبدل مُجدول GPU القائم على الأولويات بنظام الميزانيات والعادلة

استبدل معهد ألين للذكاء الاصطناعي (Ai2) مُجدول العناقيد القائم على الأولويات بميزانيات وقت GPU، والعادلة الهرمية، وعقد تقسيم الوقت، فانخفض وقت تحميل التصحيح من ساعات إلى ثوانٍ.

استبدل معهد ألين للذكاء الاصطناعي (Ai2) مُجدوله القائم على الأولويات في عناقيد GPU بنظام قائم على ميزانيات وقت GPU، والعادلة الهرمية، وعقد تقسيم الوقت. التغيير المُرحّل تدريجياً منذ نهاية يوليو يمنح الأولوية للأبحاث عالية التأثير ويُبقي آلاف وحدات Nvidia H100 وB200 وB300 GPU محمّلة بالكامل.

من الأولويات إلى الميزانيات

يدير Ai2 عناقيد تتراوح من 88 إلى 1024 وحدة GPU لحوالي 150 باحثاً داخلياً، يطوّرون نماذج لغوية كبيرة ونماذج لغة-رؤية، والتعلم المعزز للروبوتات، والتدريب المتقدم للتطبيقات الوكيلية العلمية. الطلب على وقت GPU يفوق العرض بمرتين إلى ثلاث مرات.

اعتمد المُجدول القديم على الأولويات والاستباق غير الإلزامي. كان المستخدمون يشغلون أماكن لتصحيح الأخطاء بأحمال غير مجدية، وكانت 100 بالمئة من الأحمال المجدولة ذات أولوية HIGH، بينما كان المهندسون الاحتياطيون يضيعون الوقت في إيقاف المهام غير القابلة للاستباق يدوياً على المضيفين المطلوبين للصيانة.

يتعامل النموذج الجديد مع وقت GPU كاستثمار. يوزّع المديرون الميزانيات بين المشاريع والباحثين حتى وجود الأحمال، مما يحوّل الاستراتيجية إلى حصة مضمونة من القدرة. يجب أن يكون كل طلب مموّلاً بميزانية، وإلا فلن يكون محمياً من الاستباق، مما يجعل شغل الأماكن مكلفاً.

الجدولة العادلة الهرمية وعقد تقسيم الوقت

المُجدول الهرمي للعدالة، الذي جذوره في Hadoop Fair Scheduler عام 2009 ويُستخدم اليوم في SLURM وYARN، يراقب الإشغال في نافذة متحركة مدتها سبعة أيام ويضع الأحمال المخصصة للموارد الأقل استخداماً أعلى من الأكثر استخداماً. الشجرة تحاكي هيكل البرنامج البحثي، والأوزان هي ميزانيات المديرين وليست حصصاً ثابتة.

يميّز المُجدول بين الإشغال المخصص، الذي يُسجَّل من الميزانية ويكون محمياً في نافذة العمل الدنيا، والإشغال الفارغ، الذي يكون مجانياً لكنه قابل للاستباق. يتطلب العقد الإعلان عن وقت عمل دنيوي بحد أقصى 8 ساعات، خلاله يكون الإيقاف مستحيلاً. بعد ذلك تعود الأحمال القابلة للاستمرار تلقائياً إلى الطابور، لاستقرار العدالة وتحرير المضيفين غير الصالحين للإصلاح التلقائي.

النتائج والتحديات المفتوحة

في اختبار مدته 30 يوماً، حصلت الفرق على 98 بالمئة من ساعات GPU المستحقة؛ ومن بين 15 فريقاً تم إخلاؤهم، حصل 13 على 95 بالمئة أو أكثر، وأسوأ حالة كانت 90 بالمئة. بقي إشغال العنقود عند 98 بالمئة، وبقي 18 بالمئة من وقت GPU المقدم فارغاً لتبقى الأجهزة محمّلة عندما لم تكن الأحمال الممولة جاهزة.

انخفض وقت التحميل في الطابور للأحمال التصحيحية عند p90 من ساعتين إلى 30 ثانية، متفوقاً على التنبؤ المحاكى من 6 ساعات إلى 5 دقائق. في أكبر عنقود H100، انخفض الوسيط من 5 دقائق إلى 24 ثانية، وp90 من 2,8 ساعة إلى 1,8 ساعة. انخفضت الإصلاحات التي تتطلب تدخلاً بشرياً بنسبة 74 بالمئة.

لم تتحسن كل الاستخدامات. أصبحت جلسات التحليل التفاعلي، التي كان الباحثون يحتفظون بها لمدة أسبوع، قابلة للاستباق بعد حد حماية مدته 8 ساعات، ويضطر المستخدمون إلى استعادة الحالات المتغيرة يدوياً. يطوّر Ai2 الآن عنقود CPU فقط لجلسات التطوير ويخطط لجلسات استعادة لمتابعة العمل المتقطع في مكان آخر. يبحث الفريق في تجزئة القدرة، التي قد تزيد وقت التحميل على الأحمال الكبيرة، ويقول إن التركيز التالي هو جودة الاستخدام: جعل تطبيقات bootstrapping وcheckpointing والتدريب أكثر فعالية.

المصادر: Hugging Face Blog

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.