
Ai2, GPU planlayıcını byüdcə və ədalətli paylanma sistemləri əsasında dəyişir
Allen Institute for AI (Ai2) klasterinin prioritetlərə əsaslanan planlayıcısını GPU zamanı byüdcələri, iyerarxik ədalətli paylanma və vaxt bölgü müqaviləsi ilə əvəz etdi; debugging yüklənmələri üçün növbədə gözləmə saatlar saniyələr səviyyəsinə endi.
Prioritetlərdən byüdcələrə
Ai2 təxminən 150 daxili araşdırmaçı üçün 88-dən 1024-ə qədər GPU klasterini idarə edir; onlar böyük dil və görüş modelləri, robotikanı gücləndirərək öyrənmə və elmi agent tətbiqlərinin təkmilləşdirməsi ilə məşğuldurlar. GPU zamanına tələbat təchizatdan üç dəfə çoxdur.
Köhnə planlayıcı prioritetlərə və ixtiyari preemptiyaya əsaslanırdı. İstifadəçilələr debugging üçün yararsız yüklənmələrlə yer tutardı, planlaşdırılmış yüklənmələrin 100 faizi HIGH prioritetdə idi, növbəti mühəndislər isə lazım olan hostlarda fasiləsiz tapşırıqları əl ilə dayandırmağa vaxt itirirdilər.
Yeni model GPU zamanıni investisiya kimi qiymətləndirir. Menecerlər byüdcələri layihələr və araşdırmalar arasında yüklənmələrin mövcudluğuna qədər bölüşdürür, nəticədə strategiya gücün zəmanətli hissəyə çevrilir. Bütün tələblər byüdcə ilə maliyyələşdirilməlidir, əks halda preemptiyadan qorunmayır, bu da yer tutmanı bahalışdırır.
Ədalətli paylanma planlaması və vaxt bölgü müqaviləsi
2009-cu ildə Hadoop Fair Scheduler-inə köklənən, bu gün SLURM və YARN-da istifadə olunan iyerarxik ədalətli paylanma planlayıcısı, yüklənməni hərəkətli yeddigünənlər pəncərəsinə nəzər tutur və az istifadə edilən resursların yüklənmələrini daha çox istifadə olunanların üstünə qoyur. Ağac araşdırma proqramının strukturlarını təkrar layihələr, çəkilər isə statik kvotlar deyil, menecerlərin byüdcələridir.
Planlayıcı byüdcədən hesablanan və minimum iş pəncərəsində qorunan ayrılan yüklənməni, fəaliyyətsiz olan lakin preemptiv olan resursdan fərqləndirir. Müqavilə minimum iş vaxtının elan edilməsini tələb edir, maksimum 8 saat, ərzində dayandırılması mümkün deyil. Bundan sonra uzun yüklənmələr avtomatik növbəyə qaytarılır ki, ədalətli paylanma sabitlənsin və hostlar avtomatik təmir üçün boşadılsın.
Nəticələr və açıq çətinliklər
30 günlük testlərdə qruplar GPU saatlarının 98 faizini aldılar; 15 qrupdan 13-ü 95 faiz və ya daha çox göstərdir, ən pis hal 90 faiz idi. Klasterin yüklənməsi 98 faizdə qaldı, təchizat olunan GPU zamanının 18 faizi isə reserve saxlanıldı ki, cihazlar maliyyələşdirilən yüklənmələr hazır olmayanda dolu qalsın.
Debugging yüklənmələrində p90 növbə gecikməsi 2 saat 30 saniyəyə qədər düşdü, bu 6 saat 5 dəqiqəyə qədər olan simulyaq proqnozdan üstün gəlir. Ən böyük H100 klasterdə median 5 dəqiqə 24 saniyəyə, p90 isə 2,8 saatdan 1,8 saat qədər azaldı. İnsan müdaxiləsi ilə təmir 74 faiz azaldı.
Bütün istifadə halları yaxşılaşmadı. Araşdırmaçılara bir həftə ərzində verilən interaktiv analiz sessiyaları 8 saatlıq qorunan limitdən sonra preemptiv oldu və istifadəçilərə dəyişən vəziyyətləri əl ilə bərpa etmək düşdü. Ai2 artıq CPU yalız inkişaf sessiyaları üçün klaster yaradır və dayanmış işlərin başqa yerdə davam etməsi üçün bərpa sessiyaları planlaşdırır. Qrup güc fraqmentasiyasını araşdırır ki, bu, böyük yüklənmələrdə gecikməni artıra bilər, və növbəti fokusun istifadə keyfiyyəti — bootstrapping, checkpointing və təlim tətbiqlərinin maksimum effektiv şəkildə işləməsi — olacağını bildirir.
Mənbələr: Hugging Face Blog
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.