Geri Dön
Ai2, öncelik tabanlı GPU zamanlayıcısını bütçe ve adil payı temel alan sistemle değiştiriyor
SiTech AI Team3 dk okuma

Ai2, öncelik tabanlı GPU zamanlayıcısını bütçe ve adil payı temel alan sistemle değiştiriyor

Allen Institute for AI (Ai2), küme zamanlayıcısını öncelik tabanlı yöntem yerine GPU süresi bütçeleri, hiyerarşik adil pay ve zaman paylaşımı sözleşmesiyle değiştirdi; hata ayıklama yüklemesi saatlerden saniyelere düştü.

Yapay zekâ Allen Enstitüsü (Ai2), GPU kümelerinde öncelik tabanlı zamanlayıcıyı GPU süresi bütçelerine, hiyerarşik adil paya ve zaman paylaşımı sözleşmesine dayalı bir sistemle değiştirdi. Temmuz sonundan itibaren aşamalı olarak devreye alınan değişiklik, yüksek etkili araştırmalara öncelik tanır ve binlerce Nvidia H100, B200 ve B300 GPU'nun tamamen dolu kalmasını sağlar.

Önceliklerden bütçelere

Ai2, yaklaşık 150 dahili araştırmacı için 88 ila 1024 GPU'ya kadar kümeleri yönetir; bu araştırmacılar büyük dil ve görü-dil modelleri, robotikte güçlendirmeli öğrenme ve bilimsel ajan uygulamalarında ilerleme sağlar. GPU süresi talebi, arzı iki ila üç kez aşar.

Eski zamanlayıcı önceliklere ve isteğe bağlı preemption sistemlerine dayanırdı. Kullanıcılar hata ayıklama için gereksiz yüklemelerle kapasiteyi doldurur; planlanan yüklemelerin yüzde 100'ü HIGH önceliğindeyken, sonraki mühendisler hizmeti veren ana makinelerde preempt edilemeyen görevleri manuel durdurmak için zaman harcar.

Yeni model GPU süresini yatırım olarak görür. Yöneticiler bütçeleri, proje ve araştırmacılar arasında yüklemeler ortaya çıkana kadar paylaştırır ve stratejiyi güvenilir bir kapasite garantisine dönüştürür. Her talep bütçeyle finanse edilmeli; yoksa preemption korumasından yararlanmaz ve kapasite pahalılaşır.

Adil pay zamanlaması ve zaman paylaşımı sözleşmesi

Hiyerarşik adil pay zamanlayıcısının kökleri 2009'daki Hadoop Fair Scheduler içinde bugün SLURM ve YARN'da kullanılır; doluluk yedi günlük hareketli bir pencere izler ve az kullanılan ayrılımların yüklemelerini daha yoğun kullanılanların üzerine koyar. Ağaç, araştırma programlarının yapısını taklit eder; ağırlıklar statik kotalar değil, yöneticilerin bütçeleridir.

Zamanlayıcı, bütçeden hesaplanan ve minimum çalışma penceresinde korunan doluluğu, ücretsiz ancak preempt edilebilir olan ayrılımdan ayırır. Sözleşme, kesintiye uğratılmadan geçen minimum çalışma süresini bildirmeyi ister; maksimum 8 saat. Sonrasında ardışık yüklemeler otomatik kuyruğa döner ki adil pay stabilize olsun ve sağlam olmayan ana makineler otomatik onarım için serbest bırakılsın.

Sonuçlar ve açık sorunlar

30 günlük testte ekipler GPU saatlerinin yüzde 98'ini aldı; 15 ekipten 13'ü yüzde 95 veya daha fazla aldı, en kötü durum yüzde 90 oldu. Küme doluluğu yüzde 98'de sabit kaldı; tahsis edilen GPU süresinin yüzde 18'i, finansmanı sağlanmış yüklemeler hazır olmadığında donanımın dolu kalması için ayrılmış kaldı.

Hata ayıklama yüklemelerinde p90 kuyruk yüklemesi 2 saatten 30 saniyeye düştü; bu, 6 saatten 5 dakikaya kadar simüle edilmiş tahmini geçer. En büyük H100 kümesinde medyan 5 dakikadan 24 saniyeye, p90 ise 2,8 saatten 1,8 saate düştü. İnsan müdahalesi gerektiren onarım yüzde 74 azaldı.

Her kullanım iyileşmedi. Bir haftaya kadar saklanan etkileşimli analiz oturumları, 8 saatlik korunmuş limit sonrası preempt edilebilir hale geldi ve kullanıcıların değişken durumları manuel yeniden yüklemesi gerekiyor. Ai2 artık CPU'yu yalnızca geliştirme oturumları için kümeleri büyütüyor ve kesintiye uğrayan işlerin başka yerde devam edebilmesi için kurtarma oturumları planlıyor. Ekip, büyük yüklemelerde kuyruk yüklemesini artırabilecek kapasite parçalanmasını araştırıyor; bir sonraki odak noktasının kullanım kalitesi olduğunu söylüyor: bootstrapping, checkpointing ve eğitim uygulamalarının mümkün olan en verimli şekilde çalışması.

Kaynaklar: Hugging Face Blog

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.