
NVIDIA, NVCRE'yi açık kaynak yaptı: GPU kümeleri iş yükünden önce test ediliyor
Apache 2.0 lisanslı Kubernetes denetleyicisi, topolojiye duyarlı düğüm gruplarında gerçek dağıtık iş yükleri çalıştırıp arızalı GPU düğümlerini üretim işleri başlamadan adlandırıyor.
Kâğıt üzerinde sağlıklı, yük altında değil
Bir GPU kümesi tüm sağlık kontrollerinden geçip yine de yapay zekâ iş yükünü çalıştıramayabilir: her GPU, bağlantı ve pod sağlıklı görünse bile 512 GPU'lu bir eğitim işi performans kaybedebilir. Neden tek bir yavaş GPU, yük altında bozulan bir bağlantı veya trafiği sessizce daha yavaş bir yola yönlendiren bir yapılandırma olabilir.
NVIDIA Cluster Readiness Engine (NVCRE), aramayı ilgili düğümlere daraltan açık kaynaklı bir Kubernetes denetleyicisi. Topolojiye göre gruplanmış düğümlerde gerçek dağıtık iş yükleri çalıştırıyor ve her testte hangi düğümlerin başarısız olduğunu bildiriyor; böylece hazır olma bir varsayım değil, kanıtlanmış bir küme özelliği hâline geliyor.
Katmanlı API ve yerleşik katalog
API üç kaynaktan oluşur: Certification test edilecek düğümleri ve kategorileri tanımlar; her kategori, platform ve GPU ayarlarını uygulayan ve alt bir Job oluşturan Workflow tarafından yönetilir; Job iş yükünü çalıştırır, düğüm sağlığını izler ve hataları belirli düğümlere atfeder.
Katalog beş NCCL iletişim varyantını, NVIDIA DCGM seviye-4 tanılama paketini ve Nemotron 5 modelleriyle NVIDIA NeMo ön eğitimini kapsar. Geçme ölçütleri Common Expression Language ile yazılır ve hedefini tutturamayan bir iş, tamamlanmış olsa bile başarısız sayılır.
Hataların göründüğü ölçekte test
testScale alanı gruplama stratejisini seçer: intra-node, intra-rack (nvidia.com/gpu.clique etiketine göre), full-scale veya diagnose. diagnose modunda NVCRE başarısız grupları bölüp yarılarını yeniden çalıştırır ve tüm grup yerine birkaç şüpheli düğüm adı verir.
WorkloadRun çok düğümlü işleri bir konteyner imajı, framework seçimi (torch, mpi veya exec) ve düğüm sayısıyla çalıştırır. spec.gangScheduler ayarı pod'ları KAI Scheduler gibi gang-aware bir zamanlayıcıya bağlar ve yoğun kümelerde kilitlenmeyi önler.
Tespit et, doğrula, iyileştir
NVCRE, NVIDIA DSX OS katmanlarından biri: AICR doğrulanmış yapılandırmayı koruyup sapmayı tespit ediyor, NVCRE telemetriye yansımayan arızaları ortaya çıkarmak için yük üretiyor, NVSentinel ise DCGM metriklerini, Xid hatalarını ve sistem günlüklerini izliyor.
NVCRE başarısız düğümleri ve nedenlerini kaydeder ama kendisi cordon, taint veya düğüm koşulu değişikliği yapmaz; NVSentinel'in Certification Monitor'ü başarısız sertifikasyonu sağlık olayına çevirebilir. Proje Apache 2.0 lisanslı ve Kubernetes 1.29 veya üstünü, kubectl, Helm 3.x ve NVIDIA GPU Operator gerektiriyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.