Geri Dön
NVIDIA, NVCRE'yi açık kaynak yaptı: GPU kümeleri iş yükünden önce test ediliyor
SiTech AI Team2 წთ. საკითხავი

NVIDIA, NVCRE'yi açık kaynak yaptı: GPU kümeleri iş yükünden önce test ediliyor

Apache 2.0 lisanslı Kubernetes denetleyicisi, topolojiye duyarlı düğüm gruplarında gerçek dağıtık iş yükleri çalıştırıp arızalı GPU düğümlerini üretim işleri başlamadan adlandırıyor.

Kâğıt üzerinde sağlıklı, yük altında değil

Bir GPU kümesi tüm sağlık kontrollerinden geçip yine de yapay zekâ iş yükünü çalıştıramayabilir: her GPU, bağlantı ve pod sağlıklı görünse bile 512 GPU'lu bir eğitim işi performans kaybedebilir. Neden tek bir yavaş GPU, yük altında bozulan bir bağlantı veya trafiği sessizce daha yavaş bir yola yönlendiren bir yapılandırma olabilir.

NVIDIA Cluster Readiness Engine (NVCRE), aramayı ilgili düğümlere daraltan açık kaynaklı bir Kubernetes denetleyicisi. Topolojiye göre gruplanmış düğümlerde gerçek dağıtık iş yükleri çalıştırıyor ve her testte hangi düğümlerin başarısız olduğunu bildiriyor; böylece hazır olma bir varsayım değil, kanıtlanmış bir küme özelliği hâline geliyor.

Pasif NVSentinel izlemesi ile aktif NVCRE doğrulamasının karşılaştırması

Katmanlı API ve yerleşik katalog

API üç kaynaktan oluşur: Certification test edilecek düğümleri ve kategorileri tanımlar; her kategori, platform ve GPU ayarlarını uygulayan ve alt bir Job oluşturan Workflow tarafından yönetilir; Job iş yükünü çalıştırır, düğüm sağlığını izler ve hataları belirli düğümlere atfeder.

Katalog beş NCCL iletişim varyantını, NVIDIA DCGM seviye-4 tanılama paketini ve Nemotron 5 modelleriyle NVIDIA NeMo ön eğitimini kapsar. Geçme ölçütleri Common Expression Language ile yazılır ve hedefini tutturamayan bir iş, tamamlanmış olsa bile başarısız sayılır.

Hataların göründüğü ölçekte test

testScale alanı gruplama stratejisini seçer: intra-node, intra-rack (nvidia.com/gpu.clique etiketine göre), full-scale veya diagnose. diagnose modunda NVCRE başarısız grupları bölüp yarılarını yeniden çalıştırır ve tüm grup yerine birkaç şüpheli düğüm adı verir.

WorkloadRun çok düğümlü işleri bir konteyner imajı, framework seçimi (torch, mpi veya exec) ve düğüm sayısıyla çalıştırır. spec.gangScheduler ayarı pod'ları KAI Scheduler gibi gang-aware bir zamanlayıcıya bağlar ve yoğun kümelerde kilitlenmeyi önler.

Tespit et, doğrula, iyileştir

NVCRE, NVIDIA DSX OS katmanlarından biri: AICR doğrulanmış yapılandırmayı koruyup sapmayı tespit ediyor, NVCRE telemetriye yansımayan arızaları ortaya çıkarmak için yük üretiyor, NVSentinel ise DCGM metriklerini, Xid hatalarını ve sistem günlüklerini izliyor.

NVCRE başarısız düğümleri ve nedenlerini kaydeder ama kendisi cordon, taint veya düğüm koşulu değişikliği yapmaz; NVSentinel'in Certification Monitor'ü başarısız sertifikasyonu sağlık olayına çevirebilir. Proje Apache 2.0 lisanslı ve Kubernetes 1.29 veya üstünü, kubectl, Helm 3.x ve NVIDIA GPU Operator gerektiriyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.