
NVIDIA-მ NVCRE ღია კოდით გამოუშვა: GPU-კლასტერის მზადყოფნა დატვირთვამდე მოწმდება
ღია კოდის Kubernetes-კონტროლერი ტოპოლოგიის მიხედვით დაჯგუფებულ კვანძებზე რეალურ განაწილებულ დატვირთვებს უშვებს და ასახელებს იმ GPU-ებს, რომლებიც წარმოების სამუშაოების დაწყებამდე ჩავარდება.
ჯანმრთელი ჩანს, დატვირთვას კი ვერ უძლებს
GPU-კლასტერს შეიძლება ჯანმრთელობის ყველა შემოწმება წარმატებით გაიაროს და მაინც ვერ შეასრულოს AI-დატვირთვა: მაშინაც კი, როცა ყველა GPU, ბმული და pod ჯანმრთელად იუწყება, 512-GPU-იანი სწავლების სამუშაო შეიძლება შენელდეს. მიზეზი ერთი ნელი GPU, დატვირთვის ქვეშ დეგრადირებული ბმული ან კონფიგურაციაა, რომელიც ტრაფიკს ჩუმად უფრო ნელი გზით ატარებს.
NVIDIA Cluster Readiness Engine (NVCRE) ღია კოდის Kubernetes-კონტროლერია, რომელიც ძებნას კონკრეტულ კვანძებამდე ვიწროვებს. ის ტოპოლოგიის გათვალისწინებით დაჯგუფებულ კვანძებზე რეალურ განაწილებულ დატვირთვებს უშვებს და იუწყება, რომელი კვანძი ჩავარდა თითოეულ ტესტში — მზადყოფნა კლასტერის დადასტურებული თვისება ხდება და არა ვარაუდი.
ფენოვანი API და ჩაშენებული კატალოგი
API სამ რესურსს მოიცავს: Certification განსაზღვრავს შესამოწმებელ კვანძებსა და კატეგორიებს; თითოეულ კატეგორიას Workflow მართავს, რომელიც პლატფორმისა და GPU-ის გადაფარვებს იყენებს და შვილობილ Job-ს ქმნის; Job კი დატვირთვას უშვებს, კვანძების ჯანმრთელობას აკვირდება და ჩავარდნებს კონკრეტულ კვანძებს მიაწერს.
კატალოგი მოიცავს NCCL-კომუნიკაციის ხუთ ვარიანტს, NVIDIA DCGM-ის მეოთხე დონის დიაგნოსტიკას და NVIDIA NeMo-ს წინასწარ სწავლებას Nemotron 5 მოდელებით. ჩაბარების კრიტერიუმები Common Expression Language-ით იწერება, და დასრულებული სამუშაო, რომელმაც მიზანს ვერ მიაღწია, მაინც ჩავარდნად ითვლება.
ტესტირება იმ მასშტაბზე, სადაც ხარვეზები ჩნდება
testScale ველი ირჩევს დაჯგუფების სტრატეგიას: intra-node, intra-rack (nvidia.com/gpu.clique ლეიბლის მიხედვით), full-scale ან diagnose. diagnose რეჟიმში NVCRE ჩავარდნილ ჯგუფებს ყოფს და ნახევრებს ხელახლა უშვებს, სანამ მთელი ჯგუფის ნაცვლად რამდენიმე ეჭვმიტანილ კვანძს დაასახელებს.
WorkloadRun მრავალკვანძიან სამუშაოებს კონტეინერის იმიჯით, ჩარჩოს არჩევანით (torch, mpi ან exec) და კვანძების რაოდენობით უშვებს. spec.gangScheduler pod-ებს gang-aware დამგეგმავში, მაგალითად KAI Scheduler-ში, აერთიანებს და დატვირთულ კლასტერებზე ჩიხს თავიდან აგვიცილებს.
აღმოჩენა, დადასტურება, გამოსწორება
NVCRE NVIDIA DSX OS-ის ერთი ფენაა: AICR ვალიდირებულ კონფიგურაციას ინახავს და გადახრებს აღმოაჩენს, NVCRE დატვირთვას აგენერირებს ტელემეტრიაში უხილავი ჩავარდნების გამოსავლენად, NVSentinel კი DCGM-მეტრიკებს, Xid-შეცდომებსა და ჟურნალებს აკვირდება.
NVCRE ჩავარდნილ კვანძებსა და მიზეზებს აღრიცხავს, მაგრამ თავად არ ახდენს კვანძის cordon-ს ან taint-ს; NVSentinel-ის Certification Monitor ჩავარდნას ჯანმრთელობის მოვლენად გარდაქმნის. პროექტი Apache 2.0 ლიცენზიით ვრცელდება და მოითხოვს Kubernetes 1.29 ან უფრო ახალს, kubectl, Helm 3.x და NVIDIA GPU Operator-ს.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.