
NVIDIA-ն բաց կոդով հրապարակեց NVCRE-ն՝ GPU կլաստերների ստուգման համար
Apache 2.0 արտոնագրով Kubernetes կարգավորիչը իրական բաշխված ծանրաբեռնվածություններ է գործարկում տոպոլոգիայի համաձայն խմբավորված հանգույցներում և մատնանշում է խափանված GPU հանգույցները մինչ արտադրական աշխատանքները։
Առողջ՝ թղթի վրա, անկայուն՝ ծանրաբեռնվածության տակ
GPU կլաստերը կարող է անցնել առողջության ստուգումները և այնուամենայնիվ չկատարել AI ծանրաբեռնվածությունը. նույնիսկ երբ յուրաքանչյուր GPU, կապուղի և pod հաղորդում է առողջ վիճակի մասին, 512 GPU-ով ուսուցման աշխատանքը կարող է կորցնել արագությունը։ Պատճառը մեկ դանդաղ GPU է, դեգրադացվող կապուղին կամ կոնֆիգուրացիան, որը լուռ երթևեկությունը տանում է ավելի դանդաղ ուղով։
NVIDIA Cluster Readiness Engine (NVCRE) բաց կոդով Kubernetes կարգավորիչ է, որը որոնումը նեղացնում է մինչև կոնկրետ հանգույցները։ Այն իրական բաշխված ծանրաբեռնվածություններ է գործարկում տոպոլոգիայով խմբավորված հանգույցներում և հաղորդում, թե որ հանգույցներն են ձախողել յուրաքանչյուր թեստը, այնպես որ պատրաստությունը դառնում է ապացուցված հատկություն, ոչ թե ենթադրություն։
Շերտավոր API և ներկառուցված կատալոգ
API-ն ունի երեք ռեսուրս. Certification-ը նշում է ստուգվող հանգույցներն ու կատեգորիաները. յուրաքանչյուր կատեգորիա ղեկավարվում է Workflow-ով, որը կիրառում է հարթակի և GPU-ի կարգավորումները և ստեղծում դուստր Job. Job-ը գործարկում է ծանրաբեռնվածությունը և խափանումները վերագրում է կոնկրետ հանգույցների։
Կատալոգը ընդգրկում է NCCL կապի հինգ տարբերակ, NVIDIA DCGM-ի չորրորդ մակարդակի ախտորոշումը և NVIDIA NeMo-ի ուսուցումը Nemotron 5 մոդելներով։ Անցման չափանիշները գրվում են Common Expression Language-ով, և նպատակին չհասած ավարտված աշխատանքը միշտ հաղորդվում է որպես ձախողված։
Փորձարկում այն մասշտաբով, որտեղ խափանումները դրսևորվում են
testScale դաշտը ընտրում է խմբավորման ռազմավարությունը՝ intra-node, intra-rack, full-scale կամ diagnose։ diagnose ռեժիմում NVCRE-ն բաժանում է ձախողված խմբերը և վերսկսում կեսերը, մինչև ամբողջ խմբի փոխարեն անվանի մի քանի կասկածյալ հանգույց։
WorkloadRun-ը բազմանոդ աշխատանքներ է գործարկում կոնտեյների պատկերով, framework-ի (torch, mpi կամ exec) և հանգույցների քանակով։ spec.gangScheduler պարամետրը pod-երը միացնում է KAI Scheduler-ի նման gang-aware պլանավորիչին և խուսափում փակուղուց ծանրաբեռնված կլաստերներում։
Բացահայտել, հաստատել, վերացնել
NVCRE-ն NVIDIA DSX OS-ի շերտերից մեկն է. AICR-ը պահպանում է հաստատված կոնֆիգուրացիան և հայտնաբերում շեղումները, NVCRE-ն ծանրաբեռնվածություն է գեներացնում՝ բացահայտելու հեռաչափության մեջ չերևացող խափանումները, իսկ NVSentinel-ը հետևում է DCGM չափիչներին, Xid սխալներին և մատյաններին։
NVCRE-ն գրանցում է ձախողված հանգույցներն ու պատճառները, բայց ինքը չի կատարում cordon կամ taint. NVSentinel-ի Certification Monitor-ը ձախողված սերտիֆիկացիան վերածում է առողջության իրադարձության։ Նախագիծը Apache 2.0 արտոնագրով է և պահանջում է Kubernetes 1.29, kubectl, Helm 3.x և NVIDIA GPU Operator։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։