Назад
NVIDIA відкрила код NVCRE, щоб перевіряти GPU-кластери до запуску навантажень
SiTech AI Team2 წთ. საკითხავი

NVIDIA відкрила код NVCRE, щоб перевіряти GPU-кластери до запуску навантажень

Контролер для Kubernetes під ліцензією Apache 2.0 запускає справжні розподілені навантаження на топологічних групах вузлів і називає проблемні GPU ще до старту продакшн-задач.

Здоровий на папері, але не під навантаженням

GPU-кластер може пройти всі перевірки стану й усе одно не впоратися з AI-навантаженням: навіть коли кожен GPU, лінк і pod звітують про справність, завдання навчання на 512 GPU може втратити продуктивність. Причина — один повільний GPU, лінк, що деградує під навантаженням, або конфігурація, яка тихо веде трафік повільнішим шляхом.

NVIDIA Cluster Readiness Engine (NVCRE) — контролер для Kubernetes з відкритим кодом, який звужує пошук до конкретних вузлів. Він запускає реальні розподілені навантаження на групах вузлів, сформованих за топологією, і повідомляє, які вузли не пройшли кожен тест, тож готовність стає доведеною властивістю кластера, а не припущенням.

Порівняння пасивного моніторингу NVSentinel з активною валідацією NVCRE

Багаторівневий API і вбудований каталог

В API є три ресурси: Certification визначає вузли й категорії для перевірки; кожну категорію веде Workflow, який застосовує налаштування платформи та GPU і створює дочірній Job; Job запускає навантаження, стежить за станом вузлів і приписує збої конкретним вузлам.

Каталог охоплює п'ять варіантів NCCL-комунікації, діагностичний набір NVIDIA DCGM рівня 4 і попереднє навчання NVIDIA NeMo з моделями Nemotron 5. Критерії проходження описують мовою Common Expression Language, і завдання, яке завершилося, але не досягло мети, однаково вважається невдалим.

Тестування в тому масштабі, де з'являються збої

Поле testScale вибирає стратегію групування: intra-node, intra-rack (за міткою nvidia.com/gpu.clique), full-scale або diagnose. У режимі diagnose NVCRE ділить групи, що зірвалися, і перезапускає половини, доки не назве кількох підозрюваних вузлів замість цілої групи.

WorkloadRun запускає багатовузлові завдання з образу контейнера, вибору фреймворку (torch, mpi або exec) і кількості вузлів. Параметр spec.gangScheduler підключає pod'и до gang-aware планувальника, наприклад KAI Scheduler, і уникає глухого кута на завантажених кластерах.

Виявити, підтвердити, усунути

NVCRE — один із шарів NVIDIA DSX OS: AICR зберігає перевірену конфігурацію й виявляє дрейф, NVCRE генерує навантаження, щоб знайти збої, невидимі в телеметрії, а NVSentinel стежить за метриками DCGM, помилками Xid і системними логами.

NVCRE фіксує вузли, що зірвалися, та причини, але сам не робить cordon, taint і не змінює стани вузлів; Certification Monitor у NVSentinel перетворює невдалу сертифікацію на подію стану. Проєкт ліцензовано за Apache 2.0; потрібні Kubernetes 1.29 або новіший, kubectl, Helm 3.x і NVIDIA GPU Operator.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.