العودة
NVIDIA تطلق NVCRE مفتوح المصدر لاختبار جاهزية عناقيد GPU قبل الأحمال
SiTech AI Team2 წთ. საკითხავი

NVIDIA تطلق NVCRE مفتوح المصدر لاختبار جاهزية عناقيد GPU قبل الأحمال

وحدة تحكم Kubernetes مفتوحة المصدر برخصة Apache 2.0 تشغّل أحمالاً موزعة حقيقية على مجموعات عُقد متوافقة مع الطوبولوجيا وتحدد عُقد GPU المتعطلة قبل أن تصل أحمال الإنتاج.

سليم على الورق، لكنه يفشل تحت الحمل

قد يجتاز عنقود GPU كل فحوص الصحة ومع ذلك يفشل في تشغيل حمل ذكاء اصطناعي: حتى عندما تبدو كل وحدات GPU والوصلات وحاويات pod سليمة، قد تنخفض أداء مهمة تدريب على 512 وحدة GPU. السبب قد يكون وحدة GPU واحدة بطيئة، أو وصلة تتدهور تحت الحمل، أو إعداداً يوجّه حركة المرور بصمت عبر مسار أبطأ.

‏NVIDIA Cluster Readiness Engine (NVCRE) وحدة تحكم Kubernetes مفتوحة المصدر تضيّق البحث إلى العُقد المعنية تحديداً. تشغّل أحمالاً موزعة حقيقية على مجموعات عُقد مرتبة حسب الطوبولوجيا وتبلّغ عن العُقد التي فشلت في كل اختبار، فيصبح الجاهزية خاصية مثبتة في العنقود لا افتراضاً.

مقارنة بين المراقبة السلبية من NVSentinel والتحقق النشط من NVCRE

واجهة برمجية متعددة الطبقات وكتالوج مدمج

تتكوّن الواجهة من ثلاثة موارد: Certification يحدد العُقد والفئات المطلوب اختبارها؛ وتدير كل فئة Workflow تطبّق إعدادات المنصة وGPU وتنشئ Job فرعياً؛ ويشغّل الـJob الحمل ويراقب صحة العُقد وينسب الإخفاقات إلى عُقد محددة.

يغطي الكتالوج خمسة أنماط لاتصال NCCL، ومجموعة التشخيص NVIDIA DCGM من المستوى الرابع، والتدريب المسبق من NVIDIA NeMo بنماذج Nemotron 5. تُكتب معايير النجاح بلغة Common Expression Language، كما تُحتسب المهمة التي تنتهي دون بلوغ هدفها فاشلة.

الاختبار بالحجم الذي تظهر فيه الإخفاقات

يحدد الحقل testScale استراتيجية التجميع: intra-node، أو intra-rack (عبر التسمية nvidia.com/gpu.clique)، أو full-scale، أو diagnose. وفي وضع diagnose يقسّم NVCRE المجموعات الفاشلة ويعيد تشغيل أنصافها حتى يسمّي عُقداً مشتبهاً بها قليلة بدلاً من المجموعة كاملة.

يشغّل WorkloadRun مهام متعددة العُقد من صورة حاوية، واختيار إطار عمل (torch أو mpi أو exec)، وعدد العُقد. وربط spec.gangScheduler يضع الحاويات في مجدول gang-aware مثل KAI Scheduler ويتجنب الجمود في العناقيد المزدحمة.

الاكتشاف والتحقق والمعالجة

‏NVCRE طبقة واحدة من NVIDIA DSX OS: يحافظ AICR على إعداد موثّق ويكتشف الانحراف، ويولّد NVCRE حملاً لكشف أعطال لا تظهر في القياسات، ويراقب NVSentinel مقاييس DCGM وأخطاء Xid وسجلات النظام.

يسجّل NVCRE العُقد الفاشلة والأسباب لكنه لا ينفذ cordon أو taint ولا يعدّل حالات العُقد؛ ويستطيع Certification Monitor في NVSentinel تحويل الشهادة الفاشلة إلى حدث صحي. المشروع برخصة Apache 2.0 ويتطلب Kubernetes 1.29 أو أحدث وkubectl وHelm 3.x وNVIDIA GPU Operator.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.