
NVIDIA משחררת בקוד פתוח את NVCRE לבדיקת אשכולות GPU לפני עומסי ייצור
בקר Kubernetes בקוד פתוח ברישיון Apache 2.0 מריץ עומסים מבוזרים אמיתיים על קבוצות צמתים מודעות-טופולוגיה, מודד את התוצאות ומצביע על צמתי GPU שנכשלים עוד לפני שהמשימות עולות לייצור.
בריא על הנייר, נכשל בעומס
אשכול GPU יכול לעבור כל בדיקת בריאות ועדיין לא להריץ עומס AI: גם כשכל GPU, קישור ו-pod מדווחים כתקינים, משימת אימון על 512 GPU עשויה לאבד ביצועים. הסיבה עשויה להיות GPU אחד איטי, קישור שמתדרדר תחת עומס, או קונפיגורציה שמנתבת בשקט תעבורה במסלול איטי יותר.
NVIDIA Cluster Readiness Engine (NVCRE) הוא בקר Kubernetes בקוד פתוח שמצמצם את החיפוש לצמתים המעורבים בלבד. הוא מריץ עומסים מבוזרים אמיתיים על קבוצות צמתים מודעות-טופולוגיה ומדווח אילו צמתים נכשלו בכל בדיקה, כך שהמוכנות הופכת לתכונה מוכחת של האשכול ולא להנחה.
API רב-שכבתי וקטלוג מובנה
ל-API שלושה משאבים: Certification מגדיר את הצמתים והקטגוריות לבדיקה; כל קטגוריה מנוהלת בידי Workflow שמחיל הגדרות פלטפורמה ו-GPU ויוצר Job בן; ה-Job מריץ את העומס, עוקב אחר בריאות הצמתים ומייחס כשלים לצמתים מסוימים.
הקטלוג מכסה חמישה וריאנטים של תקשורת NCCL, את ערכת האבחון NVIDIA DCGM ברמה 4, ואימון מקדים של NVIDIA NeMo עם מודלי Nemotron 5. תנאי המעבר נכתבים בשפת Common Expression Language, ומשימה שהסתיימה אך לא עמדה ביעד עדיין מדווחת ככשל.
בדיקה בקנה המידה שבו הכשלים מופיעים
השדה testScale בוחר את אסטרטגיית הקיבוץ: intra-node, intra-rack (לפי התווית nvidia.com/gpu.clique), full-scale או diagnose. במצב diagnose NVCRE מפצל קבוצות שנכשלו ומריץ שוב את החצאים, עד שהוא מצביע על כמה צמתים חשודים במקום על הקבוצה כולה.
WorkloadRun מריץ משימות רב-צמתיות מתוך image של קונטיינר, בחירת framework (torch, mpi או exec) ומספר צמתים. הגדרת spec.gangScheduler מכניסה את ה-pods למתזמן gang-aware כמו KAI Scheduler ומונעת מבוי סתום באשכולות עמוסים.
לזהות, לאמת, לתקן
NVCRE הוא שכבה אחת ב-NVIDIA DSX OS: AICR שומר קונפיגורציה מאומתת ומזהה סטיות, NVCRE מייצר עומס כדי לחשוף כשלים שאינם מייצרים טלמטריה, ו-NVSentinel עוקב אחר מדדי DCGM, שגיאות Xid ולוגים של המערכת.
NVCRE רושם צמתים שנכשלו וסיבות, אך אינו מבצע cordon, taint או שינוי בתנאי הצמתים; ה-Certification Monitor של NVSentinel יכול לתרגם אישור שנכשל לאירוע בריאות. הפרויקט ברישיון Apache 2.0 ודורש Kubernetes 1.29 ואילך, kubectl, Helm 3.x ו-NVIDIA GPU Operator.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.