
NVIDIA מכניסה הסקה רב-התקנית של TensorRT אל תוך Dynamo-Triton
NVIDIA שילבה הסקה רב-התקנית של TensorRT ב-Dynamo-Triton 26.07, כך שמופע מודל אחד של Triton מחזיק כמה GPUs וזמן יצירת הווידאו ב-Cosmos 3 Nano ירד מ-156.6 ל-34.2 שניות.
NVIDIA שילבה את יכולת ההסקה הרב-התקנית של TensorRT בתוך Dynamo-Triton, כך שאפליקציה כבר אינה צריכה לתאם בעצמה את דרגות ה-GPU.
מה השתנה
הסקה רב-התקנית של TensorRT מאפשרת לרשת TensorRT אחת לפעול על פני כמה GPUs באמצעות קולקטיבים מבוזרים המבוססים על NCCL, תוך שמירה על אופטימיזציות ההסקה. Dynamo-Triton, שבעבר נקרא Triton Inference Server, מפעיל את היכולת בגרסה 26.07, ומופע KIND_MODEL יחיד יכול כעת להחזיק כמה GPUs: הוא יוצר הקשרי הרצה, זרמי CUDA ומתקשרי NCCL לכל דרגה, ואז מפעיל את הדרגות יחד בכל בקשה בקריאת gRPC אחת.
איך עובד נתיב ההגשה
את האינטגרציה הדגימו ביצירת וידאו עם Cosmos 3 Nano: Diffusers ממשיך לתזמר את הסביבה, בעוד Dynamo-Triton מגיש את טרנספורמר הדנואיזינג בן 36 השכבות. ההסקה הרב-התקנית של TensorRT מפזרת 44,160 אסימוני וידאו על פני עד שמונה GPUs באמצעות מקביליות הקשר של Ulysses.
הגרף המבוזר מהודר לתוך כל תוכנית TensorRT עוד לפני הפריסה, ולכן Triton מפעיל תוכנית מקבילית-הקשרית ולא ממיר מנוע חד-התקני. הטרנספורמר אחראי ל-93.4% מזמן היצירה על GPU בודד; מכיוון שכל אחד מ-35 צעדי הדנואיזינג דורש שתי תחזיות עבור classifier-free guidance, פרוקסי ה-Diffusers מבצע 70 קריאות RPC של הטרנספורמר לכל יצירה.
תוצאות השהיה
כל ארבעת הווריאנטים רצו על אותה מערכת עם שמונה GPUs: 1280x720, 189 פריימים ב-24 FPS וחמש יצירות מדודות. השהיה מקצה לקצה ירדה מ-156.595 שניות על GPU אחד ל-87.999 בשניים, 53.093 בארבעה ו-34.183 שניות בשמונה — הפחתה של 78.17%. זמן ה-RPC של הטרנספורמר ירד ב-83.59%, חלקו ירד מ-93.4% ל-70.2%, והזמן מחוץ למסלול זה נשאר בין 10.2 ל-10.5 שניות בכל התצורות.
האימות השווה כל פלט מקבילי-הקשרי לתוצאה של התקן בודד באותו seed: CP2 ו-CP4 מדדו שגיאה מוחלטת ממוצעת של 12.759 ו-PSNR של 21.111 dB, CP8 מדד MAE 16.316 ו-PSNR 19.400 dB — כולם בתוך הספים. NVIDIA אינה טוענת שהפלטים זהים ברמת הפיקסל.
פשרות
צוותים עדיין נדרשים לאזן בין תוספת משאבי GPU לבין השהיה קצרה יותר. הבנצ'מרק אינו מודד תפוקת בקשות במקביל, עלות לכל וידאו או עלות בעלות כוללת — מדדים שיש לבחון מול יעדי ה-SLO הפנימיים. Dynamo-Triton 26.07 זמין ב-NGC.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.