חזרה →
SiTech Team⏱️ 5 წთ. საკითხავი

ארכיטקטורת NVIDIA Vera Rubin GPU — 336 מיליארד טרנזיסטורים, פי 10 תפוקה סוכנת לעומת Blackwell

ארכיטקטורת NVIDIA Vera Rubin GPU — 336 מיליארד טרנזיסטורים, פי 10 תפוקה סוכנת לעומת Blackwell

NVIDIA חשפה את פלטפורמת Vera Rubin — 336 מיליארד טרנזיסטורים, זיכרון HBM4 ומנוע Transformer Engine מהדור השלישי, המספק עד פי 10 יותר תפוקה סוכנת ליחידת אנרגיה מאשר Blackwell עבור עומסי עבודה סוכנים של AI.

העידן החדש של AI סוכן — NVIDIA Vera Rubin

לפני כמה שנים, עולם הבינה המלאכותית שירת בעיקר אימון מודלים וממשקי צ'אט פשוטים. היום התמונה השתנתה לחלוטין — מפעלי AI פועלים ברציפות ומייצרים אינטליגנציה בקנה מידה. מפעלים אלו משרתים כעת זרימות עבודה סוכנות שמסיקות מסקנות, מתכננות, משתמשות בכלים, בודקות תוצאות ביניים ומבצעות משימות מורכבות מרובות-שלבים בהקשרים רחבים.

עומסי עבודה סוכנים אינם מוגדרים על ידי שאלה ותשובה בודדת — אלא על ידי הסקת מסקנות מתמשכת על פני שלבי חשיבה רבים. הם דורשים חביון נמוך בכל שלב, תפוקת פענוח גבוהה, קשב יעיל בהקשר ארוך, קיבולת גדולה של מטמון KV, ויכולת להרחיב מודלים על פני תחומי GPU מחוברים היטב. לאתגרים אלו בדיוק עונה פלטפורמת NVIDIA Vera Rubin החדשה.

Rubin GPU — 336 מיליארד טרנזיסטורים של צפיפות חישוב

בלב הפלטפורמה נמצא NVIDIA Rubin GPU, שנועד לספק עד פי 10 יותר תפוקה סוכנת ליחידת אנרגיה מאשר NVIDIA Blackwell. זהו לא רק מספר — זוהי קפיצת דור משמעותית, שתאפשר למפעלי AI לייצר יותר טוקנים שימושיים באותה מסגרת אנרגיה.

Rubin GPU בנוי מ-336 מיליארד טרנזיסטורים, וכולל 224 מעבדי זרם מרובי-תכלית (SM) ו-896 ליבות Tensor. השבב מיוצר מגבישי חישוב מוגבלי רטיקולה המאוחדים על גבי חבילה אחת באמצעות קישור NV-HBI (NVIDIA High-Bandwidth Interface) מהיר בין-גבישי. גישה זו משיגה צפיפות ויעילות גבוהות.

מנוע Transformer Engine מהדור השלישי — 50 פטהפלופס NVFP4

אחת החידושים המרכזיים של Rubin היא מנוע Transformer Engine מהדור השלישי. מנוע זה מתאים דיוק בין פורמטים מספריים שונים, ומאפשר ל-Rubin GPU להגיע לביצועי הסקה של עד 50 פטהפלופס NVFP4 תוך שמירה על דיוק.

ליבות Tensor המשופרות בעלות גמישות דיוק מורחבת, ותפוקת ליבות Tensor לשעון מוכפלת הודות להכפלת עיבוד הנתונים בממד K. אופטימיזציה זו מסייעת גם לליבות המוגבלות בתפוקה וגם לליבות המוגבלות בזיכרון ובחביון.

זיכרון HBM4 — 288 ג"ב ברוחב פס של 22 ט"ב/שנייה

Rubin משלב עד 288 ג"ב של זיכרון HBM4, המונע על ידי בקרי HBM ייעודיים וערימות 12-Hi, המספקות עד 22 ט"ב/שנייה של רוחב פס שיא — פי 2.8 יותר מאשר Blackwell ו-Blackwell Ultra.

HBM4 מכפיל את רוחב הממשק יחסית ל-HBM3e. בשילוב עם בקר זיכרון חדש, הנדסה משותפת מעמיקה עם מערכת הזיכרון, ואינטגרציה הדוקה יותר בין חישוב לזיכרון, מערכת זו מספקת רוחב פס חסר תקדים.

HBM4 בעל קיבולת גבוהה ורוחב פס גבוה הוא קריטי לאירוח מודלים עם טריליוני פרמטרים, הרחבת אורך הקשר ללא פריקת מטמון KV, ותמיכה בעומסי הסקה ארוכי-טווח עם במקביליות גבוהה.

NVLink 6 ו-NVLink-C2C — חיבורים מהירים במיוחד

בארכיטקטורת Rubin, תשתית התקשורת חשובה לא פחות מכוח החישוב עצמו. NVIDIA NVLink 6 מספק 3,600 ג"ב/שנייה של רוחב פס הרחבה למתג NVLink לתקשורת GPU-GPU מלאה. NVLink-C2C מספק 1,800 ג"ב/שנייה לתקשורת קוהרנטית CPU-GPU, בעוד x16 PCIe Gen 6 מספק עד 256 ג"ב/שנייה של קישוריות מארח.

Rubin מציג counted writes לתקשורת NVLink ביוזמת התקן, המייעלת סנכרון להעברות נתונים בין GPU ל-GPU. זה מאפשר ל-GPU המקבל לעקוב אחר השלמת ההעברה ביעילות רבה יותר, ומספק מנגנון חביון נמוך יותר.

ארכיטקטורה מותאמת ל-AI סוכן

ה-Rubin GPU בנוי במיוחד עבור דפוסי הביצוע של AI סוכן — חשיבה, תכנון, שימוש בכלים ועיבוד הקשר ארוך. זה דורש לא רק ביצועי חישוב שיא אלא גם העברת נתונים יעילה, עיבוד קשב בהקשר ארוך ומעברים חלקים בין ליבות תלויות.

Rubin מאיץ קשב על ידי שילוב של דלילות הפעלה עם דחיסה אדפטיבית יחד עם תפוקת softmax משופרת. צינור הקשב מתחיל בחישוב QK^T צפוף להפקת ציוני קשב ביניים. Rubin יכול לטעון נתוני ביניים אלה מ-Tensor Memory לצורה דחוסה דלילה מובנית 2:4, ולהפחית את עלויות הכתיבה ואת דרישות האחסון.

בנוסף, Rubin מאפשר תיאום עדין יותר בין ליבות תלויות, ומאפשר ליבת הצרכן להתחיל לעבוד מוקדם יותר ברגע שנתוני הקלט הדרושים הופכים זמינים.

Vera CPU — ליבות Olympus לביצועים מקסימליים

פלטפורמת Vera Rubin כוללת גם את Vera CPU, הבנוי על ליבות Olympus המיועדות לביצועי חוט-יחיד מקסימליים. CPU זה מספק תיאום הדוק עם ה-GPU באמצעות NVLink-C2C, דבר קריטי במיוחד עבור זרימות עבודה סוכנות שבהן CPU ו-GPU מחליפים נתונים כל העת.

Vera Rubin NVL72 — מחשב-על AI בקנה מידה של מתלה

Vera Rubin NVL72 מרחיב את Rubin GPU לתחום ביצוע בקנה מידה של מתלה. ארכיטקטורת MGX מהדור השלישי משלבת מגשי חישוב ורשת ללא כבלים, קירור נוזלי ב-45°C, ניהול כוח דינמי בקנה מידה של מתלה ו-Intelligent Power Smoothing.

עם DSX MaxLPS, Vera Rubin NVL72 יכול להפחית את צריכת האנרגיה הממוצעת בכ-10% ואת הספק השיא ב-20% למשך 50 אלפיות השנייה. זה מאפשר למפעילים להתקין עד 40% יותר GPU באותו תקציב אנרגיה. רשת Spectrum-6 מספקת קישוריות למפעלי AI בגודל גיגה-קנה מידה.

מחשוב סודי עם TEE-I/O

לפריסות AI סוכן בקנה מידה גדול, אבטחת נתונים היא קריטית. NVIDIA מציגה מחשוב סודי עם TEE-I-O, המיועד לאבטחת נתונים במנוחה, בתעבורה ובשימוש ברחבי מפעל ה-AI.

Bristol Myers Squibb — מפעל ה-AI המתקדם ביותר במדעי החיים

להדגמת הפוטנציאל האמיתי של פלטפורמת Rubin, Bristol Myers Squibb בונה את מפעל ה-AI המתקדם ביותר במדעי החיים על בסיס Rubin. צעד זה מדגיש כי Vera Rubin אינה רק דור חדש של GPU — אלא פלטפורמה שתאפשר לתעשיות שלמות לעבור לשלב הבא של אימוץ AI.

סיכום

ארכיטקטורת NVIDIA Vera Rubin GPU מייצגת רגע מכריע באבולוציית תשתיות ה-AI. עם 336 מיליארד טרנזיסטורים, זיכרון HBM4, מנוע Transformer Engine מהדור השלישי ופי 10 תפוקה סוכנת לעומת Blackwell, היא לא רק עונה לדרישות עומסי העבודה הנוכחיים של AI אלא מניחה את היסוד למערכות סוכנות עתידיות. בגיבוי של 300 שותפים גלובליים וספקי ענן מובילים כולל CoreWeave, Google Cloud, Microsoft Azure ו-Mistral, Vera Rubin כבר נפרסת ברחבי העולם. עם Vera Rubin, NVIDIA ממשיכה את חזונה של מפעלי AI הפועלים ברציפות, ביעילות רבה יותר, בצורה מאובטחת יותר ובקנה מידה גדול מאי פעם.

📖 מקור