هندسة NVIDIA Vera Rubin GPU — 336 مليار ترانزستور، إنتاجية وكيلة أكثر 10 مرات مقارنة بـ Blackwell
كشفت NVIDIA عن منصة Vera Rubin — 336 مليار ترانزستور، وذاكرة HBM4، ومحرك Transformer Engine من الجيل الثالث، مما يوفر إنتاجية وكيلة أكثر بمقدار 10 مرات لكل وحدة طاقة مقارنة بـ Blackwell لأعمال الذكاء الاصطناعي الوكيل.
العصر الجديد للذكاء الاصطناعي الوكيل — NVIDIA Vera Rubin
قبل بضع سنوات، كان عالم الذكاء الاصطناعي يخدم بشكل أساسي تدريب النماذج وواجهات المحادثة البسيطة. اليوم تغير المشهد جذريًا — مصانع الذكاء الاصطناعي تعمل باستمرار وتنتج الذكاء على نطاق واسع. هذه المصانع تخدم الآن سير العمل الوكيل التي تفكر وتخطط وتستخدم الأدوات وتتحقق من النتائج الوسيطة وتنفذ مهام معقدة متعددة الخطوات في سياقات واسعة.
أعمال الذكاء الاصطناعي الوكيل لا تُعرّف بسؤال وإجابة واحدة — بل هي استدلال مستمر عبر العديد من خطوات التفكير. تتطلب زمن استجابة منخفض لكل خطوة، وإنتاجية فك ترميز عالية، وانتباه فعال طويل السياق، وسعة تخزين مؤقت KV كبيرة، والقدرة على توسيع النماذج عبر مجالات GPU مترابطة بإحكام. هذه هي التحديات التي تجيب عليها منصة NVIDIA Vera Rubin الجديدة.
Rubin GPU — 336 مليار ترانزستور من كثافة الحوسبة
في قلب المنصة يوجد NVIDIA Rubin GPU، المصمم لتقديم إنتاجية وكيلة أكثر بمقدار 10 مرات لكل وحدة طاقة مقارنة بـ NVIDIA Blackwell. هذا ليس مجرد رقم — بل قفزة جيلية أساسية ستمكن مصانع الذكاء الاصطناعي من إنتاج المزيد من الرموز المفيدة ضمن نفس حدود الطاقة.
يتكون Rubin GPU من 336 مليار ترانزستور، ويضم 224 معالج تيار متعدد (SM) و896 نواة Tensor. الشريحة مصنوعة من بلورات حوسبة محدودة بالشبكية موحدة على حزمة واحدة عبر رابط NV-HBI (NVIDIA High-Bandwidth Interface) عالي السرعة بين البلورات. هذا النهج يحقق كثافة وكفاءة عالية.
محرك Transformer Engine من الجيل الثالث — 50 بيتافلوبس NVFP4
أحد الابتكارات الرئيسية في Rubin هو محرك Transformer Engine من الجيل الثالث. هذا المحرك يكيّف الدقة بين التنسيقات الرقمية المختلفة، مما يسمح لـ Rubin GPU بتقديم أداء استدلال يصل إلى 50 بيتافلوبس NVFP4 مع الحفاظ على الدقة.
نوى Tensor المحسّنة تمتلك مرونة دقة موسعة، وإنتاجية نوى Tensor لكل دورة ساعة مضاعفة بفضل مضاعفة معالجة البيانات في بُعد K. هذا التحسين يساعد كلاً من النوى المحدودة بالإنتاجية والنوى المحدودة بالذاكرة وزمن الاستجابة.
ذاكرة HBM4 — 288 جيجابايت بعرض نطاق 22 تيرابايت/ثانية
يدمج Rubin ما يصل إلى 288 جيجابايت من ذاكرة HBM4، مدفوعة بوحدات تحكم HBM مخصصة ومكدسات 12-Hi، مما يوفر عرض نطاق ترددي يصل إلى 22 تيرابايت/ثانية — 2.8 مرة أكثر من Blackwell وBlackwell Ultra.
HBM4 يضاعف عرض الواجهة مقارنة بـ HBM3e. إلى جانب وحدة تحكم ذاكرة جديدة، وهندسة مشتركة عميقة مع نظام الذاكرة، وتكامل أكثر إحكامًا بين الحوسبة والذاكرة، يوفر هذا النظام عرض نطاق غير مسبوق.
ذاكرة HBM4 عالية السعة وعالية النطاق الترددي ضرورية لاستضافة النماذج ذات تريليونات المعاملات، وتوسيع طول السياق دون تفريغ ذاكرة التخزين المؤقت KV، ودعم أحمال عمل الاستدلال عالية التوافق طويلة الأفق.
NVLink 6 و NVLink-C2C — وصلات فائقة السرعة
في بنية Rubin، البنية التحتية للاتصالات لا تقل أهمية عن قوة الحوسبة نفسها. NVLink 6 من NVIDIA يوفر 3,600 جيجابايت/ثانية من عرض النطاق الترددي للتوسع إلى مبدل NVLink للاتصال الشامل بين GPU وGPU. NVLink-C2C يوفر 1,800 جيجابايت/ثانية للاتصال المتماسك بين CPU وGPU، بينما x16 PCIe Gen 6 يوفر ما يصل إلى 256 جيجابايت/ثانية من اتصال المضيف.
يقدم Rubin الكتابات المعدودة (counted writes) للاتصال NVLink المُبادَر من الجهاز، مما يبسط المزامنة لنقل البيانات بين GPU وGPU. هذا يسمح لـ GPU المستقبل بتتبع اكتمال النقل بكفاءة أكبر.
بنية محسّنة للذكاء الاصطناعي الوكيل
تم تصميم Rubin GPU خصيصًا لأنماط تنفيذ الذكاء الاصطناعي الوكيل — التفكير والتخطيط واستخدام الأدوات ومعالجة السياق الطويل. هذا يتطلب ليس فقط أداء حوسبة ذروة ولكن أيضًا نقل بيانات فعال، ومعالجة انتباه طويلة السياق، وانتقالات سلسة بين النوى المعتمدة.
يعمل Rubin على تسريع الانتباه من خلال الجمع بين نداءات التنشيط والضغط التكيفي مع تحسين إنتاجية softmax. يبدأ خط أنابيب الانتباه بحساب QK^T كثيف لتوليد درجات انتباه وسيطة. يمكن لـ Rubin بعد ذلك تحميل تلك البيانات الوسيطة من ذاكرة Tensor إلى شكل مضغوط متناثر منظم 2:4، مما يقلل من تكلفة الكتابة ومتطلبات التخزين.
بالإضافة إلى ذلك، يتيح Rubin تنسيقًا أدق بين النوى المعتمدة، مما يسمح للنوى المستهلكة ببدء العمل في وقت أبكر بمجرد أن تصبح بيانات الإدخال المطلوبة متاحة.
Vera CPU — نوى Olympus للأداء الأقصى
تتضمن منصة Vera Rubin أيضًا Vera CPU، المبني على نوى Olympus المصممة لأقصى أداء أحادي الخيط. توفر وحدة المعالجة المركزية هذه تنسيقًا وثيقًا مع GPU عبر NVLink-C2C، وهو أمر بالغ الأهمية بشكل خاص لسير العمل الوكيل حيث يتبادل CPU وGPU البيانات باستمرار.
Vera Rubin NVL72 — حاسوب فائق AI على مستوى الرف
Vera Rubin NVL72 يوسع Rubin GPU إلى مجال تنفيذ على مستوى الرف. بنية الرف MGX من الجيل الثالث تجمع بين أدراج الحوسبة والشبكة بدون كابلات، والتبريد السائل عند 45 درجة مئوية، وإدارة الطاقة الديناميكية على مستوى الرف، وIntelligent Power Smoothing.
مع DSX MaxLPS، يمكن لـ Vera Rubin NVL72 تقليل متوسط استهلاك الطاقة بنحو 10٪ وذروة الطاقة لمدة 50 مللي ثانية بنحو 20٪. هذا يسمح للمشغلين بتركيب ما يصل إلى 40٪ أكثر من GPU ضمن نفس ميزانية الطاقة. توفر شبكة Spectrum-6 اتصالاً لمصانع AI على نطاق جيجا.
الحوسبة السرية مع TEE-I/O
لنشر الذكاء الاصطناعي الوكيل على نطاق واسع، أمن البيانات أمر بالغ الأهمية. تقدم NVIDIA الحوسبة السرية مع TEE-I/O، المصممة لحماية البيانات في حالة السكون وأثناء النقل وأثناء الاستخدام عبر مصنع AI.
Bristol Myers Squibb — أكثر مصانع AI تقدمًا في علوم الحياة
لإظهار الإمكانات الحقيقية لمنصة Rubin، تقوم Bristol Myers Squibb ببناء أكثر مصانع AI تقدمًا في علوم الحياة على أساس Rubin. هذه الخطوة تؤكد أن Vera Rubin ليس مجرد جيل جديد من GPU — بل منصة ستمكن صناعات بأكملها من الانتقال إلى المستوى التالي من اعتماد الذكاء الاصطناعي.
الخلاصة
تمثل بنية NVIDIA Vera Rubin GPU لحظة فارقة في تطور البنية التحتية للذكاء الاصطناعي. مع 336 مليار ترانزستور، وذاكرة HBM4، ومحرك Transformer Engine من الجيل الثالث، وإنتاجية وكيلة أكثر 10 مرات مقارنة بـ Blackwell، فهي لا تلبي فقط متطلبات أعباء عمل AI الحالية بل تضع الأساس لأنظمة الوكيل المستقبلية. بدعم من 300 شريك عالمي ومزودي الخدمات السحابية الرئيسيين بما في ذلك CoreWeave وGoogle Cloud وMicrosoft Azure وMistral، يتم بالفعل نشر Vera Rubin في جميع أنحاء العالم. مع Vera Rubin، تواصل NVIDIA رؤيتها لمصانع AI التي تعمل باستمرار، وبكفاءة أكبر، وبأمان أكبر، وعلى نطاق أوسع من أي وقت مضى.