Назад
SiTech Team⏱️ 5 წთ. საკითხავი

Архітектура NVIDIA Vera Rubin GPU — 336 мільярдів транзисторів, у 10 разів вища агентна пропускна здатність порівняно з Blackwell

Архітектура NVIDIA Vera Rubin GPU — 336 мільярдів транзисторів, у 10 разів вища агентна пропускна здатність порівняно з Blackwell

NVIDIA представила платформу Vera Rubin — 336 мільярдів транзисторів, пам'ять HBM4 і рушій Transformer Engine третього покоління, який забезпечує у 10 разів вищу агентну пропускну здатність на одиницю енергії порівняно з Blackwell для агентних AI навантажень.

Нова ера агентного AI — NVIDIA Vera Rubin

Кілька років тому світ штучного інтелекту в основному обслуговував навчання моделей та прості чат-інтерфейси. Сьогодні картина радикально змінилася — AI фабрики працюють безперервно, виробляючи інтелект у масштабі. Ці фабрики тепер обслуговують агентні робочі процеси, які розмірковують, планують, використовують інструменти, перевіряють проміжні результати та виконують складні багатоетапні завдання у широкому контексті.

Агентні навантаження не визначаються одним запитом і відповіддю — це безперервний інференс через багато етапів міркування. Вони потребують низької латентності на кожному етапі, високої пропускної здатності декодування, ефективної уваги з довгим контекстом, великої ємності KV кешу та можливості масштабування моделей на тісно зв'язаних GPU доменах. Саме на ці виклики відповідає нова платформа NVIDIA Vera Rubin.

Rubin GPU — 336 мільярдів транзисторів обчислювальної щільності

У центрі платформи знаходиться NVIDIA Rubin GPU, створений для забезпечення до 10 разів вищої агентної пропускної здатності на одиницю енергії, ніж NVIDIA Blackwell. Це не просто число — це фундаментальний стрибок, який дозволить AI фабрикам виробляти більше корисних токенів у тих же енергетичних межах.

Rubin GPU складається з 336 мільярдів транзисторів, включає 224 потокові мультипроцесори (SM) та 896 Tensor Core. Чіп виготовлений з ретикуло-обмежених обчислювальних кристалів, об'єднаних на одному пакеті через високошвидкісний NV-HBI (NVIDIA High-Bandwidth Interface) міжкристальний зв'язок. Цей підхід забезпечує високу щільність та ефективність.

Transformer Engine третього покоління — 50 петафлопс NVFP4

Однією з головних інновацій Rubin є рушій Transformer Engine третього покоління. Цей рушій адаптує точність між різними числовими форматами, дозволяючи Rubin GPU досягати до 50 петафлопс продуктивності інференсу NVFP4 із збереженням точності.

Покращені Tensor Cores мають розширену гнучкість точності, а пропускна здатність Tensor Core на такт подвоєна завдяки подвоєнню обробки даних у K вимірі. Ця оптимізація допомагає як ядрам, обмеженим пропускною здатністю, так і ядрам, обмеженим пам'яттю та латентністю.

Пам'ять HBM4 — 288 ГБ з пропускною здатністю 22 ТБ/с

Rubin інтегрує до 288 ГБ пам'яті HBM4, керованої спеціалізованими контролерами HBM та 12-Hi стеками, що забезпечує до 22 ТБ/с пікової пропускної здатності — у 2.8 рази більше, ніж у Blackwell та Blackwell Ultra.

HBM4 подвоює ширину інтерфейсу порівняно з HBM3e. У поєднанні з новим контролером пам'яті, глибокою спільною інженерією з екосистемою пам'яті та тіснішою інтеграцією обчислень і пам'яті, ця система забезпечує безпрецедентну пропускну здатність.

Високоємнісна HBM4 з високою пропускною здатністю є критично важливою для розміщення моделей з багатотрильйонними параметрами, розширення довжини контексту без вивантаження KV кешу та підтримки висококонкурентних довгострокових інференс-навантажень.

NVLink 6 та NVLink-C2C — надшвидкісні з'єднання

В архітектурі Rubin комунікаційна інфраструктура настільки ж важлива, як і обчислювальна потужність. NVIDIA NVLink 6 забезпечує 3,600 ГБ/с пропускної здатності масштабування до комутатора NVLink для зв'язку "всі-з-усіма" між GPU. NVLink-C2C доставляє 1,800 ГБ/с для когерентного зв'язку CPU-GPU, а x16 PCIe Gen 6 забезпечує до 256 ГБ/с зв'язку з хостом.

Rubin впроваджує counted writes для ініційованої пристроєм комунікації NVLink, що спрощує синхронізацію передачі даних між GPU. Це дозволяє приймаючому GPU ефективніше відстежувати завершення передачі, забезпечуючи механізм з нижчою латентністю.

Архітектура, оптимізована для агентного AI

Rubin GPU спеціально створений для шаблонів виконання агентного AI — міркування, планування, використання інструментів та обробка довгого контексту. Це вимагає не лише пікової обчислювальної продуктивності, але й ефективного переміщення даних, обробки уваги з довгим контекстом та плавних переходів між залежними ядрами.

Rubin прискорює увагу шляхом комбінації розрідженості активацій та адаптивної компресії разом із покращеною пропускною здатністю softmax. Конвеєр уваги починається з щільного обчислення QK^T для генерації проміжних оцінок уваги. Rubin може завантажувати ці проміжні дані з Tensor Memory у структуровану 2:4 розріджену стиснену форму, зменшуючи витрати на запис та вимоги до зберігання.

Крім того, Rubin забезпечує більш дрібнозернисту координацію між залежними ядрами, дозволяючи споживаючому ядру почати роботу раніше, як тільки необхідні вхідні дані стають доступними.

Vera CPU — ядра Olympus для максимальної продуктивності

Платформа Vera Rubin також включає Vera CPU, побудований на ядрах Olympus, розроблених для максимальної однопотокової продуктивності. Цей CPU забезпечує тісну координацію з GPU через NVLink-C2C, що особливо важливо для агентних робочих процесів, де CPU та GPU постійно обмінюються даними.

Vera Rubin NVL72 — стійковий AI суперкомп'ютер

Vera Rubin NVL72 розширює Rubin GPU до стійкового домену виконання. Ця архітектура третього покоління MGX поєднує безкабельні обчислювальні та мережеві лотки, рідинне охолодження при 45°C, динамічне стійкове керування енергією та Intelligent Power Smoothing.

З DSX MaxLPS, Vera Rubin NVL72 може знизити середнє споживання енергії приблизно на 10% та пікову потужність на 20% за 50 мс. Це дозволяє операторам встановлювати до 40% більше GPU в тому ж енергетичному бюджеті. Мережа Spectrum-6 забезпечує з'єднання гігамасштабних AI фабрик.

Конфіденційні обчислення з TEE-I/O

Для масштабних розгортань агентного AI безпека даних є критичною. NVIDIA впроваджує конфіденційні обчислення з TEE-I/O, призначені для захисту даних у стані спокою, під час передачі та використання в AI фабриці.

Bristol Myers Squibb — найпередовіша AI фабрика в науках про життя

Для демонстрації реального потенціалу платформи Rubin, Bristol Myers Squibb будує найпередовішу AI фабрику в науках про життя на базі Rubin. Цей крок підкреслює, що Vera Rubin — це не просто нове покоління GPU, а платформа, яка дозволить цілим галузям перейти на наступний рівень використання AI.

Висновок

Архітектура NVIDIA Vera Rubin GPU є знаковим моментом в еволюції AI інфраструктури. З 336 мільярдами транзисторів, пам'яттю HBM4, рушієм Transformer Engine третього покоління та у 10 разів вищою агентною пропускною здатністю порівняно з Blackwell, вона не лише відповідає вимогам сучасних AI навантажень, але й закладає основу для майбутніх агентних систем. За підтримки 300 глобальних партнерів та провідних хмарних провайдерів, включаючи CoreWeave, Google Cloud, Microsoft Azure та Mistral, Vera Rubin вже розгортається по всьому світу. З Vera Rubin, NVIDIA продовжує своє бачення AI фабрик, які працюють безперервно, ефективніше, безпечніше та у більшому масштабі, ніж будь-коли раніше.

📖 Джерело