NVIDIA Vera Rubin GPU Mimarisi — 336 Milyar Transistör, Blackwell'e Kıyasla 10 Kat Daha Fazla Ajan Verimi
NVIDIA, Vera Rubin platformunu tanıttı — 336 milyar transistör, HBM4 bellek ve üçüncü nesil Transformer Engine ile ajan AI iş yükleri için Blackwell'e kıyasla enerji birimi başına 10 kata kadar daha fazla ajan verimi sunuyor.
Ajan AI'nın Yeni Çağı — NVIDIA Vera Rubin
Birkaç yıl önce, yapay zeka dünyası esas olarak model eğitimi ve basit sohbet arayüzlerine hizmet ediyordu. Bugün ise tablo kökten değişti — AI fabrikaları sürekli çalışarak ölçekte zeka üretiyor. Bu fabrikalar artık akıl yürüten, planlayan, araçlar kullanan, ara sonuçları doğrulayan ve geniş bağlamlarda karmaşık çok adımlı görevleri yürüten ajan iş akışlarına hizmet ediyor.
Ajan iş yükleri tek bir soru ve yanıtla tanımlanmaz — bunlar birçok akıl yürütme adımı boyunca sürekli çıkarımdır. Adım başına düşük gecikme, yüksek kod çözme verimi, verimli uzun bağlam dikkati, büyük KV önbellek kapasitesi ve modelleri sıkı bağlı GPU alanlarında ölçeklendirme yeteneği gerektirirler. İşte NVIDIA'nın yeni Vera Rubin platformu bu zorluklara yanıt veriyor.
Rubin GPU — 336 Milyar Transistörlük Hesaplama Yoğunluğu
Platformun kalbinde, NVIDIA Blackwell'den enerji birimi başına 10 kata kadar daha fazla ajan verimi sağlamak üzere tasarlanmış NVIDIA Rubin GPU yer alıyor. Bu sadece bir sayı değil — AI fabrikalarının aynı enerji bütçesi içinde daha fazla kullanışlı token üretmesini sağlayacak temel bir nesil sıçramasıdır.
Rubin GPU, 336 milyar transistörden oluşur, 224 akış çok işlemcisi (SM) ve 896 Tensor Core içerir. Çip, yüksek hızlı NV-HBI (NVIDIA High-Bandwidth Interface) kristaller arası bağlantısıyla tek bir pakette birleştirilmiş retikül-sınırlı hesaplama kristallerinden üretilmiştir. Bu yaklaşım, yüksek yoğunluk ve verimlilik sağlar.
Üçüncü Nesil Transformer Engine — 50 Petaflops NVFP4
Rubin'in en önemli yeniliklerinden biri üçüncü nesil Transformer Engine'dir. Bu motor, sayısal formatlar arasında hassasiyeti uyarlayarak Rubin GPU'nun doğruluğu korurken 50 petaflops'a kadar NVFP4 çıkarım performansı sunmasını sağlar.
Gelişmiş Tensor Core'lar genişletilmiş hassasiyet esnekliğine sahiptir ve Tensor Core saat başına verimi, K boyutundaki veri işlemenin iki katına çıkarılması sayesinde ikiye katlanmıştır. Bu optimizasyon, hem verimle sınırlı çekirdeklere hem de bellek ve gecikme ile sınırlı çekirdeklere yardımcı olur.
HBM4 Bellek — 22 TB/s Bant Genişliğinde 288 GB
Rubin, özel HBM denetleyicileri ve 12-Hi yığınları tarafından yönetilen 288 GB'a kadar HBM4 belleği entegre ederek 22 TB/s'ye kadar tepe bant genişliği sağlar — Blackwell ve Blackwell Ultra'dan 2.8 kat daha fazla.
HBM4, HBM3e'ye kıyasla arayüz genişliğini iki katına çıkarır. Yeni bir bellek denetleyicisi, bellek ekosistemiyle derin ortak mühendislik ve daha sıkı hesaplama-bellek entegrasyonu ile birleştiğinde, bu sistem benzersiz bant genişliği sağlar.
Yüksek kapasiteli, yüksek bant genişlikli HBM4, çok trilyon parametreli modelleri barındırmak, KV önbellek boşaltması olmadan bağlam uzunluğunu genişletmek ve yüksek eşzamanlı, uzun vadeli çıkarım iş yüklerini desteklemek için kritiktir.
NVLink 6 ve NVLink-C2C — Son Derece Hızlı Bağlantılar
Rubin mimarisinde, iletişim altyapısı hesaplama gücü kadar önemlidir. NVIDIA NVLink 6, tümden-tüme GPU-GPU iletişimi için NVLink Switch'e 3,600 GB/s ölçeklendirme bant genişliği sağlar. NVLink-C2C, tutarlı CPU-GPU iletişimi için 1,800 GB/s sunarken, x16 PCIe Gen 6, 256 GB/s'ye kadar ana bilgisayar bağlantısı sağlar.
Rubin, cihaz tarafından başlatılan NVLink iletişimi için sayımlı yazmalar (counted writes) getirir ve GPU'lar arası veri aktarımları için senkronizasyonu kolaylaştırır. Bu, alıcı GPU'nun aktarım tamamlanmasını daha verimli bir şekilde izlemesine olanak tanır.
Ajan AI İçin Optimize Edilmiş Mimari
Rubin GPU, özellikle ajan AI'nın yürütme desenleri için tasarlanmıştır — akıl yürütme, planlama, araç kullanımı ve uzun bağlam işleme. Bu, yalnızca tepe hesaplama performansını değil, aynı zamanda verimli veri hareketini, uzun bağlam dikkat işlemeyi ve bağımlı çekirdekler arasında yumuşak geçişleri gerektirir.
Rubin, aktivasyon seyrekliği ile uyarlamalı sıkıştırmanın birleşimini ve gelişmiş softmax verimini kullanarak dikkati hızlandırır. Dikkat hattı, ara dikkat puanları oluşturmak için yoğun bir QK^T hesaplamasıyla başlar. Rubin daha sonra bu ara verileri Tensor Memory'den yapılandırılmış 2:4 seyrek sıkıştırılmış forma yükleyerek yazma maliyetini ve depolama gereksinimlerini azaltır.
Ayrıca Rubin, bağımlı çekirdekler arasında daha ince taneli koordinasyon sağlayarak tüketici çekirdeğinin, gerekli giriş verileri kullanılabilir hale gelir gelmez daha erken çalışmaya başlamasına izin verir.
Vera CPU — Maksimum Performans İçin Olympus Çekirdekleri
Vera Rubin platformu ayrıca, maksimum tek iş parçacıklı performans için tasarlanmış Olympus çekirdekleri üzerine inşa edilmiş Vera CPU'yu da içerir. Bu CPU, NVLink-C2C aracılığıyla GPU ile sıkı koordinasyon sağlar; bu, CPU ve GPU'nun sürekli veri alışverişinde bulunduğu ajan iş akışları için özellikle kritiktir.
Vera Rubin NVL72 — Raf Ölçekli AI Süper Bilgisayarı
Vera Rubin NVL72, Rubin GPU'yu raf ölçekli bir yürütme alanına genişletir. Üçüncü nesil MGX raf mimarisi, kablosuz hesaplama ve ağ tepsilerini, 45°C sıvı soğutmayı, dinamik raf ölçekli güç yönetimini ve Intelligent Power Smoothing'i birleştirir.
DSX MaxLPS ile Vera Rubin NVL72, ortalama güç tüketimini yaklaşık %10 ve 50 ms tepe gücünü yaklaşık %20 azaltabilir. Bu, operatörlerin aynı güç bütçesi içinde %40'a kadar daha fazla GPU kurmasına olanak tanır. Spectrum-6 ağı, giga-ölçekli AI fabrikaları için bağlantı sağlar.
TEE-I/O ile Gizli Bilgi İşlem
Büyük ölçekli ajan AI dağıtımları için veri güvenliği çok önemlidir. NVIDIA, AI fabrikası genelinde verileri bekleme, aktarım ve kullanım sırasında korumak için tasarlanmış TEE-I/O ile Gizli Bilgi İşlem sunar.
Bristol Myers Squibb — Yaşam Bilimlerinin En Gelişmiş AI Fabrikası
Rubin platformunun gerçek dünya potansiyelini göstermek için Bristol Myers Squibb, Rubin üzerinde yaşam bilimlerinin en gelişmiş AI fabrikasını inşa ediyor. Bu adım, Vera Rubin'in yalnızca yeni bir GPU nesli olmadığını — tüm endüstrilerin AI benimsemesinde bir sonraki seviyeye geçmesini sağlayacak bir platform olduğunu vurguluyor.
Sonuç
NVIDIA Vera Rubin GPU mimarisi, AI altyapısı evriminde bir dönüm noktasını temsil ediyor. 336 milyar transistör, HBM4 bellek, üçüncü nesil Transformer Engine ve Blackwell'e kıyasla 10 kat ajan verimi ile yalnızca günümüz AI iş yüklerinin taleplerini karşılamakla kalmıyor, aynı zamanda geleceğin ajan sistemlerinin temelini atıyor. CoreWeave, Google Cloud, Microsoft Azure ve Mistral dahil 300 küresel ortak ve büyük bulut sağlayıcının desteğiyle Vera Rubin dünya çapında kullanıma sunuluyor. Vera Rubin ile NVIDIA, AI fabrikalarının sürekli, daha verimli, daha güvenli ve her zamankinden daha büyük ölçekte çalıştığı vizyonunu sürdürüyor.