Geri Dön
SiTech Team⏱️ 6 წთ. საკითხავი

NVIDIA Vera Rubin: Akıllılığı Dolar Başına Maksimize Eden Yapay Zeka Sonrası Eğitimde Yeni Çağ

NVIDIA Vera Rubin: Akıllılığı Dolar Başına Maksimize Eden Yapay Zeka Sonrası Eğitimde Yeni Çağ

NVIDIA'nın Vera Rubin platformu, sonrası eğitim (post-training) iş yükleri için Blackwell'den dört kat daha az GPU gerektirir — bu, "dolar başına zekâ" (intelligence per dollar) metriğinde yeni bir referans noktasıdır.

Acente Yapay Zekâya Geçiş: Sonrası Eğitim Neden Artık Sürekli

Profesyonel bir sporcu düşünün. Elit performansçıları ayıran şey, maçlar arasında olanlardır: sürekli iyileştirme, yeni rakiplere uyum sağlama, son maçın ortaya çıkardığı hatalardan ders alarak becerileri keskinleştirme. Acente yapay zekâ da aynı şekilde çalışır. Bir model artık sadece bir soruyu yanıtlamaz — bir hedef verilir ve ortam değiştikçe, uç durumlar ortaya çıktıkça ve araçlar haftadan haftaya değiştikçe sürekli uyum sağlaması gerekir.

Bu, yapay zekâ modellerinin hazırlanması hakkındaki düşüncelerimizi kökten değiştiriyor. Sonrası eğitim (post-training) — bir modeli ham verilerle ilk eğitimden sonra iyileştiren aşama — artık tek seferlik bir bitiş adımı değildir. Süreklidir, çünkü acente modellerin çalıştığı ortam sürekli evrilir. Bir acentenin kullandığı araçlar haftadan haftaya değişebilir. Prodüksiyonda hiçbir test setinin öngörmediği uç durumlar ortaya çıkar. Her dağıtım kendi kod tabanını, politikalarını ve ortamını beraberinde getirir.

Hesaplama ayak izi, tek bir çalıştırmanın daha büyük olmasından değil, çalıştırmaların asla durmamasından dolayı büyür. Bu, sonrası eğitimi acente çağının merkezi iş yükü haline getiriyor — ve dolar başına zekânın temel itici gücü yapıyor.

Sonrası Eğitim Nedir ve Neden Önemlidir

Sonrası eğitim, zekânın inşa edildiği yerdir. Ön eğitimde (pre-training) model bir sonraki tokeni tahmin etmeyi öğrenir — bu ona dilde akıcılık kazandırır ama zekâ vermez. Sonrası eğitim, modelin kod yazmayı, çok adımlı bir görevi planlamayı, arama aracı kullanmayı ve bir şey ters gittiğinde kendini toparlamayı öğrendiği yerdir.

Çıkarım (inference) daha sonra gelir: model iş başında çalışır, token başına maliyetle (cost per token) fiyatlandırılır. Ancak sonrası eğitim farklı çalışır. Ezberlenecek bir cevap anahtarı olmadığından — sadece bir ödül vardır — model pekiştirmeli öğrenme (RL) teknikleriyle öğrenir.

Süreç şöyle işler: bir görev verildiğinde, model bir deneme yazar — ileri geçiş (forward pass) (iş başında yapacağı işin aynısı). Deneme puanlanır ve ders modelin ağırlıklarını günceller — geri geçiş (backward pass). Milyonlarca deneme boyunca zekâ büyür. Her adım hesaplama yoğunlukludur ve bu döngüyü ölçeklendirmek bir orkestrasyon sorunudur: paralel olarak rollout üreten binlerce ortam, ödüllerin doğrulanması ve güncellenmiş ağırlıkların eğitime geri akması.

NVIDIA'nın açık kaynak NeMo kütüphaneleri — eğitim ortamları için NeMo Gym ve dağıtık sonrası eğitim için NeMo RL gibi — sonrası eğitimi özel araştırma kodundan tekrarlanabilir, üretim kalitesinde altyapıya dönüştürür.

Dolar Başına Zekâ: Token Başına Maliyeti Genişletmek

Çıkarım gelir motoruysa, sonrası eğitim çarpandır: model ne kadar yetenekliyse, sunulan her tokenin değeri o kadar yüksektir. Token başına maliyet (cost per token), çıkarım fabrikası için temel metriktir — bir milyon token sunmanın tüm maliyeti.

Dolar başına zekâ (intelligence per dollar) bir kat üstte oturur ve farklı bir soruyu yanıtlar: sunulmaya değer bir model oluşturmanın maliyeti nedir — ve ortamı değiştikçe onu değerli tutmak? Bu iki metrik iç içedir, rekabet halinde değil. Token başına maliyeti düşüren yapay zekâ altyapısı, aynı zamanda modele yerleştirilen her zekâ noktasının maliyetini de düşürür. Ve yerleştirilen her zekâ noktası, çıkarım fabrikasının sunduğu her tokenin değerini artırır.

Başka bir deyişle: cost per token operasyonel verimi ölçer; intelligence per dollar ise model zekâsına yapılan yatırımın karşılığını verip vermediğini ölçer. Sonrası eğitimdeki her ileri geçiş, temelde cost per token ile ölçülen çıkarım işi olduğundan, çıkarım verimliliğindeki her iyileştirme doğrudan dolar başına zekâ denklemine akar.

Vera Rubin: Dörtte Bir GPU, Maksimum Zekâ

NVIDIA Blackwell platformu, çalıştırma başına maliyeti zaten düşürerek acente çağının talep ettiği sık sonrası eğitimi ekonomik olarak uygulanabilir hale getirdi. Ancak Vera Rubin bu yörüngeyi çarpıcı şekilde genişletiyor — en büyük modelleri Blackwell neslinin dörtte biri GPU ile eğitiyor.

Vera Rubin, acente sonrası eğitim yükü için dolar başına zekâyı maksimize etmek üzere baştan sona birlikte tasarlandı: çalıştırma başına daha fazla rollout, aynı anda daha fazla ortam ve asla durmayan sonrası eğitim döngüleri. Bu verimlilik artışı, kuruluşların aynı zekâyı — veya daha fazlasını — çok daha az donanım yatırımıyla elde edebileceği anlamına geliyor.

Bu önemlidir çünkü cost per token ve intelligence per dollar sıkıca bağlantılıdır. İleri geçiş (çıkarım) maliyetindeki her düşüş, sonrası eğitimdeki her öğrenme döngüsünün maliyetini doğrudan azaltır ve milyonlarca deneme boyunca birikimli tasarruf sağlar.

Nemotron 3 Ultra: Açık Ağırlıklı Zekâ, Doğrulanabilir Sonuçlar

NVIDIA'nın Nemotron 3 Ultra — açık ağırlıklı (open-weight), 550 milyar parametreli uzman karışımı (MoE) modeli — doğrulanabilir kıyaslamalar ve NeMo RL üzerinde çalıştırılan tamamen açıklanmış bir sonrası eğitim tarifi sunar. SWE-bench verified'de %71.7 puan aldı; bu, açık kaynak projelerden yaklaşık on gerçek yazılım hatasından yedisine çalışan bir düzeltme ürettiği gerçek dünya kodlama kıyaslamasıdır ve her biri projenin kendi test paketine karşı kontrol edilmiştir.

Nemotron 3 Ultra'nın sonrası eğitim çalıştırması, önceki nesil Nemotron 3 Super'in her biri yaklaşık 10.000 tokenlik ~1,2 milyon rollout'undan ölçeklendirilerek yaklaşık 20 milyar rollout tokeni kullandı. Kritik olarak, platformlar arasındaki dolar başına zekâ oranı bu spesifik varsayımdan bağımsızdır — mutlak değerler token sayısıyla ölçeklenir, ancak Vera Rubin'in Blackwell'e göre göreceli avantajı sabit kalır.

Tam Ekosistem: NeMo, Dynamo ve Endüstriyel Benimseme

Vera Rubin platformu, acente yapay zekâ için daha geniş, entegre bir NVIDIA ekosisteminin parçasıdır:

  • NeMo Gym ve NeMo RL — Sonrası eğitimi özel araştırma kodundan tekrarlanabilir altyapıya dönüştüren açık kaynak kütüphaneler. NeMo Gym eğitim ortamlarını yönetir; NeMo RL ölçekte dağıtık sonrası eğitimi yönetir.
  • NVIDIA Dynamo — Prodüksiyonda verimi maksimize etmek ve gecikmeyi minimize etmek için çıkarım orkestrasyonu.

Sektör liderleri bu ekosistemi zaten kullanıyor:

  • Prime Intellect — NVIDIA Blackwell üzerinde öncü açık modelleri sürekli olarak sonradan eğitiyor ve Vera Rubin'de RL ortamlarını ölçeklendirmeyi planlıyor. Karşılaştırmalı değerlendirmeleri, alternatif x86 mimarilerine kıyasla NVIDIA Vera CPU'lar ile CPU başına %30 daha fazla verim gösteriyor.
  • Perplexity — RL sonrası eğitim yığınını yüzlerce NVIDIA GPU'da asenkron olarak çalıştırıyor ve trilyon parametreli modelleri eğitim ve çıkarım düğümleri arasında iki saniyenin altında senkronize eden RDMA tabanlı bir ağırlık aktarım motoru kullanıyor.
  • Together AI — NVIDIA platformunda denetimli ince ayar, RL ve doğrudan tercih optimizasyonu dahil olmak üzere sonrası eğitimi hizmet olarak sunuyor ve sırada Vera Rubin'den yararlanmayı planlıyor.

Sürekli Zekânın Geleceği

Vera Rubin'in gelişiyle NVIDIA, yapay zekâ yatırım verimliliğini nasıl ölçtüğümüzü yeniden tanımlıyor. Dolar başına zekâ, modellerin yalnızca istemlere yanıt vermekle kalmayıp planladığı, akıl yürüttüğü, araçlar kullandığı, başarısızlıklardan kurtulduğu ve sürekli iyileştiği acente yapay zekâ çağına en iyi hangi platformun hizmet edebileceğini belirleyen metrik haline geliyor.

Yapay zekâ modelleri basit soru-cevaptan karmaşık, çok adımlı, sürekli uyum sağlayan davranışa geçtikçe, sonrası eğitimin rolü yalnızca büyüyecek. NVIDIA'nın Vera Rubin platformu — NeMo kütüphaneleri, Nemotron 3 Ultra modeli ve Dynamo çıkarım orkestratörü ile birlikte — yatırılan her doların entelektüel getirisini maksimize eden entegre, uçtan uca bir sistem oluşturuyor.

Bu, yapay zekâ altyapısının yeni çağıdır. Soru artık "kaç GPU'm var?" değil, "dolar başına ne kadar zekâ alıyorum?"

📖 Kaynak